Debian社区正讨论是否禁止AI提交代码,现有四项提案:A全面禁止,因版权和质量问题;B和D允许但要求贡献者负责并披露;C倾向拒绝但承认完全禁止不现实。讨论至2026年7月24日,尚未定论,反映开源社区对AI态度分裂。
AMD宣布将支持AM5主板至2029年,并重新推出包括“10周年”版Ryzen 7 5800X3D和Ryzen 7 7700X3D在内的旧款处理器。同时,新款显卡Radeon RX 9070 GRE将在美国上市,售价549美元,旨在为PC游戏玩家提供更具性价比的选择。
OpenAI 正在与联发科和高通合作开发新款手机处理器,预计2028年量产,立讯精密为独家制造商。新手机将由 AI 智能体直接调度用户任务,采用云端与端侧 AI 整合方案。李想称理想汽车领先大众两代,大众高管反驳称理想仅在价格和营销上领先。马斯克与奥特曼的诉讼将于本周开庭,索赔高达1340亿美元。
本文探讨了生成性人工智能(LLM)对软件项目的影响,特别是用户期望的变化。创意产业面临挑战,用户对AI生成内容的价值产生质疑。文章强调项目需明确价值主张,以应对法律风险和用户信任问题,并将AI视为工具,独立阐明成果和责任。
Retool通过将宣传语从“技术实现”改为“用户结果”,显著提高了邮件回复率。强调用简洁明了的语言传达价值,确保品牌一致性,最终成功实现了“快速构建内部工具”。
本研究提出了欺骗性幽默数据集(DHD),旨在探讨虚假主张中的幽默,揭示幽默与欺骗之间的关系,推动欺骗性幽默检测模型的发展。
本研究探讨了“语言作为固定效应谬误”对GPT-4等大型语言模型的影响。研究强调将语言视为随机效应的重要性,并警告不要基于有限的测试集对模型能力做出广泛概括。研究人员应设计更健壮的研究,以更准确地评估模型的真实潜力。
本文介绍了一种新的认领审核数据集,包含10,987个带证据的主张,证据来源于维基百科。研究提出了ClaimVer框架和ExClaim系统,旨在提高事实核查的准确性和可解释性。通过自动化流水线和主题感知模型,改善了证据检索和验证性能,并为事实检查员提供清晰的解释,以帮助甄别真假索赔。
清华大学教授周伯文成为上海人工智能实验室主任和首席科学家,提出人工智能45°平衡律和实现该主张的技术路径。他强调人工智能的安全问题,呼吁加强全球AI安全人才交流与合作,构建开放、安全的通用人工智能创新生态和人才发展环境。
本文介绍了一种新方法,结合大型语言模型(LLM)和不确定性感知模块,为生成答案提供置信度评分。研究表明,通过高效微调,LLM在多个基准数据集上超越了现有算法,并提出了一种基于扰动的不确定性估计方法,量化答案的置信度。这一方法在提高模型的准确性和可解释性方面具有重要意义。
本文介绍了一种新方法FActScore,用于评估生成文本的真实性。该方法通过将文本分解为原子事实,并计算可靠来源支持的事实比例来进行评估。同时,研究提出了LongDocFACTScore框架,能够有效评估长文档的事实一致性,且在与人工测量对比中表现优于现有标准。此外,研究还指出大型语言模型在生成文本时存在的事实准确性问题,并提出D-FActScore以改善评估效果。
我们提出了一种用于事实检查的文档级索取索赔的方法,旨在从文档中提取值得检查的要求,并将它们解除背景以便在任何环境下理解。使用自动评估指标和事实检查专业人员的评估结果表明,我们的方法比以前的工作更准确地从文档中提取出有价值的索赔,并改善了证据的检索。
欧盟对苹果罚款20亿美元,认为其App Store垄断了数字音乐市场竞争。苹果回应称Spotify在欧盟占据56%份额,是绝对垄断。苹果提供了App Store等服务,但Spotify从未给过苹果钱。苹果还派工程师为Spotify提供技术支持。苹果认为Spotify想改变App Store规则以获得更多利益。苹果的支付分成策略限制了订阅服务和微支付模式的发展。Spotify和欧盟投诉苹果的策略。
研究人员提出了一种名为FENICE的基于自然语言推理和主张提取的事实性评估摘要度量方法,通过对齐源文件中的信息和从摘要中提取的一组原子事实来评估摘要的一致性。该方法设立了一个新的标杆,并通过人工注释扩展到了更具挑战性的环境中。
本研究测试了开放领域的声明验证系统的性能,使用三个知识来源和两种信息检索技术,对四个生物医学和健康声明进行了测试。结果显示,对于专门的生物医学声明,PubMed 表现更好,而对于日常健康问题,Wikipedia 更适合。BM25 在检索精度方面表现出色,语义搜索在相关证据的回收方面更具优势。提供了未来方向。
本研究提出了基于大型语言模型嵌入的移动应用预测模型(MAPLE),能够准确解读复杂模式并理解用户背景。研究结果强调了大型语言模型在应用使用预测中的潜力和广泛适用性。建议大型语言模型在模拟人类行为方面具有改变性的能力。
本研究比较了调整模型和极大语言模型在可检测可信度主张任务中的性能。实验结果表明,调整模型在跨域设置中优于零样本方法。
本文介绍了一种端到端的多模态事实核查和解释生成方法,构建了Mocheg数据集,实验表明性能仍不够令人满意。研究团队是第一个建立此类数据集和解决方案的。
本文介绍了一种使用预训练语言模型进行全零样本学习的方法,通过单向和双向PLMs生成和训练数据,并使用提示引导的类别条件文本。该方法在GLUE数据集的七个分类任务中表现出色,相对于零样本提示方法和少样本方法,取得了强有力的结果。同时,采用了标签平滑和时间模型的融合技术以提高泛化和稳定性。
连续谬误是一种非正式谬误,指拒绝一个主张因为它处于两个极端之间的连续体上。了解连续谬误可以帮助人们更好地理解两个主题之间的差异,并做出更明智的决定。
完成下面两步后,将自动完成登录并继续当前操作。