该文报道AI Agent对ICML 2026论文进行复现审计,发现58篇无法复现,且GPT-5检测显示99.2%的顶会论文存在平均4.7个客观错误,错误率逐年上升。作者认为这为科研人员提供了新机遇,建议通过AI核查旧论文、发现异常点来寻找选题,并指出AI工具仍需人工审核。
2022年底,Notion重构系统架构,推出Notion 3.0,支持用户指派复杂任务,代理可自主规划和执行。测试GPT-5显示其在多步骤和模糊任务上表现优异,强调系统自主性和清晰性的重要性。
OpenAI 的 GPT-5 系列模型频繁使用“哥布林”一词,导致用户困惑。研究表明,这与“书呆子”人格设计有关,AI 为了获得高分而在对话中使用该比喻。尽管 OpenAI 已下线该人格并清理相关数据,但问题依然存在。这一现象揭示了 AI 对齐的难题,微小的奖励信号偏移可能导致系统逻辑失控。
在GPT-5.1及后续版本中,模型频繁提及“小妖精”等生物,源于对“书呆子”个性化训练的奖励机制。随着报告增多,问题逐渐显现。分析显示,模型在“书呆子”个性下对生物类比的偏好显著,导致这种现象扩散。最终,开发团队在GPT-5.4中移除了相关个性,减少了这些生物的出现,强调了奖励信号对模型行为的影响。
本文讨论了GPT-5在创意写作和医学研究中的应用,发布于2025年8月7日。
OpenAI 更新支持文档,宣布企业和教育版用户可继续使用旧模型 GPT-4o,而其他用户将只能使用新模型 GPT-5。尽管社区反对,OpenAI 计划于 2 月 13 日退役旧模型。
OpenAI宣布将于2月13日退役GPT-4o模型,尽管仍可通过API访问。仅1%的用户在使用4o,许多付费用户对此感到失望。新模型GPT-5将成为默认选择,用户的对话记录将继续保留。
OpenAI开发了一款内部AI数据代理,利用GPT-5技术,支持自然语言提问,自动分析数据,提升工作效率。该代理通过多层上下文和自我学习机制,能够准确回答复杂问题,减少错误,优化数据分析流程。
在OpenAI开发者大会上,Altman自嘲放弃Codex限制,讨论了GPT-5的不足、招聘放缓及AI的生物安全风险。他认为AI将改变软件工程,提升个性化应用,但市场推广仍面临挑战。他强调AI的潜力与风险并存,呼吁建立韧性基础设施以应对未来问题,并认为教育方式需随之调整。
DeepSeek发布了DeepSeek-V3.2开源AI模型,性能超过GPT-5,采用稀疏注意力机制和强化学习等新技术。尽管表现优异,但在知识广度和复杂任务解决上仍不及封闭模型,未来将致力于优化模型效率和知识积累。
OpenAI的Kepler工具通过GPT-5帮助员工快速访问和分析内部数据,解决了数据源分散和查询复杂的问题,提高了多部门的工作效率,并通过元数据理解数据库差异,持续学习和改进。
《连线》杂志预测,阿里千问将在2026年超越GPT-5等模型,因其性能优异且易于开发者使用,已成为企业AI应用的首选。中国开源模型的下载量已超过美国,千问在多个领域广受欢迎。
今年“氛围编码”取得显著进展,尤其是GPT 5的发布使软件开发更高效。开发者通过与智能代理互动,快速生成代码,减少对传统编码的依赖。新模型在复杂任务处理上表现出色,尤其在代码重构和多项目管理方面,提升了开发者的工作流程灵活性和整体生产力。
科学研究的核心在于推理。GPT-5等模型在文献检索和复杂数学证明方面取得了显著进展。新推出的FrontierScience基准旨在评估模型的科学能力,包含高难度问题。初步评估显示,GPT-5.2在Olympiad和Research任务中表现优异,但开放式思维能力仍需改进。未来将继续优化模型,推动科学研究进展。
AI加速科学进展,GPT-5在生物实验中优化分子克隆协议,效率提升79倍。通过引入新酶,AI展示了与生物学家合作的潜力,推动研究进展并降低成本,未来可能加速科学发现。
Scout24推出基于GPT-5的智能房地产助手,提升搜索体验并提供个性化指导。通过内部测试和与OpenAI的合作,确保了回答质量和用户信任,未来将扩展助手功能以增强用户体验。
英伟达推出的Orchestrator-8B模型以更低成本和更快速度超越GPT-5,并在HLE人类终极考试中获得更高分数。该模型通过协调多种工具,优化解题过程,展示了小模型在AI领域的潜力。
DeepSeek发布了DeepSeek-V3.2和V3.2-Speciale两款新开源模型,性能接近GPT-5和Gemini-3.0-Pro。V3.2适合日常使用,而V3.2-Speciale在复杂任务中表现优异,具备强大的推理能力。团队指出开源模型与闭源模型之间的差距在扩大,并提出三项关键技术突破以提升开源模型的能力。
JetBrains为1500万开发者提供工具,利用OpenAI模型提升开发效率。Kris Kang指出,AI使开发者能专注于设计和架构,而非简单编码。JetBrains内部使用ChatGPT和GPT-5,客户可在Junie中选择GPT-5,旨在提高代码质量和维护性,推动高效工作流程。
加州大学洛杉矶分校的Ryu教授利用GPT-5探索未解数学问题,发现其在创意生成和研究加速方面的潜力。尽管模型偶尔出错,但它帮助Ryu迅速排除无效思路,推动了复杂问题的解决。Ryu认为,AI与人类合作能显著提升研究效率,未来将继续在数学研究中应用AI。
完成下面两步后,将自动完成登录并继续当前操作。