该文章介绍了一项关于多模态大语言模型(MLLM)在城市导航中能力的研究。研究团队构建了基于香港真实地理数据的URBANGROUND交互环境,评测了GPT-5.5等模型。结果显示,模型具备局部空间识别和短距离导航能力,但长距离导航和动态环境适应能力不足,难以将局部感知转化为持续可靠的城市行动。
Meta的AI负责人Wang在内部会议上表示,其模型“Watermelon”在某些基准上已赶上OpenAI的GPT-5.5,但未提供可验证的数据。Zuckerberg承认Meta的AI投资尚未见效,尽管Wang预测未来更新将带来显著进展,但缺乏实质性证据支持。
阿里巴巴达摩院提出了“自主策略演化”评估新范式EvoPolicyGym,关注在固定预算内Agent如何迭代改进策略。该方法通过轨迹级诊断框架分析预算分配、反馈转化和策略精炼能力,揭示不同模型的演化模式。实验结果显示GPT-5.5表现优异,强调了Agent从反馈中学习的重要性。
VS Code团队与OpenAI合作,优化了GPT-5.5系统提示,以提高编码效率。通过实验,减少不必要的探索和加快验证降低了成本。最终采用“LargePromptSections”作为默认提示,显著提升了编辑速度和令牌效率,同时保持代码质量。团队将继续寻找改进方法,以提升用户体验。
Cognizant与OpenAI合作推出搭载GPT-5.5的AI网络安全防御服务,旨在帮助企业加速漏洞修复。该服务涵盖安全代码审查和威胁建模,确保每一步都有人工验证和监督。Cognizant在自身安全运营中先行实践,以提升防御能力。
Rust Secure Code Working Group 负责人 Shnatsel 发现,GPT-5.5 在审计 Rust unsafe 代码时表现出色,成功识别多种安全问题。通过聚焦内存安全并使用 miri 过滤假阳性,审计效率显著提高。这种方法可能使 Rust 生态的安全检查常态化。此外,Aurora 浏览器引擎和 Ratatui 项目展示了 Rust 在浏览器和嵌入式显示屏上的应用,guitar 则提升了大型 Git 仓库的历史管理效率。
OpenAI的GPT-5.5和GPT-5.4模型以及Codex已在Amazon Bedrock平台上线。这些模型专注于代码编写和复杂工作流程,支持开发者通过Responses API调用。Codex每周有超过400万开发者使用,优化了开发流程。用户按token付费,无需购买席位许可,模型在美国东部和西部区域可用,用户可通过OpenAI SDK或curl访问。
亚马逊云科技宣布,GPT-5.5、GPT-5.4和Codex已在Amazon Bedrock上线,企业可直接调用这些大模型以支持复杂任务,计费标准与OpenAI一致,无额外费用。Codex可通过多种IDE插件使用,推理计算符合数据合规要求。亚马逊将持续扩展OpenAI的能力。
DeepSWE测试显示,GPT-5.5在编程能力上超越Claude Opus 4.8,表现出更高的效率和可靠性。新考试更真实,反映了AI在实际工作中的能力,用户普遍认为GPT-5.5更实用。
OpenAI 宣布将逐步弃用使用率低的 o3 和 GPT-4.5 模型,o3 将在 90 天后弃用,GPT-4.5 在 30 天后弃用。新推出的 GPT-5.5 Instant 模型将提供更易读的输出和改善的对话节奏。旧版模型的 Canvas 功能将不再支持,付费用户可在有限时间内继续使用。API 端将继续支持这些模型。
OpenAI 将于6月2日起下线 GPT-5.2 和 GPT-5.3-Codex 模型,因 GPT-5.5 存在降智问题,开发者可选择 GPT-5.4。付费用户可继续使用 GPT-5.4 和 GPT-5.5,而免费用户默认使用 GPT-5.5,无法切换。特殊模型如 GPT-5.3-Codex-Spark 仍可使用。
文章讨论了使用GPT-5.5模型进行代码生成的优缺点。尽管模型在大多数情况下表现可靠,但也可能产生幻觉和低质量代码。建议在复杂任务中使用最佳模型,并进行交叉审查和人工审核,以确保代码质量和可读性。同时强调了对生成代码的责任,避免过度防御和不必要的复杂性。
Warp是一款现代终端,因其速度和协作功能受到开发者喜爱。它推出了开放代理开发模式,允许人类设定目标,代理负责编码和测试。引入GPT-5.5后,代理的效率显著提高,Warp开发团队中约90%的拉取请求由代理共同创建。Warp旨在通过代理协作提升软件开发的效率和一致性,并将继续与社区合作,推动代理开发的演进。
Ramp的工程师们通过使用Codex和GPT-5.5加速代码审查,显著提升了开发效率和代码质量。Codex能够在几分钟内提供反馈,超越传统工具。Austin Ray指出,Codex的推理能力帮助开发内部工具,如On-Call Assistant,减轻了工程师的负担。他建议领导者亲自体验AI工具,以建立信任并促进迭代。Codex正在改变Ramp工程师的工作方式,使他们成为更有效的协调者。
Cerebras宣布公测GPT-5.5,引发X和Reddit技术社区的热议。讨论主要集中在存储能力和生态系统上,部分用户质疑SRAM存储的局限性,另一些则关注模型的上下文窗口和处理速度。社区强调技术的实际应用和可用性才是关键。
Databricks推出了GPT-5.5,显著提升了复杂企业文档任务的处理能力。与GPT-5.4相比,GPT-5.5在OfficeQA Pro上减少了46%的错误,首次实现超过50%的准确率,尤其在解析扫描PDF和旧文件时表现出色,改善了多步骤任务的协调性。客户可通过AI Unity Gateway使用GPT-5.5,提升定制代理工作流的效率。
OpenAI推出了名为Daybreak的网络安全计划,基于GPT-5.5,旨在为验证的防御者提供分层访问。该计划与Anthropic的Glasswing计划重叠,双方承诺通过先进模型进行安全代码审查和漏洞管理。合作伙伴包括Cisco、CrowdStrike和Palo Alto Networks,显示出安全平台对不同模型的双重策略。
OpenAI最近推出了GPT-5.5 Instant,取代了GPT-5.2。测试显示,GPT-5.5在回答准确性和个性化方面有所提升,但在简洁性上不如5.2。5.5的对话风格更丰富,能更好地处理复杂问题,减少错误信息。总体而言,5.5相比5.2有明显改进,但普通用户可能不易察觉。
Codex是OpenAI的编码代理,旨在帮助开发者更快地编写、审查和调试代码。它支持CLI、IDE扩展、桌面应用和Codex Cloud等多种使用方式,并与GPT-5.5模型结合,提供高效的编码体验。手册中包含设置、使用、定价和最佳实践等详细指导,以帮助团队有效采用Codex。
我们发布了《智能时代的网络安全行动计划》,旨在民主化AI驱动的防御。推出了GPT-5.5和GPT-5.5-Cyber,支持关键基础设施的网络安全工作。通过“网络安全可信访问”,确保网络能力交给经过验证的防御者,提升防御效率。GPT-5.5适用于一般防御工作,而GPT-5.5-Cyber则支持更专业的工作流程。我们与安全供应商合作,提升整体安全能力,帮助快速识别和修复漏洞。
完成下面两步后,将自动完成登录并继续当前操作。