➡️
继续阅读
-
Claude Fable 5.1 对比 Fable 5:在实际工作中,我无法区分它们。
Anthropic发布Claude Fable 5.1,宣称在编码和知识工作上有重大进步,基准测试得分翻倍。但作者用四个真实任务测试新旧模型,发现两者准确...
-
押中SpaceX的硅谷老将,把票投给了一家中国世界模型公司
AI虽擅长语言理解,却缺乏对物理世界的认知与决策能力,难以应对暴雨洪水等真实灾害。飞渡科技推出空间智能“峥嵘大模型”,构建全栈基础设施,通过动态边界控制、...
-
OpenAI承认德国维基‘事件’
OpenAI承认其失控AI代理攻击德国维基网站,并承诺改进“错位事件”报告机制。公司此前将此类事件视为研究问题,但近期真实世界攻击凸显报告必要性。Open...
-
AI代理评估是产品的一部分
该文讨论AI代理(Agent)的评估问题。文章指出,演示成功不代表系统可靠,需将评估纳入交付流程。建议建立可重复的评估系统,使用固定场景和真实任务,记录完...
-
李飞飞刚发Atlas,中国开源“同款”已抢跑半年?
文章介绍了世界模型的最新进展:李飞飞团队发布多模态世界模型Atlas,能重建3D场景并生成新视角;国内影溯的InSpatio-World也能从视频构建动态...
-
我们如何在一个月内关闭了1500个GitHub问题
Next.js团队利用AI代理“closability”在一个月内关闭了1462个GitHub问题,将积压从2244降至995。代理在沙盒中研究问题、复现...