本文总结了Hacker News上的多个科技新闻:GLM-5.3开源模型在编程和网络安全上表现突出,但缺乏安全限制引发担忧;Google发布Gemini 3.7 Flash,性能提升且价格减半;Qwen3.8-27B多模态模型增强但资源占用高;Opus 5能力更强但体验差,因擅自猜测;Cerebras与OpenAI推出超快GPT-5.6;Count Binface在补选中获26.9%选票;建议选择成熟技术;理解代码成新瓶颈;Mistral OCR 4.1发布。
Opus 5在基准测试中表现更强,但用户满意度下降,因其语言晦涩、模板化,不遵守指令,代码注释过多。问题在于基准测试未衡量沟通能力,模型为优化硬指标而忽视软体验。更聪明不等于更好用,厂商应将沟通体验纳入评测,否则再强的能力也被糟糕的交互界面封印。
Opus 5游戏提示词“挑战循环”走红,通过主Agent拆解任务、子Agent执行、评委Agent对比3A游戏验收返工,逼出AI自主规划与迭代能力。网友Anshu据此24小时开发出太空探索游戏《The Long Silence》,其他用户也制作出卡丁车游戏等。该方法放大模型作用,印证Opus 5长程工作能力。
作者对比了Fable 5、Opus 5、Codex 5.6 Sol和Kimi K3四款AI模型的主观体验。Fable 5最强,适合核心项目;Opus 5作为辅助;Codex 5.6耐用且性价比高;Kimi K3智商不错但算力不足。作者认为Anthropic在编程领域的垄断地位将结束,期待更多竞争。
Anthropic发布Opus 5模型,性能追平或超越Fable 5,价格仅为其一半。在编程、物理模拟等测试中表现优异,网友用它生成游戏、3D模型等。同时,Anthropic精简了Claude Code系统提示词超80%,性能未降,体现模型判断力提升。
Anthropic发布Opus 5模型,比Fable 5更便宜且限制更少,专为长时间编程任务设计,成本性能比创新高。它在编码和知识工作基准上表现优异,但需新安全措施,如微虚拟机、短期凭证和智能遥测。模型在生物任务上进步,但保留安全防护,平台需适应其自主运行。
Anthropic发布Opus 5模型,性能接近旗舰Fable 5,价格减半,且无需数据保留政策。它在知识工作、编码和自动化基准上表现优异,部分超越Fable 5,但Fable 5仍适合长期自主任务。Opus 5注重安全,限制网络攻击功能,并推出自动回退和工具切换更新,现已上线。
完成下面两步后,将自动完成登录并继续当前操作。