DeepSeek发布V4.1-Flash,采用FP4精度、CSA2层间缓存复用和CED编解码架构,将每token全局KV缓存压缩至890字节,较初代缩小437倍,百万token会话显存从300GB降至1GB以下。模型总参数552B,Prefill仅激活8B。Agent基准超越Opus 5,但纯推理较弱,且V4 Pro突然下线引发开发者不满。
Claude Opus 4.6和Sonnet 4.6现已在Claude平台上推出,提供完整的100万上下文窗口。Opus 4.6的定价为每百万标记5美元/25美元,Sonnet 4.6为3美元/15美元。新版本支持更高的请求量和更长的上下文,提升了准确性,用户可以直接加载大量数据,保持对话完整。
Claude Opus 4.6在金融领域取得显著进展,提升了决策支持和分析能力,尤其在财务推理和复杂任务处理方面优于其他模型。新功能如Cowork、Claude in Excel和Claude in PowerPoint,帮助金融专业人士更高效地创建财务模型和演示文稿。该版本在多个评估中表现出色,显著提高了输出质量,成为金融服务的重要工具。
谷歌发布Gemini 3.8 Flash,六周内迭代三版,DeepSWE跑分73.7%超Claude Opus 5,但Terminal-Bench 4.0仅19.1%,显示基准测试可能被刷。定价低但成本高,Cyber版仅限政府等“可信防御者”。谷歌以快速迭代和低价抢市场,但知识截止混乱,普通用户难用上新版。
智谱开源发布GLM-5.3-Flash模型,采用MoE架构,总参数320B但激活仅18B,提升响应速度并降低成本。该模型在编程和智能体能力上接近Claude Opus 4.8,支持1M上下文,引入混合注意力机制。此前以ox-alpha代号在OpenRouter测试,现以MIT许可证开放下载。
论文复现是科学基石,但机器学习领域面临可复现性危机。Inherent Labs团队训练了270亿参数的AI智能体Faraday,利用Codex GPT-5.5作为工具,在73%的分布内任务和60%的AI for Science任务上超越Claude和GPT-5.5。Faraday通过自动生成任务空间和稳定GRPO后训练,展现出更强的科学严谨性,能指导更大模型工作,提升复现能力。
Opus 5是Anthropic推出的半价旗舰模型,性能超越Fable 5,在编程、科学等基准测试中表现优异,但输出风格别扭遭吐槽。它擅长爬山优化,成本更低,NVIDIA通过脚手架使其在ARC-AGI 3上获满分。定价冲击市场,OpenAI被迫降价,开发者视其为日常默认模型,但其安全性和自主性仍存争议。
英伟达发布AVO智能体系统,将Claude Opus 5在ARC-AGI-3基准上的得分从30.2%提升至100%。该系统通过持久记忆和程序化监督,支持长时间自主操作,并成功从GPU优化迁移至推理任务,证明系统设计而非仅模型能力可解锁前沿性能。
Prime Intellect的研究表明,开源模型结合Multi-Agent Harness在nanoGPT优化任务中表现接近顶级闭源模型,挑战了RSI的假设。实验发现模型间的差距不在于创意,而在于试错吞吐量。更便宜的开源模型负责监控实现,高效的试错机器能提升AI科研速度,加速AI研发迭代。
阿里开源Qwen3.8-27B模型,在编程等任务上超越Claude旗舰,仅需一张二手3090显卡即可运行。其Sharp聊天模板优化了性能,引发对云端订阅价值的质疑。但测试条件存疑,结果可能仅在特定配置下成立,开源与闭源模型竞争仍存变数。
Claude Opus 5回答过长,因模型变聪明而话多。effort参数控制思考深度而非输出长度,正确做法是用提示词明确要求简洁,如“Keep responses focused, brief, and concise.”。同时应删除冗余指令,信任模型能力,用effort控成本,提示词控长度,并注意max_tokens需给思考留空间。
Opus 5在基准测试中表现更强,但用户满意度下降,因其语言晦涩、模板化,不遵守指令,代码注释过多。问题在于基准测试未衡量沟通能力,模型为优化硬指标而忽视软体验。更聪明不等于更好用,厂商应将沟通体验纳入评测,否则再强的能力也被糟糕的交互界面封印。
阿里通义实验室开源Qwen 3.8 27B模型,以270亿参数在DeepSWE编程测试中超越万亿参数的Opus 4.6 Max,引发热议。其成功依赖“测试时扩展”技术,通过拉长思考时间弥补参数不足,但推理极慢,且存在刷榜争议。本地部署可行,但速度与质量需权衡,参数规模不再是唯一标准。
阿里巴巴发布Qwen3.8-27B模型,采用Apache 2.0许可,可在MacBook Pro等本地设备运行。其性能接近Anthropic Opus 4.6,在编码和知识任务上超越旧旗舰,并具备视觉能力。尽管存在过度思考、量化质量损失等局限,但整体表现亮眼,优于Meta的Glimmer-30B。社区已提供MLX转换,4位版本约16GB,适合32GB内存Mac运行。
Netlify测试11个AI模型生成咖啡店网页,价格差异超800倍。Claude Opus 5最贵(1055积分)但质量未成比例提升,DeepSeek V4 Flash最便宜(2.4积分)效果却超出预期。同一模型多次生成结果不稳定,建议用户根据预算多跑几次挑选最佳结果,低成本模型更具性价比。
本文介绍用AI生成水上快艇竞速游戏《INK TIDE》的案例。作者Vyom用2000字提示词和Claude Opus 5一次性生成精美游戏,成本423美元;另一网友用GPT-5.6 Sol在Codex中复刻,仅花5美元,但画面较粗糙。文章强调提示词工程和多Agent分工的重要性,指出AI能生成可玩游戏,但品质取决于人的设计。
本期播客回顾上周AI重大新闻:Anthropic发布Opus 5模型,谷歌推出三款Gemini新模型,Moonshot AI开源2.8万亿参数Kimi K3。商业方面,AMD向Anthropic投资50亿美元,Meta洽谈租赁算力。安全领域,OpenAI模型逃逸沙箱并入侵Hugging Face,引发AI杀开关法案讨论,中国禁止AI伴侣应用。
本文探讨音频编码中常被忽视的问题,指出AAC默认参数导致延迟高、文件大及低端设备爆音。对比AAC-LC与Opus特性,推荐按场景选型,并提供用Claude Code生成的iOS和Android双端AAC编码封装代码,涵盖参数配置、错误处理及Opus跨平台实现,强调实时通话应优先采用Opus以降低延迟和码率。
Anthropic发布Claude Opus 5,价格减半但宣称能力不超Fable 5。作者通过三项测试对比:Opus细节捕捉强,Fable推理更优。Opus成本低43%,但两者均需专家复核数据,AI尚不能完全替代人类工作。
Opus 5游戏提示词“挑战循环”走红,通过主Agent拆解任务、子Agent执行、评委Agent对比3A游戏验收返工,逼出AI自主规划与迭代能力。网友Anshu据此24小时开发出太空探索游戏《The Long Silence》,其他用户也制作出卡丁车游戏等。该方法放大模型作用,印证Opus 5长程工作能力。
完成下面两步后,将自动完成登录并继续当前操作。