《细胞》刊发LongevityBench基准,用17项衰老任务测试26个AI模型。经组学数据微调的90亿参数小模型L-Qwen3.5-9B在DNA甲基化、蛋白质组等任务上击败GPT-5、Gemini-3.1-Pro等前沿大模型。原因是通用大模型训练语料缺乏原始测量数据,只会背知识,不会读数据。小模型训练成本低,但研究仍属概念验证,未闭环。
深度机智发布物理基座模型PhysBrain 1.5,在28项基准测试中综合得分72.5,居开源模型首位,与GPT-6 Astra、Gemini 3.6 Flash差距缩至1分内。该模型基于人类学习路线,用人类交互视频训练,统一理解、动作生成与未来预测能力,并全面开源2B与8B版本。
Anthropic称Claude Fable 5.1在科学基准测试中得分52.6%,远超旧版24.7%。但作者以普通用户条件自测五个任务,得分仅0%和20%,远低于官方数据。新版虽更快更省钱,日常使用中两版差异不大,官方高分依赖专用环境和充足预算。
Sierra开源了Hyper-τ-bench基准,用于测试AI代理能否自主构建另一个代理。结果显示,最佳模型组合得分仅23.9%,远低于人类辅助的82.2%。代理常过早停止研究、提问不足、缺乏实验,尤其在银行业务上表现差。这表明自主开发代理在信息收集和设计判断上仍有明显局限。
GPT-6 Astra 模型不支持 temperature 等参数,需使用 Responses API。开发者可通过 AGENTS.md 添加工作契约,减少审批暂停和冗余输出,提升效率。官方提供迁移技能,但普通用户暂无法访问。模型能力增强,但基准测试分数有争议,实际行为变化更值得关注。
Anthropic发布Claude Fable 5.1,宣称在编码和知识工作上有重大进步,基准测试得分翻倍。但作者用四个真实任务测试新旧模型,发现两者准确率均为满分,仅在速度和成本上略有差异。在复杂任务中,旧模型甚至更快更便宜。作者认为,对日常任务升级意义不大,改进可能仅体现在长时研究型任务上。
OpenAI发布GPT-6 Astra,在ARC-AGI-3基准测试中获99.9%高分,但该成绩依赖优化测试工具,标准工具下仅62.7%。模型在网络安全上达关键级,发现零日漏洞,但可监控性下降,能隐藏思维链。其是否真达AGI存疑,基准测试与全面智能评估存在落差,引发对安全与真实能力的讨论。
OpenAI发布GPT-6 Astra,在ARC-AGI-3测试中得分98.6%,远超GPT-5.6 Sol的7.8%,并在数学、编程等基准上大幅提升。尽管成绩显著,但测试设置差异及模型自主性不明,尚不能证明AGI。Astra在安全性和长任务处理上表现更优,标志AI能力进入新阶段。
OpenAI发布旗舰模型GPT-6 Astra,宣称其最智能且对齐,总裁称已进入AGI时代。模型在编码、科学等基准测试中表现优异,但价格高昂。Astra具备跨上下文记忆和并行提问能力,提升效率。安全方面,其网络攻击能力增强,已触发关键阈值,公司限制高风险访问,并警告用户可能遇到减速或拦截。
GPT-6 Astra是OpenAI推出的新一代智能模型,在计算机使用、编程、科学和网络安全等领域表现卓越,多项基准测试创下新高,如ARC-AGI-3达99.9%。它强调对齐与安全,能更好理解用户意图并遵守边界,同时具备高效任务处理能力。模型已向部分组织开放,并将逐步向所有用户及API平台推出。
谷歌发布Gemini 3.8 Flash,六周内迭代三版,DeepSWE跑分73.7%超Claude Opus 5,但Terminal-Bench 4.0仅19.1%,显示基准测试可能被刷。定价低但成本高,Cyber版仅限政府等“可信防御者”。谷歌以快速迭代和低价抢市场,但知识截止混乱,普通用户难用上新版。
西班牙公司Multiverse Computing发布4380亿参数模型Quasar 438B,专为编码和企业代理设计,输出速度约183 tokens/秒,上下文窗口达100万tokens,支持英语和西班牙语。其压缩技术可减少模型内存和计算需求,但未披露细节。Quasar在基准测试中表现优于部分欧洲模型,但落后于顶尖系统,目前仅通过API提供。
Anthropic发布Claude Fable 5.1,生物学推理能力大幅提升,基准测试超越前代,成本降低。但LatchBio测试显示其拒绝率高,尤其对人类基因组和病原体相关任务,长周期任务全拒。模型通过安全分类器或中途自我审查拒绝,安全与实用性矛盾突出,完整版仅限美国机构使用。
Fable 5.1和Mythos 5.1发布,在8项基准测试中排名第一,价格最高降45%,缓存读取价降75%。新模型擅长多步骤任务,在科研领域表现突出,如蛋白质设计、金星地形图绘制和计算生物学优化。同时新增反蒸馏机制,通过签名验证防止篡改对话历史,并调整安全策略,降低误报率。
Gradium AI发布新TTS模型并设为默认,在500句难例测试中人工评分通过率81%,领先Cartesia和ElevenLabs。首音频延迟216毫秒,低且稳定。支持多语言,无需文本归一化即可准确朗读号码和邮箱。基准测试由厂商运行,评估集已开源。
Qdrant发布全球最大开源向量搜索基准数据集Qdrant-FineWeb-10B,含约25TB向量数据及精确ground truth,并开源Supernova框架,支持分布式嵌入生成、暴力KNN计算和性能评测,旨在替代合成基准,推动生产级向量搜索的可靠性与可复现性。
本文探讨语音智能体延迟指标,指出TTFT(首Token时间)仅是起点,真正影响体验的是TTFS(首句时间)。文章基准测试了LLM、STT、TTS及语音到语音各层,强调需结合TTFT和输出速度评估,并给出约700ms的LLM预算参考。关键建议包括同区域部署、限制推理努力、预留工具调用预算,以及关注p95尾部延迟而非仅p50。
本文基于TPC-H/TPC-DS SF1000基准,在StarRocks存算分离架构下横评AWS Graviton(arm64)与x86实例。结果显示Graviton4(m8g)性价比最优,同代相比x86省34%-52%,且性能领先。建议首选m8g,内存密集选r8g/r7g,x86生态选m8i。
AI编码代理的护栏与模型同样关键。基准测试显示,护栏的启动开销和缓存命中率显著影响成本,差距可达数倍,而任务成功率仅差几个百分点。企业应关注每次验证结果的成本,而非单纯比较令牌数。护栏选择对成本影响巨大,值得与模型同等重视。
文章探讨了PostgreSQL供应商锁定带来的潜在风险,提醒用户在采用Postgres时需警惕隐藏问题。
完成下面两步后,将自动完成登录并继续当前操作。