GPT-6 Astra 模型不支持 temperature 等参数,需使用 Responses API。开发者可通过 AGENTS.md 添加工作契约,减少审批暂停和冗余输出,提升效率。官方提供迁移技能,但普通用户暂无法访问。模型能力增强,但基准测试分数有争议,实际行为变化更值得关注。
Anthropic发布Claude Fable 5.1,宣称在编码和知识工作上有重大进步,基准测试得分翻倍。但作者用四个真实任务测试新旧模型,发现两者准确率均为满分,仅在速度和成本上略有差异。在复杂任务中,旧模型甚至更快更便宜。作者认为,对日常任务升级意义不大,改进可能仅体现在长时研究型任务上。
OpenAI发布GPT-6 Astra,在ARC-AGI-3基准测试中获99.9%高分,但该成绩依赖优化测试工具,标准工具下仅62.7%。模型在网络安全上达关键级,发现零日漏洞,但可监控性下降,能隐藏思维链。其是否真达AGI存疑,基准测试与全面智能评估存在落差,引发对安全与真实能力的讨论。
OpenAI发布GPT-6 Astra,在ARC-AGI-3测试中得分98.6%,远超GPT-5.6 Sol的7.8%,并在数学、编程等基准上大幅提升。尽管成绩显著,但测试设置差异及模型自主性不明,尚不能证明AGI。Astra在安全性和长任务处理上表现更优,标志AI能力进入新阶段。
OpenAI发布旗舰模型GPT-6 Astra,宣称其最智能且对齐,总裁称已进入AGI时代。模型在编码、科学等基准测试中表现优异,但价格高昂。Astra具备跨上下文记忆和并行提问能力,提升效率。安全方面,其网络攻击能力增强,已触发关键阈值,公司限制高风险访问,并警告用户可能遇到减速或拦截。
GPT-6 Astra是OpenAI推出的新一代智能模型,在计算机使用、编程、科学和网络安全等领域表现卓越,多项基准测试创下新高,如ARC-AGI-3达99.9%。它强调对齐与安全,能更好理解用户意图并遵守边界,同时具备高效任务处理能力。模型已向部分组织开放,并将逐步向所有用户及API平台推出。
谷歌发布Gemini 3.8 Flash,六周内迭代三版,DeepSWE跑分73.7%超Claude Opus 5,但Terminal-Bench 4.0仅19.1%,显示基准测试可能被刷。定价低但成本高,Cyber版仅限政府等“可信防御者”。谷歌以快速迭代和低价抢市场,但知识截止混乱,普通用户难用上新版。
西班牙公司Multiverse Computing发布4380亿参数模型Quasar 438B,专为编码和企业代理设计,输出速度约183 tokens/秒,上下文窗口达100万tokens,支持英语和西班牙语。其压缩技术可减少模型内存和计算需求,但未披露细节。Quasar在基准测试中表现优于部分欧洲模型,但落后于顶尖系统,目前仅通过API提供。
Anthropic发布Claude Fable 5.1,生物学推理能力大幅提升,基准测试超越前代,成本降低。但LatchBio测试显示其拒绝率高,尤其对人类基因组和病原体相关任务,长周期任务全拒。模型通过安全分类器或中途自我审查拒绝,安全与实用性矛盾突出,完整版仅限美国机构使用。
Fable 5.1和Mythos 5.1发布,在8项基准测试中排名第一,价格最高降45%,缓存读取价降75%。新模型擅长多步骤任务,在科研领域表现突出,如蛋白质设计、金星地形图绘制和计算生物学优化。同时新增反蒸馏机制,通过签名验证防止篡改对话历史,并调整安全策略,降低误报率。
Gradium AI发布新TTS模型并设为默认,在500句难例测试中人工评分通过率81%,领先Cartesia和ElevenLabs。首音频延迟216毫秒,低且稳定。支持多语言,无需文本归一化即可准确朗读号码和邮箱。基准测试由厂商运行,评估集已开源。
Qdrant发布全球最大开源向量搜索基准数据集Qdrant-FineWeb-10B,含约25TB向量数据及精确ground truth,并开源Supernova框架,支持分布式嵌入生成、暴力KNN计算和性能评测,旨在替代合成基准,推动生产级向量搜索的可靠性与可复现性。
本文探讨语音智能体延迟指标,指出TTFT(首Token时间)仅是起点,真正影响体验的是TTFS(首句时间)。文章基准测试了LLM、STT、TTS及语音到语音各层,强调需结合TTFT和输出速度评估,并给出约700ms的LLM预算参考。关键建议包括同区域部署、限制推理努力、预留工具调用预算,以及关注p95尾部延迟而非仅p50。
本文基于TPC-H/TPC-DS SF1000基准,在StarRocks存算分离架构下横评AWS Graviton(arm64)与x86实例。结果显示Graviton4(m8g)性价比最优,同代相比x86省34%-52%,且性能领先。建议首选m8g,内存密集选r8g/r7g,x86生态选m8i。
AI编码代理的护栏与模型同样关键。基准测试显示,护栏的启动开销和缓存命中率显著影响成本,差距可达数倍,而任务成功率仅差几个百分点。企业应关注每次验证结果的成本,而非单纯比较令牌数。护栏选择对成本影响巨大,值得与模型同等重视。
文章探讨了PostgreSQL供应商锁定带来的潜在风险,提醒用户在采用Postgres时需警惕隐藏问题。
本文通过基准测试,量化了Qdrant优化器配置对搜索延迟的影响。连续索引虽在加载后需恢复期,但稳态延迟可降180倍;启用prevent_unoptimized能大幅降低排空期延迟,但新点暂不可见。单段配置稳态最快但恢复慢,限制段大小则相反。串行化优化线程可平滑延迟但延长排空。提高删除阈值可避免真空干扰。建议根据负载权衡配置。
本文介绍了四个Rust项目:gRPC-Rust在官方基准测试中性能落后于Go和Java,仍在完善功能;burli是纯Rust的Brotli编解码器,优化传输速度;maudio、auditorium和audctl组成跨平台音频工具集;mdtext是兼容CommonMark和GFM的增量Markdown解析器。
ASI-Bench是由清华、MIT等机构构建的自主科研能力基准,包含60项覆盖11学科的项目级任务,通过B1至B4四级逐步减少人类方法指导来测试AI科研自主性。评测18套系统显示,B1平均分50.91,B3降至26.62,表明AI在方法落地和流程执行上仍有明显短板,距离独立完成开放式科研尚存差距。
Ora平台在Vercel上运行,测试AI代理在真实网站上的表现,发现99%的网页不适合代理操作。它对比Claude Code、eve等主流代理,提供详细追踪。Ora采用eve框架,因其配置简单、沙箱可覆盖,使16人团队每天高效提交数百次代码,并计划扩展微服务。
完成下面两步后,将自动完成登录并继续当前操作。