小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
GPT-6 Astra三行提示词:写入AGENTS.md,告别废话立刻干活

GPT-6 Astra 模型不支持 temperature 等参数,需使用 Responses API。开发者可通过 AGENTS.md 添加工作契约,减少审批暂停和冗余输出,提升效率。官方提供迁移技能,但普通用户暂无法访问。模型能力增强,但基准测试分数有争议,实际行为变化更值得关注。

GPT-6 Astra三行提示词:写入AGENTS.md,告别废话立刻干活

极道 极道 · 2026-09-05T23:32:00Z
Claude Fable 5.1 对比 Fable 5:在实际工作中,我无法区分它们。

Anthropic发布Claude Fable 5.1,宣称在编码和知识工作上有重大进步,基准测试得分翻倍。但作者用四个真实任务测试新旧模型,发现两者准确率均为满分,仅在速度和成本上略有差异。在复杂任务中,旧模型甚至更快更便宜。作者认为,对日常任务升级意义不大,改进可能仅体现在长时研究型任务上。

Claude Fable 5.1 对比 Fable 5:在实际工作中,我无法区分它们。

The New Stack The New Stack · 2026-09-05T15:00:00Z
OpenAI发布GPT-6 Astra:称可能代表AGI

OpenAI发布GPT-6 Astra,在ARC-AGI-3基准测试中获99.9%高分,但该成绩依赖优化测试工具,标准工具下仅62.7%。模型在网络安全上达关键级,发现零日漏洞,但可监控性下降,能隐藏思维链。其是否真达AGI存疑,基准测试与全面智能评估存在落差,引发对安全与真实能力的讨论。

OpenAI发布GPT-6 Astra:称可能代表AGI

极道 极道 · 2026-09-03T21:09:00Z
GPT-6 Astra 在难度最高的AI基准测试中表现出色。但其中的星号比分数更重要。

OpenAI发布GPT-6 Astra,在ARC-AGI-3测试中得分98.6%,远超GPT-5.6 Sol的7.8%,并在数学、编程等基准上大幅提升。尽管成绩显著,但测试设置差异及模型自主性不明,尚不能证明AGI。Astra在安全性和长任务处理上表现更优,标志AI能力进入新阶段。

GPT-6 Astra 在难度最高的AI基准测试中表现出色。但其中的星号比分数更重要。

The New Stack The New Stack · 2026-09-03T19:05:24Z
OpenAI发布GPT-6 Astra,宣称欢迎进入“AGI时代”

OpenAI发布旗舰模型GPT-6 Astra,宣称其最智能且对齐,总裁称已进入AGI时代。模型在编码、科学等基准测试中表现优异,但价格高昂。Astra具备跨上下文记忆和并行提问能力,提升效率。安全方面,其网络攻击能力增强,已触发关键阈值,公司限制高风险访问,并警告用户可能遇到减速或拦截。

OpenAI发布GPT-6 Astra,宣称欢迎进入“AGI时代”

The New Stack The New Stack · 2026-09-03T18:02:40Z
GPT-6 Astra:新一代智能

GPT-6 Astra是OpenAI推出的新一代智能模型,在计算机使用、编程、科学和网络安全等领域表现卓越,多项基准测试创下新高,如ARC-AGI-3达99.9%。它强调对齐与安全,能更好理解用户意图并遵守边界,同时具备高效任务处理能力。模型已向部分组织开放,并将逐步向所有用户及API平台推出。

GPT-6 Astra:新一代智能

OpenAI OpenAI · 2026-09-03T11:00:00Z
Gemini 3.8 Flash上线:DeepSWE跑分73.7%压过Opus 5

谷歌发布Gemini 3.8 Flash,六周内迭代三版,DeepSWE跑分73.7%超Claude Opus 5,但Terminal-Bench 4.0仅19.1%,显示基准测试可能被刷。定价低但成本高,Cyber版仅限政府等“可信防御者”。谷歌以快速迭代和低价抢市场,但知识截止混乱,普通用户难用上新版。

Gemini 3.8 Flash上线:DeepSWE跑分73.7%压过Opus 5

极道 极道 · 2026-09-02T21:52:00Z
Multiverse称其438B模型对AI代理而言速度足够快。但基准测试揭示的情况更为复杂。

西班牙公司Multiverse Computing发布4380亿参数模型Quasar 438B,专为编码和企业代理设计,输出速度约183 tokens/秒,上下文窗口达100万tokens,支持英语和西班牙语。其压缩技术可减少模型内存和计算需求,但未披露细节。Quasar在基准测试中表现优于部分欧洲模型,但落后于顶尖系统,目前仅通过API提供。

Multiverse称其438B模型对AI代理而言速度足够快。但基准测试揭示的情况更为复杂。

The New Stack The New Stack · 2026-09-02T20:14:53Z
Fable 5.1生物学推理强但拒答高:基准测试全面碾压前代

Anthropic发布Claude Fable 5.1,生物学推理能力大幅提升,基准测试超越前代,成本降低。但LatchBio测试显示其拒绝率高,尤其对人类基因组和病原体相关任务,长周期任务全拒。模型通过安全分类器或中途自我审查拒绝,安全与实用性矛盾突出,完整版仅限美国机构使用。

Fable 5.1生物学推理强但拒答高:基准测试全面碾压前代

极道 极道 · 2026-09-02T09:11:00Z
Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线

Fable 5.1和Mythos 5.1发布,在8项基准测试中排名第一,价格最高降45%,缓存读取价降75%。新模型擅长多步骤任务,在科研领域表现突出,如蛋白质设计、金星地形图绘制和计算生物学优化。同时新增反蒸馏机制,通过签名验证防止篡改对话历史,并调整安全策略,降低误报率。

Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线

量子位 量子位 · 2026-09-02T02:18:12Z
Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

Gradium AI发布新TTS模型并设为默认,在500句难例测试中人工评分通过率81%,领先Cartesia和ElevenLabs。首音频延迟216毫秒,低且稳定。支持多语言,无需文本归一化即可准确朗读号码和邮箱。基准测试由厂商运行,评估集已开源。

Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

实时互动网 实时互动网 · 2026-09-01T06:35:17Z
告别糟糕的基准测试:面向生产级研究的工具

Qdrant发布全球最大开源向量搜索基准数据集Qdrant-FineWeb-10B,含约25TB向量数据及精确ground truth,并开源Supernova框架,支持分布式嵌入生成、暴力KNN计算和性能评测,旨在替代合成基准,推动生产级向量搜索的可靠性与可复现性。

告别糟糕的基准测试:面向生产级研究的工具

Qdrant - Vector Database Qdrant - Vector Database · 2026-09-01T00:00:00Z
面向语音与实时智能体的最低延迟推理 API:一份以首 Token 时间(TTFT)为先的基准测试

本文探讨语音智能体延迟指标,指出TTFT(首Token时间)仅是起点,真正影响体验的是TTFS(首句时间)。文章基准测试了LLM、STT、TTS及语音到语音各层,强调需结合TTFT和输出速度评估,并给出约700ms的LLM预算参考。关键建议包括同区域部署、限制推理努力、预留工具调用预算,以及关注p95尾部延迟而非仅p50。

面向语音与实时智能体的最低延迟推理 API:一份以首 Token 时间(TTFT)为先的基准测试

实时互动网 实时互动网 · 2026-08-31T06:07:51Z
用数据选型:StarRocks 跨架构(arm64 vs x86)基准测试记录

本文基于TPC-H/TPC-DS SF1000基准,在StarRocks存算分离架构下横评AWS Graviton(arm64)与x86实例。结果显示Graviton4(m8g)性价比最优,同代相比x86省34%-52%,且性能领先。建议首选m8g,内存密集选r8g/r7g,x86生态选m8i。

用数据选型:StarRocks 跨架构(arm64 vs x86)基准测试记录

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-08-31T03:33:52Z
Aider、Claude Code 和 OpenClaw 运行相同模型,令牌使用量相差 70 倍。

AI编码代理的护栏与模型同样关键。基准测试显示,护栏的启动开销和缓存命中率显著影响成本,差距可达数倍,而任务成功率仅差几个百分点。企业应关注每次验证结果的成本,而非单纯比较令牌数。护栏选择对成本影响巨大,值得与模型同等重视。

Aider、Claude Code 和 OpenClaw 运行相同模型,令牌使用量相差 70 倍。

The New Stack The New Stack · 2026-08-27T17:54:40Z
基准测试向量索引

文章探讨了PostgreSQL供应商锁定带来的潜在风险,提醒用户在采用Postgres时需警惕隐藏问题。

基准测试向量索引

Percona Database Performance Blog Percona Database Performance Blog · 2026-08-27T13:35:32Z
配置Qdrant优化器以实现可预测的搜索延迟

本文通过基准测试,量化了Qdrant优化器配置对搜索延迟的影响。连续索引虽在加载后需恢复期,但稳态延迟可降180倍;启用prevent_unoptimized能大幅降低排空期延迟,但新点暂不可见。单段配置稳态最快但恢复慢,限制段大小则相反。串行化优化线程可平滑延迟但延长排空。提高删除阈值可避免真空干扰。建议根据负载权衡配置。

配置Qdrant优化器以实现可预测的搜索延迟

Qdrant - Vector Database Qdrant - Vector Database · 2026-08-25T08:00:00Z

本文介绍了四个Rust项目:gRPC-Rust在官方基准测试中性能落后于Go和Java,仍在完善功能;burli是纯Rust的Brotli编解码器,优化传输速度;maudio、auditorium和audctl组成跨平台音频工具集;mdtext是兼容CommonMark和GFM的增量Markdown解析器。

【Rust日报】2026-08-21 gRPC-Rust:官方基准测试中的性能与实现现状

Rust.cc Rust.cc · 2026-08-24T23:29:09Z
覆盖11个学科/60项科研任务,清华/MIT/哈佛等提出ASI-Bench测试AI自主科研能力

ASI-Bench是由清华、MIT等机构构建的自主科研能力基准,包含60项覆盖11学科的项目级任务,通过B1至B4四级逐步减少人类方法指导来测试AI科研自主性。评测18套系统显示,B1平均分50.91,B3降至26.62,表明AI在方法落地和流程执行上仍有明显短板,距离独立完成开放式科研尚存差距。

覆盖11个学科/60项科研任务,清华/MIT/哈佛等提出ASI-Bench测试AI自主科研能力

HyperAI超神经 HyperAI超神经 · 2026-08-24T10:24:30Z
Ora如何在Vercel上对每个主流AI代理进行基准测试

Ora平台在Vercel上运行,测试AI代理在真实网站上的表现,发现99%的网页不适合代理操作。它对比Claude Code、eve等主流代理,提供详细追踪。Ora采用eve框架,因其配置简单、沙箱可覆盖,使16人团队每天高效提交数百次代码,并计划扩展微服务。

Ora如何在Vercel上对每个主流AI代理进行基准测试

Vercel News Vercel News · 2026-08-21T21:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码