小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Claude在新基准测试中表现最佳,该基准用于测试构建代理的代理,但其通过率仍不足四分之一。

Sierra开源了Hyper-τ-bench基准,用于测试AI代理能否自主构建另一个代理。结果显示,最佳模型组合得分仅23.9%,远低于人类辅助的82.2%。代理常过早停止研究、提问不足、缺乏实验,尤其在银行业务上表现差。这表明自主开发代理在信息收集和设计判断上仍有明显局限。

Claude在新基准测试中表现最佳,该基准用于测试构建代理的代理,但其通过率仍不足四分之一。

The New Stack The New Stack · 2026-09-09T20:14:09Z
Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

Gradium AI发布新TTS模型并设为默认,在500句难例测试中人工评分通过率81%,领先Cartesia和ElevenLabs。首音频延迟216毫秒,低且稳定。支持多语言,无需文本归一化即可准确朗读号码和邮箱。基准测试由厂商运行,评估集已开源。

Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

实时互动网 实时互动网 · 2026-09-01T06:35:17Z
上次说“没有靠谱的尺子”,这次 Dex Horthy 找到了一把——Opus 5 实测通过率只有 24%

Dex Horthy在第三篇文章中承认此前“无好基准”的判断有误,介绍新基准SlopCodeBench(SCB),通过检查点模拟需求逐步演进。他实测Opus 5、Sonnet 5、Opus 4.8,最强Opus 5严格通过率仅24%,其余仅6%。代码质量指标显示劣化严重,结论是当前模型仍无法无人值守运行,但SCB提供了可追踪的衡量工具。

上次说“没有靠谱的尺子”,这次 Dex Horthy 找到了一把——Opus 5 实测通过率只有 24%

Tony Bai Tony Bai · 2026-07-27T23:00:00Z
顶刊生物实验难复现?统一操作话术来了!编译通过率98.6%

AI在生物制造领域的应用面临实验执行精确性挑战。恩和科技开发的BPL语言旨在标准化实验流程,提高自动化和复现性。通过BPL-COGEN,科研人员可以将自然语言转化为标准化代码,确保实验的准确性和效率。SAION AI平台整合这些技术,实现高效的实验设计与执行,推动生物制造产业化进程。

顶刊生物实验难复现?统一操作话术来了!编译通过率98.6%

量子位 量子位 · 2026-06-30T10:09:56Z
Claude 通过率不到4%,SaaS-Bench撕碎了Computer-Use的「全自动办公」幻想

UniPat AI发布的SaaS-Bench评测显示,主流AI模型在真实办公任务中的通过率仅为3.8%。这些模型在处理复杂跨应用任务时表现不佳,无法稳定完成实习生的日常工作。评测指出AI在长流程工作中的四大缺陷:任务越长越难、错误传播、缺乏自我检查和执行不稳定。未来软件需重新设计以适应AI的操作需求。

Claude 通过率不到4%,SaaS-Bench撕碎了Computer-Use的「全自动办公」幻想

量子位 量子位 · 2026-05-25T03:29:41Z

谷歌推出了两个工具以解决Gemini API代码过时的问题。Gemini API Docs MCP连接代理与最新的API文档,确保使用最新配置。Gemini API Developer Skills提供最佳实践指导。结合使用这两个工具可提高工作效率,评估显示通过率达到96.3%,且每个正确答案所需的令牌减少63%。

通过Gemini API文档MCP和代理技能提升编码代理的性能

The Keyword The Keyword · 2026-04-01T12:54:00Z
AGENTS.md在我们的代理评估中优于技能

研究表明,将文档索引嵌入AGENTS.md文件中,可以使AI编码代理在Next.js项目中的通过率达到100%,而使用技能的通过率仅为79%。技能未能有效触发,指令措辞对结果影响显著。AGENTS.md的被动上下文方法优于主动检索,提供了更可靠的知识访问框架。

AGENTS.md在我们的代理评估中优于技能

Vercel News Vercel News · 2026-01-27T13:00:00Z

机器之心数据服务现已上线,提供高效稳定的数据获取服务,简化数据爬取流程。

Test Time Scaling Law远未达到上限! o4-mini仅15.8%通过率,华为诺亚提出代码HLCE终极基准

机器之心 机器之心 · 2025-07-05T10:41:33Z

文章分析了一位同学面试失败的原因,主要是缺乏自信和缺乏总结习惯。建议通过工作中的成就感提升自信,并定期总结项目经验,以增强简历亮点和面试表现。

为什么你的面试通过率不高? - 老_张

老_张 老_张 · 2025-02-21T06:17:00Z

本研究结合ChatGPT与基本搜索技术,提升了形式证明生成的效率和可及性,最佳模型的通过率达到31.15%,为AI辅助的形式证明生成提供了新见解。

利用ChatGPT和基本搜索技术简化形式证明生成模型

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-02-05T00:00:00Z
1792. 最大平均通过率

在一所学校中,给定每个班级的通过人数和总人数,以及额外的优秀学生,目标是合理分配这些学生,以最大化所有班级的平均通过率。通过使用最大堆优先分配对通过率提升最大的班级,最终计算出最大可能的平均通过率。

1792. 最大平均通过率

DEV Community DEV Community · 2024-12-15T15:19:48Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码