小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
一分钟读论文:《工具调用的苦涩教训》

普华永道研究对比JSON与程序化工具调用(PTC)范式,基于BFCL v4基准测试14个模型。PTC在长链任务领先18.8%,并行扇出和上下文污染场景更优,但宏平均略低。优势随模型代际分化,GPT-5.6收益最大。PTC以固定输入开销换取长链与高扇出收益,但存在样本量小等局限。

一分钟读论文:《工具调用的苦涩教训》

Micropaper Micropaper · 2026-08-18T00:00:00Z
吐槽Opus 5翻车实录:语言失控,开发者怒斥注释垃圾

Opus 5在基准测试中表现更强,但用户满意度下降,因其语言晦涩、模板化,不遵守指令,代码注释过多。问题在于基准测试未衡量沟通能力,模型为优化硬指标而忽视软体验。更聪明不等于更好用,厂商应将沟通体验纳入评测,否则再强的能力也被糟糕的交互界面封印。

吐槽Opus 5翻车实录:语言失控,开发者怒斥注释垃圾

极道 极道 · 2026-08-14T22:06:00Z
Liquid AI 发布 LFM2.5-VL-3B:一款 3B 视觉语言模型,可读取屏幕、识别物体并调用设备端工具

Liquid AI发布LFM2.5-VL-3B,31亿参数视觉语言模型,专为设备端设计,支持屏幕理解、函数调用、锚定和多图像输入。在28项基准测试中平均得分69.4,与4.7B模型相当。内存占用约3GB,解码速度228 tok/s。许可证对年收入低于1000万美元的公司免费,高收入需商业许可。

Liquid AI 发布 LFM2.5-VL-3B:一款 3B 视觉语言模型,可读取屏幕、识别物体并调用设备端工具

实时互动网 实时互动网 · 2026-08-14T02:56:23Z
深度求索发布DeepSeek-V4-Pro-0813 该模型从预览版正式进入GA阶段

深度求索发布DeepSeek-V4-Pro-0813版,从预览版正式进入GA阶段,模型ID不变,API定价暂未调整。该模型支持1M上下文窗口,提供Responses和Anthropic API,价格未变但已预告将涨价。目前未开源,基准测试数据待完善,内部数据显示多项测试较预览版大幅提升,编码、数学等核心任务保持开源领先,接近前沿闭源模型水平。

深度求索发布DeepSeek-V4-Pro-0813 该模型从预览版正式进入GA阶段

蓝点网 蓝点网 · 2026-08-13T05:30:30Z
实测 DeepSeek V4 Pro 正式版:能力直逼 Fable 5,还藏了一个大招

DeepSeek发布V4 Pro正式版,API价格不变,Agent能力大幅提升,基准测试远超预览版,接近Fable 5。实测中能自主完成数据报表、网页设计、游戏开发等任务。官方预告DeepSeek Harness框架即将推出,未来将进一步提升AI Agent能力。

实测 DeepSeek V4 Pro 正式版:能力直逼 Fable 5,还藏了一个大招

爱范儿 爱范儿 · 2026-08-12T22:55:33Z

pperl项目以高速开发著称,每两周代码变更量相当于Perl一年。在基准测试中,其JIT使mandelbrot程序比perl5快36倍,接近node.js。为此,项目暂停发布,从头重构JIT架构,目标超越所有脚本语言,同时保持通用性以加速真实程序。

pperl 0.6.12+ - "我们玩个游戏吗?"

blogs.perl.org blogs.perl.org · 2026-08-11T03:41:21Z
一分钟读论文:《PAST-Bench:评估个人智能体递归自我改进的基础基准》

香港中文大学与阿里巴巴联合提出PAST-Bench,首个系统评估个人AI智能体递归自我改进能力的基准。通过控制组设计隔离经验保留效应,在26个任务族上测试7个模型和4种框架,定义记忆、程序、主动信息收集和更新四维度。发现跨会话改进不均衡,并提出Hermes+框架增强机制,但效果依赖模型,通用性待验证。

一分钟读论文:《PAST-Bench:评估个人智能体递归自我改进的基础基准》

Micropaper Micropaper · 2026-08-07T00:00:00Z
DeepAmbigQA:用于基准测试大语言模型答案完整性的歧义多跳问题

本文介绍了DEEPAMBIGQA数据集,用于评估大语言模型在开放域问答中处理歧义多跳问题的能力。该数据集包含3600个问题,其中一半涉及名称歧义消解。实验显示,即使先进的GPT-5模型在歧义问题上精确匹配率仅0.13,非歧义问题为0.21,表明现有系统在答案完整性上仍有不足,需更稳健的QA模型。

DeepAmbigQA:用于基准测试大语言模型答案完整性的歧义多跳问题

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-06T00:00:00Z
首个面向LLM的蛋白突变排序标准化评测基准!哈佛大学团队提出PG-LLM,一次性测评13款主流模型+95种专业模型

哈佛大学等团队提出PG-LLM基准测试,首次统一评估13款通用语言模型与95种专业蛋白质预测工具。结果显示,Claude Opus 5等通用模型在蛋白突变排序上超越半数专业工具,但落后于顶尖模型VenusREM。研究揭示通用模型随推理资源增加性能提升有限,且对候选集规模敏感,为蛋白质工程工具选择与融合提供新思路。

首个面向LLM的蛋白突变排序标准化评测基准!哈佛大学团队提出PG-LLM,一次性测评13款主流模型+95种专业模型

HyperAI超神经 HyperAI超神经 · 2026-08-05T12:43:03Z
Avi Vallarapu:调优PostgreSQL HOT更新——一项HammerDB基准测试

本文主要讨论了人工智能在医疗领域的应用现状与前景,包括AI辅助诊断、药物研发、个性化治疗等方向,并分析了技术挑战与伦理问题。

Avi Vallarapu:调优PostgreSQL HOT更新——一项HammerDB基准测试

Planet PostgreSQL Planet PostgreSQL · 2026-08-05T09:12:04Z
阿里巴巴Qwen3.8-Max反响:“披着开源外衣的API商业模式”

阿里巴巴发布Qwen3.8-Max,2.4万亿参数多模态模型,支持百万token上下文,采用稀疏专家和混合注意力架构,并承诺下周开源权重。专家质疑其自评基准可信度,强调需外部验证和稳健测试框架。模型在自主编码和长任务执行上表现突出,但成本、安全及实际采用率仍是关键考量。

阿里巴巴Qwen3.8-Max反响:“披着开源外衣的API商业模式”

The New Stack The New Stack · 2026-08-04T14:47:35Z
英伟达NOOA框架:让AI代理成为一个Python类

英伟达发布NOOA框架,将AI代理定义为单一Python类,整合能力、状态和提示,旨在解决代理开发碎片化问题。专家认为这提升可读性和可维护性,但担忧代码与概率行为难区分、安全风险集中及扩展性挑战。NOOA在基准测试中表现优异,成本减半,英伟达强调开源研究对AI未来至关重要。

英伟达NOOA框架:让AI代理成为一个Python类

The New Stack The New Stack · 2026-08-04T14:02:35Z
Kodee的Kotlin综述:生日祝福、Shipaton 2026与新的Kotlin AI基准测试

Kotlin迎来15周年,社区可参与庆祝活动。RevenueCat Shipaton 2026邀请开发者用Kotlin Multiplatform构建应用,争夺奖项。Kotlin发布首个AI编码代理基准测试,并推出2.4.10版本及2.4.20-Beta2。Kotlin支持登陆BlueJ教育平台,X应用已完全用Kotlin重写。此外,Golden Kodee奖项揭晓,KMP库Ktor、Koin和Kermit获推荐。

Kodee的Kotlin综述:生日祝福、Shipaton 2026与新的Kotlin AI基准测试

The JetBrains Blog The JetBrains Blog · 2026-08-04T08:14:27Z
DeepSeek的小型模型刚刚超越了自家旗舰模型

DeepSeek发布V4-Flash-0731公开测试版,通过后训练提升智能体性能,未改架构。模型总参数2840亿,激活130亿,小于V4-Pro,但基准测试超越后者。支持MIT许可、Responses API及Codex集成,可自托管,降低推理成本,体现小模型通过优化追赶大模型的趋势。

DeepSeek的小型模型刚刚超越了自家旗舰模型

The New Stack The New Stack · 2026-08-03T13:32:15Z
一分钟读论文:《ORCA-bench:语言模型 Agent 准备好应对 On-Call 了吗?》

论文提出ORCA-bench,一个生产保真度的根因分析基准测试,用真实微服务系统评估语言模型Agent。在1,079个任务中,最佳模型中等难度准确率仅25.3%,困难任务仅10.0%,且移除源代码访问会降低性能。测试床含六天遥测数据,结果经专家验证,但真实系统更复杂,实际表现可能更差。

一分钟读论文:《ORCA-bench:语言模型 Agent 准备好应对 On-Call 了吗?》

Micropaper Micropaper · 2026-08-01T00:00:00Z
GPT-5.6 Sol打开两个设置:ARC-AGI-3评分从7.8%翻三倍38.3%

OpenAI发现GPT-5.6 Sol在ARC-AGI-3基准测试中得分低,源于官方框架丢弃推理和滚动截断,而非模型能力不足。启用推理保留和上下文压缩后,得分从7.8%升至38.3%,输出token减少六倍。这揭示基准测试测的是框架记忆管理,而非模型智商,建议评估应使用更贴近实际场景的设置。

GPT-5.6 Sol打开两个设置:ARC-AGI-3评分从7.8%翻三倍38.3%

极道 极道 · 2026-07-30T06:56:00Z

页面加载失败,建议刷新或返回上一页。

如何启用两个设置使我们在ARC-AGI-3基准测试中的得分提高了三倍

OpenAI OpenAI · 2026-07-29T15:00:00Z

PetaPerl 0.6.8发布,兼容Perl 5.44,提升速度并附带基准测试套件。新增DBI支持,可连接PostgreSQL、MySQL等数据库,无需安装驱动。引入守护进程,通过fork跳过重复编译,显著加速模块加载。修复模块搜索路径问题,改进文档翻译。项目坚持跟随Perl 5,不扩展语法,未来探索GPU和微控制器编程。

移动目标 - PetaPerl 0.6.8

blogs.perl.org blogs.perl.org · 2026-07-27T01:29:02Z
Geekbench 7将更严苛地考验你的电脑或手机,带来更精准的基准测试

Primate Labs发布Geekbench 7基准测试工具,外观与6代相似,但采用更大数据集和新增音视频编解码测试,多核测试更贴近真实软件行为。Pro版售价99美元,8月6日前优惠至79美元。分数与6代不兼容,需重新测试。

Geekbench 7将更严苛地考验你的电脑或手机,带来更精准的基准测试

The Verge The Verge · 2026-07-23T17:00:00Z
美国阿贡实验室提出ChemGraph,13项基准测试评估Agent在计算化学领域价值

美国阿贡国家实验室团队开发了由大语言模型驱动的智能体系统ChemGraph,用于自动化计算化学分子模拟工作流。该系统结合图神经网络和LLM,支持从分子结构生成到热化学计算等任务。在13项基准测试中,多智能体架构显著提升性能,使小模型(如GPT-4o-mini)准确率从40%提升至87%,甚至超过单智能体GPT-4o的83%,展示了AI自动化科研的潜力。

美国阿贡实验室提出ChemGraph,13项基准测试评估Agent在计算化学领域价值

HyperAI超神经 HyperAI超神经 · 2026-07-23T09:25:34Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码