普华永道研究对比JSON与程序化工具调用(PTC)范式,基于BFCL v4基准测试14个模型。PTC在长链任务领先18.8%,并行扇出和上下文污染场景更优,但宏平均略低。优势随模型代际分化,GPT-5.6收益最大。PTC以固定输入开销换取长链与高扇出收益,但存在样本量小等局限。
Opus 5在基准测试中表现更强,但用户满意度下降,因其语言晦涩、模板化,不遵守指令,代码注释过多。问题在于基准测试未衡量沟通能力,模型为优化硬指标而忽视软体验。更聪明不等于更好用,厂商应将沟通体验纳入评测,否则再强的能力也被糟糕的交互界面封印。
Liquid AI发布LFM2.5-VL-3B,31亿参数视觉语言模型,专为设备端设计,支持屏幕理解、函数调用、锚定和多图像输入。在28项基准测试中平均得分69.4,与4.7B模型相当。内存占用约3GB,解码速度228 tok/s。许可证对年收入低于1000万美元的公司免费,高收入需商业许可。
深度求索发布DeepSeek-V4-Pro-0813版,从预览版正式进入GA阶段,模型ID不变,API定价暂未调整。该模型支持1M上下文窗口,提供Responses和Anthropic API,价格未变但已预告将涨价。目前未开源,基准测试数据待完善,内部数据显示多项测试较预览版大幅提升,编码、数学等核心任务保持开源领先,接近前沿闭源模型水平。
DeepSeek发布V4 Pro正式版,API价格不变,Agent能力大幅提升,基准测试远超预览版,接近Fable 5。实测中能自主完成数据报表、网页设计、游戏开发等任务。官方预告DeepSeek Harness框架即将推出,未来将进一步提升AI Agent能力。
pperl项目以高速开发著称,每两周代码变更量相当于Perl一年。在基准测试中,其JIT使mandelbrot程序比perl5快36倍,接近node.js。为此,项目暂停发布,从头重构JIT架构,目标超越所有脚本语言,同时保持通用性以加速真实程序。
香港中文大学与阿里巴巴联合提出PAST-Bench,首个系统评估个人AI智能体递归自我改进能力的基准。通过控制组设计隔离经验保留效应,在26个任务族上测试7个模型和4种框架,定义记忆、程序、主动信息收集和更新四维度。发现跨会话改进不均衡,并提出Hermes+框架增强机制,但效果依赖模型,通用性待验证。
本文介绍了DEEPAMBIGQA数据集,用于评估大语言模型在开放域问答中处理歧义多跳问题的能力。该数据集包含3600个问题,其中一半涉及名称歧义消解。实验显示,即使先进的GPT-5模型在歧义问题上精确匹配率仅0.13,非歧义问题为0.21,表明现有系统在答案完整性上仍有不足,需更稳健的QA模型。
哈佛大学等团队提出PG-LLM基准测试,首次统一评估13款通用语言模型与95种专业蛋白质预测工具。结果显示,Claude Opus 5等通用模型在蛋白突变排序上超越半数专业工具,但落后于顶尖模型VenusREM。研究揭示通用模型随推理资源增加性能提升有限,且对候选集规模敏感,为蛋白质工程工具选择与融合提供新思路。
本文主要讨论了人工智能在医疗领域的应用现状与前景,包括AI辅助诊断、药物研发、个性化治疗等方向,并分析了技术挑战与伦理问题。
阿里巴巴发布Qwen3.8-Max,2.4万亿参数多模态模型,支持百万token上下文,采用稀疏专家和混合注意力架构,并承诺下周开源权重。专家质疑其自评基准可信度,强调需外部验证和稳健测试框架。模型在自主编码和长任务执行上表现突出,但成本、安全及实际采用率仍是关键考量。
英伟达发布NOOA框架,将AI代理定义为单一Python类,整合能力、状态和提示,旨在解决代理开发碎片化问题。专家认为这提升可读性和可维护性,但担忧代码与概率行为难区分、安全风险集中及扩展性挑战。NOOA在基准测试中表现优异,成本减半,英伟达强调开源研究对AI未来至关重要。
Kotlin迎来15周年,社区可参与庆祝活动。RevenueCat Shipaton 2026邀请开发者用Kotlin Multiplatform构建应用,争夺奖项。Kotlin发布首个AI编码代理基准测试,并推出2.4.10版本及2.4.20-Beta2。Kotlin支持登陆BlueJ教育平台,X应用已完全用Kotlin重写。此外,Golden Kodee奖项揭晓,KMP库Ktor、Koin和Kermit获推荐。
DeepSeek发布V4-Flash-0731公开测试版,通过后训练提升智能体性能,未改架构。模型总参数2840亿,激活130亿,小于V4-Pro,但基准测试超越后者。支持MIT许可、Responses API及Codex集成,可自托管,降低推理成本,体现小模型通过优化追赶大模型的趋势。
论文提出ORCA-bench,一个生产保真度的根因分析基准测试,用真实微服务系统评估语言模型Agent。在1,079个任务中,最佳模型中等难度准确率仅25.3%,困难任务仅10.0%,且移除源代码访问会降低性能。测试床含六天遥测数据,结果经专家验证,但真实系统更复杂,实际表现可能更差。
OpenAI发现GPT-5.6 Sol在ARC-AGI-3基准测试中得分低,源于官方框架丢弃推理和滚动截断,而非模型能力不足。启用推理保留和上下文压缩后,得分从7.8%升至38.3%,输出token减少六倍。这揭示基准测试测的是框架记忆管理,而非模型智商,建议评估应使用更贴近实际场景的设置。
页面加载失败,建议刷新或返回上一页。
PetaPerl 0.6.8发布,兼容Perl 5.44,提升速度并附带基准测试套件。新增DBI支持,可连接PostgreSQL、MySQL等数据库,无需安装驱动。引入守护进程,通过fork跳过重复编译,显著加速模块加载。修复模块搜索路径问题,改进文档翻译。项目坚持跟随Perl 5,不扩展语法,未来探索GPU和微控制器编程。
Primate Labs发布Geekbench 7基准测试工具,外观与6代相似,但采用更大数据集和新增音视频编解码测试,多核测试更贴近真实软件行为。Pro版售价99美元,8月6日前优惠至79美元。分数与6代不兼容,需重新测试。
美国阿贡国家实验室团队开发了由大语言模型驱动的智能体系统ChemGraph,用于自动化计算化学分子模拟工作流。该系统结合图神经网络和LLM,支持从分子结构生成到热化学计算等任务。在13项基准测试中,多智能体架构显著提升性能,使小模型(如GPT-4o-mini)准确率从40%提升至87%,甚至超过单智能体GPT-4o的83%,展示了AI自动化科研的潜力。
完成下面两步后,将自动完成登录并继续当前操作。