小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
吐槽Opus 5翻车实录:语言失控,开发者怒斥注释垃圾

Opus 5在基准测试中表现更强,但用户满意度下降,因其语言晦涩、模板化,不遵守指令,代码注释过多。问题在于基准测试未衡量沟通能力,模型为优化硬指标而忽视软体验。更聪明不等于更好用,厂商应将沟通体验纳入评测,否则再强的能力也被糟糕的交互界面封印。

吐槽Opus 5翻车实录:语言失控,开发者怒斥注释垃圾

极道 极道 · 2026-08-14T22:06:00Z
Liquid AI 发布 LFM2.5-VL-3B:一款 3B 视觉语言模型,可读取屏幕、识别物体并调用设备端工具

Liquid AI发布LFM2.5-VL-3B,31亿参数视觉语言模型,专为设备端设计,支持屏幕理解、函数调用、锚定和多图像输入。在28项基准测试中平均得分69.4,与4.7B模型相当。内存占用约3GB,解码速度228 tok/s。许可证对年收入低于1000万美元的公司免费,高收入需商业许可。

Liquid AI 发布 LFM2.5-VL-3B:一款 3B 视觉语言模型,可读取屏幕、识别物体并调用设备端工具

实时互动网 实时互动网 · 2026-08-14T02:56:23Z
深度求索发布DeepSeek-V4-Pro-0813 该模型从预览版正式进入GA阶段

深度求索发布DeepSeek-V4-Pro-0813版,从预览版正式进入GA阶段,模型ID不变,API定价暂未调整。该模型支持1M上下文窗口,提供Responses和Anthropic API,价格未变但已预告将涨价。目前未开源,基准测试数据待完善,内部数据显示多项测试较预览版大幅提升,编码、数学等核心任务保持开源领先,接近前沿闭源模型水平。

深度求索发布DeepSeek-V4-Pro-0813 该模型从预览版正式进入GA阶段

蓝点网 蓝点网 · 2026-08-13T05:30:30Z
实测 DeepSeek V4 Pro 正式版:能力直逼 Fable 5,还藏了一个大招

DeepSeek发布V4 Pro正式版,API价格不变,Agent能力大幅提升,基准测试远超预览版,接近Fable 5。实测中能自主完成数据报表、网页设计、游戏开发等任务。官方预告DeepSeek Harness框架即将推出,未来将进一步提升AI Agent能力。

实测 DeepSeek V4 Pro 正式版:能力直逼 Fable 5,还藏了一个大招

爱范儿 爱范儿 · 2026-08-12T22:55:33Z

pperl项目以高速开发著称,每两周代码变更量相当于Perl一年。在基准测试中,其JIT使mandelbrot程序比perl5快36倍,接近node.js。为此,项目暂停发布,从头重构JIT架构,目标超越所有脚本语言,同时保持通用性以加速真实程序。

pperl 0.6.12+ - "我们玩个游戏吗?"

blogs.perl.org blogs.perl.org · 2026-08-11T03:41:21Z
一分钟读论文:《PAST-Bench:评估个人智能体递归自我改进的基础基准》

香港中文大学与阿里巴巴联合提出PAST-Bench,首个系统评估个人AI智能体递归自我改进能力的基准。通过控制组设计隔离经验保留效应,在26个任务族上测试7个模型和4种框架,定义记忆、程序、主动信息收集和更新四维度。发现跨会话改进不均衡,并提出Hermes+框架增强机制,但效果依赖模型,通用性待验证。

一分钟读论文:《PAST-Bench:评估个人智能体递归自我改进的基础基准》

Micropaper Micropaper · 2026-08-07T00:00:00Z
DeepAmbigQA:用于基准测试大语言模型答案完整性的歧义多跳问题

本文介绍了DEEPAMBIGQA数据集,用于评估大语言模型在开放域问答中处理歧义多跳问题的能力。该数据集包含3600个问题,其中一半涉及名称歧义消解。实验显示,即使先进的GPT-5模型在歧义问题上精确匹配率仅0.13,非歧义问题为0.21,表明现有系统在答案完整性上仍有不足,需更稳健的QA模型。

DeepAmbigQA:用于基准测试大语言模型答案完整性的歧义多跳问题

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-06T00:00:00Z
首个面向LLM的蛋白突变排序标准化评测基准!哈佛大学团队提出PG-LLM,一次性测评13款主流模型+95种专业模型

哈佛大学等团队提出PG-LLM基准测试,首次统一评估13款通用语言模型与95种专业蛋白质预测工具。结果显示,Claude Opus 5等通用模型在蛋白突变排序上超越半数专业工具,但落后于顶尖模型VenusREM。研究揭示通用模型随推理资源增加性能提升有限,且对候选集规模敏感,为蛋白质工程工具选择与融合提供新思路。

首个面向LLM的蛋白突变排序标准化评测基准!哈佛大学团队提出PG-LLM,一次性测评13款主流模型+95种专业模型

HyperAI超神经 HyperAI超神经 · 2026-08-05T12:43:03Z
Avi Vallarapu:调优PostgreSQL HOT更新——一项HammerDB基准测试

本文主要讨论了人工智能在医疗领域的应用现状与前景,包括AI辅助诊断、药物研发、个性化治疗等方向,并分析了技术挑战与伦理问题。

Avi Vallarapu:调优PostgreSQL HOT更新——一项HammerDB基准测试

Planet PostgreSQL Planet PostgreSQL · 2026-08-05T09:12:04Z
阿里巴巴Qwen3.8-Max反响:“披着开源外衣的API商业模式”

阿里巴巴发布Qwen3.8-Max,2.4万亿参数多模态模型,支持百万token上下文,采用稀疏专家和混合注意力架构,并承诺下周开源权重。专家质疑其自评基准可信度,强调需外部验证和稳健测试框架。模型在自主编码和长任务执行上表现突出,但成本、安全及实际采用率仍是关键考量。

阿里巴巴Qwen3.8-Max反响:“披着开源外衣的API商业模式”

The New Stack The New Stack · 2026-08-04T14:47:35Z
英伟达NOOA框架:让AI代理成为一个Python类

英伟达发布NOOA框架,将AI代理定义为单一Python类,整合能力、状态和提示,旨在解决代理开发碎片化问题。专家认为这提升可读性和可维护性,但担忧代码与概率行为难区分、安全风险集中及扩展性挑战。NOOA在基准测试中表现优异,成本减半,英伟达强调开源研究对AI未来至关重要。

英伟达NOOA框架:让AI代理成为一个Python类

The New Stack The New Stack · 2026-08-04T14:02:35Z
Kodee的Kotlin综述:生日祝福、Shipaton 2026与新的Kotlin AI基准测试

Kotlin迎来15周年,社区可参与庆祝活动。RevenueCat Shipaton 2026邀请开发者用Kotlin Multiplatform构建应用,争夺奖项。Kotlin发布首个AI编码代理基准测试,并推出2.4.10版本及2.4.20-Beta2。Kotlin支持登陆BlueJ教育平台,X应用已完全用Kotlin重写。此外,Golden Kodee奖项揭晓,KMP库Ktor、Koin和Kermit获推荐。

Kodee的Kotlin综述:生日祝福、Shipaton 2026与新的Kotlin AI基准测试

The JetBrains Blog The JetBrains Blog · 2026-08-04T08:14:27Z
DeepSeek的小型模型刚刚超越了自家旗舰模型

DeepSeek发布V4-Flash-0731公开测试版,通过后训练提升智能体性能,未改架构。模型总参数2840亿,激活130亿,小于V4-Pro,但基准测试超越后者。支持MIT许可、Responses API及Codex集成,可自托管,降低推理成本,体现小模型通过优化追赶大模型的趋势。

DeepSeek的小型模型刚刚超越了自家旗舰模型

The New Stack The New Stack · 2026-08-03T13:32:15Z
一分钟读论文:《ORCA-bench:语言模型 Agent 准备好应对 On-Call 了吗?》

论文提出ORCA-bench,一个生产保真度的根因分析基准测试,用真实微服务系统评估语言模型Agent。在1,079个任务中,最佳模型中等难度准确率仅25.3%,困难任务仅10.0%,且移除源代码访问会降低性能。测试床含六天遥测数据,结果经专家验证,但真实系统更复杂,实际表现可能更差。

一分钟读论文:《ORCA-bench:语言模型 Agent 准备好应对 On-Call 了吗?》

Micropaper Micropaper · 2026-08-01T00:00:00Z
GPT-5.6 Sol打开两个设置:ARC-AGI-3评分从7.8%翻三倍38.3%

OpenAI发现GPT-5.6 Sol在ARC-AGI-3基准测试中得分低,源于官方框架丢弃推理和滚动截断,而非模型能力不足。启用推理保留和上下文压缩后,得分从7.8%升至38.3%,输出token减少六倍。这揭示基准测试测的是框架记忆管理,而非模型智商,建议评估应使用更贴近实际场景的设置。

GPT-5.6 Sol打开两个设置:ARC-AGI-3评分从7.8%翻三倍38.3%

极道 极道 · 2026-07-30T06:56:00Z

页面加载失败,建议刷新或返回上一页。

如何启用两个设置使我们在ARC-AGI-3基准测试中的得分提高了三倍

OpenAI OpenAI · 2026-07-29T15:00:00Z

PetaPerl 0.6.8发布,兼容Perl 5.44,提升速度并附带基准测试套件。新增DBI支持,可连接PostgreSQL、MySQL等数据库,无需安装驱动。引入守护进程,通过fork跳过重复编译,显著加速模块加载。修复模块搜索路径问题,改进文档翻译。项目坚持跟随Perl 5,不扩展语法,未来探索GPU和微控制器编程。

移动目标 - PetaPerl 0.6.8

blogs.perl.org blogs.perl.org · 2026-07-27T01:29:02Z
Geekbench 7将更严苛地考验你的电脑或手机,带来更精准的基准测试

Primate Labs发布Geekbench 7基准测试工具,外观与6代相似,但采用更大数据集和新增音视频编解码测试,多核测试更贴近真实软件行为。Pro版售价99美元,8月6日前优惠至79美元。分数与6代不兼容,需重新测试。

Geekbench 7将更严苛地考验你的电脑或手机,带来更精准的基准测试

The Verge The Verge · 2026-07-23T17:00:00Z
美国阿贡实验室提出ChemGraph,13项基准测试评估Agent在计算化学领域价值

美国阿贡国家实验室团队开发了由大语言模型驱动的智能体系统ChemGraph,用于自动化计算化学分子模拟工作流。该系统结合图神经网络和LLM,支持从分子结构生成到热化学计算等任务。在13项基准测试中,多智能体架构显著提升性能,使小模型(如GPT-4o-mini)准确率从40%提升至87%,甚至超过单智能体GPT-4o的83%,展示了AI自动化科研的潜力。

美国阿贡实验室提出ChemGraph,13项基准测试评估Agent在计算化学领域价值

HyperAI超神经 HyperAI超神经 · 2026-07-23T09:25:34Z
谷歌发布三款新Gemini模型,但并非众人期待的那款。

谷歌发布三款新Gemini模型:3.6 Flash(更便宜高效,编码性能提升)、3.5 Flash-Lite(低成本高吞吐)和3.5 Flash Cyber(网络安全专用,仅限政府试点)。但旗舰3.5 Pro延迟发布,仍在测试中。新模型在基准测试中表现优于前代,但落后于部分竞品,价格竞争复杂。

谷歌发布三款新Gemini模型,但并非众人期待的那款。

The New Stack The New Stack · 2026-07-21T15:00:52Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码