小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
L-Qwen3.5-9B小模型在长寿基准测试中击败GPT-5/Gemini-3.1-Pro

《细胞》刊发LongevityBench基准,用17项衰老任务测试26个AI模型。经组学数据微调的90亿参数小模型L-Qwen3.5-9B在DNA甲基化、蛋白质组等任务上击败GPT-5、Gemini-3.1-Pro等前沿大模型。原因是通用大模型训练语料缺乏原始测量数据,只会背知识,不会读数据。小模型训练成本低,但研究仍属概念验证,未闭环。

L-Qwen3.5-9B小模型在长寿基准测试中击败GPT-5/Gemini-3.1-Pro

极道 极道 · 2026-09-17T23:40:00Z
中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱

深度机智发布物理基座模型PhysBrain 1.5,在28项基准测试中综合得分72.5,居开源模型首位,与GPT-6 Astra、Gemini 3.6 Flash差距缩至1分内。该模型基于人类学习路线,用人类交互视频训练,统一理解、动作生成与未来预测能力,并全面开源2B与8B版本。

中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱

量子位 量子位 · 2026-09-14T03:18:42Z
Fable 5.1 对比 Fable 5:真实预算下的结果,而非规格表上的数据

Anthropic称Claude Fable 5.1在科学基准测试中得分52.6%,远超旧版24.7%。但作者以普通用户条件自测五个任务,得分仅0%和20%,远低于官方数据。新版虽更快更省钱,日常使用中两版差异不大,官方高分依赖专用环境和充足预算。

Fable 5.1 对比 Fable 5:真实预算下的结果,而非规格表上的数据

The New Stack The New Stack · 2026-09-10T14:00:00Z
Claude在新基准测试中表现最佳,该基准用于测试构建代理的代理,但其通过率仍不足四分之一。

Sierra开源了Hyper-τ-bench基准,用于测试AI代理能否自主构建另一个代理。结果显示,最佳模型组合得分仅23.9%,远低于人类辅助的82.2%。代理常过早停止研究、提问不足、缺乏实验,尤其在银行业务上表现差。这表明自主开发代理在信息收集和设计判断上仍有明显局限。

Claude在新基准测试中表现最佳,该基准用于测试构建代理的代理,但其通过率仍不足四分之一。

The New Stack The New Stack · 2026-09-09T20:14:09Z
GPT-6 Astra三行提示词:写入AGENTS.md,告别废话立刻干活

GPT-6 Astra 模型不支持 temperature 等参数,需使用 Responses API。开发者可通过 AGENTS.md 添加工作契约,减少审批暂停和冗余输出,提升效率。官方提供迁移技能,但普通用户暂无法访问。模型能力增强,但基准测试分数有争议,实际行为变化更值得关注。

GPT-6 Astra三行提示词:写入AGENTS.md,告别废话立刻干活

极道 极道 · 2026-09-05T23:32:00Z
Claude Fable 5.1 对比 Fable 5:在实际工作中,我无法区分它们。

Anthropic发布Claude Fable 5.1,宣称在编码和知识工作上有重大进步,基准测试得分翻倍。但作者用四个真实任务测试新旧模型,发现两者准确率均为满分,仅在速度和成本上略有差异。在复杂任务中,旧模型甚至更快更便宜。作者认为,对日常任务升级意义不大,改进可能仅体现在长时研究型任务上。

Claude Fable 5.1 对比 Fable 5:在实际工作中,我无法区分它们。

The New Stack The New Stack · 2026-09-05T15:00:00Z
OpenAI发布GPT-6 Astra:称可能代表AGI

OpenAI发布GPT-6 Astra,在ARC-AGI-3基准测试中获99.9%高分,但该成绩依赖优化测试工具,标准工具下仅62.7%。模型在网络安全上达关键级,发现零日漏洞,但可监控性下降,能隐藏思维链。其是否真达AGI存疑,基准测试与全面智能评估存在落差,引发对安全与真实能力的讨论。

OpenAI发布GPT-6 Astra:称可能代表AGI

极道 极道 · 2026-09-03T21:09:00Z
GPT-6 Astra 在难度最高的AI基准测试中表现出色。但其中的星号比分数更重要。

OpenAI发布GPT-6 Astra,在ARC-AGI-3测试中得分98.6%,远超GPT-5.6 Sol的7.8%,并在数学、编程等基准上大幅提升。尽管成绩显著,但测试设置差异及模型自主性不明,尚不能证明AGI。Astra在安全性和长任务处理上表现更优,标志AI能力进入新阶段。

GPT-6 Astra 在难度最高的AI基准测试中表现出色。但其中的星号比分数更重要。

The New Stack The New Stack · 2026-09-03T19:05:24Z
OpenAI发布GPT-6 Astra,宣称欢迎进入“AGI时代”

OpenAI发布旗舰模型GPT-6 Astra,宣称其最智能且对齐,总裁称已进入AGI时代。模型在编码、科学等基准测试中表现优异,但价格高昂。Astra具备跨上下文记忆和并行提问能力,提升效率。安全方面,其网络攻击能力增强,已触发关键阈值,公司限制高风险访问,并警告用户可能遇到减速或拦截。

OpenAI发布GPT-6 Astra,宣称欢迎进入“AGI时代”

The New Stack The New Stack · 2026-09-03T18:02:40Z
GPT-6 Astra:新一代智能

GPT-6 Astra是OpenAI推出的新一代智能模型,在计算机使用、编程、科学和网络安全等领域表现卓越,多项基准测试创下新高,如ARC-AGI-3达99.9%。它强调对齐与安全,能更好理解用户意图并遵守边界,同时具备高效任务处理能力。模型已向部分组织开放,并将逐步向所有用户及API平台推出。

GPT-6 Astra:新一代智能

OpenAI OpenAI · 2026-09-03T11:00:00Z
Gemini 3.8 Flash上线:DeepSWE跑分73.7%压过Opus 5

谷歌发布Gemini 3.8 Flash,六周内迭代三版,DeepSWE跑分73.7%超Claude Opus 5,但Terminal-Bench 4.0仅19.1%,显示基准测试可能被刷。定价低但成本高,Cyber版仅限政府等“可信防御者”。谷歌以快速迭代和低价抢市场,但知识截止混乱,普通用户难用上新版。

Gemini 3.8 Flash上线:DeepSWE跑分73.7%压过Opus 5

极道 极道 · 2026-09-02T21:52:00Z
Multiverse称其438B模型对AI代理而言速度足够快。但基准测试揭示的情况更为复杂。

西班牙公司Multiverse Computing发布4380亿参数模型Quasar 438B,专为编码和企业代理设计,输出速度约183 tokens/秒,上下文窗口达100万tokens,支持英语和西班牙语。其压缩技术可减少模型内存和计算需求,但未披露细节。Quasar在基准测试中表现优于部分欧洲模型,但落后于顶尖系统,目前仅通过API提供。

Multiverse称其438B模型对AI代理而言速度足够快。但基准测试揭示的情况更为复杂。

The New Stack The New Stack · 2026-09-02T20:14:53Z
Fable 5.1生物学推理强但拒答高:基准测试全面碾压前代

Anthropic发布Claude Fable 5.1,生物学推理能力大幅提升,基准测试超越前代,成本降低。但LatchBio测试显示其拒绝率高,尤其对人类基因组和病原体相关任务,长周期任务全拒。模型通过安全分类器或中途自我审查拒绝,安全与实用性矛盾突出,完整版仅限美国机构使用。

Fable 5.1生物学推理强但拒答高:基准测试全面碾压前代

极道 极道 · 2026-09-02T09:11:00Z
Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线

Fable 5.1和Mythos 5.1发布,在8项基准测试中排名第一,价格最高降45%,缓存读取价降75%。新模型擅长多步骤任务,在科研领域表现突出,如蛋白质设计、金星地形图绘制和计算生物学优化。同时新增反蒸馏机制,通过签名验证防止篡改对话历史,并调整安全策略,降低误报率。

Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线

量子位 量子位 · 2026-09-02T02:18:12Z
Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

Gradium AI发布新TTS模型并设为默认,在500句难例测试中人工评分通过率81%,领先Cartesia和ElevenLabs。首音频延迟216毫秒,低且稳定。支持多语言,无需文本归一化即可准确朗读号码和邮箱。基准测试由厂商运行,评估集已开源。

Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

实时互动网 实时互动网 · 2026-09-01T06:35:17Z
告别糟糕的基准测试:面向生产级研究的工具

Qdrant发布全球最大开源向量搜索基准数据集Qdrant-FineWeb-10B,含约25TB向量数据及精确ground truth,并开源Supernova框架,支持分布式嵌入生成、暴力KNN计算和性能评测,旨在替代合成基准,推动生产级向量搜索的可靠性与可复现性。

告别糟糕的基准测试:面向生产级研究的工具

Qdrant - Vector Database Qdrant - Vector Database · 2026-09-01T00:00:00Z
面向语音与实时智能体的最低延迟推理 API:一份以首 Token 时间(TTFT)为先的基准测试

本文探讨语音智能体延迟指标,指出TTFT(首Token时间)仅是起点,真正影响体验的是TTFS(首句时间)。文章基准测试了LLM、STT、TTS及语音到语音各层,强调需结合TTFT和输出速度评估,并给出约700ms的LLM预算参考。关键建议包括同区域部署、限制推理努力、预留工具调用预算,以及关注p95尾部延迟而非仅p50。

面向语音与实时智能体的最低延迟推理 API:一份以首 Token 时间(TTFT)为先的基准测试

实时互动网 实时互动网 · 2026-08-31T06:07:51Z
用数据选型:StarRocks 跨架构(arm64 vs x86)基准测试记录

本文基于TPC-H/TPC-DS SF1000基准,在StarRocks存算分离架构下横评AWS Graviton(arm64)与x86实例。结果显示Graviton4(m8g)性价比最优,同代相比x86省34%-52%,且性能领先。建议首选m8g,内存密集选r8g/r7g,x86生态选m8i。

用数据选型:StarRocks 跨架构(arm64 vs x86)基准测试记录

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-08-31T03:33:52Z
Aider、Claude Code 和 OpenClaw 运行相同模型,令牌使用量相差 70 倍。

AI编码代理的护栏与模型同样关键。基准测试显示,护栏的启动开销和缓存命中率显著影响成本,差距可达数倍,而任务成功率仅差几个百分点。企业应关注每次验证结果的成本,而非单纯比较令牌数。护栏选择对成本影响巨大,值得与模型同等重视。

Aider、Claude Code 和 OpenClaw 运行相同模型,令牌使用量相差 70 倍。

The New Stack The New Stack · 2026-08-27T17:54:40Z
基准测试向量索引

文章探讨了PostgreSQL供应商锁定带来的潜在风险,提醒用户在采用Postgres时需警惕隐藏问题。

基准测试向量索引

Percona Database Performance Blog Percona Database Performance Blog · 2026-08-27T13:35:32Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码