小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
一分钟读论文:《同一份权重,换个接口就从不会调工具变成 0.96 分》

香港城市大学研究发现,Agent评测中的工具调用率受“模型加接口栈”整体影响,接口错配会静默丢弃调用,导致分数失真。实验显示,仅更换接口配置,同一模型分数可从0.00变至0.96。机制上,单独修改模板或解析器无效,需两者匹配。此问题也影响训练信号,但修复接口仅恢复测量,不提升模型能力。

一分钟读论文:《同一份权重,换个接口就从不会调工具变成 0.96 分》

Micropaper Micropaper · 2026-09-04T00:00:00Z
免费无限!GPT-5.6 Luna向所有用户开放文字聊天

OpenAI向所有免费用户开放GPT-5.6 Luna无限文字聊天,但模型能力弱于付费版Sol,且需手动点击Think按钮才能深度思考。此举实为用低成本模型换取用户日常对话数据,免费用户成为模型训练的众包测试员,看似福利实则分级供应,无限不等于优质。

免费无限!GPT-5.6 Luna向所有用户开放文字聊天

极道 极道 · 2026-08-06T21:49:00Z
关于 Agent 的几个判断

作者认为通用Agent将主导市场,少数赢家通吃,垂直Agent难有空间。插件生态比开源更重要,模型能力是核心护城河,用户忠诚度低。前期产品重在教育用户,个人开发者应转向Agent插件机会。普通用户应尽早使用Agent提升效率,管理能力将更关键,Mac是理想工具。

关于 Agent 的几个判断

宝玉的分享 宝玉的分享 · 2026-07-28T00:00:00Z
Opus 5 砍掉超 80% 系统提示词,我们用 AI 的方式也该变了 |附指南

Claude Code团队删减了超过80%的系统提示词,因新模型能力更强,无需过多规则。建议减少绝对规则,用清晰工具说明替代示例,按需加载内容,避免重复要求,让AI自动记忆,并用代码、测试等作为参考。人类应提供上下文和定义好结果,而非堆砌提示词。

Opus 5 砍掉超 80% 系统提示词,我们用 AI 的方式也该变了 |附指南

爱范儿 爱范儿 · 2026-07-27T10:05:15Z
数据集汇总丨英伟达开源Nemotron系列数据集,超10T tokens+40M 条后训练样本,覆盖数学推理/代码生成/多语言对话

训练数据在大模型竞争中至关重要,NVIDIA推出的Nemotron系列数据集强调数据质量和任务适配性,涵盖通用文本预训练、监督微调和代码生成等核心能力,推动模型训练从数量向精准转变。这些数据集为大模型研究提供系统性支持,提升模型能力。

数据集汇总丨英伟达开源Nemotron系列数据集,超10T tokens+40M 条后训练样本,覆盖数学推理/代码生成/多语言对话

HyperAI超神经 HyperAI超神经 · 2026-07-17T08:06:36Z
在编码评估中区分信号与噪声

本文讨论了SWE-bench Pro基准测试的评估问题,发现约30%的任务存在缺陷,主要包括测试过于严格、提示不明确和覆盖率低。通过人类审核和代理审查,确认了这些问题的普遍性,强调了建立高质量基准的重要性,以确保模型能力的准确评估。

在编码评估中区分信号与噪声

OpenAI OpenAI · 2026-07-08T13:00:00Z
看下chrome的内置模型

Chrome内置模型提供本地翻译和语言检测功能,无需联网,适用于Windows 10/11和macOS 13+,需22GB以上磁盘空间。该模型可用于社交网络翻译,提升用户体验,未来期待支持中文及增强模型能力。

看下chrome的内置模型

Nicksxs's Blog Nicksxs's Blog · 2026-07-05T12:52:32Z
Fable 5回归24小时差评如潮!跑分大降,拒答问题,还偷偷骂用户

Fable 5回归后遭遇用户吐槽,因安全机制频繁拦截正常请求,导致用户体验差。开发者发现请求过于简单,转交给低版本处理。用户对账单不满,认为付费未得到相应服务,反映出模型能力与产品体验之间的矛盾。整体来看,Fable 5的护栏设置过于严格,影响了实际表现。

Fable 5回归24小时差评如潮!跑分大降,拒答问题,还偷偷骂用户

量子位 量子位 · 2026-07-03T12:17:37Z
AA榜单反转真相解析:DeepSeek幻觉率96%垫底,但写代码强过Minimax

DeepSeek V4 Pro的幻觉率高达96%,但在编程方面表现出色。Minimax M3以16%的低幻觉率显示出更好的自我认知能力。高幻觉率并不意味着模型能力差,而是由于过度自信导致的错误。这表明在不同任务中选择合适的模型至关重要。

AA榜单反转真相解析:DeepSeek幻觉率96%垫底,但写代码强过Minimax

极道 极道 · 2026-07-01T23:04:00Z
实测Claude史上最强模型Fable 5,普通人慎用

Anthropic推出Claude Fable 5和Mythos 5,其中Fable 5面向公众,Mythos 5仅限特定机构。Fable 5在软件工程、知识工作和视觉理解等方面表现优异,但自6月23日起将按token计费,用户需关注使用成本。尽管模型能力显著提升,但高强度任务的费用可能成为普通用户的负担,影响AI的普惠性。

实测Claude史上最强模型Fable 5,普通人慎用

爱范儿 爱范儿 · 2026-06-10T06:31:17Z
2026 年主流 AI 对话式 API 的性能和价格评测对比

2026年,AI对话式API成为智能应用的基础。文章比较了主流API的延迟、模型能力和价格,推荐了OpenAI、豆包和通义等方案,强调实时语音对话的低延迟和合规性。选择时需考虑场景需求和成本优化策略。

2026 年主流 AI 对话式 API 的性能和价格评测对比

实时互动网 实时互动网 · 2026-05-28T01:22:00Z
DeepSeek网页版大升级!随后宕机11小时崩上热搜,新模型真的来了

DeepSeek网页版经历11小时宕机后,用户反馈模型能力显著提升。新版本DeepSeek-V3稳定性增强,知识截止更新至2026年1月。服务恢复后仍有小问题,但整体表现令人期待。

DeepSeek网页版大升级!随后宕机11小时崩上热搜,新模型真的来了

量子位 量子位 · 2026-03-30T03:33:58Z
让 AI 自己进化自己:深入 HyperAgents

Meta于2026年开源HyperAgents,采用“Agent训练Agent”的方法实现AI自我进化。通过meta-agent观察task-agent表现,自动生成代码补丁,经过多代迭代,准确率显著提升。该框架支持多种任务场景,强调模型能力对进化效果的重要性,展示了AI自我改进的潜力与挑战。

让 AI 自己进化自己:深入 HyperAgents

乱世浮生 乱世浮生 · 2026-03-29T23:07:11Z
通用Agent能搞定购物吗?

通用Agent在电商购物中面临两个主要瓶颈:模型能力不足和数据孤岛问题。解决方案包括垂直Agent与A2A协议或UI Agent,但后者可能影响平台利益。

通用Agent能搞定购物吗?

SKYue's Home SKYue's Home · 2026-03-21T08:22:00Z

通用Agent在购物场景中面临模型能力不足和电商平台数据孤岛的问题。解决方案包括推出垂直Agent与A2A协议,或通过UI Agent绕过限制,但后者可能遭遇商业阻力。购物平台的多样性将使Agent时代的购物形式更加丰富。

通用Agent能搞定购物吗?

SKYue's Home SKYue's Home · 2026-03-21T08:22:00Z
构建 Claude Code 的经验教训:以 Agent 的视角看世界

构建Agent框架时,操作集合的设计至关重要,需要在工具数量与决策能力之间取得平衡。Claude通过工具调用执行操作,需观察模型能力以匹配合适工具。开发过程中,逐步探索和渐进式信息披露是关键,以确保模型有效使用工具。

构建 Claude Code 的经验教训:以 Agent 的视角看世界

Teach Talk Teach Talk · 2026-03-09T01:37:48Z
MAI-UI - A GUI-centric agent framework supporting models ranging from 2B to 235B to build …

文章讨论了MAI-UI智能体框架,该框架以图形界面为中心,支持从小型到超大规模模型(2B至235B)的交互体验,旨在将基础模型能力应用于真实世界任务,提供设备与云的协同、事件感知和多模态输入支持。

MAI-UI - A GUI-centric agent framework supporting models ranging from 2B to 235B to build …

云原生 云原生 · 2026-01-09T09:51:26Z
针对哪种模型的评估?语音模型评估的分类法

本文提出了一种统一的分类法,用于评估语音模型,解决不同模型在语音处理中的评估需求。该分类法定义了三个维度:评估方面、模型能力和任务要求。通过将现有评估与模型能力和方法论需求相匹配,提供了选择和解释语音模型评估的框架,并揭示了未来基准设计的优先领域。

针对哪种模型的评估?语音模型评估的分类法

Apple Machine Learning Research Apple Machine Learning Research · 2026-01-09T00:00:00Z

到2025年,国产AI编程工具迅速发展,逐步实现模型能力的追平、开放集成和端到端落地。AI不仅能生成代码,还能理解任务和验证结果,替代重复劳动,提升全栈能力。未来开发者需关注系统设计和不可替代的核心能力。

AI 编程 2025 总结:国产模型“能力追平”,国产编程工具还在“情感陪伴”

phodal phodal · 2025-12-30T08:25:12Z
MCP的重大变革:为何AI引导将取代API包装器

MCP生态系统面临变革,单一的包装器无法满足需求。随着模型能力的提升,错误的工程决策风险加大。解决方案在于嵌入判断力,AI引导将教会模型思考,而非仅提供工具。通过结构化推理和经验知识,pg-aiguide等工具能有效提升模型的工程标准,避免技术债务的产生。

MCP的重大变革:为何AI引导将取代API包装器

Timescale Blog Timescale Blog · 2025-11-25T15:49:22Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码