小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
OpenAI会卖给你Astra,但不会卖给你在ARC-AGI-3上得分98.6%的那套系统

文章探讨了AI模型评测中“框架工程”(harness)的关键作用。以GPT-6 Astra为例,同一模型在不同评测框架下得分差异显著(62.7%对98.6%),且成本更低,表明框架选择对性能与费用影响巨大,甚至比模型选择更重要。目前,OpenAI、Anthropic等公司已将框架产品化,Nvidia也自建框架。未来,构建框架将比挑选模型更为关键。

OpenAI会卖给你Astra,但不会卖给你在ARC-AGI-3上得分98.6%的那套系统

The New Stack The New Stack · 2026-09-04T15:25:17Z
Anthropic的Fable 5.1更便宜、更智能,拒绝次数大幅减少

Anthropic发布Fable 5.1和Mythos 5.1模型,性能提升且缓存读取价格降低75%。Fable 5.1在科学基准测试中大幅进步,安全防护干预减少,并推出零数据保留的Enterprise Frontier Safeguards,同时加强防蒸馏措施,检测API开放给欧盟合规机构。

Anthropic的Fable 5.1更便宜、更智能,拒绝次数大幅减少

The New Stack The New Stack · 2026-09-01T19:38:32Z
一分钟读论文:《Function-Aware Fill-in-the-Middle 作为编码 Agent 基础模型的中期训练》

阿里巴巴达摩院与宾夕法尼亚大学合作提出了一种新的编码Agent基础模型中期训练方法FIM Mid-Training。该方法通过自监督学习,利用从GitHub抽取的2.6B token数据,增强模型对函数调用的理解。实验结果表明,模型在多个基准测试中显著提升了性能,并有效缓解了工具调用微调对编码能力的负面影响。

一分钟读论文:《Function-Aware Fill-in-the-Middle 作为编码 Agent 基础模型的中期训练》

Micropaper Micropaper · 2026-07-15T00:00:00Z
递归语言模型与不确定性相遇:自反程序搜索在长上下文中的惊人有效性

本文探讨了长上下文处理的挑战,提出了自反程序搜索框架(SRLM),通过不确定性自反增强编程交互。SRLM利用自一致性、推理轨迹长度和语言信心等信号评估上下文交互程序,实验表明SRLM在多种基准数据集上表现优于现有模型,提升达22%。研究发现,递归并非RLM性能的主要驱动因素,自反程序搜索在短长上下文中均表现出一致的优势。

递归语言模型与不确定性相遇:自反程序搜索在长上下文中的惊人有效性

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-09T00:00:00Z
基准测试的意义差距

研究表明,当前编码基准测试存在“意义差距”,即基准分数与模型实际性能之间的差异。基准测试通常只反映特定任务的能力,而非全面的编码能力。为改善评估,建议使用更广泛的基准套件,并强调持续维护和多样化任务的重要性,以更准确地反映模型的真实表现。

基准测试的意义差距

The JetBrains Blog The JetBrains Blog · 2026-07-07T13:10:00Z
本地模型在编码中的可行性

本文探讨了在本地运行生成模型进行编码的可行性,分析了影响模型性能的因素,如内存、处理器核心、模型参数和推理能力。尽管小型模型在工具调用上存在困难,但Qwen3.6 35B MoE模型在能力、速度和内存占用方面表现最佳。总体而言,当前模型仍需改进,尚未实现简单的“即插即用”体验。

本地模型在编码中的可行性

Martin Fowler Martin Fowler · 2026-07-07T12:34:00Z
代理协调已经过时

文章讨论了现代AI代理的构建理念,指出以2024年的思维方式构建代理是错误的。随着模型在长期任务上的改进,过度的代理协调可能会降低模型性能。2026年的竞争优势在于信息检索与独特数据的结合,以及端到端的评估。You.com是一款利用AI的搜索和生产力引擎,帮助企业获取信息和自动化复杂任务。

代理协调已经过时

Stack Overflow Blog Stack Overflow Blog · 2026-07-07T07:40:00Z
八大开源模型推理路径对比:GLM DeepSeek Qwen

八个主流大语言模型在解答同一道概率题时表现出显著的思维路径差异。GLM 5.2表现自信,修正较少;而DeepSeek V4 Pro则频繁自我怀疑,思维过程复杂。可视化树状图显示了模型的认知风格,指出自我怀疑与模型性能之间的关系尚不明确,需进一步研究。

八大开源模型推理路径对比:GLM DeepSeek Qwen

极道 极道 · 2026-07-07T02:58:00Z
Weblica:可扩展和可重复的视觉网络代理训练环境

Weblica(网络复制)是一个构建可重复和可扩展网络环境的框架,旨在解决视觉网络代理训练数据的规模化问题。该框架通过HTTP级缓存捕捉稳定的视觉状态,并利用基于真实网站的环境合成来扩展强化学习训练。Weblica-8B模型在多个网络导航基准测试中表现优异,推理步骤更少,且在计算资源增加时表现良好。

Weblica:可扩展和可重复的视觉网络代理训练环境

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-07T00:00:00Z
Meta提出AI数据科学家,Autodata构建高质量训练/评测数据集

近年来,人工智能的发展逐渐从算法创新转向数据质量驱动。合成数据成为重要支撑,Meta的Autodata框架通过智能体模拟数据科学家,生成高质量训练数据,显著提升模型性能,展示了合成数据生成的新范式。

Meta提出AI数据科学家,Autodata构建高质量训练/评测数据集

HyperAI超神经 HyperAI超神经 · 2026-06-30T10:31:15Z
破天荒!DeepSeek V4正式版居然要涨价,而且翻着倍地涨

DeepSeek V4正式版将于下月上线,尽管高峰时段价格上涨,但仍被认为便宜。公司正在建设数据中心以应对算力需求,并计划优化模型性能。用户反馈主要集中在幻觉率高、上下文稳定性差和复杂代码任务表现不足等问题,期待模型在能力、价格和速度等方面进一步提升。

破天荒!DeepSeek V4正式版居然要涨价,而且翻着倍地涨

量子位 量子位 · 2026-06-30T04:08:11Z
DevRel通讯 — 2026年6月

Elastic DevRel团队在2026年6月的通讯中介绍了新发布的jina-embeddings-v5-omni模型。该模型支持文本、图像、音频和视频的跨模态搜索,允许用户通过单一查询检索不同类型的媒体。模型在多个基准测试中表现优异,特别是在视频片段检索方面,展现了高效性和准确性,并与Elasticsearch兼容,便于用户集成和使用。

DevRel通讯 — 2026年6月

Elastic Blog - Elasticsearch, Kibana, and ELK Stack Elastic Blog - Elasticsearch, Kibana, and ELK Stack · 2026-06-30T00:00:00Z
如何构建一个使用autoresearch进行自主LLM实验的AI代理

Andrej Karpathy发布了名为autoresearch的开源Python工具,允许AI代理在GPU上自动进行实验。该工具通过编辑代码、训练模型和评估结果,发现了20个有效的改进,显著提升了模型性能。autoresearch的设计使AI能够在固定时间预算内进行科学实验,优化训练效率,展示了AI在细节调整方面的潜力。

如何构建一个使用autoresearch进行自主LLM实验的AI代理

freeCodeCamp.org freeCodeCamp.org · 2026-06-29T16:50:22Z
步骤拒绝微调:从嘈杂的智能体轨迹中提取更多信号

研究团队提出了一种名为“步骤拒绝微调”(SRFT)的方法,以提高大型语言模型(LLM)在复杂任务中的学习效率。SRFT通过“评论者”模型分析失败轨迹,标记有害步骤,保留有用的正确步骤,从而显著提升模型性能,证明失败的尝试也能为学习提供重要信息。

步骤拒绝微调:从嘈杂的智能体轨迹中提取更多信号

The JetBrains Blog The JetBrains Blog · 2026-06-17T08:57:24Z

文章讨论了通过优化目标函数(LFD)高效开发产品的方法。作者指出传统目标设定方法的缺陷,强调盲测和迭代优化对提升模型性能的重要性。经过多轮测试,agent在不作弊的情况下显著提高了结果准确性。此外,信息不对称被认为是构建竞争优势的关键,建议开发者关注真实评估集和用户反馈,以加速产品迭代。

【译文】/goal + 损失函数:如何用一条指令在 30 小时内蒸馏一个产品

电波障害 电波障害 · 2026-06-11T04:00:00Z
别光给Agent加Tool了,它根本选不明白!复旦×通义提出全新CUA训练范式

复旦大学与通义实验室联合提出ToolCUA,旨在优化计算机使用代理(CUA)在GUI与工具调用之间的选择。研究表明,直接连接工具未能提升模型性能,反而导致准确率下降。ToolCUA通过生成混合轨迹数据,帮助模型学习何时使用GUI或工具,从而提高任务执行效率。在OSWorld-MCP上的评测结果显示,ToolCUA取得46.85%的准确率,显著优于其他模型,展示了其在复杂任务中的有效性和灵活性。

别光给Agent加Tool了,它根本选不明白!复旦×通义提出全新CUA训练范式

量子位 量子位 · 2026-05-31T14:25:18Z

后训练是一个复杂的数据流水线,包含多个阶段,如SFT、奖励模型和策略优化。每个阶段旨在将预训练模型转变为更符合人类指令和偏好的模型。SFT主要调整回答格式,奖励模型提供训练信号,策略优化提升生成候选的能力。评测确保模型的安全性和准确性,整体流程强调数据回流和持续优化,以提升模型性能和可靠性。

【强化学习与大模型后训练】06|后训练全景:SFT → RM → RLHF → 评测

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-05-29T00:00:00Z
Claude Code 怎样快速消耗 token

文章讨论了如何高效消耗AI模型Claude Code的token。作者建议通过打开Claude Code窗口,逐一总结项目源码,并生成架构分析报告,以此提高token的使用效率。

Claude Code 怎样快速消耗 token

iMaeGoo's Blog iMaeGoo's Blog · 2026-05-21T10:30:00Z
信通院&清华提出FedRE:用「纠缠」搞定联邦学习三难困境 | CVPR 26

联邦学习中,平衡模型性能、数据隐私和通信开销是一大挑战。清华大学等研究团队提出了基于表征纠缠的框架FedRE,能够有效保护隐私并降低通信成本,同时适应模型异构场景。FedRE通过融合不同类别的表征生成纠缠表征,上传至服务器训练全局分类器,从而显著提升模型性能和隐私保护能力。

信通院&清华提出FedRE:用「纠缠」搞定联邦学习三难困境 | CVPR 26

量子位 量子位 · 2026-05-18T06:44:04Z
2.7%的裂缝:全球AI竞赛进入非对称博弈时代

斯坦福大学的《人工智能指数报告》显示,美国与中国在AI模型性能的差距缩小至2.7%。尽管美国在投资和数据中心数量上占优,中国通过效率优化和丰富的应用场景实现了快速追赶。中国在工业机器人和AI论文引用方面领先,开源模型也受到全球开发者的青睐。未来AI竞争将侧重于生态体系的构建与应用场景的拓展。

2.7%的裂缝:全球AI竞赛进入非对称博弈时代

TechWeb 全站精华 TechWeb 全站精华 · 2026-04-29T02:38:56Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码