文章探讨了AI模型评测中“框架工程”(harness)的关键作用。以GPT-6 Astra为例,同一模型在不同评测框架下得分差异显著(62.7%对98.6%),且成本更低,表明框架选择对性能与费用影响巨大,甚至比模型选择更重要。目前,OpenAI、Anthropic等公司已将框架产品化,Nvidia也自建框架。未来,构建框架将比挑选模型更为关键。
Anthropic发布Fable 5.1和Mythos 5.1模型,性能提升且缓存读取价格降低75%。Fable 5.1在科学基准测试中大幅进步,安全防护干预减少,并推出零数据保留的Enterprise Frontier Safeguards,同时加强防蒸馏措施,检测API开放给欧盟合规机构。
阿里巴巴达摩院与宾夕法尼亚大学合作提出了一种新的编码Agent基础模型中期训练方法FIM Mid-Training。该方法通过自监督学习,利用从GitHub抽取的2.6B token数据,增强模型对函数调用的理解。实验结果表明,模型在多个基准测试中显著提升了性能,并有效缓解了工具调用微调对编码能力的负面影响。
本文探讨了长上下文处理的挑战,提出了自反程序搜索框架(SRLM),通过不确定性自反增强编程交互。SRLM利用自一致性、推理轨迹长度和语言信心等信号评估上下文交互程序,实验表明SRLM在多种基准数据集上表现优于现有模型,提升达22%。研究发现,递归并非RLM性能的主要驱动因素,自反程序搜索在短长上下文中均表现出一致的优势。
研究表明,当前编码基准测试存在“意义差距”,即基准分数与模型实际性能之间的差异。基准测试通常只反映特定任务的能力,而非全面的编码能力。为改善评估,建议使用更广泛的基准套件,并强调持续维护和多样化任务的重要性,以更准确地反映模型的真实表现。
本文探讨了在本地运行生成模型进行编码的可行性,分析了影响模型性能的因素,如内存、处理器核心、模型参数和推理能力。尽管小型模型在工具调用上存在困难,但Qwen3.6 35B MoE模型在能力、速度和内存占用方面表现最佳。总体而言,当前模型仍需改进,尚未实现简单的“即插即用”体验。
文章讨论了现代AI代理的构建理念,指出以2024年的思维方式构建代理是错误的。随着模型在长期任务上的改进,过度的代理协调可能会降低模型性能。2026年的竞争优势在于信息检索与独特数据的结合,以及端到端的评估。You.com是一款利用AI的搜索和生产力引擎,帮助企业获取信息和自动化复杂任务。
八个主流大语言模型在解答同一道概率题时表现出显著的思维路径差异。GLM 5.2表现自信,修正较少;而DeepSeek V4 Pro则频繁自我怀疑,思维过程复杂。可视化树状图显示了模型的认知风格,指出自我怀疑与模型性能之间的关系尚不明确,需进一步研究。
Weblica(网络复制)是一个构建可重复和可扩展网络环境的框架,旨在解决视觉网络代理训练数据的规模化问题。该框架通过HTTP级缓存捕捉稳定的视觉状态,并利用基于真实网站的环境合成来扩展强化学习训练。Weblica-8B模型在多个网络导航基准测试中表现优异,推理步骤更少,且在计算资源增加时表现良好。
近年来,人工智能的发展逐渐从算法创新转向数据质量驱动。合成数据成为重要支撑,Meta的Autodata框架通过智能体模拟数据科学家,生成高质量训练数据,显著提升模型性能,展示了合成数据生成的新范式。
DeepSeek V4正式版将于下月上线,尽管高峰时段价格上涨,但仍被认为便宜。公司正在建设数据中心以应对算力需求,并计划优化模型性能。用户反馈主要集中在幻觉率高、上下文稳定性差和复杂代码任务表现不足等问题,期待模型在能力、价格和速度等方面进一步提升。
Elastic DevRel团队在2026年6月的通讯中介绍了新发布的jina-embeddings-v5-omni模型。该模型支持文本、图像、音频和视频的跨模态搜索,允许用户通过单一查询检索不同类型的媒体。模型在多个基准测试中表现优异,特别是在视频片段检索方面,展现了高效性和准确性,并与Elasticsearch兼容,便于用户集成和使用。
Andrej Karpathy发布了名为autoresearch的开源Python工具,允许AI代理在GPU上自动进行实验。该工具通过编辑代码、训练模型和评估结果,发现了20个有效的改进,显著提升了模型性能。autoresearch的设计使AI能够在固定时间预算内进行科学实验,优化训练效率,展示了AI在细节调整方面的潜力。
研究团队提出了一种名为“步骤拒绝微调”(SRFT)的方法,以提高大型语言模型(LLM)在复杂任务中的学习效率。SRFT通过“评论者”模型分析失败轨迹,标记有害步骤,保留有用的正确步骤,从而显著提升模型性能,证明失败的尝试也能为学习提供重要信息。
文章讨论了通过优化目标函数(LFD)高效开发产品的方法。作者指出传统目标设定方法的缺陷,强调盲测和迭代优化对提升模型性能的重要性。经过多轮测试,agent在不作弊的情况下显著提高了结果准确性。此外,信息不对称被认为是构建竞争优势的关键,建议开发者关注真实评估集和用户反馈,以加速产品迭代。
复旦大学与通义实验室联合提出ToolCUA,旨在优化计算机使用代理(CUA)在GUI与工具调用之间的选择。研究表明,直接连接工具未能提升模型性能,反而导致准确率下降。ToolCUA通过生成混合轨迹数据,帮助模型学习何时使用GUI或工具,从而提高任务执行效率。在OSWorld-MCP上的评测结果显示,ToolCUA取得46.85%的准确率,显著优于其他模型,展示了其在复杂任务中的有效性和灵活性。
后训练是一个复杂的数据流水线,包含多个阶段,如SFT、奖励模型和策略优化。每个阶段旨在将预训练模型转变为更符合人类指令和偏好的模型。SFT主要调整回答格式,奖励模型提供训练信号,策略优化提升生成候选的能力。评测确保模型的安全性和准确性,整体流程强调数据回流和持续优化,以提升模型性能和可靠性。
文章讨论了如何高效消耗AI模型Claude Code的token。作者建议通过打开Claude Code窗口,逐一总结项目源码,并生成架构分析报告,以此提高token的使用效率。
联邦学习中,平衡模型性能、数据隐私和通信开销是一大挑战。清华大学等研究团队提出了基于表征纠缠的框架FedRE,能够有效保护隐私并降低通信成本,同时适应模型异构场景。FedRE通过融合不同类别的表征生成纠缠表征,上传至服务器训练全局分类器,从而显著提升模型性能和隐私保护能力。
斯坦福大学的《人工智能指数报告》显示,美国与中国在AI模型性能的差距缩小至2.7%。尽管美国在投资和数据中心数量上占优,中国通过效率优化和丰富的应用场景实现了快速追赶。中国在工业机器人和AI论文引用方面领先,开源模型也受到全球开发者的青睐。未来AI竞争将侧重于生态体系的构建与应用场景的拓展。
完成下面两步后,将自动完成登录并继续当前操作。