论文指出终端代码智能体后训练的瓶颈在于可执行环境而非轨迹数量。Terminal-Universe框架从已有轨迹中重建37.3k个环境,通过回放文件操作和补全缺失部分,并扩展单轮及多轮任务。SFT后,Terminal-Bench提升11.9分,EvoCode-Bench多轮提升13.8分,显示环境是可持续生成任务的关键资产。
星尘智能发布SmoothRL框架,解决真实机器人异步执行中的在线强化学习问题。该框架仅对实际执行的动作进行学习,并保持训练与部署节奏一致。在投掷、戴笔帽、开箱等任务中,成功率显著提升,动作更平滑,展示了在线后训练对修正基础策略偏差的价值。
自变量公司发布灵巧操作系统TwinDex,其核心创新在于后训练阶段无需真机遥操数据,仅用几百条无本体数据即可完成精细操作,如化学实验中的旋拧瓶盖、注射器推注等。TwinDex采用三指九自由度设计,强调数据采集与执行端的一致性,提升采集效率5.3倍,旨在降低对真机数据的依赖,推动无本体数据规模化应用。
GLM-5.3发布,基座未变但后训练大幅提升编程能力,代码干净、长任务执行强,Token效率高。但存在死循环耗资源、通用智能弱、无原生视觉等短板。定位为需人类明确指令的强力执行者,适合已理解的任务,不适合探索性工作。
智谱AI发布GLM-5.3,基座与5.2相同,仅靠后训练将编程分数提升六倍,并意外涌现网络安全能力,引发刷榜争议。模型效率高,成本低于闭源对手,但真实水平待开源验证,闭源巨头实力成谜。
智谱发布GLM-5.3编程模型,参数7000亿,通过后训练提升性能,编程能力比肩Fable 5和GPT-5.6 Sol,网络安全表现突出。开源后训练框架Slime,支持多系列模型。实测3D网页生成效果良好,但细节待优化。模型已上线Zcode等平台,API下周开放,权重两周内开源。
DeepSeek发布V4-Flash-0731公开测试版,通过后训练提升智能体性能,未改架构。模型总参数2840亿,激活130亿,小于V4-Pro,但基准测试超越后者。支持MIT许可、Responses API及Codex集成,可自托管,降低推理成本,体现小模型通过优化追赶大模型的趋势。
该论文系统研究了基础模型智能体在多轮长程规划中的能力获取机制,覆盖预训练、后训练及多教师整合全生命周期。通过构建可控规划实验平台,发现世界模型内部化能显著提升长程泛化能力,RL后训练存在适用边界,多教师蒸馏中模式兼容性比单一性能更重要。
后训练正成为AI前沿,Kimi K3方案将其拆为三阶段:高质量SFT冷启动、单任务强化学习训练九大专家、多教师同策略蒸馏融合。系统用部分轨迹回滚处理长任务,分离能力发现与融合,使模型兼具多领域专长,决定实际战斗力上限。
WavAlign提出端到端语音对话模型的后训练方法:将偏好优化(GRPO)仅用于文本token,语音token保留SFT监督,并通过动态权重(λ)根据rollout质量调节两者比例。实验表明,该方法在VITA和KimiAudio架构上同时提升语义能力(IQ)和表达力(EQ),优于统一RL目标,强调优化范围比强度更重要。
NVIDIA Vera Rubin平台通过优化后训练工作流程,提高了智能每美元的效率。后训练阶段使模型在变化环境中持续学习,旨在最大化每次前向和后向传递的收益。该平台支持大规模并行处理,降低了每个令牌的成本,提升了模型的整体价值。
后训练是调整预训练模型以实现特定目标的方法,包括预训练、监督微调、奖励建模、策略优化和评测。风格对齐关注表达方式,能力激发关注任务成功率。RLHF通过人类偏好优化助手行为,DPO简化为离线分类损失,RLVR通过可验证奖励提升推理能力。
后训练是一个复杂的数据流水线,包含多个阶段,如SFT、奖励模型和策略优化。每个阶段旨在将预训练模型转变为更符合人类指令和偏好的模型。SFT主要调整回答格式,奖励模型提供训练信号,策略优化提升生成候选的能力。评测确保模型的安全性和准确性,整体流程强调数据回流和持续优化,以提升模型性能和可靠性。
本文讨论了在真实世界中部署通用机器人策略的挑战,提出了一种名为“部署中学习”(LWD)的框架,通过车队规模的离线到在线强化学习(RL)实现策略的持续改进。该方法结合离线数据和在线交互,利用多样化的部署经验,优化策略以适应新任务和环境。作者提出的分布式隐式价值学习(DIVL)和带有伴随匹配的Q学习(QAM)技术,旨在提高策略的稳定性和泛化能力,实现高效的后训练。
DeepSeek-V4技术通过架构创新和后训练优化,显著提升了长上下文处理能力。其混合注意力机制和流形约束超连接提高了效率与稳定性。后训练阶段采用专家培养与全词表蒸馏,增强了Coding Agent的能力,提升了编程任务表现,标志着在长上下文与智能体能力结合上的重要进展。
人工智能(AI)是识别模式、学习数据并生成有用输出的软件。大型语言模型(LLM)专注于语言,通过大量文本学习生成和转换文本。AI模型分为预训练和后训练阶段,后者强调安全性和可靠性。用户可根据需求选择合适的模型。
大模型训练的关键在于后训练阶段,包括指令遵循、评测和奖励等,这些因素直接影响用户体验。预训练是基础,但后续的训练流程和数据配置更决定模型的实际能力。模型优化不仅依赖参数,还需考虑系统架构和反馈机制。
作者通过后训练提升Agent性能,构建A股投资Agent时发现小模型工具调用和推理能力不足,随后用SFT和GRPO训练7B模型,通过NGRPO方法将测试准确率提升至85%,接近DeepSeek-Chat水平。文章还讨论了调试工具和训练框架(如verl)的使用体验。
与做Agent的朋友交流后,发现主Agent需维护状态机以追踪环境和行为,但常遇到指令遵从和状态记忆丢失的问题。考虑通过后训练让模型学习状态机描述,以提升决策效率。在开发辅助A股投资的Agent时,发现多轮交互难以处理,需要更好的调试工具。最终通过后训练提升了模型表现,体验了后训练的过程。
与做Agent的朋友交流后,发现主Agent需维护状态机以追踪环境状态,但常遇到指令遵循和状态记忆丢失的问题。考虑通过后训练让模型学习状态机描述,以提升决策效率。在开发辅助A股投资的Agent时,发现多轮交互处理困难,需要更好的调试工具。最终通过后训练提升了模型表现,获得了完整的训练体验。
完成下面两步后,将自动完成登录并继续当前操作。