小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
一分钟读论文:《旧轨迹里挖出新环境》

论文指出终端代码智能体后训练的瓶颈在于可执行环境而非轨迹数量。Terminal-Universe框架从已有轨迹中重建37.3k个环境,通过回放文件操作和补全缺失部分,并扩展单轮及多轮任务。SFT后,Terminal-Bench提升11.9分,EvoCode-Bench多轮提升13.8分,显示环境是可持续生成任务的关键资产。

一分钟读论文:《旧轨迹里挖出新环境》

Micropaper Micropaper · 2026-09-06T00:00:00Z
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理

星尘智能发布SmoothRL框架,解决真实机器人异步执行中的在线强化学习问题。该框架仅对实际执行的动作进行学习,并保持训练与部署节奏一致。在投掷、戴笔帽、开箱等任务中,成功率显著提升,动作更平滑,展示了在线后训练对修正基础策略偏差的价值。

机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理

量子位 量子位 · 2026-09-04T09:19:29Z
今年最难的机器人Demo,“机器人含量”为0

自变量公司发布灵巧操作系统TwinDex,其核心创新在于后训练阶段无需真机遥操数据,仅用几百条无本体数据即可完成精细操作,如化学实验中的旋拧瓶盖、注射器推注等。TwinDex采用三指九自由度设计,强调数据采集与执行端的一致性,提升采集效率5.3倍,旨在降低对真机数据的依赖,推动无本体数据规模化应用。

今年最难的机器人Demo,“机器人含量”为0

量子位 量子位 · 2026-09-03T00:51:16Z
GLM-5.3实测:能写干净代码但别让它独立思考!

GLM-5.3发布,基座未变但后训练大幅提升编程能力,代码干净、长任务执行强,Token效率高。但存在死循环耗资源、通用智能弱、无原生视觉等短板。定位为需人类明确指令的强力执行者,适合已理解的任务,不适合探索性工作。

GLM-5.3实测:能写干净代码但别让它独立思考!

极道 极道 · 2026-08-17T00:03:00Z
智谱GLM-5.3后训练这么神!闭源模型手里还有牌吗?

智谱AI发布GLM-5.3,基座与5.2相同,仅靠后训练将编程分数提升六倍,并意外涌现网络安全能力,引发刷榜争议。模型效率高,成本低于闭源对手,但真实水平待开源验证,闭源巨头实力成谜。

智谱GLM-5.3后训练这么神!闭源模型手里还有牌吗?

极道 极道 · 2026-08-16T03:01:00Z
实测GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键

智谱发布GLM-5.3编程模型,参数7000亿,通过后训练提升性能,编程能力比肩Fable 5和GPT-5.6 Sol,网络安全表现突出。开源后训练框架Slime,支持多系列模型。实测3D网页生成效果良好,但细节待优化。模型已上线Zcode等平台,API下周开放,权重两周内开源。

实测GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键

爱范儿 爱范儿 · 2026-08-14T09:44:28Z
DeepSeek的小型模型刚刚超越了自家旗舰模型

DeepSeek发布V4-Flash-0731公开测试版,通过后训练提升智能体性能,未改架构。模型总参数2840亿,激活130亿,小于V4-Pro,但基准测试超越后者。支持MIT许可、Responses API及Codex集成,可自托管,降低推理成本,体现小模型通过优化追赶大模型的趋势。

DeepSeek的小型模型刚刚超越了自家旗舰模型

The New Stack The New Stack · 2026-08-03T13:32:15Z
一分钟读论文:《多轮长程规划的训练物理》

该论文系统研究了基础模型智能体在多轮长程规划中的能力获取机制,覆盖预训练、后训练及多教师整合全生命周期。通过构建可控规划实验平台,发现世界模型内部化能显著提升长程泛化能力,RL后训练存在适用边界,多教师蒸馏中模式兼容性比单一性能更重要。

一分钟读论文:《多轮长程规划的训练物理》

Micropaper Micropaper · 2026-07-31T00:00:00Z
后训练正成为真正前沿:Kimi K3九大专家蒸馏灌顶内幕

后训练正成为AI前沿,Kimi K3方案将其拆为三阶段:高质量SFT冷启动、单任务强化学习训练九大专家、多教师同策略蒸馏融合。系统用部分轨迹回滚处理长任务,分离能力发现与融合,使模型兼具多领域专长,决定实际战斗力上限。

后训练正成为真正前沿:Kimi K3九大专家蒸馏灌顶内幕

极道 极道 · 2026-07-28T09:43:00Z
论文解读|WavAlign:让语音模型既会“想”,也会“说”

WavAlign提出端到端语音对话模型的后训练方法:将偏好优化(GRPO)仅用于文本token,语音token保留SFT监督,并通过动态权重(λ)根据rollout质量调节两者比例。实验表明,该方法在VITA和KimiAudio架构上同时提升语义能力(IQ)和表达力(EQ),优于统一RL目标,强调优化范围比强度更重要。

论文解读|WavAlign:让语音模型既会“想”,也会“说”

实时互动网 实时互动网 · 2026-07-23T07:01:30Z
NVIDIA Vera Rubin平台最大化后训练工作负载中的每美元智能效率——代理人工智能的关键指标

NVIDIA Vera Rubin平台通过优化后训练工作流程,提高了智能每美元的效率。后训练阶段使模型在变化环境中持续学习,旨在最大化每次前向和后向传递的收益。该平台支持大规模并行处理,降低了每个令牌的成本,提升了模型的整体价值。

NVIDIA Vera Rubin平台最大化后训练工作负载中的每美元智能效率——代理人工智能的关键指标

NVIDIA Blog NVIDIA Blog · 2026-07-17T15:00:14Z

后训练是调整预训练模型以实现特定目标的方法,包括预训练、监督微调、奖励建模、策略优化和评测。风格对齐关注表达方式,能力激发关注任务成功率。RLHF通过人类偏好优化助手行为,DPO简化为离线分类损失,RLVR通过可验证奖励提升推理能力。

【强化学习与大模型后训练】01|系列总览:从 RL 到 LLM 后训练的地图

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-05-29T00:00:00Z

后训练是一个复杂的数据流水线,包含多个阶段,如SFT、奖励模型和策略优化。每个阶段旨在将预训练模型转变为更符合人类指令和偏好的模型。SFT主要调整回答格式,奖励模型提供训练信号,策略优化提升生成候选的能力。评测确保模型的安全性和准确性,整体流程强调数据回流和持续优化,以提升模型性能和可靠性。

【强化学习与大模型后训练】06|后训练全景:SFT → RM → RLHF → 评测

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-05-29T00:00:00Z
LWD——大规模部署中训练VLA的RL框架:结合“分布隐式价值学习”与“基于QAM的策略提取”,先离线RL预训练,后在线RL微调中跑通“部署-数据收集-训练”的持续进化循环

本文讨论了在真实世界中部署通用机器人策略的挑战,提出了一种名为“部署中学习”(LWD)的框架,通过车队规模的离线到在线强化学习(RL)实现策略的持续改进。该方法结合离线数据和在线交互,利用多样化的部署经验,优化策略以适应新任务和环境。作者提出的分布式隐式价值学习(DIVL)和带有伴随匹配的Q学习(QAM)技术,旨在提高策略的稳定性和泛化能力,实现高效的后训练。

LWD——大规模部署中训练VLA的RL框架:结合“分布隐式价值学习”与“基于QAM的策略提取”,先离线RL预训练,后在线RL微调中跑通“部署-数据收集-训练”的持续进化循环

结构之法 算法之道 结构之法 算法之道 · 2026-04-30T14:53:08Z
DeepSeek-V4 技术解析:架构革新与 Coding Agent 后训练优化

DeepSeek-V4技术通过架构创新和后训练优化,显著提升了长上下文处理能力。其混合注意力机制和流形约束超连接提高了效率与稳定性。后训练阶段采用专家培养与全词表蒸馏,增强了Coding Agent的能力,提升了编程任务表现,标志着在长上下文与智能体能力结合上的重要进展。

DeepSeek-V4 技术解析:架构革新与 Coding Agent 后训练优化

jax - 走在路上 jax - 走在路上 · 2026-04-28T12:56:00Z
人工智能基础

人工智能(AI)是识别模式、学习数据并生成有用输出的软件。大型语言模型(LLM)专注于语言,通过大量文本学习生成和转换文本。AI模型分为预训练和后训练阶段,后者强调安全性和可靠性。用户可根据需求选择合适的模型。

人工智能基础

OpenAI OpenAI · 2026-04-10T00:00:00Z
你不知道的大模型训练:原理、路径与新实践

大模型训练的关键在于后训练阶段,包括指令遵循、评测和奖励等,这些因素直接影响用户体验。预训练是基础,但后续的训练流程和数据配置更决定模型的实际能力。模型优化不仅依赖参数,还需考虑系统架构和反馈机制。

你不知道的大模型训练:原理、路径与新实践

Tw93 的博客 Tw93 的博客 · 2026-04-01T00:00:00Z
从 vibe coding agent 到后训练,从零开始的实验科学

作者通过后训练提升Agent性能,构建A股投资Agent时发现小模型工具调用和推理能力不足,随后用SFT和GRPO训练7B模型,通过NGRPO方法将测试准确率提升至85%,接近DeepSeek-Chat水平。文章还讨论了调试工具和训练框架(如verl)的使用体验。

从 vibe coding agent 到后训练,从零开始的实验科学

高策 高策 · 2026-02-15T16:00:00Z

与做Agent的朋友交流后,发现主Agent需维护状态机以追踪环境和行为,但常遇到指令遵从和状态记忆丢失的问题。考虑通过后训练让模型学习状态机描述,以提升决策效率。在开发辅助A股投资的Agent时,发现多轮交互难以处理,需要更好的调试工具。最终通过后训练提升了模型表现,体验了后训练的过程。

从 vibe coding agent 到后训练,从零开始的实验科学

高策 高策 · 2026-02-15T15:00:00Z

与做Agent的朋友交流后,发现主Agent需维护状态机以追踪环境状态,但常遇到指令遵循和状态记忆丢失的问题。考虑通过后训练让模型学习状态机描述,以提升决策效率。在开发辅助A股投资的Agent时,发现多轮交互处理困难,需要更好的调试工具。最终通过后训练提升了模型表现,获得了完整的训练体验。

从 vibe coding agent 到后训练,从零开始的实验科学

高策 高策 · 2026-02-15T15:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码