内容提要
云知声发布U2-Flash,率先交出国产RSI早期答卷。该模型采用稀疏MoE架构,总参数266B、单次仅激活约10B,速度提升2.1倍,能力反超上一代U2。其核心是后训练闭环:自主生成任务、异步Agent RL、多教师在线策略蒸馏,让模型参与生成数据、分析轨迹乃至维护训练系统,已显露L3级自我改进特征。
延伸解读
Flash定位的突破:更快更省,能力反超
通常Flash模型是旗舰的平替,速度更快、成本更低,但能力会有所妥协。U2-Flash却打破了这一惯例:相比上一代U2,生成速度提升2.1倍,Agent任务完成时间缩短35%,任务迭代步数和Token消耗降低20%至30%,同时能力反超U2,部分表现甚至进入万亿参数级模型区间。这得益于稀疏MoE架构,总参数266B但单次仅激活约10B,实现了高智能密度。
后训练闭环:模型如何参与自我改进
U2-Flash的核心是后训练闭环,包含三个关键机制:自主任务生成,动态产生近10万道高质量SWE任务,解决“练什么”;异步Agent RL,通过多Worker并行执行,单位时间有效训练轨迹提升约60%,解决长任务“怎么练”;多教师在线策略蒸馏,由专项教师模型逐Token打分,使达到同等能力所需训练步数减少约55%。闭环还延伸至训练系统维护,故障平均恢复时间缩短至人工介入的三分之一左右。
RSI分级下的位置:显露L3特征
RSI(递归自我改进)尚无行业统一定义,但上海交大、清华等机构提出的L1-L5路线图提供了参考。按此分级,U2-Flash已显露L3特征:它仍在人工设定的沙盒、规则和授权边界内运行,但开始参与决定下一版自己该学什么。这与OpenAI和Anthropic的判断相呼应——真正的分水岭在于一次改进能否沉淀下来、进入下一轮,再推动新的改进。
国产算力适配:长期运行的关键
越往L3之后走,模型越需要反复生成数据、执行任务、接受训练和重新验证,对算力、推理框架和集群调度要求越高。U2-Flash强调对国产算力的适配,已围绕主流国产算力平台对模型架构、核心算子、推理框架和集群调度进行优化,实际服务中吞吐、时延、并发和集群扩展效率持续提升,部分场景已接近NVIDIA GPU方案。这关系到自我迭代体系能否稳定、可控地长期运行。
Q&A
云知声U2-Flash模型的主要特点是什么?
U2-Flash采用稀疏MoE架构,总参数约266B,单次推理仅激活约10B参数。相比上一代U2,生成速度提升2.1倍,Agent任务完成时间缩短35%,任务迭代步数和Token消耗降低20%至30%,同时能力反超U2,在代码、Agent等任务上表现接近万亿参数级模型。
U2-Flash的后训练闭环包含哪些关键机制?
后训练闭环包含三个关键机制:自主任务生成,动态生成适合当前能力的训练任务;异步Agent RL,通过多Worker并行执行加速训练;多教师在线策略蒸馏,由专项教师模型对学生模型轨迹进行细粒度评分。
U2-Flash在实测中表现如何?
在实测中,U2-Flash能自主发现并修复代码问题,7分6秒找出全部三个埋藏问题;在环境混乱时,3分32秒锁定故障并修复,测试从1项补到7项;处理14份文件、四种格式的512K长上下文任务,8分36秒完成交付,准确更新了日期和成绩数据。
U2-Flash的API定价和免费额度是怎样的?
U2-Flash当前限时六折,输入价格0.6元/百万Tokens,输出价格1.2元/百万Tokens,缓存命中价格0.12元/百万Tokens。2025年9月15日至9月30日,用户可免费领取1亿Tokens使用额度。
RSI是什么?U2-Flash在RSI分级中处于什么水平?
RSI(递归自我改进)指模型参与改进下一代自身。根据上海交大等机构提出的L1-L5分级,U2-Flash已显露L3特征:在人工设定的沙盒和规则边界内,开始参与决定下一版自己该学什么。
U2-Flash如何适配国产算力?
U2-Flash围绕主流国产算力平台,对模型架构、核心算子、推理框架和集群调度进行了适配优化。实际服务中,在国产平台上的吞吐、时延、并发和集群扩展效率持续提升,部分场景已接近NVIDIA GPU方案。