➡️
继续阅读
-
大模型不只是预测下一个词:RLVR让它自己跟自己下棋
大模型不再仅依赖预测下一个词,通过RLVR强化学习,它能自主探索解题路径,从模仿者转变为探索者。预训练如同背诵课文,而RLVR则类似自我解题,借助可验证奖...
-
DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维K...
-
Kimi K3 模型结构(3):序列维度,Gated MLA 与 3:1 混合
本文介绍Kimi K3模型结构:采用3:1混合,每四层含一层Gated MLA(无位置编码、满秩sigmoid门),其余为KDA层。MLA低秩压缩KV至5...
-
最值得买的顶级公路车?TREK 八代 Madone 评测
TREK Madone八代公路车评测:作者认为其综合性能最佳,兼具独特造型与舒适性,踩踏体验无与伦比,操控精准,虽气动性一般但制造工艺均衡,售后终身质保服...
-
从AI代码到可信软件:工程约束的实践
文章探讨了“工程约束”如何通过仓库强制执行标准,确保AI生成代码的质量与问责。它强调权限、质量门、证据和可观测性,并描述了从辅助到自主的成熟度阶段。核心是...
-
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
星尘智能发布SmoothRL框架,解决真实机器人异步执行中的在线强化学习问题。该框架仅对实际执行的动作进行学习,并保持训练与部署节奏一致。在投掷、戴笔帽、...