➡️
继续阅读
-
把Agent放进真实尺度香港,上交大/新加坡国立大学/美团等提出UrbanGround,测试多模态模型城市探索能力
该文章介绍了一项关于多模态大语言模型(MLLM)在城市导航中能力的研究。研究团队构建了基于香港真实地理数据的URBANGROUND交互环境,评测了GPT-...
-
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
星尘智能发布SmoothRL框架,解决真实机器人异步执行中的在线强化学习问题。该框架仅对实际执行的动作进行学习,并保持训练与部署节奏一致。在投掷、戴笔帽、...
-
DeepSeek-V4 模型结构(6):优化器与稳定性,Muon
DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大...
-
Kimi K3 模型结构(8):训练并行,一步训练里谁在等谁
本文介绍Kimi K3模型预训练的并行系统设计,聚焦MoE层expert并行。核心是MoonEP方案:每个rank预留E/R个冗余expert槽位,确保任...
-
DeepSeek-V4 模型结构(5):宽度维度,DeepSeekMoE 的四个改动
本文介绍DeepSeek-V4模型结构中MoE层的四处改动:路由打分从sigmoid改为sqrt(softplus)以消除饱和;前三层用固定hash ro...
-
DeepSeek-V4 模型结构(4):深度维度,mHC
该文详解DeepSeek-V4的mHC残差结构:将单条残差流拓宽为4条,通过读、写、混三算子连接子层。为保稳定,混合矩阵被约束为双随机矩阵(非负、行和列和...