➡️
继续阅读
-
Claude Fable 5.1 对比 Fable 5:在实际工作中,我无法区分它们。
Anthropic发布Claude Fable 5.1,宣称在编码和知识工作上有重大进步,基准测试得分翻倍。但作者用四个真实任务测试新旧模型,发现两者准确...
-
Kimi K3 模型结构(9):显存,把 2.8T 塞进 GPU
本文详解Kimi K3模型训练中的显存优化策略,通过账本形式分析权重、激活等内存占用,并介绍六项关键技术:均衡PP rank激活、统一激活管理器、MoE反...
-
DeepSeek-V4 模型结构(7):结构决定系统
DeepSeek-V4模型采用混合压缩注意力(mHC),将KV缓存分为状态缓存和分页缓存,分别管理滑窗KV与压缩条目。上下文并行通过点对点通信和all-g...
-
DeepSeek-V4 模型结构(6):优化器与稳定性,Muon
DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大...
-
Kimi K3 模型结构(8):训练并行,一步训练里谁在等谁
本文介绍Kimi K3模型预训练的并行系统设计,聚焦MoE层expert并行。核心是MoonEP方案:每个rank预留E/R个冗余expert槽位,确保任...
-
DeepSeek-V4 模型结构(5):宽度维度,DeepSeekMoE 的四个改动
本文介绍DeepSeek-V4模型结构中MoE层的四处改动:路由打分从sigmoid改为sqrt(softplus)以消除饱和;前三层用固定hash ro...