➡️
继续阅读
-
DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维K...
-
Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA
本文介绍Kimi K3模型中KDA(Kimi Delta Attention)的递推形式,从线性注意力、DeltaNet到Gated DeltaNet演进...
-
数据并行与 ZeRO:三级分片各省多少
本文介绍数据并行与ZeRO优化技术。ZeRO通过三级分片(优化器状态、梯度、权重)减少显存占用,前两级不增通信量,第三级需额外all-gather。ZeR...
-
流水线并行:1F1B、虚拟段与气泡
本文介绍流水线并行中气泡的产生与优化。将模型按层切段、批次分微批后,段间等待形成气泡。四代调度各改一点:GPipe先全前向再全反向,显存高;1F1B改交替...
-
在实地录音中探索全球
Earth Garden是一款基于Freesound环境音频的互动应用,灵感源自Radio Garden,让用户通过旋转地球聆听全球各地的实地录音,如海浪...
-
并行策略总览:六个维度各切什么、怎么通信
本文介绍大模型并行训练的核心概念,将DP、TP、SP、PP、EP、CP六种并行方式按切分维度、显存减少、通信开销和等待关系列表对比。并行本质是切分模型并引...