➡️
继续阅读
-
Kimi K3 模型结构(4):深度维度,Attention Residuals
本文解析Kimi K3模型中的Attention Residuals(注意力残差)结构。该机制将残差连接视为深度方向上的RNN,通过可学习伪query对e...
-
数据并行与 ZeRO:三级分片各省多少
本文介绍数据并行与ZeRO优化技术。ZeRO通过三级分片(优化器状态、梯度、权重)减少显存占用,前两级不增通信量,第三级需额外all-gather。ZeR...
-
结构化应用数据的Dataclasses
本文介绍Python dataclass如何替代易出错的配置字典,构建结构化、可维护的数据模型。涵盖组合嵌套记录、用default_factory处理可变...
-
机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理
星尘智能发布SmoothRL框架,解决真实机器人异步执行中的在线强化学习问题。该框架仅对实际执行的动作进行学习,并保持训练与部署节奏一致。在投掷、戴笔帽、...
-
金融AI的年度大考交卷了:2万名选手、30+家机构、百亿级数据开源
AFAC 2026金融AI大赛在上海举办,吸引全球5027支队伍参赛。赛事聚焦真实金融场景,设置交易行为识别、复杂文档还原、稀疏反馈实验和长文本Agent...
-
流水线并行:1F1B、虚拟段与气泡
本文介绍流水线并行中气泡的产生与优化。将模型按层切段、批次分微批后,段间等待形成气泡。四代调度各改一点:GPipe先全前向再全反向,显存高;1F1B改交替...