➡️
继续阅读
-
Kimi K3 模型结构(8):训练并行,一步训练里谁在等谁
本文介绍Kimi K3模型预训练的并行系统设计,聚焦MoE层expert并行。核心是MoonEP方案:每个rank预留E/R个冗余expert槽位,确保任...
-
GPT-6带火循环Transformer,阿里早已布局
阿里团队针对循环Transformer的计算冗余问题,提出两篇论文:MeSH通过动态记忆缓冲和路由器解决循环空转,提升零样本准确率;SpiralForme...
-
结构化应用数据的Dataclasses
本文介绍Python dataclass如何替代易出错的配置字典,构建结构化、可维护的数据模型。涵盖组合嵌套记录、用default_factory处理可变...
-
Allora Labs证明变异AI模型群体性能超单个优化模型
Allora Labs研究表明,在AI模型群体中引入随机变异可提升整体性能,超越单个优化模型。变异群体在环境变化时表现更优,最佳情况下约80%优于优化群体...
-
金融AI的年度大考交卷了:2万名选手、30+家机构、百亿级数据开源
AFAC 2026金融AI大赛在上海举办,吸引全球5027支队伍参赛。赛事聚焦真实金融场景,设置交易行为识别、复杂文档还原、稀疏反馈实验和长文本Agent...
-
DeepSeek-V4 模型结构(6):优化器与稳定性,Muon
DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大...