➡️
继续阅读
-
DeepSeek采购160000颗华为AI芯片:专攻推理不碰训练
DeepSeek计划采购16万颗华为昇腾950DT芯片,用于内蒙古乌兰察布数据中心的推理任务,而非训练,订单约25.6亿美元。此举旨在降低成本、规避美国管...
-
Kimi K3 模型结构(8):训练并行,一步训练里谁在等谁
本文介绍Kimi K3模型预训练的并行系统设计,聚焦MoE层expert并行。核心是MoonEP方案:每个rank预留E/R个冗余expert槽位,确保任...
-
DeepSeek-V4 模型结构(5):宽度维度,DeepSeekMoE 的四个改动
本文介绍DeepSeek-V4模型结构中MoE层的四处改动:路由打分从sigmoid改为sqrt(softplus)以消除饱和;前三层用固定hash ro...
-
Kimi K3 模型结构(5):宽度维度,Stable LatentMoE
Kimi K3模型采用Stable LatentMoE作为FFN,基于NVIDIA LatentMoE改进,将输入压缩至半宽latent空间,增加RMSN...
-
谷歌浏览器还有隐藏小技能:遇到HSTS网站无法加载时 键盘盲打thisisunsafe即可加载
#软件资讯 谷歌浏览器还有个隐藏小技能:遇到 HSTS 网站无法加载时,通过键盘盲打 thisisunsafe 即可加载。部分网站已经设置 HSTS 严格...
-
B站首届AI创造公开赛收官,超八成参赛者为一人团队
B站首届AI创造公开赛落幕,总奖金143万元,吸引超3万投稿。UP主W博士与AI猫娘凭《猫娘计划》获一等奖100万奖金。参赛者多为非专业开发者,超八成是一...