➡️
继续阅读
-
DeepSeek-V4 模型结构(5):宽度维度,DeepSeekMoE 的四个改动
本文介绍DeepSeek-V4模型结构中MoE层的四处改动:路由打分从sigmoid改为sqrt(softplus)以消除饱和;前三层用固定hash ro...
-
DeepSeek采购160000颗华为AI芯片:专攻推理不碰训练
DeepSeek计划采购16万颗华为昇腾950DT芯片,用于内蒙古乌兰察布数据中心的推理任务,而非训练,订单约25.6亿美元。此举旨在降低成本、规避美国管...
-
Kimi K3 模型结构(8):训练并行,一步训练里谁在等谁
本文介绍Kimi K3模型预训练的并行系统设计,聚焦MoE层expert并行。核心是MoonEP方案:每个rank预留E/R个冗余expert槽位,确保任...
-
GPT-6带火循环Transformer,阿里早已布局
阿里团队针对循环Transformer的计算冗余问题,提出两篇论文:MeSH通过动态记忆缓冲和路由器解决循环空转,提升零样本准确率;SpiralForme...
-
CEO的1元年薪起源 - 编程一生
本文介绍了多个商业现象的起源:手机系统更新导致变慢源于安迪-比尔定理,即软件消耗硬件提升;CEO拿1元年薪始于克莱斯勒和乔布斯,象征共渡难关;公司延迟上市...
-
又当了一回网络工程师,找到满速断网问题
搬家后宽带频繁断网,尤其在高速下载或看高清视频时。排查发现路由器、运营商均无问题,最终确定是墙内埋设的网线故障。将设备移至弱电箱后问题解决,网速提升一倍。...