➡️
继续阅读
-
Kimi K3 模型结构(5):宽度维度,Stable LatentMoE
Kimi K3模型采用Stable LatentMoE作为FFN,基于NVIDIA LatentMoE改进,将输入压缩至半宽latent空间,增加RMSN...
-
AI时代学编程:别背语法了,学逻辑才是正经事!
AI时代学编程,重点不在背语法,而在学逻辑。文章通过实例说明,编程思维能帮人精确表达需求,避免AI误解。核心是掌握循环、条件、调试等基础概念,用结构代替模...
-
开源ThoughtDAG工作流:画布上剪一根线就能改AI答案
ThoughtDAG是一款开源、本地优先的可视化工作空间,将AI对话转化为可编辑的有向无环图。用户通过连线控制上下文,剪断线即可改变AI答案,实现精确编辑...
-
DeepSeek采购160000颗华为AI芯片:专攻推理不碰训练
DeepSeek计划采购16万颗华为昇腾950DT芯片,用于内蒙古乌兰察布数据中心的推理任务,而非训练,订单约25.6亿美元。此举旨在降低成本、规避美国管...
-
DeepSeek-V4 模型结构(7):结构决定系统
DeepSeek-V4模型采用混合压缩注意力(mHC),将KV缓存分为状态缓存和分页缓存,分别管理滑窗KV与压缩条目。上下文并行通过点对点通信和all-g...
-
DeepSeek-V4 模型结构(6):优化器与稳定性,Muon
DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大...