➡️
继续阅读
-
Kimi K3 模型结构(5):宽度维度,Stable LatentMoE
Kimi K3模型采用Stable LatentMoE作为FFN,基于NVIDIA LatentMoE改进,将输入压缩至半宽latent空间,增加RMSN...
-
AI时代学编程:别背语法了,学逻辑才是正经事!
AI时代学编程,重点不在背语法,而在学逻辑。文章通过实例说明,编程思维能帮人精确表达需求,避免AI误解。核心是掌握循环、条件、调试等基础概念,用结构代替模...
-
营销人员使用Genie One的五个方法
本文介绍Databricks Genie One如何赋能营销团队,将数据转化为行动。它作为AI助手,帮助营销人员绕过分析师瓶颈,直接查询活动、客户和管道数...
-
DeepSeek-V4 模型结构(3):序列维度(下),HCA、混合排布与零件
本文详解DeepSeek-V4模型结构:HCA将128个token压缩为一条目,无需稀疏选择;CSA与HCA交错排布,确保全局信息不丢失;滑窗分支弥补压缩...
-
DeepSeek-V4 模型结构(2):序列维度(中),Lightning Indexer 与稀疏选择
本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning ...
-
DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维K...