➡️
继续阅读
-
趋境科技与摩尔线程达成战略合作,高品质 AI Token 国产异构方案性价比超越国际先进算力
趋境科技与摩尔线程达成战略合作,基于国产PD异构技术与MTT S5000智算卡,共建高品质AI Token工厂。方案已投产,性价比超越国际算力,实现超50...
-
华为慕尼黑发布WATCH GT 7系列等旗舰新品
华为在慕尼黑发布多款旗舰新品,包括WATCH GT 7系列智能手表,新增滑雪模式与健康洞察功能;WATCH 6系列重返欧洲,支持独立智慧体验;血压表D3获...
-
DeepSeek-V4 模型结构(3):序列维度(下),HCA、混合排布与零件
本文详解DeepSeek-V4模型结构:HCA将128个token压缩为一条目,无需稀疏选择;CSA与HCA交错排布,确保全局信息不丢失;滑窗分支弥补压缩...
-
DeepSeek-V4 模型结构(2):序列维度(中),Lightning Indexer 与稀疏选择
本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning ...
-
DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维K...
-
DeepSeek-V4 模型结构(0):一张图看懂 DeepSeek-V4
本文介绍DeepSeek-V4模型架构:Pro版总参数1.6T、61层,Flash版284B、43层,均采用4条残差流、交错CSA/HCA压缩注意力与Mo...