➡️
继续阅读
-
Kimi K3 模型结构(6):输入端与零件,MoonViT-V2、MTP、Per-Head Muon
Kimi K3模型采用从零训练的MoonViT-V2视觉编码器,27层、patch14结构,支持高分辨率图像token化;MTP层预训练后微调为EAGLE...
-
海信在IFA 2026展示V AIOS系统及AI陪伴套件
海信在IFA 2026展示“陪伴式生活”愿景,推出V AIOS系统及AI陪伴套件,该系统基于感知、思考、沟通、执行四大能力,应用于烹饪、洗护及空气能源管理...
-
迅策科技发布TokenCloud一站式AI模型训推算力平台
迅策科技发布TokenCloud一站式AI模型训推算力平台,以异构算力为基础,构建四层协同生态,打通数据到Token全链路。平台支持GPU、NPU等统一调...
-
DeepSeek-V4 模型结构(3):序列维度(下),HCA、混合排布与零件
本文详解DeepSeek-V4模型结构:HCA将128个token压缩为一条目,无需稀疏选择;CSA与HCA交错排布,确保全局信息不丢失;滑窗分支弥补压缩...
-
DeepSeek-V4 模型结构(2):序列维度(中),Lightning Indexer 与稀疏选择
本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning ...
-
DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维K...