➡️
继续阅读
-
AI 智创简报:《Agent 记忆层被写进专利,垂直行业的本地化长尾还空着》
微软与UiPath近期公开了四项Agent记忆与跨上下文专利,涵盖共享上下文、事件流路由及三级记忆体系,显示大厂正抢占记忆层基础设施。尽管开源组件热门,但...
-
DeepSeek-V4 模型结构(2):序列维度(中),Lightning Indexer 与稀疏选择
本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning ...
-
DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维K...
-
DeepSeek-V4 模型结构(0):一张图看懂 DeepSeek-V4
本文介绍DeepSeek-V4模型架构:Pro版总参数1.6T、61层,Flash版284B、43层,均采用4条残差流、交错CSA/HCA压缩注意力与Mo...
-
CD销量激增,实体媒体持续复兴
According to the Recording Industry Association of America (RIAA), CD sales e...
-
Kimi K3 模型结构(7):结构决定系统
本文总结Kimi K3模型结构对训练与推理系统的影响。KDA采用三种执行形态(FlashKDA、设备内上下文并行、状态回滚)处理固定大小状态;上下文并行通...