➡️
继续阅读
-
DeepSeek-V4.1 模型结构(2):序列维度(中),CSA2 的三种模式
DeepSeek-V4.1 的 CSA2 通过跨层共享压缩全局 KV,将 KV cache 从每 token 5.41 条降至 2.5 条。每层全局注意力...
-
知识库的结构:素材、流程、案例三分
该文本仅为付费阅读和登录提示,无实质文章内容,无法总结。
-
DeepSeek-V4.1 模型结构(8):KV cache 的管理与 SWA Bounded Replay
DeepSeek-V4.1为降低长上下文agent负载成本,将滑窗KV从SSD移至主机内存池,仅保留几分钟;全局KV仍存SSD至少72小时。滑窗KV丢失后...
-
DeepSeek-V4.1 模型结构(7):输入端与优化器
DeepSeek-V4.1在主干外有两处改动。视觉端:自研DeepSeek-ViT从零训练,采用2D-RoPE、RMSNorm、SwiGLU,经3×3 p...
-
DeepSeek-V4.1 模型结构(6):解码,DSpark
DeepSeek-V4.1 的 DSpark 是在主干模型后挂载的三层草稿模块,一次前向生成 5 个草稿 token:Markov head 补充 tok...
-
DeepSeek-V4.1 模型结构(5):记忆,Engram
DeepSeek-V4.1 在第1、14层引入 Engram 条件记忆:按 token 的 2/3/4-gram 哈希查表,用中国剩余定理以 8 个头区分...