➡️
继续阅读
-
语言辨别提升多语言语音模型中的语言学习能力
多语言自监督语音模型在相同预训练数据量下逊于单语模型。在英法HuBERT实验中,通过加入辅助语言分类器或按语言k-means目标强化语言辨别能力,音素辨别...
-
DeepSeek-V4.1 模型结构(8):KV cache 的管理与 SWA Bounded Replay
DeepSeek-V4.1为降低长上下文agent负载成本,将滑窗KV从SSD移至主机内存池,仅保留几分钟;全局KV仍存SSD至少72小时。滑窗KV丢失后...
-
DeepSeek-V4.1 模型结构(7):输入端与优化器
DeepSeek-V4.1在主干外有两处改动。视觉端:自研DeepSeek-ViT从零训练,采用2D-RoPE、RMSNorm、SwiGLU,经3×3 p...
-
DeepSeek-V4.1 模型结构(6):解码,DSpark
DeepSeek-V4.1 的 DSpark 是在主干模型后挂载的三层草稿模块,一次前向生成 5 个草稿 token:Markov head 补充 tok...
-
DeepSeek-V4.1 模型结构(5):记忆,Engram
DeepSeek-V4.1 在第1、14层引入 Engram 条件记忆:按 token 的 2/3/4-gram 哈希查表,用中国剩余定理以 8 个头区分...
-
DeepSeek-V4.1 模型结构(4):深度维度,Single-Pass mHC
文章分析 DeepSeek-V4.1 的 Single-Pass mHC 优化:mHC 开销主要在访存而非计算,下界为 (2n+2)d,V4 实现达两倍。...