小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
DeepSeek-V4.1 模型结构(7):输入端与优化器

DeepSeek-V4.1在主干外有两处改动。视觉端:自研DeepSeek-ViT从零训练,采用2D-RoPE、RMSNorm、SwiGLU,经3×3 pixel-unshuffle将token数除以9,再投影到5120维;1302×1302图像占994个位置,文本与图像token各用一套MoE负载均衡偏置。优化器端:head-wise Muon按注意力头分别正交化query权重;Sinkhorn-balanced update以行列交替归一化替代Adam二阶动量,仅存一份动量即可训练196B参数的Engram表。

DeepSeek-V4.1 模型结构(7):输入端与优化器

Java不加糖's Blog Java不加糖's Blog · 2026-10-02T13:10:00Z
DeepSeek-V4 模型结构(6):优化器与稳定性,Muon

DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大值。RMS匹配对齐AdamW,部分参数仍用AdamW。Q/KV归一化替代QK-Clip防logit爆炸,Anticipatory Routing打断MoE路由正反馈,MTP预测多token,训练配方含32T token等细节。

DeepSeek-V4 模型结构(6):优化器与稳定性,Muon

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T20:00:00Z
Kimi K3 模型结构(6):输入端与零件,MoonViT-V2、MTP、Per-Head Muon

Kimi K3模型采用从零训练的MoonViT-V2视觉编码器,27层、patch14结构,支持高分辨率图像token化;MTP层预训练后微调为EAGLE-3投机解码draft模型;Per-Head Muon优化器按头正交化动量矩阵,提升训练稳定性。词表大小163840,采用稠密层设计,强调结构选择对系统设计的影响。

Kimi K3 模型结构(6):输入端与零件,MoonViT-V2、MTP、Per-Head Muon

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T16:00:00Z

在文章《Muon优化器指南:快速上手与关键细节》中,我们罗列了Muon的几个版本,它们的区别是学习率的矩阵形状相关的缩放因子不同,其中“官方版(KellerJordan版)”只比“MuP版”多出...

为什么官方版Muon比MuP版多出一个max(1, ⋅)?

科学空间|Scientific Spaces 科学空间|Scientific Spaces · 2026-06-03T07:19:00Z
DeepSeek-V4——迈向百万token上下文:保留V3的MoE和多token预测机制,提出混合注意力机制(CSA/HCA)、流形约束超连接mHC(替代残差)、Muon优化器(取代AdamW)

DeepSeek-V4系列模型推出了1.6T和284B参数的两个版本,采用混合注意力架构和流形约束超连接,提升了长上下文处理效率。通过Muon优化器和多项基础设施优化,模型在训练和推理阶段展现出更高的稳定性和效率。预训练后,DeepSeek-V4在多个基准测试中超越前代,设立了新的性能标准。

DeepSeek-V4——迈向百万token上下文:保留V3的MoE和多token预测机制,提出混合注意力机制(CSA/HCA)、流形约束超连接mHC(替代残差)、Muon优化器(取代AdamW)

结构之法 算法之道 结构之法 算法之道 · 2026-05-03T15:54:48Z

经过《基于流式幂迭代的Muon实现:1. 初识》、《基于流式幂迭代的Muon实现:2. 加速》和《基于流式幂迭代的Muon实现:3. 雕琢》三篇文章,想必大家已经对流式幂迭代(Streaming...

基于流式幂迭代的Muon实现:4. 原理

科学空间|Scientific Spaces 科学空间|Scientific Spaces · 2026-04-13T15:03:00Z

回顾前两篇文章《基于流式幂迭代的Muon实现:1. 初识》和《基于流式幂迭代的Muon实现:2. 加速》,我们引入了Muon的流式幂迭代(Streaming Power Iteration)实现...

基于流式幂迭代的Muon实现:3. 雕琢

科学空间|Scientific Spaces 科学空间|Scientific Spaces · 2026-04-07T07:41:00Z

自去年提出的Muon优化器已在多个训练框架中应用,表现优异。本文介绍了从Adam切换到Muon的技术细节,包括不同版本的参数设置和注意事项。Muon专注于矩阵参数优化,用户需了解输入输出维度的定义以确保正确使用。

Muon优化器指南:快速上手与关键细节

科学空间|Scientific Spaces 科学空间|Scientific Spaces · 2025-11-19T15:08:00Z

Muon Linux 是一款基于 Debian 的轻量级发行版,专为老旧硬件设计,提供高效、稳定的使用体验。它具有简化的配置流程和低资源占用的桌面环境,兼容 Debian 软件仓库,便于用户快速上手和优化系统。

Muon Linux:轻量级 Debian 衍生版的全面技术指南

极客技术博客’s Blog 极客技术博客’s Blog · 2025-11-18T10:00:11Z
Gram空间流形Muon

本文探讨了Muon优化器的变体,提出通过放宽Gram矩阵约束设计多种流形约束优化器。Muon优化器通过正交化权重更新改善条件数,而流形Muon进一步将权重限制在特定几何形状上。研究表明,放宽约束可以在保持良好条件的同时提升优化器的灵活性和收敛速度。

Gram空间流形Muon

Nathan Chen Nathan Chen · 2025-10-13T00:00:00Z

四个月前,我们发布了Moonlight,在16B的MoE模型上验证了Muon优化器的有效性。在Moonlight中,我们确认了给Muon添加Weight Decay的必要性,同时提出了通过Upd...

QK-Clip:让Muon在Scaleup之路上更进一步

科学空间|Scientific Spaces 科学空间|Scientific Spaces · 2025-07-12T06:07:00Z

机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。

Muon作者仅用一篇博客,就被OpenAI看中了

机器之心 机器之心 · 2025-06-16T05:17:31Z
Moonshot AI 推出 Muon 和 Moonlight:利用高效训练技术优化大规模语言模型

Muon优化器通过权重衰减和一致的RMS更新,提高了大规模语言模型的稳定性和效率,降低了计算成本。Moonlight模型表现优异,超越同类,支持多语言处理,推动高效训练方法的探索。

Moonshot AI 推出 Muon 和 Moonlight:利用高效训练技术优化大规模语言模型

实时互动网 实时互动网 · 2025-02-26T02:48:03Z
开源赛道太挤了!月之暗面开源新版Muon优化器

月之暗面开源了改进版Muon优化器,计算效率提升2倍,优于AdamW。新模型Moonlight在相同预算下表现更佳,支持大规模训练,无需调整超参数。

开源赛道太挤了!月之暗面开源新版Muon优化器

机器之心 机器之心 · 2025-02-24T05:21:30Z

月之暗面团队改进了OpenAI的Muon优化器,使算力需求降低48%。新版本适用于更大模型,并验证了在分布式训练中的可行性。改进包括引入权重衰减和调整参数更新尺度,提升了训练效率和性能。

月之暗面开源改进版Muon优化器,算力需求比AdamW锐减48%,DeepSeek也适用

量子位 量子位 · 2025-02-23T09:31:33Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码