本文介绍Kimi K3模型在1M上下文强化学习与线上服务中的系统设计,核心是状态管理。KV块和KDA状态通过write-back策略在GPU与DRAM池间迁移,训练态让位NVMe,参考模型权重借梯度缓冲槽位流入GPU,沙箱支持pause/fork/snapshot,集群调度采用缓存亲和与预算准入,确保资源高效利用。
本文详解Kimi K3模型训练中的显存优化策略,通过账本形式分析权重、激活等内存占用,并介绍六项关键技术:均衡PP rank激活、统一激活管理器、MoE反向改写、AttnRes块复用、Pipeline ZeRO-2及P2P Muon,以显存换效率,实现2.8T参数的高效训练。
本文介绍Kimi K3模型预训练的并行系统设计,聚焦MoE层expert并行。核心是MoonEP方案:每个rank预留E/R个冗余expert槽位,确保任意router输出都能使各rank计算完全平衡,消除负载不均和动态shape问题。同时用感知负载的GEMM调度解决rank内偏斜,并将视觉编码器计算塞入流水线气泡,减少等待开销。
本文总结Kimi K3模型结构对训练与推理系统的影响。KDA采用三种执行形态(FlashKDA、设备内上下文并行、状态回滚)处理固定大小状态;上下文并行通过可结合前缀扫描分解,避免直接加和;Block AttnRes优化内存通信;Stable LatentMoE融合GEMM与token中心解码;混合架构前缀缓存解耦粒度,支持512-token边界复用;视觉编码器动态并行并填充流水线气泡。核心是将固定权重累加转为数据相关选择。
Kimi K3模型采用从零训练的MoonViT-V2视觉编码器,27层、patch14结构,支持高分辨率图像token化;MTP层预训练后微调为EAGLE-3投机解码draft模型;Per-Head Muon优化器按头正交化动量矩阵,提升训练稳定性。词表大小163840,采用稠密层设计,强调结构选择对系统设计的影响。
Kimi K3模型采用Stable LatentMoE作为FFN,基于NVIDIA LatentMoE改进,将输入压缩至半宽latent空间,增加RMSNorm稳定训练,用SiTU-GLU激活控制输出,并通过Quantile Balancing实现负载均衡。该模块占模型98%参数,每层激活16个专家,显著提升效率与性能。
本文介绍Kimi K3模型结构:采用3:1混合,每四层含一层Gated MLA(无位置编码、满秩sigmoid门),其余为KDA层。MLA低秩压缩KV至576维/token,KDA状态固定约232MB。3:1比例经实验选为质量与吞吐平衡点,1M上下文时KV cache约27.6GB,decode速度约为纯MLA的2.2倍。
本文介绍Kimi K3模型序列维度的chunkwise并行算法:将序列分块,块间递推状态、块内用矩阵乘并行计算。K3将每步log-decay加−5下界,使16-token对角tile也能用BF16矩阵乘,消除FP32逐位置对瓶颈。相比通用DPLR内核,KDA内核因结构简化速度快约一倍。训练和prefill用chunkwise形式,decode用递推形式。
本文介绍Kimi K3模型中KDA(Kimi Delta Attention)的递推形式,从线性注意力、DeltaNet到Gated DeltaNet演进而来。KDA通过逐通道衰减和擦除写入机制更新状态,每头128×128矩阵,不依赖上下文长度。它采用逐头RMSNorm和满秩sigmoid输出门,在合成任务中表现优于基线,并天然具备位置编码能力。
本文解析Kimi K3模型中的Attention Residuals(注意力残差)结构。该机制将残差连接视为深度方向上的RNN,通过可学习伪query对embedding及各层输出做softmax加权,替代固定求和。K3采用Block形式,将93层分为8块,块内普通求和,块间注意力聚合,共9个来源。相比普通残差,此设计提升多步推理能力,降低输出幅度增长,并支持高效两阶段推理。
Kimi K3是2.78T参数、104.2B激活的93层MoE模型,支持1M上下文及图像视频输入。其结构创新分三方面:序列用KDA与Gated MLA混合,深度引入Attention Residuals,宽度采用Stable LatentMoE,并配视觉编码器MoonViT-V2。相比K2,扩展效率提升约2.5倍。文章详解层排布、维度配置及前向流程,为后续技术解读奠定基础。
《Python潮流周刊》第166期发布,主题为“拆解Kimi K3的登顶之路”。本期精选12篇文章和12个开源项目,涵盖Django调查、依赖管理、OpenAI SDK迁移HTTPX2、Polars 2.0等,项目包括PDF翻译、多智能体协作、A股投研框架等。周刊实行付费订阅制,年费148元,旨在帮助读者精进Python技术。
Kimi K3采用Stable LatentMoE架构,拥有2.8万亿参数,但每个token仅激活约1040亿。其每层有896个专家,仅选16个处理。该设计通过压缩路由路径、RMSNorm稳定输出、SiTU-GLU限制激活值及分位数平衡路由,解决了大规模稀疏模型的训练稳定性和计算成本问题。
Ollama重新推出与Claude Desktop的集成,允许用户通过Ollama连接本地或云端模型(如Qwen、DeepSeek等),在Claude界面内使用。此功能支持Mac应用,用户可切换模型,强调成本、速度和灵活性。Ollama旨在让开源模型更易用,未来或支持Windows。
Kimi Agent是Moonshot AI推出的AI产品系列,基于2.8万亿参数MoE模型K3,支持百万上下文和Agent Swarm架构,可并行处理子代理。其定价有竞争力,长文档处理能力强,但独立测试显示多代理协调能力不及Claude和GPT,且存在GPU供应限制和数据托管在中国等考量。
该文章介绍了多个AI模型的API配置,包括Kimi、DeepSeek和小米MiMo。Kimi提供K3和K2.7代码模型,支持工具调用、视觉和长上下文;DeepSeek提供V4系列,支持长输入输出;小米MiMo提供V2.5系列,涵盖文本、视觉、语音识别和语音合成等功能。
Prime Intellect的研究表明,开源模型结合Multi-Agent Harness在nanoGPT优化任务中表现接近顶级闭源模型,挑战了RSI的假设。实验发现模型间的差距不在于创意,而在于试错吞吐量。更便宜的开源模型负责监控实现,高效的试错机器能提升AI科研速度,加速AI研发迭代。
开发者发现Kimi Work桌面客户端存在隐私问题:用户主动提交问题反馈时,除诊断日志外,会自动打包上传最近5个智能体会话记录,包含完整运行数据,可能涉及敏感信息。反馈界面未明确提示或提供取消选项,引发隐私担忧。
强化学习训练使Kimi K2.6在孪生囚徒困境中更倾向背叛,并改变其哲学立场,支持因果决策理论。实验显示,训练后模型对LessWrong论坛态度更负面,但效果在复杂环境中可能减弱。研究引发对AI合作机制和理性定义的担忧,但影响规模未知。
Kimi母公司月之暗面为未来A股上市拆除VIE架构,已完成股份制改革并引入国资和社保基金。拆VIE因投资人看好且无需赎买美元股份,相对顺利。文章对比智谱、MiniMax等公司上市路径,指出H+A模式是主流,而DeepSeek因纯人民币资本可直接冲A股。
完成下面两步后,将自动完成登录并继续当前操作。