小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Kimi K3 模型结构(10):RL 与服务,状态住在哪里

本文介绍Kimi K3模型在1M上下文强化学习与线上服务中的系统设计,核心是状态管理。KV块和KDA状态通过write-back策略在GPU与DRAM池间迁移,训练态让位NVMe,参考模型权重借梯度缓冲槽位流入GPU,沙箱支持pause/fork/snapshot,集群调度采用缓存亲和与预算准入,确保资源高效利用。

Kimi K3 模型结构(10):RL 与服务,状态住在哪里

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T21:00:00Z
Kimi K3 模型结构(9):显存,把 2.8T 塞进 GPU

本文详解Kimi K3模型训练中的显存优化策略,通过账本形式分析权重、激活等内存占用,并介绍六项关键技术:均衡PP rank激活、统一激活管理器、MoE反向改写、AttnRes块复用、Pipeline ZeRO-2及P2P Muon,以显存换效率,实现2.8T参数的高效训练。

Kimi K3 模型结构(9):显存,把 2.8T 塞进 GPU

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T20:30:00Z
Kimi K3 模型结构(8):训练并行,一步训练里谁在等谁

本文介绍Kimi K3模型预训练的并行系统设计,聚焦MoE层expert并行。核心是MoonEP方案:每个rank预留E/R个冗余expert槽位,确保任意router输出都能使各rank计算完全平衡,消除负载不均和动态shape问题。同时用感知负载的GEMM调度解决rank内偏斜,并将视觉编码器计算塞入流水线气泡,减少等待开销。

Kimi K3 模型结构(8):训练并行,一步训练里谁在等谁

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T20:00:00Z
Kimi K3 模型结构(7):结构决定系统

本文总结Kimi K3模型结构对训练与推理系统的影响。KDA采用三种执行形态(FlashKDA、设备内上下文并行、状态回滚)处理固定大小状态;上下文并行通过可结合前缀扫描分解,避免直接加和;Block AttnRes优化内存通信;Stable LatentMoE融合GEMM与token中心解码;混合架构前缀缓存解耦粒度,支持512-token边界复用;视觉编码器动态并行并填充流水线气泡。核心是将固定权重累加转为数据相关选择。

Kimi K3 模型结构(7):结构决定系统

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T16:40:00Z
Kimi K3 模型结构(6):输入端与零件,MoonViT-V2、MTP、Per-Head Muon

Kimi K3模型采用从零训练的MoonViT-V2视觉编码器,27层、patch14结构,支持高分辨率图像token化;MTP层预训练后微调为EAGLE-3投机解码draft模型;Per-Head Muon优化器按头正交化动量矩阵,提升训练稳定性。词表大小163840,采用稠密层设计,强调结构选择对系统设计的影响。

Kimi K3 模型结构(6):输入端与零件,MoonViT-V2、MTP、Per-Head Muon

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T16:00:00Z
Kimi K3 模型结构(5):宽度维度,Stable LatentMoE

Kimi K3模型采用Stable LatentMoE作为FFN,基于NVIDIA LatentMoE改进,将输入压缩至半宽latent空间,增加RMSNorm稳定训练,用SiTU-GLU激活控制输出,并通过Quantile Balancing实现负载均衡。该模块占模型98%参数,每层激活16个专家,显著提升效率与性能。

Kimi K3 模型结构(5):宽度维度,Stable LatentMoE

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T15:20:00Z
Kimi K3 模型结构(3):序列维度,Gated MLA 与 3:1 混合

本文介绍Kimi K3模型结构:采用3:1混合,每四层含一层Gated MLA(无位置编码、满秩sigmoid门),其余为KDA层。MLA低秩压缩KV至576维/token,KDA状态固定约232MB。3:1比例经实验选为质量与吞吐平衡点,1M上下文时KV cache约27.6GB,decode速度约为纯MLA的2.2倍。

Kimi K3 模型结构(3):序列维度,Gated MLA 与 3:1 混合

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T14:40:00Z
Kimi K3 模型结构(2):序列维度(下),chunkwise 并行与下界衰减

本文介绍Kimi K3模型序列维度的chunkwise并行算法:将序列分块,块间递推状态、块内用矩阵乘并行计算。K3将每步log-decay加−5下界,使16-token对角tile也能用BF16矩阵乘,消除FP32逐位置对瓶颈。相比通用DPLR内核,KDA内核因结构简化速度快约一倍。训练和prefill用chunkwise形式,decode用递推形式。

Kimi K3 模型结构(2):序列维度(下),chunkwise 并行与下界衰减

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T14:00:00Z
Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA

本文介绍Kimi K3模型中KDA(Kimi Delta Attention)的递推形式,从线性注意力、DeltaNet到Gated DeltaNet演进而来。KDA通过逐通道衰减和擦除写入机制更新状态,每头128×128矩阵,不依赖上下文长度。它采用逐头RMSNorm和满秩sigmoid输出门,在合成任务中表现优于基线,并天然具备位置编码能力。

Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T13:20:00Z
Kimi K3 模型结构(4):深度维度,Attention Residuals

本文解析Kimi K3模型中的Attention Residuals(注意力残差)结构。该机制将残差连接视为深度方向上的RNN,通过可学习伪query对embedding及各层输出做softmax加权,替代固定求和。K3采用Block形式,将93层分为8块,块内普通求和,块间注意力聚合,共9个来源。相比普通残差,此设计提升多步推理能力,降低输出幅度增长,并支持高效两阶段推理。

Kimi K3 模型结构(4):深度维度,Attention Residuals

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T12:40:00Z
Kimi K3 模型结构(0):一张图看懂 Kimi K3

Kimi K3是2.78T参数、104.2B激活的93层MoE模型,支持1M上下文及图像视频输入。其结构创新分三方面:序列用KDA与Gated MLA混合,深度引入Attention Residuals,宽度采用Stable LatentMoE,并配视觉编码器MoonViT-V2。相比K2,扩展效率提升约2.5倍。文章详解层排布、维度配置及前向流程,为后续技术解读奠定基础。

Kimi K3 模型结构(0):一张图看懂 Kimi K3

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T12:00:00Z
Python 潮流周刊#166:拆解 Kimi K3 的登顶之路

《Python潮流周刊》第166期发布,主题为“拆解Kimi K3的登顶之路”。本期精选12篇文章和12个开源项目,涵盖Django调查、依赖管理、OpenAI SDK迁移HTTPX2、Polars 2.0等,项目包括PDF翻译、多智能体协作、A股投研框架等。周刊实行付费订阅制,年费148元,旨在帮助读者精进Python技术。

Python 潮流周刊#166:拆解 Kimi K3 的登顶之路

豌豆花下猫 | Python猫 豌豆花下猫 | Python猫 · 2026-09-05T00:00:00Z
从Mixtral到Kimi K3:混合专家模型的演进之路

Kimi K3采用Stable LatentMoE架构,拥有2.8万亿参数,但每个token仅激活约1040亿。其每层有896个专家,仅选16个处理。该设计通过压缩路由路径、RMSNorm稳定输出、SiTU-GLU限制激活值及分位数平衡路由,解决了大规模稀疏模型的训练稳定性和计算成本问题。

从Mixtral到Kimi K3:混合专家模型的演进之路

freeCodeCamp.org freeCodeCamp.org · 2026-08-27T21:31:21Z
Ollama首次尝试受阻后,Claude Desktop现可轻松运行Qwen、DeepSeek和Kimi模型

Ollama重新推出与Claude Desktop的集成,允许用户通过Ollama连接本地或云端模型(如Qwen、DeepSeek等),在Claude界面内使用。此功能支持Mac应用,用户可切换模型,强调成本、速度和灵活性。Ollama旨在让开源模型更易用,未来或支持Windows。

Ollama首次尝试受阻后,Claude Desktop现可轻松运行Qwen、DeepSeek和Kimi模型

The New Stack The New Stack · 2026-08-26T16:59:39Z

Kimi Agent是Moonshot AI推出的AI产品系列,基于2.8万亿参数MoE模型K3,支持百万上下文和Agent Swarm架构,可并行处理子代理。其定价有竞争力,长文档处理能力强,但独立测试显示多代理协调能力不及Claude和GPT,且存在GPU供应限制和数据托管在中国等考量。

我试用了Kimi Agent,这是我的发现

KDnuggets KDnuggets · 2026-08-25T12:00:47Z
配置LLM API

该文章介绍了多个AI模型的API配置,包括Kimi、DeepSeek和小米MiMo。Kimi提供K3和K2.7代码模型,支持工具调用、视觉和长上下文;DeepSeek提供V4系列,支持长输入输出;小米MiMo提供V2.5系列,涵盖文本、视觉、语音识别和语音合成等功能。

配置LLM API

瞬间 Press 瞬间 Press · 2026-08-24T00:00:00Z
闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5

Prime Intellect的研究表明,开源模型结合Multi-Agent Harness在nanoGPT优化任务中表现接近顶级闭源模型,挑战了RSI的假设。实验发现模型间的差距不在于创意,而在于试错吞吐量。更便宜的开源模型负责监控实现,高效的试错机器能提升AI科研速度,加速AI研发迭代。

闭源RSI的严父:18个Agent自主科研,Kimi K3靠Harness逼近Opus 5

量子位 量子位 · 2026-08-20T09:46:23Z
有开发者发现Kimi Work存在隐私问题 提交反馈时自动打包上传最近5个会话记录

开发者发现Kimi Work桌面客户端存在隐私问题:用户主动提交问题反馈时,除诊断日志外,会自动打包上传最近5个智能体会话记录,包含完整运行数据,可能涉及敏感信息。反馈界面未明确提示或提供取消选项,引发隐私担忧。

有开发者发现Kimi Work存在隐私问题 提交反馈时自动打包上传最近5个会话记录

蓝点网 蓝点网 · 2026-08-18T03:30:03Z
强化学习把Kimi K2.6教成利己主义者:更信背叛有理!

强化学习训练使Kimi K2.6在孪生囚徒困境中更倾向背叛,并改变其哲学立场,支持因果决策理论。实验显示,训练后模型对LessWrong论坛态度更负面,但效果在复杂环境中可能减弱。研究引发对AI合作机制和理性定义的担忧,但影响规模未知。

强化学习把Kimi K2.6教成利己主义者:更信背叛有理!

极道 极道 · 2026-08-17T10:12:00Z
Kimi拆VIE:月之暗面的H+A上市路

Kimi母公司月之暗面为未来A股上市拆除VIE架构,已完成股份制改革并引入国资和社保基金。拆VIE因投资人看好且无需赎买美元股份,相对顺利。文章对比智谱、MiniMax等公司上市路径,指出H+A模式是主流,而DeepSeek因纯人民币资本可直接冲A股。

Kimi拆VIE:月之暗面的H+A上市路

硕鼠的博客站 硕鼠的博客站 · 2026-08-12T00:30:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码