小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Ember-1 对比 Kimi K3:速度提升 3.4 倍,结果几乎相同

Fireworks于9月23日发布研究预览版Ember-1,基于Kimi K3构建,宣称用约少40%的token达到同等质量。实测三轮任务中,Ember-1准确率与Kimi K3几乎持平(15次中14次正确),推理token少23%,速度快3.4倍,Fireworks上总成本低24%。但Kimi K3可经其他供应商以更低价格调用,反而更便宜。

Ember-1 对比 Kimi K3:速度提升 3.4 倍,结果几乎相同

The New Stack The New Stack · 2026-09-29T12:00:00Z
Fireworks 的 Ember-1 现已在 AI Gateway 上线

Fireworks 在 AI Gateway 上线研究预览模型 Ember-1,基于 Kimi K3,面向编程与智能体工作流。其生成 token 比 Kimi K3 少约 40%,质量相当,可降低输出成本与上下文负担。支持 100 万 token 上下文、文本图像输入、工具调用和隐式提示缓存,端点支持零数据保留与不训练提示,预览期两周。

Fireworks 的 Ember-1 现已在 AI Gateway 上线

Vercel News Vercel News · 2026-09-27T00:00:00Z
谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架

Inferact团队为谷歌TPU v7开发megakernel推理内核,将数百个小程序合并为一个大程序,消除调度间隙并实现跨层权重预取。16块TPU运行Kimi K3达每秒709 token,比GB200快57%,且精度无损。该团队源自vLLM,获a16z领投1.5亿美元融资,代码已开源。

谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架

量子位 量子位 · 2026-09-26T07:12:05Z
浪潮信息发布元脑SD200 Ultra超节点AI服务器

浪潮信息在AICC2026发布元脑SD200 Ultra超节点AI服务器,基于本土AI芯片,单机可运行2.8万亿参数Kimi K3大模型,Token生成时延低至5.85毫秒,支持10万亿参数模型,推理性能提升3倍以上。同时发布元脑HC2000多元算力机组,同等投资下Token产能提升10倍。

浪潮信息发布元脑SD200 Ultra超节点AI服务器

全球TMT-美通国际 全球TMT-美通国际 · 2026-09-23T06:29:50Z
AWS 每周综述:AWS Builder Center 移动应用程序、Amazon Connect Talent 正式发布、Amazon Corretto 27 等更多内容(2026 年 9 月 21 日)

AWS发布Builder Center移动应用(iOS/Android),可浏览文章、课程与工作坊;Amazon Connect Talent正式发布,提供AI语音面试与评测;Amazon Corretto 27发布,支持至2027年4月;Kimi K3上线Bedrock;AWS推出T8i实例、Elastic Beanstalk集群模式及AgentCore新运行时,简化入门体验。

AWS 每周综述:AWS Builder Center 移动应用程序、Amazon Connect Talent 正式发布、Amazon Corretto 27 等更多内容(2026 年 9 月 21 日)

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-09-21T06:50:47Z
2.8万亿参数上云之后,Kimi K3的门槛变低了吗

Kimi K3于9月18日上线Amazon Bedrock,2.8万亿参数模型可通过托管API调用,降低了部署门槛,但长上下文成本与治理门槛仍存。模型支持百万Token、视觉、工具调用及提示缓存;缓存适合复用稳定前缀,需监控命中率。开放权重不等于可自行运行,迁移需验证接口语义。建议先通过API验证,再决定自建,并以每成功任务成本评估。

2.8万亿参数上云之后,Kimi K3的门槛变低了吗

Java for You Java for You · 2026-09-20T02:51:47Z
Amazon Bedrock 现已支持 Kimi K3

Amazon Bedrock 上线 Moonshot AI 的 Kimi K3 开放权重模型,参数量 2.8 万亿,支持原生视觉与 100 万 Token 上下文,适用于长周期编程和知识工作。该模型是 Bedrock 首个支持显式提示词缓存的开放权重模型,可降低延迟和输入成本。数据在 AWS 边界内处理,不共享给模型提供商,并启用零数据留存和零运维访问。用户可通过控制台或 API 调用,支持全局和美国区域配置文件。

Amazon Bedrock 现已支持 Kimi K3

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-09-18T09:20:56Z
Kimi K3 模型结构(10):RL 与服务中的状态管理

本文介绍Kimi K3模型在1M上下文强化学习与线上服务中的系统设计,核心是状态管理。KV块和KDA状态通过write-back策略在GPU与DRAM池间迁移,训练态让位NVMe,参考模型权重借梯度缓冲槽位流入GPU,沙箱支持pause/fork/snapshot,集群调度采用缓存亲和与预算准入,确保资源高效利用。

Kimi K3 模型结构(10):RL 与服务中的状态管理

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T21:00:00Z
Kimi K3 模型结构(9):显存,把 2.8T 塞进 GPU

本文详解Kimi K3模型训练中的显存优化策略,通过账本形式分析权重、激活等内存占用,并介绍六项关键技术:均衡PP rank激活、统一激活管理器、MoE反向改写、AttnRes块复用、Pipeline ZeRO-2及P2P Muon,以显存换效率,实现2.8T参数的高效训练。

Kimi K3 模型结构(9):显存,把 2.8T 塞进 GPU

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T20:30:00Z
Kimi K3 模型结构(8):训练并行,MoonEP 与四类等待

本文介绍Kimi K3模型预训练的并行系统设计,聚焦MoE层expert并行。核心是MoonEP方案:每个rank预留E/R个冗余expert槽位,确保任意router输出都能使各rank计算完全平衡,消除负载不均和动态shape问题。同时用感知负载的GEMM调度解决rank内偏斜,并将视觉编码器计算塞入流水线气泡,减少等待开销。

Kimi K3 模型结构(8):训练并行,MoonEP 与四类等待

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T20:00:00Z
Kimi K3 模型结构(7):三个新模块带来的系统改动

本文总结Kimi K3模型结构对训练与推理系统的影响。KDA采用三种执行形态(FlashKDA、设备内上下文并行、状态回滚)处理固定大小状态;上下文并行通过可结合前缀扫描分解,避免直接加和;Block AttnRes优化内存通信;Stable LatentMoE融合GEMM与token中心解码;混合架构前缀缓存解耦粒度,支持512-token边界复用;视觉编码器动态并行并填充流水线气泡。核心是将固定权重累加转为数据相关选择。

Kimi K3 模型结构(7):三个新模块带来的系统改动

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T16:40:00Z
Kimi K3 模型结构(6):输入端与零件,MoonViT-V2、MTP、Per-Head Muon

Kimi K3模型采用从零训练的MoonViT-V2视觉编码器,27层、patch14结构,支持高分辨率图像token化;MTP层预训练后微调为EAGLE-3投机解码draft模型;Per-Head Muon优化器按头正交化动量矩阵,提升训练稳定性。词表大小163840,采用稠密层设计,强调结构选择对系统设计的影响。

Kimi K3 模型结构(6):输入端与零件,MoonViT-V2、MTP、Per-Head Muon

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T16:00:00Z
Kimi K3 模型结构(5):宽度维度,Stable LatentMoE

Kimi K3模型采用Stable LatentMoE作为FFN,基于NVIDIA LatentMoE改进,将输入压缩至半宽latent空间,增加RMSNorm稳定训练,用SiTU-GLU激活控制输出,并通过Quantile Balancing实现负载均衡。该模块占模型98%参数,每层激活16个专家,显著提升效率与性能。

Kimi K3 模型结构(5):宽度维度,Stable LatentMoE

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T15:20:00Z
Kimi K3 模型结构(3):序列维度,Gated MLA 与 3:1 混合

本文介绍Kimi K3模型结构:采用3:1混合,每四层含一层Gated MLA(无位置编码、满秩sigmoid门),其余为KDA层。MLA低秩压缩KV至576维/token,KDA状态固定约232MB。3:1比例经实验选为质量与吞吐平衡点,1M上下文时KV cache约27.6GB,decode速度约为纯MLA的2.2倍。

Kimi K3 模型结构(3):序列维度,Gated MLA 与 3:1 混合

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T14:40:00Z
Kimi K3 模型结构(2):序列维度(下),chunkwise 并行与下界衰减

本文介绍Kimi K3模型序列维度的chunkwise并行算法:将序列分块,块间递推状态、块内用矩阵乘并行计算。K3将每步log-decay加−5下界,使16-token对角tile也能用BF16矩阵乘,消除FP32逐位置对瓶颈。相比通用DPLR内核,KDA内核因结构简化速度快约一倍。训练和prefill用chunkwise形式,decode用递推形式。

Kimi K3 模型结构(2):序列维度(下),chunkwise 并行与下界衰减

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T14:00:00Z
Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA

本文介绍Kimi K3模型中KDA(Kimi Delta Attention)的递推形式,从线性注意力、DeltaNet到Gated DeltaNet演进而来。KDA通过逐通道衰减和擦除写入机制更新状态,每头128×128矩阵,不依赖上下文长度。它采用逐头RMSNorm和满秩sigmoid输出门,在合成任务中表现优于基线,并天然具备位置编码能力。

Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T13:20:00Z
Kimi K3 模型结构(4):深度维度,Attention Residuals

本文解析Kimi K3模型中的Attention Residuals(注意力残差)结构。该机制将残差连接视为深度方向上的RNN,通过可学习伪query对embedding及各层输出做softmax加权,替代固定求和。K3采用Block形式,将93层分为8块,块内普通求和,块间注意力聚合,共9个来源。相比普通残差,此设计提升多步推理能力,降低输出幅度增长,并支持高效两阶段推理。

Kimi K3 模型结构(4):深度维度,Attention Residuals

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T12:40:00Z
Kimi K3 模型结构(0):一张图看懂 Kimi K3

Kimi K3是2.78T参数、104.2B激活的93层MoE模型,支持1M上下文及图像视频输入。其结构创新分三方面:序列用KDA与Gated MLA混合,深度引入Attention Residuals,宽度采用Stable LatentMoE,并配视觉编码器MoonViT-V2。相比K2,扩展效率提升约2.5倍。文章详解层排布、维度配置及前向流程,为后续技术解读奠定基础。

Kimi K3 模型结构(0):一张图看懂 Kimi K3

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T12:00:00Z
Python 潮流周刊#166:拆解 Kimi K3 的登顶之路

《Python潮流周刊》第166期发布,主题为“拆解Kimi K3的登顶之路”。本期精选12篇文章和12个开源项目,涵盖Django调查、依赖管理、OpenAI SDK迁移HTTPX2、Polars 2.0等,项目包括PDF翻译、多智能体协作、A股投研框架等。周刊实行付费订阅制,年费148元,旨在帮助读者精进Python技术。

Python 潮流周刊#166:拆解 Kimi K3 的登顶之路

豌豆花下猫 | Python猫 豌豆花下猫 | Python猫 · 2026-09-05T00:00:00Z
从Mixtral到Kimi K3:混合专家模型的演进之路

Kimi K3采用Stable LatentMoE架构,拥有2.8万亿参数,但每个token仅激活约1040亿。其每层有896个专家,仅选16个处理。该设计通过压缩路由路径、RMSNorm稳定输出、SiTU-GLU限制激活值及分位数平衡路由,解决了大规模稀疏模型的训练稳定性和计算成本问题。

从Mixtral到Kimi K3:混合专家模型的演进之路

freeCodeCamp.org freeCodeCamp.org · 2026-08-27T21:31:21Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码