80张游戏卡跑2.8T参数Kimi k3:不用HBM芯片,普通网线就搞定

80张游戏卡跑2.8T参数Kimi k3:不用HBM芯片,普通网线就搞定

💡 原文中文,约2900字,阅读约需7分钟。
📝

内容提要

80张RTX 5090游戏显卡通过25GbE普通网线成功运行2.8万亿参数的Kimi K3模型,速度达每秒20个词元。此举摆脱了对昂贵HBM芯片的依赖,利用GDDR7显存和MXFP4压缩格式,大幅降低运行成本,使实验室和初创公司能负担。虽需解决功耗、散热和网络延迟问题,但开放权重模型普及意义重大,推动AI基础设施平民化。

🔎

延伸解读

成本与性能的权衡

用80张RTX 5090跑Kimi K3,硬件成本约400万元,虽低于GB200整机(约480万),但需自行组装、调试,且功耗和散热问题突出。25GbE网络虽便宜,但延迟可能限制性能,升级到100GbE或可提速,但会增加成本。对于预算有限的实验室和初创公司,这种方案提供了可行的替代路径,但需权衡初期投入与长期运维。

技术突破的意义

Kimi K3通过MXFP4压缩将模型体积缩小至四分之一,使2.8T参数模型能装入80张显卡的GDDR7显存中,摆脱了对HBM的依赖。这得益于GDDR7产能充足和价格亲民,降低了运行门槛。同时,25GbE以太网的使用表明,在软件优化下,普通网络也能支撑大规模模型推理,为AI基础设施平民化提供了新思路。

开放权重模型的优势

Kimi K3作为开放权重模型,参数公开,便于研究者深入分析,满足学术需求。相比商业黑盒API,开放权重支持微调和代理应用,初创公司可基于此开发垂直领域应用,节省训练成本。大学也能将其用于教学,直观展示大模型运行原理,推动AI教育普及。

Q&A

如何用80张RTX 5090运行Kimi K3模型?

将80张RTX 5090通过25GbE以太网连接,利用GDDR7显存和MXFP4压缩格式,将2.8万亿参数的模型分布到各卡上,实现每秒20个词元的推理速度。

为什么用游戏显卡而不是HBM芯片?

HBM芯片产能少、价格贵,而游戏显卡的GDDR7显存产量大、成本低,通过MXFP4压缩格式将模型体积缩小到四分之一,使得用游戏卡运行大模型成为可能,大幅降低硬件成本。

Kimi K3模型有多大?

Kimi K3拥有2.8万亿个参数,全精度存储需要11TB显存,但使用MXFP4压缩后仅需1.5TB,80张RTX 5090(每张24GB)合计1920GB显存,足以容纳模型并留有余量。

用80张RTX 5090运行Kimi K3的成本是多少?

80张RTX 5090的采购价约400万人民币,还需额外购买25GbE网卡、交换机等网络设备,以及解决功耗、散热和机架空间问题,总成本可能接近或超过8台GB200服务器(约480万)。

用游戏显卡运行大模型有哪些挑战?

主要挑战包括:功耗高(80张卡相当于40个电磁炉)、散热要求高、需要电路改造、网络延迟导致同步等待、组装调试复杂,以及需要额外购买网络设备。

开放权重模型对研究有什么意义?

开放权重模型如Kimi K3允许研究者下载参数进行深入分析,促进透明可复现的研究,大学教学和初创公司微调也受益,降低了研究门槛,推动AI基础设施平民化。

25GbE以太网和专用网络(如InfiniBand)相比有什么优缺点?

25GbE以太网成本低、普及度高,但速度较慢(InfiniBand可达400GbE),可能造成通信延迟;团队选择25GbE是在成本和性能间平衡,且通过软件优化可提升性能。

MXFP4压缩格式有什么作用?

MXFP4是一种压缩格式,将模型体积缩小到原来的四分之一,使得2.8T参数模型只需1.5TB显存,从而能在80张RTX 5090上运行,且官方压缩质量高,无需重新量化。

🏷️

标签

➡️

继续阅读