AMD MI355X单节点跑Kimi K3达952t/s:每美元吞吐量暴打B300

AMD MI355X单节点跑Kimi K3达952t/s:每美元吞吐量暴打B300

💡 原文中文,约3000字,阅读约需7分钟。
📝

内容提要

AMD MI355X在运行Kimi K3模型时,凭借更低价格和更高每美元吞吐量,性能超越英伟达B300。通过修复投机解码和预填充内核的软件缺陷,MI355X单节点速度达到B200的3.8倍,首字延迟大幅降低。文章认为,CUDA生态并非不可撼动,硬件性价比和工程师修bug能力正成为新护城河。

🔎

延伸解读

每美元吞吐量:算力性价比的新标尺

文章引入“每美元吞吐量”作为对比指标,MI355X以33对22(或48对33)领先B300。这一指标将硬件价格与推理性能挂钩,对成本敏感的推理服务商尤为重要。它提醒读者,在评估AI芯片时,除了绝对性能,单位成本的产出效率可能更贴近实际商业价值。

软件生态差距:可修复的“bug”而非不可逾越的鸿沟

MI355X的性能提升主要源于修复两个软件缺陷:投机解码缺少top_k_renorm_prob函数,以及预填充内核不支持12个注意力头。这些修复仅用PyTorch自带功能或零填充实现,无需编写自定义CUDA代码。这表明AMD的ROCm生态虽不完善,但许多问题可通过工程手段快速解决,降低了切换成本。

首字延迟:影响用户体验的关键指标

文章强调,解码速度虽快,但首字延迟(从输入到首个输出token的时间)对用户感知影响更大。MI355X在长上下文预填充上初始耗时51秒,远超B300的23秒,修复后降至20秒级别。这提醒读者,推理性能需综合考量吞吐量与延迟,尤其对交互式应用,首字延迟可能成为瓶颈。

CUDA护城河并非不可撼动

文章通过对比MI355X与B300的硬件规格(同为288GB显存)和价格(2.5美元/小时 vs 6美元/小时),指出CUDA生态的溢价可能被高估。对于拥有PyTorch工程师的团队,AMD的性价比优势显著;而依赖保姆级生态的用户可能仍愿支付溢价。这一观点挑战了英伟达生态的不可替代性,但需注意文章基于特定模型和优化场景,结论未必普适。

Q&A

AMD MI355X在运行Kimi K3模型时,单节点速度达到多少?

AMD MI355X在运行Kimi K3模型时,单节点速度达到每秒952个token(952 tok/s)。

MI355X与B300相比,每美元吞吐量如何?

MI355X的每美元吞吐量是B300的1.45倍(或约48 vs 33),即每美元能处理的token数更多,性价比更高。

为什么B200无法运行Kimi K3模型?

因为Kimi K3模型有2.8万亿参数,权重占用约1.5TB显存,而B200一个节点8张卡总共只有1.5TB显存,没有剩余空间存放KV cache,导致推理无法进行。

AMD MI355X在运行Kimi K3时遇到了哪些软件问题?如何解决的?

主要遇到两个问题:一是投机解码时缺少top_k_renorm_prob函数,导致调度器崩溃,通过用PyTorch自带功能三行代码实现该函数解决;二是预填充时AITER MLA快速内核因注意力头数12不是4/8/16的倍数而加载失败,通过将12个头零填充到16再提取结果解决。

修复软件问题后,MI355X的性能提升多少?

修复投机解码问题后,单条流性能提升2.2倍,并发吞吐提升18%,最大并发数从24提升到64;修复预填充问题后,预填充速度从每秒四五千token提升到一万三,首字延迟从51秒降到二十秒级别。

文章认为英伟达的CUDA生态是否是不可撼动的护城河?

文章认为CUDA生态并非不可撼动,硬件性价比和工程师修bug的能力正成为新护城河。对于有技术能力的团队,AMD的性价比优势明显,CUDA生态的溢价可能不值得。

🏷️

标签

➡️

继续阅读