Nebius首家部署Groq 3 LPX:推理速度高达3400tok/秒

Nebius首家部署Groq 3 LPX:推理速度高达3400tok/秒

💡 原文中文,约3300字,阅读约需8分钟。
📝

内容提要

英伟达发布Groq 3 LPX推理加速器,每秒输出3400个token,速度是竞品四倍。Nebius成为首家部署该芯片的云服务商,将其用于Token Factory平台,与Vera Rubin GPU分工,加速AI推理。此举源于英伟达200亿美元收购Groq技术,旨在提升推理效率,推动AI商业化,但实际性能仍需生产环境验证。

🔎

延伸解读

异构分工:为什么“只写字”反而更快

Groq 3 LPX的设计思路不是把单个芯片做得更快,而是把推理拆成“预填充”和“解码”两步,让GPU负责前者、LPX专攻后者。这种异构解码让整个系统效率提升,但前提是GPU与LPX之间的协作顺畅。Nebius将两者部署在同一平台,共享API,开发者无需改代码,这降低了采用门槛,但实际效果仍取决于生产环境中的负载和调优。

实验室数据与真实世界的差距

文章明确指出,3400 token/秒的成绩来自英伟达预发布测试端点,而对手数据来自公开生产环境。这意味着该数字可能无法直接反映真实负载下的表现。换用更大模型、更长上下文或更复杂任务时,速度可能下降。因此,在Nebius正式上线前,这一性能指标仍需谨慎看待,实际响应速度要等真实流量验证。

英伟达的推理棋局与行业影响

英伟达以200亿美元收购Groq技术授权,将潜在挑战者纳入麾下,并让Groq云服务成为首批用户之一。此举反映了AI行业从训练转向推理的趋势,推理速度直接决定用户体验和商业化潜力。但推理加速器市场竞争激烈,Cerebras、AMD等也在布局,Groq 3 LPX能否保持优势,还需看量产后的实际部署效果和生态支持。

Q&A

Groq 3 LPX是什么?它的主要功能是什么?

Groq 3 LPX是英伟达推出的一款推理加速器,专门用于AI推理中的token生成(即“写答案”),而不是用于训练模型。它通过将记忆体直接焊在计算单元旁边,利用高带宽SRAM实现极快的输出速度,每秒可生成3400个token。

Groq 3 LPX的推理速度有多快?与竞争对手相比如何?

Groq 3 LPX在第三方评测中,使用Gemma 4 31B模型和10万token上下文,达到了每秒3400个输出token,是该模型的最快纪录。英伟达称其速度比最接近的对手快四倍,例如OpenAI的Ultrafast模式使用Cerebras芯片仅为每秒750个token。

Nebius为什么能成为首家部署Groq 3 LPX的云服务商?

Nebius成为首家部署Groq 3 LPX的云服务商,是因为其前身是Yandex的欧洲业务,在2024年独立后专注于AI云服务,并取得了快速增长。Nebius的AI云收入在2026年第一季度同比增长841%,第二季度同比增长514%,显示出其在AI云市场的积极布局。此外,Nebius的CEO强调“不断前进”的理念,使其愿意率先采用新技术。

Groq 3 LPX与Vera Rubin GPU是如何分工合作的?

在Nebius的Token Factory平台中,Vera Rubin GPU负责“预填充”阶段,即处理上下文信息和大规模计算;而Groq 3 LPX负责“解码”阶段,即低延迟的token生成。两者通过共享API接口和操作界面协同工作,实现“异构解码”,提高整体推理效率。

英伟达收购Groq技术的背景和目的是什么?

2025年12月,英伟达以200亿美元从Groq公司获得推理技术授权,并吸纳了其创始人Jonathan Ross及核心团队。此举旨在加强英伟达在推理领域的竞争力,因为推理是AI商业化的关键环节。英伟达通过整合Groq的技术,推出了Groq 3 LPX,以提升推理速度,推动AI商业化。

Groq 3 LPX的推理速度在真实生产环境中能否达到实验室水平?

目前Groq 3 LPX的3400 token/秒数据来自英伟达的预发布测试端点,而竞争对手的数据来自公开生产环境。因此,实验室数据与真实世界数据可能存在差距。实际性能还需在Nebius的机架正式上线后,经过真实流量测试才能验证。

Groq 3 LPX的推出对AI推理行业有何影响?

Groq 3 LPX通过“异构解码”设计,将推理任务拆分为预填充和解码,由不同芯片专门处理,大幅提升了推理速度。这可能会推动AI推理加速器的发展,促使其他公司优化推理方案,并加速AI应用的商业化进程。

🏷️

标签

➡️

继续阅读