内容提要
是石科技推出Meta-Infer推理引擎,通过内核补齐、算子通信重构、并行调优与缓存复用等纯软件优化,释放非主流GPU算力。在DeepSeek、GLM等模型上吞吐最高提升6.87倍,视频生成提升2.48倍,约1.5台6000D可媲美1台B300,且无需修改模型结构。
延伸解读
软件优化如何释放被锁住的算力
文章指出,许多GPU卡虽能运行模型,但性能远低于官方宣传,核心原因是框架与硬件间的适配鸿沟。Meta-Infer通过内核补齐、算子通信重构等纯软件手段,在不改动模型结构的前提下,将DeepSeek-V4.1-Flash的输入吞吐从1932 tok/s提升至13274 tok/s,实现6.87倍增长。这证明硬件潜力常被软件短板禁锢,优化适配即可释放。
PCIe显卡与高端GPU的差距比想象中小
在统一整机口径下,8卡PCIe整机在视频生成任务中吞吐可达B300的58%-67%。若采用缓存复用与LoRA方案,约1.5台6000D即可媲美1台B300的参考图生视频吞吐。这表明通过软件栈优化,成本更友好的PCIe GPU能在部分推理指标上逼近高端硬件,为算力采购提供新思路。
国产GPU同样受益于系统级适配
Meta-Infer在国产GPU上完成验证,针对具体硬件重新梳理执行路径,如显式启用NSA稀疏注意力、关闭不适配的Shared Expert融合、按推理阶段配置通信模式。仅将Shared Expert与Routed Expert并行提交,就在35组测试中带来11.26%的吞吐提升。这说明国产算力“能跑起来”只是第一步,系统适配可进一步释放性能。
长尾硬件的生产级可用性路径
对于不在主流框架官方验证矩阵内的长尾硬件,行业现状常是“能跑起来”即止。但文章实践表明,“能跑”与“可规模化生产服务”之间存在巨大软件优化空间。Meta-Infer通过内核补齐、通信重构、并行调优与缓存复用,让PCIe架构硬件在长文本、视频生成等场景达到更高服务能力,为现有算力资源增值提供了可行路线。
Q&A
Meta-Infer推理引擎是什么?它主要解决什么问题?
Meta-Infer是是石科技自研的面向异构加速芯片的企业级高性能大模型推理引擎。它通过纯软件优化手段,弥合模型框架与硬件之间的性能鸿沟,在不改动模型结构、不修改任务语义的前提下,充分挖掘GPU卡架构硬件的推理能力,让成本更低的GPU卡在部分推理业务指标上逼近更高端GPU的服务能力。
Meta-Infer引擎包含哪些核心优化能力?
Meta-Infer引擎包含四项核心能力:内核补齐、算子优化与通信重构、并行与容量调优、缓存复用。这些能力共同作用,释放硬件潜力。
在DeepSeek-V4.1-Flash模型上,Meta-Infer实现了多大的吞吐提升?
在DeepSeek-V4.1-Flash模型上,经过全套优化,输入吞吐从1932 tok/s提升至13274 tok/s,整体实现6.87倍吞吐提升,并且支持1M超长上下文。
Meta-Infer在视频生成任务上有什么优化效果?
在MiniMax H3视频生成模型上,依托稀疏注意力、自研风险感知缓存复用、Turbo LoRA多手段组合,15秒参考图生视频端到端生成速度提升2.48倍,峰值显存与原始稠密基线保持持平。单机8卡整机配置下,文生视频最高吞吐达到基线的5.33倍,参考图生视频达到基线的4.98倍。
Meta-Infer如何优化PCIe架构下的通信瓶颈?
Meta-Infer通过算子优化与通信重构来优化PCIe架构下的通信瓶颈:对注意力、投影等关键算子做算子融合,压缩单步计算耗时;将计算任务和集合通信做时间重叠掩盖,把统计类计算嵌入通信间隙并行执行;改写集合通信逻辑适配PCIe带宽特性,降低消息传输带来的等待开销。
Meta-Infer在国产GPU上的验证效果如何?
Meta-Infer在国产GPU上完成了验证。针对国产GPU,需要显式启用面向该平台优化的NSA稀疏注意力实现,关闭Shared Expert融合等默认面向NVIDIA/AMD平台的特性,并根据推理阶段配置通信策略(Prefill采用DeepEP normal模式,Decode采用low_latency模式),将Shared Expert与Routed Expert拆分到两条stream中并行提交。仅将Shared Expert与Routed Expert改为并行提交,就在35组同配置配对测试中带来了11.26%的吞吐提升。