英伟达推出更小更快的Nemotron模型及配套路由器,助力实际应用

英伟达推出更小更快的Nemotron模型及配套路由器,助力实际应用

💡 原文英文,约800词,阅读约需3分钟。
📝

内容提要

英伟达发布Nemotron 3.5 Lightning开源模型及NeMo Switchyard路由库,主打速度与定制化。该模型经微调后可在专业任务上媲美大型专有模型,并降低成本。Switchyard通过路由优化,在保持精度的同时大幅削减任务成本,合作伙伴已见成效。

🔎

延伸解读

路由器的价值:成本与精度的平衡

英伟达的Switchyard路由库通过智能分配任务,在保持精度的同时大幅降低成本。内部测试显示,混合使用开源模型和Anthropic的Opus 4.8,可将成本降至仅用Opus的三分之一。合作伙伴LangChain和Ramp也分别实现了74%和58%的成本降低,尽管LangChain有6%的精度损失。这表明,路由器并非单纯追求最高精度,而是在成本、延迟和质量之间做出权衡,这对实际部署至关重要。

小模型的定制化优势

Nemotron 3.5 Lightning虽在通用基准上不及谷歌的Gemma 4 31B,但英伟达强调其定制化潜力。通过后训练,该模型在专业任务上可媲美甚至超越大型专有模型。合作伙伴如CrowdStrike和CodeRabbit的案例显示,针对特定工作流微调后,小模型能更高效地执行任务。这提示企业用户,选择模型时不应只看基准分数,而应关注其针对自身场景的适配能力。

开源生态与集成策略

英伟达将Switchyard和Nemotron模型开源,并已集成到Kong、OpenRouter、LiteLLM等现有工具中。这种策略降低了开发者的采用门槛,使其能无缝融入现有技术栈。Switchyard用Rust编写,但通过API交互,便于集成。英伟达强调与生态系统的合作,而非孤立发展,这有助于其模型和路由库在更广泛的AI应用中得到应用。

Q&A

英伟达新发布的Nemotron 3.5 Lightning模型有哪些主要特点?

Nemotron 3.5 Lightning是一个300亿参数的混合专家模型,推理能力接近更大的Nemotron 3 Super模型,但性能不及谷歌的Gemma 4 31B。它主打速度和定制化,输出速度提升可达4倍,并可通过后训练针对特定工作流优化,在专业任务上可媲美甚至超越大型专有模型。

Nemotron 3.5 Lightning与Nemotron 3 Super和Gemma 4 31B相比性能如何?

Nemotron 3.5 Lightning的推理能力接近更大的Nemotron 3 Super模型,但两者在Artificial Analysis的智能指数上都不及谷歌的Gemma 4 31B。

英伟达的NeMo Switchyard是什么?它有什么作用?

NeMo Switchyard是英伟达推出的开源路由库,用于在模型系统中决定使用哪个模型处理任务。它支持自定义路由策略,可平衡质量、延迟和成本,帮助开发者优化模型使用效率。

使用NeMo Switchyard能带来哪些成本效益?

在英伟达内部基准测试中,混合使用开源模型和Anthropic的Opus 4.8,可将任务完成成本降至仅运行Opus时的约三分之一。合作伙伴LangChain和Ramp分别实现了74%和58%的成本降低,同时保持或接近原有性能。

Nemotron 3.5 Lightning和NeMo Switchyard在哪里可以获取?

Nemotron 3.5 Lightning可在Hugging Face、ModelScope、OpenRouter和build.nvidia.com上获取,作为NIM微服务。NeMo Switchyard已在GitHub上开源。

英伟达为什么强调后训练(post-training)的重要性?

英伟达认为,通用基准只是起点,在生产环境中,任务准确性才是关键,而后训练可以显著提高模型在特定工作流上的准确性。通过后训练,像Nemotron 3.5 Lightning这样的开源模型在专业任务上可以媲美甚至超越大型专有模型。

🏷️

标签

➡️

继续阅读