英伟达发布Groq 3 LPX推理加速器,每秒输出3400个token,速度是竞品四倍。Nebius成为首家部署该芯片的云服务商,将其用于Token Factory平台,与Vera Rubin GPU分工,加速AI推理。此举源于英伟达200亿美元收购Groq技术,旨在提升推理效率,推动AI商业化,但实际性能仍需生产环境验证。
NVIDIA宣布Vera Rubin NVL72平台扩展,其Groq 3 LPX推理加速器已全面投产,在长上下文代理任务中实现每秒3400个输出令牌,性能提升4倍。该平台通过GPU与LPU协同设计,优化推理延迟和吞吐量,并获Nebius、CoreWeave等伙伴采用。同时,NVIDIA推出Spectrum-X Multiplane网络和Scale-In基础设施,以支持大规模代理AI工厂。
OpenAI推出了首款定制推理加速器Jalapeño,旨在提升AI性能并降低成本。该芯片支持所有大型语言模型,预计将在微软等合作伙伴的数据中心大规模部署。
本文介绍了一种新型的硬件-软件协同优化设计方法,旨在快速、准确、低功耗地加速可重构脉冲神经网络(SNN)推理。该方法通过低精度计算、硬件-软件共设计和可重构性,适应不同SNN模型,显著提升了速度、准确性和能效,推动了SNN的实际应用。
本文介绍了AWS Inferentia2加速Hugging Face Transformers的方法,提供了前所未有的吞吐量、延迟、每瓦性能和可扩展性。通过与AWS的合作,Hugging Face优化了其模型以在Inferentia2上运行,性能比Inferentia和NVIDIA A10G GPU都要好。这个突破为更广泛的受众提供了高质量的机器学习模型,实现了人工智能的可访问性。
完成下面两步后,将自动完成登录并继续当前操作。