文章报道了HyperAI主办的AI编译器技术沙龙,重点介绍TileRT团队在超低延迟大模型推理方面的进展。文章强调推理速度对AI应用的关键性,并阐述TileRT通过打破Kernel边界、细粒度调度和模型-系统协同设计,实现高速解码。文中列举了与智谱、小米等合作案例,展示400至1000 tokens/s的推理速度突破,并提及与vLLM的生态融合及Tile-AI社区发展。
DeepSeek团队与北京大学联合发布了《DSpark》研究论文,提出了一种加速大模型推理的新方法。该技术在保持文本生成质量的同时,显著提升了推理速度,单用户生成速度提高85%。DSpark采用“半自回归生成”架构和置信度调度验证机制,优化了生成过程,减少了计算资源浪费,并已在DeepSeek-V4系统中应用,提升了推理效率。
算苗科技宣布其3D TokenPU芯片A4E已于6月15日流片,标志着中国在高端AI算力芯片领域的突破。该芯片专注于大模型推理,采用3D混合堆叠架构,解决了算力、内存和通信瓶颈,提供高性能和低成本的算力支持。公司致力于推动AI产业的发展。
本文介绍了基于Amazon EKS和NVIDIA NIM的混合云大模型推理架构,强调本地GPU优先和云上弹性扩展的策略。通过KEDA和Karpenter实现自动扩缩容,优化成本和性能,满足中国客户需求。该方案解决了延迟、数据本地化和成本问题,提供统一监控和最佳实践,帮助企业有效利用现有GPU资源。
本文探讨了大模型推理的工程差异,强调训练与推理的不同需求。推理分为Prefill和Decode两个阶段,前者关注计算吞吐,后者关注延迟。KV Cache的使用显著提高了推理效率,减少了计算复杂度。文章还介绍了Continuous Batching和Prefill/Decode分离的优势,强调了高并发场景下的显存管理和性能优化策略。
研究团队推出了Prefill-as-a-Service(PrFaaS),旨在解决大模型推理中的跨机房调度问题。该架构通过将Prefill计算卸载到专用集群,并利用普通以太网传输KV Cache,显著提升了吞吐量和降低了延迟。实验结果表明,PrFaaS在吞吐量上提升54%,P90延迟降低64%,有效支持长上下文场景。
美团技术团队在AAAI会议上发表了8篇论文,涉及大模型推理、退火策略和强化学习等领域,提出了多种优化模型推理效率和性能的方法,为研究者提供理论和实践参考。
第八届CCF开源创新大赛的「开源GPU创新生态赛」现已开始报名,旨在推动国产算力创新,聚焦GPU技术与开源生态的融合。赛事包括多个子赛题,特别是关注大模型推理性能优化的GPU开源生态挑战赛。开发者可通过验证任务提升国产GPU的生态适配,赛事时间为2025年9月15日至12月10日。
蚂蚁与港大联合推出PromptCoT 2.0框架,专注于任务合成与强化学习。实验表明,该框架在数学代码推理任务上达成新SOTA,显著提升模型性能。PromptCoT 2.0通过期望最大化优化生成更具挑战性的问题,并开源4.77M合成数据,推动大模型推理能力的提升。未来将探索环境合成与多模态任务。
本文探讨了大模型推理的经济学,分析了推理成本的来源及其对盈利能力的影响。以LLaMA 3.3为例,讨论了模型参数、GPU需求及其对推理效率的影响。推理过程分为计算受限和内存受限两个阶段,强调了批处理在降低单位成本中的重要性。随着输入长度和批量规模的增加,推理成本与效率的关系变得复杂,理解这些因素对AI发展的经济影响至关重要。
随着 ARM 架构和量化技术的发展,CPU 在大模型推理中展现出性价比优势。AWS Graviton 实例与 llama.cpp 工具链的测试表明,CPU 在边缘推理和成本敏感型业务中表现优异,尤其在低延迟和小吞吐量任务中更具优势。Graviton 系列的硬件和软件优化进一步提升了 CPU 性能,未来在大模型推理领域有望持续发挥潜力。
本研究提出了一种名为SpargeAttn的稀疏注意力机制,旨在解决大模型推理中的时间复杂度问题。该方法通过在线过滤器快速预测注意力图,跳过部分计算,从而显著提高推理速度而不影响性能。
10月26日,OSC源创会将在北京举行,重点讨论高性能计算与大模型推理。华为、商汤等专家将分享优化经验,探讨计算需求与能耗管理,并介绍openMind平台及其低成本大模型应用功能。
本研究提出了TPI-LLM系统,旨在解决边缘设备在执行70B规模大模型推理时的计算、内存和带宽限制。该系统通过优化内存调度和通信管理,显著降低了推理延迟和内存占用。
燧原科技的S60人工智能推理加速卡通过大模型推理I级兼容性测试,成为国内首家适配认证的芯片厂商。S60在Llama-13B模型上表现良好,可广泛应用于图像、文本生成、搜索与推荐、文本、图像和语音识别等场景。
本文介绍了在Amazon SageMaker上进行大模型推理的完整流程,以Llama 3模型为例。通过代码示例展示了配置推理参数到部署Endpoint的全过程,并介绍了SageMaker Endpoint的自动伸缩能力。借助SageMaker,可以实现高效、弹性的大模型推理服务。
浪潮信息成功在通用服务器上运行了千亿参数的大模型推理,只用了4颗CPU,无需GPU或其他AI加速卡。通用服务器的成本优势显著,且内存容量大,适合部署大模型。通过量化技术和并行计算环境的优化,解决了CPU与内存之间的通信需求。CPU的AI算力性能也在提升,能满足大模型推理的需求。这种通用算力方案将成为企业拥有AI的新起点。
本文分析了大模型推理的速度瓶颈,探讨了访存带宽与算力的关系。实测数据表明,推理速度受限于访存带宽,尤其在生成文本时,模型逐个处理token,导致并行性不足。以Mistral 7B为例,计算推理所需的最小时间,强调低精度量化可降低延迟。建议在设计推理系统时考虑访存带宽的影响,以优化性能。
本文介绍了大模型推理在企业基础设施中的挑战,以及Fluid项目在云原生AIGC模型推理场景中的优化方案。Fluid提供了数据缓存、自动化、加速和数据编排等核心能力,通过分布式缓存、弹性伸缩、数据感知调度和数据流编排来提升性能和降低成本。Fluid的Python SDK可以进一步提升GPU实例的带宽能力。
完成下面两步后,将自动完成登录并继续当前操作。