Character.ai与DigitalOcean和AMD合作,优化了AI平台的GPU性能,实现推理吞吐量提升至2倍,降低了推理成本,提升了响应速度,满足大规模低延迟需求。
vLLM 0.11.0引入KV缓存卸载功能,将缓存转移至CPU内存(DRAM),提升推理吞吐量。通过缓存KV值,降低计算需求,改善请求延迟和每节点吞吐量。新API支持异步加载和存储KV数据,优化GPU与CPU间的数据传输,显著提升性能。
DeepSeek R1模型利用INT8量化技术克服了GPU部署的限制,显著提升了推理吞吐量并降低了成本,量化后模型精度几乎无损,已在Hugging Face开源,欢迎交流与学习。
美团团队对DeepSeek R1模型进行了INT8量化,解决了GPU兼容性问题,支持A100等旧型号GPU的部署。量化后模型精度几乎无损,推理吞吐量提升50%。相关代码已开源,方便用户使用。
Llamba是一种高效的循环语言模型,源自Llama-3.x,旨在克服变压器模型在推理吞吐量和大批量处理上的局限。该模型通过跨架构蒸馏,优化了速度、内存效率和性能,特别适用于智能手机和边缘平台。
本文探讨了Key-Value缓存的低秩特性,提出多种压缩方法以降低大型语言模型的内存占用并提高推理吞吐量。通过SqueezeAttention和自适应KV缓存等技术,实验证明可实现30%至70%的内存减少和最高2.2倍的吞吐量提升,同时保持生成质量。
本文探讨了视觉语言模型的设计,旨在通过高效模型提高推理吞吐量,以应对数字助理在移动设备控制中的挑战。研究利用视觉输入和人类交互模拟,增强了人工智能代理的能力,并在多个基准测试中验证了其有效性。此外,提出了结合视觉能力的对话管理器,展望未来对话代理的应用。
本文介绍了一种新方法,通过优化大型语言模型中的键值缓存,显著降低内存使用并提高推理吞吐量。该方法可减少内存消耗高达70%,提升吞吐量2.2倍,适用于多种模型和任务。采用自适应KV缓存和SqueezeAttention等技术,保持生成质量的同时提高效率。
本文提出了一种优化视觉变压器(ViT)模型的压缩框架,显著降低了训练成本和计算复杂度。通过稠密特征提取和局部-全局令牌合并等方法,提高了推理吞吐量并缩短了训练时间。同时,介绍了硬件高效的标记修剪框架和令牌传播控制器等改进技术,进一步提升了模型的准确性和效率。
该论文研究了不同粒度的MoE模型中的路由策略,通过任务级路由在大规模数据集上实验,能够从大型稀疏模型中提取更小、可部署的子网络。实验结果显示,task-MoE在WMT上的表现比token-MoE高1.0 BLEU,并且推理成本相同。在扩展到200种语言对时,task-MoE提高了推理吞吐量2.6倍。
本文介绍了一种新的注意力模型Mamba,它基于SSM架构,具有线性复杂度和5倍推理吞吐量。Mamba在多个模态上表现出SOTA水平,在预训练和下游任务上都优于同类模型。作者认为Mamba是通用序列模型骨干的有力候选者。
该论文研究了不同粒度的MoE模型中的路由策略,通过任务级路由在数据集上进行实验,能够从大型稀疏模型中提取更小、可部署的子网络。实验结果表明,task-MOE在30种语言对上的表现平均比token-MoE高1.0 BLEU,并且能够保留所有收益。同时,当扩展到200种语言对时,task-MoE表现相近,并且提高了推理吞吐量2.6倍。
完成下面两步后,将自动完成登录并继续当前操作。