小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
技术深度剖析:DigitalOcean和AMD如何为Character.ai实现2倍的生产推理性能提升

Character.ai与DigitalOcean和AMD合作,优化了AI平台的GPU性能,实现推理吞吐量提升至2倍,降低了推理成本,提升了响应速度,满足大规模低延迟需求。

技术深度剖析:DigitalOcean和AMD如何为Character.ai实现2倍的生产推理性能提升

The DigitalOcean Blog The DigitalOcean Blog · 2026-01-13T12:30:00Z
vLLM新KV卸载连接器内部揭秘:智能内存传输以最大化推理吞吐量

vLLM 0.11.0引入KV缓存卸载功能,将缓存转移至CPU内存(DRAM),提升推理吞吐量。通过缓存KV值,降低计算需求,改善请求延迟和每节点吞吐量。新API支持异步加载和存储KV数据,优化GPU与CPU间的数据传输,显著提升性能。

vLLM新KV卸载连接器内部揭秘:智能内存传输以最大化推理吞吐量

vLLM Blog vLLM Blog · 2026-01-08T00:00:00Z
老显卡福音!美团开源首发INT8无损满血版DeepSeek R1

DeepSeek R1模型利用INT8量化技术克服了GPU部署的限制,显著提升了推理吞吐量并降低了成本,量化后模型精度几乎无损,已在Hugging Face开源,欢迎交流与学习。

老显卡福音!美团开源首发INT8无损满血版DeepSeek R1

美团技术团队 美团技术团队 · 2025-03-07T00:00:00Z
老显卡福音!美团技术团队开源首发INT8无损满血版DeepSeek R1

美团团队对DeepSeek R1模型进行了INT8量化,解决了GPU兼容性问题,支持A100等旧型号GPU的部署。量化后模型精度几乎无损,推理吞吐量提升50%。相关代码已开源,方便用户使用。

老显卡福音!美团技术团队开源首发INT8无损满血版DeepSeek R1

机器之心 机器之心 · 2025-03-03T02:26:05Z

Llamba是一种高效的循环语言模型,源自Llama-3.x,旨在克服变压器模型在推理吞吐量和大批量处理上的局限。该模型通过跨架构蒸馏,优化了速度、内存效率和性能,特别适用于智能手机和边缘平台。

Llamba: A Distilled Recurrent Model for Scalable Efficient Language Processing

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-02-20T00:00:00Z

本文探讨了Key-Value缓存的低秩特性,提出多种压缩方法以降低大型语言模型的内存占用并提高推理吞吐量。通过SqueezeAttention和自适应KV缓存等技术,实验证明可实现30%至70%的内存减少和最高2.2倍的吞吐量提升,同时保持生成质量。

RazorAttention:检索引导的高效 KV 缓存压缩

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-07-22T00:00:00Z

本文探讨了视觉语言模型的设计,旨在通过高效模型提高推理吞吐量,以应对数字助理在移动设备控制中的挑战。研究利用视觉输入和人类交互模拟,增强了人工智能代理的能力,并在多个基准测试中验证了其有效性。此外,提出了结合视觉能力的对话管理器,展望未来对话代理的应用。

现场互动的测试平台:健身教练指导

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-07-11T00:00:00Z

本文介绍了一种新方法,通过优化大型语言模型中的键值缓存,显著降低内存使用并提高推理吞吐量。该方法可减少内存消耗高达70%,提升吞吐量2.2倍,适用于多种模型和任务。采用自适应KV缓存和SqueezeAttention等技术,保持生成质量的同时提高效率。

金字塔推理:金字塔 KV 缓存压缩用于高吞吐率 LLM 推理

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-05-21T00:00:00Z

本文提出了一种优化视觉变压器(ViT)模型的压缩框架,显著降低了训练成本和计算复杂度。通过稠密特征提取和局部-全局令牌合并等方法,提高了推理吞吐量并缩短了训练时间。同时,介绍了硬件高效的标记修剪框架和令牌传播控制器等改进技术,进一步提升了模型的准确性和效率。

通过令牌扩展的 Transformer 通用高效训练

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-03-31T00:00:00Z

该论文研究了不同粒度的MoE模型中的路由策略,通过任务级路由在大规模数据集上实验,能够从大型稀疏模型中提取更小、可部署的子网络。实验结果显示,task-MoE在WMT上的表现比token-MoE高1.0 BLEU,并且推理成本相同。在扩展到200种语言对时,task-MoE提高了推理吞吐量2.6倍。

利用层间专家亲和性加速混合专家模型推理

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-01-16T00:00:00Z

本文介绍了一种新的注意力模型Mamba,它基于SSM架构,具有线性复杂度和5倍推理吞吐量。Mamba在多个模态上表现出SOTA水平,在预训练和下游任务上都优于同类模型。作者认为Mamba是通用序列模型骨干的有力候选者。

一文通透想颠覆Transformer的Mamba:从SSM、HiPPO、S4到Mamba

结构之法 算法之道 结构之法 算法之道 · 2023-12-11T04:48:36Z

该论文研究了不同粒度的MoE模型中的路由策略,通过任务级路由在数据集上进行实验,能够从大型稀疏模型中提取更小、可部署的子网络。实验结果表明,task-MOE在30种语言对上的表现平均比token-MoE高1.0 BLEU,并且能够保留所有收益。同时,当扩展到200种语言对时,task-MoE表现相近,并且提高了推理吞吐量2.6倍。

令牌混合:通过跨样本聚合实现高效的 LLMs

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2023-10-24T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码