RunningHub 为 MiniMax H3 开源模型推出 H3 Lightning 加速方案,结合后训练加速模型、SageAttention2、Cache-DiT、torch.compile 及 TP2+Ulysses4 多卡并行,在无 NVLink 的 PCIe 多卡环境下实现约 12 倍提速,5 秒视频生成时间从 348.8 秒降至 28.7 秒,并保留 BF16 精度。该方案已开源,可降低创作者试错成本。
DeepSeek 开源高性能 TopK 算子库 DeepSelect,针对稀疏注意力中的闪电索引器和采样器两个场景优化,速度可达 torch.topk 的 2 至 20 倍。该库不绑定推理框架,可通过 pip 直接替换,结果稳定,并支持关闭排序和返回值以进一步提速,助力 V4.1 Flash 推理大幅加速。
美团智播数字人直播的核心难点在于稳定支撑大规模并发,而非形象逼真。文章强调推理加速以控制算力成本,身份一致性是可信度与合规问题,需自动检测与兜底策略。普通团队应先从窄链路试点,配好监控与人工接管,再决定扩展,落地需解决调度、缓存等工程问题。
推测式程序化工具调用(sPTC)是一种在生成代码时预启动工具调用的技术,尤其适用于子代理或子LLM等高延迟工具。通过影子REPL解析部分代码,缓存工具输出,可重叠计算与生成,提升推理速度约1-1.2倍。实现需处理字面量、依赖变量及条件循环等场景,并控制安全性与开销。该技术对本地模型和编码代理尤为有效,未来可结合JIT编译进一步优化。
mlx-dspack项目在Mac上通过投机解码技术,将Qwen3.8-27B模型推理速度提升至3倍,8-bit量化下性能优于4-bit。项目基于DeepSeek的DSpark和z-lab的DFlash,支持自动调参优化草稿长度。实测显示8-bit加投机解码比4-bit普通解码快39%,但加速效果受硬件、量化方式和MLX版本影响,长上下文和内存限制仍是瓶颈。
中科院团队提出GMC核心集剪枝方法,解决视觉语言模型Token冗余问题。该方法免训练,通过互补证据筛选和群体信息传输,保留关键视觉信息,减少80%以上Token,性能保持99%以上,并抑制幻觉,兼容Qwen、LLaVA等模型,提升推理速度,降低显存占用。
vLLM 是加速大语言模型推理的框架,通过高效KV缓存管理减少内存浪费。文章提供Helm图表部署配置,并演示解耦预填充示例:启动预填充和解码两个实例,通过代理服务器传输KV缓存,实现请求处理,包含安装依赖、启动服务及测试请求的完整流程。
移远通信在WAIC 2026上宣布升级端侧AI大模型方案,聚焦多模态感知与推理加速。新增视觉大模型,使设备具备听懂、看懂和自主决策能力,应用于智能制造、智能座舱等领域。引入MTP和SD技术,推理速度提升至2倍,生成速度从25增至50+ tokens/s,加速AI商业化落地。
DeepSeek与北京大学联合发布了论文《DSpark》,提出了一种新的推理加速框架。DSpark通过半自回归架构和基于置信度的验证,显著提高了生成速度,单用户生成速度提升57%至85%。该框架在真实用户流量中表现优异,解决了大模型推理中的延迟问题,并优化了候选token的生成和验证过程。DeepSeek还开源了DSpark的模型权重和相关代码库。
vLLM 是一款专为大语言模型推理加速设计的框架,解决了内存管理瓶颈,实现了 KV 缓存内存的零浪费。使用时需关闭多处理以确保结果可复现,并设置种子。该框架在相同硬件和版本下提供可重复性。
小米新开源模型MiMo-V2-Flash参数为309B,展现出高效能,推理加速达2.6倍,具备出色的代码能力和良好的情感理解,成功进入开源第一梯队,助力小米转型为“大模型公司”。
本文介绍了镜像推测解码(Mirror-SD)算法,该算法通过并行处理和多令牌推测流来加速大型语言模型(LLM)的推理,打破了延迟与接受率之间的权衡。Mirror-SD在多种任务中实现了2.8到5.8倍的速度提升,并在性能上超越了现有基线EAGLE3,满足了快速高效推理的需求。
Intel的AutoRound算法已集成至LLM Compressor,支持低位宽量化,提升模型准确性并简化工作流程。该算法优化了多种数据类型的量化,旨在加速推理,未来将扩展支持更多格式和模型,以促进实际部署。
高通推出AI200和AI250两款新AI芯片,进军数据中心市场,股价上涨20%。这两款芯片专注于推理加速,具备高能效和低总拥有成本,预计2026年和2027年商用。高通希望通过技术积累和市场需求,挑战英伟达的市场份额。
vLLM 是一款专为大语言模型推理加速设计的框架,解决了内存管理瓶颈问题,支持几乎零浪费的 KV 缓存内存和多种提示方式,适用于编码器/解码器模型,如 BART,提升推理效率。
飞桨PaddlePaddle推出扩散模型推理加速插件,利用模型蒸馏和推理缓存等技术,将推理速度提升超过2倍,同时保持生成质量。主要方法包括SortBlock、TeaBlockCache和FirstBlock-Taylor,开发者可灵活应用这些插件以优化实时应用。
vLLM 是一款专为大语言模型推理加速设计的框架,解决了内存管理瓶颈,实现了几乎零浪费的 KV 缓存内存,支持多种参数设置,能够高效生成文本,适用于 AI 应用。
Gemma 3n正式发布,专注于移动设备的AI应用。采用Per-Layer Embeddings技术减少RAM需求,同时保持参数数量。MatFormer技术支持模型嵌套,允许选择完整模型或子模型。此外,Gemma 3n引入KV缓存共享,加速推理时间,并具备音频和视频编码能力,支持自动语音识别和翻译。
vLLM 是一款专为大语言模型推理加速设计的框架,解决了内存管理瓶颈,实现了 KV 缓存内存几乎零浪费。它支持离线演示和 API 调用,用户可以通过简单的代码实现天气查询等功能。
vLLM是一个专为大语言模型推理加速设计的框架,解决了内存管理瓶颈,实现了KV缓存内存几乎零浪费。它支持音频语言模型的离线推理,并提供多种模型的使用示例,适用于不同的音频输入。
完成下面两步后,将自动完成登录并继续当前操作。