小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
吹爆开源!RunningHub让MiniMax H3满血提速12倍,本地部署照样起飞

RunningHub 为 MiniMax H3 开源模型推出 H3 Lightning 加速方案,结合后训练加速模型、SageAttention2、Cache-DiT、torch.compile 及 TP2+Ulysses4 多卡并行,在无 NVLink 的 PCIe 多卡环境下实现约 12 倍提速,5 秒视频生成时间从 348.8 秒降至 28.7 秒,并保留 BF16 精度。该方案已开源,可降低创作者试错成本。

吹爆开源!RunningHub让MiniMax H3满血提速12倍,本地部署照样起飞

量子位 量子位 · 2026-09-11T00:55:01Z
DeepSeek开源DeepSelect:比torch.topk快二十倍!

DeepSeek 开源高性能 TopK 算子库 DeepSelect,针对稀疏注意力中的闪电索引器和采样器两个场景优化,速度可达 torch.topk 的 2 至 20 倍。该库不绑定推理框架,可通过 pip 直接替换,结果稳定,并支持关闭排序和返回值以进一步提速,助力 V4.1 Flash 推理大幅加速。

DeepSeek开源DeepSelect:比torch.topk快二十倍!

极道 极道 · 2026-09-10T10:36:00Z
从美团智播看数字人直播:真正难的是稳定跑起来

美团智播数字人直播的核心难点在于稳定支撑大规模并发,而非形象逼真。文章强调推理加速以控制算力成本,身份一致性是可信度与合规问题,需自动检测与兜底策略。普通团队应先从窄链路试点,配好监控与人工接管,再决定扩展,落地需解决调度、缓存等工程问题。

从美团智播看数字人直播:真正难的是稳定跑起来

mongona news mongona news · 2026-09-03T22:38:52Z
推测式程序化工具调用

推测式程序化工具调用(sPTC)是一种在生成代码时预启动工具调用的技术,尤其适用于子代理或子LLM等高延迟工具。通过影子REPL解析部分代码,缓存工具输出,可重叠计算与生成,提升推理速度约1-1.2倍。实现需处理字面量、依赖变量及条件循环等场景,并控制安全性与开销。该技术对本地模型和编码代理尤为有效,未来可结合JIT编译进一步优化。

推测式程序化工具调用

blank blank · 2026-08-24T00:00:00Z
Qwen3.8-27B在Mac上快3倍:mlx-dspark无损加速实测揭秘

mlx-dspack项目在Mac上通过投机解码技术,将Qwen3.8-27B模型推理速度提升至3倍,8-bit量化下性能优于4-bit。项目基于DeepSeek的DSpark和z-lab的DFlash,支持自动调参优化草稿长度。实测显示8-bit加投机解码比4-bit普通解码快39%,但加速效果受硬件、量化方式和MLX版本影响,长上下文和内存限制仍是瓶颈。

Qwen3.8-27B在Mac上快3倍:mlx-dspark无损加速实测揭秘

极道 极道 · 2026-08-15T22:53:00Z
紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力

中科院团队提出GMC核心集剪枝方法,解决视觉语言模型Token冗余问题。该方法免训练,通过互补证据筛选和群体信息传输,保留关键视觉信息,减少80%以上Token,性能保持99%以上,并抑制幻觉,兼容Qwen、LLaVA等模型,提升推理速度,降低显存占用。

紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力

量子位 量子位 · 2026-08-12T10:54:29Z

vLLM 是加速大语言模型推理的框架,通过高效KV缓存管理减少内存浪费。文章提供Helm图表部署配置,并演示解耦预填充示例:启动预填充和解码两个实例,通过代理服务器传输KV缓存,实现请求处理,包含安装依赖、启动服务及测试请求的完整流程。

【vLLM 学习】Disaggregated Prefill

HyperAI超神经 HyperAI超神经 · 2026-08-07T07:49:38Z
移远通信端侧AI大模型解决方案迎来全面升级

移远通信在WAIC 2026上宣布升级端侧AI大模型方案,聚焦多模态感知与推理加速。新增视觉大模型,使设备具备听懂、看懂和自主决策能力,应用于智能制造、智能座舱等领域。引入MTP和SD技术,推理速度提升至2倍,生成速度从25增至50+ tokens/s,加速AI商业化落地。

移远通信端侧AI大模型解决方案迎来全面升级

全球TMT-美通国际 全球TMT-美通国际 · 2026-07-20T09:21:26Z
DeepSeeK 突然发布 DSpark,让 AI 的回答不再「挤牙膏」

DeepSeek与北京大学联合发布了论文《DSpark》,提出了一种新的推理加速框架。DSpark通过半自回归架构和基于置信度的验证,显著提高了生成速度,单用户生成速度提升57%至85%。该框架在真实用户流量中表现优异,解决了大模型推理中的延迟问题,并优化了候选token的生成和验证过程。DeepSeek还开源了DSpark的模型权重和相关代码库。

DeepSeeK 突然发布 DSpark,让 AI 的回答不再「挤牙膏」

爱范儿 爱范儿 · 2026-06-28T05:32:14Z

vLLM 是一款专为大语言模型推理加速设计的框架,解决了内存管理瓶颈,实现了 KV 缓存内存的零浪费。使用时需关闭多处理以确保结果可复现,并设置种子。该框架在相同硬件和版本下提供可重复性。

【vLLM 学习】Reproduciblity

HyperAI超神经 HyperAI超神经 · 2025-12-30T08:28:57Z

小米新开源模型MiMo-V2-Flash参数为309B,展现出高效能,推理加速达2.6倍,具备出色的代码能力和良好的情感理解,成功进入开源第一梯队,助力小米转型为“大模型公司”。

小米大模型“杀”进第一梯队:代码能力开源第一,智商情商全在线

量子位 量子位 · 2025-12-18T00:57:11Z
镜像推测解码:打破大型语言模型推理中的串行障碍

本文介绍了镜像推测解码(Mirror-SD)算法,该算法通过并行处理和多令牌推测流来加速大型语言模型(LLM)的推理,打破了延迟与接受率之间的权衡。Mirror-SD在多种任务中实现了2.8到5.8倍的速度提升,并在性能上超越了现有基线EAGLE3,满足了快速高效推理的需求。

镜像推测解码:打破大型语言模型推理中的串行障碍

Apple Machine Learning Research Apple Machine Learning Research · 2025-12-11T00:00:00Z

Intel的AutoRound算法已集成至LLM Compressor,支持低位宽量化,提升模型准确性并简化工作流程。该算法优化了多种数据类型的量化,旨在加速推理,未来将扩展支持更多格式和模型,以促进实际部署。

推动LLM的低位宽量化:AutoRound与LLM Compressor的结合

vLLM Blog vLLM Blog · 2025-12-09T00:00:00Z

高通推出AI200和AI250两款新AI芯片,进军数据中心市场,股价上涨20%。这两款芯片专注于推理加速,具备高能效和低总拥有成本,预计2026年和2027年商用。高通希望通过技术积累和市场需求,挑战英伟达的市场份额。

高通新款云端芯片公开!借推理抢英伟达蛋糕,市值一夜暴涨197.4亿美元

量子位 量子位 · 2025-10-29T04:01:21Z

vLLM 是一款专为大语言模型推理加速设计的框架,解决了内存管理瓶颈问题,支持几乎零浪费的 KV 缓存内存和多种提示方式,适用于编码器/解码器模型,如 BART,提升推理效率。

【vLLM 学习】Encoder Decoder

HyperAI超神经 HyperAI超神经 · 2025-07-23T02:20:02Z

飞桨PaddlePaddle推出扩散模型推理加速插件,利用模型蒸馏和推理缓存等技术,将推理速度提升超过2倍,同时保持生成质量。主要方法包括SortBlock、TeaBlockCache和FirstBlock-Taylor,开发者可灵活应用这些插件以优化实时应用。

PaddleMIX推出扩散模型推理加速工具箱Fast-Diffusers:自研缓存加速方案实现2倍+提速

百度大脑 百度大脑 · 2025-07-16T10:56:49Z

vLLM 是一款专为大语言模型推理加速设计的框架,解决了内存管理瓶颈,实现了几乎零浪费的 KV 缓存内存,支持多种参数设置,能够高效生成文本,适用于 AI 应用。

【vLLM 学习】Eagle

HyperAI超神经 HyperAI超神经 · 2025-07-09T03:59:29Z
Gemma 3n引入新技术以增强移动AI推理

Gemma 3n正式发布,专注于移动设备的AI应用。采用Per-Layer Embeddings技术减少RAM需求,同时保持参数数量。MatFormer技术支持模型嵌套,允许选择完整模型或子模型。此外,Gemma 3n引入KV缓存共享,加速推理时间,并具备音频和视频编码能力,支持自动语音识别和翻译。

Gemma 3n引入新技术以增强移动AI推理

InfoQ InfoQ · 2025-07-04T18:00:00Z

vLLM 是一款专为大语言模型推理加速设计的框架,解决了内存管理瓶颈,实现了 KV 缓存内存几乎零浪费。它支持离线演示和 API 调用,用户可以通过简单的代码实现天气查询等功能。

【vLLM 学习】Chat With Tools

HyperAI超神经 HyperAI超神经 · 2025-05-28T02:46:21Z

vLLM是一个专为大语言模型推理加速设计的框架,解决了内存管理瓶颈,实现了KV缓存内存几乎零浪费。它支持音频语言模型的离线推理,并提供多种模型的使用示例,适用于不同的音频输入。

【vLLM 学习】Audio Language

HyperAI超神经 HyperAI超神经 · 2025-05-09T09:42:06Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码