Qwen 3.8 Flash Next经优化后,单台算力舱解码速度从23 TPS提升至102 TPS,创世界纪录。18K预填充达2588 TPS,30K首字延迟11.43秒。其T5000芯片FP4算力2070T,远超DGX G10的1000T,单台性能相当于两台DGX G10组合,性价比极高。
Kimi K3是一个参数达到2.8万亿的大语言模型,性能与Fable 5和GPT-5.6相当。它在48小时内自设计了一颗专用芯片,解码速度超过每秒8700个token。K3的API定价与美国顶级模型相当,但推理效率更高,实际使用成本较低。用户对数据隐私的关注使得开源模型受到青睐,尤其是中国模型的崛起让美国厂商感到压力。
推测解码是一种加速大模型推理的方法,解决了显存带宽限制问题。通过一次性处理多个token,提升生成效率。经典算法如Medusa和EAGLE通过多头预测和特征自回归优化性能,而Lookahead解码则利用当前模型进行并行预测,无需额外模型。整体上,推测解码显著提高了解码速度和准确性,适用于多种场景。
美团龙猫LongCat推出新稀疏注意力机制LoZA,解码速度提升10倍,支持处理1M长文本。通过优化模型结构,降低计算复杂度,提高效率,同时保持稳定性能。该技术在长文本任务中优于同类模型,未来将支持动态稀疏比例,以适应不同场景需求。
浪潮信息的元脑R1推理服务器深度适配开源框架SGLang,支持超1000路用户并发访问DeepSeek R1 671B模型,解码速度达33 tokens/s,显存带宽为4.8TB/s。
本研究提出了一种新方法——每层每头视觉标记修剪(PLPHP),旨在提高大型视觉语言模型的推理效率。该方法通过动态调整视觉标记保留率,显著提升解码速度18%,减少缓存大小,同时保持较小的性能损失。
本研究利用Intel CPU的高级矩阵扩展(AMX)和非结构稀疏性,解决了大语言模型在推理阶段的内存限制和解码速度慢的问题,实现了1.42倍的延迟减少,并提供了开源稀疏内核方案,提升了大语言模型在常规计算平台上的可访问性。
本文介绍了NeRV-Enc和NeRV-Dec两个组件,显著提升了视频隐式表示的编码和解码速度。NeRV-Enc通过超网络实现104倍加速,NeRV-Dec的解码速度比传统方法快11倍,从而提高了视频处理效率。
本研究提出了一种新系统PASTA,旨在解决自回归大型语言模型的顺序解码局限。该系统通过学习语义独立性,优化并行解码,显著提升了解码速度和响应质量。
本研究提出了一种二维高斯喷溅(2DGS)方案,解决了隐式神经表示在图像表示中的高内存消耗和慢解码速度问题,成功利用高斯点表示大型图像。
本文提出了一种“延迟融合”方法,旨在解决端到端自动语音识别中大型语言模型的计算成本和词汇不匹配问题,从而提高解码速度和准确性,为ASR任务提供新的思路。
WebAssembly是一种字节码格式,支持在浏览器中运行C、C++和Rust程序,具备性能和代码复用优势。WebAssembly SIMD指令集可提升计算性能,FFmpeg在Web端音视频处理中的应用广泛,但其视频编解码性能不足。通过重写汇编加速,WebAssembly SIMD能显著提升FFmpeg的解码速度,预计1080P解码可达140 FPS。
许多应用开发者希望在Apple硅上本地运行大型语言模型(LLMs),以提高推理效率和保护用户隐私。本文介绍了如何优化和部署Llama-3.1-8B-Instruct模型,利用Apple的Core ML框架实现约33个tokens/s的解码速度。通过引入状态化的键值缓存和4位量化,显著提升了模型性能,适用于其他基于变换器的LLMs。
本研究提出通过替换分词器提高大语言模型效率,实验显示在不影响性能的情况下显著加快长文本解码速度,对模型应用有重要影响。
本文介绍了一种基于“假设采样”的算法,显著加速Transformer解码过程,提升速度2至8.7倍,同时保持生成质量。通过结合自回归抽样与新选择算法,提出了SpecDec++和早期退出推理等方法,优化了大型语言模型的推理效率。实验结果显示,这些方法在多个任务中均表现出色。
本文探讨了基于深度学习的自动语音识别(ASR)系统在标点符号和大小写恢复方面的改进方法。研究表明,卷积神经网络(CNN)、双向长短期记忆网络(BLSTM)和变形金刚模型等技术显著提高了标点预测的准确性和解码速度。同时,领域特定数据和动态解码窗口的方法有效解决了过度分段问题,提升了整体性能。
本文介绍了一种新型视频编码方法HNeRV,该方法通过可学习的内容自适应嵌入技术,提高了视频的压缩和解码效率。HNeRV在重构质量和收敛速度上优于传统编码方法,并且与现有编解码器相比,具有更快的解码速度和更大的灵活性。此外,研究还提出了D-NeRV和PNeRV等新框架,进一步提升了视频编码的性能和准确度。
本文介绍了一种非自回归流式Transformer(NAST),用于同时机器翻译(SiMT),通过新编码器和解码器降低延迟损失,实验证明其优于传统模型。此外,基于CTC的非自回归模型在语音翻译中显著提升了解码速度和翻译质量,展示了在多个基准测试中的优越性。
本文介绍了一种基于连接主义时间分类(CTC)的非自回归语音翻译模型,采用预测感知编码和跨层注意力方法,显著提高了解码速度和翻译质量。实验结果显示,该模型在多个基准测试中优于自回归模型,具有更高的BLEU分数和加速效果。
本文探讨了推测性解码技术在大型语言模型中的应用,采用级联方法和高效的多候选验证算法,显著提高了解码速度和生成质量。研究表明,该技术可实现2-3倍的加速,同时保持模型输出一致性,适用于资源受限设备,推动自然语言处理效率提升。
完成下面两步后,将自动完成登录并继续当前操作。