mlx-dspack项目在Mac上通过投机解码技术,将Qwen3.8-27B模型推理速度提升至3倍,8-bit量化下性能优于4-bit。项目基于DeepSeek的DSpark和z-lab的DFlash,支持自动调参优化草稿长度。实测显示8-bit加投机解码比4-bit普通解码快39%,但加速效果受硬件、量化方式和MLX版本影响,长上下文和内存限制仍是瓶颈。
DeepSeek的新论文DSpark提出了一种通过系统工程和模型协同设计来提升大模型推理速度的方法。该方法利用GPU的特性进行连续批处理,结合小模型的快速猜测和大模型的验证,显著提高推理效率。DSpark通过优化草稿模型和动态调整验证长度,实现了端到端的性能提升,并已开源相关代码供开发者使用。
本文讨论了系统工程的关键要点,强调理解十个重要点即可掌握核心内容。
DeepSeek与北京大学联合发布了论文《DSpark》,提出了一种新的推理加速框架。DSpark通过半自回归架构和基于置信度的验证,显著提高了生成速度,单用户生成速度提升57%至85%。该框架在真实用户流量中表现优异,解决了大模型推理中的延迟问题,并优化了候选token的生成和验证过程。DeepSeek还开源了DSpark的模型权重和相关代码库。
DeepSeek团队与北京大学联合发布了《DSpark》研究论文,提出了一种加速大模型推理的新方法。该技术在保持文本生成质量的同时,显著提升了推理速度,单用户生成速度提高85%。DSpark采用“半自回归生成”架构和置信度调度验证机制,优化了生成过程,减少了计算资源浪费,并已在DeepSeek-V4系统中应用,提升了推理效率。
DeepSeek的研究表明,通过让AI模型先“猜测”后续内容,再进行验证,可以显著提高推理速度。这种“猜测-验证”机制减少了计算量,并提高了准确率。与美国公司的保密技术不同,中国公司通过开源技术降低了AI模型的成本,使其更为普及。这一变化可能导致AI服务价格大幅下降,影响投资者对AI公司的预期。
DeepSpec发布的DSpark算法通过引入“秘书”模型,将大语言模型的生成速度提升了6倍,同时保持输出质量不变。DSpark结合并行生成和顺序依赖,优化了计算效率,减轻了GPU负担。该框架已开源,适用于高并发场景,显著提升用户体验。
完成下面两步后,将自动完成登录并继续当前操作。