原文英文,约1800词,阅读约需7分钟。
📝
内容提要
JetBrains团队优化Qwen3.6-27B模型以支持Junie本地运行,通过扩展滚动上下文复用KV缓存、调整提示词顺序、禁用推理模式提升速度,并采用4位量化及优化推理引擎的预填充和投机解码。相比Qwen3.8,3.6无需推理模式,性能更佳,适合Mac硬件。
🔎
延伸解读
本地推理的瓶颈:预填充速度
文章指出,在Mac M5上,模型预填充速度远低于生成速度,成为主要瓶颈。默认配置下预填充约650 t/s,而离散GPU可达3700 t/s。这意味着处理文件读取等任务时,大部分时间花在预填充上。优化预填充(如切换到8位运算)能带来约40%的速度提升,这比单纯优化生成速度更重要。
量化与预填充速度的关系
通常认为4位量化能提升速度,但文章发现预填充速度在4位、8位和16位量化下没有差异,因为预填充是计算密集型,且权重在运算前被转换为16位。只有利用M5的8位运算指令,才能显著加速预填充。这提醒我们,量化对生成速度的影响可能大于对预填充的影响,需针对硬件特性优化。
模型选择:3.6 vs 3.8
Qwen 3.8虽然更新,但必须启用推理模式才能正常工作,否则输出质量严重下降甚至陷入循环。启用推理模式后,生成token数增加约5倍,导致整体速度降低约4倍。相比之下,Qwen 3.6禁用推理模式后质量影响不大,且速度提升2倍,因此更适合本地部署。这体现了模型特性对实际应用的影响。
🏷️