让本地 AI 更智能、更快速

让本地 AI 更智能、更快速

💡 原文英文,约1500词,阅读约需6分钟。
📝

内容提要

Junie Local 发布新模型 Qwen3.8-3.6-27B-blend,将 Qwen3.6 与 Qwen3.8 等比例合并,兼顾速度与能力。内部编程测试完成 37 项任务,接近 Qwen3.8 的 39 项,输出 token 减少 71%。LiveCodeBench 平均正确率 85.47%,优于 Qwen3.8。团队还优化了 MTP 推测解码,并新增 Windows NVIDIA 实验支持。

🔎

延伸解读

模型合并的简单有效

Qwen3.8-3.6-27B-blend 通过等比例合并 Qwen3.6 和 Qwen3.8 的权重得到,无需额外后训练。这种简单方法在内部编程测试中完成了 37 项任务,接近 Qwen3.8 的 39 项,同时输出 token 减少 71%。这表明模型合并可以在不增加训练成本的情况下,有效平衡速度与能力,为本地 AI 部署提供了实用方案。

MTP 推测解码的权衡

Junie Local 使用多 token 预测(MTP)加速生成,但并非提议越多 token 越好。在 M5 MacBook Pro 上,每轮提议 2 个 token 比无 MTP 快 60%,而提议 4 个 token 时加速降至 36%,因为额外的 GPU 工作抵消了收益。此外,Q4 与 Q8 精度的 MTP 头在接受率和解码速度上无显著差异,因此团队保留 Q4 以节省内存。

评估中的随机种子陷阱

开发早期,内部评估出现性能下降,但实际使用中无法复现。原因是评估时为可复现性固定了随机种子,导致数值不稳定,模型可能被引导回失败动作。Qwen3.8 受此影响尤为明显。修正方法是让种子随每个代理步骤和反思尝试推进,既保持可复现性,又允许后续尝试走不同路径。这提醒我们评估设置可能扭曲模型真实表现。

实际使用建议与限制

当模型陷入困境时,可能会过度思考,反复尝试相同方法。建议中断并重新启动,设定更窄的目标。此外,成功推理路径的长度存在显著差异,选择较短的正确轨迹可减少 24.5% 的 token 使用,暗示模型有潜力学习更高效的路径。目前,Apple M5 用户可通过 Junie 使用新模型,Windows 用户可尝试实验性 RTX 支持,但需至少 24GB VRAM 的 Ampere 或更新架构显卡。

Q&A

Qwen3.8-3.6-27B-blend 模型是怎么构建出来的?

该模型通过将 Qwen3.6 和 Qwen3.8 的权重按等比例合并而成,两者架构相同,因此直接合并权重即可得到一个单一的 27B 模型,无需额外的后训练。

新模型在编程任务上的表现和 token 效率如何?

在 100 项内部编程基准测试中,新模型完成了 37 项任务,接近 Qwen3.8 的 39 项,但输出 token 比 Qwen3.8 减少了 71%。在两者都完成的 30 项任务上,新模型仅用了 279K token,而 Qwen3.8 用了 935K,减少了约 70%。

在 LiveCodeBench 上,新模型与 Qwen3.8 和 Qwen3.6 相比表现如何?

在四次 LiveCodeBench 运行中,新模型平均正确率为 85.47%,Qwen3.8 为 83.29%,Qwen3.6 为 67.87%。新模型每次运行约使用 614 万输出 token,而 Qwen3.6 约使用 2410 万。

MTP 推测解码中,每轮提议多少 token 速度最快?

在 M5 MacBook Pro 上,每轮提议两个 token 时,解码速度比不使用 MTP 快 60%;增加到四个 token 时,加速效果降至 36%,因为额外的 GPU 工作抵消了收益。

为什么 MTP 在长上下文下会变慢?

因为验证过程中计算注意力所花费的时间大幅增加,从每轮 8.4 毫秒上升到 40.2 毫秒,而前馈和 Gated DeltaNet 计算几乎不变,导致长会话中响应变慢。

如何试用 Qwen3.8-3.6-27B-blend 模型?

Apple M5 用户可以通过 Junie 运行 /model 命令并选择 Qwen3.8-3.6-27B-blend 来切换。Windows 用户可以使用 nightly 版本(junie --channel=nightly),该版本为基于 Ampere 或更新架构、至少 24GB 显存的 NVIDIA RTX 显卡提供实验性支持。模型也可在 Hugging Face 上获取。

🏷️

标签

➡️

继续阅读