内容提要
阿里通义实验室开源Qwen 3.8 27B模型,以270亿参数在DeepSWE编程测试中超越万亿参数的Opus 4.6 Max,引发热议。其成功依赖“测试时扩展”技术,通过拉长思考时间弥补参数不足,但推理极慢,且存在刷榜争议。本地部署可行,但速度与质量需权衡,参数规模不再是唯一标准。
延伸解读
参数规模不再是唯一标准
Qwen 3.8 27B在DeepSWE上以42.2%的通过率超过万亿参数的Opus 4.6 Max,表明参数规模不再是衡量模型能力的唯一标尺。测试时扩展等技术让小模型通过拉长思考时间弥补参数不足,在复杂任务上逼近甚至超越大模型。这挑战了“参数越大越聪明”的传统认知,也促使行业重新评估AI竞赛的技术路线和投资逻辑。
Benchmark分数需谨慎解读
文章指出,公共benchmark分数可能受“刷榜”影响,即模型针对测试集优化,导致分数虚高。例如,Terminal-Bench从2.1到3.0版本,GLM 5.2的分数从78%跌至4.6%,说明题目变化后分数可能崩塌。因此,Qwen 3.8 27B的42.2%虽在数据上成立,但“打败”Opus的说法需谨慎对待,实际表现可能不如benchmark暗示。
推理速度与质量的权衡
Qwen 3.8 27B依赖“测试时扩展”,通过大量思考token提升答案质量,但代价是推理极慢。例如,生成一个SVG图耗时21分钟,消耗22,276个思考token。用户需权衡速度与质量:是愿意多等几分钟获得更可靠答案,还是选择更快但可能出错的模型。通过工程优化(如MTP、调整推理强度)可提升速度,但硬件配置仍是关键限制。
本地部署的硬件门槛
Qwen 3.8 27B可在普通设备上运行,但速度差异巨大。在64GB内存笔记本上,MoE版本可达20 token/秒,而密集模型仅4 token/秒;在RTX 4090上优化后可达到70-80 token/秒。硬件成本方面,Intel B70显卡(1500美元,32GB显存)可流畅运行,而RTX 5090价格高昂。用户需根据自身硬件和需求选择合适配置。
Q&A
Qwen 3.8 27B是什么?它在DeepSWE测试中表现如何?
Qwen 3.8 27B是阿里通义实验室于2026年8月15日开源的一个270亿参数的大语言模型。在DeepSWE编程基准测试中,它取得了42.2%的通过率,超过了Anthropic的万亿参数模型Opus 4.6 Max(40%)。
Qwen 3.8 27B为什么能在参数远小于Opus的情况下取得更高分数?
Qwen 3.8 27B主要依靠“测试时扩展”技术,即在推理阶段通过拉长思考时间(生成大量思考token)来弥补参数规模的不足。它默认使用“xhigh”推理强度,会进行大量自我推演和纠偏,从而在复杂任务上表现更好。
Qwen 3.8 27B的推理速度如何?有哪些优化方法?
Qwen 3.8 27B推理速度较慢,例如在M5 Max MacBook Pro上生成一个SVG图耗时21分钟。但通过工程优化可以大幅提升速度:在RTX 4090上,通过开启MTP(多令牌预测)、调整KV cache量化类型和推理强度,可以达到70-80 token/秒。
Qwen 3.8 27B在本地部署需要什么硬件配置?
Qwen 3.8 27B可以在普通笔记本上运行,但速度较慢。例如,64GB内存的笔记本跑密集模型约4 token/秒,而MoE版本(如Qwen 3.6 35B A3B)可达20 token/秒。在高端显卡如RTX 4090上可流畅运行,Intel B70显卡(32GB显存)也是预算选择。
Qwen 3.8 27B的benchmark成绩是否存在争议?
存在争议。有网友指出Qwen模型在benchmark上做了优化,实际表现可能不如分数暗示的那么好。例如,有用户发现GLM 5.2在Terminal-Bench版本更新后分数从78%暴跌至4.6%,说明benchmark分数可能受题目熟悉度影响。此外,Qwen 3.8 27B的42.2%可能部分归功于“测试时扩展”的推理机制,而非纯粹模型能力。
测试时扩展(Test-Time Scaling)是什么?它如何帮助小模型?
测试时扩展是一种在推理阶段增加计算量来提升模型表现的技术。传统模型在训练时把所有知识存入参数,而测试时扩展让模型在推理时通过生成大量思考token来模拟多种可能性、推演因果关系,从而弥补参数不足。Qwen 3.8 27B正是利用这一技术,在DeepSWE上超越了参数远大于它的Opus。
Qwen 3.8 27B的MoE版本和密集版本在速度上有何差异?
MoE(专家混合)版本只激活部分参数,因此速度更快。例如,Qwen 3.6 35B A3B(MoE)在64GB内存笔记本上可达20 token/秒,而同尺寸的密集模型只有4 token/秒。Qwen 3.8 27B是密集模型,速度较慢。