源神启动!一张消费级显卡跑“Opus级”Agent,Qwen3.8-27B多项榜单反超Claude

源神启动!一张消费级显卡跑“Opus级”Agent,Qwen3.8-27B多项榜单反超Claude

💡 原文中文,约3300字,阅读约需8分钟。
📝

内容提要

Qwen3.8-27B开源,拥有270亿参数,支持原生多模态和262K上下文,可扩展至100万Token。在SWE-bench Pro和QwenSWEBench上超越Claude Opus 4.6 Max,Agent和多模态评测表现优异。内置推理档位可调,支持关闭Thinking模式,默认开启preserve_thinking。量化后可在24GB显存显卡运行,支持Transformers、vLLM等部署。

🔎

延伸解读

本地部署门槛与量化

Qwen3.8-27B总参数量270亿,官方提到量化后可在24GB显存的消费级显卡(如RTX 3090、4090)上运行,这降低了本地部署门槛。但需注意,量化可能带来一定性能损失,且实际运行效果还取决于具体任务和硬件配置。对于没有高端显卡的用户,仍可考虑云服务或使用官方支持的Transformers、vLLM等框架进行部署。

推理档位与成本控制

模型内置推理档位,支持reasoning_effort调节(xhigh、medium、low),并可关闭Thinking模式。这为开发者提供了灵活控制推理深度和响应速度的手段:复杂任务可调高档位,简单任务调低或关闭,以节省计算资源和成本。默认开启的preserve_thinking功能有助于长程Agent任务保持上下文连贯,减少重复推理,但也会占用更多KV Cache,需根据实际场景权衡。

多模态与Agent能力

Qwen3.8-27B原生支持多模态,能处理图片、PDF、图表甚至视频,在OSWorld-Verified、AndroidWorld等Agent评测中得分超过Claude Opus 4.6 Max。但需注意,这些评测结果基于特定基准,实际应用效果可能因任务复杂度而异。多模态能力在本地部署时可能受限于显存和推理速度,建议在部署前评估具体需求。

Q&A

Qwen3.8-27B是什么?它有哪些主要特点?

Qwen3.8-27B是阿里开源的大语言模型,拥有270亿参数,支持原生多模态(可处理图片、PDF、图表和视频)、262K原生上下文(可扩展至100万Token),并强化了编程、专业工作、研究和长程Agent能力。

Qwen3.8-27B在编程和Agent评测中表现如何?

在SWE-bench Pro上,Qwen3.8-27B比Claude Opus 4.6 Max高8.3分;在QwenSWEBench上领先15.2分;在CoWorkBench上达到70.7分,超过Opus 4.6 Max的68.2分。

Qwen3.8-27B在多模态评测中的表现如何?

在OSWorld-Verified上得分84.3,超过Opus 4.6 Max的72.7;在AndroidWorld上得分81.9,远超Opus的62.0;在WebArena-Verified上从上一代的48.8提升到64.8;视觉数学问题解决能力开启CI后得分94.6,通用视觉推理开启CI后得分85.6(不开CI为65.7)。

Qwen3.8-27B的推理档位如何调节?

模型默认开启Thinking模式,支持通过reasoning_effort调节推理深度,分为xhigh、medium和low三档。复杂任务可调高,简单任务可调低以提升速度和降低成本。此外,Thinking模式也可以直接关闭,让模型跳过推理直接回答。

preserve_thinking功能有什么作用?

preserve_thinking默认开启,它能让Agent前几轮的思考过程保留在后续上下文中,例如Coding Agent连续修改多个文件时,可以沿用之前的决策,减少重复思考,同时更好地利用KV Cache。

Qwen3.8-27B的架构有什么特点?

模型共64层,其中48层采用Gated DeltaNet线性注意力,16层保留完整Attention,按“三层线性注意力+一层完整Attention”的节奏循环。线性注意力降低长序列计算和缓存压力,完整Attention保证信息交互,从而支持262K原生上下文并可扩展至100万Token。

如何部署和运行Qwen3.8-27B?

官方支持Transformers、vLLM、SGLang和TokenSpeed。生产环境推荐使用SGLang或vLLM等Serving引擎。Hugging Face提供量化版本,量化后可在24GB显存的RTX 3090/4090等消费级显卡上运行,也可在内存较大的Mac上部署。

🏷️

标签

➡️

继续阅读