阿里千问Qwen3.8-27B实测碾压Opus 5!一张3090就够了

阿里千问Qwen3.8-27B实测碾压Opus 5!一张3090就够了

💡 原文中文,约5700字,阅读约需14分钟。
📝

内容提要

阿里开源Qwen3.8-27B模型,在编程等任务上超越Claude旗舰,仅需一张二手3090显卡即可运行。其Sharp聊天模板优化了性能,引发对云端订阅价值的质疑。但测试条件存疑,结果可能仅在特定配置下成立,开源与闭源模型竞争仍存变数。

🔎

延伸解读

开源模型的新里程碑

Qwen3.8-27B在多个基准测试中超越Claude旗舰,如SWE-bench Pro得分61.7,高于Opus 4.6 Max的53.4。这标志着开源模型首次在编程等任务上达到或超过顶级闭源模型,且仅需一张二手3090显卡即可运行,大幅降低了高性能AI的门槛。

聊天模板的优化潜力

Sharp聊天模板通过精简提示词结构,将MTP接受率从77.6%提升至82.8%,解码吞吐量提升约19%。这表明模型性能不仅取决于参数规模,提示词工程同样关键。优化模板可显著提升效率,为本地部署提供了额外优势。

闭源模型的挑战与争议

Claude Opus 5在真实任务中表现不佳,如GitHub Issue #82162指出其简单任务需多次重试,且对荒谬问题过于轻信。这引发对闭源模型质量下滑的质疑,但测试条件可能不全面,如推理强度配置未明确,结果需谨慎解读。

本地部署的实用考量

本地模型在速度上已接近云端,如RTX 5090上解码速度达76.8 token/s,且无网络延迟。但部署需技术知识,如量化、模板调优。开源工具链如Pi正简化流程,但数据主权和成本优势需权衡,订阅费与硬件投资需根据使用频率评估。

Q&A

Qwen3.8-27B是什么?它有哪些主要特点?

Qwen3.8-27B是阿里巴巴千问团队于2026年8月14日开源的一个270亿参数的原生多模态稠密模型。它支持文本、图像等多种模态,并且可以在消费级硬件上运行,量化后仅需17GB显存。在多个基准测试中表现出色,尤其在编程和智能体任务上超越了Claude旗舰模型。

Qwen3.8-27B在哪些基准测试中超越了Claude旗舰模型?具体分数是多少?

Qwen3.8-27B在SWE-bench Pro上获得61.7分,超过Claude Opus 4.6 Max的53.4分;在LiveCodeBench v6上获得90.3分,登顶排行榜;在Agentic terminal coding基准上获得73.0分;在DeepSWE 1.1上获得42.2分,是前代的三倍多;在OSWorld-Verified上获得84.3分,比Opus 4.6 Max高出11.6分。

Sharp聊天模板是什么?它如何提升模型性能?

Sharp聊天模板是一套针对Qwen系列模型优化的提示词结构,由社区开发者设计。它精简了提示词,修复了官方模板的bug,从而减少了token消耗并提升了模型的理解能力。使用Sharp模板后,MTP接受率从77.6%提升到82.8%,解码吞吐量提升了约19%。

运行Qwen3.8-27B需要什么样的硬件?速度如何?

量化后的Qwen3.8-27B仅需17GB显存,一张二手RTX 3090(24GB显存)即可运行。在RTX 5090上,经过NVFP4优化后,解码速度可达每秒206.1个token;在AMD Radeon AI PRO R9700上,单卡可达51.8 token/s。使用Ninfer推理引擎和Sharp模板,在RTX 5090上速度可达76.8 token/s,与云端API速度相当。

Claude Opus 5在真实世界编码任务中表现如何?有哪些具体问题?

Claude Opus 5在真实编码任务中表现不佳,存在质量滑坡。例如,在GitHub Issue #82162中,用户报告Opus 5在添加博客页面时设计过时、需要多轮修正、输出冗余内容,且模型报告完成但实际未完成。此外,Issue #83510显示Opus 5对无意义提示的识别率低于旧版,且Fable 5会静默路由到Opus 4.8。

本地部署Qwen3.8-27B相比使用云端Claude有哪些优势和劣势?

优势包括:数据主权(代码不出本地)、无网络延迟、无服务中断、成本可控(一次性硬件投入可替代订阅费)、速度可与云端媲美。劣势包括:需要技术知识(量化、GGUF格式、推理引擎配置、模板调优),且性能可能受特定配置影响,存在复现性问题。

关于Qwen3.8-27B超越Claude Opus 5的测试结果,存在哪些争议或未解之谜?

争议点包括:测试条件可能特定(特定模板、量化、推理引擎、任务集、Claude配置),且未明确测试是在聊天模式还是Agent模式下进行;Sharp模板在Agent场景下可能因“不要猜”指令而影响性能;Claude Opus 5的“High”模式可能不是最佳配置,而“Max”模式表现可能不同;测试结果可能只是单次运行,存在噪声。

🏷️

标签

➡️

继续阅读