阿里巴巴发布Qwen3.8-Flash:“Qwen4架构的早期预览”

阿里巴巴发布Qwen3.8-Flash:“Qwen4架构的早期预览”

💡 原文英文,约1200词,阅读约需5分钟。
📝

内容提要

阿里巴巴发布Qwen3.8-Flash,一款1250亿参数的开源多模态MoE模型,作为Qwen4的架构预览。该模型在编码和办公任务上性能优越,训练资源仅需同类模型的九分之一,成本更低。它支持26万token上下文,可扩展至百万,并已在Hugging Face和ModelScope开放。开发者反应不一,有人称赞其能在消费级硬件运行,也有人认为本地模型尚不足以替代远程服务。

🔎

延伸解读

架构预览的战略意义

阿里巴巴将Qwen3.8-Flash定位为Qwen4的架构预览,提前开放权重,旨在让开发者社区尽早熟悉其混合注意力、门控残差等设计,以便在Qwen4正式发布前进行技术验证和代码规划。这种策略有助于降低未来迁移成本,并吸引开发者围绕其生态构建应用。

成本与性能的平衡

Qwen3.8-Flash在SWE-bench Pro等基准上表现优于部分同类模型,同时训练资源仅需约九分之一,显著降低训练和推理成本。这体现了其在性能与成本之间的优化,尤其适合对成本敏感的开发者。但需注意,这些数据来自阿里巴巴官方,实际效果可能因任务而异。

开发者体验的两极分化

开发者反馈不一:有工程师在消费级RTX 4090上成功运行该模型,认为本地部署门槛已降低;但也有开发者指出,本地模型在专业软件开发中仍无法完全替代远程服务,基础能力存在不足。这表明模型虽具潜力,但实际应用仍需谨慎评估。

Q&A

Qwen3.8-Flash是什么?它和Qwen4有什么关系?

Qwen3.8-Flash是阿里巴巴发布的一款开源多模态MoE模型,拥有1250亿参数,被视为Qwen4架构的早期预览。它旨在展示Qwen4将采用的设计形式,让开发者提前了解和测试。

Qwen3.8-Flash在哪些任务上表现突出?

Qwen3.8-Flash在编码和办公任务上具有优越能力,在agentic coding、长时程agent任务和多模态智能等基准测试中表现良好。

Qwen3.8-Flash的训练成本如何?

Qwen3.8-Flash的训练资源仅为同类模型的九分之一,显著降低了训练和推理成本,相比其3倍大小的Qwen3.7-Plus更具成本效益。

Qwen3.8-Flash的上下文长度是多少?

Qwen3.8-Flash原生支持262,144个token的上下文,并可通过YaRN扩展到1,000,000个token。

Qwen3.8-Flash在消费级硬件上能运行吗?

有开发者表示,Qwen3.8-Flash-Next(125B A6B)可以在单张24GB RTX 4090上运行,支持250,000上下文窗口,解码速度21 tokens/sec,预填充364 t/s,无需量化或KV cache优化。

开发者对Qwen3.8-Flash的评价如何?

开发者反应不一。有人称赞其能在消费级硬件上运行,认为VRAM限制已死;也有人认为本地模型尚不足以替代远程服务,在专业软件开发中表现不佳。

Qwen3.8-Flash的API价格是多少?

Qwen3.8-Flash的API定价为每百万token输入0.16美元,输出0.47美元(中国开发者输出为3元人民币)。

Qwen3.8-Flash在QwenWork上有什么改进?

在QwenWork上,Qwen3.8-Flash运行重新设计的“标准模式”,每个任务的token消耗减少75%,生成速度大约翻倍。

🏷️

标签

➡️

继续阅读