Qwen3.8-Flash-Next开源实测:1/9成本干翻自家397B旗舰!

Qwen3.8-Flash-Next开源实测:1/9成本干翻自家397B旗舰!

💡 原文中文,约3800字,阅读约需9分钟。
📝

内容提要

阿里通义千问发布Qwen3.8-Flash-Next开源模型,采用MoE、GDN、QSA、Gated Residual和N-gram Embedding等创新架构,125B参数仅激活6B,成本为前代九分之一,性能超越397B旗舰。训练中发现Muon优化器下Batch Size Warmup无效,可节省18.8%算力,引发行业反思。

🔎

延伸解读

架构创新如何实现低成本高性能

Qwen3.8-Flash-Next通过MoE、GDN、QSA等架构创新,在125B参数中仅激活6B,实现了成本降至前代九分之一且性能超越397B旗舰。这打破了参数规模决定性能的传统认知,展示了高效架构在降低推理成本方面的潜力,对AI应用部署具有重要意义。

硬件适配与部署挑战

实测显示,模型在不同硬件上性能差异显著,如DGX Spark上仅12 tok/s,而Strix Halo可达22 tok/s。此外,N-gram Embedding虽不占显存,但存储开销大,4-bit量化需100GB以上,1-bit也需73GB。这提示新架构对硬件要求高,部署时需谨慎评估硬件兼容性和资源需求。

训练优化发现引发行业反思

团队发现Batch Size Warmup无效,去除后可节省18.8%的算力。这一发现挑战了长期以来的训练惯例,引发对现有训练流程中潜在浪费的思考。但该结论是否普遍适用尚待验证,行业需进一步研究以确认其影响。

Q&A

Qwen3.8-Flash-Next是什么?它的主要特点有哪些?

Qwen3.8-Flash-Next是阿里通义千问团队于2026年8月26日开源的大语言模型。它采用MoE架构,总参数125B,但每次只激活6B参数,额外包含51B的N-gram Embedding。原生支持262144个token上下文,可扩展到100万token。训练成本仅为上一代Qwen3.7-Plus的九分之一,API定价为输入每百万token一元,输出三元。在多个基准测试中表现优异,如DeepSWE 1.1得分58.7,SWE-bench Pro得分62.5,LiveCodeBench v6得分91.9。

Qwen3.8-Flash-Next的MoE架构是如何工作的?为什么能提高效率?

MoE(专家混合)架构包含512个专家,每个token只激活10个专家和1个共享专家。这就像医院有512个科室,但每个病人只看最相关的两三个科室。虽然总参数多,但每次计算只使用少量专家,从而降低计算成本,提高效率。

GDN(Gated DeltaNet)在Qwen3.8-Flash-Next中起什么作用?

GDN是一种线性注意力机制,用于压缩长序列的记忆,将计算复杂度从平方级降至线性级。它结合了门控机制和增量更新规则,能自适应擦除不需要的记忆并精准修改需要保留的信息。Qwen3.8-Flash-Next使用了36层GDN,每四层中三层是GDN,有效处理长上下文。

QSA(Qwen Sparse Attention)如何实现高效的长上下文处理?

QSA是一种稀疏注意力机制,它先将序列按4个一组压缩成micro-block,在块级别判断重要性,然后选择最多512个块(2048个词)进行注意力计算。这避免了传统注意力对所有词的计算,提高了效率。实测在100万token下,Prefill速度提升7.6倍,Decode速度提升4.9倍。

Gated Residual在模型中的作用是什么?它带来了哪些改进?

Gated Residual是残差连接的改进版本,将单条残差路径扩展为4条并行分支,每条分支用动态门控控制信息读写。这有助于信息在深层网络中传递,避免早期信息被冲淡。分析发现其中一条分支形成了跨越大部分层的长距离通道。残差状态可用FP8存储,降低访存开销,配合NVIDIA FlashInfer实现kernel级加速2.05倍。

N-gram Embedding是什么?它如何在不增加计算负担的情况下提升模型能力?

N-gram Embedding是一种嵌入方法,它考虑当前词及其前面几个词的局部上下文,而不仅仅是单个词。Qwen3.8-Flash-Next额外增加了51B的N-gram Embedding参数,这些参数存储在Host Memory中,使用时再调用,不长期占用显存,因此计算代价几乎为零。这有助于模型理解词组含义,提升语言理解能力。

Muon优化器相比传统AdamW有什么优势?Qwen团队如何应用它?

Muon优化器直接在矩阵形态上做正交化,而不是将参数压扁成一维向量更新。研究表明它在LLM训练中持续比AdamW更快,尤其在尾部联想记忆学习方面。Qwen团队只对真正的二维线性映射参数使用Muon,其他参数用AdamW,并针对新架构重新拟合Scaling Law,发现可以使用更大的学习率和Batch Size。

Batch Size Warmup为什么被证明无效?它带来了什么影响?

Qwen团队发现Batch Size Warmup完全没必要,实验证明它没有效果,反而多消耗了18.8%的optimizer steps。去掉之后,同样的token预算下能多跑18.8%的步数。这一发现引发行业反思,可能意味着过去几年所有大模型的训练都在浪费近五分之一的计算资源。

Qwen3.8-Flash-Next在实际使用中可能遇到哪些问题?

实际使用中可能遇到以下问题:1)在xhigh推理等级下会过度思考,简单问题可能思考10分钟,有时反而写出更烂的代码;2)模型对硬件适配要求高,不同硬件性能差异大,如DGX Spark上只有12 tok/s,Strix Halo上为22 tok/s;3)存储开销大,4-bit量化需要100GB以上,1-bit量化版也要73GB,普通机器难以运行。

🏷️

标签

➡️

继续阅读