在线教程丨Qwen4架构抢先体验,Qwen3.8-Flash-Next开源,训练成本仅为前代1/9

在线教程丨Qwen4架构抢先体验,Qwen3.8-Flash-Next开源,训练成本仅为前代1/9

💡 原文中文,约1200字,阅读约需3分钟。
📝

内容提要

阿里通义千问发布Qwen3.8-Flash-Next,作为Qwen4架构预览,采用多模态MoE设计,通过混合注意力、门控残差和N-gram嵌入提升效率,主模型125B参数,激活仅6B,训练成本降至1/9,支持262K上下文,可扩展至百万Token,并已上线HyperAI教程供一键部署体验。

🔎

延伸解读

架构预览的意义

Qwen3.8-Flash-Next作为Qwen4的架构预览,提前展示了未来模型的设计方向。通过混合注意力、门控残差和N-gram嵌入等创新,模型在保持高性能的同时大幅降低训练成本。这暗示了Qwen4可能延续类似的高效架构,值得开发者关注其后续正式版本的发布。

效率与能力的平衡

该模型主参数125B,但每token仅激活6B,实现了稀疏激活的高效推理。训练成本仅为前代的1/9,同时编码和办公任务表现更强,体现了架构优化的实际收益。这种效率提升对于资源有限的开发者尤为重要,可能降低部署门槛。

长上下文与多模态应用

原生支持262K上下文,可扩展至百万Token,适合长文档分析、复杂推理和Agent工作流。多模态MoE设计使其能处理文本与图像等任务。HyperAI提供一键部署教程,便于快速体验,但需注意教程要求NVIDIA H100 80GB x 4资源,实际部署成本较高。

Q&A

Qwen3.8-Flash-Next是什么?它与Qwen4有什么关系?

Qwen3.8-Flash-Next是阿里通义千问团队发布的Qwen4架构的先导预览版本,已开放权重。它是一款多模态MoE模型,旨在探索更高效的大模型架构设计。

Qwen3.8-Flash-Next在架构上做了哪些创新?

该模型在Attention、Residual、Embedding和Optimization四个方面进行了系统升级:采用GDN + QSA混合注意力降低长上下文计算开销,引入Gated Residual增强跨层信息传递稳定性,利用N-gram Embedding以更低计算成本扩展模型容量,并引入Muon优化器及针对正交化精度、Muon与AdamW参数分工的调整。

Qwen3.8-Flash-Next的参数量和激活参数是多少?训练成本相比前代有何变化?

主模型参数量为125B,额外配备51B N-gram Embedding,每token激活参数仅6B。相比Qwen3.7-Plus,训练成本降低至约1/9。

Qwen3.8-Flash-Next支持多长的上下文?能否扩展到百万Token?

模型原生支持262K Token上下文,并可通过YaRN扩展至100万Token,适用于长文档分析、复杂推理和Agent工作流等场景。

如何在HyperAI上部署Qwen3.8-Flash-Next-FP8模型?

在HyperAI教程页面选择「Qwen3.8-Flash-Next-FP8 多模态大模型」,点击「运行此教程」,然后点击右上角「Clone」克隆至自己的容器,选择「NVIDIA H100 80GB x 4」和「vllm」镜像,点击「Continue job execution」,等待资源分配后点击「Open Workspace」进入Jupyter Workspace,运行README文件并启动Open WebUI即可。

Qwen3.8-Flash-Next在哪些任务上表现更强?

相比Qwen3.7-Plus,该模型在编码、办公等任务中展现出更强表现。

🏷️

标签

➡️

继续阅读