阿里巴巴的AI连续编码16天,所有提交都在GitHub上

阿里巴巴的AI连续编码16天,所有提交都在GitHub上

💡 原文英文,约1100词,阅读约需4分钟。
📝

内容提要

阿里巴巴发布Qwen3.8-Max多模态模型,拥有2.4万亿参数,采用稀疏混合专家架构,每次激活约950亿参数。该模型面向复杂任务,可自主运行数天,如构建应用、复现研究等。定价为每百万输入令牌2美元,输出6美元。权重将开源,但自托管需大量GPU资源,适合大型机构。性能接近Anthropic和OpenAI模型,但独立验证尚待进行。

🔎

延伸解读

自托管门槛高,适合大型机构

尽管采用稀疏混合专家架构,每次仅激活约950亿参数,但模型总参数达2.4万亿,完整权重仍需存储并分布在多个高内存GPU节点上。这使得自托管对大多数开发者不现实,更适合拥有基础设施的大型组织和推理提供商。开发者可先通过API使用,待权重开源后再评估自托管成本。

长时运行依赖外部系统

Qwen3.8-Max能连续运行16天构建应用,但模型本身只负责决策,实际执行依赖外部工具链(如CI/CD、GitHub集成)。这些基础设施决定了智能体能否长时间稳定运行。文章强调,模型与“外壳”的配合是关键,开发者需关注工具链的可靠性,而非仅看模型能力。

基准测试结果需独立验证

阿里巴巴的内部基准显示Qwen3.8-Max接近Anthropic和OpenAI的模型,但独立运行同一基准可能产生不同分数。文章指出,这些结果尚未经外部实验室重复验证,且模型在31项测试中仅领先6项。因此,性能表现需待权重发布后由开发者实际测试确认。

上下文窗口与成本限制

尽管模型支持近百万token的上下文窗口,但长时运行中记忆早期决策和指令的能力仍待验证。此外,自主智能体消耗token的速度远超人工监督会话,更低的单token价格并不自动意味着更低的总成本。开发者需权衡长时任务的token消耗与预算。

Q&A

阿里巴巴发布的Qwen3.8-Max模型有哪些主要特点?

Qwen3.8-Max是阿里巴巴发布的多模态模型,拥有2.4万亿参数,采用稀疏混合专家架构,每次激活约950亿参数。它面向复杂任务,可自主运行数天,如构建应用、复现研究等。

Qwen3.8-Max的定价是多少?

Qwen3.8-Max的定价为每百万输入令牌2美元,每百万输出令牌6美元。

Qwen3.8-Max的权重是否会开源?

是的,阿里巴巴表示模型权重将在下周发布在Hugging Face和ModelScope上,使其成为首个提供可下载权重的Qwen-Max模型。

Qwen3.8-Max在自主任务中表现如何?

根据阿里巴巴的测试,Qwen3.8-Max花费16天构建了一个命令行应用,用了5天复现研究论文的结果,并在约500次迭代后改进了芯片设计。

Qwen3.8-Max与Kimi K3相比有何异同?

Qwen3.8-Max有2.4万亿参数,而Kimi K3有2.8万亿参数。两者都采用稀疏混合专家架构,且阿里巴巴持有Moonshot AI 36%的股份,因此它们并非完全独立的竞争对手。Kimi K3在发布后因需求过大而暂停新订阅,而Qwen3.8-Max也面临类似的挑战。

Qwen3.8-Max的基准测试成绩如何?

根据阿里巴巴的内部基准测试,Qwen3.8-Max在Terminal-Bench 2.1上得分86.6,而OpenAI的GPT-5.6 Sol(max)得分为88.8。它在Text Arena中排名第五,在Vision Arena中排名第二。在31项测试中,它在6项中领先,但大多数测试中Claude Fable 5或GPT-5.6 Sol表现更好。

Qwen3.8-Max的自托管难度如何?

由于模型总参数达2.4万亿,即使每次只激活950亿参数,完整权重仍需存储并分布在多个高内存GPU节点上,因此自托管需要大量GPU资源,适合大型机构或推理提供商,大多数开发者难以实现。

🏷️

标签

➡️

继续阅读