开源Top2!实测阶跃Step 5 Preview,真有点猛啊…

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…

💡 原文中文,约3500字,阅读约需9分钟。
📝

内容提要

阶跃星辰发布旗舰基座模型Step 5 Preview,采用MoE架构,总参数600B、激活27B,支持1M上下文,Agent能力大幅提升,AA评测44分居全球开源第二,定价极具竞争力。实测可自主完成Blender建模、乐高赛车游戏等3D任务,2D任务表现亦佳。团队采用窄而深网络设计与稀疏化技术,将算力集中于Agent能力,延续低成本高性能路线。

🔎

延伸解读

MoE架构下的效率取舍

Step 5 Preview采用MoE架构,总参数600B但激活仅27B,这意味着每次推理只调用一小部分参数,大幅降低计算成本。配合1M上下文,模型能处理长文档或复杂多轮对话,但实际吞吐取决于稀疏化在硬件上的落地效果。文章提到团队通过底层算子优化让稀疏真正转化为速度,否则理论省算力可能被索引和访存开销抵消。

Agent能力提升的技术路径

文章指出,Step 5 Preview的Agent能力提升源于窄而深的网络设计(92层Transformer)和稀疏化技术。更深的网络为多跳依赖提供更长的信息传播路径,而Sparse MoE、Hybrid Sparse等则缓解长上下文带来的计算爆炸。团队还通过Long-horizon RL和Context Compaction让模型在几十轮工具调用后仍记得目标。这些方法共同将模型的基本单位从“回答”转向“Loop”。

实测表现与实用边界

作者实测中,Step 5 Preview能自主完成Blender建模、乐高赛车游戏等3D任务,并添加后期效果;2D任务如霓虹跑酷和写作网站也表现不错,能补充Prompt未写的细节。但第一轮结果常有小Bug,如模块溢出或赛道过窄,需指出问题后经两三轮修复才达可用状态。这说明模型已能干活,但离完全自主交付仍有距离,人工review和迭代必不可少。

定价策略与竞争定位

Step 5 Preview定价为百万输入1美元、百万输出2.7美元,单个任务成本仅为Opus 5的12.5%,在AA评测中取得44分,位列全球开源第二。文章认为,这延续了阶跃星辰低成本高性能的路线,瞄准“性能×成本”的甜蜜点。在Frontier模型差距缩小的背景下,阶跃通过差异化Agent能力和价格优势,试图在拥挤的第一梯队中找回位置。

❓

Q&A

阶跃Step 5 Preview模型的基本规格是什么?

Step 5 Preview采用MoE架构,总参数600B,激活参数仅27B,支持1M上下文。

Step 5 Preview在Artificial Analysis评测中表现如何?

在Artificial Analysis最新评测中,Step 5 Preview取得44分,位列全球开源模型Top 2。

Step 5 Preview的定价是多少?

百万输入1美元,百万输出2.7美元,单个任务成本仅为Opus 5的12.5%。

Step 5 Preview在3D任务实测中表现如何?

实测中,Step 5 Preview能自主操作Blender建模后室场景,并自动添加VHS录像质感、镜头噪点、昏黄灯光和脚步声等后期效果;还能制作乐高赛车游戏,包含赛道、赛车、人机车手、实时排名和发动机音效。

Step 5 Preview的Agent能力为什么大幅提升?

团队采用窄而深的网络设计(92层Transformer),并应用稀疏化技术(Sparse MoE、Hybrid Sparse、Sparse GQA),同时优化底层算子和数据访问,将算力集中于Agent能力,通过Long-horizon RL和Context Compaction等方法,让模型在几十轮工具调用后仍能记住目标。

Step 5 Preview在2D任务上的表现如何?

在2D任务上,Step 5 Preview能制作霓虹跑酷小游戏,相比上一代增加了高楼、视觉层次更完整,Game Over时边框变红;还能生成写作网站,审美较好且覆盖全面,但偶尔会出现模块溢出等小Bug,需要review和修改。

🏷️

标签

➡️

继续阅读