这,可能是今年WAIC最惊艳的图片!

这,可能是今年WAIC最惊艳的图片!

💡 原文中文,约3300字,阅读约需8分钟。
📝

内容提要

商汤在WAIC 2026发布日日新SenseNova U1 Pro模型,实现理解、生成、行动原生统一,支持8K直出和复杂多模态任务。实测显示其能生成超长图、设计海报等,通过大Patch和自适应噪声控制提升效率。该模型代表生图从交互到交付的范式转变,但仍有待完善。

🔎

延伸解读

从“能交互”到“能交付”的范式转变

商汤CEO徐立指出,当前生图工具普遍存在“能交互不等于能交付”的问题。U1 Pro的定位正是将一次生图扩展为连续的创作流程,涵盖理解、规划、生成、检查、修正直至交付。这种转变类似于AI Coding从Copilot到Agent的演进,模型价值从生成单张图片转向完成完整任务,可能为视觉设计领域带来新的商业空间。

8K直出的技术挑战与应对

8K分辨率带来视觉Token数量激增,导致计算量和显存压力上升。商汤采用32×32的大Patch,将视觉Token总数降至原来的四分之一,但大格子易丢失细节。为此,团队引入自适应噪声控制、Patch重叠、空间采样和Loss设计优化,在控制计算规模的同时保留小字、纹理等细节,实现高质量8K输出。

实测表现与当前局限

实测中,U1 Pro在超长图、复杂海报和琉璃山河等任务中表现出色,能同时处理多组要求并保持整体一致性。然而,异步生成意味着用户需以等待时间换取更高完成度;编辑能力、成本和稳定性仍需真实项目验证。专业设计场景还依赖图层、矢量元素和团队协作,U1 Pro目前尚不能完全替代传统工作流。

Q&A

商汤在WAIC 2026上发布了什么新模型?

商汤在WAIC 2026上发布了日日新SenseNova U1 Pro模型,这是一套面向复杂多模态任务的交付系统,实现了理解、生成、行动的原生统一。

日日新SenseNova U1 Pro模型的核心特点是什么?

U1 Pro的核心特点是实现了理解、生成、行动的原生统一,能够围绕目标完成理解、规划、信息组织、多模态生成、检查修正和最终交付,支持8K直出和复杂多模态任务。

U1 Pro在实测中展示了哪些能力?

实测中U1 Pro展示了生成超长8K图(如二十四节气长图)、设计高级实验室视觉海报、生成琉璃质感的古风建筑山河图以及制作可直接商用的电影海报等能力,均表现出色。

U1 Pro如何实现8K直出并控制计算成本?

U1 Pro采用32×32的大Patch,将视觉Token总数降至原来的四分之一,同时加入自适应Noise Control,对细节区域采用针对性训练策略,并保留Patch重叠,优化空间采样、Loss设计和模型结构,从而在控制计算成本的同时保留细节。

U1 Pro代表了怎样的产品范式变化?

U1 Pro代表了从“能交互”到“能交付”的范式变化,类似AI Coding从Copilot到Coding Agent的演进,模型不再只是生成一张图,而是理解目标、组织信息、保持长程一致性、检查错误并交付可用结果,推动多模态内容生产进入真实生产环节。

U1 Pro目前存在哪些局限性?

U1 Pro目前并非完美,异步生成需要用户等待时间换取更高完成度;编辑能力、成本和稳定性仍需真实项目验证;专业设计场景中图层、矢量元素、版本管理和团队协作等需求尚未完全满足。

🏷️

标签

➡️

继续阅读