这个新生图模型有点夯:4K直出的,国产的,开源的!

这个新生图模型有点夯:4K直出的,国产的,开源的!

💡 原文中文,约4300字,阅读约需11分钟。
📝

内容提要

商汤开源轻量级多模态模型SenseNova U1.5-Lite-Preview,支持4K直出、指哪改哪的图像编辑。该模型能理解复杂信息图、复刻设计框架、局部修改文字或氛围,并融合多张参考图。基于NEO-Unify架构,在8B-MoT参数下实现视觉理解、生成与编辑统一,评测成绩较上代提升,但仍是早期预览版。

🔎

延伸解读

4K直出的实际意义

4K直出意味着生成的图像在放大后仍能保持细节清晰,减少常见的网格感、拼接痕迹和纹理断裂。这对于需要高分辨率输出的场景(如海报、信息图)尤为重要,避免了后期放大的画质损失。但需注意,4K能力依赖于重新设计的生成头和4K训练,实际效果可能因任务复杂度而异。

编辑能力的实用价值

U1.5-Lite-Preview的编辑能力不仅限于简单修改,还能在保留整体版式的前提下替换主视觉、调整氛围,甚至融合多张参考图。这更贴近真实工作流中的改稿需求,减少了重新生成的随机性。但文章也指出,复杂场景编辑的稳定性仍有提升空间,早期预览版可能不适合关键生产任务。

轻量级模型的优势与局限

8B-MoT参数在轻量级模型中实现了视觉理解、生成与编辑的统一,评测成绩较上代提升,但仍是早期预览版。轻量级意味着更低的部署门槛,但短Prompt理解、小字与人像细节等方面仍有不足。正式版即将开源,预计会解决部分问题,但当前版本更适合开发者测试和探索。

Q&A

商汤新开源的SenseNova U1.5-Lite-Preview是什么?

SenseNova U1.5-Lite-Preview是商汤面向社区开源的轻量级原生统一多模态模型的早期预览版本,基于NEO-Unify架构,将语言、视觉语义和像素生成统一在同一模型中,支持视觉理解、推理、生成与编辑,参数规模为8B-MoT。

SenseNova U1.5-Lite-Preview在图像编辑方面有哪些具体能力?

该模型支持指哪改哪的局部编辑,如修改文字(将“35+MIN”改为“25MIN”)、替换主视觉(如将“迎”字改为“命”字)、调整画面氛围(如将满月改为血月并增加浓雾),还能融合多张参考图生成新图像,如将真实照片与手绘模板结合生成食谱。

SenseNova U1.5-Lite-Preview如何实现4K直出?

商汤重新设计了生成头,减弱视觉Token网格对最终画面的影响,并将训练扩展到4K分辨率,从而减少网格感、拼接痕迹和纹理断裂,实现原生4K直出。

SenseNova U1.5-Lite-Preview在评测榜单上的表现如何?

相较上一代U1,U1.5-Lite-Preview在Qwen-Image-Bench上从47.14提升至55.20(with Prompt Enhance),ImgEdit-Bench从3.90升至4.37,GEdit-Bench英文项从7.47升至8.17,中文项从7.42升至8.05,在WeEdit榜单中Overall Average达到6.44。

SenseNova U1.5-Lite-Preview的开源地址有哪些?

开源地址包括GitHub(https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md)、Hugging Face(https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview)和魔搭社区(https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview)。

SenseNova U1.5-Lite-Preview目前存在哪些局限性?

作为早期预览版本,它在短Prompt理解、小字与人像细节、整体美学一致性以及复杂场景编辑的稳定程度方面仍有提升空间。

🏷️

标签

➡️

继续阅读