内容提要
商汤科技正式开源8B参数的生图模型SenseNova U1.5 Lite,相比三周前预览版更完整、准确、稳定。该模型采用NEO-unify统一多模态架构,通过多教师在线策略蒸馏技术融合专项能力,支持复杂排版、精准编辑和多参考图任务,强调指令遵循、视觉偏好和编辑保持,旨在实现从生成到交付的稳定创作流程。
延伸解读
统一架构的实用价值
SenseNova U1.5 Lite采用NEO-unify架构,将视觉理解、生成和编辑整合在同一模型中,避免了多模型切换的复杂性。这种设计不仅简化了部署,还通过“理解与生成双向反哺”提升了复杂任务的表现,如多参考图编辑和局部修改。对于开发者而言,这意味着更短的调用链路和更轻量的部署,同时保持任务间的一致性。
训练策略:先拆后合
商汤通过先分别训练文字渲染、美学、编辑等专项专家,再利用多教师在线策略蒸馏(MOPD)融合回统一模型。这种方法使得8B模型能兼顾多项能力,而无需外部路由。用户无需在多个模型间切换,即可获得综合性能,体现了轻量级模型在实用性和效率上的优势。
后训练强化三大能力
正式版重点强化了指令遵循、视觉偏好和编辑保持。指令遵循确保复杂要求被准确执行;视觉偏好提升构图和质感;编辑保持则保证非编辑区域不被破坏。这些能力直接对应实际应用中的痛点,如信息图排版、封面设计、局部修改等,使模型更贴近真实创作流程。
从生成到交付的稳定性
文章强调,随着生图模型普及,评价标准从“惊艳”转向“稳定”。SenseNova U1.5 Lite致力于解决从理解需求到最终交付的完整链路,包括修改、细化和保持一致性。这种稳定性对于进入实际工作流至关重要,也是开源模型与闭源模型竞争的关键。
Q&A
SenseNova U1.5 Lite是什么?它有哪些主要特点?
SenseNova U1.5 Lite是商汤科技正式开源的8B参数生图模型,采用NEO-unify统一多模态架构,支持复杂排版、精准编辑和多参考图任务,强调指令遵循、视觉偏好和编辑保持,旨在实现从生成到交付的稳定创作流程。
SenseNova U1.5 Lite与三周前的预览版相比有哪些改进?
正式版相比预览版更完整、准确和稳定,通过多教师在线策略蒸馏技术(MOPD)将文字渲染、美学表达、图像编辑等专项能力融合回同一个轻量级模型中,并强化了指令遵循、视觉偏好和编辑保持,使其能稳定进入真实创作流程。
SenseNova U1.5 Lite在复杂排版和精准编辑方面表现如何?能否举例说明?
SenseNova U1.5 Lite在复杂排版和精准编辑上表现出色,例如能将九张不同食物照片拼成一张精美的食谱分享卡片,并能精准识别菜品;还能通过框选和标注修改图片局部细节,同时保留原图的空间关系。此外,它还能生成包含多层级结构的信息图,以及进行多参考图编辑,如将Radiohead成员融入海报并保持风格一致。
SenseNova U1.5 Lite是如何实现这些能力的?其技术架构和训练方法是什么?
SenseNova U1.5 Lite采用NEO-unify原生统一多模态架构,将视觉理解、图像生成和编辑放在同一套模型中。训练时先分别训练文字渲染、美学表达、图像编辑等专项Expert,再通过多教师在线策略蒸馏技术(MOPD)将专项能力融合回同一个模型,实现理解与生成双向反哺。后训练阶段还专门强化了指令遵循、视觉偏好和编辑保持。
SenseNova U1.5 Lite在真实创作流程中的优势是什么?
SenseNova U1.5 Lite的优势在于其统一模型设计,无需外部路由或切换多个模型,调用链路短、部署轻,同时能保持不同任务之间的一致性。它强调从理解需求、生成内容到修改、细化和最终交付的完整链路,确保模型能稳定地用于实际工作,实现“快、好、省”的效果。
SenseNova U1.5 Lite的提示词增强功能是什么?
提示词增强(PE)功能可以在用户只提供简短需求时,先将意图整理成更完整的创作方案,再交给U1.5 Lite执行,从而提升生成效果。