
8月21日,商汤科技开源轻量级、原生统一多模态大模型SenseNova U1.5 Lite。
与预览版(U1.5 Lite Preview)呈现的原生统一多模态模型能力相比 ,正式版更关注的是,这些能力能否更准确 、更稳定地进入真实视觉创作流程 。
模型重点围绕真实视觉任务重新完善训练数据、任务设计与后训练流程,强化视觉质量、复杂指令遵循 、文字与布局、原生4K、原生图像编辑和精细视觉控制等 ,提供更高可控性 、更高清、更高性价比的能力工具,推动AI视觉生成跨越到“稳定完成真实视觉交付”的新阶段。
近来 ,模型已面向全球开源 ,开发者与创作者可直接部署体验。
更完整的视觉创作能力,告别AI创作瓶颈
“精心写了25分钟的详细Prompt,模型却只能解析1k字符 ,不得不花半小时删减细节 ”;“只想改掉图里的一只杯子,AI却把背景和主角的脸一起换了”……

创意海报与封面生成

高密度信息图生成
这些几乎是每位创作者都遇到过的“崩溃瞬间” 。过往几年,行业把重点放在卷“画面美感 ”和“写实感”上;但在实际生产流程中,真正的核心问题是:模型能否精准执行你的完整意图?
SenseNova U1.5 Lite解决了该难题——

高清细节与艺术质感
原生支持3—4k上下文长度 ,能够同时处理主体、数量 、空间关系、文字、布局、风格等多重约束,提升复杂视觉任务的执行稳定性;
改善整体构图 、色彩、材质、光影 、真实感和局部细节,减少“局部正确但整体完成度不足”的情况;
增强主体身份、空间结构、版式关系和非编辑区域的保持 ,同时提升局部修改 、元素替换、文字精修和多借鉴 图编辑能力;
加强中英文文字、海报 、信息图、品牌视觉及多文本排版能力,从“生成内容 ”进一步走向“组织完整视觉表达”;

草图/线稿转复古暖色漫画:精准遵循超长复杂指令,保留线稿分镜与人物轮廓 ,上色与材质补充自然细腻

跨主题迁移且保持排版(Prompt:沿用借鉴 图的复古印刷风格,生成一张天文台公众开放日主题海报)
支持Bounding Box、Visual Marker以及单图 、多图借鉴 等方式,对指定区域和对象进行更准确的编辑;
在高分辨率生成中兼顾整体构图与极精细的肌理、微小文字与光影折射。

变换风格主体保持不变(Prompt:将整张海报改为蓝银色高科技工业风 ,保持所有文字内容、机器人主体和信息布局不变)

局部属性修改(Prompt:将植物周围Cd、Pb 、Zn、Cu、As五个圆形标签改为砖红色,文字保持米白)
不只是“更多”能力,还是“更稳定 ”和“更高性价比”
作为8B参数的轻量化模型 ,SenseNova U1.5 Lite在指令遵循与图像编辑保持度上超越了同量级模型,并在文字渲染与复杂布局上达到了媲美超大规模商业模型的交付水平。

面对不同视觉任务,业界通常采用显式Router(路由)或多专家协同机制将渲染 、美学、编辑分发给不同模型,但这大幅增加了系统开销与推理时延 。
SenseNova U1.5 Lite基于NEO-unify统一架构 ,打破了这一传统定式——
训练阶段针对文字、美学 、编辑独立训练专家模型(Expert),交付阶段通过多专家在线策略蒸馏技术(MOPD),将多专家能力无损融合至单体8B模型中;
视觉语义理解与空间建模形成的认知直接反哺生成 ,使其自然消化多层级指令,同时在多模态理解榜单上保持强劲表现;
8B参数量支持单卡流畅运行,无须Router频繁切换 ,单次Pass即可兼顾语义理解与像素生成,极大降低调用成本与推理延迟。

此外,正式版强化了任务导向的强化学习(RL)后训练 ,聚焦优化指令遵循(Instruction Compliance)、视觉偏好(Visual Preference)和编辑保持(Editing Preservation)三大关键维度。
这种复杂指令跟随与精细编辑能力,使得SenseNova U1.5 Lite可以无缝支持多轮迭代修改而不跑偏 。这真正打破了单次生成的局限,让轻量级模型参与长流程的持续创作与二次改造成为可能。
商汤科技表示 ,多模态是AI迈向物理世界与真实生产力的必经之路。SenseNova U1.5 Lite开源的初衷,是希望为全球开发者与创作者提供一个轻量、统〖One〗 、 极具性价比且高可控的生产力工具。
(文章来源:上观新闻)