东升国际官网

SenseNova U1.5 Lite正式版颁布:支持超长指令,解锁原生4K真实视觉创作流

8分钟

今天,东升国际官网科技正式开源轻量级、原生统一多模态大模型 SenseNova U1.5 Lite。与预览版(U1.5 Lite Preview)出现的原生统一多模态模型能力相比,正式版更关注的是,这些能力能否更正确、更不变地进入真实视觉创作流程。

模型沉点萦绕真实视觉工作沉新美满训练数据、工作设计与后训练流程,强化视觉质量、复杂指令遵循、文字与布局、原生4K、图像编纂和精密视觉节造等,提供更高可控性、更高清、更高性价比的能力工具,推动 AI 视觉天生真正逾越到“不变实现真实视觉交付”的新阶段。

目前模型已面向全球开源,开发者与创作者可直接部署履历。

 

GitHub:https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15

魔搭社区https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT

SenseNova Studio在线履历https://unify.light-ai.top/

 

更齐全的视觉创作能力,握别AI创作瓶颈

“精心写了 25 分钟的具体 Prompt,模型却只能解析 1k 字符,不得不花半幼时删减细节”;“只想改掉图里的一只杯子,AI 却把布景和主角的脸一路换了”。

这些险些是每个创作者都遇到过的“崩溃瞬间”。过往几年,行业往往把沉点放在卷“画面美赣妆和“写实赣妆上;但在现实出产流程中,真正的主题问题是:模型能否精准执行你的齐全意图 ?

SenseNova U1.5 Lite 解决了这一难题:

  • 3-4k 字符超长复杂指令遵循:突破大无数开源模型在指令超过 1k 字符时易崩溃、遗漏细节的瓶颈。SenseNova U1.5 Lite 原生支持 3-4k 高低文长度,可能同时处置主体、数量、空间关系、文字、布局、风格等多沉约束,提升复杂视觉工作的执行不变性。

  • 更高质量的视觉天生:改善整体构图、色彩、材质、光影、真实感和部门细节,削减“部门正确但整体实现度不及”的情况。

  • 更靠得住的原生图像编纂:加强主体身份、空间结构、版式关系和非编纂区域的维持,同时提升部门批改、元素代替、文字精建和多参考图编纂能力。

  • 更好的文字与复杂布局:加强中英文文字、海报、信息图、品牌视觉及多文本排版能力,从“天生内容”进一步走向“组织齐全视觉表白”。

  • 更精密的视觉节造:支持 Bounding Box、Visual Marker 以及单图、多图参考等方式,对指定区域和对象进行更正确的编纂。

  • 原生4K高分辨率输出:在高分辨率天生中两全整体构图与极精密的肌理、微幼文字与光影折射。

 

实战演练:真实场景深度还原

我们遴选了最能考验“硬实力”的创作场景,带你看 SenseNova U1.5 Lite 若何搞定真实交付。

场景一:复杂视觉表白

1、创意海报与封面天生:

展示出极佳的美学实现杜纂高对比度质感。具备高精度的复杂布局能力,可精准掌控文字与留白节拍;在处置文字与物体的空间遮挡时,可能维持光影的天然连贯,充分展示了原生多模态对三维空间叠加关系的深刻理解。

image (12).png
image (13).png
image (14).png
image (15).png
image (16).png
image (17).png

2、高密度信息图天生:

保障中英文、数据等丰硕细节的正确无误;通过多层级结构化空间映射,美满串联各类标签和信息,实现了复杂信息可视化图表的高质量一次性交付。

img_v3_0214p_f3760868-5caf-466f-bfdf-d0999c69ac5g.jpg
image (18).png
image (19).png

3、高清细节与艺术质感:

在构筑结构、人像肌理、艺术画作笔触等复杂场景中,展示出媲美摄影与大家画作的细腻质感。

image (21).png
image (22).png
image (23).png
image (24).png
image (25).png
image (26).png
image (27).png
image (28).png

场景二:原生图像编纂

1、布局与风格可控编纂

  • 草图/线稿转复古暖色漫画:精准遵循超长复杂指令,保留线稿分镜与人物概括,上色与材质补充天然细腻。

prompt:请把这张手绘草图渲染成一幅复古暖色调的手绘漫画风格插图,布景带有米黄色纸张质感,整体光影温馨,凸起烛光下的专一氛围。构图上维持草图的版式,中心是主场景,周围环抱五个带编号的分镜面板。左上角用巨大的毛笔字体写上主标题“敲击魂灵的机械轴”,下方加一个绿色标签写上“每一颗轴,都是我与世界对话的方式。”。中心画面里,戴着护目镜的少年在烛光下用螺丝刀组装键盘,桌上有印着“BUILD SOUL”的马克杯和散落的轴体,少年上方的对话框写“深夜の工作台,只有我、烛光,还有这些幼家伙。”,旁边黑猫的对话框写“又在折腾键盘 ?喵~”。右上角的面板①展示绿色金属键盘表壳,标题写“① 选个靠谱的‘壳’!”,下面配文“定造金属表壳,沉甸甸的安全感!”。右侧中央的面板②展示四种色彩的机械轴体,标题写“② 遴选心仪的‘轴’!”,配文“红轴轻巧,茶轴平衡,青轴清脆...总有一款击中魂灵!”。右下角的面板③特写拔键器取下键帽的作为,标题写“③ 拔键器,yyds!”,加上拟声词“咔哒!”,配文“拔键、换轴、换键帽,自由才是机械键盘的浪漫!”。左侧中央的面板④展示一堆反光的通明键帽,标题写“④ 通明键帽,透出光线!”,配文“灯光透过键帽的那一刻,整个世界都温顺了。”。左下角的面板⑤展示发出温暖背光的组装实现的键盘,标题写“⑤ 大功告成!”,配文“每一次敲击,都是魂灵的回响!”。底部中央的画面是少年兴奋敲击键盘的动态特写,加上绿色爆炸框文字“这就是属于我的声音!?”,底部写上拟声词“哒哒哒哒哒!!”。右下角角落画一只幼猫看着蜡烛,气泡里写“机械键盘的魅力,在于创造,更在于酷爱。喵~”。

image (29).png

线稿图

image (30).png

编纂后

  • 跨主题迁徙且维持排版:深度理解原海报的版式框架,切换主题后仍能维持美满的视觉结构。

prompt:沿用参考图的复古印刷风格,天生一张天文台公家盛开日主题海报。

image (31).png

参考图

image (32).png

编纂后

2、多参考图融合天生

  • 融合主题元素与场景沉组:如“橘猫骑摩托坐在咖啡馆内”,提取多图主题特点(主体、风格、光影),在全新空间中天然沉组,光影与比例浑然天成。

image (33).png
image (34).png
image (35).png

参考图

image (36).png

编纂后

  • 美食海报沉组:多张美食图融合为一张齐全海报,自动匹配一致的布景、餐盘质感与环境光,并美满植入排版案牍。

image (37).png
image (38).png
image (39).png
image (40).png
image (41).png

参考图

image (42).png

编纂后

  • 信息图参考元素代替:保留原海报中的所有元素,同时代替图中的乐队成员,并将下方板块沉新分列,增长曲目和新的划线元素。

prompt:Edit Image 1 using Images 2 and 3 as content references rather than pasted rectangular images. Replace the framed band silhouettes with all five Radiohead members from Image 2, transformed into the poster’s distressed monochrome halftone style. Reflow the four lower feature blocks into a compact left column and add an ESSENTIAL LISTENING list on the right using Image 3 only for wording and hierarchy. Render the new list directly on the same continuous black distressed background with matching off-white type; do not retain any white or cream card background. Preserve all original text and all other poster elements.

image (43).png
image (44).png
image (45).png

参考图

image (46).png

编纂后

3、信息图编纂

  • 变换风格主体维持不变:

prompt:将整张海报改为蓝银色高科技工业风,维持所有文字内容、机械人主体和信息布局不变。

image (59).png
image (60).png

 

  • 部门属性批改:

prompt:将植物周围Cd、Pb、Zn、Cu、As五个圆形标签改为砖红色,文字维持米白。
image (49).png
image (50).png

 

4、文字编纂

  • 黑板菜单部门文字代替:

prompt:将黑板菜单上“Summer Drinks”题眼前方第一杏注位于白色三角形符号右侧的黄色手写体文字“欢乐柠檬水”代替为红色手写体文字“草莓啵啵奶茶”,维持原有粉笔质感和笔触风格,严格保留黑板上其余所有文字(蕴含价值5.00)、插图(柠檬、咖啡杯、冰棍)、木框结构及布景绿植环境不变。

image (51).png
image (52).png

 

  • 多处精准文字沉写:
prompt:在画面中央超大砖红色主标题,将 "PEARL" 代替为 "HORIZON"。若该区域足够显眼、清澈且天堑单一,则逐字出现,不得增删或改写字符;若文字过幼、被遮挡、严沉透视或位于复杂纹理中,则保留原文,不要为实现代替而沉绘布景。 
在左上英文地址标题,将 "ORIENTAL PEARL TOWER" 代替为 "SHANGHAI LANDMARK"。若该区域足够显眼、清澈且天堑单一,则逐字出现,不得增删或改写字符;若文字过幼、被遮挡、严沉透视或位于复杂纹理中,则保留原文,不要为实现代替而沉绘布景。
在左上英文地址副标题,将 "SHANGHAI, CHINA" 代替为 "CITY OF HARMONY"。若该区域足够显眼、清澈且天堑单一,则逐字出现,不得增删或改写字符;若文字过幼、被遮挡、严沉透视或位于复杂纹理中,则保留原文,不要为实现代替而沉绘布景。
在右上中文地址标题,将 "东方明珠" 代替为 "城市之光"。若该区域足够显眼、清澈且天堑单一,则逐字出现,不得增删或改写字符;若文字过幼、被遮挡、严沉透视或位于复杂纹理中,则保留原文,不要为实现代替而沉绘布景。
在左侧城市宣言第一句,将 "A SYMBOL OF SHANGHAI." 代替为 "A BEACON OF VISION."。若该区域足够显眼、清澈且天堑单一,则逐字出现,不得增删或改写字符;若文字过幼、被遮挡、严沉透视或位于复杂纹理中,则保留原文,不要为实现代替而沉绘布景。
在右侧城市宣言第一句,将 "DESIGNED FOR HARMONY." 代替为 "BUILT FOR TOMORROW."。若该区域足够显眼、清澈且天堑单一,则逐字出现,不得增删或改写字符;若文字过幼、被遮挡、严沉透视或位于复杂纹理中,则保留原文,不要为实现代替而沉绘布景。
在构筑底部中文大标语,将 "时期的瞭望 · 城市的明珠" 代替为 "城市的节拍 · 将来的地标"。若该区域足够显眼、清澈且天堑单一,则逐字出现,不得增删或改写字符;若文字过幼、被遮挡、严沉透视或位于复杂纹理中,则保留原文,不要为实现代替而沉绘布景。
在底部英文宣言,将 "A LANDMARK OF VISION. A BEACON OF SHANGHAI." 代替为 "A LANDMARK OF TOMORROW. A BEACON OF THE CITY."。若该区域足够显眼、清澈且天堑单一,则逐字出现,不得增删或改写字符;若文字过幼、被遮挡、严沉透视或位于复杂纹理中,则保留原文,不要为实现代替而沉绘布景。
image (53).png
image (54).png

 

5、指定区域与部门精密编纂

prompt:将红框中的“WHY IT MATTERS” ?槠肴胛形,保留原有图标、层级和排版;红框仅作定位,输出中不要保留红框。

image (55).png
image (56).png

 

prompt:Follow the marks and overall hints on the image to creatively transform this scene, making it moody, sophisticated midnight lounge vibe; remove the annotations when done.

image (57).png
image (58).png

 

8B 参数架构突破:不只是“更多”能力,还是“更不变”和“更高性价比”

作为8B参数的轻量化模型,SenseNova U1.5 Lite在指令遵循与图像编纂维持度上超过了同量级模型,并在文字渲染与复杂布局上达到了媲美超大规模贸易模型的交付水平。

benchmark_overview_all_zh_v24.png

面对分歧视觉工作,业界通常选取显式 Router(路由)或多专家协同机造将渲染、美学、编纂分发给分歧模型。但这大幅增长了系统开销与推理时延。

SenseNova U1.5 Lite 基于NEO-unify统一架构,突破了这一传统定式:

  • 解耦训练与交付(MOPD 蒸馏):训练阶段针对文字、美学、编纂独立训练专家模型(Expert);交付阶段,通过多专家在线战术蒸馏技术(MOPD),将多专家能力无损融合至单体 8B 模型中。

  • 理解与天生双向反哺:视觉语义理解与空间建模形成的认知直接反哺天生,使其天然消化多层级指令,同时在多模态理解榜单上维持强劲阐发。

  • 极致性价比:8B 参数量支持单卡流畅运行,毋庸 Router 频仍切换,单次 Pass 即可两全语义理解与像素天生,极大降低挪用成本与推理延长。

img_v3_0214o_06bcb09f-0032-41f6-9b4b-abda5bf93b0g.jpg

在 OneIG(EN、ZH)、LongText(EN、ZH)、BizGenEval(Easy、Hard)、CVTG、IGenBench 与 Qwen-Image-Bench 上的天生延长与均匀机能对比。

此表,正式版强化了工作导向的强化进建(RL)后训练,聚焦优化三大关键维度:

  • 指令遵循(Instruction Compliance):轻松解析超长 Prompt,精准执行严苛的多沉复杂限度。

  • 视觉偏好(Visual Preference):全面优化构图、材质与光影,提升画面质感与视觉实现度。

  • 编纂维持(Editing Preservation):实现像素级部门批改,美满保留非指标区域的内容与结构。

这种复杂指令追随与精密编纂能力,使得 SenseNova U1.5 Lite 能够无缝支持多轮迭代批改而不跑偏。这真正突破了单次天生的局限,让轻量级模型参加长流程的持续创作与二次刷新成为可能。

 

让开源创作从“能看”走向“能用”

多模态是AI迈向物理世界与真实出产力的必经之路。东升国际官网 SenseNova U1.5 Lite 开源的初衷,正是但愿为全球开发者与创作者提供一个轻量、统一、极具性价比且高可控的出产力工具。

欢迎前往 GitHub / Hugging Face 部署履历,与我们共同繁华开源生态!

GitHub:https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15

魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT

SenseNova Studio在线履历:https://unify.light-ai.top/

【网站地图】