From the source
我们通过保持图像块间空间连贯性的重建方式改进视觉接口,结合精选的生成与编辑数据、改进的任务建模、结构化提示增强及最高 4K 原生分辨率训练,扩大训练规模。
后训练阶段,我们分别优化视觉美学、双语文字渲染、信息图生成和图像编辑专家,再通过多专家同策略蒸馏整合其能力。
全面评测表明,SenseNova U1.5 在图像保真度、文字渲染、复杂构图、多参考图编辑和交错生成方面均取得显著进展,同时提升指令遵循能力,保持主体身份特征、几何结构与非编辑区域的一致性。
尽管生成训练数据对结构化格式的覆盖有限,模型仍能有效泛化到长而复杂的结构化视觉指令,进一步证明多模态理解能力能够迁移至视觉规划与创作。
这些结果表明, 原生统一建模为构建集感知、推理与创作于一体的端到端系统提供了一条有前景的路径。
我们将开源包括监督微调、强化学习和同策略蒸馏在内的训练代码。
代码及更多模型信息: https://www.sensenova.cn/ SenseNova U1.5技术报告链接(欢迎社区关注 ) : https://huggingface.co/papers/2609.11929 商汤小浣熊在线体验 : https://office.xiaohuanxiong.com/ GitHub 代码 : https://github.com/OpenSenseNova/SenseNova-U1 Hugging Face 模型: https://huggingface.co/collections/sensenova/sensenova-u15 SenseNova U1.5 评测概览 图1 SenseNova U1.5 在信息图与人物生成方面的示例。
图2 SenseNova U1.5 在图像编辑与多参考图生成方面的示例。
1 引言 近年来,视觉生成正迅速超越传统的图像合成,演化为一种通用的视觉创作媒介,覆盖多语言文字排版、信息密集型设计、高分辨率渲染、多参考图组合、细粒度对象与背景编辑,以及交错生成。
然而,这一范围的拓展也暴露出架构层面的割裂:大多数系统通过预训练视觉编码器(vision encoders,VEs) 感知图像,却通过变分自编码器(VAEs) 生成图像。
因此,理解与生成在不同的表示空间中运行:前者针对语义抽象进行优化,后者则针对像素级保真度进行优化。
尽管这种分离方式是有效的,但它限制了感知、推理与生成在统一视觉框架中、面向多种视觉创作形式进行无缝协同的程度。
原生统一建模选择了另一条路线,即直接从像素与文本中学习。
…