# SenseTime — SenseNova U1.5技术报告：迈向原生统一视觉智能

- Company: SenseTime (sensetime.com)
- Announced: 2026-09-17T10:42:38+00:00
- Category: not stated
- Coverage: not counted
- Announcement: yes
- Group: announcements
- Source: https://www.sensetime.com/cn/news/sensenova-u1-5-20260917-1850
- Record: https://forck.live/items/18501-sensenova-u1-5
- Title in English (translated by forck.live from zh): SenseNova U1.5 Technical Report: Toward Native Unified Visual Intelligence
- Subject: SenseNova / 商汤

我们推出 SenseNova U1.5，一个采用 8B-MoT 架构的原生统一多模态模型，无需外部视觉编码器和变分自编码器（VAE），即可理解、推理和生成视觉内容。我们通过保持图像块间空间连贯性的重建方式改进视觉接口，结合精选的生成与编辑数据、改进的任务建模、结构化提示增强及最高 4K 原生分辨率训练，扩大训练规模。后训练阶段，我们分别优化视觉美学、双语文字渲染、信息图生成和图像编辑专家，再通过多专家同策略蒸馏整合其能力。 全面评测表明，SenseNova U1.5 在图像保真度、文字渲染、复杂构图、多参考图编辑和交错生成方面均取得显著进展，同时提升指令遵循能力，保持主体身份特征、几何结构与非编辑区域的一致性。尽管生成训练数据对结构化格式的覆盖有限，模型仍能有效泛化到长而复杂的结构化视觉指令，进一步证明多模态理解能力能够迁移至视觉规划与创作。 这些结果表明， 原生统一建模为构建集感知、推理与创作于一体的端到端系统提供了一条有前景的路径。我们将开源包括监督微调、强化学习和同策略蒸馏在内的训练代码。 代码及更多模型信息： https://www.sensenova.cn/ SenseNova U1.5技术报告链接（欢迎社区关注 ） ： https://huggingface.co/papers/2609.11929 商汤小浣熊在线体验 ： https://office.xiaohuanxiong.com/ GitHub 代码 ： https://github.com/OpenSenseNova/SenseNova-U1 Hugging Face 模型： https://huggingface.co/collections/sensenova/sensenova-u15 SenseNova U1.5 评测概览 图1 SenseNova U1.5 在信息图与人物生成方面的示例。 图2 SenseNova U1.5 在图像编辑与多参考图生成方面的示例。 1 引言 近年来，视觉生成正迅速超越传统的图像合成，演化为一种通用的视觉创作媒介，覆盖多语言文字排版、信息密集型设计、高分辨率渲染、多参考图组合、细粒度对象与背景编辑，以及交错生成。然而，这一范围的拓展也暴露出架构层面的割裂：大多数系统通过预训练视觉编码器（vision encoders，VEs） 感知图像，却通过变分自编码器（VAEs） 生成图像。因此，理解与生成在不同的表示空间中运行：前者针对语义抽象进行优化，后者则针对像素级保真度进行优化。尽管这种分离方式是有效的，但它限制了感知、推理与生成在统一视觉框架中、面向多种视觉创作形式进行无缝协同的程度。 原生统一建模选择了另一条路线，即直接从像素与文本中学习。 …

---

Record: https://forck.live/items/18501-sensenova-u1-5
Catalogue: https://forck.live/llms.txt
Current issue: https://forck.live/feed.md
