🔧 AI 知识库

SenseNova U1:商汤 8B 开源多模态模型,图文交错 + 信息图生成

原文链接

SenseNova U1:商汤 8B 开源多模态模型,图文交错 + 信息图生成

原文链接:https://mp.weixin.qq.com/s/JHLOB6S-pe3n9OA-h1W5lA 作者:花叔 | 时间:2026-04-29

摘要

商汤开源 SenseNova U1,8B dense + A3B MoE 两个版本,Apache 2.0。架构上砍掉 Visual Encoder 和 VAE(NEO-Unify 架构),模型直接读原始像素、直接输出像素,近乎无损视觉表征。最大差异化能力:图文交错(一次输出含多张图+段落正文的连贯混排)。8B 体积信息图质量跟 Qwen-Image 2.0/Seedream 4.5 持平但延迟更低(2K 图十几秒 vs 闭源几十秒)。作者实测做书籍配图,效果超出预期。


核心能力

1. NEO-Unify 架构:砍掉两个翻译官

主流多模态模型流程:图像 → Visual Encoder(翻成 token)→ LLM → VAE(翻回像素)。U1 把两个翻译官都辞了,模型直接读原始像素、直接输出像素,自己学一套近乎无损的视觉表征。

2. 信息图能力:8B 小体量硬刚大模型

文字密度高、排版精准的信息图历来是生图硬骨头。U1 在这方面跟 Qwen-Image 2.0、Seedream 4.5 得分基本持平,但延迟显著更低——2K 信息图十几秒,GPT-Image-2 要几十秒。

3. 真正的差异化:图文交错(带图思考)

一次输出里包含多张图和段落正文的连贯混排,GPT-Image-2、Nano Banana、Seedream 都做不到(它们是一次 prompt 出一张图)。

官方示例

  • 上传自拍 → 面部分析 → 多种发型推荐图 + 每张配解释 → 对比图
  • 「海南万宁悬崖边的图书馆」→ 四个不同视角连贯建筑图 + 精准设计说明

作者实测

  • 4 格漫画《第一次坐飞机》
  • 《图解 Agent Skills》书籍配图

核心价值:以前要在 LLM 和生图 API 之间来回切,现在 U1 一次就能出整页。


风格切换与文字渲染

  • 同一个模型能在 Anthropic 编辑风和技术蓝图深色风之间自由切换,说明训练数据丰富、无强烈默认风格倾向
  • 环形排列文字基本不出错
  • 有少量错字(Karpathy → Karpthy、蒸馏 → 火离),prompt 工程可绕开

适合场景

场景价值
自媒体/独立创作者出配图/信息图/海报,试 10 个版本选 1 个,试错接近零成本
数据敏感行业(医疗/金融/法务)本地部署,内部数据不上云
Agent 长链路(教程/报告/绘本)10-50 张图本地跑接近零成本
书籍配图概念→概念图→解释段落→对比图→总结,一次出整页

上手入口

  • Skill:github.com/OpenSenseNova/SenseNova-Skills
  • 开源代码:github.com/OpenSenseNova/SenseNova-U1
  • HuggingFace:huggingface.co/collections/sensenova/sensenova-u1
  • 8B 体积,性能好的本地机器就能跑,支持 vLLM 和 sglang

关键洞察

U1 没有说自己是 SoTA、颠覆、革命,但它把 Visual Encoder 和 VAE 都砍了——这种敢于重新画路线的事,在已开源的多模态模型里不常见。作者体感:「有些场景,确实从这周开始变得不一样了。」他下一本橙皮书的配图可能不再需要走 API。