SenseNova U1:商汤 8B 开源多模态模型,图文交错 + 信息图生成
原文链接SenseNova U1:商汤 8B 开源多模态模型,图文交错 + 信息图生成
原文链接:https://mp.weixin.qq.com/s/JHLOB6S-pe3n9OA-h1W5lA 作者:花叔 | 时间:2026-04-29
摘要
商汤开源 SenseNova U1,8B dense + A3B MoE 两个版本,Apache 2.0。架构上砍掉 Visual Encoder 和 VAE(NEO-Unify 架构),模型直接读原始像素、直接输出像素,近乎无损视觉表征。最大差异化能力:图文交错(一次输出含多张图+段落正文的连贯混排)。8B 体积信息图质量跟 Qwen-Image 2.0/Seedream 4.5 持平但延迟更低(2K 图十几秒 vs 闭源几十秒)。作者实测做书籍配图,效果超出预期。
核心能力
1. NEO-Unify 架构:砍掉两个翻译官
主流多模态模型流程:图像 → Visual Encoder(翻成 token)→ LLM → VAE(翻回像素)。U1 把两个翻译官都辞了,模型直接读原始像素、直接输出像素,自己学一套近乎无损的视觉表征。
2. 信息图能力:8B 小体量硬刚大模型
文字密度高、排版精准的信息图历来是生图硬骨头。U1 在这方面跟 Qwen-Image 2.0、Seedream 4.5 得分基本持平,但延迟显著更低——2K 信息图十几秒,GPT-Image-2 要几十秒。
3. 真正的差异化:图文交错(带图思考)
一次输出里包含多张图和段落正文的连贯混排,GPT-Image-2、Nano Banana、Seedream 都做不到(它们是一次 prompt 出一张图)。
官方示例:
- 上传自拍 → 面部分析 → 多种发型推荐图 + 每张配解释 → 对比图
- 「海南万宁悬崖边的图书馆」→ 四个不同视角连贯建筑图 + 精准设计说明
作者实测:
- 4 格漫画《第一次坐飞机》
- 《图解 Agent Skills》书籍配图
核心价值:以前要在 LLM 和生图 API 之间来回切,现在 U1 一次就能出整页。
风格切换与文字渲染
- 同一个模型能在 Anthropic 编辑风和技术蓝图深色风之间自由切换,说明训练数据丰富、无强烈默认风格倾向
- 环形排列文字基本不出错
- 有少量错字(Karpathy → Karpthy、蒸馏 → 火离),prompt 工程可绕开
适合场景
| 场景 | 价值 |
|---|---|
| 自媒体/独立创作者 | 出配图/信息图/海报,试 10 个版本选 1 个,试错接近零成本 |
| 数据敏感行业(医疗/金融/法务) | 本地部署,内部数据不上云 |
| Agent 长链路(教程/报告/绘本) | 10-50 张图本地跑接近零成本 |
| 书籍配图 | 概念→概念图→解释段落→对比图→总结,一次出整页 |
上手入口
- Skill:github.com/OpenSenseNova/SenseNova-Skills
- 开源代码:github.com/OpenSenseNova/SenseNova-U1
- HuggingFace:huggingface.co/collections/sensenova/sensenova-u1
- 8B 体积,性能好的本地机器就能跑,支持 vLLM 和 sglang
关键洞察
U1 没有说自己是 SoTA、颠覆、革命,但它把 Visual Encoder 和 VAE 都砍了——这种敢于重新画路线的事,在已开源的多模态模型里不常见。作者体感:「有些场景,确实从这周开始变得不一样了。」他下一本橙皮书的配图可能不再需要走 API。