MiniCPM-o 4.5:面壁 9B 全双工全模态模型,一张消费级显卡跑「边看边听边说」
原文链接MiniCPM-o 4.5:面壁 9B 全双工全模态模型,一张消费级显卡跑「边看边听边说」
原文链接:https://mp.weixin.qq.com/s/wLFWL7Yeqvl_YGusHmYayA 来源:GitHubDaily | 时间:2026-04-28
摘要
面壁智能联合 OpenBMB/清华发布 MiniCPM-o 4.5 技术报告,HuggingFace 下载量 25 万+。全球首个端到端全双工全模态大模型,9B 参数,一张 RTX 5070(12GB 显存)即可流畅跑。首创 Omni-Flow 流式全模态框架,支持打断、插话等自然交互,原生摆脱 VAD 依赖。端侧安装包 Comni(Win/Mac)已发布,API 免费开放。
核心概念:什么是「全双工」?
人类交流是流畅并行的——边听边思考,可以打断对方。
过去 AI 是半双工(对讲机模式):你说完它才能处理,它说的时候听不见你。MiniCPM-o 4.5 实现「全双工全模态」:持续感知环境(看视频、听声音)的同时进行思考和响应。
这背后的核心技术:Omni-Flow 流式全模态框架
创造一个共享「时间轴」,视觉/音频/语言等所有信息流对齐到毫秒级时间片。每个极小时间片内完成一次「感知→思考→响应」循环——这是全双工的基石。
架构设计(总 9B 参数)
| 组件 | 参数量 | 职责 |
|---|---|---|
| 视觉编码器 SigLIP-ViT | 0.4B | 「看」 |
| 音频编码器 Whisper-Medium | 0.3B | 「听」 |
| LLM 基座 Qwen3-8B | 8B | 「思考」和理解 |
| 语音 Token 解码器(Llama 架构) | 0.3B | 文本→语音单元 |
| 声码器 | - | 语音单元→波形 |
关键设计:LLM 只生成文本 Token,语音合成「外包」给小型专业解码器,保证核心推理能力不被声学任务拖累。各模块 token 级稠密连接保证高上限。
TAIL 语音生成方案:解决流式语音延迟问题——让语音块紧跟实时文本,同时用轻量级 pre-look 处理跨词发音连贯性。
性能表现
- 显存:INT4 量化版仅需 12GB(Qwen3-Omni INT4 的一半),RTX 5070 可跑
- 速度:INT4 解码 212 tokens/s,比 Qwen3 快 40%+
- 综合视觉:与 Gemini 2.5 Flash 相当
- 全模态全双工:全面超越 Gemini 2.5 Flash 和 Qwen3-Omni
- 语音生成:中英文质量(字符/单词错误率更低)+ 情感表现力优于 Qwen3-Omni 和 CosyVoice2
部署方式
端侧安装包 Comni(集成模型下载 + 环境安装 + Demo)
- Windows:RTX 5070/5080/5090/4090,12GB+ 显存
- macOS:M1-M5 Max / M5 Pro,16GB+ 内存
- 启动后可用手机局域网连接进行全双工视频通话
在线体验(无需注册/下载):minicpmo45.modelbest.cn
API(全模态全双工,免费开放)
Demo 开源(Linux 可本地部署全栈):github.com/OpenBMB/MiniCPM-o-Demo
应用场景
- 主动式伴侣:烹饪/修理/运动时的实时指导提醒
- 无障碍辅助:视障人士的「眼睛」,主动播报绿灯/水杯将满
- 智能座舱:监控路况和驾驶员状态,主动提示
- 具身智能:机器人「大脑」,持续感知动态环境自主决策
共同点:不是一次性问答,而是 AI 作为「沉默观察者」+「及时提醒者」融入动态生活流。
当前局限
长时间交互稳定性、主动行为丰富性仍有提升空间。