撸猫撸出SOTA!3个00后2个月,造出史上最快流式音视频社交模型
原文链接撸猫撸出SOTA!3个00后2个月,造出史上最快流式音视频社交模型
原文链接:https://mp.weixin.qq.com/s/qiWKFjBceVBZ3Q_Izkq99A 来源:量子位 发布时间:2026-06-20
摘要
中国 10 人初创团队 Catnip(猫薄荷)推出流式音视频模型 MaineCoon(缅因猫),22B 参数,单张 H100 跑出 47.5 FPS(业界第一),支持 30 分钟以上连续音视频流式生成,每秒成本仅 0.00025 美元(Veo 3 的 1/2000)。核心创新:首次将场景垂直落地在社交交互——边生成边播放、音画同出、实时响应指令切换。3 名 00 后核心研究员,2 个月 AI Native 全栈交付,已获红杉、明势天使轮+融资。
核心突破:三件事同时做到
此前没有任何模型能同时做到的三件事:
1. 音视频流式生成
将生成单元极致压缩到亚秒级,指令输出后 1 秒内出首帧。和传统"等生成完再看"完全不同——实时生成,中间随时可切指令,角色能根据新 prompt 即时调整表情、语气。
最大感受:活人感。不是 AI 一口气输出一堆回复的生硬感,而是真人聊天般的即视感——会接话、会给你情绪反馈。
2. 业界最快推理速度
| 模型 | FPS | 备注 |
|---|---|---|
| MaineCoon (22B) | 47.5 | 单 H100 |
| MaineCoon (22B) | 30+ | RTX Pro 6000(H100 一半成本) |
| 同类流式音视频模型 | 6-7 | — |
| 1.3B 轻量流式视频模型 | 19.1 | — |
快 7 倍但不牺牲质量,情感表达更丰富、动作更连贯稳定。
3. 无限时长生成
可连续生成 10 分钟以上,画质、一致性、音画同步不崩。架构上完全可以无限生成。
技术架构
训练侧:三层递进
Step 1:自重采样(Self-Resampling) 解决推训鸿沟——传统训练用干净历史帧,推理时只能用自生成的帧,偏差累积。自重采样让模型在训练时就接触降质版历史帧。
Step 2:流式表征对齐(Representation Alignment) 引入冻结预训练 V-JEPA 2 视觉编码器做蒸馏监督,加速跨模态语义结构学习。
Step 3:域感知偏好优化(DPO)+ 强化在线策略蒸馏(ROPD) 针对不同社交场景(舞蹈看重动态、对话看重唇同步、远景看重人体结构)分别训练偏好专家,再蒸馏统一成可部署的流式策略。
训练成本:22B 模型,10k GPU 小时,不到 100 万条数据。
推理侧:三智能体框架
- Director(认知核心):规划器逐节拍生成结构化 prompt(画面+台词+环境音),观测器持续监测质量漂移并启动前向修复
- Cache Manager(缓存管理器):管理 KV 缓存保留与清除策略,角色外观/场景/关键帧作为长期记忆锚点
- Buffer Controller(前瞻缓冲控制器):控制已生成未播放的缓冲量,平衡实时性与交互响应
简单类比:一个写剧本、一个管记忆、一个控节奏。
SocialVideo Bench
自建首个社交短视频专用基准,覆盖 7 大场景(密集演讲、双人互动、音乐演唱、情绪表演、舞蹈、创意挑战、社交梗)、9 项指标。MaineCoon 综合得分 0.934,超越最优基线 SoulX-FlashTalk(0.895),刷新 SOTA。
团队背景
- Catnip,base 中国,10 人,00 后团队
- 创始人 杨姝瑞:TikTok/PixVerse 产品背景,连续创业者
- 首席科学家 谢泽柯:港科大(广州)助理教授,中科大本科 + 东大博士,NeurIPS/ICLR/ICML 领域主席
- 3 名核心研究员,2 个月 AI Native 全栈交付
- 已获红杉、明势天使轮+融资
下一步:社交世界模型
Catnip 提出 社交世界模型 概念——以人为坐标系中心,分三层:
感知层(读懂情绪)→ 模拟层(预测社交行为)→ 渲染层(实时生成音视频)
MaineCoon 先突破渲染层,下一步是实现人类式连续、交错、多模态的实时双向交互。
关键信息
- 论文:https://arxiv.org/abs/2606.17800
- 官网:https://mainecoon.tech/
- 已限量开放 200 个内测邀请码