🔬 模型 / 技术前沿
8 篇文章
Voicebox:免费开源声音克隆工具,3 秒复刻任意音色
Voicebox 是一款免费开源的声音克隆工具,GitHub 3 万+ Star。集成 Qwen3-TTS 等 7 套语音引擎,覆盖 23 种语言。支持音色克隆、文字转语音、多角色对话故事制作。已打包 Windows/Mac 桌面客户端,无需代码知识即可使用。
2026-07-09撸猫撸出SOTA!3个00后2个月,造出史上最快流式音视频社交模型
中国 10 人初创团队 Catnip(猫薄荷)推出流式音视频模型 MaineCoon(缅因猫),22B 参数,单张 H100 跑出 47.5 FPS(业界第一),支持 30 分钟以上连续音视频流式生成,每秒成本仅 0.00025 美元(Veo 3 的 1/2000)。核心创新:首次将场景垂直落地在社交交互——边生成边播放、音画同出、实时响应指令切换。3 名 00 后核心研究员,2 个月 AI Native 全栈交付,已获红杉、明势天使轮+融资。
2026-06-30daily_stock_analysis:52K Star 的 AI 多市场股票智能分析系统
daily_stock_analysis 是一个基于 AI 大模型的 A 股/港股/美股/日股/韩股自选股智能分析系统,4 个月从 1.6K Star 涨到 52K Star。新版增加可视化 Web 客户端、AI 问股/选股/回测功能,配置从文本改成可视化界面。Docker 一键部署,DeepSeek V4 Flash 跑 7 次问股 + 3 次分析仅消耗 1 毛钱。支持企业微信/飞书等推送「决策仪表盘」。
2026-06-30清华开源 TTS 王炸 VoxCPM2:2B 参数 30 语言语音设计克隆全包
OpenBMB 团队开源的 VoxCPM2——2B 参数端到端 TTS,200 万小时训练数据,30 种语言,Apache-2.0。最大卖点:tokenizer-free + 扩散自回归架构,连续空间直接生成,一步到位出 48kHz 工作室级音质。三大核心功能:语音设计(文字描述创造全新人声)、可控克隆(3 秒参考 + 风格指引)、王者克隆(连呼吸都还原)。RTX 4090 RTF 约 0.3,Nano-vLLM 加速到 0.13,峰值显存仅 8GB。
2026-06-30SenseNova U1:商汤 8B 开源多模态模型,图文交错 + 信息图生成
商汤开源 SenseNova U1,8B dense + A3B MoE 两个版本,Apache 2.0。架构上砍掉 Visual Encoder 和 VAE(NEO-Unify 架构),模型直接读原始像素、直接输出像素,近乎无损视觉表征。最大差异化能力:图文交错(一次输出含多张图+段落正文的连贯混排)。8B 体积信息图质量跟 Qwen-Image 2.0/Seedream 4.5 持平但延迟更低(2K 图十几秒 vs 闭源几十秒)。作者实测做书籍配图,效果超出预期。
2026-06-30Qwen3.6-35B-A3B NVFP4:NVIDIA 官方量化版,3 倍压缩几乎无损
NVIDIA 发布 Qwen3.6-35B-A3B 的 NVFP4 量化版,内存从 36GB 降到约 19GB,精度几乎无损(MMLU Pro 仅掉 0.6 分)。一行 vLLM 命令部署,消费级 GPU 可跑。三家在做同一种量化——NVIDIA/Unsloth/Red Hat AI,但工具链、校准数据、文件结构差异明显,NVIDIA 版最规范、benchmark 最全,工业生产首选。
2026-06-30PixiJS 火了:HTML-in-Canvas 真的落地了!
PixiJS v8.19.0 正式支持 HTML-in-Canvas——可以把真实 DOM 元素渲染成 texture,进入 GPU 管线。不是 html2canvas 那种模拟截图,而是浏览器底层能力,DOM 仍然保留交互(输入框可编辑、链接可点击、CSS animation 继续跑),同时被 PixiJS 当作纹理参与渲染、动画、滤镜、合成。长期来看,这是"HTML 负责布局交互 + PixiJS 负责渲染合成"的新范式。
2026-06-30谷歌 DiffusionGemma 续集:Unsloth 压到 18GB,单卡 2000+ Token/s
三天前 vLLM 在 H100 上跑 DiffusionGemma 达到 1000+ tok/s,Unsloth 直接把它量化成 GGUF,丢进 llama.cpp,单卡 2000+ tok/s,最低 18GB RAM 就能跑。扩散式大模型从"云端 H100 专属"直接下沉到消费级 24GB 显卡。
2026-06-30