🔧 AI 知识库

Pixelle-Video:阿里开源 2.2 万 Star,一句话全自动出视频

原文链接

Pixelle-Video:阿里开源 2.2 万 Star,一句话全自动出视频

原文链接:https://mp.weixin.qq.com/s/AEN8XCDZkt4uCmF75kYIvw 来源:极客之家 发布时间:2026-06-13

摘要

阿里国际 AI 团队(AIDC-AI)开源的 Pixelle-Video,GitHub 22k Star,Apache 2.0 协议。输入一个主题,自动走完写文案→配图→配音→合成全链路,吐出成品视频。不是 Runway 那样的生成模型,而是把各家模型串起来的装配工——LLM 写文案 + ComfyUI/Seedream 出图 + Edge-TTS 配音 + ffmpeg 合成。

核心架构:四步流水线

文案生成 → 配图规划 → 逐帧处理 → 视频合成

它自己不生成任何东西,是个装配工。每个环节接什么模型全由你定,画质不行换图模型,文案太烂换 LLM,声音不喜欢换 TTS。

各环节详解

1. 文案

  • GPT-4o、通义千问、DeepSeek、Ollama 本地模型,下拉菜单直接选
  • 不想用 AI 写可以贴现成稿子——项目文档有用户拿这个做《斗破苍穹》小说解说

2. 配图方案(三条路)

  • ComfyUI 工作流:本地跑,需要显卡,自带 image_flux.json
  • RunningHub 云端:工作流挂云上,本地不用显卡,按量付钱
  • 直连模型 API:2026 年 6 月刚上,填 API Key 直接调 DashScope/OpenAI/Seedream/Seedance/Kling

三条路不互斥,可以混搭。比如文案走 Ollama 本地、配图走 Seedream API、语音走 Edge-TTS 免费。

配图风格靠 prompt prefix 统一,所有分镜沿用同一风格,长视频或分集短剧不会风格突变。

3. 语音 + 模板

  • Edge-TTS:微软免费,多语言
  • Index-TTS:上传参考音频做声音克隆,做个人 IP 号省掉录音麻烦
  • 三种模板:static_(纯文字排版)、image_(AI 图作背景)、video_(AI 视频作背景),竖屏横屏方形都有
  • HTML 模板可自定义
  • 默认模板审美偏工具感,要精致得自己调

4. 扩展模块

  • 数字人口播:上传人像图 + 文案,数字人念稿,支持韩语日语(面向跨境电商)
  • 图生视频:静态图动起来,支持动作迁移
  • 自定义素材:上传照片视频,AI 自动分析生成脚本再合成

安装和成本

Windows 用户下整合包解压双击即用,Python/ffmpeg 全在包里不用装。macOS/Linux 从源码跑。

零成本方案:Ollama 本地 LLM + ComfyUI 本地图像 + Edge-TTS 免费语音,需要 8GB+ 显存。

API 成本:通义千问 + Edge-TTS 三段视频约 0.01-0.05 元。全套云端(OpenAI + RunningHub)费用增长但笔记本都能跑。

核心评价

不是完美的——GPU 是硬伤,默认模板审美也就及格。但对于视频教程、内部分享课程这类不需要特别精美的场景非常合适。最大的差异化:不打黑盒,每个环节的模型自由替换,是个开放式装配工而非封闭式一键工具。

GitHub:https://github.com/AIDC-AI/Pixelle-Video