Pixelle-Video
输入一个主题,AI全自动完成文案、配图、配音、视频剪辑,输出完整短视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
输入一个主题,AI全自动完成文案、配图、配音、视频剪辑,输出完整短视频
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你是否曾经为制作一条短视频而头疼?写文案、找配图、配音、剪辑——每一个环节都需要专业技能和大量时间。对于想要日更的知识博主、渴望推广产品的电商运营,或是需要批量制作内容的内容创作者来说,这个流程往往是最大的瓶颈。今天要介绍的 Pixelle-Video,正是为了解决这个痛点而生。
Pixelle-Video 是由 AIDC-AI 团队(隶属于 ATH-MaaS 组织)开源的 AI 全自动短视频引擎,当前在 GitHub 已收获超过 25702 颗星。项目的主页展示了一系列令人印象深刻的演示视频——从知识科普到文化解说,从竖屏到横屏,只需输入一个主题关键词,AI 就能全自动完成从文案到成片的全部流程。

图1:Pixelle-Video Web UI 主界面
如果把 Pixelle-Video 比作一家短视频工厂,那么它的核心设计理念就是「输入一个想法,输出一段视频」。整个视频生产流水线被拆解为四个原子化环节:文案生成 → 配图生成 → 语音合成 → 视频剪辑。每个环节既可以独立工作,也可以灵活替换为不同的 AI 引擎或服务商——这正是项目自称「原子能力灵活组合」的含义。

图2:Pixelle-Video 视频生成流水线
后端架构基于 FastAPI 构建,提供了完整的 RESTful API 层(api/ 模块),支持同步和异步两种视频生成模式,并内置了任务队列管理器处理长视频的生成请求。前端 Web UI 则使用 Streamlit 实现多页面应用,主入口为 web/app.py,页面包括主页(Home)和历史记录(History)两大模块。
项目的核心业务逻辑封装在 pixelle_video/ 包中,按职责分为多个子模块:services/ 目录包含各类 AI 能力的服务封装(LLM、TTS、图像生成、视频生成);pipelines/ 目录定义了从文案到成片的完整处理流水线;config/ 负责配置文件管理;models/ 定义数据模型;prompts/ 管理各类文案提示词模板。
AI 能力层是 Pixelle-Video 最具特色的部分。项目同时支持两条技术路线:
路线一:ComfyUI / RunningHub 工作流引擎。项目内置了大量 JSON 格式的 ComfyUI 工作流文件,存放在 workflows/selfhost/(本地 ComfyUI)和 workflows/runninghub/(云端 RunningHub)目录下。这些工作流覆盖了图像生成(Flux、Qwen、SDXL、Nano Banana)、视频生成(Wan 2.1、Wan 2.2)、音频处理(TTS Edge、Index TTS)以及视频/图像分析等多个能力节点。核心依赖 comfykit 库提供了 Python 级的 ComfyUI API 封装,使得工作流可以像函数调用一样被触发。
路线二:直连 API 模型。从 2026 年 6 月 1 日的更新开始,项目支持在 Web UI 中直接配置 DashScope(通义万象/Wan)、OpenAI(GPT Image)、字节 ARK(Seedream/Seedance)、Kling(可灵视频)等多家模型供应商的 API。配置项包含 API Key、Base URL 和本地代理开关,真正做到了「不依赖 ComfyUI 也可用」。
视频生成环节的技术选型体现了项目的前瞻性。web/pipelines/ 目录下实现了多种生成流水线:standard.py 对应标准图文视频模式;digital_human.py 处理数字人口播视频(上传人物照片作为数字人形象);i2v.py 实现图生视频;action_transfer.py 实现动作迁移(上传参考视频驱动图片中的人物动作);api_workflows.py 封装直连 API 的视频生成逻辑;asset_based.py 支持用户上传自定义素材。
语音合成层集成了 Edge-TTS(微软开源方案,支持多语言和中文方言音色)和 Index-TTS(支持声音克隆)。用户可以上传参考音频,让 AI 学习并复刻特定音色,非常适合需要统一品牌声音形象的运营场景。
前端 Web UI 使用 Streamlit 的 st.navigation API 实现了多页面路由,三栏布局清晰划分了内容输入区、媒体设置区和视频预览区。界面内置了丰富的预览功能——文案风格预览、图像生成预览、TTS 语音预览、模板效果预览——极大降低了用户的试错成本。国际化支持通过 web/i18n/ 目录管理。
部署层面,项目提供了三种上手路径:最简单的是 Windows 一键整合包(解压即用,内置 Python/uv/ffmpeg);进阶用户可以使用 Docker Compose 一键部署(服务包含 init 容器确保配置初始化、API 服务和完整依赖);有定制需求的用户可以从源码通过 uv run streamlit run web/app.py 启动。
Dockerfile 设计考虑了国内外不同网络环境,通过 USE_CN_MIRROR 构建参数自动切换 PyPI/TUNA 镜像源和 apt 源。容器内安装了 Chromium 浏览器(用于 Playwright 驱动的工作流),并预装了 CJK 字体支持确保中文字体渲染正确。
不过需要注意的是,Pixelle-Video 的完整能力依赖 GPU 加速。AI 图像生成和视频生成都需要 NVIDIA GPU 支持(推荐 8GB 以上显存),没有显卡的用户只能使用 API 模式(需付费购买 API 额度),无法本地免费运行。此外,视频生成速度高度依赖模型推理性能,生成一条 30 秒的视频通常需要 5-10 分钟。
从行业角度看,Pixelle-Video 处于 AIGC 视频创作工具链的核心位置。它不只是一个工具,更是一套将多模态 AI 模型串联成端到端应用的工程范式。项目巧妙地将 ComfyUI 工作流生态引入视频创作流程,使得原本需要手动操作的复杂 AI 能力组合变成了可配置、可复用的自动化流水线。
总的来看,Pixelle-Video 的代码质量较高:使用 Pydantic 进行数据建模、Loguru 统一日志管理、uv 作为现代 Python 包管理器、Ruff 进行代码规范检查。项目采用 Apache 2.0 许可证,完全开源,文档详尽(含完整中文 README 和独立文档站)。
如果你是一个想要快速产出短视频但缺乏剪辑经验的内容创作者,Pixelle-Video 的 Windows 整合包是最低门槛的选择;如果你是有一定技术背景的开发者,想要本地部署并自定义 AI 能力,Docker Compose 和 ComfyUI 集成提供了最大的灵活性。无论哪种方式,输入一个主题,几分钟后就能得到一条完整的 AI 视频——这正是它的核心价值所在。

图3:AIDC-AI 团队