Pixelle-Video
AI全自动短视频引擎:输入话题,输出完整短视频(文案+配图+配音+剪辑),本地执行、隐私安全
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI全自动短视频引擎:输入话题,输出完整短视频(文案+配图+配音+剪辑),本地执行、隐私安全
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,一个没有摄影团队、没有专业设备的人,是怎么在抖音和B站上持续产出高质量短视频的?答案可能比你想象的更简单——他用 AI 给自己当导演、写稿、出镜、配音、剪辑,整个流程全自动,一个人顶一个内容工厂。
Pixelle-Video 就是这样一套系统。它由 AIDC-AI 团队开源发布,GitHub 获星近 2 万次,是当前最热门的 AI 短视频生成工具之一。Apache 2.0 许可,完全免费可商用,你可以在自己电脑上跑,也可以部署到服务器接 API。

图1:Pixelle-Video 流水线架构 —— 从文字到视频的全链路自动化
传统短视频制作需要多个专业工具配合:先用 ChatGPT 写脚本,再用 Midjourney 生图,然后用 11 Labs 配音,最后用剪映剪辑。一套流程下来,至少要折腾 2-3 个小时,工具切换频繁,内容一致性也难以保证。
Pixelle-Video 把这一切整合成一个端到端管道。你只需要输入一个话题——比如「为什么我们应该每天读书」——系统会自动完成以下所有步骤:
第一步,AI 写稿。调用大语言模型,根据你选择的内容类型(知识科普、个人成长、文化解说、历史纪实等 12 种类型)生成对应风格的脚本文案。
第二步,AI 生图。基于 ComfyUI 工作流,根据脚本内容自动生成配套图片素材,支持卡通、纪实、电影感等多种风格。
第三步,AI 配音。使用微软 Edge TTS 文字转语音引擎,支持中文普通话及多方言音色,也支持克隆自定义声音。
第四步,AI 剪辑合成。用 FFmpeg 将图片、配音、BGM 按时间轴自动组装成完整视频,可选竖屏(9:16)或横屏(16:9),适配不同平台。
整个过程在本地执行,所有素材不离开你的机器,隐私安全有保障。
从源码来看,Pixelle-Video 的架构非常清晰,体现了良好的工程设计:
后端 API 层(api/ 目录):基于 FastAPI 实现,提供了完整的内容管理 API,包括内容生成路由(content.py)、文件管理(files.py)、图片生成(image.py)、TTS 语音(tts.py)、视频合成(video.py)等 REST 接口。开发者和企业可以基于这些 API 将 Pixelle-Video 集成到自己的内容平台中。
Web UI 层(web/ 目录):基于 Streamlit 构建,提供交互友好的图形界面,适合非技术用户直接在浏览器中操作。启动方式一行命令:uv run streamlit run web/app.py。
核心业务层(pixelle_video/ 目录):包含四大核心模块:
pipelines/:视频生成流水线核心逻辑,支持标准流水线(standard)、线性流水线(linear)、资产流水线(asset_based)和自定义流水线(custom)四种模式,可根据不同内容需求灵活切换。services/:封装了 ComfyUI 图像生成服务(comfy_base_service.py)、LLM 服务(llm_service.py)、TTS 语音服务(tts_service.py)、视频处理服务(video.py)等,所有外部 AI 能力在这里统一调度。prompts/:预置了 12 种内容类型的 prompt 模板,覆盖知识科普、个人成长、文化解说、历史纪实、情感、悬疑等主流内容赛道。config/:配置管理,支持自定义 LLM 厂商(OpenAI、阿里通义千问等兼容 OpenAI SDK 的接口)。Pixelle-Video 在部署方面下了不少功夫。项目根目录同时提供了 Dockerfile(单阶段构建,基于 python:3.11-slim)和 docker-compose.yml(包含 init + api + web 三个服务),开箱即用。docker-compose 还内置了国内镜像源切换机制(USE_CN_MIRLOR=true),国内用户可以无障碍拉取镜像。
部署步骤非常简洁:
config.example.yaml 为 config.yaml,填入 LLM API Keydocker-compose up -dhttp://localhost:8501 打开 Web UI不过,这里有一个硬性前提:必须有一块支持 CUDA 的 Nvidia 显卡。ComfyUI 图像生成是 GPU 密集型任务,没有显卡的话生图步骤会非常缓慢甚至无法运行。官方建议 8GB 以上显存。内存和磁盘需求相对温和,16GB RAM + 20GB 磁盘基本够用。
对于没有独立显卡的用户,项目也提供了 Windows 整合包(免配置,直接运行),以及纯 API 模式(后台调用,不依赖图形界面)。
根据项目 README 中展示的示例和社区反馈,Pixelle-Video 特别适合以下场景:
知识类短视频是它的强项。系统预置的知识科普类 prompt 模板生成的文案结构完整、有逻辑性,配图质量在 ComfyUI 的加持下也相当不错。B站上已有大量用 Pixelle-Video 制作的科普视频,最高播放超过百万。
数字人口播类内容也有不错表现。使用 Edge TTS 的中文音色生成的配音,自然度已经达到了「听起来像真人」的水平(相比早期的机械音有质的飞跃)。配合数字人图片生成,可以生成类似「AI 主播讲知识」的短视频。
局限性也客观存在:视频时长受限于单次生图的 token 消耗,适合 1-3 分钟的短内容;复杂叙事逻辑和镜头语言切换仍然是 AI 的短板;ComfyUI 工作流对硬件要求较高,在没有 GPU 的环境下体验会大打折扣。
Pixelle-Video 背后的趋势值得思考:AI 视频生成正在从「专业工具」向「人人可用的流水线」演进。早期的 AI 视频工具(Runway、Pika)侧重于让用户手动控制每一帧,而 Pixelle-Video 的思路完全不同——你只管提需求,执行全部交给 AI。这种「输入话题,输出视频」的模式,代表了 AIGC 从展示技术能力走向实际内容生产力的方向。
从技术演进看,这个项目也是 ComfyUI 生态持续扩张的一个缩影。ComfyUI 最早只是一个 Stable Diffusion 的图形化工作流工具,如今已经成为 AI 图像生成的事实标准平台,并开始向视频、音频等更多模态延伸。Pixelle-Video 的成功验证了 ComfyUI 在非图像领域的扩展可行性。
对于内容创作者:这是一个可以显著降低短视频制作门槛的工具,特别是知识类、教育类内容。对于开发者:这是研究 AI 内容生成流水线的优秀参考实现,代码结构清晰、模块化良好、扩展性强。