awesome-text-to-video
jianzhnie/awesome-text-to-video加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

一文读懂 Text-to-Video:从 Sora 到开源生态,AI 视频生成现在发展到哪一步了?
2023 年以前,AI 生成图像已经相当成熟——Midjourney、DALL·E、Stable Diffusion 让"一句话生成图片"成为日常。但视频呢?彼时所谓的"AI 视频"大多是 GIF 级别的循环动图,时长不超过 4 秒,运动轨迹僵硬得像 PPT 动画。
转折点出现在 2024 年。Sora 的发布让全世界第一次见识到"一分钟连贯、物理合理、镜头感十足"的 AI 视频——尽管后来证明演示视频存在大量 cherry-picking,OpenAI 也在 2026 年初悄悄关停了消费者版 Sora。但 Sora 激起的波澜,已经无法收回。
awesome-text-to-video 正是诞生于这一浪潮中,由独立开发者 jianzhnie 维护。这是一个持续更新的文本转视频(Text-to-Video, T2V)领域精选资源库,系统梳理了商业产品、开源模型、学术论文、数据集和基准测试。截至 2026 年 6 月,库中收录了 30+ 开源模型、100+ 商业产品、400+ 论文。
这是理解这个项目最关键的地方:awesome-text-to-video 不是一个可以 run 的代码仓库,而是一个精心维护的知识导航站。
仓库里只有 5 个文件:README.md(39KB)、LICENSE、配置文件(.flake8、.gitignore、.pre-commit-config.yaml),没有任何可执行代码。没有 Dockerfile、没有 Web 界面、没有 requirements.txt。这与传统的 AI 项目截然不同。
但这恰恰是 awesome-list 的价值所在:在一个信息过载的时代,有人在帮你做信息筛选和结构化。T2V 领域日新月异——今天推荐的模型三个月后可能已落后,新的论文每天都在 arXiv 上涌现。维护者 jianzhnie 持续追踪这个领域,按年份、按类型、按功能对资源进行分类整理,这份工作本身就是高价值的。
README 将商业 T2V 产品分为三大类:
Generative T2V 模型(生造型):Runway Gen-4.5、Seedance 2.0、Kling 3.0、Veo 3.1 等,代表趋势是原生 4K 输出 + 同步音频生成成为标配。这一领域竞争极为激烈,技术迭代速度远超开源。
AI Avatar / Presenter 工具(虚拟人型):Synthesia、HeyGen、D-ID 等,定位于企业培训、营销视频、在线教育场景。与生造型不同,Avatar 工具强调人物一致性和口型同步,技术门槛相对可控。
All-in-One 创作平台:Pika、Luma Dream Machine 等,提供从创意到成片的端到端体验,降低创作者的使用门槛。
这是库中最有技术深度的部分。以表格形式呈现每个开源模型的:
| 维度 | 说明 |
|---|---|
| 参数量 | 从 1.3B 到 27B 不等 |
| 最低 VRAM | 5B 模型最低可至 8GB |
| 核心优势 | 各模型的差异化定位 |
值得重点关注的模型:
架构趋势:2025-2026 年,主流 T2V 方案从纯 Diffusion 向 DiT(Diffusion Transformer) 收敛,各家竞争焦点转向效率优化(sliding tile attention、量化加速)和长视频生成能力。
README 按 2026→2022→2021 以前分层归档了大量学术论文,覆盖:
这使得 awesome-text-to-video 同时充当了该领域的学习路线图——对于想系统了解 T2V 技术演进的研究者,按年份梳理的论文列表极具参考价值。
对于普通爱好者:直接翻阅 README 的 Table of Contents,根据自己的需求(商业产品试用 / 开源模型部署 / 学术研究)跳转到对应章节。大多数条目都附带了 GitHub 链接或官网链接,可直接访问。
对于开发者:如果目标是部署开源模型,库中列出的每个模型都标注了最低 VRAM 需求,可以据此评估自己的硬件条件。其中 CogVideoX(2B 版本,~16GB VRAM) 和 LTX-2.3(~8GB VRAM) 是入门门槛最低的高质量方案。
信息时效性挑战:T2V 领域迭代极快。README 中标注"截至 2026 年 6 月",但一个月后格局可能已有变化。awesome-list 的固有缺陷——维护者的更新速度很难跟上技术演进。
深度不足:作为一个导航型资源库,awesome-text-to-video 不会教你 DiT 的数学原理,也不会比较两个模型的 FID/CLIP 分数。它提供的是广度覆盖,深度挖掘需要结合具体论文和模型仓库。
非代码属性:对于期待"下载即用"的开发者,这个仓库会让人失望——没有预训练权重、没有推理脚本、没有 WebUI,一切需要用户自行配置。
awesome-text-to-video 的存在本身,折射了 T2V 领域的一个有趣现象:基础设施已经不再稀缺,但信息整合仍然稀缺。
过去两年,开源社区在 T2V 上的投入可以用"军备竞赛"形容——每两三个月就有新模型刷新 SOTA。但普通用户、研究者、甚至从业者,在面对十几个名字相近、功能交叉的模型时,选择成本急剧上升。awesome-list 的价值,正在于降低这种选择成本。
这也是为什么一个没有一行可执行代码的仓库,能获得 745 颗星。
数据来源:GitHub jianzhnie/awesome-text-to-video,2026 年 9 月。