imaginAIry
Pythonic 一站式 AI 图像与视频生成工具,支持 Stable Diffusion 全系列模
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Pythonic 一站式 AI 图像与视频生成工具,支持 Stable Diffusion 全系列模
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你可能有过这样的经历:想用 Stable Diffusion 生成一张图,却要在 Python 脚本里手动管理 VAE、分词器、调度器,一堆配置文件让人头皮发麻。ImaginAIry 的出现,就是为了终结这种痛苦——它把 Stable Diffusion 的全部能力封装成一行命令行,让创作者专注于「想画什么」,而不是「怎么配置」。
想象一下:你只需要在终端敲下 imagine "a scenic landscape" "a photo of a dog",几步之后,四张精心生成的作品就躺在你的文件夹里了。这不是概念演示,这是 brycedrennan 在 GitHub 上维护了三年多、收获 8,159 颗星的真实项目。
Stable Diffusion 自 2022 年开源以来,迅速成为 AI 生成内容(AIGC)领域最重要的技术底座之一。然而,直接调用 Hugging Face Diffusers 库或 Stability AI 的 SDK,往往意味着:模型权重分散在各处、版本兼容性一言难尽、视频生成需要额外嫁接组件。开源社区涌现了大量「封装层」,但大多数只是简单包装,缺乏完整的 CLI 工具链和持续维护。
ImaginAIry 的作者 brycedrennan 是一名有着扎实工程背景的独立开发者,他从 2021 年就开始在 Stable Diffusion 生态中探索。项目经历了从最初的 diffusers 封装,到引入 refiners 库(Stability AI 官方 Python 框架)作为后端,再到 14.0 版本大规模重构支持 SDXL 和视频生成的演进历程。当前版本(14.3.x)已经集成了 Spandrel 图像超分辨率库,实现了从生成到增强的完整 pipeline。
ImaginAIry 支持所有主流 Stable Diffusion 模型变体,包括 SD1.5、SD2.x、SDXL(Stable Diffusion Extra Large)以及社区模型(如 OpenDALLE)。通过 --model 参数可以无缝切换:
pip install imaginairy
imagine "a bluejay perched on a branch" --model sdxl
最新版本还支持**图像提示(Image Prompt)**功能,通过 --image-prompt 传入参考图,让 AI 同时「看」文字描述和示例图像,生成结果更加可控。此外,Self-Attention Guidance 技术的引入显著提升了高分辨率图像的细节保真度——同样 seed 条件下,720p 和 1080p 生成的图像构图高度一致。
这是 ImaginAIry 最令人眼前一亮的功能。通过 aimg videogen 命令,只需一张输入图像,即可生成 2-4 秒的 AI 视频片段。背后使用的是 Stability AI 开源的 **Stable Video Diffusion(SVD)**模型:
aimg videogen --start-image rocket.png --fps 30 --num-frames 30
视频生成支持多种模式(SVD、SVD-XT、带图像解码器的增强版),并可选输出 bounce(往复)格式,适配短视频场景。14.1.0 版本还加入了帧插值(frame interpolation),让输出视频更加流畅。需要注意的是,视频生成目前仅支持 Nvidia GPU,不支持 Mac 或 CPU 运行。
ImaginAIry 完整接入了 ControlNet 生态,支持 7 种控制模式:
这些控制模式对于 AI 创作者来说,意味着从「随机生成」到「精确控制」的质的飞跃。比如输入一张建筑草图(OpenPose 姿态或 Canny 边缘),AI 就能在保持构图的同时生成逼真的效果图。
除了命令行,ImaginAIry 还提供了一键启动的 HTTP API 服务:
aimg server
启动后在浏览器访问 http://localhost:8000/,即可通过 Web 界面交互式生成图像和视频,背后由 FastAPI 驱动,API 文档在 /docs 路径自动生成。对于需要集成到其他应用中的开发者而言,RESTful API 是比 CLI 更友好的集成方式。
ImaginAIry 的代码结构清晰分为几层:
imaginairy/api/:生成逻辑的核心抽象层,分别封装了 generate_compvis.py(传统 SD)、generate_refiners.py(SDXL + 新特性)、generate_flux.py(Flux 模型)、upscale.py(超分)、video_sample.py(视频生成)等模块imaginairy/http_app/:FastAPI 应用,提供 Web UI 和 REST APIimaginairy/cli/:命令行工具封装,提供 imagine 和 aimg 两个入口imaginairy/enhancers/ 和 imaginairy/modules/:模型增强和神经网络模块imaginairy/weight_management/:模型权重管理,处理从 HuggingFace Hub 或本地路径加载模型项目在 14.0 版本进行了大规模重构,将底层实现迁移到 refiners 库(Stability AI 官方 Python 框架)。这意味着 ImaginAIry 不再重复造轮子,而是站在 Stability AI 的肩膀上,更快速地跟进新模型和新特性(如 SDXL、图像提示等)。
核心依赖包括:PyTorch(CUDA 加速)、transformers(分词器和 CLIP 模型)、diffusers(扩散模型基础设施)、refiners(SDXL + 新特性)、spandrel(超分辨率)、accelerate(推理加速)、pydantic(配置验证)。完整依赖通过 setup.py 管理,开发依赖通过 requirements-dev.txt 单独维护。
值得注意的是,项目同时提供了 Dockerfile(Python 3.10.6-slim 基础镜像)和 Makefile(pyenv 虚拟环境管理),覆盖了 Docker 容器化和本地开发两种场景。文档站点通过 mkdocs-material 构建,托管在 GitHub Pages。
最简单的方式是通过 pip 一键安装:
pip install imaginairy
macOS 用户需要先安装 Rust 编译器(某些依赖需要),且建议使用 Python 3.10(3.11 暂不支持)。Windows 用户在使用视频生成前,需要先从 PyTorch 官网安装支持 CUDA 的 PyTorch 2.0 版本。
对于有 Docker 环境的用户,直接使用项目提供的 Dockerfile 可以省去依赖地狱:
docker build -t imaginairy .
docker run --gpus all imaginairy imagine "a bluejay"
安装完成后,几个最常用的命令:
| 命令 | 用途 |
|---|---|
imagine "prompt" | 基础图像生成 |
aimg videogen --start-image img.png | 从图像生成视频 |
aimg colorize photo.jpg | 图像上色 |
aimg | 交互式 Shell(支持多步编辑) |
aimg server | 启动 Web API 服务 |
所有命令都配有完整的 --help 文档,参数语义清晰(如 --steps 控制采样步数,--prompt-strength 控制编辑强度)。
没有任何工具是完美的,ImaginAIry 也不例外:
ImaginAIry 不是一个追热点的玩具项目,而是经过三年持续迭代、生产可用的 Stable Diffusion 工具链。它的价值在于:把学术界的前沿模型以工程化的方式交付给终端用户。8,159 颗星、473 个 forks 的社区认可,证明了这套「Pythonic + CLI 优先」设计方向的正确性。
从趋势来看,随着 Stable Diffusion 3、FLUX 等新模型陆续开源,以及视频生成技术的快速成熟(Runway Gen-3、Pika、Sora 等商业方案),ImaginAIry 这类工具的重要性只会持续增加——它们降低了 AI 生成技术的使用门槛,让更多创作者能够把精力放在「创意」而非「工程」上。
如果你正在寻找一个稳定、好用、持续维护的 Stable Diffusion Python 封装库,ImaginAIry 值得放进你的工具箱。