flux
120亿参数开源图像生成模型,Apache-2.0可商用,1-4步出图超越Midjourney
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
120亿参数开源图像生成模型,Apache-2.0可商用,1-4步出图超越Midjourney
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2023年,Stable Diffusion 的核心创始团队集体出走 Stability AI,创立了 Black Forest Labs(黑森林实验室)。这支团队曾一手打造了开源 AI 绘图领域的标杆产品 Stable Diffusion,而他们的离职在彼时引发了行业震动。如今,这支团队带着全新的作品回来了——FLUX.1,一个在多项图像生成 benchmark 上超越 Midjourney、DALL-E 3 的开源模型家族。
2024年,Black Forest Labs 获得了 3100 万美元种子轮融资,由 Andreessen Horowitz 领投,估值迅速攀升。这家仅有十几人的德国小团队,凭借 FLUX.1 系列模型,已然成为开源图像生成领域的领头羊。他们的目标是:让开源模型达到闭源商业模型的水平,同时保持完全透明。
图1:FLUX.1 系列模型生成效果展示,涵盖写实、风格化、场景构建等多种场景
Black Forest Labs 一次性发布了 6 个定位不同的模型,形成了完整的产品矩阵:
| 模型 | 定位 | 许可证 | 速度 |
|---|---|---|---|
| FLUX.1 [schnell] | 快速生成 | Apache-2.0(可商用) | 比 dev 快 10 倍 |
| FLUX.1 [dev] | 开发研究 | 非商业许可 | 25-50 步推理 |
| FLUX.1 Fill [dev] | 局部重绘 | 非商业许可 | — |
| FLUX.1 Canny [dev] | 边缘控制 | 非商业许可 | — |
| FLUX.1 Depth [dev] | 深度控制 | 非商业许可 | — |
| FLUX.1 Redux [dev] | 图像变体 | 非商业许可 | — |
| FLUX.1 Kontext [dev] | 场景编辑 | 非商业许可 | — |
最值得关注的是 FLUX.1 [schnell]——这是唯一采用 Apache-2.0 许可的版本,意味着企业可以直接商用,无需支付任何授权费用。相比之下,Midjourney 的商业使用需要订阅付费套餐,DALL-E 3 的 API 按调用次数计费,而 FLUX.1 [schnell] 完全可以本地部署、零边际成本运行。
上手门槛评估:中等
部署 FLUX.1 并不像想象中那么困难。官方提供了详尽的安装文档,核心流程只有三步:
git clone https://github.com/black-forest-labs/flux
cd flux
pip install -e ".[all]"
[all] 依赖组会同时安装 Gradio(Web 界面)和 Streamlit(交互工具),安装完成后直接运行 demo_gr.py,即可在本地打开一个功能完整的图像生成 Web 界面,输入提示词即可出图。
GPU 是硬性要求。FLUX.1 [dev] 是 12B(120 亿)参数的巨型模型,需要至少 12GB 显存才能运行(实测 RTX 3090 24GB 可用,RTX 4060 Ti 16GB 也可运行但受限)。好在 FLUX.1 [schnell] 经过蒸馏优化,显存占用更低,普通游戏显卡也有机会跑起来。
TensorRT 加速是进阶玩家的福利。NVIDIA 官方提供了 TensorRT 集成,通过 pip install -e ".[tensorrt]" 安装,配合 NVIDIA PyTorch 镜像,可将推理速度提升至原生 PyTorch 的 2 倍以上。这对需要高频调用的生产环境非常有价值。
需要注意的是,项目不提供 Dockerfile,也没有 docker-compose 支持,不支持容器化一键部署。对于习惯了 docker run 的用户来说,需要先在宿主机配置 Python 环境再安装。对于有 Docker 偏好的用户,这是一个小遗憾。
FLUX.1 的技术底座是 Rectified Flow Transformer,这与 Stable Diffusion 系列的 U-Net 架构有本质区别。Rectified Flow 是一种新型扩散范式,将数据从噪声到真实图像的过程建模为最优传输路径,相比传统 DDPM 在相同步数下能获得更高质量的生成结果。
核心技术亮点:
invisible-watermark 模块,对所有生成的图像自动嵌入隐形水印,用于溯源和防止滥用,体现了团队对 AI 安全的重视。项目自带两个开箱即用的 Web UI:
Gradio 界面(demo_gr.py) 是最推荐的体验方式。界面包含完整的参数控制面板:步数(1-50)、指导系数、分辨率(最高 1024×1024)、种子值等。内置了 NSFW 内容过滤器,对违规图像进行过滤。生成完成后,界面直接展示结果并支持下载。
Streamlit 界面(demo_st.py) 提供了可绘制的画布,支持上传参考图进行图生图(Image-to-Image)操作,适合需要更多交互控制的场景。
对于不想折腾代码的用户,也可以直接访问 fal.ai、DeepInfra 等平台的在线演示,直接在浏览器里体验 FLUX 的能力。
技术栈: Python 3.10+ / PyTorch 2.6.0 / Transformers(HuggingFace)/ Accelerate / Gradio / Streamlit / Safetensors / TensorRT / ONNX / Ruff / Pyright
代码质量评估:
整体代码质量很高。模块划分清晰,核心推理逻辑(sampling.py)、模型加载(util/)、CLI 接口(cli*.py)各司其职。README 文档详尽,模型卡片(model_cards/)和许可证说明(model_licenses/)完备。测试方面仓库中未发现测试文件,这是纯研究代码的常见取舍——对于推理工具来说,文档完整比测试覆盖更重要。
显存需求过高:12B 参数模型对普通用户的硬件要求较高,云端 GPU 租用成本不菲,限制了其在消费级设备上的普及。
许可证分层复杂:schnell 可商用、dev 不可商用的双轨许可模式,虽然团队给出了合理解释,但对于企业用户来说,需要仔细区分模型版本以避免法律风险。
水印不可去除:invisible-watermark 是负责任 AI 的体现,但也意味着用户无法获得完全"干净"的图像,部分商业场景可能介意。
FLUX.1 的发布标志着开源图像生成正式进入"GPT-4 时刻"——开源模型在能力上追平甚至超越同期闭源产品。Stable Diffusion 3 遭遇技术风波,Midjourney 持续领跑商业市场,DALL-E 3 牢牢占据 OpenAI 生态,而 FLUX.1 的出现一举打破格局。
一个值得关注的趋势是:FLUX.1 [schnell] 的 Apache-2.0 许可正在催生一批新的 AI 图像 SaaS 服务,这些服务不再需要向闭源模型付费,降低了 AI 应用创业的门槛。
Black Forest Labs 的成功也证明了:专注小团队 + 顶级研究 + 社区友好的开源策略,完全可以在大厂林立的 AI 领域杀出一条血路。