FIBO
首个开源 JSON 原生文生图模型,通过结构化 JSON 实现精确可控的图像生成与局部精修
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个开源 JSON 原生文生图模型,通过结构化 JSON 实现精确可控的图像生成与局部精修
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Bria-AI/FIBO 是 Bria AI 公司于 2025 年 11 月开源发布的首个 JSON 原生可控文生图模型,也是目前开源社区中唯一完全基于授权数据训练的商业级图像生成模型。该项目在 GitHub 发布后迅速获得 300+ Stars,并同步登顶 HuggingFace Trending。其核心理念是让 AI 图像生成从「玄学 Prompt 调优」转向「结构化 JSON 控制」,填补了开源领域在精确可控图像生成上的空白。

图1:FIBO 生成示例——可爱毛茸茸的猫头鹰
FIBO = JSON 驱动的文生图模型:你给结构化 JSON 描述,它输出精确图像。支持三种工作模式:生成(短 Prompt → JSON → 图像)、精修(局部属性调整)、灵感(图生图)。
当前主流文生图模型(如 Stable Diffusion、DALL-E 3、Flux)依赖自然语言 Prompt,用户往往需要反复调整措辞、尝试权重符号,才能得到满意的结果。这种方式有两个根本问题:
Bria AI 团队(来自以色列的 AI 图像创业公司)发现这两个问题本质上互为因果——正是因为缺乏结构化控制,才不得不靠海量数据"暴力"覆盖所有场景,而这恰恰是数据来源混乱的根源。他们的解决方案是:用结构化 JSON 代替自然语言作为图像生成的"控制语言",训练一个真正理解 JSON Schema 的扩散模型。
2025 年 11 月 11 日,FIBO 技术报告发布在 arXiv,同步开源推理代码和微调工具,成为业界首个开源的 JSON 原生文生图模型。
FIBO 是一个基于 Transformer 架构的扩散模型(Diffusion Model),参数量为 8B,规模介于 SDXL(3.5B)和 FLUX(12B)之间。
FIBO 定义了一套标准化的图像描述 JSON Schema,字段涵盖主体、外观、姿势、背景、光照、颜色、相机参数(位置、焦距、景深)、风格介质等。模型在训练时接收 1,000+ 词的长结构化描述,而非简短的英文 Prompt。这种方式让模型学会了"解耦":JSON 中的每个字段对应图像的一个独立维度,调整一个字段不会影响其他维度,从而实现精确的局部控制。同一张图,只需一句指令就能精准改变某个属性——比如把猫头鹰变成棕色,或者把背景从白天换成夜晚,而主体保持不变。
短 Prompt 场景下,FIBO 集成 **VLM(视觉-语言模型)**将用户输入扩展为结构化 JSON。默认使用 Google Gemini API,也可切换为本地 FIBO-VLM(基于 Qwen2-VL 微调,无需调用外部 API):
# 使用 Gemini(需要 GOOGLE_API_KEY)
python generate.py --prompt "A hyper-detailed owl" --seed 1 --output owl.png
# 使用本地 VLM(离线可用)
python generate.py --prompt "A hyper-detailed owl" --model-mode local
FIBO 支持 TeaCache 技术,通过智能缓存中间注意力状态,将推理速度提升 3 倍,同时保持质量基本不变:
python generate.py --prompt "..." --enable-teacache --teacache-threshold 0.8

图2:TeaCache 加速效果对比(3x 加速,质量几乎无损)
FIBO 最独特的能力是解耦精修。给定一个完整结构化 Prompt,只需添加一句指令,模型只修改对应属性,其他部分保持不变:
# 精修:把猫头鹰变成棕色
python generate.py --structured-prompt output.json --prompt "make the owl brown"

图3:Refine 精修效果——局部属性调整示意
FIBO 采用模块化 Python 设计,核心在 src/fibo_inference/ 目录:
| 模块 | 文件 | 功能 |
|---|---|---|
| 推理管道 | fibo_pipeline.py | 封装完整的生成流程 |
| 推理引擎 | inference.py | 模型加载、采样、调度 |
| Transformer | transformer_fibo.py | 核心 U-ViT 架构实现 |
| JSON 解析 | parse_caption.py | JSON Schema 清理与标准化 |
| Prompt → JSON | prompt_to_json.py | VLM 生成结构化描述 |
| TeaCache | teacache.py | KV-Cache 加速推理 |
| 微调工具 | fine_tuning/ | LoRA / 全参数微调 |
技术栈:PyTorch 2.8、Diffusers(HuggingFace 最新版)、Transformers 4.57、Accelerate(分布式推理)、bitsandbytes(量化)、PEFT(LoRA 微调)、uv(环境管理)。
这是 FIBO 与其他开源模型的本质区别。Bria AI 强调其训练数据完全来自授权素材,用户可向 Bria AI 申请商业授权。这解决了企业用户在文生图商用场景中的最大顾虑——数据版权问题。
许可证:非商业用途适用 CC BY-NC 4.0;商业授权需联系 Bria AI 购买。
| 方式 | 难度 | 说明 |
|---|---|---|
| HuggingFace Space | 最简单 | 在线 Demo,无需本地 GPU |
| API(Fal.ai / Replicate / Bria Platform) | 简单 | 按调用付费,无需部署 |
| 本地推理 | 困难 | 需要 16-24GB VRAM GPU |
| ComfyUI 插件 | 中等 | 图形化工作流,设计师友好 |
本地安装依赖通过 uv sync 自动管理,无需手动 pip,解决 Python 环境地狱问题。
--model-mode local 时,需要 Google Gemini API KeyFIBO 的出现标志着开源文生图模型进入结构化可控时代。它验证了一条与 Stable Diffusion 截然不同的技术路径:用高质量结构化数据替代海量非结构化数据,从而实现精确控制。这一思路对 Agentic AI(智能体驱动的图像生成工作流)具有重要价值——Agent 可以程序化生成结构化 JSON,驱动 FIBO 精确渲染产品图、广告素材、游戏资产,大幅降低创意自动化的门槛。
在 2025 年底开源文生图模型普遍面临版权争议的背景下,FIBO 的"授权数据 + 结构化控制"路线,为行业提供了一个可商用的差异化方向。