INF-MLLM
INF-MLLM 是多代际多模态大模型开源项目家族,涵盖视觉语言理解、RL 自反思推理和 SOTA
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
INF-MLLM 是多代际多模态大模型开源项目家族,涵盖视觉语言理解、RL 自反思推理和 SOTA
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下:你有一份 200 页的扫描版 PDF 合同,里面有文字、表格、手写批注和印章,传统的 OCR 工具要么乱码、要么漏行、要么把表格拆得七零八落。而 INF-MLLM 家族要做的事情,就是让 AI 模型像人一样,真正「看见」并理解文档的每一个细节——不只是文字,还有排版结构、图表关系、多页逻辑。
INF-MLLM 由新加坡研究机构 INF Tech 开发维护,项目主页可见于 HuggingFace(https://huggingface.co/infly)。该仓库是一个多代际多模态大模型(MMLLM)家族的组织容器,共包含 5 个子项目:
| 子项目 | 发布时间 | 核心定位 |
|---|---|---|
| INF-MLLM1 | 2023-12 | 统一视觉语言任务基础模型 |
| INF-MLLM2 | 2024-08 | 高分辨率图像 + 文档理解增强 |
| VL-Rethinker | 2025-04 | 多模态强化学习自反思机制(NeurIPS 2025 Spotlight) |
| Infinity-Parser | 2025-11 | 强化学习训练的端到端文档解析(ACL 2026 Findings) |
| Infinity-Parser2 | 2026-05 | 旗舰级文档解析模型(SOTA) |
图1:INF-MLLM 家族标识
2025 年 4 月,VL-Rethinker 被 NeurIPS 2025 Spotlight 录取;2025 年 11 月,Infinity-Parser 相关论文被 ACL 2026 Findings 接收。能同时在 NLP 和 AI 顶会均有建树,说明这个团队在多模态理解和文档智能两个方向都有扎实积累。
INF-MLLM 家族各代际的架构设计各有侧重,但整体遵循 Vision Transformer(ViT) + Large Language Model(LLM) 的标准 MLLM 范式。
INF-MLLM1 / INF-MLLM2:基于 transformers 库(v4.31.0),使用 timm(v0.9.5)作为视觉编码器 backbone,通过 sentencepiece 分词。模型接受图文对输入,输出文本响应,支持 VQA、视觉定位等多任务。demo.py 展示了完整的推理流程:图像经过 expand2square 预处理为正方形,通过 AutoModel / AutoTokenizer 加载模型,特殊图像 token 作为占位符。
VL-Rethinker:在标准 GRPO(Group Relative Policy Optimization)算法基础上引入两项创新:① 选择性样本回放(SSR) 解决「优势消失」问题;② 强制反思(Forced Rethinking) 显式引导模型进行自反思推理步骤。数据集 ViRL39K 提供了细粒度的多模态推理样本,用于训练模型的自我修正能力。
Infinity-Parser 系列:这是整个家族中最具工程价值的子项目。其核心创新在于强化学习训练的布局感知文档解析。
图2:Infinity-Parser 架构图(Layout-Aware RL 框架)
传统文档解析工具(如 Tesseract OCR)依赖规则或轻量网络,而 Infinity-Parser 通过 RL 的可验证奖励(Verifiable Rewards) 来训练:
Infinity-Parser2 更进一步,采用近 500 万样本的合成数据引擎(Infinity-Doc2-5M)训练,推出 Pro(精度优先)和 Flash(速度优先,3.68 倍加速)两个变体。评测结果显示,在 olmOCR-Bench(87.6%)和 ParseBench(74.3%)上超越了 DeepSeek-OCR-2、PaddleOCR-VL-1.5、MinerU-2.5 等前沿方案。
从代码层面看,INF-MLLM 家族的技术栈非常清晰:
| 层级 | 技术选型 |
|---|---|
| 深度学习框架 | PyTorch(via transformers) |
| 视觉编码器 | timm(EfficientNet 等 backbone) |
| 分词器 | sentencepiece(自定义词表) |
| 推理加速 | vLLM(Infinity-Parser,v<=0.11.0) |
| 多模态工具 | qwen_vl_utils(Qwen VL 格式处理) |
| 文档处理 | PyMuPDF、pdf2image、Pillow |
| Web 界面 | Gradio + gradio_image_annotation |
| 模型托管 | HuggingFace Hub、ModelScope |
Infinity-Parser2 使用 transformers==5.3.0(最新版本),引入了 gguf(GGUF 量化格式)、xgrammar(结构化输出)、partial_json_parser 等前沿依赖,支持 LLM Guidance 约束解码,确保输出的结构化文档解析结果格式一致。
在线体验(推荐先试):
所有子项目都在 HuggingFace Spaces 提供了免费 Gradio Web Demo,无需 GPU 即可体验:
本地部署的核心门槛是 GPU 显存:7B 模型至少需要 24GB VRAM(如 RTX 3090/A100)。Infinity-Parser 提供了 CLI 工具(parser 命令),通过 pip install 或 setup.py 可快速安装。Infinity-Parser2 的 inference 目录包含完整的推理脚本,支持 vLLM 加速推理。
图3:OmniDocBench 等基准评测中 Infinity-Parser vs 其他方案对比
1. GPU 资源门槛高:即使 Flash 变体,也需要 24GB+ 显存,无法在消费级显卡(如 RTX 4060 8GB)上运行。
2. 文档类型偏好:评测主要集中在学术论文、商业文档、图表等,对极端复杂的手写体、古籍、老旧扫描件的支持尚未系统验证。
3. 多页文档处理:虽然支持多页文档问答,但当前评测主要聚焦单页/少页场景;超长文档(如 500+ 页)的跨页推理能力仍是挑战。
4. 开源不完全:虽然代码和模型权重开源,但 RL 训练脚本、数据生成 pipeline(Infinity-Synth)属于核心创新点,是否完整开源有待跟进。
从增长数据看,INF-MLLM 的 star 曲线反映了文档智能赛道的持续升温:
文档智能是 RAG(检索增强生成)流水线中不可或缺的环节。相比传统的规则型 OCR,Infinity-Parser 的 RL 训练范式为「理解文档结构」这一任务提供了新范式——不只识别文字,还理解排版逻辑,这一思路对后续的 DocLLM、DocParse 等工作有重要参考价值。
图4:Infinity-Parser 在通用文档上的处理效果示意