ParseBench
文档解析领域的专业评测基准,量化评估28+解析工具在表格、图表、版式等维度上的表现
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
文档解析领域的专业评测基准,量化评估28+解析工具在表格、图表、版式等维度上的表现
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
在AI应用井喷的年代,文档解析是几乎所有智能系统的「第一道关卡」——PDF里的表格、图表、公式、嵌套层级,能不能被准确识别出来,直接决定了下游RAG系统的上限。然而,长期以来,这个领域缺乏一把公认的「尺子」:哪家解析引擎更强?强多少?不同维度的得分差异说明了什么?
ParseBench正是为了填补这个空白而生。它由LlamaIndex团队(run-llama)主导开发,是一个专注于评估文档解析工具能力的标准化基准测试,涵盖了PDF解析、表格提取、图表识别、版式分析等多个维度。目前已收录超过28种主流解析工具的评测数据,包括LlamaParse、GPT系列、Gemini系列、Claude系列等,并在arXiv发表了相关论文(arXiv:2604.08538)。
简单来说:ParseBench就像给文档解析工具准备的一套高考真题卷,所有工具在同一套题目上竞争,分数说了算。
LlamaIndex是当前最流行的LLM数据摄取框架之一,其核心能力之一就是将各种格式的文档(PDF、Word、HTML等)转化为结构化数据,供大模型使用。在实际业务中,团队发现不同解析工具在不同类型文档上的表现差异巨大——有的处理表格极强但公式识别弱,有的图表还原度高但文字位置错乱。
更关键的是,市场上已有的评测基准(如用于OCR评估的IIIT5K,用于文档理解的DocVQA等)并不能准确反映「真实业务场景」中复杂文档的综合解析能力。这些旧基准往往只关注单一维度(如纯文字识别准确率),而忽略了版式结构、表格单元格关系、图表语义等复合信息的重要性。
于是LlamaIndex团队决定自己动手,联合来自学术和工业界的多个团队,耗费大量人工标注成本,构建了ParseBench基准数据集。该数据集包含真实业务场景中的复杂文档,涵盖了财务报表、技术手册、学术论文、网页截图等高难度样本。
ParseBench的评测分为五个维度(Category):
| 维度 | 说明 |
|---|---|
| Overall(总分) | 综合加权得分 |
| Tables(表格) | 表格结构还原度、单元格内容准确性 |
| Charts(图表) | 图表数据提取、标注框位置 |
| Content Faithfulness(内容忠实度) | 解析结果是否忠实于原始文档 |
| Semantic Formatting(语义版式) | 版式结构、阅读顺序是否合理 |
评测采用纯规则判定(rule-based evaluation),而非LLM-as-a-judge,确保评分完全客观可复现。具体指标包括:
评测流程通过CLI工具 uv run parse-bench 驱动,支持:
# 一键评测某个解析工具
uv run parse-bench run llamaparse_agentic
# 生成排行榜
uv run parse-bench leaderboard
# 对比两个工具
uv run parse-bench compare tool_a tool_b
此外,项目还提供了一个本地标注工具(apps/annotator),基于Python + JavaScript构建,用于人工审核和标注基准数据集。这是一套完整的从数据构建→评测执行→报告生成的闭环系统。
从 leaderboard.csv 数据来看,当前解析工具的竞争格局如下:
第一梯队(Overall > 80):
第二梯队(Overall 70-80):
第三梯队(Overall 50-70):
成本维度:LlamaParse Cost Effective每页仅$0.375,而Anthropic Opus 4.8每页高达$18.69,差距达50倍。这说明解析质量和成本之间存在显著权衡空间。
ParseBench代码库采用分层模块化架构,核心位于 src/parse_bench/:
cli.py:Fire CLI入口,统一管理所有子命令pipeline/cli.py:端到端流程编排,协调inference→evaluation→analysis全流程data/:HuggingFace数据集下载与管理inference/:批量推理模块,包含Pipeline注册机制,每种解析工具对应一个Pipeline实现,支持并发执行evaluation/:评测引擎,包含product-specific evaluator和多种metric实现(TEDS、GriTS、IoU、自定义规则)analysis/:报告生成,支持HTML多维可视化报告、CSV明细、Markdown汇总,以及工具对比功能test_cases/:测试用例加载器,支持JSONL格式和.test.json边车格式schemas/:Pydantic数据模型,定义InferenceRequest、EvaluationResult等核心类型依赖管理使用uv(Rust编写的高性能Python包管理器),Python版本要求>=3.12,并发评测通过concurrent.futures实现。代码质量方面,项目配置了完整的pytest测试套件、ruff代码检查和mypy类型检查,文档质量极高。
评测已有工具(无需写代码):
# 安装依赖
uv sync --all-extras
# 配置API密钥(cp .env.example .env,编辑填入Key)
# 下载评测数据集
uv run parse-bench download
# 运行评测
uv run parse-bench run llamaparse_agentic
接入自己的解析工具:项目提供了Claude Code集成命令,通过自然语言指令自动生成Pipeline适配代码,降低了接入门槛。
局限:没有提供Docker一键部署环境,用户需要自行配置Python 3.12+环境,且不同解析工具需要各自的API Key,管理成本较高。
ParseBench的出现填补了文档解析领域缺乏权威评测基准的空白。它有三个核心价值:
ParseBench是一款由LlamaIndex团队打造的专业级文档解析评测基准,覆盖28+解析工具、5大评测维度,采用纯规则判定确保可复现性。代码架构清晰、CLI友好,但不支持容器化一键部署,需手动配置Python环境。它是目前AI文档解析领域最具参考价值的Benchmark之一,无论你是RAG应用开发者、文档智能研究者,还是在选型阶段的技术决策者,ParseBench都是值得收藏的工具。