marker
将 PDF/EPUB 等文档精准转换为 Markdown + JSON,保留公式、表格、图像结构
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
将 PDF/EPUB 等文档精准转换为 Markdown + JSON,保留公式、表格、图像结构
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:Marker 项目在 GitHub 上的仓库封面
想象一下这个场景:你正在撰写一篇学术论文,需要引用一篇 2019 年发表的 PDF 文献,文献里有复杂的数学公式、表格和图表。你想把 PDF 中的内容提取出来放到 Markdown 里——但当你 Ctrl+C 复制时,公式变成了乱码,表格支离破碎,图片全部丢失。
又或者你是 AI 工程师,想把一批 PDF 文档喂给大语言模型做 RAG(检索增强生成)——但 PDF 的结构化信息在纯文本提取后几乎全部丢失,表格变成了难以解析的空格序列。
这些场景的共同痛点是:传统 PDF 提取工具只提取文字,无法保留文档的结构、公式、表格和图像信息。 而 Marker 的出现,正是为了解决这个问题。
图2:Datalab 团队 Logo
Marker 由独立开发者 Vik Paruchuri 主导开发,项目托管于 GitHub,当前已斩获超过 35,000 颗星,成为文档智能处理领域最受关注的开源项目之一。Vik 同时运营 Datalab 平台,提供商业化的托管服务,Marker 正是其核心开源产品。
Datalab 团队拥有深厚的计算机视觉和 OCR 背景,Marker 的技术根基来自其另一开源项目 Surya(一个文档 OCR 和布局分析工具链)。与传统的 Tesseract OCR 不同,Surya 专注于多语言文档理解,支持 90+ 语言的文本识别,并内置布局分析和表格识别能力。Marker 正是站在 Surya 的肩膀上,结合大语言模型,实现了更高质量的文档结构化输出。
如果用生活化的比喻,Marker 可以被理解为:给大语言模型准备的「PDF 到结构化文本」专用翻译官。
普通的 PDF 复制就像用谷歌翻译把一张图片翻译成文字——字是有了,但结构全丢了。Marker 则像是一个专业的图书管理员,不仅把书里的字读出来,还帮你把目录、章节、图表、公式全部按原样整理好,方便你后续使用。
Marker 采用多阶段级联流水线架构,每个阶段由专门的深度学习模型负责:
Marker 的核心输出是 Markdown + JSON 双格式:
根据项目 benchmarks,Marker 在标准测试集上的表现优于同类工具:
图3:Marker 与其他 PDF 转换工具的准确率对比
图4:表格识别准确率对比
图5:单文档处理耗时对比
硬件需求方面:Marker 在 GPU 上运行时峰值显存约 3.5-5GB,平均 3.5GB,支持 CPU/MPS(Apple Silicon)备选,但速度会显著下降。
Marker 支持 PDF、 EPUB 等常见文档格式。基础 pip install marker-pdf 仅支持 PDF,通过 marker-pdf[full] 可扩展支持更多格式,包括混合排版文档、扫描件(含 OCR)等。
Marker 提供三种使用方式,适合不同技术水平的用户:
最简单的方式是 pip 安装后直接使用命令行:
pip install marker-pdf
marker_single /path/to/document.pdf /output/
支持批量处理、多 GPU 并行处理(NUM_DEVICES=4 NUM_WORKERS=15 marker_chunk_convert)
Marker 提供了开箱即用的 Streamlit 应用,启动了图形化界面:
pip install marker-pdf[full]
python marker_app.py
界面支持文件上传、参数调整、实时预览转换结果。
通过 marker_server.py 可以启动 REST API 服务,方便集成到文档处理流水线:
python marker_server.py --port 8000
作者还提供了 Modal 云端一键部署示例(examples/marker_modal_deployment.py),可在云端 GPU 上运行,无需本地配置。
Marker 也有其局限性,用户在选型时需要注意:
Marker 的出现代表了文档智能处理领域的一个重要趋势:将传统的 OCR 流水线与多模态大语言模型结合,实现远超传统工具的结构化理解能力。
随着 RAG(检索增强生成)技术在企业知识管理、AI 应用开发中的广泛普及,高质量的文档解析工具变得前所未有的重要。Marker 填补了「PDF → LLM 可用格式」这一关键环节的空白,降低了 AI 应用开发的数据预处理门槛。
同时,Datalab 团队的商业化路径(开源核心 + 托管服务)也为 AI 领域的开源项目提供了一种可持续的商业模式参考。