docstrange
智能文档解析工具,PDF/图片/Word/Excel/PPT 一键转 Markdown/JSON/C
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
智能文档解析工具,PDF/图片/Word/Excel/PPT 一键转 Markdown/JSON/C
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

图1:DocStrange 项目横幅
深夜赶报告时,客户发来一份扫描版 PDF 发票,传统 OCR 识别满是乱码,表格结构全丢。又或者,你在搭建 RAG 知识库时,产品经理甩来一个嵌套三张表格、两段图片注释的 Word 文档——Embedding 模型读到的全是碎片化的垃圾文字。
DocStrange 正是为解决这类「文档到数据」的最后一公里问题而生的。它能把 PDF、图片、Word、Excel、PPT、网页、URL 一键转成干净的 Markdown、JSON、CSV 或 HTML,全程支持结构化字段提取和高级 OCR——恰好是 LLM 应用(RAG、知识库)最需要但最难搞定的环节。
DocStrange 由 Nanonets 公司开发。Nanonets 是一家专注于 AI 文档智能化的企业,在金融票据自动化领域深耕多年。2025 年 8 月,DocStrange 核心模型升级至 7B 参数级别,大幅提升复杂文档理解精度,并引入本地 Web UI,做到开箱即用。MIT 许可证,商用免费,Python 3.8-3.13 全兼容。
支持格式:PDF、DOCX、DOC、TXT、XLSX、XLS、CSV、PPTX、PPT、JPG、PNG、BMP、TIFF、WebP、GIF(含扫描件)、HTML、HTM、URL。
三种处理模式:
智能表格提取:内置表格检测模型,识别嵌套表格、跨列跨行单元格,输出 Markdown 表格或 CSV,LLM 读取结构完整。
结构化数据提取:传入 JSON Schema 或字段列表(如 ["发票号", "金额", "日期"]),返回结构化 JSON。批量处理合同、证件必备。
pip install docstrange[web]
docstrange-web
本地启动 Flask 服务,浏览器拖拽上传,支持 Markdown / JSON / CSV / HTML 四种输出,最大 100MB。首次启动自动检测 GPU:CUDA 可用则下载 GPU 模型;无 GPU 则切换云端模式。

图2:DocStrange Web UI 操作演示
模块化流水线设计:
| 目录/文件 | 职责 |
|---|---|
| extractor.py | 核心入口,DocumentExtractor 主类 |
| cli.py / web_app.py | 命令行 + Flask Web UI |
| pipeline/layout_detector.py | 文档布局检测 |
| pipeline/ocr_service.py | EasyOCR 引擎 |
| pipeline/neural_document_processor.py | 7B 神经网络文档处理 |
| pipeline/nanonets_processor.py | Nanonets 云端处理 |
| processors/*.py | 各格式独立处理器(PDF、图片、Word、Excel、PPT、URL 等) |
流程:文件输入 - 格式检测 - 路由 Processor - PDF/图片先经 OCR + 布局分析 - 送入 7B 神经网络文档模型 - 输出 Markdown/JSON/CSV/HTML。
| 层级 | 技术选型 |
|---|---|
| OCR 引擎 | EasyOCR(80+ 语言,对扫描件和手机拍摄鲁棒) |
| 文档理解 | Docling-IBM-Models + Transformers 7B |
| 布局检测 | Docling-IBM-Models 专用模型 |
| Web 框架 | Flask(轻量 Python 原生) |
| 格式解析 | python-docx、openpyxl、python-pptx、pypandoc、Pillow、pandas |
| 模型管理 | HuggingFace Hub + 本地缓存 |
提供 MCP Server 模块(mcp_server_module/),可注册到 Claude Desktop,直接用自然语言让 Claude 读取、分析、提取 PDF/Word 文档内容,AI 辅助开发场景实用。
1. 无官方容器化:无 Dockerfile 或 docker-compose,企业 Docker 部署需自行编写。
2. 云端隐私风险:默认云端模式向 Nanonets 服务器传输文件,强合规行业建议 GPU 模式。
3. 首次启动慢:GPU 模式首次下载约 2GB 模型,网络不佳环境耗时。
4. 显存门槛:7B 模型本地运行需 6-8GB 以上显存,CPU 用户只能云端模式。
高质量文档解析是 RAG 流水线最易出瓶颈的环节。DocStrange 瞄准这一痛点,提供开箱即用的端到端文档处理管道。差异化优势:开源免费(vs AWS)、本地私有化(vs Google)、一条命令安装(vs LangChain 多组件拼接)。未来补上 Docker 支持后,有望成为文档处理领域标杆开源项目。
图3:DocStrange 官方 Logo