PixelRAG
让AI直接看网页截图而非解析HTML,通过视觉检索保留表格图表等结构化信息,SimpleQA准确率提升18%
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让AI直接看网页截图而非解析HTML,通过视觉检索保留表格图表等结构化信息,SimpleQA准确率提升18%
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有遇到过这种情况:问 AI 助手一个网页上的数据,它却给你一个似是而非的答案?问题不在 AI 不够聪明,而在于传统的网页信息提取方式,把最有价值的东西弄丢了——表格被拆散、图表变文字、数字失去上下文。伯克利 SkyLab 团队推出的开源项目 PixelRAG 正是来解决这个问题的。

图1:PixelRAG 项目 Banner — Visual Retrieval-Augmented Generation
PixelRAG 来自 UC Berkeley 顶级 AI 实验室(SkyLab · BAIR · Berkeley NLP),由 Yichuan Wang、Zhifei Li 等研究者开发,论文发表于 arXiv(ID: 2606.28344),指导导师包括大名鼎鼎的 Matei Zaharia(Apache Spark 联合创始人)和 Joseph E. Gonzalez 教授。项目在 GitHub 上发布不到两个月即获 6,700+ Stars,成为 2026 年最受关注的开源 AI 项目之一。
当前主流的 RAG(检索增强生成)系统,工作流程通常是:抓取网页 HTML → 解析提取正文文本 → 分块向量化 → 存入向量数据库 → 检索最相关的文本块 → 喂给 LLM。这套流程在纯文本场景下表现不错,但一旦网页包含数据表格、可视化图表、信息图或复杂排版,就暴露了根本性缺陷。
试想:一个网页里有一张"2024 年全球 GDP 排名"表格,用传统方法提取后,表格结构消失,变成一串没有上下文的数据。问 AI"哪个国家 GDP 最高",它只能靠记忆中的知识猜答案——而不是从网页那张表格里直接读数。
PixelRAG 的核心洞察就在这里:与其把网页解析成文字,不如让 AI 直接"看"网页截图。就像人浏览网页时,眼睛捕捉到的是像素,而不是 DOM 树。
根据 PixelRAG 论文,在 SimpleQA 基准测试中,PixelRAG 相比纯文本 RAG 准确率提升高达 18%。这个提升来自于保留视觉结构的能力——表格、图表、并列信息的相对位置,原本在 HTML 解析中丢失,恰恰是人类快速理解信息的关键。
PixelRAG 的技术管线分为四个阶段,每个阶段都有独立的命令行工具:
pixelshot 命令使用 Playwright + Chrome DevTools Protocol (CDP) 或 CEF (Chromium Embedded Framework) 对任意网页或 PDF 进行截图。它会将长页面切分成瓦片(tiles),每个瓦片大约 1024×1024 像素,保证视觉信息完整保留。
这与传统的"网页截图"不同:普通截屏对长页面只能得到一张巨大图片,检索时整张图作为一个向量,无法细粒度匹配。PixelRAG 的瓦片策略使得检索精度达到区块级别——问"第三段"能定位到第三段的瓦片,而不是整页图。
提取出来的截图瓦片,通过 Qwen3-VL-Embedding-2B 模型进行向量化。这是一款阿里通义千问团队开源的多模态视觉语言模型,专门针对截图/视觉文档做了 LoRA 微调。模型将图像映射到一个高维向量空间,其中视觉语义相近的截图瓦片在向量空间中彼此接近。
所有瓦片的向量存储到 FAISS(Facebook AI Similarity Search) 索引中,支持 CPU 或 GPU 加速检索。FAISS 是 Facebook 开源的 billion-scale 向量相似度搜索库,能够在毫秒级从数十亿向量中找到最相似的 Top-K 结果。
pixelrag serve 启动一个 FastAPI 服务,接收文本查询(甚至可以是图片!),返回最相关的截图瓦片。结果可以直接喂给任何支持视觉输入的 LLM(Claude、GPT-4V、Qwen-VL 等)做最终回答。

图2:Text-RAG 解析 HTML 后丢失表格结构;PixelRAG 保留截图瓦片,VLM 直接读数
PixelRAG 团队已经在 HuggingFace 上托管了一个覆盖 828 万篇 Wikipedia 文章的预建 FAISS 索引,总大小约 217GB。用户无需任何配置,直接调用 https://api.pixelrag.ai/search 即可搜索全量 Wikipedia 内容,且支持图片作为查询(visual search)——上传一张截图,AI 帮你找到内容最相关的 Wikipedia 页面。
PixelRAG 还发布了一个 Claude Code 插件 pixelbrowse,让 Claude 在浏览网页时直接"看"页面而非读取 HTML:
uv tool install pixelrag
claude plugin marketplace add StarTrail-org/PixelRAG
claude plugin install pixelbrowse@pixelrag-plugins
# 然后直接问 Claude:
claude -p "screenshot https://arxiv.org/abs/2404.12387 and summarize"
这意味着 AI 编程助手第一次真正具备了人类的视觉浏览能力——可以读图表、解析数据可视化、理解复杂排版,不再被网页结构的复杂性所困扰。
项目支持在本地构建专属索引。工作在 Linux (CUDA) 或 macOS (Apple Silicon/MPS) 上均可运行,device: auto 自动选择最优硬件后端。配置文件仅需几行 YAML:
source:
type: local
path: ./my_docs
embed:
model: Qwen/Qwen3-VL-Embedding-2B
device: auto
output: ./my_index
PixelRAG 的架构采用严格的模块化设计,每个阶段独立安装、独立使用,通过统一的 CLI 入口协调:
| 模块 | 命令 | 功能 | 依赖 |
|---|---|---|---|
| render | pixelshot | 网页/PDF → 截图瓦片 | Playwright/CEF, Pillow |
| embed | pixelrag embed | 截图 → 向量 | PyTorch, transformers |
| index | pixelrag build-index | 向量 → FAISS 索引 | FAISS, numpy |
| serve | pixelrag serve | 向量检索 API | FastAPI, FAISS |
| train | (独立 uv 项目) | LoRA 微调 embedding 模型 | PyTorch, CUDA |
核心 Python 包 pixelrag 通过 uv 管理,采用 Hatch 构建系统,支持 pip 安装(pip install pixelrag),可选依赖按需安装(如 [embed]、[serve]、[all])。
生产部署拓扑:
pixelrag serve 通过 blue-green 策略在 nginx 反向代理后运行,确保零停机更新agent-server.mjs(Node.js)调用搜索 API,提供对话式搜索体验8.28M Wikipedia 索引约 217GB,这个体量对大多数个人开发者和小团队来说是难以承受的。团队目前提供基于 API 的在线搜索作为解决方案,但这意味着数据必须上传到第三方。
pixelshot 的截图质量高度依赖 Chrome/Chromium 环境的一致性。在不同操作系统、不同屏幕 DPI、不同字体渲染环境下,同一页面可能产生视觉上存在差异的截图,影响向量检索的稳定性。
模型在英语内容上效果出色,但 Wikipedia 非英语页面和以图像为核心但语言非英语的网页,效果仍有待验证。截图检索对文字密集型内容(如中文网页)的适用性,需要更多benchmark验证。
PixelRAG 出现在 AI 应用从"纯文本理解"向"多模态理解"跃迁的关键时间节点。它代表了一个趋势:视觉优先的信息检索正在成为继向量搜索之后的新方向。
几个值得关注的方向:
1. AI Agent 的视觉浏览能力
Claude Code 的 pixelbrowse 插件只是一个开始。未来 AI Agent 在执行任务时,对网页的处理将越来越多地采用视觉方式,而非 HTML 解析。这将显著提升 AI 在金融、医疗、法律等依赖数据表格和图表的场景中的实用性。
2. 视觉 RAG 基准测试的建立 目前 SimpleQA 是主要评估基准,但视觉 RAG 的全面评估套件尚在发展中。PixelRAG 论文为这个方向开了个头,预计会涌现更多专门评估视觉信息保留能力的 benchmark。
3. 与现有 RAG 系统的融合 PixelRAG 并不打算完全替代文本 RAG,而是提供了视觉补充。未来更可能的形态是:混合 RAG 管线,同时维护文本索引和视觉索引,根据查询类型动态选择检索路径。
项目基本信息
本报告基于 GitHub 仓库 v0.4.0(2026-07-16 更新)分析生成。