Mind2Web-2
Mind2Web-2:AI 评测 开源项目
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Mind2Web-2:AI 评测 开源项目
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你在 2025 年让 AI 搜索代理查一份行业报告,它洋洋洒洒给了你三千字——可当你追根究底想核实每一个数据时,发现它凭空编造了三个来源网址、两个引用数字。这正是当前 AI 搜索代理面临的核心困境:能搜、会写,但无法保证回答的准确性和可追溯性。
Mind2Web-2 正是为解决这一问题而来。这是俄亥俄州立大学 NLP 团队发布的 AI 搜索代理评测基准,在 2025 年 NeurIPS D&B Track 发表,核心创新是提出 Agent-as-a-Judge 方法——用专门的 LLM 评判代理来验证 AI 生成答案的正确性和引用归属。
Mind2Web 系列最初关注的是 AI 在网页环境中执行复杂任务的能力(点击、输入、导航),而 Mind2Web-2 将战场转向了自主搜索与长文本综合回答——这也是 OpenAI Deep Research、Perplexity 等产品的核心能力。
传统评测的痛点在于:当 AI 的回答涉及大量实时网络信息时,如何自动判断"它说的是对的"?人工评测成本高、一致性差。Mind2Web-2 的解法是设计任务专属的 LLM 评判代理,使用树形评分标准(rubric tree)来层层拆解评估维度,每个节点由专门的提示词模板驱动,自动提取关键事实并与网页缓存进行交叉验证。
评判流程分为几个层次:
评判代理支持 OpenAI GPT 系列和 Azure OpenAI,并通过 patchright(Playwright 的隐蔽分支)自动化缓存答案中引用的网页,解决网络内容时效性和稳定性问题。
评测中有个非常实用的工具——Cache Manager Web UI。它能批量检测哪些引用的网页缓存失败了(可能因为验证码、反爬、登录墙),然后一键通过 Chrome 扩展重新抓取。这个设计解决了评测复现性中最头疼的问题:被测 AI 引用的网页随时可能消失或改版。
评估脚本支持丰富的并发参数:
--max_concurrent_tasks:最多同时评测多少个任务--max_concurrent_answers:单个任务下最多并发评估多少个答案--max_webpage_retrieval:并发抓取网页--max_llm_requests:并发 LLM API 请求对于需要 Google Maps API 的任务(如查询地点信息),也预留了扩展接口。
项目采用模块化设计,核心在 mind2web2/ Python 包中:
| 模块 | 职责 |
|---|---|
evaluator.py | 顶层评估器,协调提取+验证全流程 |
eval_toolkit.py | Extractor 和 Verifier 类,LLM 驱动的提取与验证 |
verification_tree.py | 树形评分结构,支持自定义聚合策略 |
eval_runner.py | 异步任务编排器,处理并发执行 |
llm_client/ | LLM 提供商抽象层,支持 OpenAI/Azure |
api_tools/ | 外部 API 集成(arXiv、Google Maps、PDF) |
utils/ | 缓存、日志、浏览器、路径等共享工具 |
依赖栈非常实用:FastAPI(用于 Cache Manager Web UI)、Playwright/patchright(浏览器自动化)、BeautifulSoup4/PyMuPDF(内容解析)、Jinja2/Markdownify(Markdown 处理)。
这是一款命令行优先的工具,没有 Web UI 界面。部署步骤:
uv sync 或 pip install -e . 安装 Python 包patchright install 安装 Chromium 浏览器OPENAI_API_KEY(核心依赖)python run_eval.py --agent_name <your_agent>难点在于目录结构和回答格式需要严格遵守规范,初次使用需要参照 answers/example 目录理解格式。另外 Google Maps API Key 对部分任务是必需的。
Mind2Web-2 的出现填补了一个重要空白:此前没有专门针对"AI 搜索 + 综合回答 + 引用验证"这一完整流程的公开评测基准。该项目为 Agentic Search 系统提供了可量化的质量标尺,对推动 AI 搜索产品的实用化具有重要意义。Open Deep Research 等产品已在官方文档中推荐使用 Mind2Web-2 作为评测工具。
如果你正在开发 AI 搜索代理,Mind2Web-2 是目前最值得参考的评测框架之一——不仅能测出分数,还能通过评判日志理解 AI 的推理链路和常见错误模式。
本报告基于 GitHub 仓库 v0.1.0 分析,数据来源:OSU-NLP-Group/Mind2Web-2,NeurIPS'25 D&B。