gameworld
首个多模态AI游戏Agent标准化评测基准,覆盖34款浏览器游戏170个任务,基于游戏状态序列化实现可复现评估
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个多模态AI游戏Agent标准化评测基准,覆盖34款浏览器游戏170个任务,基于游戏状态序列化实现可复现评估
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你带着一位从未玩过游戏的朋友走进街机厅,给他30分钟时间,让他学会操作《Flappy Bird》并通过第一根水管。大多数人觉得这不可能——但这恰恰是当前多模态大语言模型(MLLM)正面临的挑战。
2026年4月,新加坡国立大学(NUS)团队在ECCV 2026发表了一篇引起不小反响的论文,推出了一个名为 GameWorld 的标准化评测基准。顾名思义,这是一个专门用来"考验"AI Agent在游戏环境中表现的系统化平台。34款浏览器游戏、170个任务关卡、两套不同的AI操控接口——这不是一个玩具项目,而是一个严肃的学术评测框架,填补了多模态AI Agent在游戏领域缺乏统一、可复现评测标准的空白。
在GameWorld之前,AI Agent的评测存在几个根深蒂固的问题。
第一个问题是实时性与推理速度的耦合。很多游戏对操作时机要求极高,AI模型的推理延迟(可能长达数秒)会直接影响游戏表现。你无法判断AI是"决策错误"还是纯粹"反应太慢"。GameWorld的解决方案很巧妙:它将游戏运行在浏览器沙箱中,与AI推理完全解耦——AI想多久想就多久,想好了再给游戏发指令,从根本上切断了延迟对评分的干扰。
第二个问题是评测标准的主观性。传统做法要么靠人工打分(昂贵且不可复现),要么靠视觉相似度(不够精确),要么用LLM做裁判(引入新的偏见)。GameWorld采用基于游戏状态的outcome-based评估:直接从游戏API序列化数据中提取分数、坐标、生命值、金币数等客观指标,计算确定性的Progress和Success Rate,完全消除人为评分带来的噪声。
第三个问题是评测环境的碎片化。不同团队用不同的游戏、不同的接口、不同的指标来"证明"自己的模型有多强——无法横向比较。GameWorld提供了统一的运行时runtime(runtime/模块)、统一的评测接口(benchmark/模块)和统一的评测套件(benchmark/suites/),确保不同模型在同一条件下较量。

图1:GameWorld支持的Simulation类游戏示例——Monkey Mart,Agent需要在开放环境中协调多种资源管理任务
GameWorld最独特的设计之一是同时评测两套Agent接口,这让研究者能够独立分析"模型本身的能力"和"操控方式的影响"。
Computer-Use Agents(计算机操控型) 模拟人类直接操作鼠标和键盘:AI直接输出 {"action": "press_key", "key": "ArrowUp"} 这样的低级指令。这种方式的优势是覆盖了所有游戏(因为所有游戏都支持键盘鼠标),缺点是AI需要自己完成"意图→精确按键"的映射,增加了控制粒度的负担。
Generalist Multimodal Agents(通用多模态型) 则通过语义动作解析(Semantic Action Parsing)来操控:AI输出 {"tool_name": "move_left", "description": "向左移动"} 这样的高级语义指令,系统再将这些语义指令转换为具体的游戏操作。例如在Flappy Bird中,move_up 语义动作绑定到空格键,在赛车游戏中可能绑定到方向键。这种方式让AI专注于"决策"而非"按键",更接近人类玩家的思维模式。
在相同模型后端(GPT-5.2)上对比两套接口时,研究者发现:语义接口在需要复杂策略的任务上表现更好,而直接操控接口在对时机要求极高的任务(如Flappy Bird)上反应更快。这说明接口设计本身就是一个值得研究的问题,而不仅仅是"换个更好的模型"就能解决。

图2:Temple Run 2这类高速跑酷游戏对AI的时机把控提出了极高要求
GameWorld收录了34款浏览器游戏,覆盖5大类型,每类游戏考验Agent不同的核心能力:
| 类型 | 代表游戏 | 考验的核心能力 |
|---|---|---|
| Runner(跑酷类) | Chrome Dino, Flappy Bird, Temple Run 2 | 高频反应控制、精确时机 |
| Arcade(街机类) | Breakout, Pac-Man, Core Ball | 多实体追踪、快速闭环交互 |
| Platformer(平台跳跃类) | Mario, Doodle Jump, Vex 3 | 时空导航、物理引擎理解 |
| Puzzle(解谜类) | 2048, Minesweeper, Wordle | 离散状态空间探索、长期策略 |
| Simulation(模拟经营类) | Monkey Mart, Wolfenstein 3D | 开放世界协调、资源管理 |
这些游戏覆盖了从"毫秒级反应"到"多步规划"的全谱系挑战,评测结果自然也比单一游戏更有说服力。
GameWorld的评测结果给火热的"AI Agent"热潮泼了一盆冷水:
Generalist Agents排名:Gemini-3-Flash-Preview以41.9%的Progress和21.2%的Success Rate位居榜首,GPT-5.2(40.6%/20.6%)和Claude-Sonnet-4.6(39.3%/20.6%)紧随其后。
Computer-Use Agents排名:Seed-1.8以39.8%/20.0%领先,Claude-Sonnet-4.6-CUA(38.3%/19.4%)和Gemini-2.5-Computer-Use(36.1%/16.5%)分列二三名。
而作为对照组,人类新手玩家的平均Progress达到64.1%,人类专家玩家达到82.6%。
也就是说,即使是当前最强的AI Agent,与人类新手的差距仍然超过20个百分点。这不是模型不够强的问题——更深刻地暴露了当前多模态Agent在以下方面的根本短板:

图3:解谜类游戏考验Agent的离散状态空间搜索和逻辑推理能力
从代码结构看,GameWorld是一个高度模块化的Python项目,设计思路清晰地为学术复现服务:
核心目录:runtime/ 模块负责Agent、环境与评测的主协调循环(coordinator.py),包含异步事件驱动的评测主循环。env/ 模块管理游戏生命周期:浏览器通过 Playwright(headless Chrome)加载HTML5游戏,browser_manager.py 处理浏览器沙箱,game_state_tracker.py 通过 CDP 协议注入JavaScript脚本读写游戏API状态,实现状态序列化。
Agent层:agents/mm_agents/ 实现了20+个模型的适配器,从Claude Sonnet 4.6到Qwen 3 VL,从通用语义接口(_vl后缀)到计算机操控接口(_cua后缀)。每个模型文件约100-200行,通过 agents/factory.py 动态加载。agents/harness/ 包含通用基础设施:语义动作解析(semantic_controls.py)、提示词渲染(prompting.py)、函数调用工具Schema(function_calling_utils.py)和多模态记忆管理(memory.py)。
评测层:benchmark/ 包含评测套件和脚本,benchmark/suites/ 下按游戏和按模型两条维度组织评测任务,通过YAML配置文件描述任务参数。catalog/ 是整个系统的"数据库":游戏规则YAML定义每个游戏的行为规范、允许的操控按键和语义动作映射;任务YAML定义评测目标、评估器和步数预算;模型YAML定义每个模型的身份、提示词模板和输出格式。
依赖栈:Python 3.12+、Anthropic/OpenAI/Google GenAI三大API(通过 openai/anthropic/google-genai SDK接入)、Playwright(浏览器沙箱核心)、Jinja2(提示词模板)、Pillow(截图处理)和ZMQ(进程间通信)。
GameWorld不是一个开箱即用的产品级项目,而是面向研究人员的评测工具。它的部署过程确实需要一定技术背景:
环境准备:需要Python 3.12以上环境,安装 pyproject.toml 中的依赖后,还必须运行 playwright install chromium 来下载浏览器(约300MB)。此外,至少需要配置一个AI API Key(Anthropic、OpenAI或Google的key都可以),因为评测需要调用大模型API来驱动Agent。
运行方式:通过命令行指定游戏、任务和模型组合:python main.py --config game_id+task_id+model_id。如果想批量跑所有评测套件,使用 run_suite.py 脚本;如果只是想快速测试一个任务,用 play.py。没有Web界面,所有交互通过命令行。
局限性:最大的问题是重度依赖外部AI API——项目本身不包含任何模型权重,运行成本完全取决于你的API调用量。其次,没有提供Docker支持意味着在不同环境间迁移有一定门槛(Python 3.12的依赖管理本身就比老版本更严格)。
GameWorld的核心价值不在于证明哪个模型更强,而在于为整个领域提供了一个可信赖的测量工具。它解决了三个根本问题:
随着多模态Agent逐渐从Demo走向实用,GameWorld这类基准测试的重要性只会增加——你无法优化一个无法测量的东西。如果未来某天AI能在GameWorld上达到人类新手水平,那才是真正的多模态Agent元年。