Thinking-with-Map
让AI通过地图工具进行地理定位推理,ACL 2026接收的地图增强智能体框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让AI通过地图工具进行地理定位推理,ACL 2026接收的地图增强智能体框架
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
痛点场景:给你一张在野外拍摄的照片,没有 GPS、没有文字标识、只有一张图——你能否仅凭视觉信息推断出这是在地球上的哪个角落?这是一个困扰计算机视觉界数十年的难题:图像地理定位(Image Geolocalization)。传统方法要么依赖精确的地面特征匹配,准确率低;要么依赖卫星遥感,成本极高。如今,阿里巴巴地图实验室(AMAP-ML)联合厦门大学、南科大等机构,在 ACL 2026 Findings 发表了一篇令人眼前一亮的论文:Thinking with Map,用地图增强的智能体彻底改变了这一游戏规则。
图像地理定位(Geolocalization)是计算机视觉中的经典难题。简单来说,就是"给你一张照片,找出它在地球上的拍摄位置"。这个任务比听起来要难得多——同一座山、同一条街、同一个建筑,从不同角度、不同季节、不同天气拍摄,视觉差异极大。
近年来,大型视觉-语言模型(LVLM)如 GPT-4V、Gemini 展现了对图像的深刻理解能力,但它们在地理定位任务上的表现仍然差强人意。原因在于:地理位置推理需要多层次的地理知识——你看到棕榈树和沙滩,可能在热带沿海;看到雪山和针叶林,可能在高纬度地区。但仅靠图像本身,模型难以建立这种跨维度的地理关联。
Thinking with Map 的核心洞察:与其让模型"硬猜",不如给它一个地图工具,让它像人类一样,主动查询地图信息来辅助推理。地图是地理信息最权威的结构化数据源——POI(兴趣点)、道路网络、地形地物应有尽有。如果模型能自主调用地图 API,地理定位的准确率将大幅提升。

图1:Thinking with Map 完整流程示意 — 模型接收一张野外图像,通过地图工具(POI搜索、静态地图瓦片、POI详情)进行多轮推理,最终推断出拍摄地点。
Thinking with Map 的核心创新是将地理定位建模为一个智能体-地图交互循环(Agent-in-the-Map Loop),并引入强化学习(RL)和并行思维搜索(Parallel Tree-of-Thoughts)来训练和优化这一系统。
第一阶段:赋予模型"使用地图"的能力。研究团队没有让模型凭空推理,而是为 Qwen3-VL-30B 添加了四类地图工具调用能力:
第二阶段:用强化学习训练"地图思维"。研究团队基于 VeRL 框架实现了一个端到端的 RL 训练流程。模型的每个工具调用动作都会产生 reward 信号:正确推断出地理位置得高分,错误则扣分。通过 GRPO/PPO 等策略优化算法,模型逐渐学会何时调用哪种地图工具、如何整合多轮地图信息做出判断。
第三阶段:并行思维搜索(Parallel TTS)。这是本工作最独特的设计。在推理阶段,模型并非只生成一条推理路径,而是同时探索多条候选路径(类似树的广度优先搜索),收集多个候选结果后再做最终决策。这种"先探索再定论"的策略对于地理定位尤为重要——不同路径可能指向不同的大洲或城市,最终投票机制能有效纠正单个错误推理。

图2:在 MAPBench 基准上与闭源/开源模型的性能对比。Thinking with Map 的 Acc@500m 达到 22.1%,是 Gemini-3-Pro 的 2.8 倍,展现出地图工具调用对地理定位任务的巨大提升潜力。
为了训练和评估这一系统,研究团队构建了 MAPBench-V2 数据集,包含:
数据集已在 HuggingFace(GD-ML/MAPBench-V2)和 ModelScope 开源。
项目代码基于 VeRL(火山引擎开源的 RL 训练框架)构建,主要目录结构如下:
Thinking-with-Map/
├── verl/ # VeRL 框架核心
│ ├── examples/data_preprocess/ # 数据预处理脚本
│ │ └── preprocess_thinking_with_map.py
│ ├── tool_server/ # 地图工具服务器(AMAP API 封装)
│ │ ├── amap_satellite_map_sync.py
│ │ ├── amap_static_map_sync.py
│ │ └── api_server_redis.py # 工具调用 API + Redis 缓存
│ └── geoagent_scripts/ # 训练/评估脚本
│ ├── train_thinking_with_map.sh
│ └── test_thinking_with_map.sh
├── api_evaluation/ # API 模式评测
├── demo/ # Jupyter Notebook 交互式演示
└── resources/ # 图片资源
主力技术栈:
推理演示(相对简单):下载已训练好的 Thinking-with-Map-30B-A3B 模型权重,通过 vLLM 启动推理服务(至少需要 2×80GB GPU),然后运行 demo/cookbook_thinking_with_map.ipynb Jupyter Notebook 进行交互式体验。
分布式训练(门槛极高):需要 8 节点×8 GPU 的集群环境,每个节点运行 verl/tool_server/run_api_server.sh 启动地图工具服务,随后在每个节点运行 verl/geoagent_scripts/train_thinking_with_map.sh。训练流程依赖 Redis 做跨节点缓存、依赖高德地图 API 提供真实地图数据。
评估流程:使用 verl/geoagent_scripts/test_thinking_with_map.sh 脚本在 MAPBench 测试集上评估模型性能。
Thinking with Map 是 2026 年 AI + 地理信息领域的重要突破,被 ACL 2026 接收并非偶然。其背后反映的是 AI 发展的大趋势:工具增强的推理(Tool-Augmented Reasoning)正在成为大模型能力扩展的主流范式。
从更大的视角看,这项工作代表了三个重要方向的交汇:
HuggingFace 官方在 2026 年 1 月 12 日将这篇论文选为 Daily Paper #1,X/Twitter 上也引发了广泛讨论。阿里 AMAP-ML 团队展示了工业界在大模型落地应用上的持续创新力。
适合人群:NLP/CV 研究者(ACL/ICML 投稿参考)、地理信息从业者、多模态 AI 爱好者、强化学习方向研究生