agent-sphere
Java 版 AI Agent 编排平台,支持浏览器自动化、MCP 协议与多模型路由
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Java 版 AI Agent 编排平台,支持浏览器自动化、MCP 协议与多模型路由
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你一定见过这样的场景:花了几百块买了套 AI 编程工具,结果它只能帮你写代码,却无法帮你打开浏览器、点击按钮、填表——每次遇到需要「动手操作」的任务,AI 就变成了一个只会「纸上谈兵」的聊天机器人。
AgentSphere 解决的就是这个问题。这是一个用 Java 构建的 AI Agent 编排平台,核心思路是:让 AI 不仅能「思考」,还能真正「执行」。它通过 LLM 驱动的决策引擎,结合内置工具、MCP 协议、CLI 命令执行和浏览器自动化等多种能力,实现了 AI Agent 从「感知 → 规划 → 执行 → 反馈」的完整闭环。
图1:AgentSphere 整体架构 — 三层结构覆盖从 UI 到 Agent 执行引擎
当前主流的 AI Agent 实现大多停留在「对话生成」层面:LLM 输出文字,用户自己动手执行。但真正的 AI Agent 应该像一个得力助手——你说「帮我注册一个 GitHub 账号」,它就应该自己去打开浏览器、填表单、点按钮,完成整个流程。
AgentSphere 的作者显然对这个问题有深刻理解。项目采用 Java 21 + Spring Boot 作为后端框架(而非更常见的 Python),这是一个有意味的选择——Java 在企业级应用的稳定性、并发处理和生态成熟度上有明显优势,更适合长时间运行的 Agent 任务。项目支持多模型路由,涵盖 OpenAI、DeepSeek、智谱 GLM 和 LiteLLM 等多个提供商,降低了对单一模型的依赖风险。
AgentSphere 的核心执行引擎是 SessionRunner,它遵循经典的 ReAct(Reasoning + Acting)模式。这个模式的核心思想是:AI 每做一步决策,都会产生「观察」结果,这个观察反过来影响下一步决策,形成一个不断迭代的闭环。
打个比方:你想让 AI 帮你订明天下午的会议室。第一步,AI 调用工具去查日历(Act);第二步,日历返回空闲时段(Observe);第三步,AI 看到空闲时段后,决定推荐14:00-16:00(Reasoning);第四步,AI 调用邮件工具发送邀请(Act)——如此循环,直到任务完成。
图2:ReAct 模式执行循环 — 推理与行动交替进行,形成自我纠正能力
长期运行 AI Agent 最头疼的问题之一,就是上下文窗口有限——聊着聊着,AI 就忘了之前说过什么。AgentSphere 用一个精心设计的六层记忆系统来解决这个问题:
这套设计的精妙之处在于:热数据放内存,冷数据放数据库,同时通过压缩机制动态管理上下文长度,既保证 AI「记得住」,又不会爆 token。
图3:六层记忆架构 — 从内存到数据库,层级分明,热冷分离
AgentSphere 最具特色的能力之一,是通过 Chrome 扩展 实现浏览器自动化。这个设计非常巧妙:不需要额外的浏览器驱动或 Selenium,AI 就可以直接操作网页——导航、点击、填表、截图,样样都行。
扩展的工作原理是:在网页中注入 content script,通过 Chrome 原生的 chrome.debugger API 与页面 DOM 交互。AI 发出的操作指令经过 JSON-RPC 协议传递到扩展,扩展解析后在真实浏览器中执行,结果再返回给 Agent 引擎。
图4:Chrome 扩展与 Agent 引擎的通信架构 — 双向 JSON-RPC 通道
对于需要「看着屏幕操作」的复杂任务,这个能力至关重要。比如让 AI 帮你填写一个政府网站的申请表:页面可能有几十个字段、复杂的联动逻辑、验证码,传统的 API 调用根本无法处理,而 AgentSphere 的浏览器自动化就能胜任。
除了浏览器自动化,AgentSphere 还支持 MCP(Model Context Protocol) 协议,这是一个标准化的 Agent 工具接入协议。MCP 的优势在于:一旦某个服务实现了 MCP Server,AgentSphere 就可以通过标准接口接入,无需重复开发。
目前社区已有大量 MCP Server 覆盖:Jira、GitHub、Slack、各类数据库等。这意味着 AgentSphere 可以成为企业内部各种系统的统一 AI 入口——让 AI 同时操作 GitHub 提交代码、Slack 发消息、Jira 创建工单。
项目采用标准的 Maven 多模块架构:
agent-sphere-bootstrap:Spring Boot 启动模块agent-sphere-runtime-kernel:运行时核心(SessionRunner 引擎)agent-sphere-runtime-orchestration:编排逻辑agent-sphere-capability-builtin:内置工具集(WebFetch、WebRead、Chrome 等)agent-sphere-capability-cli:CLI 执行能力agent-sphere-capability-mcp:MCP 协议支持agent-sphere-capability-skill:复合技能编排agent-sphere-model:多模型路由层agent-sphere-instance:会话实例管理agent-sphere-ui:React 19 + UmiJS Max + Ant Design Pro 前端中间件依赖 PostgreSQL(存储 LLM 交互历史和工具调用记录)和 Redis(缓存和会话状态)。
图5:AgentSphere Web UI — 对话式操作界面,支持多轮工具调用
坦白说,AgentSphere 的部署复杂度较高。官方提供了 docker-compose 启动 PostgreSQL 和 Redis 中间件,但主应用(Java 后端 + React 前端 + Chrome 扩展)需要手动构建运行。
最低配置需求:Java 21、Maven 3.9、Node.js 20、Docker、Chrome 浏览器,以及至少一个 LLM API Key(推荐 DeepSeek,便宜效果好)。
好消息是官方文档非常详细,提供了中英双语的快速入门指南(QUICK_START-cn.md),包括每一步的命令和截图。首次启动会自动执行 Flyway 数据库迁移,无需手动建表。
AgentSphere 最大的局限在于没有提供 Docker 化的后端服务——必须本机编译运行,对 Windows 用户不够友好(需要 WSL)。此外,Chrome 扩展依赖 chrome.debugger API,在某些企业受限环境中可能无法使用。
从更宏观的视角看,这个项目代表了一个趋势:AI Agent 的竞争,正在从「模型能力」转向「工程落地能力」。当各家大模型的差距越来越小时,谁能提供更稳定、更易用的 Agent 执行平台,谁就能赢得开发者。AgentSphere 用 Java 企业级思路做这件事,或许正是看到了这个机会。
图6:多轮工具调用示例 — AI 通过多次工具交互逐步完成复杂任务
AgentSphere 是一个工程化程度很高的 AI Agent 编排平台,特别适合以下场景:需要 AI 自动化操作网页的企业流程、需要对接多个外部系统的 AI 工作流、需要长时间运行和历史回放的 Agent 应用。其六层记忆系统和 Chrome 浏览器自动化是两大亮点。
推荐有一定 Java 技术栈积累的团队尝试。对于纯 Python 导向的团队,可能需要评估与现有工具链的整合成本。