UI-TARS-desktop
字节跳动开源的视觉语言模型驱动的 GUI 智能体,一句话指令让 AI 替你操控电脑和浏览器
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
字节跳动开源的视觉语言模型驱动的 GUI 智能体,一句话指令让 AI 替你操控电脑和浏览器
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
图1:UI-TARS 项目 Banner
想象这样一个场景:你正在赶一个紧急的报告,突然需要从 PDF 中提取数据、制作图表并更新到邮件里——传统的做法是手动操作数十个步骤。而 UI-TARS-desktop 正在重新定义这种交互方式:它让 AI 直接"看见"你的屏幕,像人类一样操控 GUI 界面,用自然语言就能指挥 AI 完成复杂的桌面操作任务。
这款工具来自字节跳动(ByteDance)Seed 团队,核心基于他们自研的 UI-TARS 视觉语言模型(Vision-Language Model)。UI-TARS 能够理解屏幕上的视觉元素——按钮、文本框、图片、表格——并精确地模拟鼠标点击、键盘输入等操作。与传统的命令行脚本自动化不同,UI-TARS 处理的是真实的 GUI 界面,不依赖控件 ID 或 XPath 定位,具备更强的通用性和鲁棒性。
UI-TARS-desktop 项目实际上是一个 monorepo 架构,包含两个核心产品:
Agent TARS — 通用多模态 AI 智能体技术栈,提供 CLI 命令行工具和 Web UI 界面,可通过 MCP(Model Context Protocol)工具协议连接各种外部工具,适合开发者和高级用户进行二次开发。
UI-TARS Desktop — 面向终端用户的桌面应用程序,提供原生图形界面,支持本地和远程两种操作模式,无需编写任何代码,直接下载安装即可使用。
从代码结构来看,项目采用了 pnpm workspaces 的 monorepo 架构,核心 packages 包括:
packages/agent-infra:智能体基础设施层,包含 browser-use(浏览器操控)、mcp-client/servers(MCP 协议实现)、logger 等模块。packages/ui-tars:UI-TARS 核心推理逻辑。packages/common:通用工具和配置。apps/ui-tars:Electron 桌面应用主入口。
整个项目使用 TypeScript 作为主力语言,Electron + electron-vite 构建桌面应用,Vitest 作为测试框架,ESLint + Prettier 保障代码质量。
UI-TARS-desktop 的操作能力可以分为四个维度:
本地计算机操作(Local Computer Operator):这是最核心的能力。安装桌面客户端后,AI 可以直接操控你的电脑——打开应用、点击按钮、输入文字、拖拽文件。前提是系统需要授予"无障碍权限"(Accessibility)和"屏幕录制权限"(Screen Recording),因为 AI 需要实时"看见"屏幕内容。
图2:UI-TARS Desktop Mac 应用主界面
远程计算机操作(Remote Computer Operator):无需本地安装模型,直接连接云端部署的 AI 服务。火山引擎(VolcEngine)提供了开箱即用的 API 接入方案,适合没有高性能 GPU 的用户。注意:官方免费远程服务已于 2025 年 8 月停止,但用户可自行部署到火山引擎。
浏览器操作(Browser Operator):支持 Chrome、Edge、Firefox 等主流浏览器,AI 可以自动完成网页导航、表单填写、内容提取等操作。配合 MCP 协议,还能扩展到爬虫、数据采集、自动化测试等场景。
本地模型支持:除了调用云端 API,还支持通过 Hugging Face 部署 UI-TARS-1.5-7B 模型本地推理,数据完全在本地处理,适合对隐私敏感的企业场景。
图3:UI-TARS 模型配置页面
从支持的 VLM 提供商来看,项目兼容多种接入方式:火山引擎 Doubao-1.5-UI-TARS、Hugging Face endpoints、OpenAI 兼容 API(理论支持任意服务商),覆盖了从免费到商业化的完整生态。
图4:多模型提供商支持
从代码架构来看,UI-TARS-desktop 的技术选型非常现代化:
Electron + electron-vite:跨平台桌面应用框架,相比 Tauri 方案在 Node.js 生态上有更好的工具链支持。
TypeScript + Vitest:类型安全 + 高性能测试,测试覆盖率有保障。
Turbo + pnpm workspaces:前端 monorepo 标准方案,Apps 和 Packages 分离,便于独立发布。
MCP(Model Context Protocol):Anthropic 提出的工具协议标准,UI-TARS 实现了完整的 MCP 客户端和服务端,这意味着它可以连接任何兼容 MCP 的外部工具生态(如文件系统、Git、数据库等),而不只是操作 GUI。
browser-use:基于 Playwright 的浏览器自动化封装,是 GUI Agent 的核心技术底座。
项目的 packages/agent-infra/mcp-servers 目录包含了丰富的预置 MCP 服务(搜索、浏览器、HTTP 服务器等),这使得 Agent TARS 具备了类似 Claude Code / GitHub Copilot Agent 的工具调用能力,但面向的是 GUI 操作而非纯代码。
对于普通用户,桌面应用是最友好的体验方式。macOS 用户可通过 Homebrew 一键安装,Windows 用户下载安装包即可。安装后需要手动在系统设置中授予辅助功能和屏幕录制权限。
不过要发挥最大潜力,用户还需要配置 VLM 模型。如果选择 Hugging Face 部署,需要自行申请 API 并配置端点。如果选择本地部署,至少需要一块 16GB 以上显存 NVIDIA GPU(如 RTX 3090 或更高),这对普通用户来说门槛不低。
对于开发者,Agent TARS CLI 提供了更强大的扩展性。npm 包 @agent-tars/cli 可直接安装,配合 MCP 工具生态可以实现复杂的自动化工作流。而且 v0.3.0 版本引入了 Event Stream Viewer,能可视化追踪数据流和工具调用过程,对调试智能体行为非常有帮助。
尽管项目在 GitHub 上获得了超过 35,000 颗星,但仍有几个明显的局限性值得关注:
多显示器支持缺失:文档明确指出 UI-TARS-desktop 目前仅支持单显示器配置,多屏用户会面临兼容性问题。这是 GUI Agent 领域的共性难题,因为多屏坐标映射增加了空间推理的复杂度。
GPU 资源依赖:本地模式对显存要求较高,限制了个人用户的普及。云端方案虽然绕过硬件限制,但存在数据隐私顾虑——你的屏幕截图会上传到第三方服务器。
任务成功率有待提升:作为新生代 GUI Agent,项目在复杂任务(如跨应用数据传递、多步骤决策)上的成功率仍不稳定,更适合作为辅助工具而非完全自主执行关键任务。
远程服务已商业化:此前免费的远程操作服务已停止运营,用户需要自行部署或使用火山引擎的付费服务,降低了零门槛体验的便利性。
UI-TARS-desktop 代表着 GUI Agent 领域的一个重要里程碑。从 2025 年 1 月上线至今不到一年半时间获得超过 35,000 颗星,反映了社区对"AI 操控电脑"这一愿景的强烈兴趣。
从技术演进角度看,项目经历了从 1.0 到 1.5 版本的迭代:UI-TARS-1.5 在动作解析精度上有显著提升,支持更复杂的 GUI 交互场景。结合 Agent TARS 的 MCP 生态,这个项目正在构建一个"AI + GUI + 工具链"的完整闭环。
对 AI 开发者而言,Agent TARS 的 CLI + MCP 架构提供了一个可编程的 GUI 自动化平台,可以用来构建自动化测试、数据采集、RPA(机器人流程自动化)等应用。相比传统 RPA 工具,它的核心优势在于自然语言理解和视觉理解能力——不再需要手动录制操作步骤,只需要描述你想要的结果。
对 AI 爱好者来说,UI-TARS Desktop 提供了一个低门槛的体验窗口。即使不理解底层技术,普通用户也能感受到"AI 帮我操作电脑"的便利——这种体验层面的突破,往往是技术走向大规模普及的关键一步。
图5:UI-TARS 与 UTIO 工具调用流程
UI-TARS-desktop 是字节跳动在 GUI Agent 领域的重要开源贡献,它将前沿的视觉语言模型能力与实用的桌面应用体验相结合,为开发者和普通用户分别提供了 Agent TARS CLI 和 UI-TARS Desktop 两条使用路径。项目采用现代化的 monorepo 架构,TypeScript + Electron 技术栈,MCP 协议为工具扩展枢纽,架构设计扎实。
从部署角度看,项目提供了 Homebrew 和直接下载两种安装方式,macOS 用户可快速上手。GPU 资源要求较高(建议 16GB+ VRAM),无 Docker 容器化方案,云端部署需要借助火山引擎。对于有 GPU 资源的开发者来说,本地部署 + CLI 扩展的灵活性更大;对于普通用户,预编译桌面应用 + 云端 API 是更务实的选择。
整体而言,这是一个技术领先、社区活跃、发展势头强劲的项目,值得持续关注其在 GUI Agent 领域的最新进展。