open-interpreter
让大语言模型在本地直接操控计算机的 AI Agent 工具,通过自然语言执行代码、文件、浏览器等操作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让大语言模型在本地直接操控计算机的 AI Agent 工具,通过自然语言执行代码、文件、浏览器等操作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2023年,OpenAI 在 ChatGPT 中推出 Code Interpreter(代码解释器),让 AI 能够直接执行代码来完成真实任务——数据分析、文件处理、图表生成。这一能力让无数用户惊叹:原来 AI 不仅能聊天,还能真正"干活"。
但 OpenAI 的方案有三个致命限制:无法访问互联网、有严格的运行时间和文件大小上限、状态无法持久保留(环境关闭后所有文件和链接消失)。这让它只能成为一个"沙盒玩具",而无法成为真正的生产力工具。
Open Interpreter 正是为了解决这些问题而生。它是一个开源项目,将 GPT-4 Code Interpreter 的能力带到你的本地电脑——拥有完整的互联网访问权限、不受限制的运行时间、可以使用任何本地包和库,并永久保存所有生成的文件和对话历史。
Open Interpreter 是一个开源的自然语言编程接口,允许大语言模型(LLM)在本地环境中执行代码。目前支持 Python、JavaScript、Shell 等多种语言,并可以通过终端界面与用户进行 ChatGPT 风格的交互对话。
用一句话概括:它让任何人都能用日常语言指挥 AI 操作你的电脑——创建图片和视频、处理 PDF、操控 Chrome 浏览器进行网络研究、清洗和分析大规模数据集,不一而足。
项目的作者 Killian Lucas 从 2023 年开始维护这个项目,GitHub 星标数已超过 6.3 万,是当前最受欢迎的 AI 代码执行类开源项目之一。项目遵循 AGPL-3.0 开源许可证,并在 Discord 社区拥有活跃的开发者生态。
安装后只需在终端运行 interpreter 命令,即可开启交互式对话。默认使用 OpenAI GPT-4o 作为推理引擎,支持用户输入 API Key 开始使用。
每次模型尝试执行代码前,系统会请求用户手动确认(安全护栏),防止 AI 执行危险操作。用户也可以通过配置文件修改系统提示词,让 AI 自动批准特定类型的命令。
from interpreter import interpreter
interpreter.chat("Plot AAPL and META's normalized stock prices")
interpreter.chat() # 启动交互式对话
项目使用 LiteLLM 作为统一的 LLM 接口层,支持连接任何 OpenAI API 兼容的后端:
项目提供了功能丰富的 CLI 终端界面,支持对话导航、历史记录保存与恢复、上下文管理等功能。通过 %reset、%undo、%verbose 等快捷命令,用户可以在对话过程中动态调整行为。
还支持 profiles 配置系统,通过 YAML 文件定义默认行为,包括模型选择、API 密钥、系统提示词等,适合需要固定配置的工作场景。
项目最具想象力的功能之一是 Computer Use ——让 AI 代理直接操控 Chrome 浏览器来执行网络研究任务。模型可以自主导航网页、点击按钮、填写表单、提取信息,形成一个完整的自动化研究工作流。
这背后的技术栈包括 Selenium WebDriver、PyAutoGUI(鼠标键盘自动化)、OpenCV(视觉辅助定位)等。
通过 --local 参数,项目可以连接本地推理服务器运行开源模型,配合 LM Studio 或 Ollama 实现完全离线的 AI 代码执行体验。本地模式下上下文窗口默认限制为 3000 tokens,适合资源受限的场景。
Open Interpreter 的代码结构采用清晰的模块化设计:
interpreter/
├── core/ # 核心执行引擎(LLM 调用、代码解析、响应渲染)
├── terminal_interface/ # CLI 交互界面(对话导航、profiles、magic commands)
├── computer_use/ # 浏览器/系统操控代理
└── server.py # WebSocket 服务器(基于 FastAPI + uvicorn)
核心依赖包括:
项目提供了 Docker 支持,官方 Dockerfile 基于 python:3.11.8 构建,运行一个 LMC 兼容的 WebSocket 服务器在 8000 端口。开发者也可以通过 VS Code 的 Dev Container 快速搭建开发环境。
标准安装方式为一行 pip 命令:
pip install git+https://github.com/OpenInterpreter/open-interpreter.git
需要注意的是,Open Interpreter 目前没有传统意义上的 Web 图形界面(Streamlit/Gradio),所有交互通过终端 CLI 或 Python API 完成。对于非技术用户来说,有一定的上手门槛。
此外,本地运行大模型需要足够的硬件配置(尤其是运行 GPT-4 级别的模型时),而接入云端 API 则需要自行承担 OpenAI/Anthropic 的调用费用。项目本身免费,但调用商业模型的 API 需要付费。
Open Interpreter 代表了 AI 辅助编程工具的一个重要分支——不是替代 IDE,而是将 AI 能力扩展到操作系统层面,成为真正的"数字助手"。它的开源性质使得任何人都可以在此基础上构建自己的定制化 AI 工作流,从自动化脚本到智能助手,不受平台限制。
该项目的发展轨迹也反映了当前 AI 开源社区的一个趋势:将对标闭源巨头(OpenAI Code Interpreter)的能力开源化,并在本地化、定制化方面形成差异化竞争。随着越来越多的大模型支持本地部署,这类工具的实用价值将持续增长。
项目地址:KillianLucas/open-interpreter
许可证:AGPL-3.0
主要语言:Python
Stars:63,000+