llm-space
桌面端AI Agent原型设计与调试工具
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
桌面端AI Agent原型设计与调试工具
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

凌晨两点,你正在为新写的 Agent prompt 调参。日志刷了几十屏,模型在某个步骤突然"失联"——它调用了什么工具?传了什么参数?为什么最后返回了这个奇怪的答案?你无从得知。传统调试方式只能看到最终输出,中间过程是一片黑箱。
LLM Space 正是为解决这个痛点而生的。它是字节跳动 DeerFlow 团队内部重度使用的主力工具:DeerFlow 的每个版本都会用 LLM Space 来构建和调试。如今 DeerFlow 团队将这个工具独立开源,让所有 Agent 开发者都能用上这把"调试放大镜"。
LLM Space 是一个本地优先的桌面应用,面向 Agent 开发者、产品经理和测试工程师。它将 Agent 开发的核心环节全部整合到一个窗口里:
项目始于 2023 年 3 月,v4 是其第四次大版本迭代,已稳定运行超过两年。

LLM Space 采用 Bun monorepo 结构,核心分为三大块:
| 组件 | 定位 |
|---|---|
packages/core | 共享逻辑:类型定义、agent loop、thread storage |
packages/runtime | 运行时引擎 |
packages/ui | UI 组件库 |
apps/desktop | 桌面应用(Electrobun 壳 + React) |
apps/web | Web 版(预览) |
apps/server | 服务端组件 |
技术栈一览:
@earendil-works/pi-agent-core),一个轻量的 Agent 构建框架LLM Space 的基本工作单元是 Thread——你可以把它理解为一个"保存的实验文件"。每个 Thread 包含标题、模型选择、System Prompt、Variables(占位变量)、Tools(工具定义)、Messages(对话历史)、Tool Calls(工具调用记录)以及 Run History(历史运行快照)。
而 Harness(测试工坊) 则负责执行这些 Thread:它追踪 agent 的每一个推理步骤、每一次工具调用、每一个响应节点,把传统 Agent 的"黑箱"变成"透明玻璃箱"。

从 GitHub Releases 下载 DMG 安装包(支持 macOS Apple Silicon 和 Intel),或直接从源码构建(需要先安装 Bun)。
首次启动时,LLM Space 会自动从环境变量中读取已有的 API Key(如 OPENAI_API_KEY),并推荐可用的模型提供商。你也可以手动添加 OpenAI、Anthropic、火山引擎等任意 OpenAI 兼容端点。
# 从源码运行
bun install
bun run dev
最实用的功能之一:在 Thread 界面点击"生成",AI 会将当前 Thread 的 prompt、tools 和设置自动转换为可运行的 LangGraph Python 代码。这意味着你在 LLM Space 中调试好的 agent,可以一键导出为生产级代码。
支持连接 Model Context Protocol(MCP) 服务器,扩展可用工具集。内置已集成 Tavily 搜索等常用工具。
选择任意两次历史运行,对比它们在相同 rubric 下的得分差异(1-5 分制),直观判断 prompt 调整或模型切换带来的效果变化。
内置 read、write、edit、grep、glob 等常用文件系统工具,开箱即用,无需额外配置。

LLM Space 代表的趋势是 Agent 开发基础设施的平民化。过去,只有大型 AI 团队才有能力构建自己的 Agent 调试平台;如今,借助 LLM Space 的 Harness 模式,任何人都可以系统化地开发、追踪、调试和评估 Agent。
同时,它也印证了"Harness 模式"在 Agent 开发中的核心地位——不是让 Agent 自己摸索,而是给它一个结构化的执行框架,让开发者能看清楚每一步在做什么。随着 Agent 应用场景的持续扩展,这类开发工具的价值将愈发凸显。
相关链接: