binex
Alexli18/binex加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你写了一段 AI Agent 流水线,跑了 20 分钟,最后输出了一堆莫名其妙的结果。想定位问题?日志残缺、调用链路不清、每一步究竟发生了什么全靠猜——因为大多数 Agent 框架本质上是"盲跑",跑完就完事了,想要事后分析几乎不可能。
Binex 正是为解决这个痛点而生的。
Binex 由独立开发者 Alex Li 创建,目前托管于 GitHub。与其说这是一个商业项目,不如说它更像一个开发者的"个人工具箱"——作者自己在使用 LangGraph、CrewAI、AutoGen 等框架时,深感这些框架对"运行之后"(post-run)的支持几乎为零。LangGraph 有 LangSmith,但那是付费托管服务;CrewAI 和 AutoGen 干脆什么都没有。
于是,这位开发者决定自己动手,写一个完全本地运行、可视化调试、支持回放和差异对比的 Agent 运行时。代码 100% 开源(MIT License),没有任何遥测或追踪,用户数据永远不会离开本地机器。
Binex 的核心是一个有向无环图(DAG)执行引擎。用户以 YAML 格式定义工作流,每个节点(node)代表一个 Agent 步骤,节点之间通过 depends_on 声明依赖关系。运行时引擎按照 DAG 拓扑序调度节点,并记录每个节点的输入、输出、耗时、成本和调用详情。
这套设计的精妙之处在于:它不是另一个 Agent 框架,而是一个框架无关的运行时。通过内置的适配器(Adapter),Binex 可以直接运行 LangGraph、CrewAI、AutoGen 的流水线,不需要任何代码迁移——只需要加一行 binex run 即可获得完整的调试能力。
Binex 提供了一个功能完整的 Web UI,通过 binex ui 命令即可启动。界面包含可视化 DAG 编辑器、拖拽式节点配置、内置工具选择器和 MCP 服务器配置面板。支持可视化编辑和 YAML 代码双向同步,修改一方会实时反映到另一方。编辑器内置实时成本估算,用户在配置阶段就能了解每个节点的大致花费。
运行结束后,binex debug 命令以交互式 TUI 展示每个节点的输入/输出和完整 Prompt。binex trace 则以甘特图(Gantt Chart)形式展示节点执行时间线,并自动标红异常节点。用户可以深入查看任意节点的完整调用记录,无需翻阅大量日志文件。
节点执行时间线,异常节点自动高亮
这是 Binex 最具特色的功能之一。binex diff 支持两个运行实例的 side-by-side 对比,过滤条件包括"有变化的节点"、"失败的节点"和"成本变化"。binex bisect 则更进一步,通过二分查找算法定位两个运行版本之间的首次分歧节点,帮助开发者快速缩小问题范围。
两次运行的结果差异一目了然
传统的调试方式需要重新运行整个流水线,效率极低。Binex 的 binex replay 命令允许用户直接回放某次历史运行,并且可以在回放时替换任意节点的模型或 Prompt,只重跑被替换的节点,其他节点直接复用历史结果。这对于调试"某个 Prompt 改改效果如何"这类需求来说,效率提升极为显著。
Binex 通过 LiteLLM 统一接入 40+ LLM 提供商,包括 OpenAI、Anthropic、Google Gemini、Ollama、DeepSeek、Groq、OpenRouter 等。配置多个模型后,单个工作流中可以混用不同提供商的模型,每个节点独立选择模型,互不影响。Ollama 和 OpenRouter 的免费模型开箱即用,无需任何付费。
Binex 内置了 9 种经过实践验证的 Agentic 设计模式,以 Pattern Node 的形式供用户直接使用,无需从零编写:
Binex 的源代码组织遵循清晰的功能分层:
| 模块 | 职责 |
|---|---|
adapters/ | Agent 后端适配器(本地脚本、LLM、A2A 协议、Human 介入、框架插件) |
runtime/ | DAG 编排器、调度器、回放引擎、重试逻辑 |
trace/ | 调试报告、血统追踪、时间线、甘特图、语义差异 |
graph/ | DAG 构建与拓扑排序 |
stores/ | SQLite 执行存储 + 文件系统产物管理 |
tools/ | @tool 装饰器、10 种内置工具、MCP 客户端 |
ui/ | FastAPI 后端 + React 前端(32 个 REST 端点) |
gateway/ | A2A 协议网关与路由 |
eval/ | 评测套件、断言、黄金运行对比 |
技术栈方面,后端采用 Python 3.11 + FastAPI,前端使用 React + TypeScript + Tailwind CSS,数据存储依赖 SQLite,LLM 接入通过 LiteLLM 统一封装。整体依赖较轻,对运行环境要求低。
安装仅需一行 pip install binex,运行 binex hello 即可零配置体验一个两节点的示例流水线。部署方式灵活:纯 CLI 模式(binex run workflow.yaml)、本地 Web UI 模式(binex ui),或者 Docker 一键部署(docker compose -f docker/docker-compose.webui.yml up --build)。即使完全不使用 OpenAI API,也可以通过 Ollama 和 OpenRouter 的免费模型完成整个工作流。
Binex 还支持将自身作为 MCP Server 暴露给 Claude Code、Cursor 等编码助手,使这些工具能够直接查询 Binex 中的运行记录、执行评测对比——真正将调试能力集成到日常开发环境中。
Binex 作为一个年轻项目(当前版本 0.7.5,开发状态为 Alpha),存在一些明显的局限:版本成熟度不足,生产环境使用需谨慎;Python 3.11+ 强制要求,对旧项目有一定迁移成本;Web UI 的工程化深度不如成熟的低代码平台,复杂场景下可能需要回归 CLI;此外,CLI 命令较多(30+ 个),新用户存在一定的学习曲线。
Binex 的出现反映了一个正在快速增长的行业需求:随着 AI Agent 从实验走向生产,**"如何在生产环境调试 Agent"**这个命题变得越来越紧迫。传统框架追求的是"如何构建 Agent",而 Binex 填补的正是"如何观测和调试 Agent"这一空白。它的框架无关性设计尤其值得称道——不需要用户重写代码,就能为现有的 LangGraph/CrewAI/AutoGen 流水线补上完整的可观测性。
目前项目社区活跃度中等(62 Stars,11 Forks),由独立开发者维护。对于希望深入理解 AI Agent 执行过程、或在生产环境引入 Agent 流水线的团队而言,Binex 是一个值得关注的技术选型。