infiAgent
通过YAML配置文件即可构建SOTA级多层级AI智能体,支持数天级长程任务与断点续跑
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
通过YAML配置文件即可构建SOTA级多层级AI智能体,支持数天级长程任务与断点续跑
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你要让AI帮你在三天内完成一份完整的市场调研报告,需要它持续追踪数十个信源、反复修正分析框架、中途崩溃后能从断点恢复、而且全程无需你盯着电脑。如果用传统的对话式AI,你可能需要在聊天框里反复粘贴上下文、管理几百条历史消息,最终大概率因上下文溢出而「失忆」。
infiAgent(全称 Multi-Level Agent,简称 MLA)就是为了解决这个痛点而诞生的。它是一个专为无限时长运行设计的智能体框架,核心理念是:让AI像人类研究员一样工作——有计划地拆解任务、在子任务间协作、保留工作记忆、随时从断点继续。
图1:infiAgent CLI 启动界面,支持交互式任务输入
大语言模型的能力在2023-2024年突飞猛进,但主流的使用方式——对话式交互——始终停留在「问答」层面。真正的AI应用需要AI能够自主规划、长程执行、多步骤协作,这催生了「Agent」(智能体)概念。
早期的Agent框架(如LangChain、AutoGPT)存在几个根本性问题:
infiAgent 由 polyuiislab 团队开发(GitHub 1179 ★,Python 主语言),从架构层面系统性解决了这些问题。其核心理念是:将Agent的执行能力封装为可配置的层级架构,让用户在 YAML 文件中定义Agent的能力边界,而非在代码里硬编码。
infiAgent 采用了树形层级编排(Hierarchical Orchestration)的设计思想。Agent被组织为多层级结构:
这种分层设计的巧妙之处在于:每一层只关心自己的「本职工作」,不需要全知全能。规划层只需要判断「这个子任务做得好不好」,不需要知道文件怎么读写;工具层只需要执行指令,不需要理解任务宏观目标。
框架内置两个成熟的预置Agent配置:
如果你想快速体验,扁平架构的 OpenCowork 开箱即用;如果你要做深度研究任务,可以用 Researcher 配置启动,它会自动调用多层级协作。
传统Agent的记忆依赖外部向量数据库或专门的存储系统,部署成本高、调试复杂。infiAgent 采用了更轻量的方案:基于文件目录的持久化记忆。
其原理是:Agent 的所有对话历史、中间产物、工作状态都存储在 ~/.mla_v3/ 目录下,每次启动任务时读取历史记录即可「记住」之前的工作进展。不同任务有独立的目录空间,互不干扰。
这一设计的优势是:
此外,从 V3 版本开始,历史任务还会被索引进本地 SQLite 数据库,支持通过自然语言检索历史任务,找到「上一次做类似任务时的方案」。
infiAgent 解决了长程任务的两大天敌:
问题一:上下文累积导致性能下降。 infiAgent 在运行时会定期对历史对话进行压缩(Compressor),只保留关键信息和当前计划,丢弃冗余细节。这样,即使任务跑了100步,实际的上下文窗口大小仍然可控。
问题二:中断导致进度丢失。 infiAgent 在每次关键操作后都会保存执行快照(checkpoint),包括:当前任务状态、子Agent进度、中间产物位置。如果进程崩溃或被手动停止,只需运行 resume 命令,Agent 就能从上次保存的位置继续,而不是从头开始。
这两种机制结合,使「数天级别的连续任务」成为可能——你可以在下班前暂停,上班后继续,中间的进度不会丢失。
infiAgent 兼容 Agent Skills 开放标准(agentskills.io),允许将AI的特定能力封装为可复用的 Skill 包。项目内置了丰富的预置 Skills:
| Skill 名称 | 功能 |
|---|---|
algorithmic-art | 算法生成艺术图案 |
canvas-design | 在线画布设计 |
doc-coauthoring | 文档协作撰写 |
pdf | PDF解析与内容提取 |
pptx | PPT生成与编辑 |
slack-gif-creator | Slack GIF 制作 |
xlsx | Excel 数据处理 |
webapp-testing | Web 应用自动化测试 |
mcp-builder | MCP 协议工具构建 |
开发者也可以将自定义 Skill 放入 skills/ 目录,Agent 启动时会自动扫描并注册可用技能,按需调用。
infiAgent 提供了三套交互界面:
CLI 模式(命令行):适合开发者,灵活可控。通过 python start.py 启动交互式终端,选择Agent类型和模型后即可开始任务。
Web UI 模式:通过 Docker 一键启动,浏览器访问 localhost:4242。支持多用户注册和用户管理,适合团队共享使用。配置好 LLM 的 API Key 后,通过可视化界面管理任务。
图2:Web UI 配置界面,支持多模型管理和任务监控
桌面端(Electron):macOS 原生应用,基于 SDK 构建,包含 Marketplace 集成、MCP 运行时接入和内置的 Researcher 科研系统。
infiAgent 的架构是「Python为核心 + TypeScript做界面」的分层结构:
core/agent_executor.py)、工具注册系统(tool_server_lite/)、LLM 客户端(services/llm_client.py)web_ui/server/server.py),REST API 管理任务和配置核心的层级编排逻辑在 core/hierarchy_manager.py 中实现,通过栈(stack)和共享上下文(share_context)管理多层级Agent间的状态传递。
值得注意的是,基于 infiAgent SDK,项目方还衍生出了 CheapClaw 项目。这是一个专注于「成本控制」的多Bot编排应用——通过在同一Agent循环内混合使用强模型(做规划/反思)和弱模型(做执行),在保持任务质量的同时显著降低API调用成本。
其核心洞察是:规划需要深度思考(用强模型),但执行只需要基本能力(用弱模型)。通过定期「截断」并压缩上下文,弱模型始终在较短的上下文窗口内工作,而强模型每隔一段时间才被调用一次来「校正方向」。
优势:
局限:
infiAgent 解决的不是「让AI更强」的问题,而是「让AI能够持续稳定地工作」的问题。这恰恰是当前Agent从Demo走向实际应用时面临的核心瓶颈。
它的出现代表了Agent框架的一个新方向:以配置文件为中心(而非代码为中心),让非开发者也能定义Agent行为;同时以文件系统为记忆,去掉数据库依赖,降低部署门槛。这两个设计选择在当下LLM应用开发中具有相当的代表性。
截至2026年,infiAgent 在 GitHub 上已有 1179 颗星,51个Fork,并保持了活跃的版本更新,是多层级Agent框架领域的值得关注的项目。