GenericAgent
用3K行代码打造的自我进化AI助手,每次完成任务自动学会新技能,技能树随使用不断生长
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
用3K行代码打造的自我进化AI助手,每次完成任务自动学会新技能,技能树随使用不断生长
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2025年初,一位独立开发者用大约3000行Python代码做了一个实验:不给AI预装任何技能,让它在每次完成任务后自己"学会"这项技能。三个月后,这个AI自主完成了GitHub仓库搭建、代码提交、网页自动化操作、股票量化筛选、外卖下单——而这一切,都是在没有人类介入的情况下独立完成的。
这个项目就是 GenericAgent,一个极简的自我进化式自主智能体(Self-Evolving Autonomous Agent)框架。它的核心理念不是让AI"知道更多",而是让AI"学会学习"——每次成功完成新任务后,框架自动将执行路径固化为可复用的技能(Skill),随着使用时间增长,用户拥有的不再是预训练的固定能力集,而是一棵不断生长的个人技能树。

图1:GenericAgent 项目Banner
传统的AI Agent(如AutoGPT、LangChain Agent)往往采用"预装技能库"模式——开发者在发布时就预设了大量工具和技能,用户只能在既定范围内使用。这种模式的局限在于:预装技能永远无法覆盖所有场景,用户遇到新任务时依然束手无策。
GenericAgent的设计哲学截然不同:不预装技能,而是让技能在实战中生长。 用户只需给AI一个目标(比如"帮我找出过去三个月消费超过2000元的支付宝记录"),Agent会自动拆解任务、操作浏览器/终端/文件系统,执行完成后将整个执行路径记录为新的技能。下次再遇到类似任务时,直接调用已有技能,效率大幅提升。
这一理念与人类的学习过程高度相似——不是死记硬背,而是在解决问题中积累经验。开发者在README中提到一个标志性事件:整个GitHub仓库的搭建、Git初始化、每一次代码提交,全部由GenericAgent自主完成,"作者从未手动打开过一次终端"。这种自我引导(Self-Bootstrap)能力在同类项目中非常罕见。
GenericAgent的架构可以用"三件事"概括:9个原子工具 + 一个约100行的Agent循环 + 一个记忆系统。
9个原子工具覆盖了计算机操作的各个方面:
约100行的Agent循环是整个框架的核心决策引擎。它接收用户目标 → 调用原子工具执行 → 评估结果 → 决策下一步。当任务完成后,循环触发记忆系统,将本次成功路径结晶为新技能。
记忆系统(Memory) 是技能树的后端支撑。它记录每次执行的工具调用序列、执行结果和反思总结,供Agent在遇到新任务时检索参考。
值得注意的是,GenericAgent对Token消耗的控制极为严格——整个上下文窗口不到30K Tokens,相比动辄200K-1M Tokens的竞品,Token效率提升了6倍以上。这意味着更低的API调用成本、更少的幻觉风险和更高的任务成功率。
GenericAgent在模型兼容性上表现突出,支持Claude(Anthropic)、Gemini(Google)、Kim(Moonshot)、MiniMax等主流大模型,用户可自由切换。这种设计让项目不依赖任何单一模型提供商,降低了使用门槛和供应商锁定风险。
前端方面,项目提供了丰富的交互入口:
这种多前端策略让GenericAgent既能在个人电脑上作为日常助手,也能部署为服务器上的自动化任务执行器,还能接入企业即时通讯工具成为团队自动化平台。
GenericAgent的安装非常简洁,通过pip即可完成核心安装:
pip install genericagent
ga # 启动 CLI
可选安装UI依赖:
pip install genericagent[ui] # Streamlit + pywebview + TUI
核心依赖仅包含5个轻量级包(requests、beautifulsoup4、bottle、simple-websocket-server、aiohttp),安装负担极低。不过值得注意的是,GenericAgent本身不提供大模型API key,用户需要自行准备Claude/Gemini等模型的访问凭证,这也是当前几乎所有LLM Agent项目的共同特点。
由于没有Dockerfile和docker-compose支持,无法实现一键容器化部署,但pip安装方式对大多数用户而言已经足够便捷。部署难度评分为2/5(简单),预估部署时间约10分钟。硬件方面不需要GPU,普通电脑即可运行。

图2:GenericAgent 自主浏览网页并周期性总结内容
README中展示了多个生动的应用场景,每个都对应着框架的核心能力:
🧋 外卖下单:用户发出"帮我点一杯奶茶"指令,Agent自动打开外卖App、搜索商品、选择规格、填写地址、完成支付——全程无需人工介入。
📈 股票量化筛选:用户指定筛选条件"找EXPMA金叉、换手率>5%的GEM股票",Agent自动访问金融网站、执行筛选逻辑、输出结果。
💰 支付宝账务管理:通过ADB连接安卓手机,Agent自动打开支付宝、定位到账单页面、筛选出过去三个月超过2000元的消费记录。
🌐 自主网页探索:给定一个主题和研究目标,Agent自动访问相关网页、定期总结发现、最终输出研究报告。
这些场景覆盖了浏览器自动化、API调用、移动端控制、主动信息收集等核心能力,充分展示了框架的通用性和扩展潜力。
作为一款诞生不久的开源项目,GenericAgent同样面临一些挑战:
任务执行的不确定性:虽然框架设计精巧,但LLM驱动的Agent在复杂长任务中仍可能出现步骤偏差,需要人工确认或重试。
安全边界问题:拥有键鼠模拟和文件系统操作能力的Agent,一旦被恶意指令误导,可能造成数据损失或隐私泄露,生产环境部署需格外谨慎。
模型依赖:项目本身免费开源,但运行所需的Claude/Gemini等API均需付费,Token消耗虽低但长期使用仍有成本。
缺乏容器化支持:没有Dockerfile/docker-compose,对于习惯容器化部署的团队来说不够友好。
GenericAgent的出现折射出一个更大的趋势:AI Agent正在从"预装技能库"向"自我进化"方向演进。传统模式的核心矛盾在于——技能库越大,维护成本越高,但覆盖率依然有限;而自我进化模式的核心价值在于——技能在真实任务中生长,质量有天然的场景验证。
从数据来看,项目在GitHub上已获得超过12000颗星,收到了来自全球开发者的关注。arXiv技术报告、Datawhale中文教程、多个技术社区的讨论,都在推动这个项目的影响力扩大。
更难能可贵的是项目背后的研究态度——作者不仅开源了代码,还发表了完整的技术报告,并开放了复现仓库。这种透明度在AI开源领域是稀缺品质,也给学术界和工业界提供了有价值的研究素材。
如果你对AI Agent的自我进化机制感兴趣,或者需要一个能在日常工作中帮你自动化重复任务的多功能助手,GenericAgent值得一试。记住它最核心的设计哲学:不要预装技能,进化它们。