gorilla
让大语言模型学会调用API的工具调用框架,集训练、推理、评测于一体
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
让大语言模型学会调用API的工具调用框架,集训练、推理、评测于一体
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有过这样的体验——对着 ChatGPT 说「帮我查一下北京今天的天气」,它热情洋溢地回复了一大段关于天气的重要性,但就是不肯直接调用天气预报 API。这种「有智能但不会干活」的状态,曾经是所有 AI 助手的通病。Gorilla 正是为解决这一问题而生。
Gorilla 由加州大学伯克利分校 Sky Computing Lab 的研究团队开发,核心想法简单而有力:教会大语言模型(LLM)像人类程序员一样调用 API。2023 年 5 月,团队发表了同名论文 Gorilla: Large Language Model Connected with Massive APIs,并在 GitHub 上开源了完整的训练框架、评估工具和预训练模型,一举斩获超过 12,800 颗星。
项目领头人 Shishir Patil 是伯克利计算机系的博士生,专注于 LLM 的函数调用(Function Calling)能力研究。他在 X(Twitter)上非常活跃,持续发布 Gorilla 的更新动态。Gorilla 的技术博客(gorilla.cs.berkeley.edu/blog.html)详细记录了每个版本的迭代思路。
传统 AI 助手靠 Prompt Engineering 勉强实现函数调用,效果不稳定——一旦 API 文档稍微复杂一点,模型就容易张冠李戴、参数填错。Gorilla 则另辟蹊径:
方法一:API Zoo 数据集。 团队收集了 16,000+ 真实 API 的文档描述,训练模型理解 API 的「是什么」「怎么用」「什么时候用」。相当于给 LLM 买了一本厚厚的 API 字典。
方法二:自训练技术(Self-Instruction)。 用 GPT-4 生成高质量的 API 调用示范,再让模型学习这些示范,比直接训练效果更好、幻觉更少。
方法三:检索增强。 结合 BM25 和 LlamaIndex 检索技术,当遇到陌生 API 时,让模型先「查字典」再「打电话」,大幅提升陌生场景下的泛化能力。

Gorilla 实际上是一个多工具组成的完整生态,每个子项目都有独立价值:
🔬 Berkeley Function Calling Leaderboard(BFCL) 最权威的函数调用能力排行榜。覆盖 GPT-4、Claude、Gemini、Llama 等主流模型,评估指标包括准确性、格式合规、多轮对话能力等。2025 年 7 月发布 V4 Agentic 版本,新增 Web Search 多跳推理、Agent 记忆管理评估,标志着函数调用从单轮能力进化到多轮 Agent 协作。
🛠️ OpenFunctions v2 7B 参数的开源模型,在 Apache 2.0 许可证下可商用。性能与 GPT-4 持平,支持多个函数并行调用、多函数协作,是当前开源函数调用模型中的 SOTA。
📄 RAFT(Retrieval Augmented Fine-Tuning) 将 RAG 和模型微调结合的 recipes。用户只需上传一份领域文档,RAFT 自动生成问答对,用于微调模型。已与微软 Azure AI Studio 集成。
⚡ GoEx(Execution Engine) Powered by LLMs 的 API 执行引擎。与传统函数调用不同,GoEx 让 LLM 直接生成并执行代码来调用 API,通过反向调用(Reverse Call)机制确保执行安全。支持 RESTful API、数据库、文件系统、OAuth2 认证。
🏟️ Agent Arena 2024 年 10 月与 LMSYS(Chatbot Arena 的主办方)合作推出的 Agent 对战平台。基于 ELO 评分系统,覆盖搜索、金融、RAG 等任务场景。

图1:BFCL 评估框架架构。 模型输入 API 描述和用户指令,输出结构化的函数调用参数。评估引擎对照标准答案判定正确性,支持单轮和多轮场景。
Gorilla 的部署比普通开源工具稍复杂,主要原因是核心推理模块依赖 HuggingFace 上的 7B 模型权重,需要下载 ~14GB 文件。有 GPU 的用户(推荐 RTX 3090 或 A100,7B 模型需 14GB+ 显存)可以本地运行推理;没有 GPU 的用户可通过 API 模式调用云端模型。
纯 CLI 使用,无需 Docker 或 Web 界面。Python 3.8+、pip 安装依赖即可。BFCL 排行榜项目有 Codespaces 支持,在浏览器里点点就能跑评测。

图2:本地推理实时演示(需 GPU)。
Gorilla 也不是完美的。7B 参数的 OpenFunctions v2 相比 GPT-4 在复杂 API 场景下仍有差距;BFCL V4 Agentic 的评估标准较新,排行榜数据的稳定性还有待更多社区验证;此外,GoEx 的执行引擎涉及代码生成,存在被恶意 Prompt 注入的风险,官方虽加入了反向调用保护机制,但在生产环境使用前仍需谨慎评估。
Gorilla 代表了一个明确的趋势:从「会说话」到「会干活」。2024-2025 年,Function Calling 已经成为所有主流 LLM API 的标配能力,而这一切的学术起点之一,正是 Berkeley 的这个项目。
截至目前,Gorilla 仓库拥有 12,800+ Stars、1,300+ Forks、250+ Open Issues,社区活跃度高。如果你在构建 Agent 系统、RAG 流水线或需要让 AI 调用外部工具,Gorilla 的方法论、预训练模型和评估工具都值得参考。