promptfoo
AI 提示词质量评估与安全红队工具,支持多模型对比和自动化漏洞测试
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
AI 提示词质量评估与安全红队工具,支持多模型对比和自动化漏洞测试
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有遇到过这样的场景:LLM 发布了一个新版本,你迫不及待地把新模型接入了产品,上线后却发现某个场景的回答质量反而下降了——但已经来不及回滚了。promptfoo 就是为解决这个问题而生的。

图1:promptfoo 的红队漏洞报告界面,展示 AI 应用安全测试结果
promptfoo 由 Ian Wu 和 Meta 前工程师于 2023 年初创立,核心理念很简单:与其靠人工一条条测试 prompt,不如用代码自动化、系统化地评估 LLM 输出质量。这种思路填补了 LLM 开发流程中一个长期被忽视的空白——提示词工程(Prompt Engineering)领域此前没有成熟的测试框架。promptfoo 的出现让开发者可以用 YAML 配置文件定义测试用例,自动对比多个模型或 prompt 版本的输出差异,并以 Web UI 可视化呈现结果。
2025年,promptfoo 正式加入 OpenAI。官方公告称此举是为了"让 AI 安全测试进入主流开发流程"。一个做提示词测试的工具,反被模型厂商收购——这本身就说明:AI 评估已经从可选项变成了核心基础设施。

图2:promptfoo 开源项目 Logo,21.6k GitHub Stars,MIT 协议
如果把 AI 应用比作餐厅,promptfoo 的功能可以这样理解:
Eval(评估)= 质检员:每次换厨师(模型)或改菜谱(prompt),质检员对比出品质量,告诉你新方案比旧方案好多少、差多少。
Red Team(红队)= 卧底测试员:专门模拟恶意顾客(攻击者),测试餐厅的安保漏洞——比如有人试图在点单时夹带纸条(提示词注入)、试图绕过后厨权限(越权调用)。
promptfoo 就是同时担任质检员和卧底测试员的自动化系统,而且它不领工资、不知疲倦。
在 promptfooconfig.yaml 中定义测试用例后,promptfoo 可以同时向多个模型发送相同的 prompt,对比它们的输出质量,并用内置或自定义的断言(assertions)自动打分。支持的评估维度包括:
promptfoo 支持 100+ 模型提供商:OpenAI GPT 系列、Claude、Gemini、DeepSeek、Ollama(本地模型)等。开发者可以用同一套测试集对不同模型做横向评测,找到当前任务性价比最高(效果好 + 成本低)的模型组合。这一功能对需要做模型选型和成本优化的团队尤其有价值。
这是 promptfoo 近年重点发力的方向,测试范围涵盖:
红队测试可以自动生成数千条攻击向量,配合 CI/CD 流水线实现持续安全监控。
promptfoo 提供了两种交互方式:
命令行模式(主要):
npm install -g promptfoo
promptfoo eval
测试结果输出在终端,同时可以启动本地 Web UI 查看可视化报告:
promptfoo view
Web UI 以 React + Vite 构建,提供了表格对比、统计图表等可视化视图,但本质上这是一个本地调试工具,不是托管在云端的 SaaS 产品。
配置方式:全部基于 YAML 文件,不需要写代码,非常适合 DevOps 集成。
官方提供多阶段 Dockerfile,构建产物为轻量级 Alpine 镜像,内置 Node.js + Python 3.12 环境。虽然没有 docker-compose,但一行命令即可运行:
docker run -p 3000:3000 promptfoo/promptfoo
1. Web UI 不是核心产品:promptfoo 的 Web 界面主要用于本地调试,企业级需求(团队协作、报告托管、权限管理)需要企业版。开源版本缺少这些功能。
2. 评估质量依赖断言设计:promptfoo 的评估准确性很大程度上取决于你写的断言质量。糟糕的断言设计会导致高分低质或低分高质的误判,对新用户有一定学习成本。
3. 闭源模型 API 费用:使用 OpenAI/Claude 等商业模型运行大规模评估时,成本可能快速攀升。虽然支持 Ollama 本地部署,但需要自行维护模型服务。
promptfoo 的崛起代表了一个重要趋势:LLMOps(LLM 运维)正在从实验阶段走向工程化。
截至目前,promptfoo 积累了超过 300,000 名开发者用户,156 家财富 500 强企业在生产环境使用它,被 OpenAI 和 Anthropic 官方用于培训和教育材料。
它的成功说明:随着 AI 应用规模扩大,"如何确保 AI 表现符合预期"的问题会越来越重要。promptfoo 所代表的自动化评估和安全测试赛道,正在成为 AI 基础设施不可或缺的一环。
对于 AI 开发者而言,promptfoo 是值得加入日常工作流的效率工具。对于 AI 爱好者而言,它是理解"如何衡量 AI 质量"这一核心命题的最佳实践案例。