genai-compliance-bench
为金融、电信、医疗等强监管行业的AI部署者提供部署前合规性评测工具
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
为金融、电信、医疗等强监管行业的AI部署者提供部署前合规性评测工具
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这样的场景:某银行把大模型部署到贷款审批系统,模型生成的拒贷理由只写了"综合评分不足",结果被监管机构以违反《公平信贷法》(ECOA)为由开出罚单。通用的AI安全测试(检测仇恨言论、幻觉等)根本测不出这个问题——因为这根本不是"通用安全"问题,而是一个行业法规合规问题。
GenAI Compliance Bench 就是来解决这个空白的。
这个开源项目诞生于2025年10月,由贡献者社区维护,定位是:为金融、电信、医疗等强监管行业的AI部署者,提供部署前的合规性评测工具。它本质上是一个规则引擎——你喂给它一段AI生成的文本,告诉它"这是金融行业的贷款审批场景",它就能告诉你这条输出违反了哪条法规、严重程度如何、应该怎么修复。
随着LLM在金融、医疗、电信等行业的落地,企业面临的合规压力急剧增加。NIST AI风险管理框架定义了"可信赖AI"的标准,但没有配套的评测工具。企业只能自建内部测试,重复造轮子,还容易遗漏边缘案例。GenAI Compliance Bench 正是填补这个空白的开源方案。
这个项目的核心价值在于两点:
第一,规则可复用。 项目内置了多个行业的预置合规规则:金融行业的SOX审计跟踪、ECOA公平信贷、PCIDSS支付数据保护、BSAAML可疑交易检测;电信行业的FCC Section 222 CPNI数据保护、TCPA电话营销同意;医疗行业的HIPAA隐私规则和安全保障。这些规则以YAML格式定义,每个规则直接关联到具体的法规条款和引用(如"12 CFR 1002.9")。
第二,评测结果有审计价值。 输出不只告诉你"违规",而是给出违规的具体文本片段(span,字符偏移量)、对应的法规引用、以及风险严重等级(CRITICAL/HIGH/MEDIUM/LOW/None),形成完整的审计轨迹,支持留存备查。
项目代码结构清晰,分为三个核心模块:
src/genai_compliance_bench/
├── policy_engine/ # 核心评测引擎
│ ├── engine.py # PolicyEngine 主类
│ ├── rule_loader.py # YAML规则加载器
│ └── explainer.py # 评测结果解释模块
├── evaluator/ # 评测执行器
│ ├── batch_eval.py # 批量评测(含并发、进度追踪)
│ └── realtime_eval.py # 实时评测
└── learner/ # 自进化模块
├── feedback_loop.py # 人类反馈学习循环
└── risk_feature_store.py # 风险特征存储
PolicyEngine 是整个系统的核心。它的工作流程是:接收一段AI文本输出 + 指定行业/场景上下文,加载对应行业的YAML规则集,通过三层匹配策略进行检查——关键词预过滤(快速)、正则表达式匹配(精确)、上下文条件匹配(复杂场景)。匹配到的违规会收集起来,去重后按严重程度排序,最终输出一个ComplianceResult对象,包含通过/未通过标记、风险评分、违规列表、修复建议和审计轨迹。
RuleLoader 的设计值得注意。它支持YAML规则的继承和覆盖:基准规则放在benchmarks/_base.yaml,各行业在此基础上扩展。例如金融行业的fair_lending.yaml中可以覆盖或扩展基础规则。加载时会检查重复ID,同名规则后者覆盖前者。加载结果会缓存(可强制刷新)。
FeedbackLoop 是可选的自进化模块。如果安装了openai依赖,可以记录人类审核者的纠正反馈(真阳性/假阳性/真阴性/假阴性),系统会计算每条规则的精确率和召回率,进而自动调整规则的权重。如果precision低(假阳性高),说明规则太严格,会降低权重;如果recall低(假阴性高),说明规则有漏洞,会建议补充。
安装只需要一行命令:
pip install genai-compliance-bench
调用同样简洁:
from genai_compliance_bench import PolicyEngine
engine = PolicyEngine()
engine.load_sector("financial")
result = engine.evaluate(
output="Based on the applicant profile, we recommend denying the loan.",
sector="financial",
context={"use_case": "credit_decisioning", "model": "gpt-4"},
)
print(f"Passed: {result.passed}, Risk: {result.risk_level.value}")
批量评测支持CSV/JSON/Markdown多种输出格式,带并发加速和进度追踪,适合接入CI/CD流水线做自动化回归测试。
项目依赖非常轻量:pyyaml、pydantic、rich,纯CPU运行,不需要GPU。learner模块可选(需要openai)。Python版本要求≥3.10,支持3.10~3.13。
这个项目仍处于Alpha阶段(v0.3.1),局限是明显的:
规则覆盖有限。 目前只支持金融、电信、医疗三个行业,每个行业的规则数量有限,且主要来自美国法规。欧洲GDPR、中国数据安全法等海外法规暂不支持。对于全球化的AI应用,规则库的扩展是长期挑战。
评测粒度依赖规则质量。 规则本质上是正则+关键词匹配,无法理解语义——如果AI用同义词绕过关键词,规则可能漏检。项目文档也承认这一点,将"语义理解"列为未来方向。
自进化功能依赖商业API。 FeedbackLoop的规则建议功能需要调用OpenAI API,意味着需要额外的商业成本。这对于只想用基础评测功能的企业来说是个门槛。
无容器化部署支持。 项目不提供Dockerfile或docker-compose,对需要在隔离环境中运行的企业来说,需要自行打包。
GenAI Compliance Bench 代表了一个正在快速扩张的细分赛道:AI合规性评测工具。
随着欧盟AI法案(EU AI Act)生效、美国各州AI监管法规陆续出台,AI合规性评测正在从"可选"变为"必须"。据估算,到2026年底,全球金融行业在AI合规方面的支出将增长3倍以上。这个背景下,开源合规评测工具的需求会持续增加。
从GitHub数据看,项目目前634 stars、55 forks,创建于2025年10月,最近更新2026年3月,活跃度中等。issues数为0(未发现公开问题),社区维护状态良好。
对于AI开发者和AI爱好者来说,这个项目是一个很好的学习案例——它展示了如何用结构化的方式处理非结构化的合规问题,将抽象的法规条文转化为可执行的规则引擎。无论你是正在评估某个AI系统的合规性,还是在设计一个需要合规保障的AI应用,GenAI Compliance Bench 都值得了解。