TrustLLM
ICML 2024 收录的 LLM 可信度评测基准,覆盖真实性、安全性、公平性等六个维度
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
ICML 2024 收录的 LLM 可信度评测基准,覆盖真实性、安全性、公平性等六个维度
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你让 AI 帮你生成一篇新闻报道,结果它一本正经地编造了不存在的历史事件;你让 AI 帮你分析竞品数据,结果它泄露了用户隐私;你让 AI 帮你写代码,结果它在安全关键的部分埋下了后门。这类"一本正经地胡说八道"的问题,正是 TrustLLM 试图系统性地回答的核心问题:大语言模型到底有多可信?
TrustLLM 于 2024 年被国际机器学习顶级会议 ICML 2024 正式收录,是目前学术界关于 LLM 可信度评估最为系统的开源基准之一。
2023-2024 年,随着 GPT-4、Claude、ChatGLM 等大型语言模型在各行业快速落地,一个根本性的问题浮出水面:这些模型"听起来很厉害",但它们真的安全、公平、不会泄露隐私、不会传播有害信息吗?
此前业界对 LLM 的评测主要集中在"能力"维度——回答是否准确、推理是否正确——但对"可信度"的评估却缺乏统一标准。TrustLLM 的作者团队(以 Yue Huang、Siyuan Wu、Haoran Wang 为核心)正是在这一背景下,推出了覆盖六个核心维度的可信度评测框架。
该项目的技术博客、官网和 Leaderboard 均已上线(https://trustllmbenchmark.github.io/TrustLLM-Website/),吸引了全球研究者的关注和参与。截至目前,trustllm 包在 PyPI 上的下载量已突破 9000 次,足以说明社区对其的认可。
图1:TrustLLM 官方 Logo
TrustLLM 构建了一套系统性的评测框架,涵盖六个相互独立又彼此关联的可信度维度:
1. 真实性(Truthfulness):模型是否会传播虚假信息?包含内/外部一致性、幻觉检测、反事实推理等子任务。
2. 安全性(Safety):模型是否会产生有害内容?包括恶意指令规避、有毒内容生成等方面的评测。
3. 公平性(Fairness):模型是否存在性别、种族、地域等偏见?通过精心设计的偏见测试集评估。
4. 鲁棒性(Robustness):模型对对抗性输入、分布漂移的抵抗能力如何?涵盖拼写扰动、同义词替换等攻击场景。
5. 隐私性(Privacy):模型是否会泄露训练数据中的敏感信息?测试模型对隐私保护指令的遵从度。
6. 机器伦理(Machine Ethics):模型在道德困境中的决策是否符合人类社会伦理规范?
此外,TrustLLM 还延伸覆盖了透明性和解释性两个更高层次的原则维度,形成了八维度的完整体系。
图2:TrustLLM 基准测试架构图
TrustLLM 不仅是一份评测数据集,更是一套可复用的评测工具包。其核心设计理念是"让评测像调用 API 一样简单"。
数据集层面:TrustLLM 在 HuggingFace 上发布了完整的评测数据集(TrustLLM-dataset),涵盖 30+ 个公开数据集、数万个测试样本,涵盖上述六个维度的全面覆盖。
工具包层面:trustllm Python 包提供了端到端的评测 Pipeline:
from trustllm.task.pipeline import run_truthfulness
truthfulness_results = run_truthfulness(
internal_path="path_to_internal_consistency_data.json",
external_path="path_to_external_consistency_data.json",
hallucination_path="path_to_hallucination_data.json",
sycophancy_path="path_to_sycophancy_data.json",
advfact_path="path_to_advfact_data.json"
)
TrustLLM 支持16+ 主流 LLM,包括:
支持 DeepInfra、Replicate、Azure OpenAI 等多个推理平台,开发者可根据需求灵活切换后端。
TrustLLM 的代码结构清晰,遵循模块化设计:
trustllm_pkg/trustllm/
├── config.py # 全局配置:API密钥、支持的模型列表、评测任务参数
├── dataset_download.py # 一键下载评测数据集
├── generation/ # LLM 响应生成模块
│ └── generation.py # 支持HuggingFace模型和在线API的文本生成
├── task/ # 核心评测任务
│ ├── ethics.py # 机器伦理评测(14159B,最复杂的评测模块)
│ ├── fairness.py # 公平性评测
│ ├── privacy.py # 隐私保护评测
│ ├── robustness.py # 鲁棒性评测(对抗攻击)
│ ├── safety.py # 安全性评测
│ ├── truthfulness.py # 真实性评测(幻觉/误导检测)
│ └── pipeline.py # 统一评测 Pipeline 入口
└── utils/ # 工具函数
├── embedder.py # 文本嵌入(用于语义相似度评测)
├── gpt_auto_eval.py # GPT-4 自动评测(打分/偏好判断)
├── metrics.py # 多维度评测指标计算
└── perspective.py # Perspective API(毒性检测)
核心依赖:transformers、huggingface_hub、peft(LoRA/QLoRA微调支持)、openai、anthropic、google-generativeai、replicate、datasets 等,生态丰富。
TrustLLM 支持三种安装方式:
# 方式一:GitHub 安装(推荐)
git clone git@github.com:HowieHwong/TrustLLM.git
cd TrustLLM/trustllm_pkg
pip install .
# 方式二:PyPI
pip install trustllm
# 方式三:Conda
conda install -c conda-forge trustllm
前置要求:Python 3.9+,以及需要评测的 LLM 平台 API 密钥(OpenAI / Anthropic / Google / Replicate 等)。
TrustLLM 提供了公开的 Leaderboard,展示了 16+ 主流 LLM 在六个维度上的综合表现。目前业界普遍认为:
这一基准的建立,为 AI 安全研究提供了可量化的参照系,对推动"可信 AI"(Trustworthy AI)的发展具有重要的学术和工程价值。
值得注意的是,TrustLLM 评测框架本身也存在一定局限:
TrustLLM 团队并未止步于此。2025 年 2 月,他们发布了新一代工具包 TrustGen 和 TrustEval,将可信度评估扩展到更广泛的生成式 AI 模型(涵盖图像、视频等多模态场景),并引入了动态评测框架 UniGen,以应对静态评测的时效性问题。
总结:TrustLLM 是 AI 可信度评测领域的里程碑式工作。它以系统化的框架、丰富的工具链和开放的基准数据,为研究者和开发者提供了一把衡量 LLM 可信度的"标尺"。尽管存在文化覆盖不足等局限,但其对 AI 安全生态的推动作用毋庸置疑。随着 TrustGen/TrustEval 的推出,这一工作正从语言模型扩展到更广阔的生成式 AI 领域,值得持续关注。