TrustEval-toolkit
七维度可信度评测框架,覆盖 LLM/VLM/T2I 三大模态,ICLR26/NAACL25 Demo
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
七维度可信度评测框架,覆盖 LLM/VLM/T2I 三大模态,ICLR26/NAACL25 Demo
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有这种感觉——大模型评测就像开盲盒,benchmark 刷分一个比一个高,真正用起来却总是差点意思。TrustGen(TrustEval-toolkit)就是来解决这个问题的:它不看你 benchmark 跑分,而是专门给生成式基础模型做可信度体检,从七个维度给模型打分,告诉你哪个模型在真实场景下更值得信赖。
图1:TrustGen 项目概览
随着 GPT-4、Claude、Gemini、LLaMA 等大模型能力越来越强,传统的 benchmark 评测( MMLU、HellaSwag 等)已经不够用了。这些评测往往考察的是模型在封闭数据集上的「记忆能力」,而忽视了模型在可信度维度的表现——比如:
TrustGen 由学术团队开发(发表在 ICLR 2026 和 NAACL 2025 Demo),提出了一个动态评测框架,不仅能测,还能针对不同上下文场景做变体评测——真正模拟模型在真实部署环境中的可信度表现。
TrustEval 采用流水线(Pipeline)架构,核心分为以下模块:
| 模块 | 功能 |
|---|---|
download | 自动下载评测元数据(metadata) |
generation | 调用各类生成模型的 API(LLM/VLM/T2I) |
contextual_variator | 对输入施加上下文变化(文化、语言、领域等) |
evaluation | 基于 LM/VLM/T2I 评判器给输出打分 |
report | 生成可视化评测报告 |
核心依赖包括:
架构设计遵循松耦合原则:每个模块都可以独立运行,用户可以只替换 generation 模块切换不同的模型后端,而不影响评测逻辑。这种设计对研究者非常友好,也方便集成到自动化评测流程中。
TrustEval 定义了 7 个可信度维度,每个维度都有独立的评测子模块:
评估模型在面对复杂、模糊或高风险场景时的决策质量。包含 advance_AI_risks.json 专项评测集,考察模型对前沿 AI 风险的感知能力。比如当用户描述一个涉及多方的利益冲突时,模型的回答是否考虑了多方视角?
评估模型在道德判断和价值观引导方面的表现。区分 LLM(文本伦理)和 VLM(视觉伦理)两个评测分支,考察模型对色情、暴力、仇恨内容的拒绝程度,以及在灰色地带的边界处理。
这是 TrustEval 的亮点之一——公平性评测覆盖了 LLM、VLM、T2I 三种模态:
评测模型是否会在交互中泄露隐私信息,包括直接隐私泄露(模型主动透露训练数据中的人物信息)和推断隐私泄露(通过多轮对话诱导推断用户的个人信息)。同样覆盖 LLM、VLM、T2I 三个模态。
评估模型面对各种干扰和攻击时的稳定性:
专门针对有害内容的安全评测,包括 safety metadata 专项数据集,评估模型对恶意请求(病毒代码生成、犯罪指导等)的拒绝率及理由质量。
考察模型输出的事实准确性,包括事实型问答中的幻觉(hallucination)检测,以及 T2I 模型生成的图像是否符合文字描述(数量、颜色、空间关系等)。
LLM(文本模型):OpenAI GPT 系列、Anthropic Claude 系列、Meta LLaMA 系列、Google Gemini 系列、Mistral 系列,以及国产 Qwen(通义千问)、GLM(智谱)、Baichuan(百川)等。
VLM(视觉语言模型):支持基于视觉输入的评测,覆盖主流多模态模型。
T2I(文生图模型):Stable Diffusion 系列(本地或 API)、FLUX 系列、DALL-E 等商业 API。本地 T2I 模型需要额外安装:pip install -e ".[local]"。
Step 0:设置项目根目录,在项目目录下放一个 project_base 文件,TrustEval 会在此路径下存储元数据和评测结果。
Step 1:运行 python -m trusteval.src.download,自动从 HuggingFace 等源拉取评测数据集。
Step 2:调用 generate_responses() 生成待评测的模型输出(支持 LLM/VLM/T2I)。
Step 3:使用 contextual_variator_cli 对原始评测数据进行变体扩展,模拟不同语言、文化、领域的场景。
Step 4:调用 judge_responses() 或 judge_images() 进行打分,report_generator() 输出可视化报告。
图3:TrustEval 的典型评测案例输出
七维度全景评测:覆盖 AI Risk、伦理、公平、隐私、鲁棒、安全、真实七大维度,是目前最全面的可信度评测框架之一
多模态支持:不仅是 LLM,还支持 VLM(视觉语言)和 T2I(文生图)模型的可信度评测
上下文感知变体:通过 contextual_variator 实现跨语言、跨文化的动态评测,避免单一文化视角的偏见
学术背书:已在 ICLR 2026 和 NAACL 2025 Demo 发表,评测方法有理论支撑
开源可复现:评测数据集和评测代码均开源,便于研究者复现和扩展
图4:TrustEval 公开的模型可信度排行榜
非商业 License:项目采用 CC BY-NC 4.0,仅允许非商业用途,商业产品集成需联系作者获取授权。
依赖外部 API:核心评测依赖 OpenAI/Anthropic/Google 等商业 API,需要配置 API Key 并承担调用费用。本地模型评测需要额外配置环境。
无容器化部署:项目为纯 Python CLI 工具库,无 Dockerfile,不支持一键容器部署,需要手动配置 Python 环境。
评测耗时:完整七维度评测涉及大量 API 调用和模型推理,对大规模模型的评测可能耗时较长。
TrustEval 的出现填补了一个重要空白——在此之前,大部分大模型评测都聚焦于「能力」(Capability),而忽视了「可信度」(Trustworthiness)。随着 AI 系统越来越多地进入医疗、金融、法律、教育等高风险领域,模型的可信度与能力同等重要。
TrustEval 的动态评测框架和上下文变体设计,代表了下一代评测方法的方向:不是在一个封闭数据集上跑分,而是模拟真实部署场景,评估模型在复杂、多变、跨文化环境下的综合可信度。
图5:TrustGen 项目标识
项目信息:TrustGen/TrustEval-toolkit · 133 stars · Python
相关链接: