agentsocialbench
kingofspace0wzz/agentsocialbench加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象这样一个场景:你同时雇用了三个 AI 助手——一个帮你管理健康数据,一个处理财务投资,还有一个安排日程。这三个 AI 之间需要互相协调,比如帮手的理财建议需要结合你的健康状况来调整风险偏好。但问题是:它们在互相交流时,会不会不小心把你的敏感个人信息泄露给不该知道的人?
这正是 AgentSocialBench 要回答的核心问题。这是全球首个专门评估人类中心代理社交网络中隐私保护能力的基准测试,由 352 个真实场景构成,覆盖 8 个主流 LLM 后端,由 Kingofspace0wzz 团队开发,2026 年 4 月发布在 arXiv(编号 2604.01487),采用 MIT 许可证开源。
图1:AgentSocialBench 场景示例 — 展示 AI 代理在不同社会网络拓扑中的交互模式
AI 代理(Agent)正在从“单兵作战”走向“团队协作”。现代 AI 应用中,多个专业化 AI 代理组成团队,共同服务一个用户或多用户——它们互相传递信息、委托任务、协调行动。但这种协作带来了一个此前从未被系统研究过的问题:隐私边界在哪里?
当你让 AI 代理 A 向代理 B 传递“给客户做财务规划”时,A 是否会顺手把客户刚告诉你的抑郁症诊断结果也一起传递过去?代理 C 在群聊中回复时,会不会无意间透露其他用户刚才分享的薪资信息?这种“信息泄露”不是技术 bug,而是 AI 在复杂社会协作场景下对“隐私边界”理解的根本性缺陷。
现有基准测试几乎全部聚焦于单代理能力(问答、代码生成、数学推理),没有任何工具能够系统评估多代理协作中的隐私保护水平。AgentSocialBench 填补了这个空白。
AgentSocialBench 遵循 Generate → Simulate → Evaluate → Analyze 四阶段流水线:
第一阶段:场景生成(Generate) — 从用户画像(profiles)出发,由 LLM 生成符合特定类别的交互场景。比如“跨域协调”类场景会包含:一个健康助手需要和一个财务助手协调用户服务,涉及哪些敏感信息可以传递、哪些必须隐藏,都有精确定义。
第二阶段:模拟执行(Simulate) — 使用 prism.scripts.simulate 运行场景。每个代理由一个 LLM 后端驱动,模拟其在特定隐私指令级别下的行为。系统支持 OpenAI GPT 系列、Google Gemini、AWS Bedrock(Claude)和 Together AI 等多个后端,可对比不同模型在相同场景下的隐私表现。
第三阶段:评估(Evaluate) — 评估模块是项目的技术核心,包含三个子维度:
隐私泄露评估(Privacy):通过 LLM 裁判(另一轮 LLM 调用)判断模拟对话中是否存在敏感信息泄露,计算 CDLR(跨域泄露率)、MLR(中介泄露率)、CULR(跨用户泄露率)等指标。隐私评估还区分了 6 种泄露类型——CD(跨域协调)、MC(中介通信)、CU(跨用户交互)、GC(群聊)、HS(枢纽辐射)、CM(竞争博弈)。
信息抽象评估(Abstraction):评估代理在需要隐藏信息时是否学会了正确的抽象方式(如用“医疗状况”代替具体病名)。
任务完成质量(Task Completion):在保护隐私的前提下,代理是否仍然完成了协作任务,而非为了“绝对安全”而拒绝一切信息交流。
第四阶段:分析(Analyze) — 使用 prism.analysis.generate_all 生成统计表格和可视化图表(热力图、散点图等),支持横向对比不同 LLM 后端在不同类别场景下的隐私-任务平衡表现。
| 类别 | 代码 | 场景数 | 典型场景 |
|---|---|---|---|
| 跨域协调 | CD | 100 | 健康助手与财务助手协调用户服务 |
| 中介通信 | MC | 100 | AI 代理作为人与人之间的沟通桥梁 |
| 跨用户交互 | CU | 50 | 不同用户的 AI 代理通过 A2A 协议交互 |
| 群聊 | GC | 28 | 3-6 个用户的代理在同一群组中协作 |
| 枢纽辐射 | HS | 23 | 协调者代理汇聚多个参与者信息 |
| 竞争博弈 | CM | 23 | 代理在资源竞争中施压导致泄露 |
| 亲疏调节 | AM | 28 | 关系亲疏影响信息披露边界 |
值得注意的是,亲疏调节(AM)场景中的隐私合规率接近 100%——AI 对“熟人圈”和“陌生人”有直觉上的边界感。但竞争场景(CM)则相反,代理在压力下更容易冲动泄露信息。
1. 跨域协调是最大的隐私杀手
数据显示,跨域协调(CD)的隐私泄露率(CDLR 约 0.40-0.67)是所有场景中最高的,比中介通信和跨用户交互高出 2-3 倍。原因很直观:当代理需要跨越“领域边界”(健康到财务)传递信息时,AI 会把这种“协作需要”误读为“信息共享授权”,从而放松对敏感信息的保护意识。
2. 多方场景不一定会放大隐私风险
直觉上以为“参与方越多,泄露风险越高”,但实际数据颠覆了这一假设。群聊(GC)的泄露率与双方中介通信(MC)相当,竞争博弈(CM)中压力反而压制了自我披露(代理选择沉默而非冒险泄露)。这说明隐私风险更多取决于场景拓扑结构而非参与人数。
3. 隐私指令悖论(Abstraction Paradox)
最令人意外的发现:当隐私指令教会 AI“如何抽象敏感信息”(比如用“医疗状况”代替“抑郁症”)时,AI 反而讨论这些信息更多了。原因是:学会了“合规词汇”后,AI 觉得使用这些词汇就是“安全的”,于是更频繁地提及它们——表面上是合规的,实际上敏感信息的存在感反而更强了。这给隐私指令设计敲响了警钟。
AgentSocialBench 基于 MAGPIE 框架构建,在其基础上扩展了多代理隐私评估能力。项目采用模块化架构,核心代码组织在 prism/ 包下:
prism/core/ — 核心抽象层:llm.py 统一封装了 OpenAI、Google GenAI、Together AI、AWS Bedrock 四大后端的 LLM 调用接口;env.py 管理 API Key 加载;conversation.py 维护对话日志结构。
prism/simulation/ — 模拟引擎:agents.py 定义了 SocialAgent 数据类,每个代理持有领域标识(health/finance/social等)、用户画像切片和完整上下文;protocols.py 实现 A2A(Agent-to-Agent)通信协议;social_graph.py 构建社会关系图谱。
prism/evaluation/ — 评估模块:隐私评估(privacy.py)、抽象能力评估(abstraction.py)、任务完成质量(task_completion.py)和行为评估(behavioral.py)各自独立,均采用 LLM-as-Judge 模式,通过另一轮 LLM 调用评判模拟结果。
prism/generation/ — 生成模块:scenarios.py 和 profiles.py 负责从 LLM 生成场景和用户画像,attribute_pools.py 提供敏感属性(疾病、薪资、地址等)的标准化模板池。
prism/analysis/ — 分析模块:包含 10+ 个可视化脚本(热力图、柱状图、散点图等),使用 Matplotlib 生成论文级图表。
技术栈方面,项目纯 Python 实现,依赖 openai>=1.0.0(非必选,API 调用时按需加载)、google-genai>=1.0.0、boto3>=1.34.0(AWS Bedrock)、pyyaml>=6.0 和 pytest>=8.0。无 Docker 支持,部署依赖手动配置 API Key。
AgentSocialBench 是一个纯命令行工具,没有 Web UI。需要:
.env.example 到 .env,填入 OpenAI/Gemini/AWS Bedrock 等 API Keypip install -r requirements.txt 安装依赖python -m prism.scripts.generate 生成场景,或直接运行 python -m prism.scripts.simulate 执行现成场景样本python -m prism.scripts.evaluate 评估结果,最后用 python -m prism.analysis.generate_all 汇总分析部署难点主要在于 API Key 配置。由于需要同时测试多个 LLM 后端(OpenAI、Gemini、AWS Bedrock),需要分别获取和配置各平台的凭证,配置过程对非 AI 研究者有一定门槛。
首先,API 成本不可忽视。完整运行 352 个场景 × 8 个 LLM 后端 × 3 个隐私级别 = 8448 次模拟,每次模拟又需要额外的 LLM 调用做评估(按模型计费),实际成本相当可观,普通研究者难以负担。
其次,评估依赖 LLM-as-Judge 本身存在偏差。用 LLM 来判断“AI 是否泄露隐私”,本质上是用一个 AI 评估另一个 AI,这种元评估的可靠性本身值得审视——GPT-5 在评估 Claude 时是否存在系统性偏差,目前尚无定论。
第三,场景真实性有待现实检验。当前场景由 LLM 生成再由 LLM 评判,两端都依赖同一类模型,生成-评估闭环可能导致结果过度拟合于当前主流 LLM 的行为模式,与真实用户实际使用场景存在差距。
不过,这些局限并不妨碍 AgentSocialBench 的核心价值:它第一次系统性地提出了“多代理协作中的隐私保护”这个议题,并提供了量化评估工具。随着 AI 代理从实验室走向现实应用(医疗、金融、法律等高敏感领域),这类基准测试的重要性只会越来越高。
从趋势看,AI 代理正在加速进入高敏感领域:医疗 AI 助手协调患者护理、金融 AI 管理投资组合、法律 AI 辅助案例研究。在这些场景中,AI 之间的信息交换如果缺乏隐私保护机制,后果远比单纯的“答非所问”严重得多。AgentSocialBench 的出现,标志着 AI 安全评估从“单代理能力”扩展到“多代理社会性安全”的新阶段。
同时,其发现的“隐私指令悖论”对整个行业有重要警示:精心设计的隐私规则如果只教“how”而不约束“when”,反而可能帮倒忙。未来的隐私指令设计需要更精细的场景化考量,而非简单的规则列表。
作为开发者,如果你正在构建多代理 AI 系统,AgentSocialBench 提供了在部署前系统性检验隐私风险的能力。对于 AI 研究者,它打开了一个全新的基准测试方向——多代理社会性安全评估,预计未来会有大量跟进工作。