Scam-AI-Multi-modal-Evaluation-System
跨文本/图像/音频/视频四模态的AI诈骗内容检测框架,通过交叉验证和来源追溯识破Deepfake组合欺诈
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
跨文本/图像/音频/视频四模态的AI诈骗内容检测框架,通过交叉验证和来源追溯识破Deepfake组合欺诈
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2024年,一段"某知名企业家视频通话"在社交媒体疯传。画面里的人物声音、表情、唇形几乎与真人无异,交谈中甚至准确提及了对方的家庭细节。数小时后,受害者向"企业家"转账 200 万元。事后查明,这段视频由一款开源 AI 工具在 10 分钟内生成,全程未使用任何专业设备。
这不是电影情节。这是 Deepfake 诈骗正在真实发生的缩影。传统单一维度的检测手段——比如只查文字有没有 AI 写作痕迹——在多模态攻击面前几乎失效。当骗子同时伪造文本、声音、视频和人脸时,单点检测如同盲人摸象。
正是在这样的背景下,一个名为 Scam-AI-Multi-modal-Evaluation-System 的开源项目悄然获得了 1000 颗 GitHub 星标。该项目来自独立开发者 siyuanchen0214,其核心理念是:真正的 AI 诈骗从来不是单一模态的,我们需要从文本、图像、音频、视频四个维度同时出手,通过交叉验证发现不一致之处,最终识破整个伪造链条。
图1:项目作者 GitHub 头像
Scam-AI-Multi-modal-Evaluation-System 的诞生,折射出 AI 生成内容(AIGC)滥用的严峻现实。2023 年至 2024 年间,基于生成式 AI 的诈骗案件在全球范围内急剧增长。仅 2024 年上半年,中国境内就查处了多起利用 AI 换脸视频冒充领导诈骗的案件,单笔涉案金额最高超过 500 万元。
这些案件的共同特点是:骗子不再满足于"写一封钓鱼邮件",而是构建完整的虚假叙事——一张看似真实的新闻图片 + 一段克隆的声音 + 一段换脸视频,三位一体,环环相扣。传统的邮件安全网关或单一检测工具根本无法应对。
项目作者 siyuanchen0214 在项目 README 中写道,该系统的设计目标是"通过逆向工程框架和持续学习机制,对抗不断进化的生成模式"。这意味着系统不仅要检测已知类型的 AI 伪造内容,还要具备自我进化的能力,去捕捉未来可能出现的新型攻击。
系统架构围绕六大模块展开,每个模块各司其职,协同工作:
1. 多模态检测器(MultiModalDetector)
这是整个系统的核心入口。它同时调用四个独立的检测器:
all-MiniLM-L6-v2)进行语义嵌入比对,能发现纯关键词检测无法识别的隐性 AI 写作特征。2. 跨模态一致性分析(CrossModalAnalyzer)
这是该项目最具差异化的设计思路。当用户同时提交了文本描述和对应的视频时,系统会提取文本的语义向量和视频帧的视觉特征向量,通过余弦相似度计算两者的一致性。如果视频中的人物声称"我上周在巴黎",但视频背景的植被特征显示为热带气候,系统会标记为可疑。
CrossModalAnalyzer 依赖 sentence-transformers 的 all-MiniLM-L6-v2 模型计算语义相似度,默认阈值设为 0.7。低于该值的跨模态组合会被标记为潜在伪造。
3. 来源追溯(ProvenanceTracer)
通过哈希算法为内容生成唯一指纹,并追踪内容的修改历史。该模块还负责检测元数据中的时间戳不一致问题——比如一张声称"2020年拍摄"的照片,其 EXIF 元数据却显示拍摄设备型号是 2023 年才发布的机型。
4. 模式逆向分析(PatternAnalyzer)
这是系统的"黑匣子解析"模块。它内置了已知生成模型的特征指纹库,当前覆盖:
5. 动态评估引擎(AlertEngine)
这是一个规则引擎,支持五级告警:EMERGENCY(紧急)、URGENT(紧急)、WARNING(警告)、NOTICE(注意)、INFO(信息)。系统根据检测信号的数量和严重程度自动决定触发哪一级告警,并支持自定义告警规则。
6. 持续学习模块(ContinuousLearner)
系统内置增量学习能力。随着新的生成模型和攻击手法出现,ContinuousLearner 接收新的训练样本后自动更新内部模型权重,无需完全重训即可适应新型攻击。
从代码结构来看,该项目采用了清晰的模块化分层设计:
src/
├── core/ # 核心编排层(detector.py, pipeline.py, cross_modal_analyzer.py)
├── modalities/ # 模态检测层(text/image/audio/video detector)
├── tracing/ # 来源追溯层(provenance_tracer.py)
├── reverse_engineering/ # 模式分析层(pattern_analyzer.py)
├── evaluation/ # 评估告警层(alert_engine, severity_classifier, signal_combinator)
└── learning/ # 持续学习层(continuous_learner.py)
项目使用 Python 3.9+,主要依赖:
项目通过 config/detector.yaml 集中管理所有检测阈值、模型路径和告警规则,提供了良好的可配置性。日志系统基于 loguru,支持日志轮转和分级输出。
CLI 入口 main.py 支持通过命令行参数指定任意模态组合:
python main.py --text "text.txt" --image "img.jpg" --audio "voice.wav" --video "clip.mp4"
Python API 同样简洁:
from src.core import MultiModalDetector
detector = MultiModalDetector()
result = detector.detect(text="内容", image="路径", audio="路径", video="路径")
该项目本质上是一个 Python CLI 工具包,没有提供 Web UI 界面,也没有 Docker 容器化支持。安装流程非常直接:
git clone 克隆仓库pip install -r requirements.txt 安装依赖(requirements.txt 中包含大量重型依赖:PyTorch、TensorFlow、OpenCV 等,总体积约 5-8 GB)config/.env 配置文件硬件要求方面,由于涉及多模态深度学习推理(图像/音频/视频),GPU 是强烈推荐的。项目依赖 PyTorch 和 sentence-transformers 的 CPU 推理虽然技术上可行,但速度会非常慢。文档建议使用 NVIDIA GPU(RTX 3090 或更高)并配合 CUDA 11.8+ 环境。内存建议 16GB+,磁盘空间 10GB+(包含依赖和模型权重)。
部署难度评级为"简单",因为全流程通过 pip 安装,无额外编译步骤。但 GPU 环境配置本身对非专业用户有一定门槛。
必须坦诚地说,这个项目存在几个值得关注的局限性:
第一,模型权重未开源。 代码中所有检测器(TextDetector、ImageDetector、AudioDetector、VideoDetector)的核心模型加载逻辑均为占位符实现(placeholder)。虽然 pattern_analyzer.py 完整定义了各类生成模型的特征规则库,但实际的分类/检测模型并未随代码一同发布,用户克隆仓库后需要自行训练或接入第三方模型。这意味着"开箱即用"的可用性受限。
第二,7 个月未更新。 该仓库目前仅有 2 次 commit,最后一次提交为 7 个月前("Multi-modal variables update")。对于一个需要持续跟进新型生成模型的对抗性工具来说,长时间不更新意味着特征规则库可能已过时,无法识别最新版本的 GPT-4o、Midjourney v6、Sora 等新型生成内容。
第三,测试覆盖率存疑。 tests/ 目录中仅有 test_detector.py 一个文件,且 README 中未提及详细的测试流程。考虑到这是一个安全类工具,测试覆盖不足是潜在隐患。
第四,MIT 许可证与安全责任。 MIT 许可证明确免责声明:该软件按"原样"提供,不提供任何明示或暗示的保证。将其直接用于生产环境前,强烈建议进行充分的本地评估和压力测试。
Scam-AI-Multi-modal-Evaluation-System 代表的,是 AI 安全领域一个更大的趋势——对抗性工具链(Adversarial Toolchain)的兴起。当生成式 AI 的能力呈指数增长时,检测与生成之间形成了一场军备竞赛。全球范围内,无论是学术界(斯坦福 HAUS 挑战赛、Google Deepfake Detection Challenge)还是企业界(微软 Video Authenticator、Adobe Content Credentials),都在投入资源建设检测能力。
该项目在 GitHub 上获得的 1000 颗星标说明:除了大厂和政府机构,民间安全研究者、独立开发者乃至普通用户,对多模态内容鉴伪工具存在强烈需求。它以 MIT 许可证开放代码,降低了安全研究的门槛——任何人都可以下载代码、理解检测逻辑、自行扩展。
从技术演进角度看,该项目最有价值的设计思路是跨模态一致性检测(Cross-Modal Consistency)。传统的 Deepfake 检测往往聚焦于单一模态(只检测视频),而真实的诈骗场景中,骗子会同时伪造多个模态以增强可信度。跨模态检测能发现单模态检测无法发现的"组合欺诈",这是该项目的核心差异化价值。
总结: Scam-AI-Multi-modal-Evaluation-System 是一个架构清晰、功能设计完整的 AI 多模态诈骗检测框架。其跨模态一致性分析思路在当前安全工具中具有创新性。但由于核心检测模型未随代码发布、长期未更新等因素,其实用性仍有一定局限。对于安全研究者和开发者而言,这是一个值得研究代码架构和检测思路的优秀参考项目;对于普通用户,建议等待项目完成模型权重的正式发布后再投入生产使用。