chatgpt-comparison-detection
首个中英双语AI文本检测开源方案,通过对比语料库训练RoBERTa分类器,可识别文本是否由ChatG
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
首个中英双语AI文本检测开源方案,通过对比语料库训练RoBERTa分类器,可识别文本是否由ChatG
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2022年11月,ChatGPT横空出世。仅两个月后,互联网上就开始出现大量由AI生成的新闻报道、学生论文、技术文章——没有人能分辨它们的来源。学术界和教育界陷入恐慌:如何证明一篇文字是真人写的?
正是在这一背景下,Hello-SimpleAI团队(来自清华大学等机构的研究者)于2022年12月9日正式启动了HC3(Human ChatGPT Comparison Corpus)项目,并在2023年1月发布了全球首个系统性AI文本检测开源解决方案。论文"How Close is ChatGPT to Human Experts? Comparison Corpus, Evaluation, and Detection"迅速成为AI文本检测领域的引用标杆。
HC3是目前最具权威性的中英双语人机文本对比语料库,其设计思路堪称教科书级别。
数据集包含超过5000组精心配对的"人类回答 vs ChatGPT回答",覆盖六大领域:
| 领域 | 英文来源 | 中文来源 | 核心挑战 |
|---|---|---|---|
| 开放式问答 | Reddit ELI5、WikiQA | 百度百科、WebTextQA | 长答案风格差异 |
| 医学问答 | Medical Dialog | 中文医疗对话 | 专业术语准确性 |
| 金融问答 | FiQA | FinanceZhidao | 数值与术语处理 |
| 法律问答 | LegalQA | NLPCC-DBQA | 条款引用规范 |
| 心理学 | 心理学公开数据集 | 百度AI Studio | 表达方式差异 |
| 维基百科 | Wikipedia | 百度百科 | 事实性vs流畅性 |
每个问答对都由同一问题分别提交给人类和ChatGPT,产生天然对齐的比较数据。这种"同一问题不同来源"的配对设计,比随意采集的正负样本更有说服力——它直接对比了同场景下两者的表达差异。
数据集还标注了"指示词"(Indicating Words):人类倾向于使用"我认为""根据我的经验"等第一人称表达,而ChatGPT更依赖"根据分析""从技术角度看"等套路化开头。这些词汇分布差异成为后续检测器的核心特征之一。
项目提供了三种互补的检测方案,分别针对不同应用场景:
1. QA版检测器(chatgpt-qa-detector-roberta) 这是最精准的检测器,需要同时提供"问题"和"回答"两个输入。它利用RoBERTa-base架构,学习同一问题下人类和ChatGPT答案的差异模式。由于有问题的语境约束,模型能捕捉到ChatGPT特有的"万金油式"回答风格——过于全面、过于中庸、缺少个人经验。这种方式在实验中F1达到0.85以上。
2. 独立文本检测器(chatgpt-detector-roberta) 适用于无法获得原始问题的场景,如检测一段匿名文章或社交媒体帖子。模型通过纯文本特征进行判断,精度略低于QA版,但在速度和便利性上优势明显。部署方式为HuggingFace Spaces在线演示,地址:https://huggingface.co/spaces/Hello-SimpleAI/chatgpt-detector-single
3. 语言学特征检测器(chatgpt-detector-ling) 这是最轻量的方案,完全基于手工设计的语言学特征:词汇多样性、句子长度方差、连接词使用频率、标点模式等。不依赖深度学习模型,可在CPU上毫秒级运行。虽然准确率不如神经网络版本,但胜在可解释性强——用户可以精确看到"你的文本在词汇丰富度这一项上与ChatGPT相似度为78%"。
三种检测器均提供中文版本,基于hfl/chinese-roberta-wwm-ext预训练模型,对中文文本的检测效果与英文相当。
项目代码采用标准的深度学习NLP开发框架,主要依赖:
训练流程高度自动化:
# 单文本检测器训练
python detect/dl_train.py -i zh/mix -m hfl/chinese-roberta-wwm-ext -b 16 -e 2
# QA检测器训练(需提供问答对)
python detect/dl_train.py -i zh/mix --pair -m hfl/chinese-roberta-wwm-ext -b 16
训练脚本接受自定义参数:--batch-size、--epochs、--max-length(默认512)、--cuda指定GPU编号。数据格式为CSV,包含text(或question+answer)和label列,label=1表示ChatGPT生成,label=0表示人类撰写。
对于医学、金融等专业领域,团队还提供了领域适配版本,只需在对应领域的HC3子集上微调即可。实验表明,领域适配后的检测器准确率比通用模型提升约12%。
对于普通用户,有两种体验路径:
快速体验(推荐):直接访问HuggingFace Spaces在线演示,无需任何安装。选择对应的检测器版本,输入文本即可获得检测结果。QA版需要同时输入"原始问题";单文本版只需输入待检测段落。检测结果会显示"人类撰写概率"和"ChatGPT生成概率"的对比条形图。
本地部署:克隆仓库后,安装依赖:
pip install datasets evaluate scikit-learn torch transformers
下载Google Drive上的数据集压缩包,解压到hc3/目录,运行训练或推理脚本。GPU强烈推荐——CPU训练一个epoch可能需要数小时。
项目团队诚实地公开了检测器的局限性:
1. 迭代逃避问题:ChatGPT每更新一次版本,检测器准确率就会下降约8-15%。因为新版ChatGPT学会了模仿人类的写作风格,"AI指纹"不再稳定。HC3的解决思路是持续收集新数据,但本质上这是猫鼠游戏的无限循环。
2. 短文本检测效果差:少于50词的文本几乎无法准确判断,因为AI和人类在短文本上的差异信号太少。
3. 翻译绕过的可能性:将中文文本先翻译成英文、再用ChatGPT改写,可以有效欺骗现有检测器。混合语言场景下的检测仍是开放问题。
4. 刻意伪装:用户可以让ChatGPT"故意写得不像ChatGPT",如减少连接词、使用更多口语化表达。这种对抗性绕过目前没有好的防御手段。
尽管如此,HC3项目在AI治理领域的意义远超技术本身。它建立了一个持续更新的评估基准,让整个社区能够系统性地跟踪AI生成内容检测技术的进展。
HC3项目的价值不仅在于技术本身,更在于它代表了一种数据驱动的AI治理思路:
截至目前,该论文在arXiv上的引用量已超过3000次,成为AI检测领域的基础参考文献。它的出现标志着"AI生成内容检测"从零散的工具开发,走向了系统性的科学研究。