watermarks-remover
Strip AI watermarks (Claude/GPT/Gemini text + C2PA metadata) from content you own — privacy-first, open-source.
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
Strip AI watermarks (Claude/GPT/Gemini text + C2PA metadata) from content you own — privacy-first, open-source.
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
2026 年 8 月 2 日,欧洲《AI 法案》正式生效的一项条款改变了所有 AI 用户的内容命运:从这一天起,Claude、ChatGPT、Gemini 等主流大模型在生成内容时,会自动嵌入不可见的数字水印——一种可以追溯内容来源的机器可读签名。
你写的每一行代码、每一篇文案、每一张图片,都可能携带模型厂商的"指纹"。更关键的是:没有任何退出选项,API 用户也无法豁免。
九天后,一位名叫 Guillaume Meyer 的独立开发者开源了一个名为 watermarks-remover 的项目,彻底反击这一机制。根据 GitHub API 的实时数据,该项目在上线 7 天内就斩获了 14,000 颗星——作为对比,Google DeepMind 官方发布的 SynthID 参考实现(这一水印技术的发明者),历时近两年仅积累了约 1,000 颗星。
发明水印的工具获得了 1,000 颗星。抹除水印的工具,7 天内拿到了 14,000 颗星。
这个项目不是为"逃避 AI 检测"而生的。它的核心定位是 "Privacy First"(隐私优先):帮助你清除自己创作内容上附带的 AI 痕迹,确保这些内容在流通时不会因为"AI 生成"标签而受到区别对待。
典型场景:
watermarks-remover 采用了精心设计的分层处理策略,将"去除 AI 水印"这一任务分解为三个独立层次:
这是整个工具链中最轻量的部分,处理的是 AI 在文本中植入的字符级水印,包括:
这些字符对人类读者完全不可见,但能被统计检测器捕获。inspect_text.py 负责发现它们,clean_text.py 负责清除它们。核心脚本仅依赖 Python 标准库,不需要任何 pip 包。
字符级清洗之后,AI 模型还在更深的统计层面嵌入了指纹——不是特定字符,而是词频、句子结构、词汇选择的整体分布模式。这是 SynthID-Text 这类统计水印的核心原理。
Layer B 通过引入另一个"干净"的大语言模型(如 Ollama 本地模型、OpenAI API 等)生成多轮重写,替换同义词并微调句式,让文本的统计特征脱离原有模型的分布范围。
ETH Zurich 的研究团队曾测试该方法,报告称可去除约 90% 的文本水印检测信号。需要注意的是:这并非百分之百保证,因为 Anthropic 官方检测器的具体实现尚未公开。
AI 模型在生成图片、PDF、DOCX、SVG 等富媒体文件时,会附加 C2PA(Coalition for Content Provenance and Authenticity)元数据——这是一种经过数字签名的内容溯源标准,记录了"此文件由哪个模型于何时生成"。
watermarks-remover 通过集成 c2patool、ExifTool、qpdf 等工具,完整剥离以下格式的 C2PA/元数据:
对于图像领域更棘手的问题——如 SynthID-Image、StegaStamp、Tree-Ring、StableSignature 等像素级嵌入水印,工具提供了两个可选的后端:
mertizci/noai-watermark 实现这两个模块需要 GPU,算力消耗大,仅在 heavy profile 中提供。
watermarks-remover 还提供了一组 Claude Code Skill,可以直接在 AI 助手中调用:
/watermarks-remover:remove-ai-marks
/watermarks-remover:clean-user-facing-text
用户只需将仓库中的 skills 目录安装到 Claude Code 的 skills 路径,即可在对话中随时触发完整的水印清洗流程。Skill 支持 Cursor、Grok 等多个 Agent 平台。
项目提供了两条部署路径:
路径一:Docker Compose 一键启动(推荐)
git clone https://github.com/guillaumemeyer/watermarks-remover
cd watermarks-remover
docker compose up --build -d
核心服务启动后监听 http://127.0.0.1:8765,提供完整的 REST API 和 OpenAPI 3.0.3 文档。默认无需 API Key,可通过环境变量设置认证。
路径二:本地 Python 脚本直跑
# 仅清洗文本(纯 stdlib,无需任何依赖)
python3 service/scripts/clean_text.py input.txt -o output.txt
# 清洗文件(需要 c2patool/exiftool/qpdf)
python3 service/scripts/clean_file.py document.pdf -o document.clean.pdf
Docker 镜像在安全方面下了不少功夫:
--read-only)| 组件 | 要求 |
|---|---|
| Python | 3.10+(核心脚本仅需 stdlib) |
| Docker | Docker & Docker Compose |
| ffmpeg | 可选(音视频处理) |
| c2patool | 可选(C2PA 元数据) |
| exiftool | 可选(图片元数据) |
| qpdf | 可选(PDF 处理) |
虽然这个项目因"对抗 Claude 水印"而出名,但它实际上支持 所有主流 AI 厂商的水印检测和去除:
| 厂商 | 文本水印 | C2PA/元数据 | 像素水印 |
|---|---|---|---|
| Claude (Anthropic) | ✅ Layer A + B | ✅ | 需 CtrlRegen/MarkDiffusion |
| ChatGPT (OpenAI) | ✅ Layer A + B | ✅ | 需 CtrlRegen/MarkDiffusion |
| Gemini (Google) | ✅ Layer A + B (含 SynthID-class) | ✅ | 需 CtrlRegen/MarkDiffusion |
| 本地开源模型 | ✅ Layer A + B | ✅ | 不适用 |
这个项目不可避免地引发了广泛争议。
来自 AI 厂商的质疑:Anthropic 等公司认为,AI 水印是一种内容溯源机制,有助于打击虚假信息、明确 AI 生成内容的边界。去除水印可能削弱这一机制的价值。
去水印有效性的不确定性:由于 Anthropic 的检测器具体实现从未公开,目前的去水印效果(如 ETH Zurich 的 90% 数据)仅基于推测,并非官方验证。无法保证对未来的检测算法同样有效。
版权与法律灰色地带:在某些司法管辖区,去除版权管理信息(RMPI,如 C2PA)可能涉及法律问题。项目 README 明确声明适用于"你拥有的内容"。
watermarks-remover 的爆发式增长揭示了一个深层的产业矛盾:AI 厂商希望通过水印建立内容溯源体系,但用户社区用开源的速度回应了这场技术博弈。
截至分析时,该项目已获得接近 20,000 颗星,成为 2026 年增长最快的开源工具之一。它的存在本身说明了一个现实:在开源生态面前,任何单一厂商的技术护城河都面临被快速跨越的可能。
对于 AI 爱好者而言,理解水印技术的原理和局限,是在这个 AI 生成内容爆炸时代保持主动权的关键。对于开发者而言,watermarks-remover 的代码结构(Layer 分离、Skill 架构、安全加固设计)本身就是一份高质量的参考实现。