GroundingDINO
通过自然语言文本实现开放词汇目标检测,无需预设类别,ECCV 2024 录用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
通过自然语言文本实现开放词汇目标检测,无需预设类别,ECCV 2024 录用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。

想象这样一个场景:你打开手机摄像头,随口说出一句话——"帮我找出图片里那只黄色的猫"或"把所有穿红色衣服的人标记出来"——AI 立刻精准框出你描述的目标。这不是科幻,而是 Grounding DINO 正在做的事情。
Grounding DINO 由 IDEA-CVR(深圳市大数据研究院计算机视觉研究中心)推出,2023 年 3 月arXiv 论文公开,同年 ECCV 2024 正式收录。项目在 GitHub 迅速获得超过 10,000 颗星,成为开放词汇目标检测(Open-Vocabulary Object Detection)领域的标杆工作。
作者团队星光熠熠:第一作者 Shilong Liu 是 DINO 系列的贡献者,通讯作者 Lei Zhang 博士是 CV 领域知名学者,团队其他成员来自北大、清华、中科院等顶尖机构。能在如此短时间内完成从论文到高质量开源实现的全流程,体现了 IDEA 团队强大的工程能力。
传统目标检测需要预先定义好的类别(如 COCO 的 80 类),而 Grounding DINO 实现了"任意文本描述 -> 精准定位"的能力。

特征提取层:使用 Swin Transformer 作为视觉编码器,从图像中提取多尺度特征图;同时用 BERT/DeBERTa 作为文本编码器,将用户输入的自然语言编码为语义向量。
跨模态融合(BiPropositional Attention):这是论文最核心的创新。传统方法往往在特征提取后才做融合,而 Grounding DINO 在视觉和文本 encoder 的每一层都引入了跨模态注意力机制,让视觉特征和语言语义从一开始就"对话",极大提升了文本-图像对齐精度。
语言引导的查询初始化:传统 DETR 类检测器的 queries 是随机初始化的,Grounding DINO 根据输入文本的语义信息来初始化 object queries,让模型一开始就"知道要找什么"。
根据 Papers With Code 排行榜,Grounding DINO 在零样本目标检测(MS COCO)和开放世界检测(ODinW)两个基准上均达到 SOTA(State-of-the-Art) 水平。

在 COCO 零样本检测任务中,无需任何微调,直接用文本描述检测 80 类物体,AP 指标远超同期 GLIP 等竞品。在 ODinW(Generalized Detection across 35 domains)上同样表现优异,展现了强大的泛化能力。
方式一:Hugging Face 在线 Demo(零配置)
项目在 Hugging Face Spaces 提供了免费在线体验页面,上传图片、输入文本描述即可获得检测结果,无需安装任何依赖,适合非技术用户尝鲜。
方式二:pip 安装(推荐开发方式)
pip install groundingdino
python -m groundingdino.util.inference --help
方式三:Docker 部署(生产环境推荐)
项目提供了完整的 Dockerfile,基于 PyTorch 2.1.2 + CUDA 12.1 镜像,自动下载预训练权重,一行命令完成环境搭建:
docker build -t groundingdino .
docker run --gpus all -v $(pwd):/workspace groundingdino
智能安防:输入"骑电动车没戴头盔的人",自动从监控视频流中定位违规行为,无需为每种场景单独训练模型。
内容审核:用自然语言描述违规内容特征,快速定位图片中的违规元素,替代传统的关键词匹配+规则引擎。
医疗影像辅助:医生可以用"肺部有磨玻璃影的区域"这样的描述来定位 CT 影像中的疑似病灶,降低 AI 辅助诊断的使用门槛。

Grounding DINO 的影响力不止于检测本身。IDEA 团队基于此构建了庞大的 Grounded SAM 2 生态:

Grounded SAM 2(2024年发布):将 Grounding DINO 的开放词汇检测能力与 SAM 2 的分割能力结合,实现"输入文本 -> 检测 + 分割任意目标"的端到端 pipeline。
Grounded Editing:结合 Stable Diffusion / GLIGEN,可以做到"将检测到的对象替换成其他物体"的图像编辑效果。

推理速度:受限于 Swin Transformer backbone 和多阶段跨模态融合,1080p 图片推理约需 300-500ms(RTX 3090),实时视频流处理仍需量化或蒸馏优化。
小目标检测:当文本描述的目标在图片中占比极小时,召回率下降明显。
长文本理解:输入一段复杂的描述句时,模型对其中细节的把握不如简单短语。
英文语义偏向:尽管支持多语言 BERT,主流评测和实际使用仍以英文为主,中文场景下的指令理解存在差距。
Grounding DINO 的出现标志着目标检测从"分类标签时代"正式迈入"自然语言交互时代"。它的成功催生了一大批跟进工作,也让"用自然语言操控视觉模型"从实验室走向了工业应用。
随着多模态大模型的兴起,Grounding DINO 系列的定位正在从"独立检测器"转变为"多模态 Agent 的感知引擎"——作为视觉语言大模型在精细化定位任务上的可靠工具。
如果你在构建需要"听懂用户描述再去找目标"的 AI 应用,Grounding DINO 几乎是你目前能找到的最成熟的开源解决方案。
分析日期:2026-08-05 | 模型版本:Swin-T / Swin-B | 相关项目:Grounded SAM 2 | HuggingFace Demo