rf-detr
基于 DINOv2 视觉 Transformer 的实时目标检测与实例分割模型,COCO SOTA,支持 pip 一键安装
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
基于 DINOv2 视觉 Transformer 的实时目标检测与实例分割模型,COCO SOTA,支持 pip 一键安装
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
在工厂流水线的缺陷检测场景中,传统的目标检测模型往往面临一个两难困境:追求精度就要牺牲速度,追求速度就要牺牲精度。然而,Roboflow 团队在 2025 年底发布的 RF-DETR(Real-Time DETR)打破了这一困局——它不仅在 Microsoft COCO 数据集上取得了实时检测的 SOTA(State-of-the-Art)成绩,更是在 2026 年被 ICLR 大会接收,标志着学术界对其实用价值的认可。

图1:Roboflow 团队 logo — 计算机视觉领域的知名开源力量
DETR(DEtection TRansformer)自 2020 年由 Facebook AI Research 提出后,以其端到端、无需 NMS 后处理的创新架构震惊了计算机视觉圈。但原始 DETR 存在收敛慢、实时性差的问题,后续改进方案(Deformable DETR、DINO 等)虽然在精度上持续突破,却始终未能完美兼顾速度。
Roboflow 作为计算机视觉领域的知名开源力量(拥有超过 10 万开发者用户的平台),敏锐地捕捉到了这一痛点。团队于 2025 年 11 月发布 RF-DETR,基于 DINOv2 视觉 Transformer 主干网络,重新设计了检测头和训练流程,在 COCO 数据集上实现了 精度与速度的最佳 trade-off。据官方博客报道,RF-DETR-Large 在 NVIDIA T4 GPU 上的推理速度达到 124 FPS,同时 mAP 达到 54.3——这一成绩超越了 YOLOv10、RT-DETR 等主流实时检测器。
RF-DETR 并不是一个单一的推理工具,而是一套完整的视觉感知解决方案。
目标检测是其最基础的能力。RF-DETR 支持 Nano、Small、Medium、Large、2XLarge 等多个规模的模型权重,从移动端轻量部署到服务器端高精度推理均有覆盖。用户只需几行代码即可完成图片输入到检测结果输出的全流程:
from rfdetr import image2detections
import supervision as sv
detections = image2detections("image.jpg", conf=0.5)
box_annotator = sv.BoxAnnotator()
annotated = box_annotator.annotate("image.jpg", detections=detections)
实例分割是 RF-DETR 的另一核心能力。通过在检测头上叠加分割分支,同一模型同时输出目标边界框和像素级掩码(Mask),避免了传统"检测+分割"两阶段 pipeline 的效率损失。分割结果以标准的 Detections 对象返回,与 supervision 库无缝衔接,开发者无需关心底层实现细节。
模型微调是 RF-DETR 区别于大多数开源检测器的核心亮点。项目提供了完整的训练框架,支持基于自有数据集的快速微调。借助 LoRA(Low-Rank Adaptation)技术,即使没有 A100 级别的算力,普通开发者也能在消费级 GPU 上完成模型定制。训练流程与 PyTorch Lightning 深度集成,支持 TensorBoard、WandB、MLflow 等主流训练日志工具,极大降低了从实验到生产的门槛。
从源码结构来看,RF-DETR 的工程化水平相当成熟。项目采用 src/rfdetr/ 下的模块化组织:
rfdetr.roboflow.com 在线推理)依赖管理方面,项目使用 pyproject.toml 规范 Python 包,核心依赖包括:
torch >= 2.2.0 + torchvision:PyTorch 生态transformers >= 5.1.0:DINOv2 预训练权重加载supervision:业界标准的检测结果可视化库pydantic >= 2.0:配置验证可选依赖则覆盖了训练(PyTorch Lightning、Albumentations)、部署(ONNX、TensorRT、TFLite)、增强(Kornia)、日志(TensorBoard、WandB、MLflow)等完整工具链。
安装 RF-DETR 只需一行命令:
pip install rfdetr
Python 3.10+ 环境即可运行,自动从 HuggingFace Hub 下载预训练权重。官方还提供了 Google Colab 笔记本,开发者无需配置本地环境即可体验完整功能。对于追求更高灵活性的用户,也可以从 GitHub 安装开发分支:
pip install https://github.com/roboflow/rf-detr/archive/refs/heads/develop.zip
不过需要注意的是,项目不提供 Docker 容器化部署,GPU(CUDA)环境需要手动配置。对于没有 NVIDIA 显卡的用户,官方提供了基于 Gradio 的 HuggingFace Space 在线演示,可以在浏览器中直接体验模型推理。
尽管 RF-DETR 在精度和速度上表现出色,但仍有一些局限值得坦诚面对:
GPU 显存要求较高。Large 及以上模型需要 8GB+ VRAM,2XLarge 模型更是需要 16GB+,这对个人开发者和中小团队来说是一道不低的门槛。
模型权重许可分层。基础模型(rfdetr 包)采用 Apache 2.0 开源许可,但 Plus 组件(rfdetr_plus,包含 XLarge/2XLarge 高精度模型)采用 Roboflow 自有的 PML(Private Model License)许可,意味着商业使用需要额外授权。
非 GPU 环境性能受限。在没有 CUDA 加速的情况下,推理速度会大幅下降,无法发挥实时检测的优势。
RF-DETR 的出现标志着实时目标检测领域正式进入了"精度不妥协"的时代。在工业质检、医疗影像、自动驾驶等对精度要求严苛的场景中,开发者不再需要被迫在速度和精度之间做出痛苦的选择。
从更宏观的视角看,RF-DETR 代表着开源计算机视觉从单点工具向平台生态演进的趋势。Roboflow 通过将模型训练、数据管理、在线部署整合为一体,让 AI 开发者能够在统一的工作流中完成从数据到模型到产品的全链路开发——这才是 RF-DETR 真正的价值所在。
Tags: 目标检测 | 实例分割 | DINOv2 | Transformer | Roboflow | ICLR 2026