cvat
开源计算机视觉标注平台,支持图像、视频、3D点云标注,内置AI辅助标注和团队协作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
开源计算机视觉标注平台,支持图像、视频、3D点云标注,内置AI辅助标注和团队协作
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下,你需要训练一个自动驾驶系统,让它能够识别行人、车辆和交通标志。在模型"学会"之前,必须用数以万计的标注图片来训练它——每张图片里,哪里是人、哪里是车、哪里是标志,都需要一一标出。传统做法是外包团队手动标注,成本高昂、效率低下、沟通成本巨大。
CVAT(Computer Vision Annotation Tool) 正是为解决这一痛点而生的开源标注平台。它让数据科学家和算法工程师能够自主、高效地为图片、视频、3D 点云创建高质量的标注数据,成为视觉 AI 训练数据准备的行业标杆。
CVAT 最初由 Intel 的研究人员于 2018 年开发,初衷是解决内部计算机视觉研究中的数据标注需求。项目开源后迅速获得社区认可,逐步演变为 CVAT.ai 公司,并衍生出 CVAT Online(托管 SaaS)和 CVAT Enterprise(企业版)两条商业产品线。开源社区版(CVAT Community)采用 MIT 许可证,允许任何个人或组织免费使用、修改和分发。
目前 CVAT 已成为全球视觉 AI 团队构建训练数据集的事实标准,GitHub Stars 超过 15,000,Docker 镜像累计下载量达数千万次,覆盖从学术研究到工业落地的广泛场景。
多模态标注支持: CVAT 支持图片、视频、3D 点云三种数据格式的标注。支持的标注类型包括:边界框(Bounding Box)、多边形(Polygon)、像素级语义分割(Mask)、关键点(Keypoints)、立方体(Cuboid)、线条、椭圆、标签等,几乎涵盖了计算机视觉领域所有主流的标注需求。
AI 辅助标注(Auto-labeling): 这是 CVAT 区别于其他开源标注工具的核心竞争力。CVAT 支持接入用户自建的机器学习模型,在标注界面中自动生成标注建议。标注员可以在 AI 建议的基础上做修正,而不是从零开始手动绘制,大幅降低标注工作量。内置支持与 Nuclio serverless 框架集成,可以部署 SAM(Segment Anything)、DETR 等主流模型作为自动标注后端。
团队协作与质量控制: CVAT 内置完整的多用户协作体系,支持创建组织、分配角色(管理员、标注员、审核员)、指派任务、评论反馈。项目级别的工作流管理让大型数据集的标注任务可以被分解、并行、追踪。针对标注质量问题,平台提供了 Ground Truth 检查、Honeypot 抽查和标注员间一致性(Inter-rater Reliability)分析工具。
数据导入导出: CVAT 支持 20+ 主流数据集格式的导入导出,包括 COCO(目标检测/分割)、YOLO(目标检测)、Pascal VOC、PoseTrack(姿态估计)等。内置与 S3、Azure Blob、Google Cloud Storage 的云存储集成,可以在不下载原始数据的情况下直接处理远程文件。
后端技术栈: CVAT 后端基于 Django(Python)构建,使用 PostgreSQL 作为主数据库、Redis 作为缓存和任务队列(支持 RQ)、ClickHouse 存储事件日志、Grafana + Vector 提供可观测性。架构采用 Django + uWSGI + Nginx 的标准组合,并通过 Docker Compose 管理多容器协同。
前端技术栈: 前端使用 React + TypeScript 构建,组件化设计。打包工具使用 Webpack,代码规范遵循 ESLint + Prettier + Black(Python 端)。cvat-ui、cvat-core、cvat-canvas 等模块被拆分为独立包,体现了良好的模块化工程实践。
容器化部署: 项目根目录包含 Dockerfile(多阶段构建)、Dockerfile.ui(前端镜像)、Dockerfile.ci(CI 镜像)、docker-compose.yml(默认全量栈)和 docker-compose.dev.yml(开发调试配置)。docker compose up -d 即可启动完整服务栈,包括后端服务器、前端 UI、PostgreSQL 数据库、Redis 缓存、ClickHouse 分析数据库、Nginx 反向代理和 Traefik 路由。
扩展机制: cvat/apps 目录采用 Django App 插件化架构,engine(标注引擎)、dataset_manager(数据集管理)、quality_control(质量控制)、lambda_manager(AI 模型集成)等模块高度解耦,便于二次开发和功能扩展。
对于没有 Docker 经验的团队,最简单的体验方式是直接访问 CVAT Online 使用免费计划,无需任何安装。
自托管部署需要具备基本的 Docker 知识,在具备 Docker + Docker Compose 环境的机器上,安装流程非常简洁:克隆仓库 → docker compose up -d → 创建管理员账户,三步完成。进阶部署支持 Kubernetes、AWS、Azure、阿里云等生产级方案。
资源消耗: CVAT 完整部署包含 10+ 个容器,对硬件资源有一定要求,生产环境建议 4 核 CPU + 8GB 内存以上。
学习曲线: 虽然基础标注操作直观,但 AI 辅助标注的模型接入、自动化工作流配置、服务器运维等进阶功能需要一定的技术背景。
WebKit/Safari 兼容性: 官方明确表示仅在 Chromium 内核浏览器(Chrome、Edge)上经过完整测试,Firefox 可能存在部分功能问题。
CVAT 代表了视觉 AI 数据标注从"人工外包"向"平台化自主"转变的趋势。其开源策略也值得研究:通过开源社区版建立用户生态和技术口碑,再通过 CVAT Online( SaaS)和 Enterprise(企业版)实现商业化变现,形成了健康的开源商业闭环。
目前 CVAT 已与 Label Studio、VIA 等开源标注工具形成差异化竞争——后者偏向轻量级场景,CVAT 则面向需要 AI 辅助、高质量标注和团队协作的生产级视觉 AI 项目。