ultralytics
YOLO 目标检测全家桶:一站式计算机视觉框架,支持检测/分割/分类/姿态估计,pip 安装即用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
YOLO 目标检测全家桶:一站式计算机视觉框架,支持检测/分割/分类/姿态估计,pip 安装即用
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
想象一下这个场景:深夜的工厂流水线旁,一台配备摄像头的工控机正在实时监控着传送带上每一个零件——系统只用了 25 毫秒,就在一帧图像里同时识别出了 47 个螺丝、12 个螺母和 3 个异物。在工业质检、安防监控、自动驾驶、医疗影像等无数个对速度与精度同样苛求的领域里,有一个名字几乎无处不在:Ultralytics YOLO。

Ultralytics YOLO 是由 Ultralytics 公司开发和维护的计算机视觉模型库,GitHub 累计斩获超过 57,000 颗星,是全球最受欢迎的 AI 开源项目之一。它不只是一个模型,而是一个覆盖目标检测、实例分割、语义分割、图像分类、姿态估计、目标跟踪六大核心任务的一站式解决方案。
YOLO(You Only Look Once)最早由华盛顿大学 Joseph Redmon 等人在 2016 年提出,革命性地将目标检测从两阶段(区域提案→分类)压缩为单阶段端到端推理——模型"扫一眼"图像,就能同时输出所有物体的位置和类别。这一范式让实时目标检测成为可能,也为后续的工业落地打开了大门。
Ultralytics 在 YOLOv8 和 YOLOv5 上的工程化贡献尤为关键。创始人 Glenn Jocher 带领团队不仅实现了论文中的算法,更做了大量工程优化:预训练模型的泛化能力调优、COCO 数据集上的 AutoAnchor 锚框优化、多后端推理引擎支持、以及对 PyTorch 生态的深度集成。2025 年推出的 YOLO26 更是在精度与速度的权衡上刷新了业界纪录。
从技术发展脉络看,YOLO 系列经历了三个阶段:学术驱动期(v1-v4)、工程化成熟期(v5-v11)、平台化生态期(v12-v26),而 Ultralytics 恰好站在第三个阶段的潮头——他们不仅维护代码仓库,还搭建了 Ultralytics Platform 云平台、HUB 在线训练系统、以及覆盖 10+ 种语言的完整文档体系。
如果把计算机视觉模型比作人类的视觉系统,传统的两阶段检测器(如 Faster R-CNN)就像是先"找到所有可能是物体的区域"(类似人眼先模糊扫一遍),再逐个"仔细辨认"(像人眼聚焦细节)。这个过程准确但缓慢。
YOLO 则像是经验丰富的质检员——不需要逐一确认,扫一眼就能同时说出"左下角有个螺母拧歪了,中间偏右两个螺丝缺失"。这就是"你只看一次"(You Only Look Once)的字面含义:一次前向传播,同时完成定位和分类。
Ultralytics 库则是在这双"眼睛"外面加上了一整套装备:镜框(模型架构)、眼睑(预处理/后处理)、视神经(推理引擎)、甚至还有一本"使用手册"(CLI 和 SDK)。这套装备开箱即用,无需从零组装。
Ultralytics 提供的模型架构(YOLOv8/YOLO11/YOLO26)统一支持以下任务类型:
| 任务 | 说明 | 典型场景 |
|---|---|---|
| 目标检测 (detect) | 标出图像中物体位置 + 类别 | 安防监控、工业质检 |
| 实例分割 (segment) | 在检测基础上描绘像素级轮廓 | 医学影像、自动驾驶 |
| 图像分类 (classify) | 判断整张图属于哪一类 | 产品分类、垃圾识别 |
| 姿态估计 (pose) | 检测人体关键点坐标 | 健身 App、体育分析 |
| 目标跟踪 (track) | 跨帧追踪同一物体 ID | 视频分析、人流统计 |
| OBB 定向检测 | 检测任意角度旋转的物体 | 遥感影像、车牌识别 |
Ultralytics 维护了一个庞大的预训练模型库,从 nano 到 xl 多种规格(yolo26n / yolo26s / yolo26m / yolo26l / yolo26x),覆盖从边缘设备到服务器端的不同性能需求。
同时支持从 Hugging Face、Kaggle、Weights & Biases、ClearML 等平台直接加载模型权重,无需手动下载:
from ultralytics import YOLO
# 从 PyTorch 加载预训练模型
model = YOLO('yolo26n.pt')
# 从其他平台加载
model = YOLO('hf://some/hf-model')
# 推理:单张图片
results = model.predict('bus.jpg', conf=0.25, iou=0.45)
# 推理:批量图片或视频
results = model.predict('video.mp4', save=True, stream=True)
模型训练完成后,可以导出为 ONNX、TensorRT、CoreML、TFLite、paddlepaddle、PaddleLite、EdgeTPU、IMX 等格式,打通从训练到部署的最后一公里:
# 导出为 ONNX(通用格式)
yolo export model=yolo26n.pt format=onnx imgsz=640
# 导出为 TensorRT(NVIDIA GPU 加速)
yolo export model=yolo26n.pt format=engine imgsz=640 half
除了本地训练,Ultralytics 还提供了 HUB 云端训练界面,支持拖拽上传数据集、可视化训练过程、以及一键部署模型到边缘设备。这大大降低了没有深度学习经验的团队使用目标检测的门槛。
pip install ultralytics
最低要求:Python 3.8+、PyTorch 1.8+,没有 GPU 也可以用 CPU 跑推理(速度较慢)。
方式一:CLI 命令行(最快上手)
yolo detect predict model=yolo26n.pt source='https://ultralytics.com/images/bus.jpg'
方式二:Python SDK(最灵活)
from ultralytics import YOLO
model = YOLO('yolo26n.pt')
results = model.val(data='coco8.yaml') # 验证集评估
model.train(data='coco8.yaml', epochs=100, imgsz=640) # 训练
方式三:Docker(环境隔离,生产推荐)
# GPU 推理(需要 nvidia-docker)
docker run -it --ipc=host --gpus all ultralytics/ultralytics:latest
# CPU 推理(轻量,无 GPU)
docker run -it --ipc=host ultralytics/ultralytics:latest-cpu
Docker 镜像版本非常丰富,涵盖了 GPU CUDA、CPU、ARM64(M1/M2 Mac)、Jetson 嵌入式、conda 环境等多种场景,最大程度减少了"环境配置地狱"。

Ultralytics 持续在 COCO 数据集上与竞品对比。从官方 benchmark 数据看,YOLO26 在精度(mAP)与推理速度(FPS)的帕累托前沿上表现优异,尤其在 YOLO26n(nano 规格)上实现了极高的性价比——参数量仅 5M 左右,推理速度超过 300 FPS(RTX 3080),同时 mAP 保持在 40%+,非常适合边缘设备部署。
Ultralytics 采用 AGPL-3.0 开源许可证,这是目前最具传染性的开源协议之一——只要在网络服务器上使用(哪怕只是调用 API),就必须开源你的衍生代码。Ultralytics 公司提供 商业许可证,但价格不菲。对于有商业化需求的企业来说,这一点必须提前评估清楚。
虽然推理"三行代码"就能搞定,但训练自己的数据集并不简单:需要准备符合 YOLO 格式的标注数据、配置 YAML 数据集描述文件、调参(学习率、Augmentation、锚框策略等),对初学者有一定门槛。HUB 平台降低了部分复杂度,但免费版功能有限。
Ultralytics 有自己的 .pt 模型格式,内部耦合了 Ultralytics 框架。虽然支持导出到 ONNX 等通用格式,但导出过程偶有算子不兼容的问题。长期来看,模型的迁移性是一个潜在风险。
Ultralytics YOLO 的影响力远超学术论文的引用数。它几乎是工业计算机视觉项目的默认选择——无论是大厂的安防系统、新能源汽车的 ADAS,还是高校实验室的 AI 课程 Demo,都能见到它的身影。
从数据来看:PyPI 每月下载量持续增长,社区 Discord 超过万人规模,GitHub issues 活跃度极高。这种生态的建立,靠的是极低的上手门槛 + 极高的推理性能 + 持续的版本迭代这三者的结合——很少有开源项目能同时做到。
对于 AI 开发者而言,Ultralytics 也是一个值得研究的工程化范本:如何在保证模型精度持续提升的同时,不破坏 API 的向后兼容性;如何在开源社区与商业变现之间找到平衡。这些经验对任何想要做 AI 基础设施的团队都有参考价值。
项目基本信息