CenterPoint-Fusion
yinjunbo/CenterPoint-Fusion加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
加载项目详情…
本应用为开源项目,仅供学习研究,请遵守其开源协议。
你有没有想过,自动驾驶汽车在夜间或恶劣天气下,仅靠摄像头能准确"看见"前方障碍物吗?答案是:远远不够。于是,科学家们开始给车辆装上"透视眼"——激光雷达(LiDAR)。而 PV-SSD(Point-Voxel Single Shot Detector)正是这样一套让汽车同时拥有"眼睛"和"透视眼"的 AI 系统。
3D 目标检测是自动驾驶的核心技术之一。系统需要实时判断周围车辆、行人、骑行者等目标的位置和大小——不是照片里的平面框,而是真实三维空间中的包围盒。
行业主流方案分为两条路线:
PV-SSD 的核心思路:取长补短,把两条路线"融合"。
PV-SSD 以 CenterPoint 为基准模型(一种基于热力图的 3D 检测器),从三个层面引入多模态信息:
用预训练的 Mask R-CNN(在 nuImages 数据集上训练)从相机图像生成 2D 实例分割掩码,然后将掩码投影到 3D 点云上,为每个激光点"涂上"所属物体的类别颜色。
类比理解:就像给黑白的点云地图贴上彩色标签,让系统不仅知道"这里有个东西",还知道"那是一辆卡车"。
同时用 Cylinder3D(一种专为点云设计的 3D 语义分割网络)为点云中的每个点打上语义标签(道路、建筑、植被等),进一步丰富点的特征表示。
原始 CenterPoint 的 RPN(区域候选网络)在多类别检测时表现不足。PV-SSD 用改进的 Spatial-Semantic Feature Aggregation(SSFA) 模块替代,显著提升了对多类别目标的召回率。
PV-SSD 还集成了多种训练/推理技巧来榨干模型性能:
| 技术 | 作用 |
|---|---|
| 伪标签(Pseudo Labeling) | 用模型预测高置信度样本来扩充训练集,半监督学习 |
| TTA(测试时增强) | 推理时对点云做多次翻转/旋转,结果融合提升鲁棒性 |
| 多分辨率体素融合 | 融合 0.05m~0.125m 多种体素分辨率的检测结果 |
| 3D WBF(加权边界框融合) | 将多分辨率结果用加权方式合并,减少漏检 |
本仓库是一个研究复现项目,而非生产级部署包:
推荐人群:3D 感知方向的研究者、硕博生、需要复现 nuScenes 检测论文的工程师。
PV-SSD 代表了 2021 年前后 3D 检测领域"多模态融合"的技术趋势:通过 PointPainting 和 Cylinder3D 为点云注入语义信息,再结合 CenterPoint 的检测头,实现高精度 3D 目标检测。虽然当前仓库以文档为主,但其融合思路和 SSFA 模块的设计对后续研究(如 BEVFormer、PETR)有重要参考价值。
如果你在研究多传感器融合、BEV(鸟瞰图)感知或 nuScenes 数据集的使用,PV-SSD 值得深入阅读。