论文原文与图表

Target Detection for Construction Machinery Based on Deep Learning and Multisource Data Fusion

基于深度学习与多源数据融合的工程机械目标检测

Yong Wang, Xinhui Liu, Quanxiao Zhao, Haiteng He, Zongwei Yao

查看正式论文

论文将RGB图像与LiDAR点云转换的稠密深度图分别输入MY3Net,并依据两路检测置信度动态融合二维目标框。

论文摘要

面向复杂动态场景、光照变化和振动条件下的道路目标检测,论文融合视觉图像与LiDAR点云。点云经投影、稠密化和地面去除形成深度图;MY3Net以MobileNet v2提取特征,并采用YOLO v3进行多尺度检测;RGB图像和深度图的检测结果再由动态权重进行决策级融合。实验结果表明,该方法在复杂照明条件下保持了较高的检测精度。

  • Construction machinery
  • Target detection
  • Multisource data fusion
  • MY3Net
  • Complex illumination

数据预处理、双路MY3Net和决策融合构成检测流程

Fig.3将方法划分为数据预处理、神经网络和决策融合三部分。RGB图像直接进入视觉分支,LiDAR点云先转为稠密深度图并去除地面。

两个结构相同的MY3Net分别输出car与person的二维检测框和置信度,随后依据类别、位置与检测分数形成最终结果。

Fig. 3 论文提出的算法总体框架
论文原图 · Fig. 3 论文提出的算法总体框架

论文提出的算法总体框架。

Algorithmic framework proposed in this article.

查看高清原图 ↗

稀疏点云经投影和固定邻域搜索形成稠密深度图

LiDAR与相机联合标定后,三维点映射到图像像素位置,点的距离坐标写入对应网格,形成稀疏深度图。

Fig.5给出改进N-P算法流程:在3×3固定邻域内搜索有效网格,满足数量条件时采用反距离加权估计缺失深度;广度优先搜索与角度阈值用于地面去除。

Fig. 5 深度图稠密化算法流程
论文原图 · Fig. 5 深度图稠密化算法流程

深度图稠密化算法流程。

Flowchart of depth graph thickening algorithm.

查看高清原图 ↗

MobileNet v2特征提取与YOLO v3多尺度预测组合为MY3Net

Fig.6中的特征提取器由MobileNet v2倒残差模块组成,使用1×1、3×3和1×1卷积完成通道扩展、深度卷积和投影。

跨尺度特征融合在13×13、26×26和52×52三个尺度上进行,每个尺度设置3个anchor,共9种预设框。

Fig. 6 MY3Net结构
论文原图 · Fig. 6 MY3Net结构

MY3Net结构。

Structure of the MY3Net.

查看高清原图 ↗

检测分数差用于动态调整RGB与深度框的位置权重

两路检测结果先分别按置信度阈值筛选,同类别框再按IOU阈值匹配。仅由单一分支检测到且满足条件的目标保留对应结果。

共同检测到的目标以Δs=s₁−s₂计算Logistic权重wᵣ=1/(1+e⁻ᵏΔˢ),深度权重为w_d=1−wᵣ;论文给出的k经验范围为5–10。

约5,000对KITTI图像与点云用于两类目标实验

实验选取约5,000张RGB图像及对应5,000组激光点云,检测类别为car和person,两类各占数据集50%。

数据增强包括光照变化、平移、随机噪声、旋转和翻转。训练学习率为0.001,miniBatchSize为8,平台为AMD Ryzen 5 3600与NVIDIA RTX 3060 Ti。

正常照明下MY3Net的类别AP略高于融合模型

Fig.15展示正常照明下融合模型的检测效果。Table I中,MY3Net的Car AP与Person AP为84.2%和62.3%,融合模型为83.6%和60.1%。

正常照明图像保留了较完整的纹理和边界,深度图经稠密化后仍缺少部分细节,因此融合结果在该条件下略低于RGB分支。

Fig. 15 正常照明下融合模型的检测效果
论文原图 · Fig. 15 正常照明下融合模型的检测效果

正常照明下融合模型的检测效果。

Detection effect of the fusion model under normal illumination.

查看高清原图 ↗

弱光、强光与混合照明实验比较三种检测模型

弱照明和强照明由正常图像分别变暗和增亮构造。融合模型在弱照明下的Car/Person AP为57.9%/45.2%,强照明下为53.0%/47.2%。

混合照明数据按正常、弱、强=3:4:1组成。融合模型的Car AP为63.0%,Person AP为50.2%;对应MY3Net结果为58.0%和31.6%。

Fig. 18 弱照明下融合模型的检测效果
论文原图 · Fig. 18 弱照明下融合模型的检测效果

弱照明下融合模型的检测效果。

Detection effect of the fusion model under weak illumination.

查看高清原图 ↗

实验类别、光照构造与小目标采样限定了结果范围

论文定量实验基于KITTI的car与person两类目标,输出为图像平面的二维检测框;强弱照明由图像增亮和变暗构造。

作者指出,即使使用64线LiDAR,小目标的点云细节仍不足;后续研究将扩展目标类别并改善小目标检测。

第二层阅读

需要更快地把握方法链和核心机制?

AI简报不会替代上方的论文原文导读;它只在您主动打开时加载。

引用本文

以下格式根据论文正式题录生成;使用前请按目标期刊或机构规范复核。

GB/T 7714

WANG Y, LIU X H, ZHAO Q X, et al. Target detection for construction machinery based on deep learning and multisource data fusion[J]. IEEE Sensors Journal, 2023, 23(10): 11070-11081. DOI:10.1109/JSEN.2023.3264526.

APA

Wang, Y., Liu, X., Zhao, Q., He, H., & Yao, Z. (2023). Target detection for construction machinery based on deep learning and multisource data fusion. IEEE Sensors Journal, 23(10), 11070–11081. https://doi.org/10.1109/JSEN.2023.3264526

IEEE

Y. Wang, X. Liu, Q. Zhao, H. He, and Z. Yao, “Target Detection for Construction Machinery Based on Deep Learning and Multisource Data Fusion,” IEEE Sensors Journal, vol. 23, no. 10, pp. 11070–11081, May 2023, doi: 10.1109/JSEN.2023.3264526.

AI简报

正在整理本篇AI简报…

梳理方法、实验、结果与适用边界