论文原文与图表

Visual recognition of excavator keypoints based on synthetic image datasets

基于合成图像数据集的挖掘机关键点识别

Zong-wei Yao, Chen Chen, Zhen-yun Gao, Hong-peng Jin, Hao Rong, Xue-fei Li, Hong-pu Huang, Qiu-shi Bi

查看正式论文

在2,340帧实际挖掘视频测试中,由10,000张真实照片与14,000张合成图像构成的Dataset #2训练模型平均PCK为97.64%,平均NE为0.0056。

论文摘要

论文建立挖掘机虚拟模型和多类场景,通过程序随机设置挖掘机姿态、虚拟相机位置及场景参数,计算关键点坐标与遮挡信息并生成合成图像数据集,再使用单目相机和深度神经网络估计工作装置关键点。实际挖掘视频测试中,Dataset #2训练模型的平均NE为0.0056,平均PCK为97.64%。

  • Excavator
  • Keypoint recognition
  • Synthetic image dataset
  • Deep learning
  • YOLOv8x-pose-p6

合成数据生成、模型训练和实际数据测试组成完整流程

Fig.1将方法分为Blender合成图像数据集、深度神经网络训练和实际挖掘机数据集三部分。虚拟模型与场景生成图像和自动标签,实际照片经手工标注和数据增强形成真实数据。

两类数据分别组成训练数据集,YOLOv8x-pose-p6输出挖掘机包围框和七个工作装置关键点的二维坐标。

Fig. 1 基于合成图像数据集的挖掘机关键点识别流程
论文原图 · Fig. 1 基于合成图像数据集的挖掘机关键点识别流程

基于合成图像数据集的挖掘机关键点识别。

Keypoints recognition of excavator based on synthetic image dataset.

查看高清原图 ↗

四个基础点与三个补充点共同描述工作装置

Fig.2给出七个关键点及遮挡案例。Point_1至Point_4依次为动臂铰点、斗杆铰点、铲斗铰点和铲斗尖点;Point_5至Point_7为动臂油缸、斗杆油缸和铲斗油缸附加铰点。

每个关键点标签表示为[x, y, v]。x和y为归一化二维坐标,v=0、1、2分别表示超出视图、被遮挡和可见。

Fig. 2 基础点遮挡与七个关键点
论文原图 · Fig. 2 基础点遮挡与七个关键点

基础点遮挡与关键点示意。

Occlusion of base-points and keypoints.

查看高清原图 ↗

相机、姿态、外观和场景参数在循环中随机生成

Fig.5展示虚拟数据集生成流程。程序随机设置虚拟相机的位置、焦距和传感器尺寸,计算相机朝向与内外参,并随机设置回转、动臂、斗杆和铲斗关节角。

纹理、材质、部件颜色、光照和反射参数随样本变化。关键点三维坐标经相机参数投影为二维坐标,辅助点用于判断遮挡状态,图像和标签随后写入数据集。

Fig. 5 虚拟数据集生成流程
论文原图 · Fig. 5 虚拟数据集生成流程

虚拟数据集生成流程。

Virtual dataset generation process.

查看高清原图 ↗

两套数据采用相同模型架构与训练配置

Dataset #1包含37,368张现场真实挖掘机照片。Dataset #2包含10,000张真实照片与14,000张Blender合成图像,共24,000张;两套数据均按70%训练、30%验证划分。

两个模型均使用YOLOv8x-pose-p6、SGD、batch=8和100轮训练。训练硬件为Intel Xeon Silver 4210R和Tesla V100S 32 GB,训练时间分别为150 h和121 h。

真实照片覆盖不同工况、姿态和相机角度

Fig.7展示同一相机角度下的下挖、平地挖掘和装车工况,以及同一工况下的右后方、左前方和右前方拍摄视角。

实际数据采集还改变焦距、相机位置、光照与天气条件;照片经手工标注,并通过翻转、旋转、平移、缩放、对比度变化、高斯噪声和颜色变化进行增强。

Fig. 7 实际挖掘机数据集获取
论文原图 · Fig. 7 实际挖掘机数据集获取

实际挖掘机数据集获取。

Acquisition of actual excavator dataset.

查看高清原图 ↗

两个模型在同一段实际挖掘视频上评价

测试由专业驾驶员连续完成两个挖掘作业循环。相机距挖掘机约35 m,视频分辨率为1080p、帧率60 fps、时长39 s,共2,340帧。

Fig.9按下降、挖掘、提升、回转和卸料五个阶段展示Dataset #1与Dataset #2模型的识别结果,底图来自同一段实际测试视频。

Fig. 9 实际视频中的关键点识别结果
论文原图 · Fig. 9 实际视频中的关键点识别结果

关键点识别结果。

Keypoint recognition results.

查看高清原图 ↗

Dataset #2模型获得更高平均PCK和更低平均NE

PCK阈值α设为0.02,即预测点与真值的距离低于图像对角线2%时计为正确;NE为关键点距离按图像对角线归一化后的跨帧平均。

Dataset #1模型平均PCK为96.28%、平均NE为0.0059;Dataset #2模型分别为97.64%和0.0056。Point_4在挖掘阶段受土壤遮挡,遮挡样本占测试集34.29%,对应阶段PCK为59.19%和67.22%。

识别对象、拍摄距离与遮挡条件限定了结果范围

论文识别七个工作装置关键点,机身位姿未纳入关键点标签。结果用于挖掘机作业安全监控和工作效率分析。

作者指出,拍摄距离过远或挖掘机严重遮挡时,二维关键点可能无法正确识别或误差增大;数据和代码计划在后续公开。

第二层阅读

需要更快地把握方法链和核心机制?

AI简报不会替代上方的论文原文导读;它只在您主动打开时加载。

引用本文

以下格式根据论文正式题录生成;使用前请按目标期刊或机构规范复核。

GB/T 7714

姚宗伟, 陈辰, 高振云, 等. 基于合成图像数据集的挖掘机关键点识别[J]. 吉林大学学报(工学版), 2026, 56(1): 76-85. DOI:10.13229/j.cnki.jdxbgxb.20240677.

APA

Yao, Z.-W., Chen, C., Gao, Z.-Y., Jin, H.-P., Rong, H., Li, X.-F., Huang, H.-P., & Bi, Q.-S. (2026). Visual recognition of excavator keypoints based on synthetic image datasets. Journal of Jilin University (Engineering and Technology Edition), 56(1), 76–85. https://doi.org/10.13229/j.cnki.jdxbgxb.20240677

IEEE

Z.-W. Yao, C. Chen, Z.-Y. Gao, H.-P. Jin, H. Rong, X.-F. Li, H.-P. Huang, and Q.-S. Bi, “Visual recognition of excavator keypoints based on synthetic image datasets,” Journal of Jilin University (Engineering and Technology Edition), vol. 56, no. 1, pp. 76–85, 2026, doi: 10.13229/j.cnki.jdxbgxb.20240677.

AI简报

正在整理本篇AI简报…

梳理方法、实验、结果与适用边界