论文原文与图表
Visual recognition of excavator keypoints based on synthetic image datasets
基于合成图像数据集的挖掘机关键点识别
在2,340帧实际挖掘视频测试中,由10,000张真实照片与14,000张合成图像构成的Dataset #2训练模型平均PCK为97.64%,平均NE为0.0056。
论文摘要
论文建立挖掘机虚拟模型和多类场景,通过程序随机设置挖掘机姿态、虚拟相机位置及场景参数,计算关键点坐标与遮挡信息并生成合成图像数据集,再使用单目相机和深度神经网络估计工作装置关键点。实际挖掘视频测试中,Dataset #2训练模型的平均NE为0.0056,平均PCK为97.64%。
- Excavator
- Keypoint recognition
- Synthetic image dataset
- Deep learning
- YOLOv8x-pose-p6
合成数据生成、模型训练和实际数据测试组成完整流程
Fig.1将方法分为Blender合成图像数据集、深度神经网络训练和实际挖掘机数据集三部分。虚拟模型与场景生成图像和自动标签,实际照片经手工标注和数据增强形成真实数据。
两类数据分别组成训练数据集,YOLOv8x-pose-p6输出挖掘机包围框和七个工作装置关键点的二维坐标。
基于合成图像数据集的挖掘机关键点识别。
Keypoints recognition of excavator based on synthetic image dataset.
查看高清原图 ↗四个基础点与三个补充点共同描述工作装置
Fig.2给出七个关键点及遮挡案例。Point_1至Point_4依次为动臂铰点、斗杆铰点、铲斗铰点和铲斗尖点;Point_5至Point_7为动臂油缸、斗杆油缸和铲斗油缸附加铰点。
每个关键点标签表示为[x, y, v]。x和y为归一化二维坐标,v=0、1、2分别表示超出视图、被遮挡和可见。
基础点遮挡与关键点示意。
Occlusion of base-points and keypoints.
查看高清原图 ↗相机、姿态、外观和场景参数在循环中随机生成
Fig.5展示虚拟数据集生成流程。程序随机设置虚拟相机的位置、焦距和传感器尺寸,计算相机朝向与内外参,并随机设置回转、动臂、斗杆和铲斗关节角。
纹理、材质、部件颜色、光照和反射参数随样本变化。关键点三维坐标经相机参数投影为二维坐标,辅助点用于判断遮挡状态,图像和标签随后写入数据集。
虚拟数据集生成流程。
Virtual dataset generation process.
查看高清原图 ↗两套数据采用相同模型架构与训练配置
Dataset #1包含37,368张现场真实挖掘机照片。Dataset #2包含10,000张真实照片与14,000张Blender合成图像,共24,000张;两套数据均按70%训练、30%验证划分。
两个模型均使用YOLOv8x-pose-p6、SGD、batch=8和100轮训练。训练硬件为Intel Xeon Silver 4210R和Tesla V100S 32 GB,训练时间分别为150 h和121 h。
真实照片覆盖不同工况、姿态和相机角度
Fig.7展示同一相机角度下的下挖、平地挖掘和装车工况,以及同一工况下的右后方、左前方和右前方拍摄视角。
实际数据采集还改变焦距、相机位置、光照与天气条件;照片经手工标注,并通过翻转、旋转、平移、缩放、对比度变化、高斯噪声和颜色变化进行增强。
实际挖掘机数据集获取。
Acquisition of actual excavator dataset.
查看高清原图 ↗两个模型在同一段实际挖掘视频上评价
测试由专业驾驶员连续完成两个挖掘作业循环。相机距挖掘机约35 m,视频分辨率为1080p、帧率60 fps、时长39 s,共2,340帧。
Fig.9按下降、挖掘、提升、回转和卸料五个阶段展示Dataset #1与Dataset #2模型的识别结果,底图来自同一段实际测试视频。
关键点识别结果。
Keypoint recognition results.
查看高清原图 ↗Dataset #2模型获得更高平均PCK和更低平均NE
PCK阈值α设为0.02,即预测点与真值的距离低于图像对角线2%时计为正确;NE为关键点距离按图像对角线归一化后的跨帧平均。
Dataset #1模型平均PCK为96.28%、平均NE为0.0059;Dataset #2模型分别为97.64%和0.0056。Point_4在挖掘阶段受土壤遮挡,遮挡样本占测试集34.29%,对应阶段PCK为59.19%和67.22%。
识别对象、拍摄距离与遮挡条件限定了结果范围
论文识别七个工作装置关键点,机身位姿未纳入关键点标签。结果用于挖掘机作业安全监控和工作效率分析。
作者指出,拍摄距离过远或挖掘机严重遮挡时,二维关键点可能无法正确识别或误差增大;数据和代码计划在后续公开。
第二层阅读
需要更快地把握方法链和核心机制?
AI简报不会替代上方的论文原文导读;它只在您主动打开时加载。引用本文
以下格式根据论文正式题录生成;使用前请按目标期刊或机构规范复核。
姚宗伟, 陈辰, 高振云, 等. 基于合成图像数据集的挖掘机关键点识别[J]. 吉林大学学报(工学版), 2026, 56(1): 76-85. DOI:10.13229/j.cnki.jdxbgxb.20240677.
Yao, Z.-W., Chen, C., Gao, Z.-Y., Jin, H.-P., Rong, H., Li, X.-F., Huang, H.-P., & Bi, Q.-S. (2026). Visual recognition of excavator keypoints based on synthetic image datasets. Journal of Jilin University (Engineering and Technology Edition), 56(1), 76–85. https://doi.org/10.13229/j.cnki.jdxbgxb.20240677
Z.-W. Yao, C. Chen, Z.-Y. Gao, H.-P. Jin, H. Rong, X.-F. Li, H.-P. Huang, and Q.-S. Bi, “Visual recognition of excavator keypoints based on synthetic image datasets,” Journal of Jilin University (Engineering and Technology Edition), vol. 56, no. 1, pp. 76–85, 2026, doi: 10.13229/j.cnki.jdxbgxb.20240677.