专利原文与附图
一种基于3d视觉的挖掘机位姿识别方法
An Excavator Pose Recognition Method Based on 3D Vision
该专利以单目图像中的七个挖掘机关键点为观测,经标准D‑H运动学建模和3D—2D投影,把关键点投影误差与工作装置相邻主链长度误差组合为动态目标,再以全局—局部优化及曲线平滑重构连续三维位姿。
专利摘要
本专利提供一种基于3d视觉的挖掘机位姿识别方法。方法建立实际挖掘机与Blender合成图像数据集,训练YOLOv8x‑pose‑p6识别包围框及七个关键点;通过标准D‑H法建立工作装置运动学模型,将八个位姿变量映射到关键点三维坐标和图像二维坐标;对遮挡、离群点和多机目标进行预处理后,以投影误差和主链长度误差构造目标函数,结合全局与局部优化求解三维位姿,并进行时序平滑。
- 单目视觉
- 挖掘机位姿
- 七关键点
- YOLOv8‑Pose
- 标准D‑H法
- 3D—2D投影
- 全局—局部优化
- 时序平滑
单目视觉位姿识别需要处理遮挡、多机干扰和二维观测的不完整性
挖掘机工作装置的铰点或斗尖可能被驾驶室、铲斗和土壤遮挡,也可能超出相机视野。
方法把视觉关键点与工作装置运动学和物理长度约束结合,而不是仅由二维坐标直接给出三维位姿。
S1—S8连接数据、关键点识别、投影建模、优化与平滑
S1—S2建立实际与合成图像数据集并训练YOLOv8x‑pose‑p6;S3—S4建立运动学模型并完成3D—2D坐标投影。
S5处理目标关联、遮挡和离群值;S6—S7构建目标并求解位姿;S8使位姿曲线连续。
图1按S1—S8展示数据集、关键点训练、运动学建模、三维投影、二维预处理、目标函数、全局—局部优化和位姿平滑。
查看高清原图 ↗P1—P4定义工作装置主链,P5—P7是三类油缸或四连杆附加观测点
P1、P2、P3和P4依次对应动臂铰点、斗杆铰点、铲斗铰点和铲斗尖点。铲斗在P3与斗杆直接连接。
P5、P6和P7分别对应动臂油缸铰点、斗杆油缸铰点和铲斗油缸铰点;它们属于不同执行机构分支,不构成第二条串联主链。
图2(a)展示关键点超出视图或被驾驶室、铲斗及土壤遮挡的情形;图2(b)标示四个基础点和三个附加点。
查看高清原图 ↗标准D‑H法把八个位姿变量映射为七点三维坐标
位姿变量包括回转中心轴与地面交点在相机坐标系中的X、Y、Z,以及θ₀—θ₄五个角度,共八个变量。
D‑H坐标系描述主工作链和附加机构坐标关系,并由倾斜角旋转矩阵计入地面不平整。
图3(a)给出0—4点坐标系,图3(b)给出5—8点坐标系,用于建立工作装置运动学关系。
查看高清原图 ↗相机内外参与径向畸变模型把三维关键点投影到像素坐标
三维关键点经相机内参、外参和深度归一化得到二维投影坐标,再按径向畸变参数修正。
预处理依据连续帧位置和包围框面积排除其他挖掘机,并对遮挡造成的异常点进行离群检测与拟合修补。
图4展示相机坐标系、挖掘机坐标系以及图像坐标系与像素坐标系之间的关系。
查看高清原图 ↗Obj₁投影误差与Obj₂主链长度误差共同约束三维位姿
Obj₁计算估计二维点与投影二维点的加权距离;Obj₂比较P1—P2、P2—P3、P3—P4三段的估计长度与投影长度。
全局优化给出候选位姿并设早停机制;局部优化以上一帧结果为初值。说明书规定每60帧执行一次全局优化,并在坐标变化或误差超过阈值时切回全局优化。
图5以侧视和横向倾斜示意回转中心位置X、Y、Z及θ₀—θ₄五个角度变量。
查看高清原图 ↗FFT、低通滤波和移动窗口用于形成连续位姿曲线
完整三维位姿重构后,先用快速傅里叶变换分解位姿曲线频率,再以低通滤波去除高频部分。
最后通过移动窗口平滑曲线;说明书中的PCK、NE、MPJPE和MLE数值对应其数据集与实验设置。
第二层阅读
需要更快地把握方法链和核心机制?
AI简报不会替代上方的专利内容导读;它只在您主动打开时加载。引用专利
以下格式根据专利文献标识生成;使用前请按目标期刊或机构规范复核。
姚宗伟,李昊旻,黄鸿溥,靳鸿鹏,李学飞,陈辰,高振云,荣浩. 一种基于3d视觉的挖掘机位姿识别方法: CN 119515981 B[P]. 2025-10-24.
姚宗伟,李昊旻,黄鸿溥,靳鸿鹏,李学飞,陈辰,高振云,荣浩. (2025). 一种基于3d视觉的挖掘机位姿识别方法 (CN 119515981 B). China National Intellectual Property Administration.
[1] 姚宗伟,李昊旻,黄鸿溥,靳鸿鹏,李学飞,陈辰,高振云,荣浩, “一种基于3d视觉的挖掘机位姿识别方法,” 中国专利 CN 119515981 B, 2025-10-24.