论文原文与图表
Reinforcement learning-based trajectory planning for continuous digging of excavator working devices in trenching tasks
基于强化学习的挖掘机工作装置沟槽连续挖掘轨迹规划
本文将沟槽连续挖掘任务分解为三类目标区域,利用PSO生成离线参考并训练TD3策略,在四种仿真工况中在线生成连续三关节轨迹。
论文摘要
论文面向自主挖掘中的实时连续轨迹规划,提出粒子群优化(PSO)与强化学习相结合的方法。首先针对不同几何形状的挖掘区域定义三类轨迹,并利用PSO优化高阶多项式轨迹,获得最优轨迹、敏感参数及变化范围;随后建立强化学习模型,将离线优化结果作为训练参考。论文在四种沟槽工况中开展仿真实验,轨迹生成时间均在0.5 s以内,综合性能指标低于0.14,工况平均目标区域挖掘率均超过92%。
- Continuous digging
- Trajectory planning
- Particle swarm optimization
- Reinforcement learning
- TD3
PSO离线优化与强化学习在线规划
总体方法包括PSO规划模型、强化学习规划模型和完整任务的连续规划三部分。PSO在目标区域、目标函数和约束条件下优化高阶多项式轨迹,生成关节运动参考。
强化学习模型接收环境状态,输出三个关节的运动信息。训练后的模型用于逐个处理任务分解得到的子区域,直到完成全部沟槽挖掘任务。
所提规划方法的总体框架。PSO表示粒子群优化,RL表示强化学习。
The overall framework of the proposed planning method. PSO, particle swarm optimization; RL, reinforcement learning.
查看高清原图 ↗三类目标区域组成连续沟槽任务
完整沟槽由总面积、深度、起始点和两侧坡角定义。论文将任务分为梯形、异六边形和平行四边形三类目标区域,分别用于首次向下开挖、补充深度和沿沟槽方向继续推进。
不同沟槽深度通过三类区域的组合完成。每个子任务记录位置、面积、深度和坡角,并据此初始化后续轨迹规划。
任务分解、挖掘体积计算与铲斗角度定义:(a)总体任务分解,(b)第一类目标区域,(c)第二类目标区域,(d)第三类目标区域,(e)挖掘体积计算,(f)铲斗角度θp1和θp2。
Task decomposition, excavation volume calculation and bucket angle definition; (a) overall task decomposition, (b) first type of target area, (c) second type of target area, (d) third type of target area, (e) excavation volume calculation, and (f) bucket angle θp1 and θp2.
查看高清原图 ↗六阶多项式轨迹与PSO参考样本
动臂、斗杆和铲斗的关节角由六阶多项式描述,轨迹起点和终点的角速度、角加速度设为零。PSO优化多项式系数和执行时间。
目标函数联合执行时间、目标区域挖掘率和能耗,并施加关节角、速度、加速度、功率、转矩、斗尖运动方向和铲斗姿态等约束。优化结果用于确定敏感参数范围并构造强化学习训练参考。
状态、连续动作、奖励与终止条件
TD3状态包括关节运动、动力与能量、目标区域几何和挖掘进展。第一步动作是三个关节的角加加速度,后续动作是角加加速度的时间微分。
奖励函数分别处理时间、挖掘率、能耗、斗尖高度和铲斗姿态的变化。正常终止用于任务完成或达到资源上限,惩罚终止用于阻止违反机械和轨迹约束的动作继续展开。
四种沟槽工况与MBD–DEM环境
四种工况的总面积由2.50倍增加到4.70倍铲斗横截面积,深度由0.09 m增加到0.20 m。任务分解后共形成14个连续子任务。
轨迹规划在Simulink物理环境中运行,执行验证采用多体动力学与离散元法联合仿真。规划平台使用NVIDIA RTX 3060 GPU和AMD Ryzen 5 5600处理器。
用于连续沟槽规划的多体动力学与离散元法联合仿真环境。
Simulation environment combining multi-body dynamics and discrete element method for continuous trenching planning.
查看高清原图 ↗四工况规划时间、挖掘率与综合指标
Table 9中的全部RL子任务规划时间均小于0.5 s,四种工况的平均规划时间分别为0.469、0.459、0.471和0.464 s。PSO方法对应工况的平均规划时间为40.781、30.792、30.495和32.192 s。
四种工况的平均目标区域挖掘率分别为97.26%、92.05%、92.27%和93.09%,平均综合指标f1分别为0.0930、0.1352、0.1323和0.1394。PINN生成时间约为4 ms,快于RL;论文比较显示RL在连续子任务中的指标分布较为均衡。
沟槽任务的分解与规划。
Decomposition and planning of the trenching tasks.
查看高清原图 ↗Condition 1三轮连续开挖联合仿真
论文选取平均挖掘率最高的Condition 1进行MBD–DEM联合仿真。Fig.10依次呈现初始状态、第一轮结束、第二轮结束和最终状态。
三轮连续开挖后,实际沟槽轮廓总体接近设计轮廓;材料滑移和沉积造成局部偏差。论文报告规划轨迹与目标挖掘区域的重叠超过94.1%。
验证来自Simulink和MBD–DEM仿真,未使用原型机。论文将非均匀材料、随机载荷、阻力模型细化和现场试验列为后续方向。
开挖联合仿真:(a)初始状态,(b)第一轮开挖结束状态,(c)第二轮开挖结束状态,(d)最终状态。
Co-simulations of excavation: (a) start state, (b) end state of the first round excavation, (c) end state of the second round excavation, and (d) final state.
查看高清原图 ↗第二层阅读
需要更快地把握方法链和核心机制?
AI简报不会替代上方的论文原文导读;它只在您主动打开时加载。引用本文
以下格式根据论文正式题录生成;使用前请按目标期刊或机构规范复核。
TAN X, WEI W, LIU C, et al. Reinforcement learning-based trajectory planning for continuous digging of excavator working devices in trenching tasks[J]. Computer-Aided Civil and Infrastructure Engineering, 2025, 40(13): 1847-1870. DOI:10.1111/mice.13428.
Tan, X., Wei, W., Liu, C., Cheng, K., Wang, Y., Yao, Z., & Huang, Q. (2025). Reinforcement learning-based trajectory planning for continuous digging of excavator working devices in trenching tasks. Computer-Aided Civil and Infrastructure Engineering, 40(13), 1847–1870. https://doi.org/10.1111/mice.13428
X. Tan, W. Wei, C. Liu, K. Cheng, Y. Wang, Z. Yao, and Q. Huang, “Reinforcement learning-based trajectory planning for continuous digging of excavator working devices in trenching tasks,” Computer-Aided Civil and Infrastructure Engineering, vol. 40, no. 13, pp. 1847–1870, 2025, doi: 10.1111/mice.13428.