有效
一种基于隐空间对齐的遥操作机器人动作控制方法及系统
夏博、王学谦、陈雷、刘甘霖、张可、张海丽、王一戎
天津先进技术研究院
摘要
本发明提出一种基于隐空间对齐的遥操作机器人动作控制方法及系统,属于机器人控制技术领域。本发明通过构建增广状态策略网络与隐空间价值网络,将同一时间步下的增广状态与真实状态分别在隐空间表征和动作价值上进行一致性对齐,从而实现遥操作机器人的精准动作控制。本发明用于解决现有延迟强化学习技术中输入结构不一致、表征难以统一以及价值估计存在偏差的技术问题,从根本上改善延迟环境中的决策稳定性与价值评估精度,提高强化学习在存在通信与感知延迟条件下用于执行动作控制的决策的可靠性。
1.一种基于隐空间对齐的遥操作机器人动作控制方法,其特征在于,所述方法包括:S1、针对延迟环境进行马尔可夫建模;其中,对遥操作机器人在通信与感知上存在延迟的实际运行环境进行马尔可夫建模,以确定存在延迟的增广状态与不存在延迟的真实状态在时间序列上的依赖关系,并进一步量化所述延迟对遥操作机器人的动作执行和状态观测产生的影响;S2、基于所述延迟环境设计策略网络;其中,策略网络以所述增广状态作为输入,遥操作机器人在所述延迟环境下根据历史观测与动作序列生成控制指令,作为所述策略网络的输出,所述控制指令指待执行的连续且稳定的动作;S3、执行价值网络隐空间的构建与对齐;其中,设计价值网络隐空间编码,从而将真实状态映射至隐空间,通过隐空间特征对齐和动作价值对齐,使得价值网络与策略网络在优化目标上协同一致,对齐机制针对所述延迟导致的输入分布差异;S4、利用策略网络和价值网络对策略进行训练;其中,在延迟环境中,基于增广状态下策略网络输出的连续且稳定的动作获得延迟后的反馈,价值网络结合时序差分、隐空间特征对齐和动作价值对齐的损失对所述策略进行优化训练;S5、对经训练的策略进行验证和应用;其中,将经训练的策略应用于设定在多关节接触动力学机器人平台的遥操作机器人任务,并通过固定延迟以及采用不同策略进行实验验证,使得经训练的策略在各种延迟场景下实现遥操作机器人的动作控制。
2.根据权利要求1所述的一种基于隐空间对齐的遥操作机器人动作控制方法,其特征在于,在S1中,在遥操作机器人执行的任务中,操作端与执行端之间的通信链路中存在延迟 d ,使得操作端在时刻 t 所接收的存在延迟的状态 s t-d 滞后于不存在延迟的状态 s t ;延迟环境下马尔可夫建模中的决策过程由六元组 进行表征;其中:X 表示延迟状态空间, 表示时刻 t 时延迟状态空间的状态, ,由非延迟状态空间S与过去 d 个历史动作序列组成;A 表示动作空间; 表示时刻 t 时的动作,延迟状态空间 X 中的状态 , 为历史动作序列,下标表示时刻; 表示延迟环境下的初始状态分布, , 表示延迟环境下的初始状态, s 0 表示非延迟环境下的初始状态, 表示非延迟环境下的初始状态分布, 表示狄拉克函数, ,表示遥操作机器人与非延迟环境进行交互的前 d 个状态不可观测的时刻, 表示状态不可观测时的动作序列, 表示状态不可观测时动作空间中的动作序列,初始状态指 t =0;P 表示转移函数,且有:其中, 表示在状态 下执行动作 后转移至状态 的概率, 表示在状态 s t-d 下执行动作 后转移至状态 s t-d+1 的概率;其中, 表示在状态 下 t-d+j 时刻的动作, 表示在状态 下 t-d+j 时刻的动作, , 表示在状态 下 t 时刻的动作;R 表示奖励函数;由于在 t 时刻仅观测到 t-d 时刻的状态,则奖励函数被配置为 , 表示在状态 下执行动作 获得的奖励, 表示在状态 s t-d 下执行动作 获得的奖励; 表示折扣因子, ;其中,策略表示为 , 表示策略网络。
3.根据权利要求2所述的一种基于隐空间对齐的遥操作机器人动作控制方法,其特征在于,在S2中,在所述延迟环境下,策略网络根据历史观测与动作序列生成控制指令,策略网络以 为输入,以 s t-d 为存在延迟的状态,以 为历史动作序列,策略网络的输出为连续且稳定的动作 ,且有 , 表示由具有网络参数 的神经网络构成的策略网络;其中:遥操作机器人接收延迟环境返回的状态,从经验回放池中提取对应的历史动作序列,以构建增广状态,策略网络对构建的增广状态进行处理,从而得到控制指令,所述控制指令指待执行的连续且稳定的动作。
4.根据权利要求3所述的一种基于隐空间对齐的遥操作机器人动作控制方法,其特征在于,在S3中,在价值网络中引入隐空间编码与对齐机制,将真实状态映射至隐空间,通过隐空间特征对齐和动作价值对齐,使得价值网络与策略网络在优化目标上协同一致;其中:在价值网络隐空间编码过程中,价值网络隐空间编码器 将状态 映射到隐空间,得到 :其中, 属于实数域,隐空间维度为 , 表示价值网络隐空间编码器参数,隐空间编码用于提取状态 s t 中与决策相关的特征,价值网络以 和 为输入,输出针对 经评估的价值。
5.根据权利要求4所述的一种基于隐空间对齐的遥操作机器人动作控制方法,其特征在于,在S3中,隐空间特征对齐包括:利用增广状态编码器 将状态 映射至隐空间,得到 :通过最小化 与 之间的欧氏距离,实现隐空间特征对齐,隐空间特征对齐过程 表示为:其中, D 表示经验回放池, 表示从 D 中采样数据 , 表示对从 D 中采样得到的数据 求期望。
6.根据权利要求5所述的一种基于隐空间对齐的遥操作机器人动作控制方法,其特征在于,在S3中,动作价值对齐过程 表示为:其中, 表示价值网络, 表示由具有网络参数 的神经网络构成的价值网络, 表示从 D 中采样数据 , 表示对从 D 中采样得到的数据 求期望。
7.根据权利要求6所述的一种基于隐空间对齐的遥操作机器人动作控制方法,其特征在于,在S4中,训练过程包括初始化、数据采集、延迟环境交互、网络更新、循环迭代五个阶段;其中:在初始化阶段:配置策略网络,用于输出当前时刻的控制指令,作为动作;配置价值网络,用于对动作价值进行评估,并复制生成目标价值网络以保持训练稳定性;创建编码器,用于将增广状态和真实状态映射至隐空间;设置网络更新比率 ;在数据采集阶段:在训练初期的前 d 个时间步以随机策略与延迟环境进行交互:执行随机动作并记录对应的延迟状态;将动作和延迟状态存入临时缓冲区 B ,用于构建增广状态。
8.根据权利要求7所述的一种基于隐空间对齐的遥操作机器人动作控制方法,其特征在于,在S4中,当训练步数超过 d 后,进入延迟环境交互阶段:从 B 中提取 s t-d 及 ,从而构建 , ;策略网络根据 输出 ,在延迟环境中执行 ,并获得 s t-d+1 与 ;将 s t-d+1 、 、 存入 B ;当训练步数超过2 d 后,从 B 中提取相关数据以构建 以及( s t, s t-1 ),并将 作为一条数据存入 D 。
9.根据权利要求8所述的一种基于隐空间对齐的遥操作机器人动作控制方法,其特征在于,在S4中:在网络更新阶段:从 D 中采样 N 条数据,表示为:其中, 表示第 k 条数据, ;计算:计算价值贝尔曼目标 : 表示价值网络, 表示由具有网络参数 的神经网络构成的价值网络,将由具有网络参数 的神经网络构成的价值网络作为目标价值网络, 表示使得 具有最大价值的动作;计算价值贝尔曼损失 :计算 和 ;计算总损失 :其中, 和 为调节系数;以 更新参数 , 表示梯度下降法;利用 指导策略更新;以 对参数 进行更新;在循环迭代阶段:重复执行延迟环境交互到网络更新的过程,直至训练结束。
10.一种基于隐空间对齐的遥操作机器人动作控制系统,其特征在于,所述系统包括处理单元,所述处理单元被配置为执行:针对延迟环境进行马尔可夫建模;其中,对遥操作机器人在通信与感知上存在延迟的实际运行环境进行马尔可夫建模,以确定存在延迟的增广状态与不存在延迟的真实状态在时间序列上的依赖关系,并进一步量化所述延迟对遥操作机器人的动作执行和状态观测产生的影响;基于所述延迟环境设计策略网络;其中,策略网络以所述增广状态作为输入,遥操作机器人在所述延迟环境下根据历史观测与动作序列生成控制指令,作为所述策略网络的输出,所述控制指令指待执行的连续且稳定的动作;执行价值网络隐空间的构建与对齐;其中,设计价值网络隐空间编码,从而将真实状态映射至隐空间,通过隐空间特征对齐和动作价值对齐,使得价值网络与策略网络在优化目标上协同一致,对齐机制针对所述延迟导致的输入分布差异;利用策略网络和价值网络对策略进行训练;其中,在延迟环境中,基于增广状态下策略网络输出的连续且稳定的动作获得延迟后的反馈,价值网络结合时序差分、隐空间特征对齐和动作价值对齐的损失对所述策略进行优化训练;对经训练的策略进行验证和应用;其中,将经训练的策略应用于设定在多关节接触动力学机器人平台的遥操作机器人任务,并通过固定延迟以及采用不同策略进行实验验证,使得经训练的策略在各种延迟场景下实现遥操作机器人的动作控制。



