有效
强化学习框架下场景图骨架构建方法
李硕豪、杨佳鑫、张军、陈超、孙博良、雷军、于淼淼、李虹颖、李小飞
中国人民解放军国防科技大学
李
李硕豪 专利 64
中国人民解放军国防科技大学生物模型计算视觉识别计算模型系统
杨
杨佳鑫 专利 11
中国人民解放军国防科技大学视觉识别图像视频识别计算技术
张
张军 专利 102
中国人民解放军国防科技大学视觉识别图像视频识别生物模型计算
陈
陈超 专利 104
中国人民解放军国防科技大学计算模型系统生物模型计算计算技术
孙
孙博良 专利 55
中国人民解放军国防科技大学计算技术物理仪器视觉识别
雷
雷军 专利 48
中国人民解放军国防科技大学视觉识别图像视频识别生物模型计算
于
于淼淼 专利 11
中国人民解放军国防科技大学视觉识别图像视频识别生物特征识别
李
李虹颖 专利 7
中国人民解放军国防科技大学生物模型计算视觉识别图像视频识别
李
李小飞 专利 9
中国人民解放军国防科技大学视觉识别图像视频识别生物模型计算
摘要
本发明公开了强化学习框架下场景图骨架构建方法,包括:生成基于马尔科夫决策过程的图结构;构建图结构生成环境;构建图卷积策略网络,并对图卷积策略网络进行训练,在关系感知环境下以迭代的方式不断向候选子图中添加节点和边,最终形成图像的场景图骨架。本发明利用强化学习框架得到稀疏场景图骨架的问题,将场景图骨架的建立过程作为马尔科夫决策过程,利用强化学习得到一个稀疏的场景图骨架,构建了高信息度低复杂度的稀疏场景图骨架,为精确场景图骨架构建提供依据。
1.强化学习框架下场景图骨架构建方法,其特征在于,所述方法包括以下步骤:生成基于马尔科夫决策过程的图结构;构建图结构生成环境;构建图卷积策略网络,并对图卷积策略网络进行训练,在关系感知环境下以迭代的方式不断向候选子图中添加节点和边,最终形成图像的场景图;所述构建图结构生成环境,包括:在基于马尔科夫决策过程的图结构生成策略下,环境通过策略网络给出的动作以迭代的方式逐步建立场景图骨架,在每次迭代步骤中有五个组成部分,即状态表示、策略网络、动作、状态转移分布和奖励;状态空间:将环境的状态s t 定义为第t次迭代后生成的图结构G t ,每一次图结构的更新都受强化学习智能体的控制;动作空间:首先,定义一个候选子节点集合C={C 1 ,C 2 ,...,C s },集合中的节点在图生成的过程中不断被添加到候选子图中;然后,在第t次迭代过程中,定义扩展图为候选子图与候选子节点集合的并集,表示为G t ∪C,其中G t 为候选子图,C为候选子节点;动作分为三种类型:1)候选子图中在上一次迭代时未存在连接的两个节点进行连接,在此动作后候选子节点集合不发生变化;2)候选子图中的特定节点与候选子节点集合中的节点进行连接,此时将候选子节点中存在连接的节点移除;3)候选子节点集合中特定两个节点进行连接;此时将存在连接的两节点从候选子节点结合中移除;状态转移分布:将特定领域的动作规则纳入到状态转移分布中,对于场景图骨架生成任务,环境结合了数据集中对象间的连接规则,此连接规则是在对数据集中所有连接统计后得出,如果在数据集中对象与对象之间没有存在连接,那么这种结果被当作连接规则的一种;奖励函数:在场景图骨架生成环境中,强化学习智能体的动作被两类奖励函数指导,分别是中间奖励和最终奖励;其中,所述中间奖励包括特定领域规则奖励和对抗性奖励,如果动作不违反图构建规则,则根据数据集中的关系统计分配少量的正面奖励,否则分配少量的负面奖励;所述最终奖励定义为对抗性奖励和场景图正确率奖励的总和,其中,场景图正确率奖励从场景图分类任务中评价指标的召回率获得,采用生成性对抗网络来定义对抗性奖励V(π θ ,D φ )。
2.根据权利要求1所述的强化学习框架下场景图骨架构建方法,其特征在于,所述生成基于马尔科夫决策过程的图结构,包括:将图结构的生成过程表述为一个通用决策过程M=(S,A,P,R,γ),其中S={s i }是由所有可能的中间图和最终图组成的状态集,A={a i }是一组动作,描述在每个时刻对当前图结构的修改,P=p(s t+1 |s t ,s t-1 ,...,s 0 ,a t )为状态转移分布,表示执行一项行动可能产生结果的概率,其中s 0 ,…s t ,s t+1 为第0,…t,t+1时刻的图结构,a t 为第t时刻的动作,R(s t )为所设计的奖励函数,表示图结构达到状态s t 后的奖励,γ为折扣因子,用于减少未来的回报的对当前动作的影响;图结构生成的过程表示为一个迭代轨迹(s 0 ,a 0 ,r 0 ,...,s n ,a n ,r n ),其中s n 为最终生成的图结构,a n 为最终生成的动作,r n 为最终生成的奖励;图结构在每次迭代中会进行节点间边的增加,增加边后图结构的状态转移分布表示为:其中,p(a t |s t ,...,s 0 )为策略网络π θ ,π θ 为一种图卷积策略网络,采用马尔可夫决策过程的图结构生成过程,在这个过程中要求状态转移分布满足马尔可夫性质,即p(s t+1 |s t ,s t-1 ,...,s 0 ,a t )=p(s t+1 |s t ,a t );在此性质下,策略网络π θ 以当前时刻的图结构s t 为输入来生成下一步的执行动作,即确定哪两个节点应该连接或者确定整个生成过程停止。
3.根据权利要求1所述的强化学习框架下场景图骨架构建方法,其特征在于,其中,所述生成性对抗网络的构建过程表示为:其中,π θ 为策略网络;p data 定义了最终图或中间图的数据分布情况,所述最终图用于最终奖励,所述中间图用于中间奖励;D φ 为判别器网络,x表示输入的图结构,D φ (x)∈[0,1]是判别模型的输出结果,用来判断图结构的合理程度;E表示数学期望;由于x是一个对参数φ不可微的图数据,因此只有判别器D φ 用随机梯度下降来训练,而对于策略网络,引入策略梯度方法对其进行训练。
4.根据权利要求3所述的强化学习框架下场景图骨架构建方法,其特征在于,在场景图骨架生成环境中,采用图卷积策略网络计算动作引起的状态转移概率,图卷积策略网络包括:图卷积策略网络的输入是候选子图和候选子节点集,输出为当前迭代步骤将要发生的动作,网络最终的结构和参数是强化学习智能体学习的目标;节点嵌入特征计算:为了能够在扩展图G t ∪C中预测当前迭代步骤的动作,利用图卷积网络来计算节点的嵌入特征;通过L层的图卷积网络,对图中的每个连接执行共L层的消息传递;在网络的第l层,节点的嵌入过程如下:其中, A为图结构的邻接矩阵,I是对角线为1其余值为0的单位矩阵, D为图结构的度矩阵,W (l) 为图卷积网络第l层训练的参数,H (0) 为对象节点的深度特征,此为FasterR-CNN网络ROI池化层的输出,X=H (L) ,H (l) ,H (l+1) 分别是第l层和l+1层神经网络结点输出的深度特征;动作预测:在第t次迭代步骤中,动作的预测是三个组件的串联:即两个节点的选择和终止的预测,表示为a t =CONCAT(a start ,a end ,a stop ),a start 和a end 是选择的两个节点,a stop 是终止节点,每个组件通过基于神经网络表示的预测分布进行采样,当a stop =1时,强化学习环境下图结构的迭代过程结束,当前图结构为生成的初始场景图骨架。
5.根据权利要求4所述的强化学习框架下场景图骨架构建方法,其特征在于,策略梯度训练包括:采用近端策略优化PPO来训练图卷积策略网络,PPO的目标函数定义如下:其中,π θold (a t |s t )为更新前的策略网络,π θ (a t |s t )为更新后的策略网络,r t (θ)为网络更新前后策略网络输出的比值,且被截断到[1-ε,1+ε]区间,作用是将L CLIP (θ)成为保守策略迭代目标的下限,clip为操作符,表示如果第一项小于第二项,最终值取第二项,如果第一项值大于第三项,最终值取第三项,如果在二者之间,则保持自己的值;ε是训练中需要调整的超参数,A t 为优势函数,描述了在状态s t 下所采取的动作随机采取一个动作的优势,评价动作的值函数是生成对抗网络中的判别函数,其原理为先将图嵌入,然后利用多层感知器进行评分。



