有效
一种基于观察-记录-决策机制的具身问答方法
鲍秉坤、游思思、邹佳怡
南京邮电大学
摘要
本发明提供了一种基于观察‑记录‑决策机制的具身问答方法,智能体通过多视角感知捕捉来自各个方向的RGB图像和深度图像,用于构建3D场景图并映射到2D语义地图上,同时,智能体在2D语义地图上标记每一个经过的位置,并动态更新未访问位置的权重,降低已标记经过区域中边界点的选择概率,基于观察阶段的2D语义地图,智能体根据观察的RGB图片辨别是否能够回答问题,若能的话直接生成响应,否则导航到新的区域重复上述步骤直到达到能或者最大步数,本发明通过构建语义地图和权重调控导航、专用VLM分析与双准则决策的融合设计,实现了智能体无冗余探索与精准问答的决策。
1.一种基于观察-记录-决策机制的具身问答方法,其特征在于,包括以下步骤:观察阶段,智能体通过多视角感知捕捉来自各个方向的RGB图像和深度图像,用于构建3D场景图并映射到2D语义地图上;记录阶段,智能体在2D语义地图上标记每一个经过的位置,并动态更新未访问位置的权重,降低已标记经过区域中边界点的选择概率;决策阶段,基于观察阶段的2D语义地图,智能体根据观察的RGB图片辨别是否能够回答问题,若能的话直接生成响应,否则导航到新的区域重复上述步骤直到达到能或者最大步数;所述智能体在2D语义地图上标记每一个经过的位置是基于边界的探索方法的基础上建立的,所述基于边界的探索方法具体过程为:智能体首先在 上识别已探索区域和未探索区域边界处的边界点,边界点是位于已探索自由空间和未探索区域之间的边界上的点;遍历地图,找到周围找到所有满足以下条件的体素:由深度图得到的没有障碍物的区域;每次更新后没有标记过的区域;至少有一个相邻体素标记为已经过;最后使用连通域分析,将相邻边界单元格聚合成区域集合F(f),F(f)即表示为边界点的集合;对于每个边界点 ,使用PrismaticVLM来提供一个选择概率 ,该概率表示边界点 被选为下一个位置的可能性;该概率由当前视图中所有边界点的归一化探索概率 和图像探索概率 计算得出:其中,E()表示温度标度融合函数,G()表示高斯平滑函数,智能体最终选择其当前位置周围权重最高的边界点作为导航目标;归一化探索概率 是当前视图RGB图像中用PrismaticVLM标记的三个候选方向上的归一化VLM置信度:其中 是在t时捕获并选择的第k张RGB图像,图像探索概率 表示PrismaticVLM对当前视图是否值得导航的响应为是的归一化概率:这两个概率均通过E()进行温度缩放;其中,Prompt5表示输出当前视图RGB图像中不同候选方向上的归一化探索概率,Prompt6表示输出当前视图是否值得探索的响应为是的归一化概率; , 用于控制方向偏好和视觉相关性的相对影响,取值由任务场景的优先级需求、PrismaticVLM 模型的输出特性、实验验证的最优目标共同决定;此外,使用高斯函数G()对相邻的边界点进行平滑处理,减少边界点的噪声;所述动态更新未访问位置的权重,降低已标记经过区域中边界点的选择概率过程如下:设全局二维语义地图 上所有元素的权重初始化为 ;当到达新位置 时,以 为中心,创建一个已访问圆 ;所有已访问圆内的位置权重均降低:其中,(x,y)表示元素在全局二维语义地图中的坐标, 表示截至当前步骤t的累计探索区域,此更新在每个步骤中逐步执行,地图会永久记录所有已探索区域;wunvisited被直接纳入边界选择,从而得出最终的探索概率:其中, 是边界点f处地图元素的当前权重。
2.如权利要求1所述一种基于观察-记录-决策机制的具身问答方法,其特征在于:所述智能体通过多视角感知捕捉来自各个方向的RGB图像和深度图像过程如下:在第一步t=0时,智能体在未知环境处于初始化位置,通过旋转从初始方向到两侧45°以及90°的不同角度捕捉到从左到右的多张RGB图像和深度图像 {k=0,1,2,3};其中,k表示图像的索引,t表示时间步,I表示RGB图像,D表示深度图像, 表示在t时的第k张深度图。
3.如权利要求2所述一种基于观察-记录-决策机制的具身问答方法,其特征在于:所述构建3D场景图并且映射到2D语义地图上的具体过程如下:首先,通过截断符号函数,将集合 {k=0,1,2,3}融合为一个基于体素的三维地图,具体的转化过程语义地图的过程如下:构建3D体素地图,使用TSDF Fusion术来处理深度图;在时间步t=0,即机器人在初始化位置时,获取深度图 ;通过TSDF Fusion算法将深度图 投影到全局3D体素地图M中;输出处理全部深度图的图的全局3D体素地图M,该地图能够根据体素的深度值判断环境中物体的位置、形状与几何结构;把3D体素地图映射成2D语义地图:几何信息的投影:将全局3D体素地图M通过正交投影的方式,投影到二维平面上,得到2D几何地图 ;语义信息的生成与融合:将时间步t时捕捉的RGB图像集合 {k=0,1,2,3}与用户的问题Q,输入到VLM模型中,生成与问题相关的语义信息;2D 语义地图的生成:将2D几何地图 与语义信息进行融合,得到全局 2D 语义地图 ;该地图同时包括环境的几何结构与语义信息;对于后续的时间步,智能体每移动到一个新的位置,都会通过多视角感知获取新的图像集合,并重复构建3D场景图并且映射到2D语义地图,实现3D体素地图与2D语义地图的动态更新。
4.如权利要求3所述一种基于观察-记录-决策机制的具身问答方法,其特征在于:所述语义信息的生成与融合具体过程如下:智能体将RGB图像集合 {k=0,1,2,3}按比例缩放并排列成2×2的网格,然后拼接成单个合成图像 与问题Q进行配对;由智能体使用两个专用的prompt进行处理。
5.如权利要求4所述一种基于观察-记录-决策机制的具身问答方法,其特征在于:所述由智能体使用两个专用的prompt进行处理具体流程如下:Prompt1是识别与问题Q最相关的视图,具体为:识别合成图像中与问题Q最相关的单个视图,并输出该视图的索引k,索引的取值范围为0,1,2,3;Prompt2是评估此合成图像与回答问题Q的相关性,具体为:评估合成图像与回答问题Q的相关性,并输出一个标量分数 ,分数的取值范围为0到10,其中0表示最不相关,10表示最相关;该分数 是决策阶段的三元组相关性终止准则的关键信号。
6.如权利要求1所述一种基于观察-记录-决策机制的具身问答方法,其特征在于:所述决策阶段:智能体根据观察的RGB图片辨别是否能够回答问题,若能的话直接生成响应,否则导航到新的区域重复上述过程直到达到停止标准或者最大步数,在停止决策过程中,采用双准则机制,VLM直接判断和三元组相关性终止,当任一准则被触发时,智能体将停止探索并生成答案。
7.如权利要求6所述一种基于观察-记录-决策机制的具身问答方法,其特征在于:所述VLM直接判断包括:利用VLM输出“是”或“否”,以指示能否根据当前选定的第k个图像 回答问题Q,并由提示Prompt3引导:其中Prompt3表示基于提供的当前视图RGB图像,判断是否能够准确回答问题 Q是否能够回答。
8.如权利要求6所述一种基于观察-记录-决策机制的具身问答方法,其特征在于:所述三元组相关性终止包括:TRT确保智能体在与问题相关的区域停止,从而生成基于证据的答案,在每个时间步t,智能体从多视角感知模块提供分数 ,并从记忆引导导航模块检索已探索的圆形区域 ,当 >0时,区域 被认为与问题相关,并添加到相关区域集合中,记为 ;当在二维语义地图上找到三个这样的相关区域时,探索过程终止,具体来说,如果 中存在三个中心坐标彼此相距不超过2米的区域,则智能体停止探索,并根据Prompt4生成答案a:其中,Prompt4 表示生成对应问题Q的答案。



