有效

一种基于观察-记录-决策机制的具身问答方法

鲍秉坤、游思思、邹佳怡
南京邮电大学

摘要

本发明提供了一种基于观察‑记录‑决策机制的具身问答方法,智能体通过多视角感知捕捉来自各个方向的RGB图像和深度图像,用于构建3D场景图并映射到2D语义地图上,同时,智能体在2D语义地图上标记每一个经过的位置,并动态更新未访问位置的权重,降低已标记经过区域中边界点的选择概率,基于观察阶段的2D语义地图,智能体根据观察的RGB图片辨别是否能够回答问题,若能的话直接生成响应,否则导航到新的区域重复上述步骤直到达到能或者最大步数,本发明通过构建语义地图和权重调控导航、专用VLM分析与双准则决策的融合设计,实现了智能体无冗余探索与精准问答的决策。