1.一种基于人机协作的无人机具身认知对齐方法,其特征在于,所述方法包括:基于EmbodiedCity模拟器开发EIEA-EC数据集;所述EIEA-EC数据集包括不同的角度和不同的距离收集实体的观测图片,所述观测图片作为导航图上的离散节点以构建实体对齐任务;构建无人机具身认知对齐模型;所述无人机具身认知对齐模型包括问题建模模块,观察模块、预测模块以及行动模块;将所述实体对齐任务输入到所述无人机具身认知对齐模型中根据问题建模模块将具身交互式实体对齐问题建模为一个包括状态空间、动作空间、观测空间、状态转移函数、观测函数、奖励函数以及折扣因子的部分可观测马尔可夫决策过程;基于所述部分可观测马尔可夫决策过程,根据观察模块采用自我反思机制对每个已知的目标事实进行分别提问生成对各疑似实体的描述;所述预测模块采用零样本学习方法,将所述各疑似实体的描述以及掌握的目标事实输入到视觉语言模型中,输出目标预测结果;所述行动模块采用导航-提问机制,基于所述目标预测结果中实体的观察情况,切换导航或是提问行动,若执行导航行动,则选择一个没有被探索的实体并导航到附近获取观测图片,同时基于实体边界框在视图中的比例进行自适应距离控制,若执行提问行动,则采用对比提问方式,选择将两个已探索实体的观测图片输入视觉语言模型生成区分性问题,并通过与人类用户的对话获得关于目标事实的回答;根据所述预测模块采用零样本学习方法,将所述各疑似实体的描述以及掌握的目标事实输入到视觉语言模型中,输出目标预测结果,包括:基于共形预测理论构建目标预测方法,通过校准集 进行模型校准,定义非符合性函数 ,用于量化样本 的真实标签 在预测模型的输出中所代表的典型或符合行为的偏离程度,其中, 表示样本集合, 表示标签集合, 表示实数集;计算校准集分数集合的经验分位数;根据各疑似实体的描述以及掌握的目标事实构建测试样本 ,利用预测模型对每个可能的候选标签 计算非符合性分数 基于所述经验分位数和所述非符合性分数指导生成预测集,即目标预测结果 ,目标预测结果以至少 置信水平包含真实标签,满足 ,其中, 表示经验分位数, 表示预先设定的错误率。
2.根据权利要求1所述的方法,其特征在于,所述状态空间包括智能体决策所需的已知信息,表示为一个三元组 ,其中 表示当前对各实体的观察视图,由智能体以第一人称视角拍摄的实体的RGB图片构成; 表示从初始指令和后续对话中提取出的关于目标实体的事实集合; 记录了对当前对各实体的评估;所述动作空间包括三类动作,在每个时间步 ,智能体选择执行三类动作之一,即 , 表示智能体向实体 移动,旨在通过获得更近的视角来降低观察不确定性;提问 表示智能体向人类用户提出一个旨在消除歧义或获取新事实的问题 ;报告 表示智能体主动结束对齐过程,并向人类用户报告实体 即为目标实体;所述观测空间包括在时间步 ,智能体的观测包含了视觉和语言两个通道,即 ,当选择导航动作 时,智能体获得实体 的新的观察视图 ,即 ;当选择提问动作 时,智能体获得来自人类的回答 ,即 ;所述状态转移函数定义为 ,当选择导航动作 时,实体 的观察视图被更新,其实体评估也相应更新,当选择提问动作 时,智能体会从与人类用户的问答中提取新的事实 并更新事实集合,基于新的事实集合更新所有实体的评估结果,当选择报告动作 时,对齐过程结束,无需更新信念状态;所述奖励函数包括对齐结果奖励、导航成本奖励和对话成本奖励;所述对齐结果奖励为当智能体执行报告 动作,并且 时,说明对齐成功,获得正奖励,否则获得一个负奖励或零奖励;所述导航成本奖励为当智能体执行导航动作 时,采用移动距离或移动时间的负数来引入对导航动作的惩罚;所述对话成本奖励为当智能体执行提问动作 时,采用对话次数的负数来引入对导航动作的惩罚。
3.根据权利要求1所述的方法,其特征在于,基于EmbodiedCity模拟器开发EIEA-EC数据集,包括:在实体数据采集阶段,将实体模型放置在模拟器中,并随机生成初始观测角度 和观测距离 ;根据实体位置、初始观测角度和观测距离,收集智能体对实体的初始观测图片 ,其中 和 分别为图片的高度和宽度,将收集初始观测图片的位置记为 ;对于实体 ,其数据采集结果表示为 ,其中 包括了初始观测图片及其对应的坐标,其余的 包括了不同观测距离对应的图片和坐标;在采集到的实体数据的基础上构建基于导航图的EIEA任务,每个任务被建模为 ,其中 和 分别为导航图的节点集合和边集合, 为目标实体;在构建任务时,首先从实体集合中随机选择3-5个同种类型的实体,并从中随机选择一个作为目标实体,将任务中各实体不同距离的观察图片作为节点,并将节点进行全连接构成实体对齐任务。
4.根据权利要求1所述的方法,其特征在于,根据观察模块采用自我反思机制对每个已知的目标事实进行分别提问生成对各疑似实体的描述,包括:对于给定的目标事实集合 和实体视图 ,利用预定义提示词 对目标事实集合中的每个事实进行单独提问,限制视觉语言模型仅输出是、否、不知道三种回答,强制视觉语言模型对每个事实的认知状态进行评估,生成对各疑似实体的描述。
5.根据权利要求1所述的方法,其特征在于,所述目标预测方法包括:对于具身交互式实体对齐问题中的目标预测,给定目标事实列表 和 个疑似实体的观察描述 ,共同构成了预测模型输入 ,将每个实体都作为一个预测标签,其中有且只有一个实体 为真实标签,即目标实体,预测模型的输出为所有预测标签的概率。
6.根据权利要求1所述的方法,其特征在于,计算校准集分数集合的经验分位数为:其中, 表示第 个样本的非符合性分数, 表示校准集大小。
7.根据权利要求1所述的方法,其特征在于,根据所述行动模块采用导航-提问机制,基于所述目标预测结果中实体的观察情况,切换导航或是提问行动,包括:给定预测集及其探索标识符 和评分 ,当预测集存在至少两个已探索实体时,选择评分最高的两个实体执行提问行动 ;当预测集中未探索实体较多时,选择评分最高的未探索实体执行导航行动 ;通过自适应距离控制方法调整观察距离,使实体边界框满足约束条件,采用对比提问方法生成区分性问题,通过对比两个实体在多个方面的差异来获取目标事实;所述多个方面包括颜色、样式和结构。
8.根据权利要求7所述的方法,其特征在于,所述约束条件为:其中, 和 分别为边界框的左上角坐标和右下角坐标, 控制实体在视图中的最小占比, 控制实体在视图中的边界位置, 和 分别为观察图片的高度和宽度。
9.根据权利要求7所述的方法,其特征在于,所述对比提问方法包括差异识别阶段、问题构造阶段、去重过滤阶段、人机交互阶段和事实更新阶段;所述差异识别阶段为将两个疑似实体的观察图像 和 输入视觉语言模型,采用差异分析提示词 输出实体在多维度特征的具体差异描述;所述多维度特征包括颜色、样式、结构、姿势和性别;所述问题构造阶段为将差异描述 和已掌握事实集合 输入大语言模型,采用问题生成提示词 生成能够区分两个实体的二元选择问题 ;所述去重过滤阶段为确保生成的问题不与事实集合 中已有特征重复,避免对同一特征进行重复提问;所述人机交互阶段为通过自然语言对话 获取人类用户的回答,从中提取新的目标事实 ;所述事实更新阶段为执行 更新事实集合,并相应更新所有实体的评估 。