在审

策略探索模型训练方法、装置、计算机设备及存储介质

聂建政、李论通、彭佩玺、田永鸿
鹏城实验室

摘要

本申请实施例公开一种策略探索模型训练方法、装置、计算机设备及存储介质。其中,根据标注数据集确定出人类偏好奖励和人类非偏好奖励,根据人类偏好奖励和人类非偏好奖励构建奖励模型;在非标注数据集中确定出目标非标注数据的预设状态及其对应的第一探索策略;获取智能体根据第一探索策略以及预设状态与环境交互输出动作状态数据集和执行结果,将执行结果输入到奖励模型中输出奖励值,将奖励值设置在动作状态数据集中;确定动作状态数据集中每个动作状态组对应的动作价值和标签值;根据动作价值和标签值确定出每个动作状态组对应的评价值,根据预设探索策略和评价值对第一探索策略更新,实现策略探索模型迭代训练,直至训练完成。

暂无引用专利