1.一种大语言模型评估方法,其特征在于,包括:定义典型数据科学任务类型,并收集包含至少一个典型数据科学任务类型的问题,建立问题集;通过大语言模型为所述问题集中的每个问题生成答案并进行验证,得到验证通过的标准答案;为不同的典型数据科学任务类型定义相应的评估函数,对每个典型数据科学任务类型的评估函数进行函数类别聚合,得到每个典型数据科学任务类型的聚合评估函数:为不同的典型数据科学任务类型定义相应的评估函数;根据所述评估函数为每个问题生成相应的评估代码;对每个问题的所述典型数据科学任务类型、所述评估函数和相应的评估代码封装为一个三元组;基于所述三元组为每个问题创建一个层次结构中的有向无环图;利用大语言模型执行所述评估函数,获得每个典型数据科学任务类型的预期结果,作为评估大语言模型的基准;根据所述聚合评估函数为每个问题生成相应的评估代码,并结合每个问题对应的标准答案,生成大语言模型评估的测试用例集:根据所述聚合评估函数为每个问题生成相应的评估代码;通过判断所述聚合评估函数相应的评估代码的预测输出和标准答案之间的一致性确定评估结果,并将评估结果统一为0到1之间的布尔类型或十进制类型;对于所述十进制类型的评估结果,通过设置相应的阈值,将其转换为布尔值;基于所述测试用例集对目标大语言模型进行评估。
2.根据权利要求1所述的大语言模型评估方法,其特征在于,所述典型数据科学任务类型包括但不限于:数据清理和预处理任务、数据探索和统计任务、数据可视化任务、预测建模任务、数据挖掘和模式识别任务和可解释性和报告生成任务。
3.根据权利要求1所述的大语言模型评估方法,其特征在于,所述收集包含至少一个典型数据科学任务类型的问题,建立问题集包括:从预设渠道收集所述问题,所述预设渠道包括但不限于:实际编程问题中的数据科学任务问题、代码库中的数据科学任务问题、通过大语言模型生成的数据科学任务问题和由领域专家设计的数据科学任务问题;对所述问题通过预设过滤规则进行过滤,所述预设过滤规则包括但不限于:关键字筛选过滤,需要代码更新、错误查找或概念解释的排除过滤以及需要编写与人类偏好和大语言模型一致性的排除过滤;对过滤后的问题的正确性、适用性和评估容易度进行审查;对通过审查的问题的进行格式化处理,并确保数据的可用性。
4.根据权利要求1所述的大语言模型评估方法,其特征在于,所述通过大语言模型为所述问题集中的每个问题生成答案并进行验证,得到验证通过的标准答案包括:针对每个问题,对大语言模型进行多次采样,生成多个答案代码片段和对应的答案输出;通过预设测试用例验证答案输出,或,采用自一致性策略对所有生成的答案代码片段进行交叉验证;将通过验证的答案确定为标准答案。
5.根据权利要求1所述的大语言模型评估方法,其特征在于,所述对每个典型数据科学任务类型的评估函数进行函数类别聚合,得到每个典型数据科学任务类型的聚合评估函数包括:对每个典型数据科学任务类型,选择K个最优评估函数;基于所述K个最优评估函数,将每个典型数据科学任务类型的所有评估函数聚类为K个聚类评估函数。
6.一种大语言模型评估装置,其特征在于,包括:数据获取模块,用于定义典型数据科学任务类型,并收集包含至少一个典型数据科学任务类型的问题,建立问题集;数据处理模块,用于通过大语言模型为所述问题集中的每个问题生成答案并进行验证,得到验证通过的标准答案;评估函数构建模块,用于为不同的典型数据科学任务类型定义相应的评估函数,对每个典型数据科学任务类型的评估函数进行函数类别聚合,得到每个典型数据科学任务类型的聚合评估函数:为不同的典型数据科学任务类型定义相应的评估函数;根据所述评估函数为每个问题生成相应的评估代码;对每个问题的所述典型数据科学任务类型、所述评估函数和相应的评估代码封装为一个三元组;基于所述三元组为每个问题创建一个层次结构中的有向无环图;利用大语言模型执行所述评估函数,获得每个典型数据科学任务类型的预期结果,作为评估大语言模型的基准;测试用例集构建模块,用于根据所述聚合评估函数为每个问题生成相应的评估代码,并结合每个问题对应的标准答案,生成大语言模型评估的测试用例集:根据所述聚合评估函数为每个问题生成相应的评估代码;通过判断所述聚合评估函数相应的评估代码的预测输出和标准答案之间的一致性确定评估结果,并将评估结果统一为0到1之间的布尔类型或十进制类型;对于所述十进制类型的评估结果,通过设置相应的阈值,将其转换为布尔值;目标评估模块,用于基于所述测试用例集对目标大语言模型进行评估。
7.一种大语言模型评估设备,其特征在于,包括:存储器,用于存储计算机程序;处理器,用于执行所述计算机程序时实现如权利要求1至5任一项所述一种大语言模型评估方法的步骤。
8.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质上存储有计算机程序,所述计算机程序被处理器执行时实现如权利要求1至5任一项所述一种大语言模型评估方法的步骤。