有效

一种数据科学领域大语言模型评估方法、装置及存储介质

唐杰、张丹、周卞思宁
清华大学

摘要

本发明涉及数据科学技术领域,尤其是指一种数据科学领域大语言模型评估方法、装置、设备及计算机存储介质。本发明所述的大语言模型评估方法,从粗粒度的角度来看,首先汇总任务类型、函数和相应的代码的范围,然后,从细粒度的角度来看,根据特定的任务为每个函数的输出定义编程规则,并将结果与标准答案进行比较,最终,通过生成的测试用例集对目标大语言模型进行评估;本发明从综合的角度为每个子任务生成标准答案并定义特定的评估指标,从而能够面向更复杂的由多个子任务组成的现实世界任务的大语言模型评估。