有效
面向数据分级分类的大模型细粒度访问控制方法和装置
孙毅、张可、吴振亚、张慧、丁鲲、刘茗、翁年凤、蒋国权
中国人民解放军国防科技大学
摘要
本申请涉及一种面向数据分级分类的大模型细粒度访问控制方法和装置。所述方法包括:对用户问题进行文本权限分级分类标注与合规性检测,获取基于用户问题的访问策略;通过两步检索获取用户问题对应的参考文档集合,并通过访问大语言模型,获取用户问题的整体答复;对每份参考文档进行文本权限分级分类标注与合规性检测,获取基于参考文档的访问策略;将每份参考文档及对应的基于参考文档的访问策略输入大语言模型进行访问,获取每份参考文档的答复,通过整理用户问题以及每份参考文档的答复,得到大语言模型输出的用户问题的最终答复。采用本方法能够通过文本数据权限分级分类标注与合规性检测,实现大语言模型的准确安全访问。
1.一种面向数据分级分类的大模型细粒度访问控制方法,其特征在于,所述方法包括:获取用户信息以及对应的用户问题,通过将所述用户问题输入预先构建的权限标注模型进行文本权限标注,获取用户问题权限的分级分类标注结果,并通过将所述用户问题权限的分级分类标注结果与用户信息中的用户访问权限输入访问策略引擎进行合规性检测,判断用户问题是否合规并获取基于用户问题的访问策略;对于合规问题或部分合规问题,首先输入至两步检索模型进行相关性文档检索,得到用户问题对应的参考文档集合,再将用户问题、基于用户问题的访问策略以及所述参考文档集合输入大语言模型进行访问,获取用户问题的整体答复;对于不合规问题,在输入大语言模型进行访问后,直接输出拒绝回答的答复;将所述参考文档集合中的每份参考文档输入至权限标注模型进行文本权限标注,获取每份参考文档权限的分级分类标注结果,并通过将所述每份参考文档权限的分级分类标注结果与用户访问权限输入访问策略引擎进行合规性检测,判断每份参考文档是否合规并获取基于参考文档的访问策略;将每份参考文档及对应的基于参考文档的访问策略输入大语言模型进行访问,获取每份参考文档的答复,通过整理用户问题以及每份参考文档的答复,得到大语言模型输出的用户问题的最终答复。
2.根据权利要求1所述的方法,其特征在于,以用户问题为例,所述权限标注模型进行文本权限标注的过程,包括:构建分级分类标签库 及对应的分级分类样例库 ,且 ;其中, 表示样本到分级分类标签的映射关系, 表示分级分类标签库中的第 m 个标签, 表示分级分类样例库中的第 n 个文档,每个标签对应若干个文档;对于输入的用户问题 ,首先,基于向量检索模型,在分级分类样例库 中采用向量检索的方式获取由用户问题 的两个最相似文档组成的相似文档集合 ,并获取两个最相似文档对应的标签 ;其中, 和 表示 的两个最相似文档, 表示向量检索模型;然后,采用K最邻近算法,搜索 在分级分类标签库 中的邻近标签,并获取邻近标签对应的文档,对所述相似文档集合中的文档数量进行扩展,得到参考示例 ;将所述参考示例 、用户问题 以及提示模板 输入大语言模型进行权限预测和实体抽取,得到用户问题 权限的分级分类标注结果,表示为 ;其中, 表示预测得到的用户问题 权限的标签类别, 表示抽取得到的用户问题 的实体集合, 表示基于大语言模型的标注模型, 表示标注结果,即标签类别和实体集合。
3.根据权利要求2所述的方法,其特征在于,通过将用户问题权限的分级分类标注结果与用户信息中的用户访问权限输入访问策略引擎进行合规性检测,判断用户问题是否合规并获取基于用户问题的访问策略,包括:将用户问题 权限的标签类别、用户问题 的实体集合以及用户访问权限输入访问策略引擎进行合规性检测,判断用户问题合规或部分合规或不合规,并获取基于用户问题的访问策略 ;其中, 表示用户信息, 表示用户的访问权限矩阵,包括用户的机构、业务、领域、层级、职务以及任务, 表示用户个人基本信息,包括用户的姓名和性别,下标 k 表示第 k 个用户。
4.根据权利要求3所述的方法,其特征在于,对于合规问题或部分合规问题,首先输入至两步检索模型进行相关性文档检索,得到用户问题对应的参考文档集合,再将用户问题、基于用户问题的访问策略以及所述参考文档集合输入大语言模型进行访问,获取用户问题的整体答复,包括:若用户问题 合规或部分合规,将用户问题 输入两步检索模型,所述两步检索模型先采用较小参数的向量检索模型进行初步检索,得到用户问题 最相关的200个文档,然后采用较大参数的向量检索模型进行重排序,得到用户问题 最相关的10个文档组成用户问题 的参考文档集合 ,表示为 ;其中, 表示用于重排序的向量检索模型, 表示用于初步检索的向量检索模型, 表示初步检索得到的文档集合, 表示文档库中所有文档的集合;将用户问题 、基于用户问题的访问策略 、参考文档集合 以及提示模板 输入大语言模型进行访问,得到用户问题 的整体答复 ,表示为 ;其中, 表示大语言模型。
5.根据权利要求4所述的方法,其特征在于,将所述参考文档集合中的每份参考文档输入至权限标注模型进行文本权限标注,获取每份参考文档权限的分级分类标注结果,并通过将所述每份参考文档权限的分级分类标注结果与用户访问权限输入访问策略引擎进行合规性检测,判断每份参考文档是否合规并获取基于参考文档的访问策略,包括:将参考文档集合 中的每份参考文档输入至所述权限标注模型进行文本权限标注,获取每份参考文档权限的标签类别以及对应的实体集合;将每份参考文档权限的标签类别、每份参考文档对应的实体集合以及用户访问权限输入访问策略引擎进行合规性检测,判断每份参考文档合规或不合规,并获取基于参考文档的访问策略 ;其中, 表示用户信息, 表示用户的访问权限矩阵,包括用户的机构、业务、领域、层级、职务以及任务, 表示用户个人基本信息,包括用户的姓名和性别,下标 k 表示第 k 个用户; 表示第 j 个参考文档。
6.根据权利要求5所述的方法,其特征在于,将每份参考文档及对应的基于参考文档的访问策略输入大语言模型进行访问,获取每份参考文档的答复,包括:若参考文档 合规,将用户问题 、参考文档 、基于参考文档的访问策略 以及提示模板 输入大语言模型进行访问,获取参考文档 的答复 ,表示为 ;其中, 表示大语言模型;若参考文档 不合规,在输入大语言模型进行访问后,直接输出拒绝回答的答复。
7.根据权利要求6所述的方法,其特征在于,通过整理用户问题以及每份参考文档的答复,得到大语言模型输出的用户问题的最终答复,包括:整理用户问题 以及每份参考文档 的答复 ,并采用提示模板 ,得到大语言模型输出的用户问题 的最终答复,表示为 。
8.根据权利要求7所述的方法,其特征在于,所述方法还包括:基于LoRA算法对所述大语言模型进行微调,大语言模型原有参数为 ,该部分参数训练时固定不变,大语言模型的可训练参数为权重 ,其中,矩阵 ,矩阵 ;在初始化时,矩阵 通过高斯函数初始化,矩阵 为零初始化,使得训练开始之前旁路对原大语言模型不造成影响,即参数变化量为0;对于该权重 的输入 来说,输出如下: ;其中, 表示实数集合, 、 和 分别表示参数维度。
9.根据权利要求8所述的方法,其特征在于,所述大语言模型的损失函数为负对数似然损失,表示为 ;其中, 表示负对数似然损失的值, 表示输入文本的长度, 为当前词元, 表示输入文本, 表示当前词元之前的文本, 表示被微调的模型参数, 表示基于当前词元之前的文本和模型参数,预测出当前词元 的概率。
10.一种面向数据分级分类的大模型细粒度访问控制装置,其特征在于,所述装置包括:用户问题合规性检测模块,用于获取用户信息以及对应的用户问题,通过将所述用户问题输入预先构建的权限标注模型进行文本权限标注,获取用户问题权限的分级分类标注结果,并通过将所述用户问题权限的分级分类标注结果与用户信息中的用户访问权限输入访问策略引擎进行合规性检测,判断用户问题是否合规并获取基于用户问题的访问策略;参考文档检索与整体答复模块,用于对于合规问题或部分合规问题,首先输入至两步检索模型进行相关性文档检索,得到用户问题对应的参考文档集合,再将用户问题、基于用户问题的访问策略以及所述参考文档集合输入大语言模型进行访问,获取用户问题的整体答复;对于不合规问题,在输入大语言模型进行访问后,直接输出拒绝回答的答复;参考文档合规性检测模块,用于将所述参考文档集合中的每份参考文档输入至权限标注模型进行文本权限标注,获取每份参考文档权限的分级分类标注结果,并通过将所述每份参考文档权限的分级分类标注结果与用户访问权限输入访问策略引擎进行合规性检测,判断每份参考文档是否合规并获取基于参考文档的访问策略;答复输出模块,用于将每份参考文档及对应的基于参考文档的访问策略输入大语言模型进行访问,获取每份参考文档的答复,通过整理用户问题以及每份参考文档的答复,得到大语言模型输出的用户问题的最终答复。




