有效

基于多头注意力冗余评估的大规模预训练模型迁移方法

纪荣嵘、周毅奕、吴穹、叶伟豪
厦门大学

摘要

本发明提供一种基于多头注意力冗余评估的大规模预训练模型迁移方法,所述方法包括:获取大规模预训练模型,在每个多头注意力模块前插入一个传播信息适配器;计算每一个多头注意力模块的偏好得分;将偏好得分按照从高到低排序,筛选出偏好得分最低的一定数量的多头注意力模块作为被跳过的模块;对于每一个被跳过的模块,用其同层的传播信息适配器替代,执行信息交换和模态路由,得到紧凑的网络模型;对所述紧凑的网络模型进行训练;训练完成后,将传播信息适配器与网络进行重参数化,得到训练后的模型。本发明方法可在保持或提高模型性能的同时显著减少模型的参数数量和推理时间,从而提高模型迁移效率。