1.一种基于增量学习的miRNA及其异构体家族信息识别方法,其特征在于,该方法包括以下步骤:步骤S1,构建miRNA成熟体及其异构体的家族信息识别问题的基准数据集;步骤S2,构建基于增量学习的miRNA成熟体及其异构体家族信息识别的基准模型;步骤2具体包括:步骤S21:设置融合编码层,将miRNA序列的One-hot编码表示和Nucleotide chemicalproperty即NCP编码表示相加聚合,得到miRNA序列融合编码表示,作为模型的输入;步骤S22:设置RNN层,有效捕获序列片段间的依赖关系;步骤S23:设置全连接层,用于进行线性变换,使得每个序列样本得到对应所有类别的输出;步骤S24:设置偏差校正层,用于对步骤S23定义的全连接层的输出结果进行校正;步骤S21具体包括:步骤S211:获取基准数据集中的miRNA序列;步骤S212:对步骤S211得到的miRNA序列进行One-hot编码,得到miRNA序列的One-hot编码表示;步骤S213:对步骤S211得到的miRNA序列进行NCP编码,得到miRNA序列的NCP编码表示;步骤S214:将步骤S212得到miRNA序列的One-hot编码表示和步骤S213得到的miRNA序列的NCP编码表示进行相加聚合,得到miRNA序列融合编码表示;步骤S3,选取旧家族信息识别的基准模型所使用的旧类别数据,和新类别数据合并,构建增量学习数据集;步骤S4,在全连接层添加新类别数量维度,在偏差校正层开放对新类别的校正函数,更新家族信息识别的基准模型;步骤S5,将增量学习数据集输入到更新后的家族信息识别的基准模型,在损失函数约束下进行训练;步骤S6,将待分类miRNA序列输入训练后的模型中,进行序列家族信息识别,得到家族分类结果。
2.如权利要求1所述的家族信息识别方法,其特征在于,步骤S1具体包括:步骤S11:从miRBase数据库下载数据,得到miRNA成熟体名称、miRNA成熟体的序列信息及其miRNA成熟体家族注释信息;步骤S12:从isomiRdb数据库下载数据,得到miRNA异构体的序列信息及其所对应的miRNA成熟体名称;步骤S13:将步骤S11得到的miRNA成熟体名称和步骤S12得到的异构体对应的miRNA成熟体名称进行比对,找到所有miRNA成熟体对应的异构体;步骤S14:根据步骤S11得到的miRNA成熟体家族注释信息,为步骤S13获得的miRNA成熟体对应的异构体添加家族注释信息,再进行统计、分析、筛选、去重、填充,完成miRNA成熟体及其异构体的家族信息识别问题的基准数据集的构建。
3.如权利要求2所述的家族信息识别方法,其特征在于,步骤S14具体包括:步骤S141:统计含异构体的miRNA家族数目,选择构建数据集的家族并确定这些家族的miRNA成熟体和异构体数据;步骤S142:对步骤S141确定的家族中的miRNA成熟体和异构体数据进行去重操作,得到去重的miRNA成熟体和异构体数据;步骤S143:统计并分析步骤S142得到去重的miRNA成熟体和异构体数据数目;步骤S144:先使用步骤S142得到的去重的miRNA成熟体来填充家族数据,家族数据中的剩余部分使用步骤S142得到的去重的异构体数据进行填充;每条记录保留miRNA成熟体和异构体的家族注释信息及其序列信息。
4.如权利要求1所述的家族信息识别方法,其特征在于,步骤S3具体包括:步骤S31:定义两个容器分别存储旧家族信息识别的基准模型所使用的旧类别中的部分训练数据和部分验证数据;步骤S32:将步骤S31得到的旧类别的部分训练数据连同新类别的所有训练数据一起放入数据池中,构成后续增量学习的训练数据集;步骤S33:将步骤S31得到的旧类别的部分验证数据连同新类别的部分验证数据一起放入数据池中,构成后续增量学习的验证数据集。
5.如权利要求1所述的家族信息识别方法,其特征在于,步骤S4具体包括:步骤S41:更新步骤S2中定义的家族信息识别的基准模型中的全连接层;步骤S42:更新步骤S2中定义的家族信息识别的基准模型中的偏差校正层。
6.如权利要求4所述的家族信息识别方法,其特征在于,步骤S5具体包括:步骤S51:将步骤S32得到的增量学习的训练数据集输入到步骤S4得到的更新后的家族信息识别的基准模型,在增量学习的总损失函数约束下进行增量学习训练模型中的RNN层和全连接层;步骤S52:冻结更新后的家族信息识别的基准模型中的RNN层和全连接层,使得在训练模型时这两层的参数不会更新;步骤S53:将步骤S33得到的增量学习的验证数据集输入到步骤S4得到的更新后的家族信息识别的基准模型,在softmax交叉熵损失函数约束下进行增量学习训练模型中的偏差校正层。