有效
纤维素降解菌的筛选方法及系统
田晨、李锟、陈祥、曹光荣、陈亚松、王先恺、刘枫、王航、乔雪园
三峡环境科技有限公司
摘要
本申请实施例提供一种纤维素降解菌的筛选方法及系统。该方法包括:确定待检测样品中所有待筛选微生物的所有基因及所有基因的第一基因丰度数据;基于功能基因集,从所有基因中筛选出多个目标基因;根据第一基因丰度数据,确定多个目标基因的第二基因丰度数据;根据第二基因丰度数据,确定每个待筛选微生物的纤维素降解分数;根据每个待筛选微生物的纤维素降解分数筛选出所有待筛选微生物中的纤维素降解菌。能够进行高通量筛选,同时分析大量待筛选微生物,提高了筛选效率。
1.一种纤维素降解菌的筛选方法,其特征在于,包括:确定待检测样品中所有待筛选微生物的所有基因及所述所有基因的第一基因丰度数据,其中所述第一基因丰度数据为所述所有基因中每个基因在每个待筛选微生物的基因丰度值;基于功能基因集,从所述所有基因中筛选出多个目标基因,其中所述功能基因集包括多个用于指示纤维素降解功能的功能基因;根据所述第一基因丰度数据,确定所述多个目标基因的第二基因丰度数据,其中所述第二基因丰度数据为所述多个目标基因中每个目标基因在所述每个待筛选微生物的基因丰度值;根据所述第二基因丰度数据,确定所述每个待筛选微生物的纤维素降解分数;根据所述每个待筛选微生物的纤维素降解分数筛选出所述所有待筛选微生物中的纤维素降解菌;所述根据所述第二基因丰度数据,确定所述每个待筛选微生物的纤维素降解分数,包括:根据所述第二基因丰度数据和所述第一基因丰度数据,确定每个目标基因的第一预设数量的对照基因及第三基因丰度数据,其中所述第三基因丰度数据为所述每个目标基因的第一预设数量的对照基因在所述每个待筛选微生物的基因丰度平均值;确定所有目标基因的基因属性向量,其中所述基因属性向量用来指示所述所有目标基因的激活属性或者抑制属性;根据所述基因属性向量、所述第二基因丰度数据和所述第三基因丰度数据,计算得到所述每个待筛选微生物的纤维素降解分数。
2.根据权利要求1所述的方法,其特征在于,所述根据所述第二基因丰度数据和所述第一基因丰度数据,确定每个目标基因的第一预设数量的对照基因及第三基因丰度数据,包括:对所述第一基因丰度数据进行求和,以得到所述所有基因中每个基因在所述每个待筛选微生物的基因丰度总值;对所述每个基因的所述基因丰度总值按照大小进行排序,以生成丰度序列;基于所述丰度序列,将所述所有基因分为第二预设数量的组别;确定所述所有目标基因所在的组别,并针对所述每个目标基因从所属组别中随机选取所述第一预设数量的对照基因,以生成多组第一预设数量的对照基因;根据所述第一基因丰度数据,获取每组第一预设数量的对照基因在所述每个待筛选微生物的基因丰度平均值,以生成第三基因丰度数据。
3.根据权利要求1所述的方法,其特征在于,所述根据所述基因属性向量、所述第二基因丰度数据和所述第三基因丰度数据,计算得到所述每个待筛选微生物的纤维素降解分数,包括:根据所述第二基因丰度数据生成第一基因丰度矩阵;根据所述第三基因丰度数据生成第二基因丰度矩阵;根据所述基因属性向量、所述第一基因丰度矩阵和所述第二基因丰度矩阵,计算得到降解分数矩阵,其中所述降解分数矩阵包括所述每个待筛选微生物的纤维素降解分数。
4.根据权利要求1至3任一项所述的方法,其特征在于,所述根据所述每个待筛选微生物的纤维素降解分数筛选出所述所有待筛选微生物中的纤维素降解菌,包括:根据所述每个待筛选微生物的纤维素降解分数对所述每个待筛选微生物进行排序,以得到降解分数序列;根据所述降解分数序列筛选出所述所有待筛选微生物中的纤维素降解菌。
5.根据权利要求1至3任一项所述的方法,其特征在于,所述确定待检测样品中所有待筛选微生物的所有基因及所述所有基因的第一基因丰度数据,包括:对待检测样品进行宏基因组测序,并对得到的测序数据进行数据预处理以得到所述待检测样品中每个待筛选微生物的每个重叠群对应的每百万转录本数TPM值;根据所述每个待筛选微生物的每个重叠群对应的TPM值,计算所述每个待筛选微生物的标准丰度值;根据所述每个待筛选微生物的标准丰度值,计算所述所有基因中每个基因在所述每个待筛选微生物的基因丰度值,以生成第一基因丰度数据。
6.根据权利要求1至3任一项所述的方法,其特征在于,所述确定所有待筛选微生物的所有基因及所述所有基因的第一基因丰度数据之前,还包括:从预设的数据库中获取与纤维素降解相关的通路信息;根据所述通路信息获取与纤维素降解相关的纤维素酶及所述纤维素酶的基因;从预设的数据库中获取用于调控所述纤维素酶的调控基因;根据所述纤维素酶的基因和所述调控基因,生成所述功能基因集。
7.根据权利要求6所述的方法,其特征在于,所述调控基因包括转录激活因子基因和转录抑制因子基因。
8.根据权利要求3所述的方法,其特征在于,计算得到降解分数矩阵的公式为:式中,D为降解分数矩阵;X为第一基因丰度矩阵;B为第二基因丰度矩阵;vector(G)为基因属性向量。
9.根据权利要求5所述的方法,其特征在于,计算所述每个待筛选微生物的标准丰度值的公式为:式中,Bin k _abundance_value表示待筛选微生物k的标准丰度值;T k,j 表示待筛选微生物k中的第j个重叠群的TPM值;L k,j 表示待筛选微生物k中的第j个重叠群的长度;计算所述所有基因中每个基因在所述每个待筛选微生物的基因丰度值的公式为:式中,Gene_abundance k,i 表示待筛选微生物k的基因i的基因丰度值;mapped_gene_read_length k,i 表示所述测序数据映射到基因i上的长度;gene_length i 表示基因i的基因长度;Bin k _abundance_value表示待筛选微生物k的标准丰度值。
10.一种纤维素降解菌的筛选系统,其特征在于,包括:确定模块,用于确定待检测样品中所有待筛选微生物的所有基因及所述所有基因的第一基因丰度数据,其中所述第一基因丰度数据为所述所有基因中每个基因在每个待筛选微生物的基因丰度值;筛选模块,用于基于功能基因集,从所述所有基因中筛选出多个目标基因,其中所述功能基因集包括多个用于指示纤维素降解功能的功能基因;所述确定模块,还用于根据所述第一基因丰度数据,确定所述多个目标基因的第二基因丰度数据,其中所述第二基因丰度数据为所述多个目标基因中每个目标基因在所述每个待筛选微生物的基因丰度值;所述确定模块,还用于根据所述第二基因丰度数据,确定所述每个待筛选微生物的纤维素降解分数;所述筛选模块,还用于根据所述每个待筛选微生物的纤维素降解分数筛选出所述所有待筛选微生物中的纤维素降解菌;所述确定模块,具体用于根据所述第二基因丰度数据和所述第一基因丰度数据,确定每个目标基因的第一预设数量的对照基因及第三基因丰度数据,其中所述第三基因丰度数据为所述每个目标基因的第一预设数量的对照基因在所述每个待筛选微生物的基因丰度平均值;确定所有目标基因的基因属性向量,其中所述基因属性向量用来指示所述所有目标基因的激活属性或者抑制属性;根据所述基因属性向量、所述第二基因丰度数据和所述第三基因丰度数据,计算得到所述每个待筛选微生物的纤维素降解分数。




