1.一种基于云端检测鸟类鸣声的方法,其特征在于,所述方法包括:接收智能终端获取的原始声音数据;将所述原始声音数据输入经过训练的第一神经网络模型,分离得到鸟类鸣声数据;将所述鸟类鸣声数据输入经过训练的第二神经网络模型,确定与所述鸟类鸣声数据对应的鸟类信息,并将所述鸟类信息发送给所述智能终端;所述经过训练的第一神经网络模型为经过训练的深度吸引子网络,以所述原始声音数据作为训练数据集;所述经过训练的第二神经网络模型为经过训练的时间延迟神经网络,以所述第一神经网络模型输出的鸟类鸣声数据作为训练数据集,以实现原始声音数据的实时接收、鸟类鸣声数据的实时在线分离、所述鸟类信息的实时识别和实时发送至所述智能终端;所述接收智能终端获取的原始声音数据,包括:获取所述智能终端的定位信息;接收所述原始声音数据;将所述定位信息标签化,并与所述原始声音数据匹配,得到具有位置标签的原始声音数据;所述将所述原始声音数据输入经过训练的第一神经网络模型,分离得到鸟类鸣声数据,包括:提取与所述原始声音数据匹配的位置标签;提取所述原始声音数据中不同音源的声纹特征;将所述不同音源的声纹特征输入所述经过训练的深度吸引子网络,分离得到对应鸟类鸣声数据的声纹特征;根据所述对应鸟类鸣声数据的声纹特征,确定所述鸟类鸣声数据以及对应所述鸟类鸣声数据的所述位置标签;所述提取所述原始声音数据中不同音源的声纹特征,包括:对所述原始声音数据使用短时傅里叶变换,得到混合语谱图;根据所述混合语谱图,分离得到不同音源的源音频语谱图;对所述不同音源的源音频语谱图使用逆短时傅里叶变换,得到对应不同音源的声音源波形;根据所述声音源波形,生成所述不同音源的声纹特征;由所述第一神经网络模型的输出作为所述第二神经网络模型的输入,从而无缝衔接鸟类鸣声的分离与识别,加快处理过程,实现实时处理反馈。
2.根据权利要求1所述的基于云端检测鸟类鸣声的方法,其特征在于,所述将所述鸟类鸣声数据输入经过训练的第二神经网络模型,确定与所述鸟类鸣声数据对应的鸟类信息,并将所述鸟类信息发送给所述智能终端,包括:预处理所述鸟类鸣声数据,得到强化鸟类鸣声数据;基于梅尔频率倒谱系数处理所述强化鸟类鸣声数据,得到对应所述强化鸟类鸣声数据的声纹特征参数;将所述声纹特征参数输入所述经过训练的时间延迟神经网络,确定对应所述声纹特征参数的所述鸟类信息,并将所述鸟类信息发送给所述智能终端。
3.根据权利要求2所述的基于云端检测鸟类鸣声的方法,其特征在于,所述基于梅尔频率倒谱系数处理所述强化鸟类鸣声数据,得到对应所述强化鸟类鸣声数据的声纹特征参数,包括:对所述强化鸟类鸣声数据进行快速傅里叶变换,获得所述强化鸟类鸣声数据的语谱图;基于所述强化鸟类鸣声数据的所述语谱图和所述梅尔频率倒谱系数,得到梅尔频率倒谱系数特征向量作为对应所述强化鸟类鸣声数据的所述声纹特征参数。
4.根据权利要求2所述的基于云端检测鸟类鸣声的方法,其特征在于,所述将所述声纹特征参数输入所述经过训练的时间延迟神经网络,确定对应所述声纹特征参数的所述鸟类信息,包括:将所述声纹特征参数进行压缩操作和激励操作,获得若干层压缩-激励数据;将若干层所述压缩-激励数据串联并融合,获得特征聚合数据;将所述特征聚合数据进行基于注意力机制的概率池化处理,获得权重统计数据;根据所述权重统计数据确定所述鸟类信息。
5.根据权利要求1所述的基于云端检测鸟类鸣声的方法,其特征在于,所述将所述原始声音数据输入经过训练的第一神经网络模型,分离得到鸟类鸣声数据之前,还包括:对所述原始声音数据依次进行降采样、分段和归一化处理,去除环境噪音,得到所述原始声音数据的标准化范围;对所述标准化范围进行验证,若确定所述原始声音数据内具有鸟类鸣声数据,则将所述原始声音数据输入所述经过训练的第一神经网络模型。
6.一种基于云端检测鸟类鸣声的系统,其特征在于,包括云端服务器和与所述云端服务器通信连接的若干智能终端,其中,所述云端服务器包括:接收模块,所述接收模块接收所述智能终端获取的原始声音数据;鸟类鸣声分离模块,所述鸟类鸣声分离模块将所述原始声音数据输入经过训练的第一神经网络模型,分离得到鸟类鸣声数据;鸟类鸣声数据处理模块,所述鸟类鸣声数据处理模块将所述鸟类鸣声数据输入经过训练的第二神经网络模型,确定与所述鸟类鸣声数据对应的鸟类信息,并将所述鸟类信息发送给所述智能终端;所述经过训练的第一神经网络模型为经过训练的深度吸引子网络,以所述原始声音数据作为训练数据集;所述经过训练的第二神经网络模型为经过训练的时间延迟神经网络,以所述第一神经网络模型输出的鸟类鸣声数据作为训练数据集,以实现原始声音数据的实时接收、鸟类鸣声数据的实时在线分离、所述鸟类信息的实时识别和实时发送至所述智能终端;所述接收智能终端获取的原始声音数据,包括:获取所述智能终端的定位信息;接收所述原始声音数据;将所述定位信息标签化,并与所述原始声音数据匹配,得到具有位置标签的原始声音数据;所述将所述原始声音数据输入经过训练的第一神经网络模型,分离得到鸟类鸣声数据,包括:提取与所述原始声音数据匹配的位置标签;提取所述原始声音数据中不同音源的声纹特征;将所述不同音源的声纹特征输入所述经过训练的深度吸引子网络,分离得到对应鸟类鸣声数据的声纹特征;根据所述对应鸟类鸣声数据的声纹特征,确定所述鸟类鸣声数据以及对应所述鸟类鸣声数据的所述位置标签;所述提取所述原始声音数据中不同音源的声纹特征,包括:对所述原始声音数据使用短时傅里叶变换,得到混合语谱图;根据所述混合语谱图,分离得到不同音源的源音频语谱图;对所述不同音源的源音频语谱图使用逆短时傅里叶变换,得到对应不同音源的声音源波形;根据所述声音源波形,生成所述不同音源的声纹特征;由所述第一神经网络模型的输出作为所述第二神经网络模型的输入,从而无缝衔接鸟类鸣声的分离与识别,加快处理过程,实现实时处理反馈。