1.一种基于深度迁移学习的Spark作业时间预测方法,所述方法包括:获取不同类型的Spark作业的样本数据;所述样本数据包括:目标样本和源样本;目标样本是从需要预测应用类型采集的样本数据,源样本数据是从其他应用类型采集的样本数据;将所述目标样本和所述源样本分别输入全连接神经网络模型,记录所述全连接神经网络模型每一层网络输出的所述目标样本的目标样本激活值和所述源样本的源样本激活值;根据所述目标样本激活值和所述源样本激活值,得到每一层网络的最大均值差异:其中,MMD l 表示第l层的最大均值差异,n s 表示源样本,n t 表示目标样本, 表示第i个源样本经过第l层产生的源样本激活能, 表示第i个目标样本经过第l层产生的目标样本激活能;根据所述全连接神经网络模型输出所述目标样本对应的标签预测值以及所述目标样本对应的标签实际值,确定平均平方误差;对所述最大均值差异与所述平均平方误差相乘,将相乘结果与所述平均平方误差求和,得到损失函数;根据所述损失函数,训练所述全连接神经网络模型,根据训练好的全连接神经网络模型,预测Spark作业时间。
2.根据权利要求1所述的方法,其特征在于,所述获取不同类型的Spark作业的样本数据,包括:选择不同的作业配置;所述作业配置包括:输入数据大小和任务数量;执行不同的作业配置的Spark作业,得到Spark作业的样本数据;样本数据包括:目标样本和源样本。
3.根据权利要求1所述的方法,其特征在于,根据所述全连接神经网络模型输出所述目标样本对应的标签预测值以及所述目标样本对应的标签实际值,确定平均平方误差,包括:根据所述全连接神经网络模型输出所述目标样本对应的标签预测值和所述目标样本对应的标签实际值之差的平方和,得到平均平方和误差。
4.一种基于深度迁移学习的Spark作业时间预测装置,其特征在于,所述装置包括:样本获取模块,用于获取不同类型的Spark作业的样本数据;所述样本数据包括:目标样本和源样本;目标样本是从需要预测应用类型采集的样本数据,源样本数据是从其他应用类型采集的样本数据;局部密度计算模块,用于将所述目标样本和所述源样本分别输入全连接神经网络模型,记录所述全连接神经网络模型每一层网络输出的所述目标样本的目标样本激活值和所述源样本的源样本激活值;根据所述目标样本激活值和所述源样本激活值,得到每一层网络的最大均值差异:其中,MMD l 表示第l层的最大均值差异,n s 表示源样本,n t 表示目标样本, 表示第i个源样本经过第l层产生的源样本激活能, 表示第i个目标样本经过第l层产生的目标样本激活能;距离计算模块,用于根据所述全连接神经网络模型输出所述目标样本对应的标签预测值以及所述目标样本对应的标签实际值,确定平均平方误差;时间预测模块,用于根据所述平均平方误差和所述最大均值差异,确定损失函数;根据所述损失函数,训练所述全连接神经网络模型,根据训练好的全连接神经网络模型,预测Spark作业时间。
5.根据权利要求4所述的装置,其特征在于,样本获取模块还用于选择不同的作业配置;所述作业配置包括:输入数据大小和任务数量;执行不同的作业配置的Spark作业,得到Spark作业的样本数据;样本数据包括:目标样本和源样本。
6.一种计算机设备,包括存储器和处理器,所述存储器存储有计算机程序,其特征在于,所述处理器执行所述计算机程序时实现权利要求1至3中任一项所述方法的步骤。
7.一种计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现权利要求1至3中任一项所述的方法的步骤。