1.一种数据布局方法,其特征在于,包括:获取原始数据,并将所述原始数据分解成若干子数据集;以数据处理效益最大化为目标,确定关于所述子数据集的数据分配方案;基于所述数据分配方案对所述子数据集执行数据分配操作,以将所述子数据集布局到数据中心的若干服务器网格单元上;在所述数据分配操作执行后,获取所述数据中心的数据分布信息;基于所述数据分布信息,对所述数据中心的当前数据布局进行优化。
2.如权利要求1所述的数据布局方法,其特征在于,所述基于所述数据分布信息,对所述数据中心的当前数据布局进行优化,包括:基于所述数据分布信息构建空间布局矩阵;其中,所述空间布局矩阵中的元素与所述数据中心的服务器网格单元一一对应,所述元素携带了布局在对应服务器网格单元上的子数据集及其数据类型、对应服务网格单元的适配数据类型;依据数据布局优化目标构建布局优化目标函数:其中, 为相邻服务器协调性; 为服务器网格单元 的数据类型协调性指数,所述数据类型协调性指数与所述服务器网格单元 中处理不同数据类型的服务器数量分布的均衡程度呈正相关关系; 为服务器网格单元 的邻域单元中,处理的数据类型不同于服务器网格单元 所处理的第k种数据类型的服务器数量;m和n分别是所述空间布局矩阵的行数和列数,服务器网格单元 表示所述空间布局矩阵中第 行第 列的服务器网格单元; 为数据分布可达性; 为服务器网格单元 与分布到服务器网格单元 上的子数据集的适合度等级值,分布到服务器网格单元 的子数据集的数据类型与服务器网格单元 中服务器的适配数据类型越匹配,所述适合度等级值越高; 为分布到服务器网格单元 的子数据集的鼓励系数值,所述鼓励系数值与分布到服务器网格单元 的子数据集的数据类型与服务器网格单元 的适配数据类型之间的匹配程度呈正相关关系; 为服务器网格单元紧凑度; 表示第一服务器网格单元 的邻域单元中各个所述适配数据类型与所述第一服务器网格单元中所述适配数据类型相同的服务器数量;所述第一服务器网格单元指的是发生数据挪移或替换的服务器网格单元;构建布局约束条件:或 为所述服务器网格单元中的子数据集被挪移到其他所述服务器网格单元的单元面积, 为所述服务器网格单元中的子数据集被替换到其他所述服务器网格单元的单元面积; 为服务器网格单元面积; 在服务器网格单元 中的子数据集被挪移到适配数据类型与服务器网格单元 不同的其他服务器网格单元时值为1,否则为0; 在服务器网格单元 中的子数据集被替换到适配数据类型与服务器网格单元 不同的其他服务器网格单元时值为1,否则为0; 为被替换的子数据集占所述数据中心总数据量的比例或被挪移的子数据集占所述数据中心总数据量的比例, 为约束系数;基于所述空间布局矩阵,在所述布局约束条件的约束下,对所述布局优化目标函数求解,得到数据布局优化方案;根据所述数据布局优化方案对所述数据中心的当前数据布局进行优化。
3.如权利要求2所述的数据布局方法,其特征在于,所述布局约束条件还包括:禁止对静态服务器网格单元进行数据布局优化;其中,所述静态服务器网格单元是预先标注有预设标识信息的服务器网格单元,所述预设标识信息用于表示所述服务器网格单元不参与数据布局优化。
4.如权利要求1所述的数据布局方法,其特征在于,所述基于所述数据分布信息,对所述数据中心的当前数据布局进行优化,包括:构建布局约束条件和至少两个数据布局优化目标;根据所述数据布局优化目标和所述布局约束条件构建惩罚函数,并以所述惩罚函数作为粒子群优化算法的适应度函数;初始化布局优化型粒子种群,将第一非支配解集合初始化为空集;对布局优化型粒子进行多轮迭代,直到满足预设的迭代停止条件,从所述第一非支配解集合中选出最优解以作为数据布局优化方案,基于所述数据布局优化方案对所述数据中心的当前数据布局进行优化;在每一迭代轮次中,基于帕累托优化算法维护所述第一非支配解集合。
5.如权利要求4所述的数据布局方法,其特征在于,所述在每一迭代轮次中,基于帕累托优化算法维护所述第一非支配解集合,包括:在每一迭代轮次中,基于所述数据分布信息和所述布局优化型粒子的当前位置计算所述布局优化型粒子在各个所述数据布局优化目标下的目标值;基于帕累托优化算法根据所述目标值选出候选布局优化型粒子;若所述候选布局优化型粒子的当前位置不被所述第一非支配解集合中的任意解支配,将所述候选布局优化型粒子的当前位置作为新解加入所述第一非支配解集合中并移除所述第一非支配解集合中被所述候选布局优化型粒子的当前位置支配的解;其中,所述候选布局优化型粒子指的是当前迭代轮次中不被其他布局优化型粒子支配的布局优化型粒子;所述方法还包括:在每一迭代轮次中,基于所述适应度函数,根据所述数据分布信息和所述布局优化型粒子的当前位置计算所述布局优化型粒子的适应度值,并根据所述布局优化型粒子的适应度值更新所述布局优化型粒子的速度和位置。
6.如权利要求1所述的数据布局方法,其特征在于,所述以数据处理效益最大化为目标,确定关于所述子数据集的数据分配方案,包括:制定至少两个不同的数据处理效益最大化目标,并为各个所述数据处理效益最大化目标选择适配的算法;随机生成一组初始解集合;使用与所述数据处理效益最大化目标对应的算法计算所述初始解集合中每个解在所述数据处理效益最大化目标下的效益值;基于所述效益值,应用帕累托优化算法从所述初始解集合中选出最优解,以作为数据分配方案。
7.如权利要求6所述的数据布局方法,其特征在于,所述基于所述效益值,应用帕累托优化算法从所述初始解集合中选出最优解,以作为数据分配方案,包括:基于所述初始解集合中每个解在各个所述数据处理效益最大化目标下的效益值,从所述初始解集合中选出不被其他解支配的解,得到第二非支配解集合;对所述第二非支配解集合中的每个解进行局部邻域搜索,更新所述第二非支配解集合;基于预设的挑选规则,从所述第二非支配解集合中选出最优解,以作为数据分配方案。
8.如权利要求7所述的数据布局方法,其特征在于,所述对所述第二非支配解集合中的每个解进行局部邻域搜索,更新所述第二非支配解集合之后,所述基于预设的挑选规则,从所述第二非支配解集合中选出最优解,以作为数据分配方案之前,还包括:根据所有所述数据处理效益最大化目标构建适应度函数;初始化数据分配型粒子种群;对数据分配型粒子进行多轮迭代,直到满足预设的迭代停止条件;在每一迭代轮次中,基于所述帕累托优化算法维护所述第二非支配解集合。
9.如权利要求8所述的数据布局方法,其特征在于,所述在每一迭代轮次中,基于所述帕累托优化算法维护所述第二非支配解集合,包括:在每一轮迭代中,根据所述数据分配型粒子的当前位置计算所述数据分配型粒子在各个所述数据处理效益最大化目标下的效益值;基于所述帕累托优化算法根据所述效益值选出候选数据分配型粒子;若所述候选数据分配型粒子的当前位置不被所述第二非支配解集合的任何解支配,将所述候选数据分配型粒子的当前位置加入到所述第二非支配解集合中,并将所述第二非支配解集合中被所述候选数据分配型粒子的当前位置支配的解从所述第二非支配解集合中移除;所述方法还包括:在每一迭代轮次中,基于所述适应度函数,根据所述数据分配型粒子的当前位置计算所述数据分配型粒子的适应度值;根据所述数据分配型粒子的适应度值更新所述数据分配型粒子的速度和位置。
10.一种数据布局系统,其特征在于,包括:数据获取模块,用于获取原始数据,并将所述原始数据分解成若干子数据集;分配方案确定模块,用于以数据处理效益最大化为目标,确定关于所述子数据集的数据分配方案;数据分配模块,用于基于所述数据分配方案对所述子数据集执行数据分配操作,以将所述子数据集布局到数据中心的若干服务器网格单元上;分布信息获取模块,用于在所述数据分配操作执行后,获取所述数据中心的数据分布信息;布局优化模块,用于基于所述数据分布信息,对所述数据中心的当前数据布局进行优化。