1.一种分布式数据血缘构建及展现方法,其特征在于,包括如下步骤:步骤SS1:数据血缘构建步骤,包括:分别通过分布式元数据采集、数据加工处理血缘获取、数据访问中间件对象解析和数据存储访问监控生成血缘关系数据;所述步骤SS1中的分布式元数据采集包括:各节点获取数据生命周期中的元数据作为采集对象进行创建数据源,所述采集对象包括数据库、离线计算服务、在线计算服务、数据中台组件、计算任务;对所述数据源配置采集任务,然后执行元数据采集,对采集到的元数据进行打标签,然后将元数据写入数据库中并进行跨节点元数据汇聚和去重融合;所述将元数据写入数据库中并进行跨节点元数据汇聚和去重融合具体包括:采用中心式的元数据汇聚融合模式,即中台节点作为主节点,其他数据节点作为从节点,各节点在完成元数据采集后,由从节点通过周期性的元数据同步任务将元数据汇聚到主节点;主节点接收到元数据后,首先将原始数据存储到数据库作为原始数据,然后通过元数据标签对元数据进行去重和融合操作,从而获得全局数据的元数据集合;步骤SS2:对所述血缘关系数据通过数据解析处理模块进行数据血缘关系的解析及血缘关系的整合,生成数据血缘关系;步骤SS3:将所述数据血缘关系存储到图数据库中,供用户查询和可视化展现。
2.根据权利要求1所述的一种分布式数据血缘构建及展现方法,其特征在于,所述步骤SS1中的分布式元数据采集具体还包括:针对数据库作为采集对象,通过数据库访问的采集方法,采集内容为表名称、备注、字段列表、主键、外键、表大小、行数、文件数、分区数、表/字段上下游依赖关系。
3.根据权利要求1所述的一种分布式数据血缘构建及展现方法,其特征在于,所述步骤SS1中的分布式元数据采集具体还包括:针对离线计算服务作为采集对象,通过调用计算服务接口的采集方法,采集内容为Hive/RDS表元数据,所述表元数据包括文件的状态、文件数、文件大小和数据更新时间的趋势数据;针对在线计算服务作为采集对象,通过访问服务落盘的工单数据,获取计算主题的基础元数据信息的采集方法,采集内容为Flume/Hbase/Kafka组件的元数据。
4.根据权利要求1所述的一种分布式数据血缘构建及展现方法,其特征在于,所述步骤SS1中的分布式元数据采集具体还包括:针对数据中台组件作为采集对象,通过将组件数据同步到数据库,并离线抽取元数据的采集方法,采集内容为BI报表系统、指标库、OneService服务的血缘数据。
5.根据权利要求1所述的一种分布式数据血缘构建及展现方法,其特征在于,所述步骤SS1中的分布式元数据采集具体还包括:针对计算任务作为采集对象,通过解析任务输入/输出依赖配置,或者解析计算脚本中表/字段的血缘关系的采集方法,采集内容为离线/实时计算任务的名称、责任人、deadline告警时间、脚本和任务配置信息。
6.根据权利要求1所述的一种分布式数据血缘构建及展现方法,其特征在于,所述步骤SS1中的数据加工处理血缘获取包括:首先,数据抽取,先对各业务系统和各类数据源所产生的分散性数据进行全面识别,进而对所需的数据源进行设置和给予定义,选定能够实施操作的数据源,同时对增量抽取的定义进行确定;接着,数据转换,通过转换措施让各类数据从业务模型转变成分析模型,提供选择、分离/合并、转化以及汇总基础性任务;之后,数据加载,将转换之后的数据通过直接加载或者数据库相连接的方法加载到数据库内;最后,将数据转换过程中对源数据的数据处理过程信息进行提取获取源数据的字段级血缘关系,将转换之后的数据与源数据的字段级血缘关系存储到数据库中。
7.根据权利要求1所述的一种分布式数据血缘构建及展现方法,其特征在于,所述数据血缘关系为所有者-数据库-表-字段。
8.根据权利要求1所述的一种分布式数据血缘构建及展现方法,其特征在于,所述步骤SS2中的数据血缘关系的解析包括通过HiveHook插件获取输入表和输出表的丰富信息,异步发送到Kafka,再经过解析处理后,将数据写到图数据库中,提供元数据系统展示和RESTAPI服务,落地成Hive关系表,供用户查询和可视化展现使用。