拥抱开源云上元数据管理

2019独角兽企业重金招聘Python工程师标准>>>

上期我们讲述的是实现数据工程师梦想的一个小目标《梦想成真&＃xff0c;只差一步》&＃xff0c;里面提到了要实现数据超市的管理&＃xff0c;数据工程师需要使用合适的工具将数据进行整理、组合、分类后上架&＃xff0c;然后业务分析师和数据科学家就可以使用了。

hadoop

在整个数据工程师的工作流程中&＃xff0c;需要自始至终的进行数据治理&＃xff1a;我们需要将每种类型的数据进行清晰的标识以及分类&＃xff0c;以利于其它角色的用户进行查找以及使用&＃xff1b;我们需要将每种数据的使用范围进行管理以及监控&＃xff0c;以使得数据被合理、合法的使用&＃xff1b;我们还要管理数据的生存周期以及质量溯源&＃xff0c;以利于数据质量可以被监管&＃xff0c;无用数据被清除...... 因此本文中我们将着重介绍上图中标红框的部分&＃xff0c;介绍实现我们梦想的工具Open Metadata Services - 开源组件Apache Atlas。

这个模块还在Apache的孵化中&＃xff0c;最新的版本是8月16号发布的0.7版本。详细文档可以查看以下链接&＃xff1a;http://atlas.incubator.apache.org/

Atlas 最早由HortonWorks实现&＃xff0c;用来管理Hadoop项目里面的元数据&＃xff0c;进而设计为数据治理的框架。后来开源出来给Apache社区进行孵化&＃xff0c;目前得到Aetna&＃xff0c;Merck&＃xff0c;Target&＃xff0c;SAS等公司的支持进行发展演进&＃xff0c;IBM现在也积极贡献功能&＃xff0c;拿来为我所用。(其在HortonWorks公司的介绍材料链接&＃xff1a; https://zh.hortonworks.com/apache/atlas/#section_1 ) 从其诞生历史看&＃xff0c;该框架天生就支持横向海量扩展&＃xff0c;具备良好的集成能力&＃xff0c;非常适合在云上使用。以下是其架构图&＃xff1a;

hadoop

Apache网站介绍它的主要功能有&＃xff1a;

1、数据分类 &＃xff1b;

2、集中审计 &＃xff1b;

3、搜索及溯源 &＃xff1b;

4、安全及策略引擎 &＃xff1b;

它的最核心部分Core就是类型管理系统 Type System &＃xff0c; 用户可以把数据资产进行类型定义&＃xff0c;然后使用Ingest/Export 的模块进行元数据的导入、修改、删除等管理。和外界的接口可以通过Rest API或使用Kafaka进行消息交换。数据对象存放在按照图的模式进行管理的Titan图数据库中&＃xff0c;具体Titan又把元数据存放在HBase中&＃xff0c;索引存放在Solr中。这样用户可以非常便捷和直观的通过层次图进行浏览信息&＃xff0c;可以按照文字进行精确的查找。

hadoop

如上图&＃xff0c;我们将数据资产分成了五类&＃xff0c;分别是&＃xff1a;Pipeline、Data Set、Report、Model、Notebook&＃xff0c;具体存储的属性是红色框部分&＃xff0c;描述了以上五种数据资产的详细信息&＃xff1a;例如它是哪类型业务&＃xff0c;数据质量如何&＃xff0c;归在哪个项目里面&＃xff0c;具体评级如何、用户访问权限如何等等......

有了这个Open Data Services服务后&＃xff0c;我们是否觉得又离梦想近了一步&＃xff1f;更详细的使用我们将在未来文章分享。

IBM对开源社区一直采取大力拥抱以及不遗余力地进行支持的态度&＃xff1a;

hadoop

IBM基于Cloud Foundry 打造了世界最大的PaaS平台BlueMix&＃xff0c;在上面部署了大量开源的云数据服务业务 - 例如Cloudant源于CouchDB&＃xff0c;DataWorks Forge构建在Spark平台之上。现在我们将Atlas开源元数据管理部署到我们的云数据治理中&＃xff0c;通过实际使用来促进该项目的大力发展。我们有理由相信&＃xff0c;未来IBM 将把开源的魔力继续发扬光大&＃xff01;

更多大数据与分析相关行业资讯、解决方案、案例、教程等请点击查看>>>