大数据平台建设系列:(二)浅谈数据仓库管理体系
数据仓库首要解决的问题是数据孤岛问题!在企业生产过程中,每个部门、子公司都会产生数据,数据如果不能统一管理,久而久之部门间或子公司间的数据会烟囱式生产,最终会形成数据孤岛。 数据孤岛只能片面的反应生产经营情况,缺乏全局的数据支持,是分析决策的大忌。因此,数据仓库在解决了数据孤岛问题后,才可以谈指标体系、资产管理等概念。良好的数据仓库管理体系需覆盖企业生产经营的所有数据,才能全面、真实、客观的反应企业发展情况。数据仓库需具备企业全域数据收集和存储能力(数据湖),在此基础上展开ETL分析。 数据仓库管理体系图 为保证数据处理的时效性,实时数据仓库也需要规划到数据仓库体系中。数据仓库的下游对应不同主题域的数据集市,数据使用方从数据集市中获取他们需要的数据。 因此我觉得良好的数据仓库管理体系应该包含以下几部分内容: 1.数据湖: 负责企业全范围的数据收集和存储,避免数据烟筒式生产的关键; 2.数据仓库: 离线数据仓库(传统意义上的数据仓库)、实时数据仓库(解决数据时效性问题),负责对数据湖中的数据进行ETL; 3.数据集市: 数据仓库分析结果的载体,根据不同场景划分为不同的主题域。是后续开展指标体系、数据质量体系,数据资产体系的关键因素。 来源: CSDN 作者: juan333 链接: https://blog.csdn.net/juan333/article/details