Hive基础知识介绍
Hive是基于Hadoop的数据仓库工具,可对存储在HDFS上的文件中的数据进行数据整理、特殊查询和分析处理,提供了类似于SQL语言的查询语言-HiveSQL,可通过HQL语句实现简单的MR统计,Hive将HQL语句转换成MR任务进行执行。 1-1 数据仓库概念 数据仓库(Data Warehouse)是一个面向主题的(Subject Oriented)、集成的(Integrated)、相对稳定的(Non-Volatile)、反应历史变化(Time Variant)的数据集合,用于支持管理决策。 数据仓库体系结构通常含四个层次 :数据源、数据存储和管理、数据服务、数据应用。 数据源:是数据仓库的数据来源,含外部数据、现有业务系统和文档资料等 ;数据集成:完成数据的抽取、清洗、转换和加载任务,数据源中的数据采用ETL(Extract-Transform-Load)工具以固定的周期加载到数据仓库中。 数据存储和管理:此层次主要涉及对数据的存储和管理,含数据仓库、数据集市、数据仓库检测、运行与维护工具和元数据管理等 。 数据服务:为前端和应用提供数据服务, 可直接从数据仓库中获取数据供前端应用使用,也可通过OLAP(OnLine Analytical Processing,联机分析处理)服务器为前端应用提供负责的数据服务。 数据应用:此层次直接面向用户,含数据查询工具、自由报表工具