欢迎光临
我们一直在努力

【大数据处理与分析】数据仓库Hive:01 数据仓库的概念

在这里插入图片描述

【作者主页】Francek Chen 【专栏介绍】

大数据技术原理与应用

专栏系统介绍大数据的相关知识,分为大数据基础篇、大数据存储与管理篇、大数据处理与分析篇、大数据应用篇。内容包含大数据概述、大数据处理架构Hadoop、分布式文件系统HDFS、分布式数据库HBase、NoSQL数据库、云数据库、MapReduce、Hadoop再探讨、数据仓库Hive、Spark、流计算、Flink、图计算、数据可视化,以及大数据在互联网领域、生物医学领域的应用和大数据的其他应用。 【GitCode】专栏资源保存在我的GitCode仓库:https://gitcode.com/Morse_Chen/BigData_principle_application。

文章目录

    • 一、数据仓库概念
    • 二、数据仓库和数据库的区别
    • 小结

本文介绍数据仓库概念、传统数据仓库面临的挑战、Hive 简介、Hive 与 Hadoop 生态系统中其他组件的关系、Hive 与传统数据库的对比分析以及 Hive 在企业中的部署和应用。

一、数据仓库概念

数据仓库的一个比较公认的定义是由 W. H. Inmon 给出的,即“数据仓库(Data Warehouse)是一个面向主题的(Subject Oriented)、集成的(Integrated)、相对稳定的(Non-Volatile)、反映历史变化(Time Variant)的数据集合,用于支持管理决策”。

随着信息技术的普及和企业信息化建设步伐的加快,企业逐步认识到建立企业范围内的统一数据存储的重要性,越来越多的企业已经建立或正着手建立企业数据仓库。企业数据仓库有效集成了来自不同部门、不同地理位置、具有不同格式的数据,为企业管理决策者提供了企业范围内的单一数据视图,从而为综合分析和科学决策奠定了坚实的基础。常见的传统数据仓库工具供应商或产品主要包括 Oracle、BusinessObjects、IBM Informix、Sybase、NCR、Microsoft、SAS 等。

数据仓库的体系结构(见图1)通常包含 4 个层次:数据源、数据存储和管理、数据服务、数据应用。

(1)数据源:数据仓库的数据来源,包括外部数据、现有业务(OLTP,联机事务处理)系统和文档资料等。

(2)数据存储和管理:主要涉及对数据的存储和管理,包括数据仓库、数据集市、数据仓库监视、运行与维护工具和元数据管理等。

(3)数据服务:为前端工具和应用提供数据服务,可以直接从数据仓库中获取数据供前端应用使用,也可以通过 OLAP(联机分析处理)服务器为前端应用提供更加复杂的数据服务。OLAP 服务器提供了不同聚集粒度的多维数据集合,使得应用不需要直接访问数据仓库中的底层细节数据,这大大减少了数据计算量,提高了查询响应速度。OLAP 服务器还支持针对多维数据集的上钻、下探、切片、切块和旋转等操作,增强了多维数据分析能力。

(4)数据应用:直接面向最终用户,包括数据查询工具、自由报表工具、数据分析工具、数据挖掘工具和各类应用系统。

在这里插入图片描述

图1 数据仓库的体系结构

二、数据仓库和数据库的区别

总体而言,数据仓库和数据库有很大的区别,具体如表1所示。

表1 数据仓库和数据库的区别

特性数据库数据仓库
擅长做什么 事务处理 分析、报告、大数据
数据从哪里来 从单个来源“捕获” 从多个来源抽取和标准化
数据标准化 高度标准化的静态Schema 非标准化Schema
数据如何写 针对连续写入操作进行优化 按批处理计划进行批量写入操作
数据怎么存 针对单行型物理块的高吞吐写操作进行了优化 使用列式存储进行了优化,便于实现高速查询和低开销访问
数据怎么读 大量小型读取操作 为最小化I/O且最大化吞吐而优化

小结

数据仓库是面向主题、集成、稳定且反映历史变化的数据集合,主要用于支持管理决策。其体系结构包括数据源、数据存储与管理、数据服务和数据应用四层。传统数据仓库虽能整合多源数据、提供统一视图,但在海量数据扩展性、实时处理能力和成本上面临挑战。与数据库不同,数据仓库侧重分析与批量处理,数据来自多个来源并采用列式存储优化查询,而数据库则擅长事务处理和高频写入,二者定位有所差异。

欢迎 点赞👍 | 收藏⭐ | 评论✍ | 关注🤗

在这里插入图片描述

赞(0)
未经允许不得转载:171主机测评 » 【大数据处理与分析】数据仓库Hive:01 数据仓库的概念
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址