HBase技术参考手册 PDF 下载_Java知识分享网-免费Java资源下载

HBase技术参考手册 PDF 下载

本站整理下载：

链接：https://pan.baidu.com/s/1V7apTrjIIjT4piIfR85sXA

提取码：7m3d

相关截图：

主要内容：

Hadoop的限制

Hadoop使用分布式文件系统，用于存储大数据，并使用MapReduce来处理。Hadoop擅长于存储各种格式的庞大的数据，任意的格式甚至非结构化的处理。

Hadoop只能执行批量处理，并且只以顺序方式访问数据。这意味着必须搜索整个数据集，即使是最简单的搜索工作。

当处理结果在另一个庞大的数据集，也是按顺序处理一个巨大的数据集。在这一点上，一个新的解决方案，需要访问数据中的任何点（随机访问）单元。

HBase不适合做大规模数据分析，他适合做海量数据的实时写入和实时检索，也就是实时快速查询操作。因为HBase的列式存储结构决定了它不适合做大范围的数据查询检索。所以很少能见到离线数仓用HBase来构建。

Hadoop随机存取数据库

应用程序，如HBase, Cassandra, couchDB, Dynamo 和 MongoDB 都是一些存储大量数据和以随机方式访问数据的数据库。

HBase是什么?

HBase是建立在Hadoop文件系统之上的分布式面向列的数据库。它是一个开源项目，是横向扩展的。

HBase是一个数据模型，类似于谷歌的大表设计，可以提供快速随机访问海量结构化数据。它利用了Hadoop的文件系统（HDFS）提供的容错能力。

它是Hadoop的生态系统，提供对数据的随机实时读/写访问，是Hadoop文件系统的一部分。

人们可以直接或通过HBase的存储HDFS数据。使用HBase在HDFS读取消费/随机访问数据。 HBase在Hadoop的文件系统之上，并提供了读写访问。

HBase 和 HDFS

HDFS HBase

HDFS是适于存储大容量文件的分布式文件系统。 HBase是建立在HDFS之上的数据库。

HDFS不支持快速单独记录查找。 HBase提供在较大的表快速查找

它提供了高延迟批量处理;没有批处理概念。它提供了数十亿条记录低延迟访问单个行记录（随机存取）。

它提供的数据只能顺序访问。 HBase内部使用哈希表和提供随机接入，并且其存储索引，可将在HDFS文件中的数据进行快速查找。

HBase的存储机制

HBase是一个面向列的数据库，在表中它由行排序。表模式定义只能列族，也就是键值对。一个表有多个列族以及每一个列族可以有任意数量的列。后续列的值连续地存储在磁盘上。表中的每个单元格值都具有时间戳。总之，在一个HBase：

表是行的集合。

行是列族的集合。

列族是列的集合。

列是键值对的集合。

下面给出的表中是HBase模式的一个例子。

最新Java全栈就业实战课程(免费)