1、2014年2月Sub Project描述描述common分布式文件系统和通用I/O的组件与接口(序列化,Java RPC和持久化数据结构)Avro支持高效的跨语言RPC和持久数据存储的序列化系统MapReduce分布式数据处理模型和执行环境,运行在大型商用机集群HDFS分布式文件系统,用于大型商用机集群PIGPig是SQL-like语言,是在MapReduce上构建的一种高级查询语言,把一些运算编译进MapReduce模型的Map和Reduce中,并且用户可以定义自己的功能。Hive分布式、按列存储的数据仓库。Hive管理HDFS中存储的数据,并提供基于SQL的查询语言(由运行时引擎翻译成Ma
2、pReduce作业)Hbase分布式、按列存储的数据库。HBase使用HDFS作为底层存储,同时支持MapReduce的批量式计算和点查询(随机读取)ZooKeeper分布式、可用性高的协调服务。提供类似分布式锁的基础服务。Sqoop在数据库和HDFS之间高效传输数据的工具Flume分布式、可靠、和高可用的海量日志聚合的系统。ChukwaChukwa是基于Hadoop的大集群监控系统,由yahoo贡献。存储大文件百兆以上级别文件百万级文件由于亿级别文件流式处理数据一次写多次多模式支持追加操作廉价的硬件环境普通pc server组成集群环境低延时读操作 高吞吐量而非低延时 Hbase 解决了这个
3、问题大量小数据文件 最好每个文件大于100M多次写 只支持一次写 只支持在文件尾部添加,不支持随机写JobTracker管理集群资源和Job调度TaskTracker管理Task运行Inputk1,v1Mapk2,v2Reducek3,v3OutputMapReduceInputFormatMapperPartitionerReducerOutputFormat 引入一个新的资源管理系统YARN HDFS单点故障得以解决 HDFS Federation HDFS 快照 通过NFS访问HDFS 支持Window系统n 1 高可靠性n 2 高效性n 3 面向列n 4 可伸缩n 5 可在廉价PC S
4、erver搭建大规模结构化存储集群HBaseHBase 系统架构图系统架构图ClientClient:使用HBase RPC机制与HMaster和HRegionServer进行通信Client与HMaster进行通信进行管理类操作Client与HRegionServer进行数据读写类操作ZookeeperZookeeper:Zookeeper Quorum存储-ROOT-表地址、HMaster地址HRegionServer把自己以Ephedral方式注册到Zookeeper中,HMaster随时感知各个HRegionServer的健康状况Zookeeper避免HMaster单点问题HMaste
5、rHMaster:HMaster没有单点问题,HBase中可以启动多个HMaster,通过Zookeeper的Master Election机制保证总有一个Master在运行主要负责Table和Region的管理工作:1 管理用户对表的增删改查操作2 管理HRegionServer的负载均衡,调整Region分布3 Region Split后,负责新Region的分布4 在HRegionServer停机后,负责失效HRegionServer上Region迁移Table&RegionTable&Regionn Table随着记录增多不断变大,会自动分裂成多份Splits,成为Regionsn 一
6、个region由startkey,endkey)表示n 不同region会被Master分配给相应的RegionServer进行管理-ROOT-&.META.-ROOT-&.META.n.META.记录用户表的Region信息,同时,.META.也可以有多regionn-ROOT-记录.META.表的Region信息,但是,-ROOT-只有一个regionn Zookeeper中记录了-ROOT-表的locationn 客户端访问数据的流程:Client-Zookeeper-ROOT-.META.-用户数据表n 多次网络操作,不过client端有cache缓存HBaseHBase 数据模型数据
7、模型Row Key:Table主键,Table中记录按照Row Key排序Timestamp:每次对数据操作对应的时间戳,也即数据的version numberColumn Family:列簇,一个table在水平方向有一个或者多个列簇,列簇可由任 意多个Column组成,列簇支持动态扩展,无须预定义数量及 类型,二进制存储,用户需自行进行类型转换n 数据类型:Hbase只有简单的字符串类型。n 数据操作:Hbase只有很简单的插入、查询、删除、清空操作,没有复杂的表和表之间的关系。n 存储模式:Hbase是基于列式存储,每个列族由几个文件保存,不同列族的文件是分离的。n 数据维护:更新操作是
8、替换版本,删除只是逻辑标记n 可伸缩性:Tika是一个内容抽取的工具集合。支持work,ppt,execl,PDF等Elasticsearch:开源的分布式实时搜索系统,结合Hbase实现海量数据存储和检索,同时提供索引数据统计功能,满足海量数据的实时统计要求。ya主要功能特点主要功能特点 real time distributed high availability document oriented schema free restful api索引数据统计索引数据统计 min、max、sum、avg。stats、filter、missing rang、data range、ipv4 range histogram、date hitogramThank You!Thank You!