从hadoop框架讨论大数据生态
1.1 hadoop是什么
hadoop是一个由Apache基金会所开发的分布式系统基础架构。广义上来说hadoop通常指一个更广泛的概论-hadoop生态圈。
1.2 hadoop发展历史
1.3 hadoop三大发行版本
1.4 hadoop的优势
1.5 hadoop组成
1.5.1 hdfs框架概述
* NameNode(nm):存储文件的元数据,如文件名,文件目录结构,文件属性(生成时间、副本数、文件权限),以及每个文件的块列表和块所在的DataNode等。
* DataNode(dm):在本地文件系统存储文件块数据,一级块数据的校验和
* Secondary Namenode(2mn):用来监控HDFS状态的辅助后台程序,每隔一段时间获取HDFS元数据的快照
1.5.2 yarn架构概述
1.5.3 mapreduce架构概述
1.6 大数据技术生态系统
1.7 推荐系统架构图