073-preBigData-01Introduction

一、什么是大数据?

大数据(Big Data),指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长和多样化的信息资产。

大白话就是,数据量很大,普通常用工具很慢,要新工具新方法好高效处理。

大数据,更多的功能是分析过去,提醒现在,展望未来。

将人们所收集的各种数据分类汇总,最终通过高精尖的平台运算,分析其中的规律所在,就是大数据的应用。如果数据收集得当,任何行业、任何事情都可以运用大数据寻找规律,最终做出最优的小抉择。

无论从公司营销、政府决策、高速公路运营、农场管理、来年预算等等,大大小小的事情都可以应用大数据,并且从中获利。

单位:

1Byte = 8bit 、 1KB = 1024Byte 、 1MB = 1024KB 、 1GB = 1024MB

1TB = 1024GB 、 1PB = 1024TB 、 1EB = 1024PB 、 1ZB = 1024EB

1YB = 1024ZB 、 1DB = 1024YB 、 1NB = 1024DB

二、大数据的特征

  • 容量(Volume):数据的大小决定所考虑的数据的价值和潜在的信息;
  • 种类(Variety):数据类型的多样性;
  • 速度(Velocity):指获得数据的速度;
  • 可变性(Variability):妨碍了处理和有效地管理数据的过程;
  • 真实性(Veracity):数据的质量;
  • 复杂性(Complexity):数据量巨大,来源多渠道;
  • 价值(value):合理运用大数据,以低成本创造高价值。

三、路线图

JAVA =====> 面向对象编程语言
Linux =====> 类Unix操作系统
Hadoop生态
  • HDFS =====> 解决存储问题
  • MapReduce =====> 解决计算问题
  • Yarn =====> 资源协调者
  • Zookeeper =====> 分布式应用程序协调服务
  • Flume =====> 日志收集系统
  • Hive =====> 基于Hadoop的数仓工具
  • HBase =====> 分布式、面向列的开源数据库
  • Sqoop =====> 数据传递工具
Scala =====> 多范式编程语言、面向对象和函数式编程的特性
Spark =====> 目前企业常用的批处理离线/实时计算引擎
Flink =====> 目前最火的流处理框架、既支持流处理、也支持批处理
Elasticsearch =====> 大数据分布式弹性搜索引擎
Docker =====>Docker 是一个开源的应用容器。
离线/实时项目

四、技能树?

image.png
岗位
  • 大数据开发工程师

  • 大数据清洗开发工程师

  • 大数据仓库开发工程师

  • 大数据运维开发工程师

  • 大数据平台开发工程师

五、起源

名字起源:

该项目的创建者,Doug Cutting解释Hadoop的得名 :“这个名字是我孩子给一个棕黄色的大象玩具命名的

image.png

项目起源:

  • Hadoop由 Apache Software Foundation 公司于 2005 年秋天作为Lucene的子项目Nutch的一部分正式引入。它受到最先由 Google Lab 开发的 Map/Reduce 和 Google File System(GFS) 的启发

Google是Hadoop的思想之源(Google在大数据方面的三篇论文)

GFS ====> HDFS

Map-Reduce ====> MR

BigTable ====> HBase

我大略看过了,普通人不会想仔细看的,了解下就行。

三大发行版本:

  • Apache、Cloudera、Hortonworks
Apache版本最原始、最基础:适合零基础 大公司在用
Cloudera
  • Cloudera’s DistributionIncluding Apache Hadoop 简称CDH
  • 中小型公司用、简单方便、自带可视化
Hortonworks
  • 文档较好

注:Cloudera 和Hortonworks 在2018年10月,国庆期间宣布合并

六、环境

Windows硬件环境:

内存:32G(建议最低16G)

个人电脑最大内存检测:

win + R 输入 cmd

输入:

wmic memphysical get maxcapacity

就是字面意思,获取微机最大物理内存容量。

如果:

MaxCapacity:33554432

33554432 除以 1024 除以 1024 等于 32G

即电脑的最大支持内存为32G

如果是:

MaxCapacity:67108864

即电脑的最大支持内存为64G

磁盘:4T+200G SSD(建议最低500+G)

Mac硬件环境:

i7+16G内存+500+SSD

下一篇:074-preBigData-02常用软件安装

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 215,245评论 6 497
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 91,749评论 3 391
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 160,960评论 0 350
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 57,575评论 1 288
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 66,668评论 6 388
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 50,670评论 1 294
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 39,664评论 3 415
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 38,422评论 0 270
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 44,864评论 1 307
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 37,178评论 2 331
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 39,340评论 1 344
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 35,015评论 5 340
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 40,646评论 3 323
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 31,265评论 0 21
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 32,494评论 1 268
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 47,261评论 2 368
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 44,206评论 2 352

推荐阅读更多精彩内容