玩儿数据 - Sqoop (RDBMS To Hadoop 操作纪实)

本文中的Sqoop使用v1.4.6版本
Sqoop官方档:http://sqoop.apache.org/docs/1.4.6/SqoopUserGuide.html

Sqoop是一个数据同步工具,是apache基金会的顶级项目。
Sqoop可以实现数据在RDBMS和Hadoop的导入导出
Sqoop可以通过简单的配置实现同步功能,免去开发烦恼

本文参照Sqoop官方文档指导完成,由于Sqoop体量并不是很大并且配置相对比较简单,所以官方文档也是很好看懂的,建议大家看一下。感谢A大给我们提供的优秀开源组件 :)

Sqoop Logo
Sqoop

Sqoop基础用法 Doc

使用方法: sqoop COMMAND [ARGS]
  可用命令:
    codegen            生成Sqoop操作数据功能的代码,Sqoop根据用户指定的配置信息生成对应的Java代码,再使用脚本调用代码实现同步功能
    create-hive-table  导入表数据到Hive
    eval               评估测试SQL语句并显示执行结果,可以是RDBMS的Sql或Hql
    export             导出HDFS中的文件或目录到RDBMS
    help               显示可用命令帮助信息
    import             导入表或数据库到HDFS
    import-all-tables  导入指定数据库所有表到HDFS
    job                将配置保存为Sqoop任务,通过job命令可方便控制
    list-databases     列出某主机的所有可用数据库
    list-tables        列出某数据库的所有可用表
    version            显示版本信息

Sqoop导入Mysql数据到HDFS Doc

  1. 在mysql中创建测试数据
DROP DATABASE IF EXISTS sqoop_import_test;
CREATE DATABASE sqoop_import_test DEFAULT CHARSET=utf8;
USE sqoop_import_test;
SET FOREIGN_KEY_CHECKS=0;
DROP TABLE IF EXISTS `emp_test`;
CREATE TABLE `emp_test` (
  `id` int(11) NOT NULL AUTO_INCREMENT,
  `emp_name` varchar(255) DEFAULT NULL,
  `emp_age` int(3) DEFAULT NULL,
  `last_login_time` datetime DEFAULT NULL,
  PRIMARY KEY (`id`)
) ENGINE=MyISAM AUTO_INCREMENT=5 DEFAULT CHARSET=utf8;
INSERT INTO `emp_test` VALUES ('1', '简书', '1', '2017-06-09 14:36:54');
INSERT INTO `emp_test` VALUES ('2', '印象笔记', '2', '2017-06-09 14:37:14');
INSERT INTO `emp_test` VALUES ('3', 'OneNote', '3', '2017-06-09 14:37:31');
INSERT INTO `emp_test` VALUES ('4', '有道云笔记', '4', '2017-06-09 14:37:47');
  1. 将Mysql JDBC使用的jar包添加到Sqoop库
  • 准备对应版本的mysql连接JDBC jar如mysql-connector-java-5.1.38.jar
  • 将该jar拷贝到${Sqoop_HOME}/lib目录下
  1. 执行导入
    我们的目的是将Mysql中的sqoop_import_test.emp_test表导入HDFS,所以我们使用Sqoop的import命令:
sqoop import \
--append \
--connect jdbc:mysql://master:3306/sqoop_import_test \
--username root \
--password root \
--target-dir /rdbms_2_hdfs \
--num-mappers 1 \
--table emp_test \
--fields-terminated-by '&'
  1. 查看结果
    若正常执行完成则会发现HDFS对应目录下会出现相应的文件,查看文件内容与数据库中的一致
HDFS结果查看

Sqoop导入Mysql数据到Hive Doc

准备测试数据的过程同上,不再赘述
执行导入到Hive命令:

sqoop import \
--hive-import \
--connect jdbc:mysql://master:3306/sqoop_import_test \
--username root \
--password root \
--hive-table rdmbs_2_hive \
--num-mappers 1 \
--table emp_test

成功执行后查看Hive中结果:

Hive查询结果

总结

文档中演示的导入操作只是Sqoop提供的最基础功能之一。Sqoop还有很多有趣的用法和有趣的导入配置项,请大家查看官方文档并进行尝试操作 :)

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 204,921评论 6 478
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 87,635评论 2 381
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 151,393评论 0 338
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 54,836评论 1 277
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 63,833评论 5 368
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 48,685评论 1 281
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 38,043评论 3 399
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 36,694评论 0 258
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 42,671评论 1 300
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 35,670评论 2 321
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 37,779评论 1 332
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 33,424评论 4 321
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 39,027评论 3 307
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 29,984评论 0 19
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 31,214评论 1 260
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 45,108评论 2 351
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 42,517评论 2 343

推荐阅读更多精彩内容