order by:对输入做全局排序,因此只有一个reduce(多个reduce无法保证全局有序),只有一个reduce,当输入规模较大时,需要较长的计算时间。
sort by:局部排序,在数据进入reduce前完成排序.
distribute by:按照指定字段对数据进行划分输出到不同的reduce中。
cluster by:除具distribute by功能外还具有sort by的功能。
hive中sort by,order by,cluster by,distribute by各自表达的意思
©著作权归作者所有,转载或内容合作请联系作者
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。
推荐阅读更多精彩内容
- 一、order by order by 会对输入做全局排序,因此只有一个reducer(多个reducer无法保证...
- 转载请在文章起始处注明出处,谢谢。 一:order by order by会对输入做全局排序,因此只有一个Redu...
- Order By语法 对全局数据的排序,只有一个reducecolOrder: ( ASC | DESC )col...
- 1、背景表结构 在讲解中我们需要贯串一个 例子,所以需要设计一个情景,对应 还要有一个表结构和填充数据。如下:有3...