登录注册写文章

Spark算子：统计RDD分区中的元素及数量

Spark算子：统计RDD分区中的元素及数量

Spark RDD是被分区的，在生成RDD时候，一般可以指定分区的数量，如果不指定分区数量，当RDD从集合创建时候，则默认为该程序所分配到的资源的CPU核数，如果是从HDFS文件创建，默认为文件的Block数。

具体看例子：

//创建一个RDD，默认分区15个，因为我的spark-shell指定了一共使用15个CPU资源//–total-executor-cores 15

rdd1 parititons

//统计rdd1每个分区中元素数量

partition中元素数量

//统计rdd1每个分区中有哪些元素

partition中元素

//从HDFS文件创建的RDD，包含65个分区，因为该文件由65个Block

rdd2 partitions

//rdd2每个分区的元素数量

partition中元素数量

最后编辑于：2017.12.03 05:08:58

©著作权归作者所有,转载或内容合作请联系作者
平台声明：文章内容（如有图片或视频亦包括在内）由作者上传并发布，文章内容仅代表作者本人观点，简书系信息发布平台，仅提供信息存储服务。

推荐阅读更多精彩内容

Apache Spark 2.2.0 中文文档 - Spark SQL, DataFrames...
Spark SQL, DataFrames and Datasets Guide Overview SQL Dat...
草里有只羊阅读 18,378评论 0赞 85
Apache Spark 2.2.0 中文文档 - Spark SQL, DataFrames...
Spark SQL, DataFrames and Datasets Guide Overview SQL Dat...
Joyyx阅读 8,347评论 0赞 16
Apache Spark 2.2.0 中文文档 - Spark 编程指南 | ApacheCN
Spark 编程指南概述 Spark 依赖初始化 Spark 使用 Shell 弹性分布式数据集 (RDDs)...
草里有只羊阅读 3,279评论 0赞 15
Apache Spark 2.2.0 中文文档 - Spark Streaming 编程指南 ...
Spark Streaming 编程指南概述一个入门示例基础概念依赖初始化 StreamingConte...
Joyyx阅读 5,397评论 0赞 26
Apache Spark 2.2.0 中文文档 - Spark 编程指南 | ApacheCN
Spark 编程指南概述 Spark 依赖初始化 Spark 使用 Shell 弹性分布式数据集 (RDDs)...
Joyyx阅读 1,884评论 0赞 4

1赞2赞

赞赏

手机看全文