spark 使用说明 1、 join 算法 join算法是 一般是reduce阶段执行时选择的join算法 1.1、BroadcastHashJ...
一、Flink 核心基础认知 核心定位:分布式、实时、有状态、流批一体计算引擎 核心思想:流是本质,批是有界流,统一一套流式 Runtime 执...
rss client driver侧,向codinator申请分配shuffle-server节点;封装给task codinator 接收rs...
1. ec 算法 通过对数据编解码,以实现在部分数据丢失时仍能够将其恢复。 EC的目标和作用:对n个同样大小的数据块, 额外增加m个校验块, 使...
1. 主要功能 kafka是分布式,高吞吐,持久化的中间件消息系统 消息队列: 异步解耦,系统之家不需要直接调用耦合在一起; 日志采集 事件所愿...
1、RDD介绍 弹性分布式数据集。 父RDD: 生成当前RDD所以来的上游RDD,父RDD是相对的子RDD: 经过算子计算后,有上游RDD生成的...
1. 数据倾斜如何处理 1.1、map阶段读倾斜 读取阶段数据倾斜主要是因为读取的数据分布不均匀导致; 常见情景有 采用了不可分割的压缩方式,比...
1、 join 算法 join算法是 一般是reduce阶段执行时选择的join算法 1.1、BroadcastHashJoin 最快的join...
1. Spark on YARN 支持两种运行模式: 模式说明特点yarn-clientDriver 运行在本地提交端适合调试、小任务yarn-...