240 发简信
IP属地:广东
  • hadoop ec说明

    1. ec 算法 通过对数据编解码,以实现在部分数据丢失时仍能够将其恢复。 EC的目标和作用:对n个同样大小的数据块, 额外增加m个校验块, 使...

  • kafka核心要点

    1. 主要功能 kafka是分布式,高吞吐,持久化的中间件消息系统 消息队列: 异步解耦,系统之家不需要直接调用耦合在一起; 日志采集 事件所愿...

  • spark dag切分

    1、RDD介绍 弹性分布式数据集。 父RDD: 生成当前RDD所以来的上游RDD,父RDD是相对的子RDD: 经过算子计算后,有上游RDD生成的...

  • spark 数据倾斜

    1. 数据倾斜如何处理 1.1、map阶段读倾斜 读取阶段数据倾斜主要是因为读取的数据分布不均匀导致; 常见情景有 采用了不可分割的压缩方式,比...

  • spark shuffle

    1、 join 算法 join算法是 一般是reduce阶段执行时选择的join算法 1.1、BroadcastHashJoin 最快的join...

  • spark 执行过程

    1. Spark on YARN 支持两种运行模式: 模式说明特点yarn-clientDriver 运行在本地提交端适合调试、小任务yarn-...

  • claude code skill

    背景 日常工作中重复的工作用claude code skill 功能编写工作流程,这样就能提升效率,释放人力 使用步骤 浏览器使用 考虑到兼容性...

  • ss5反向代理

    sokect 反向代理实现不修改目标的网络访问 1、基础环境 2、编译 http://ss5.sourceforge.net/[http://s...

  • Resize,w 360,h 240
    虚拟机访问宿主机内代理问题解决

    背景 安装openclaw 遇到时需要访问github问题,因为虚拟机中没有代理一次,下载很慢,有时甚至下载不下来 解决 1. 代理设置 我这里...