240 发简信
IP属地:广东
  • spark总结

    spark 使用说明 1、 join 算法 join算法是 一般是reduce阶段执行时选择的join算法 1.1、BroadcastHashJoin 最快的join算法,只...

  • flink 核心知识

    一、Flink 核心基础认知 核心定位:分布式、实时、有状态、流批一体计算引擎 核心思想:流是本质,批是有界流,统一一套流式 Runtime 执行 两大 API 体系Data...

  • rss 远程shuffle

    rss client driver侧,向codinator申请分配shuffle-server节点;封装给task codinator 接收rss-client请求,响应dr...

  • hadoop ec说明

    1. ec 算法 通过对数据编解码,以实现在部分数据丢失时仍能够将其恢复。 EC的目标和作用:对n个同样大小的数据块, 额外增加m个校验块, 使得这n+m个数据中任意丢失m个...

  • kafka核心要点

    1. 主要功能 kafka是分布式,高吞吐,持久化的中间件消息系统 消息队列: 异步解耦,系统之家不需要直接调用耦合在一起; 日志采集 事件所愿、系统数据总线邓 2. 核心架...

  • spark dag切分

    1、RDD介绍 弹性分布式数据集。 父RDD: 生成当前RDD所以来的上游RDD,父RDD是相对的子RDD: 经过算子计算后,有上游RDD生成的数据,子RDD是相对的 2、R...

  • spark 数据倾斜

    1. 数据倾斜如何处理 1.1、map阶段读倾斜 读取阶段数据倾斜主要是因为读取的数据分布不均匀导致; 常见情景有 采用了不可分割的压缩方式,比如gzip, snappy等。...

  • spark shuffle

    1、 join 算法 join算法是 一般是reduce阶段执行时选择的join算法 1.1、BroadcastHashJoin 最快的join算法,只需map端匹配,无需s...

  • spark 执行过程

    1. Spark on YARN 支持两种运行模式: 模式说明特点yarn-clientDriver 运行在本地提交端适合调试、小任务yarn-clusterDriver 运...

  • claude code skill

    背景 日常工作中重复的工作用claude code skill 功能编写工作流程,这样就能提升效率,释放人力 使用步骤 浏览器使用 考虑到兼容性采用chrome-devtoo...

  • ss5反向代理

    sokect 反向代理实现不修改目标的网络访问 1、基础环境 2、编译 http://ss5.sourceforge.net/[http://ss5.sourceforge....

  • 120
    虚拟机访问宿主机内代理问题解决

    背景 安装openclaw 遇到时需要访问github问题,因为虚拟机中没有代理一次,下载很慢,有时甚至下载不下来 解决 1. 代理设置 我这里用的clash,其他同理 2....

  • openclaw多agent协调配置(ai生成,待验证)

    实现多个 Agent 之间的协同工作。我们将以“研发 Agent 请求运维 Agent 提供 Hive 机器信息”的典型场景为例,逐步说明配置方法和操作流程。 1. 前置条件...

  • 120
    服务器内安装openclaw

    1.环境初始化 2. 安装 安装node 环境,node版本需要 >= V22.19.xxx,使用版本v22.20.0 3. 设置npm镜像 4. 安装 安装过程比较耗时,8...

  • docker 基本使用

    docker下载镜像 docker.xuanyuan.run 当前国内比较稳的镜像,要花钱阿里云,腾讯云只有相关厂商服务器才能访问 启动 进入容器 docker run 命令...

  • 大模型python 环境初始化安装

    python 环境采用conda 进行初始化化 下载链接 miniconda的资源页面的链接[https://repo.anaconda.com/miniconda] 安装 ...