240 发简信
IP属地:广东
  • hadoop ec说明

    1. ec 算法 通过对数据编解码,以实现在部分数据丢失时仍能够将其恢复。 EC的目标和作用:对n个同样大小的数据块, 额外增加m个校验块, 使得这n+m个数据中任意丢失m个...

  • kafka核心要点

    1. 主要功能 kafka是分布式,高吞吐,持久化的中间件消息系统 消息队列: 异步解耦,系统之家不需要直接调用耦合在一起; 日志采集 事件所愿、系统数据总线邓 2. 核心架...

  • spark dag切分

    1、RDD介绍 弹性分布式数据集。 父RDD: 生成当前RDD所以来的上游RDD,父RDD是相对的子RDD: 经过算子计算后,有上游RDD生成的数据,子RDD是相对的 2、R...

  • spark 数据倾斜

    1. 数据倾斜如何处理 1.1、map阶段读倾斜 读取阶段数据倾斜主要是因为读取的数据分布不均匀导致; 常见情景有 采用了不可分割的压缩方式,比如gzip, snappy等。...

  • spark shuffle

    1、 join 算法 join算法是 一般是reduce阶段执行时选择的join算法 1.1、BroadcastHashJoin 最快的join算法,只需map端匹配,无需s...

  • spark 执行过程

    1. Spark on YARN 支持两种运行模式: 模式说明特点yarn-clientDriver 运行在本地提交端适合调试、小任务yarn-clusterDriver 运...

  • claude code skill

    背景 日常工作中重复的工作用claude code skill 功能编写工作流程,这样就能提升效率,释放人力 使用步骤 浏览器使用 考虑到兼容性采用chrome-devtoo...

  • ss5反向代理

    sokect 反向代理实现不修改目标的网络访问 1、基础环境 2、编译 http://ss5.sourceforge.net/[http://ss5.sourceforge....

  • 120
    虚拟机访问宿主机内代理问题解决

    背景 安装openclaw 遇到时需要访问github问题,因为虚拟机中没有代理一次,下载很慢,有时甚至下载不下来 解决 1. 代理设置 我这里用的clash,其他同理 2....

  • openclaw多agent协调配置(ai生成,待验证)

    实现多个 Agent 之间的协同工作。我们将以“研发 Agent 请求运维 Agent 提供 Hive 机器信息”的典型场景为例,逐步说明配置方法和操作流程。 1. 前置条件...

  • 120
    服务器内安装openclaw

    1.环境初始化 2. 安装 安装node 环境,node版本需要 >= V22.19.xxx,使用版本v22.20.0 3. 设置npm镜像 4. 安装 安装过程比较耗时,8...

  • docker 基本使用

    docker下载镜像 docker.xuanyuan.run 当前国内比较稳的镜像,要花钱阿里云,腾讯云只有相关厂商服务器才能访问 启动 进入容器 docker run 命令...

  • 大模型python 环境初始化安装

    python 环境采用conda 进行初始化化 下载链接 miniconda的资源页面的链接[https://repo.anaconda.com/miniconda] 安装 ...

  • python2 pip安装

    python2 pip安装 现在对于python2版本,直接修改python.exe名字为python2.exe,命令python2 -m pip install --upg...

  • elastic shoud查询的注意事项

    should 查询 当 BoolQuery 中有 must/filter/must_not 子句,时,should 子句的默认匹配规则是「满足 0 个或多个」(而非「至少满足...

  • jar 命令常用说明

    jar 命令选项说明 主要操作模式(必须指定一个) 选项描述备注c创建新的 JAR 文件c 创建t列出 JAR 文件的内容r 查看x从 JAR 文件中提取文件r 读取u更新现...

  • 120
    JVM组成

    参考链接:一篇文章彻底理解JVM的组成,各组件的底层实现逻辑[https://blog.csdn.net/Aaaaaaatwl/article/details/1424640...

  • 120
    kafka消费能力不足解决

    背景 通过监控发发现topic消费状态不正常 原因 kafka在业务消费500条数据处理时间超过5分钟时会引起消费者的rebalance,从而影响消费速率甚至数据重复问题。 ...