1. ec 算法 通过对数据编解码,以实现在部分数据丢失时仍能够将其恢复。 EC的目标和作用:对n个同样大小的数据块, 额外增加m个校验块, 使得这n+m个数据中任意丢失m个...
1. ec 算法 通过对数据编解码,以实现在部分数据丢失时仍能够将其恢复。 EC的目标和作用:对n个同样大小的数据块, 额外增加m个校验块, 使得这n+m个数据中任意丢失m个...
1. 主要功能 kafka是分布式,高吞吐,持久化的中间件消息系统 消息队列: 异步解耦,系统之家不需要直接调用耦合在一起; 日志采集 事件所愿、系统数据总线邓 2. 核心架...
1、RDD介绍 弹性分布式数据集。 父RDD: 生成当前RDD所以来的上游RDD,父RDD是相对的子RDD: 经过算子计算后,有上游RDD生成的数据,子RDD是相对的 2、R...
1. 数据倾斜如何处理 1.1、map阶段读倾斜 读取阶段数据倾斜主要是因为读取的数据分布不均匀导致; 常见情景有 采用了不可分割的压缩方式,比如gzip, snappy等。...
1、 join 算法 join算法是 一般是reduce阶段执行时选择的join算法 1.1、BroadcastHashJoin 最快的join算法,只需map端匹配,无需s...
1. Spark on YARN 支持两种运行模式: 模式说明特点yarn-clientDriver 运行在本地提交端适合调试、小任务yarn-clusterDriver 运...
背景 日常工作中重复的工作用claude code skill 功能编写工作流程,这样就能提升效率,释放人力 使用步骤 浏览器使用 考虑到兼容性采用chrome-devtoo...
sokect 反向代理实现不修改目标的网络访问 1、基础环境 2、编译 http://ss5.sourceforge.net/[http://ss5.sourceforge....
背景 安装openclaw 遇到时需要访问github问题,因为虚拟机中没有代理一次,下载很慢,有时甚至下载不下来 解决 1. 代理设置 我这里用的clash,其他同理 2....
实现多个 Agent 之间的协同工作。我们将以“研发 Agent 请求运维 Agent 提供 Hive 机器信息”的典型场景为例,逐步说明配置方法和操作流程。 1. 前置条件...
1.环境初始化 2. 安装 安装node 环境,node版本需要 >= V22.19.xxx,使用版本v22.20.0 3. 设置npm镜像 4. 安装 安装过程比较耗时,8...
docker下载镜像 docker.xuanyuan.run 当前国内比较稳的镜像,要花钱阿里云,腾讯云只有相关厂商服务器才能访问 启动 进入容器 docker run 命令...
python 环境采用conda 进行初始化化 下载链接 miniconda的资源页面的链接[https://repo.anaconda.com/miniconda] 安装 ...
python2 pip安装 现在对于python2版本,直接修改python.exe名字为python2.exe,命令python2 -m pip install --upg...
should 查询 当 BoolQuery 中有 must/filter/must_not 子句,时,should 子句的默认匹配规则是「满足 0 个或多个」(而非「至少满足...
jar 命令选项说明 主要操作模式(必须指定一个) 选项描述备注c创建新的 JAR 文件c 创建t列出 JAR 文件的内容r 查看x从 JAR 文件中提取文件r 读取u更新现...
参考链接:一篇文章彻底理解JVM的组成,各组件的底层实现逻辑[https://blog.csdn.net/Aaaaaaatwl/article/details/1424640...
背景 通过监控发发现topic消费状态不正常 原因 kafka在业务消费500条数据处理时间超过5分钟时会引起消费者的rebalance,从而影响消费速率甚至数据重复问题。 ...