hdfs调度

HDFS NameNode 调度

  • NOT_IN_SERVICE
  节点退役、维护、死亡,不在服务状态。

  相关:dfs.hosts, dfs.hosts.exclude
  • NODE_STALE
  节点心跳或状态太久没更新。

  相关:dfs.namenode.stale.datanode.interval

      dfs.namenode.avoid.write.stale.datanode
  • NODE_TOO_BUSY / NODE_BUSY
  节点当前太忙。(xceiver count

DataXceiver 数量

当前读写连接数

DataNode 当前传输线程数

DataNode load

正在进行的 replication 数

正在进行的 write pipeline 数)

  相关:dfs.namenode.redundancy.considerLoad

      dfs.namenode.replication.considerLoad
  • TOO_MANY_NODES_ON_RACK
  某个 rack 已经放了太多副本。

  相关:net.topology.script.file.name
  • NOT_ENOUGH_STORAGE_SPACE
  节点或磁盘空间不足。(DataNode 剩余空间

DataNode 每块 volume 剩余空间

是否满足 block 写入需要

是否超过预留空间)

  相关:dfs.datanode.du.reserved

      dfs.datanode.data.dir
  • NODE_SLOW
  DataNode 被识别为慢节点。(DataNode 之间传输耗时)

  相关:dfs.datanode.peer.stats.enabled

      dfs.datanode.outliers.report.interval
  • DISK_SLOW
  DataNode 某块磁盘被识别为慢盘。

  相关:dfs.datanode.fileio.profiling.sampling.percentage

      dfs.datanode.outliers.report.interval

      dfs.datanode.slow.io.warning.threshold.ms

原因 主要监控/判断指标

  1. NOT_IN_SERVICE DataNode 服务状态、退役状态、维护状态、死亡状态

  2. NODE_STALE 心跳延迟、last contact、stale node 数量

  3. NODE_TOO_BUSY / NODE_BUSY xceiver 数量、读写连接数、传输线程、节点负载、复制流数量

  4. TOO_MANY_NODES_ON_RACK rack 分布、已选副本 rack 数量、机架拓扑

  5. NOT_ENOUGH_STORAGE_SPACE DFS remaining、volume remaining、reserved space、failed volume

  6. NODE_SLOW peer latency、pipeline ack latency、slow peer report

  7. DISK_SLOW disk read/write/meta latency、slow disk report

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容