企业推进 AI 化,很多时候第一反应是换模型、调 Prompt、接入更多工具。
但真正落到研发、运维、故障排查这些复杂场景时,问题往往不在模型,而在底层监控系统。
过去十年,企业用 Prometheus、ELK、Grafana、SkyWalking、Jaeger、CMDB、告警系统、工单系统、自动化平台,拼出了一套自己的监控体系。在云原生时代,这套体系能支撑运维团队看指标、查日志、排故障。但到了 AI Agent 时代,它正在成为企业 AI 化的新阻力。
因为 Agent 需要的不是更多页面,而是完整上下文。
监控系统的使用者,已经变了
过去,监控系统的核心价值,是帮助少数专家更快发现问题:开发提交代码,运维维护平台,SRE 分析故障...
但 Agent 出现后,监控系统的使用者不再只是人。
未来,一个企业内部可能会有大量 Agent 参与研发、运维、测试、发布、巡检和故障分析。它们需要查日志、看指标、读链路、理解资源关系、关联变更记录,甚至执行 Runbook、调整配置、触发修复动作。
对 Agent 来说,监控平台不是 Dashboard。它是理解系统的入口,也是行动前的判断依据。
如果这个入口本身是割裂的,Agent 再聪明,也只能在碎片里做判断。

分散的监控平台,会让 Agent 失去上下文
很多企业现在的观测体系,表面上很完整,实际却是分散的。指标在 Prometheus,日志在 ELK,链路在 SkyWalking,资源关系在 CMDB,发布记录在 Jenkins,工单在 Jira,运行状态在 Kubernetes...
人排查问题时,可以凭经验在多个系统之间来回切换。但 Agent 不行。Agent 的判断依赖上下文。上下文越完整,分析越准确;上下文越碎,结论越容易跑偏。
当指标、日志、链路、资源、变更记录分散在不同系统里,Agent 很难知道:
- 这次错误率上升,是不是和刚刚的发布有关?
- 这条链路变慢,是应用问题,还是资源问题?
- 这段异常日志,是否影响了核心业务?
- 这个告警,是单点异常,还是系统性风险?
如果数据之间无法自动关联,Agent 看到的就只是一个个孤立片段。
所以很多企业会发现,模型能力在提升,Agent 也接入了更多工具,但故障定位效率并没有明显变化。
根本原因不是 Agent 不够强,而是监控系统没有给它足够完整的上下文。

没有多租户隔离,Agent 很容易越界
Agent 和传统工具最大的区别,是它不只会看,还会做。未来的 Agent 可能会自动重启服务、调整副本数、修改配置、创建告警、生成 Dashboard,甚至执行自动化修复流程。
这就带来了一个关键问题:边界。
传统自建监控平台大多面向运维团队设计,默认使用者是可信管理员。因此,很多系统的数据权限、资源权限、API 权限都比较粗放。
对人来说,这还能靠流程和制度约束。
对 Agent 来说,这远远不够。
因为 Agent 会主动搜索数据、调用工具、执行动作。如果没有天然的多租户隔离,它就可能访问不属于自己的业务数据,甚至跨团队、跨业务线执行操作。
AI 时代,企业最担心的不是 Agent 不够聪明。而是 Agent 足够聪明,却没有清晰边界。
所以,当企业开始让 Agent 接入监控、运维和自动化系统时,多租户隔离、权限治理、执行边界必须成为平台能力,而不是后期补丁。

观测能力,应该交给应用构建者
过去,监控平台通常由运维团队统一建设和维护。开发团队写代码,运维团队看系统。但在 AI 时代,这种分工正在变得低效。真正需要观测能力的人,正在变成应用构建者。
- 开发人员需要为自己的服务定义指标和视图
- 业务团队需要看到关键流程的运行状态
- Agent 需要围绕具体应用获取上下文,完成分析和行动
也就是说,观测能力不能只停留在运维平台里,而要进入应用构建过程本身。
但这并不代表企业可以放弃统一治理。应用团队需要自治,平台团队也需要全局视角。企业仍然要统一管理资源、权限、安全、成本和依赖关系。
这就要求新一代观测平台既能支持团队自治,又能保持全局统一。
这正是传统拼接式监控平台最难做到的地方。
AI 时代,需要一套统一观测底座
Agent 的能力上限,取决于上下文。而上下文的质量,取决于观测底座是否统一。
企业需要的不是再增加一个监控工具,也不是再搭一个新的 Dashboard,而是一套面向 AI Agent 的统一观测平台。
- 它要把日志、指标、链路、事件、资源、用户体验、安全数据和业务上下文统一起来。
- 它要让 Agent 能够通过一个入口理解系统,而不是在多个工具之间来回猜测。
- 它也要让企业在开放观测能力的同时,守住权限、租户和安全边界。
未来的观测平台,不只是给人看的系统状态页。
它会成为企业 Agent 的上下文中心、权限中心和行动入口。

观测云:让监控系统跟上 AI 化
观测云不是把多个开源组件简单拼在一起,而是围绕统一观测模型构建的一体化平台。
在观测云中,日志、指标、链路、事件、用户体验、安全数据和资源关系运行在统一的数据与权限体系之上。
这意味着,Agent 可以通过一个入口获取完整上下文,通过一套权限体系完成安全访问,通过统一资源目录理解服务、资源和业务之间的关系,并在可控边界内执行自动化动作。
- 对开发团队来说,观测云让他们可以围绕自己的应用快速构建观测能力。
- 对平台团队来说,观测云保留了全局治理能力,可以统一管理资源、权限、成本和安全。
- 对 Agent 来说,观测云既提供完整上下文,也提供清晰边界。
这才是企业真正进入 AI Agent 时代所需要的监控底座。
别让过去十年搭建的监控基础设施,成为未来 AI 化的绊脚石。
观测云要做的,是让监控系统从“给人看的 Dashboard”,升级为“让 Agent 理解企业、协同行动的统一观测底座”。