传统 RPA 采用规则驱动的指令式架构。它的执行模型是"状态机":每个步骤严格依赖前一步的输出,坐标、XPath、按钮文本全部硬编码在脚本里。页面结构一变,定位失效,整条链路断裂。这种架构的脆弱性源于一个本质缺陷——它只描述"怎么做",从不理解"为什么做"。
AIAgent则采用目标驱动的声明式架构。用户定义目标状态,Agent 自主规划路径、选择工具、处理异常。它的核心组件包括:
感知层:通过 OCR、元素语义识别、视觉理解获取环境状态
推理层:调用大模型分析上下文,生成下一步动作决策
执行层:将决策转化为具体操作,支持浏览器、API、本地应用等多模态交互
记忆层:维护短期任务上下文与长期知识库,支持跨会话学习
目标驱动 vs 规则驱动的差异,本质上是从" imperative programming(命令式)"到" declarative programming(声明式)"的范式迁移。
前者告诉计算机每一步怎么走,后者告诉计算机想要达到什么状态。