什么是 AI Agent?从小白到入门

LLM 为什么不够:从聊天到行动

你大概已经习惯了这样的工作方式:遇到问题 → 打开 ChatGPT → 输入提示词 → 得到回答 → 复制粘贴到某处。

这个流程有一个根本性的问题——LLM 只会"说",不会"做"

你问它"帮我查一下明天的天气",它能告诉你怎么查,但不会帮你查。你让它"把这个 CSV 转成 JSON 并写入数据库",它只能给你一段代码,剩下的执行、调试、错误处理全靠你自己。

这就是 LLM 的边界:一个极其博学但没有手脚的大脑

AI Agent 要解决的正是这个问题。如果 LLM 是大脑,Agent 就是给这个大脑装上了眼睛(感知环境)、手(使用工具)、记事本(记忆上下文)和日程表(规划步骤)。

一个经典的例子:

你对 Agent 说:"帮我找出项目里所有未使用的依赖并清理掉。"

Agent 会自动:读取 package.json → 逐个分析引用 → 找出未使用的包 → 执行卸载 → 验证项目仍能正常构建。

全程不需要你介入。这就是 Agent 的核心价值——从"回答问题"到"完成任务"

LLM到Agent升级对比

Agent 四大核心组件拆解

学术界和工业界对 Agent 的定义各有不同,但几乎所有 Agent 系统都围绕四个核心组件构建:

1. 感知(Perception)

Agent 需要理解当前的环境和任务。感知的输入可以是:

  • 用户的自然语言指令
  • 系统的状态信息(如文件内容、数据库状态)
  • 外部事件(如 webhook 触发、定时任务)

在 Claude Code 中,感知就是它读取你的项目文件、理解你的需求描述、观察终端输出的能力。

2. 规划(Planning)

拿到任务后,Agent 需要把它拆解成可执行的步骤。这就是规划。

一个复杂的任务比如"重构认证模块",Agent 可能会规划出这样的步骤:

  1. 分析现有认证模块的代码结构
  2. 识别所有依赖点
  3. 制定重构方案
  4. 逐个模块修改
  5. 运行测试验证

规划能力是区分"好 Agent"和"差 Agent"的关键。好的规划能处理任务间的依赖关系,知道哪些步骤可以并行,哪些必须串行。

3. 工具调用(Tool Use)

这是 Agent 的"手"。通过调用外部工具,Agent 才能真正影响现实世界。

常见的工具包括:

工具类型 例子 能做什么
文件操作 读写文件 创建、修改、删除代码
命令执行 Shell/Bash 运行构建、测试、部署
网络请求 HTTP/搜索 查询 API、搜索文档
数据库 SQL 执行 查询和修改数据

2024 年底 Anthropic 提出了 MCP(Model Context Protocol) 协议,试图统一工具调用的标准。到 2026 年,几乎所有主流 Agent 框架都已支持 MCP,相当于给 Agent 预装了一个"万能工具箱接口"。

4. 记忆(Memory)

Agent 需要记住之前做过什么,才能做出合理的后续决策。记忆通常分为两类:

  • 短期记忆:当前对话的上下文,比如"我刚才已经修改了 A 文件"
  • 长期记忆:跨会话的知识积累,比如"这个项目使用 pnpm 而不是 npm"

Claude Code 的记忆系统就是一个典型的长期记忆实现——它会把项目约定、用户偏好等信息持久化到文件中,下次对话时自动加载。

四个组件的协作关系可以简单理解为:

Agent四组件循环流程

这个循环会一直持续,直到任务完成。

主流 Agent 范式一览

不同的 Agent 采用不同的策略来完成上述循环。目前最主流的几种范式:

ReAct(Reasoning + Acting)

最经典的 Agent 范式。Agent 交替进行"思考"和"行动":

  1. 思考:分析当前状态,决定下一步做什么
  2. 行动:调用工具执行操作
  3. 观察:获取工具执行的结果
  4. 回到第 1 步,直到任务完成
ReAct范式循环
思考:用户想删除 node_modules 里未使用的包,我需要先分析依赖关系
行动:运行 npx depcheck
观察:发现 lodash 和 dayjs 未被引用
思考:需要确认这些包确实没有被间接引用
行动:搜索代码中的 import 语句
观察:确认没有引用
行动:执行 npm uninstall lodash dayjs

Claude Code 日常工作中大量使用这种模式——你看到它在"思考"然后"执行工具"就是 ReAct 在工作。

ReAct范式循环

Plan-and-Execute

先把整个计划制定好,再逐步执行。适合任务步骤明确、依赖关系清晰的场景。

优势是执行效率高(不用每步都重新思考),劣势是一旦计划有误,可能需要回滚重来。

Reflexion

在 ReAct 基础上加入了"自我反思"——Agent 完成任务后会评估自己的表现,如果结果不理想就调整策略重试。

这相当于 Agent 有了"自我纠错"的能力,是目前 Agent 研究的热门方向之一。

怎么选?

范式选择决策
范式 适用场景 代表实现
ReAct 通用任务、需要灵活应对 Claude Code、大多数 Agent 框架
Plan-and-Execute 多步骤复杂任务 LangGraph
Reflexion 需要高质量输出的场景 学术研究、代码审查 Agent

实际应用中,这些范式经常组合使用。一个成熟的 Agent 系统可能在规划阶段用 Plan-and-Execute,执行阶段用 ReAct,验证阶段用 Reflexion。

动手体验:用 Claude Code 跑一次 Agent

概念讲完了,来点实际的。Claude Code 是目前最容易上手的 Agent 体验之一——你不需要写任何代码,只需要一个终端。

准备工作

  1. 安装 Claude Code:npm install -g @anthropic-ai/claude-code
  2. 在任意项目目录下运行 claude 启动交互式会话

实操演示

试试对 Claude Code 说:

"分析一下这个项目的依赖关系,列出哪些依赖可能是多余的。"

你会看到 Agent 的完整工作过程:

  1. 感知:读取 package.json,了解项目依赖
  2. 规划:决定逐个分析每个依赖的使用情况
  3. 工具调用:使用 grep 搜索代码中的 import 语句
  4. 记忆:记住哪些依赖被使用、哪些没有
  5. 输出结论:给出分析报告和建议

再试一个更复杂的:

"帮我给这个项目添加 ESLint 配置,使用主流的规则集。"

这次你会看到更多步骤——安装依赖、创建配置文件、运行检查、修复问题——全部自动完成。

关键观察点

在体验过程中,重点关注这几件事:

  • Agent 如何拆解任务:看它的"思考"过程,理解规划逻辑
  • Agent 如何处理错误:当工具调用失败时,它是否会自动调整策略
  • Agent 何时停下来问你:好的 Agent 知道什么决策需要人类确认

通过这两个小练习,你对 Agent 的体感就建立起来了。接下来如果想深入,可以尝试用 LangGraph 或 CrewAI 搭建自己的 Agent——那才是真正的 Agent 开发。

小结

AI Agent 的核心就是把 LLM 从一个"只会说话的知识库"升级为一个"能感知、会规划、有工具、能记忆"的自主系统。

四个核心组件(感知、规划、工具调用、记忆)构成了 Agent 的基本骨架,而 ReAct、Plan-and-Execute 等范式则是不同的运行策略。

如果你之前只把 ChatGPT 当"高级搜索"来用,现在是时候体验 Agent 了——打开 Claude Code,给它一个真实任务,你会真正感受到 AI 从"回答问题"到"完成任务"的质变。

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容