← 懂一点

Agent 的大脑与四肢——拆解核心组成

2026-07-21

本文是专栏《从零看懂 AI Agent》第 2 篇。回到目录与导读。上一篇:什么是 AI Agent

上一篇我们说,Agent = 模型 + 循环 + 工具。这一篇把盖子掀开,看看内部到底有哪几个零件。

一个好用的比喻:远程助理

把一个 Agent 想象成你雇的一个远程助理,你只通过消息给他派活。那么:

几乎所有 Agent,无论用什么框架,拆开都是这五块。下面逐个说。

1. 大模型:负责"判断",不负责"记忆"和"执行"

大模型(LLM)是 Agent 的大脑,负责一件事:看着当前情况,判断下一步该干什么

但要记住它的两个"天生短板",这决定了为什么还需要其他零件:

理解这两点,后面的零件就都顺理成章了——它们都是在补大模型的短板

2. 规划(Planning):把大任务拆成小步骤

面对"帮我调研这三家公司并出对比报告"这种大任务,直接让模型一步做完是不现实的。规划做的就是拆解

现实里动态规划往往更稳,因为任务很少完全按预想展开——静态计划一旦撞上意外就断了,而动态规划能随机应变。这套"边想边做"的机制,就是下一篇 ReAct 的主角。

3. 记忆(Memory):短期和长期是两回事

前面说了模型天生"失忆",记忆就是外挂的记事本。它分两层:

记忆这块水很深,第 6 篇会专门讲。这里只需记住:短期靠上下文,长期靠检索。

4. 工具(Tools):Agent 伸向世界的手

工具是 Agent 能"动手"的关键。一个工具本质上是一个函数 + 一段说明书

工具名:查天气
说明:输入城市名,返回该城市今天的天气
参数:city(字符串,城市名)

模型读到这段"说明书",就知道"哦,需要天气信息时我可以调这个"。它输出一个"我要调 查天气,参数 city=北京"的请求,由外面的程序真正去执行,再把结果塞回去。

常见工具:网页搜索、读写文件、执行代码、查数据库、调各种 API。工具越多,Agent 能干的事越多。模型怎么稳定地发出调用请求,是第 4 篇的内容;工具怎么标准化接入,是第 5 篇 MCP的内容。

5. 调度器(Orchestrator):那个转圈的"工头"

前面四块是"零件",调度器是把它们串起来转圈的那段程序。它负责:

它就是上一篇那段 while 循环的真身。 你用的各种 Agent 框架(LangGraph、各家 SDK 等),很大一部分工作就是帮你把这个调度器写好、写稳。

五块拼在一起

把五个零件放进上一篇的循环里,一次完整的运转是这样的:

        ┌──────────── 调度器(工头,管着整个循环)────────────┐
        │                                                      │
  目标 ─┤  1) 组装:历史(记忆) + 工具说明书 → 喂给 大模型        │
        │  2) 大模型 结合 规划 决定:调工具?还是出答案?         │
        │  3) 若调工具 → 执行 工具 → 结果写回 记忆 → 回到第 1 步  │
        │  4) 若出答案 → 结束                                    │
        └──────────────────────────────────────────────────────┘

小结

零件 类比 职责 对应专栏篇目
大模型 大脑 判断下一步 全专栏基础
规划 列计划 拆解大任务 第 3 篇 ReAct
记忆 记事本 提供上下文 第 6 篇记忆
工具 动手执行 第 45 篇
调度器 工头 驱动循环 第 8 篇

记住一句话:其他零件的存在,大多是为了补大模型"没记忆、不会动手"这两个短板。

下一篇,我们放大看那个最核心的循环——ReAct,看模型是怎么"边想边做"的。

继续阅读:ReAct——让模型"边想边做"的经典循环