基础构件:增强型 LLM
所有智能体模式的原子单元都是 Augmented LLM——在裸模型之上叠加三大能力:
检索 (Retrieval)
RAG、向量搜索、工具文档——将外部知识注入 LLM 上下文,弥补训练数据截止和领域知识缺失。
工具 (Tools)
函数调用、API 集成、代码执行——让 LLM 从"只说不做"变为"说做合一",扩展行动边界。
记忆 (Memory)
短期(对话上下文)、长期(向量存储)、程序性(技能库)——让 Agent 具备学习和适应能力。
Augmented LLM = LLM + 检索 + 工具 + 记忆 —— 所有后续模式都是这个原语的不同组合方式。
五大 Workflow 模式
Workflow 模式是确定性编排——流程由开发者预定义,LLM 在每个节点内执行。适合已知流程的生产场景。
Prompt Chaining
将复杂任务拆为顺序步骤链,上一步输出作为下一步输入。中间可插入质量门控 (gate)。
适合:可分解为固定步骤的确定性任务。如:生成大纲 → 验证 → 写正文 → 格式化。
Routing
分类器将输入路由到不同处理分支。每个分支有独立的 Prompt 和工具集。
适合:输入类型多样、需要差异化处理的场景。如:客服系统中按意图路由到不同处理流。
Parallelization
多个 LLM 同时工作,分为 Sectioning(分段并行)和 Voting(多视角投票)。
适合:子任务无依赖、或需要多角度校验。如:长文档分段处理、安全审查多票决。
Orchestrator-Workers
中央 Orchestrator 动态分解任务,分配给多个 Worker LLM,再合成结果。
适合:无法预知子任务结构的探索性任务。如:代码审查中动态发现需检查的维度。
Evaluator-Optimizer
Generator 生成输出,Evaluator 评估并给出反馈,Generator 基于反馈迭代优化。
适合:有明确评估标准且需要多轮改进的任务。如:代码生成 + 测试 + 修复循环。
四种单 Agent 模式
单 Agent 模式赋予 LLM 自主决策能力——流程由 Agent 动态控制,而非预定义。
ReAct
核心循环:Thought → Action → Observation → Thought...
将推理 (Reasoning) 和行动 (Acting) 交替进行。最基础、最广泛使用的 Agent 模式。工具调用在 Action 阶段完成。
局限:长任务中容易迷失方向,缺乏全局规划。
Reflexion
核心思想:在 ReAct 基础上加入反思层——执行失败后生成 verbal reflection,存入记忆,下次执行时检索使用。
效果:HumanEval 通过率从 80.1% 提升至 91.0%。Agent 从错误中学习。
局限:反思质量依赖模型能力,记忆检索可能引入噪声。
Tree of Thoughts (ToT)
核心思想:将推理从线性链扩展为搜索树。每步生成多个候选方案,用评估函数剪枝,保留最优路径。
适合:需要探索和回溯的组合问题。如:24 点游戏、创意写作、战略规划。
局限:计算成本高(多路径并行评估)。
Plan-and-Execute
核心思想:分离规划和执行。Planner 生成完整计划,Executor 逐步执行,执行结果可触发 Re-planning。
优势:全局视野清晰,长任务不易偏航。比纯 ReAct 更适合复杂任务。
局限:规划阶段本身可能出错,且重规划成本高。
五种多 Agent 模式
当单 Agent 能力到达天花板时,多 Agent 模式通过分工和协作突破复杂度边界。
Sequential (顺序链)
Agent 形成线性流水线,前一个的输出是后一个的输入。最简单的多 Agent 模式。
代表:LangGraph 的 StateGraph 线性编排,Prompt Chaining 的多 Agent 版本。
Concurrent (并行蜂群)
多个 Agent 同时处理不同子任务,结果通过聚合函数合并。可配合 Map-Reduce 模式。
代表:Anthropic 并行工具调用,多 Agent 投票机制。
Group Chat (群组对话)
多个 Agent 在同一对话空间中交互,通过轮流发言达成共识。需要一个 Moderator 管理发言顺序。
代表:AutoGen GroupChat,ChatDev 多角色对话。
Handoff (交接委托)
Agent 之间通过 handoff 函数转移控制权。当前 Agent 判断自己无法处理时,将对话连同上下文交接给更合适的 Agent。
代表:OpenAI Swarm 的核心原语,客服系统的多级转接。
Magentic-One (多角色协作)
微软提出的通用多 Agent 架构:Orchestrator + WebSurfer + FileSurfer + Coder + ComputerTerminal,五个固定角色协作完成复杂任务。
特点:角色固定、职责清晰、Orchestrator 动态调度。
四种认知架构
认知架构源自认知科学,为 Agent 提供类人思维的底层框架。
ACT-R
Adaptive Control of Thought-Rational。将认知分为声明性记忆 (facts) 和程序性记忆 (skills) 两大模块,通过产生式规则驱动行为。
LLM 映射:Transformer 注意力 ≈ 声明性检索,Fine-tuning ≈ 程序性学习。
SOAR
State, Operator, And Result。通过问题空间和问题解决算子建模认知。核心机制是 impasse(僵局)触发子目标递归求解。
LLM 映射:ReAct 的 Action 选择 ≈ SOAR 的算子应用,Planning 的 Re-planning ≈ impasse 处理。
LIDA
Learning Intelligent Distribution Agent。基于全局工作空间理论 (GWT),模拟意识循环:感知 → 理解 → 意识广播 → 行动选择。
LLM 映射:注意力机制 ≈ 意识广播,Multi-Agent 的消息总线 ≈ 全局工作空间。
CLARION
双层架构:显性层 (explicit, 规则驱动) 和隐性层 (implicit, 模式驱动) 并行运行并互相影响。
LLM 映射:System Prompt / 规则引擎 ≈ 显性层,Few-shot / 上下文学习 ≈ 隐性层。
ACI 工具设计原则
Agent-Computer Interface (ACI) 是 Agent 与外部工具交互的界面设计学科——好的 ACI 设计能显著提升 Agent 的工具使用成功率。
语义三要素
命名 (Naming)
工具名应语义明确、无歧义。search_orders 优于 get_data。Agent 通过名称推断功能。
参数 (Parameters)
参数描述应包含类型、约束、示例值。使用 enum 限制取值范围,用 description 说明语义。
返回 (Returns)
返回结构应稳定、可预测。错误信息应包含原因和建议操作,而非仅返回 "error"。
两种调用范式
Function Calling:LLM 输出结构化 JSON 调用请求,Runtime 执行后将结果返回 LLM。主流、推荐。
Code Execution:LLM 直接生成可执行代码(Python/JS),在沙箱中运行。灵活但安全性需额外保障。
两种编排模式
Flat (扁平):所有工具直接暴露给 Agent,Agent 自行选择。简单场景高效。
Hierarchical (层级):工具按领域分组,先选领域再选工具。或通过 Router Agent 分发。大规模工具集时必需。
选型决策树
面对具体场景时,按以下路径快速选择最合适的 Agent 模式:
任务复杂度?
|
+-- 简单(单一明确目标)
| +-- 无工具调用 → Prompt Chaining
| +-- 需工具调用 → ReAct
|
+-- 中等(需规划但目标明确)
| +-- 步骤可预知 → Plan-and-Execute
| +-- 需试错改进 → Reflexion 或 Evaluator-Optimizer
| +-- 需探索回溯 → Tree of Thoughts
|
+-- 复杂(跨领域、大规模)
+-- 单一领域 → Orchestrator-Workers
+-- 多领域交接 → Handoff
+-- 需多视角共识 → Group Chat 或 Concurrent + Vote
+-- 全流程自动化 → Magentic-One 或 CrewAI
七大框架对比
| 框架 | 核心抽象 | 编排方式 | 多 Agent | 最佳场景 |
| LangChain | Chain + Agent | LCEL 声明式链 | 基础支持 | 快速原型,RAG 应用 |
| LangGraph | StateGraph | 有向图 + 状态机 | 原生支持 | 复杂工作流,需精确控制流 |
| CrewAI | Crew + Agent + Task | 角色扮演 + 流程 | 核心功能 | 团队协作模拟,角色驱动任务 |
| AutoGen | ConversableAgent | 对话驱动 | 核心功能 | 研究探索,多 Agent 对话 |
| OpenAI Swarm | Agent + Handoff | Handoff 函数 | 轻量支持 | 客服路由,简单交接场景 |
| Semantic Kernel | Kernel + Plugin | Planner 自动编排 | 有限支持 | 企业集成,.NET/Java 生态 |
| Haystack | Pipeline + Component | DAG 管道 | 有限支持 | 搜索/RAG 管线,NLP 处理 |
深入探索
本页是方法论的高层概览。如需每个模式的深入分析、完整代码示例、性能对比与实战案例,请访问完整版:
阅读完整版方法论 →