从单 Agent 到多 Agent 系统——协作拓扑、Generator-Evaluator 架构与自我完善飞轮
多智能体系统 (Multi-Agent System, MAS) 是指由 2 个或更多独立 Agent 通过协议和共享环境进行协作的系统。每个 Agent 拥有自己的感知能力、决策能力和行动能力,通过消息传递或共享状态协调完成任务。
| 维度 | 单 Agent | 多 Agent |
|---|---|---|
| 架构复杂度 | 低,单一控制流 | 高,需协调、通信、共识机制 |
| 可扩展性 | 受限于单 LLM 上下文窗口 | 可按需增减 Agent,天然水平扩展 |
| 容错性 | 单点故障 | 部分失败可隔离,整体继续运行 |
| 适用场景 | 明确、线性的任务 | 跨领域、大规模、需分工的复杂任务 |
| 成本 | 较低,单模型调用 | 较高,多模型 × 多轮调用 |
| 典型框架 | ReAct, Plan-and-Execute | CrewAI, AutoGen, OpenAI Swarm |
拓扑决定了 Agent 之间信息流动的方式。选择拓扑的核心依据是问题的 依赖结构——任务之间是否有先后、是否可并行、是否需要共识。
拓扑选择应镜像问题的依赖结构,而非追求复杂性。层级拓扑适合可分解问题,并行拓扑适合可独立求解的问题,顺序拓扑适合严格依赖链,网络拓扑适合需要共识的问题。选错拓扑比选错模型更致命。
多 Agent 系统的规划分为两大范式,核心区别在于 分解和执行是否交替进行。
生产系统通常混合两种策略:用静态规划生成高层大纲(里程碑和依赖关系),在执行每个子任务时使用动态规划展开细节。这样既有全局视野,又保持对变化的适应性。类似敏捷开发中的"Epic → Sprint → Daily"三层规划。
受 GAN (生成对抗网络) 启发,Generator-Evaluator 架构将 Agent 系统分为三个核心角色:Planner(规划)、Generator(生成)和 Evaluator(评估),形成持续改进的闭环。
| 角色 | 职责 | 典型实现 | 调用成本 |
|---|---|---|---|
| Planner | 分析需求,分解任务,制定执行计划 | 高质量模型 (Claude Opus / GPT-4o) | $0.46 |
| Generator | 执行具体生成/编码任务 | 高能力模型 + 工具调用 | $71.00 |
| Evaluator | 评估输出质量,提供反馈,触发返工 | 专项评估模型 + 规则检查 | $3.24 |
| 典型 Sprint 总成本 | ~$124.70 | ||
V1 Sprint 架构:Planner 一次性生成完整计划,Generator 按计划顺序执行,Evaluator 在最后做一次性评估。适合短任务,但长任务中 Generator 可能偏离方向而 Evaluator 无法及时纠正。
V2 持续构建:Generator 每完成一个子任务就提交给 Evaluator,Evaluator 实时反馈,Planner 根据评估结果动态调整后续计划。形成 Generator↔Evaluator 的快速反馈回路。
自我完善飞轮是 MAS 实现持续进化的核心机制,将 Agent 的每一次执行都转化为未来改进的素材。
自我完善飞轮的 Memory 环节直接对应三层记忆架构:工作记忆维持当前任务上下文(如 ReAct 的思考链),短期记忆存储近期会话的反思结果(如 Reflexion 的 verbal memory),长期记忆积累跨会话的规律(如向量数据库中的历史经验)。飞轮每转一圈,长期记忆就更丰富,Agent 的能力边界就更大。
一个典型的多 Agent 顺序流水线应用——将政务执法案件的复杂处理流程拆解为七个专职 Agent,形成端到端的自动化处理管线。
| 阶段 | Agent 名称 | 职责 | 输入 → 输出 |
|---|---|---|---|
| 1 | 任务分解 Agent | 解析案件描述,识别违法行为类型,分解为结构化子任务 | 案件文本 → 结构化任务清单 |
| 2 | 合规审查 Agent | 检查案件处理是否符合程序法和实体法要求 | 任务清单 → 合规检查报告 |
| 3 | 条款匹配 Agent | 从法规数据库中检索并匹配适用法律条款 | 违法行为描述 → 适用条款列表 |
| 4 | 处罚分析 Agent | 基于匹配条款和案件情节,分析量罚建议 | 条款 + 情节 → 处罚建议 |
| 5 | 归档 Agent | 将处理结果整理为标准格式,生成案件档案 | 全流程数据 → 标准案件档案 |
| 6 | 整改追踪 Agent | 生成整改通知,设定追踪时间节点和验收标准 | 处罚建议 → 整改追踪计划 |
| 7 | 摘要 Agent | 生成面向不同受众(领导/当事人/公众)的案件摘要 | 全流程数据 → 多版本摘要 |
政务执法场景对准确性和可追溯性要求极高。单 Agent 处理七类任务会导致 Prompt 臃肿、上下文稀释和角色混乱。拆分为七个专职 Agent 后:每个 Agent 的 System Prompt 可以高度优化;中间结果可在 Agent 之间持久化,断点可恢复;每个 Agent 可独立升级和测试;出了问题可以精确定位到具体环节。