从三条可恢复原语到 ETCLOVG 七层分类——构建生产级 Agent 的执行安全地基
Agent 与传统软件有本质区别。理解这五个特征是设计基础设施的前提——它们决定了我们需要什么样的安全机制。
当前基础设施的薄弱根源在于两个深层错位——我们的安全模型和执行模型都是为上一个时代设计的。
针对五大执行特征和两个结构性错位,我们需要三条传统基础设施中不存在的新原语来构建 Agent 的安全地基。
Effect Log 记录"发生了什么",Capability Gateway 控制"能做什么",Fork Recovery 解决"怎么恢复"。三者形成完整的执行安全闭环:事前约束(Gateway)+ 事中记录(Log)+ 事后恢复(Fork)。缺少任何一条,Agent 都有结构性的安全盲区。
传统基础设施追求"不停机"(99.99% uptime),通过冗余和负载均衡来避免中断。但对于长程运行的 Agent,"不中断"是不现实的——LLM API 限流、网络抖动、工具服务不可用都是常态。
新范式的核心不是避免中断,而是让中断变得无害:每次操作都有 checkpoint,每个副作用都有日志,每次恢复都有确定的起点。就像分布式系统中的 WAL(Write-Ahead Log),Agent 需要自己的"执行日志"来保证 at-least-once 语义。
将 Agent 基础设施按职责划分为七个层次,前四层构成数据平面(Data Plane),后三层构成控制平面(Control Plane)。
| 层 | 名称 | 核心关注 | 代表技术 / 项目 |
|---|---|---|---|
| E | Execution | LLM 调用、沙箱隔离、代码执行 | E2B, Modal, Fly.io, vLLM |
| T | Tooling | 工具注册、MCP Server、能力网关 | MCP, Composio, Toolhouse |
| C | Context | 三层记忆、向量检索、RAG 管线 | Mem0, Zep, Pinecone, Weaviate |
| L | Lifecycle | 任务编排、checkpoint、恢复策略 | LangGraph, Prefect, Temporal, Inngest |
| O | Observability | 追踪、日志、指标、cost tracking | LangSmith, Helicone, Arize, Braintrust |
| V | Verification | 评测框架、红队测试、安全扫描 | Inspect AI, Promptfoo, Garak |
| G | Governance | 权限管理、审计合规、策略引擎 | Portkey, Prompt Armor, Lasso |
Lifecycle 层承载了 Agent 最复杂的工程挑战——长程任务的状态管理、失败恢复、多步编排。47 个项目说明这个领域尚未收敛,各种方案(状态机、DAG、事件驱动)都在竞争。对于构建 Agent 平台的团队,L 层是投入产出比最高的关注点。
Agent 基础设施的规模化需要从四个维度同时推进,缺一不可:
iteration/s——每秒能完成多少轮有效的"执行-评估-改进"循环。Agent 系统的性能瓶颈不在模型能力,而在 Harness(驾驭)层。更好的约束比更好的模型更能提升 Agent 表现。
这意味着 Agent 工程的投资重心应该从"换更好的模型"转向"建更好的驾驭系统"。更好的约束、更精确的工具描述、更完善的验证机制——这些 harness 层的工作才是 Agent 性能的真正杠杆点。模型能力是天花板,但 harness 决定了你能离天花板有多近。