← 返回书架
ONLINE PLAYBOOK

AGENT ENGINEERING PLAYBOOK

从模型调用走向具备状态、工具、记忆与协作能力的智能体系统。

雪猴 Agent 工程师的黑红色视觉封面

目录

从模型调用走向具备状态、工具、记忆与协作能力的智能体系统。

第一部分:Agent 基础

  1. 第一章

    从 LLM 到 Agent:先把基本概念说清楚

    LLM、Prompt、Context 和 Agent 经常被混在一起。本章从一次模型调用出发,建立 Agent Engineering 最基础的概念边界。

  2. 第二章

    Skill、Tool 与 Environment:方法、能力和外部世界

    Skill 告诉 Agent 怎样完成一类任务,Tool 让它能够采取动作,Environment 则提供动作发生和结果被观察的地方。

  3. 第三章

    Workflow 与 Agent:谁来决定下一步

    使用了 LLM 和 Tool 的系统不一定是 Agent。固定流程与动态决策的真正分界,在于下一步动作究竟由程序还是模型决定。

  4. 第四章

    Agent Loop:一个 while 循环如何变成执行系统

    Agent 的计算内核可以写成一个 while 循环,但只有加入观察、状态、动作结果和终止语义,它才能成为可工作的执行系统。

第二部分:Context、State 与 Memory

  1. 第五章

    Context Assembly:Agent 这一轮看见什么

    把目标、状态、Skill、观察和记忆组装成当前模型调用所需的有限工作集。

  2. 第六章

    Run State:Agent 现在做到哪里

    建立可以持久化、版本化和恢复的执行状态,而不是依赖不断膨胀的对话历史。

  3. 第七章

    Plan、Todo 与 Task Graph

    把计划视为可修改的执行假设,通过 Task 生命周期、依赖和调度持续推进目标。

  4. 第八章

    Workspace 与 Sandbox:执行环境也是状态

    管理 Agent 跨工具调用使用的文件、代码、浏览器和中间产物,并控制隔离与生命周期。

  5. 第九章

    Memory Architecture:Session、User、Agent 与 Long-term Memory

    从时间跨度、归属范围和内容类型拆解 Agent Memory,并建立读取、写入、遗忘与修正机制。

第三部分:Tool、Skill 与控制面

  1. 第十章

    Tool Protocol:动作空间的稳定接口

    通过明确的语义、参数、结果和错误契约,让 Agent 能够可靠地读取和改变外部环境。

  2. 第十一章

    Skill:可执行知识的工程结构

    把领域方法、操作步骤、资源和检查标准封装成可版本化、可选择和可评估的能力包。

  3. 第十二章

    Router 与能力发现

    根据任务动态选择 Skill、Tool、模型、Agent 或 Workflow 分支,同时管理置信度和回退。

  4. 第十三章

    Identity、Permission、Guardrail 与 Human-in-the-Loop

    认证用户、Agent 与 Runtime Workload 的多重身份,并把委托授权、审批和风险控制放进 Runtime 状态机。

  5. 第十四章

    副作用、幂等、事务与补偿

    控制重试、取消和故障恢复对真实外部系统产生的重复或不可逆影响。

第四部分:Agent Runtime 与执行协议

  1. 第十五章

    Framework、Runtime 与 Protocol

    区分开发框架、执行环境、外部协议与 Harness,建立不依赖具体产品的 Agent 系统分层。

  2. 第十六章

    Agent Definition、Thread、Run、Attempt 与 Step

    用一组稳定对象描述 Agent 版本、长期上下文、一次执行、重试尝试和内部步骤。

  3. 第十七章

    Event、Artifact、Checkpoint 与 Trace

    区分执行事件、正式产物、恢复快照和观测轨迹,明确每类对象的事实边界。

  4. 第十八章

    Agent 任务生命周期

    设计 Run 从提交、排队、运行到等待、取消、失败和完成的完整状态机。

  5. 第十九章

    Interrupt、Resume、Cancel 与 Retry

    让暂停、恢复、取消和重试成为可持久化、可审计的 Runtime 控制操作。

第五部分:Observability、Evaluation 与优化

  1. 第二十章

    Trace、Span 与 Event:看见完整执行轨迹

    以 Run 为核心关联模型、Tool、子 Agent、审批、成本和外部副作用的完整因果链。

  2. 第二十一章

    结果、过程与轨迹评估

    同时评估目标完成、产物质量、计划、工具选择、执行轨迹、安全和恢复行为。

  3. 第二十二章

    Dataset、Bad Case、Replay 与 Regression

    把线上轨迹转化为经过脱敏、去重和验证的回归数据,并支持从状态或轨迹重放。

  4. 第二十三章

    Prompt、Skill、Model 与 Agent Version

    把一次 Run 使用的模型、Prompt、Skill、Tool Schema、策略和 Runtime 版本完整固定下来。

  5. 第二十四章

    质量、成本、安全与效率指标

    用分层指标识别任务失败、Token 浪费、延迟热点、无进展循环和危险行为。

  6. 第二十五章

    从线上轨迹到优化闭环

    把观测、评估、数据集、实验和发布门禁连接成可审计的持续优化流程。

第六部分:Multi-Agent

  1. 第二十六章

    什么时候应该拆成多个 Agent

    用并行收益、上下文隔离、权限边界和独立判断,判断多 Agent 是否值得它带来的协调成本。

  2. 第二十七章

    Orchestrator、Worker、Reviewer 与 Peer

    比较集中编排、阶段流水线、独立审查和对等协作拓扑,并明确角色、控制权与最终责任。

  3. 第二十八章

    Delegation Contract、Task Tree 与消息协议

    让每次委派携带目标、最小上下文、约束、权限、验收标准和可追踪的父子 Run 关系。

  4. 第二十九章

    Blackboard、共享状态与并发控制

    用结构化共享状态连接多个 Agent,并通过版本、所有权、租约和证据引用控制并发写入。

  5. 第三十章

    结果合并、冲突仲裁与最终责任

    把多个候选结果经过校验、去重、冲突分类、仲裁和组合验证,提升为唯一正式产物。