目录
从模型调用走向具备状态、工具、记忆与协作能力的智能体系统。
第一部分:Agent 基础
- 第一章
从 LLM 到 Agent:先把基本概念说清楚
LLM、Prompt、Context 和 Agent 经常被混在一起。本章从一次模型调用出发,建立 Agent Engineering 最基础的概念边界。
- 第二章
Skill、Tool 与 Environment:方法、能力和外部世界
Skill 告诉 Agent 怎样完成一类任务,Tool 让它能够采取动作,Environment 则提供动作发生和结果被观察的地方。
- 第三章
Workflow 与 Agent:谁来决定下一步
使用了 LLM 和 Tool 的系统不一定是 Agent。固定流程与动态决策的真正分界,在于下一步动作究竟由程序还是模型决定。
- 第四章
Agent Loop:一个 while 循环如何变成执行系统
Agent 的计算内核可以写成一个 while 循环,但只有加入观察、状态、动作结果和终止语义,它才能成为可工作的执行系统。
第二部分:Context、State 与 Memory
- 第五章
Context Assembly:Agent 这一轮看见什么
把目标、状态、Skill、观察和记忆组装成当前模型调用所需的有限工作集。
- 第六章
Run State:Agent 现在做到哪里
建立可以持久化、版本化和恢复的执行状态,而不是依赖不断膨胀的对话历史。
- 第七章
Plan、Todo 与 Task Graph
把计划视为可修改的执行假设,通过 Task 生命周期、依赖和调度持续推进目标。
- 第八章
Workspace 与 Sandbox:执行环境也是状态
管理 Agent 跨工具调用使用的文件、代码、浏览器和中间产物,并控制隔离与生命周期。
- 第九章
Memory Architecture:Session、User、Agent 与 Long-term Memory
从时间跨度、归属范围和内容类型拆解 Agent Memory,并建立读取、写入、遗忘与修正机制。
第三部分:Tool、Skill 与控制面
- 第十章
Tool Protocol:动作空间的稳定接口
通过明确的语义、参数、结果和错误契约,让 Agent 能够可靠地读取和改变外部环境。
- 第十一章
Skill:可执行知识的工程结构
把领域方法、操作步骤、资源和检查标准封装成可版本化、可选择和可评估的能力包。
- 第十二章
Router 与能力发现
根据任务动态选择 Skill、Tool、模型、Agent 或 Workflow 分支,同时管理置信度和回退。
- 第十三章
Identity、Permission、Guardrail 与 Human-in-the-Loop
认证用户、Agent 与 Runtime Workload 的多重身份,并把委托授权、审批和风险控制放进 Runtime 状态机。
- 第十四章
副作用、幂等、事务与补偿
控制重试、取消和故障恢复对真实外部系统产生的重复或不可逆影响。
第四部分:Agent Runtime 与执行协议
- 第十五章
Framework、Runtime 与 Protocol
区分开发框架、执行环境、外部协议与 Harness,建立不依赖具体产品的 Agent 系统分层。
- 第十六章
Agent Definition、Thread、Run、Attempt 与 Step
用一组稳定对象描述 Agent 版本、长期上下文、一次执行、重试尝试和内部步骤。
- 第十七章
Event、Artifact、Checkpoint 与 Trace
区分执行事件、正式产物、恢复快照和观测轨迹,明确每类对象的事实边界。
- 第十八章
Agent 任务生命周期
设计 Run 从提交、排队、运行到等待、取消、失败和完成的完整状态机。
- 第十九章
Interrupt、Resume、Cancel 与 Retry
让暂停、恢复、取消和重试成为可持久化、可审计的 Runtime 控制操作。
第五部分:Observability、Evaluation 与优化
- 第二十章
Trace、Span 与 Event:看见完整执行轨迹
以 Run 为核心关联模型、Tool、子 Agent、审批、成本和外部副作用的完整因果链。
- 第二十一章
结果、过程与轨迹评估
同时评估目标完成、产物质量、计划、工具选择、执行轨迹、安全和恢复行为。
- 第二十二章
Dataset、Bad Case、Replay 与 Regression
把线上轨迹转化为经过脱敏、去重和验证的回归数据,并支持从状态或轨迹重放。
- 第二十三章
Prompt、Skill、Model 与 Agent Version
把一次 Run 使用的模型、Prompt、Skill、Tool Schema、策略和 Runtime 版本完整固定下来。
- 第二十四章
质量、成本、安全与效率指标
用分层指标识别任务失败、Token 浪费、延迟热点、无进展循环和危险行为。
- 第二十五章
从线上轨迹到优化闭环
把观测、评估、数据集、实验和发布门禁连接成可审计的持续优化流程。
第六部分:Multi-Agent
- 第二十六章
什么时候应该拆成多个 Agent
用并行收益、上下文隔离、权限边界和独立判断,判断多 Agent 是否值得它带来的协调成本。
- 第二十七章
Orchestrator、Worker、Reviewer 与 Peer
比较集中编排、阶段流水线、独立审查和对等协作拓扑,并明确角色、控制权与最终责任。
- 第二十八章
Delegation Contract、Task Tree 与消息协议
让每次委派携带目标、最小上下文、约束、权限、验收标准和可追踪的父子 Run 关系。
- 第二十九章
Blackboard、共享状态与并发控制
用结构化共享状态连接多个 Agent,并通过版本、所有权、租约和证据引用控制并发写入。
- 第三十章
结果合并、冲突仲裁与最终责任
把多个候选结果经过校验、去重、冲突分类、仲裁和组合验证,提升为唯一正式产物。