深入理解AI Agent设计原理和工程实践
19 notes on this book.
AI Agent 第一章 —— Agent 到底是什么?
拆解 AI Agent 的核心公式 LLM + 上下文 + 工具,用大脑、眼睛、手脚的直觉框架重新理解 Cursor、Manus、豆包等主流 Agent 产品,并深入 ReAct 循环和工具调用机制。
2026-07-24Agent 的眼睛 —— 上下文不只是塞文本
上下文是 Agent 在每个决策点能看到的全部信息。拆解上下文的五个组件(系统提示词、工具定义、用户消息、模型回复、工具结果),用消融实验验证每个组件为什么缺一不可,并总结"视野决定决策"的核心原则。
2026-07-24Harness 工程 —— Agent 从 Demo 到产品的最后一公里
Harness 工程是 Agent 系统的真正核心竞争力。从 Harness 五要素(上下文、工具、约束、验证、纠正)出发,梳理从提示工程到 Loop 工程的范式演进、编排模式选择、模型选型策略和护栏安全体系。
2026-07-24AI Agent 的大脑 —— LLM 不只是回答问题
LLM 在 Agent 中扮演的角色远不止文本生成:它是理解意图、拆解任务、内部推演、自主决策的完整决策引擎。深入剖析零样本泛化、少样本适应、模型即 Agent 新范式,以及三种互补的学习机制。
2026-07-24ReAct 循环 —— Agent 的想→做→看心跳
ReAct 是串联 LLM、上下文和工具的核心运行机制。从一个多币种收入汇总的真实案例拆解 Agent 轨迹的完整结构,理解上下文累积性和结构化分离的精妙设计,再看 GPT-5.6 如何将这一模式升级为模型原生能力。
2026-07-24上下文压缩 —— 不是删信息,是提炼知识
上下文压缩不只是为了不超出窗口限制——更深层的价值在于把"需要思考才能用"的原始数据变成"可直接检索"的结构化知识。从六种压缩策略的量化对比,到生产级五层压缩机制,再到"隔离优于压缩"的子 Agent 设计哲学。
2026-07-24上下文工程(上)—— 决定 Agent 能力上限的东西
模型智力只是 Agent 的能力下限,上下文质量才是真正的上限。从一个"永远的新员工"类比出发,拆解 Chat API 的消息结构、工具调用多轮交互的完整链路,以及用 20 行 Python 实现 Agent 核心循环。
2026-07-24提示工程 —— 写好 Agent 的员工手册
系统提示词是 Agent 的员工手册。从语气风格、XML/Markdown 结构化到流程驱动设计,从业务规则细化到 Few-shot 示例策略,再到提示注入的攻防全景——系统地看如何让模型把通用能力转化为具体任务执行力。
2026-07-24Skills 与工具的关系 —— 少即是多的架构选择
Skills 和工具是两种不同的能力承载形态。理解两者的分工——工具是执行原语(数量少、定义稳定),Skill 是领域知识包(按需加载、不破坏缓存)——是构建可扩展 Agent 系统的关键架构决策。
2026-07-24Agent Skills —— 从一本厚手册到按需取阅的图书馆
当系统提示词膨胀到无法管理时,Skills 提供了渐进式披露的解决方案:三层结构(元数据/核心流程/子文档)+ 三种注入方式的工程权衡 + emit-once 的 KV Cache 优化策略。这是 Agent 能力从集中式管理走向社区化生态的关键一步。
2026-07-24Agent 状态栏 —— 给模型装一个仪表盘
Agent 状态栏在上下文末尾注入结构化的运行状态摘要。它不只是省 token——它从根本上改变了模型消费上下文的方式:把"每次决策都要扫描全文重新统计"变成"瞥一眼就够",让思考量变得与上下文长度无关。
2026-07-24记忆框架 —— 从认知科学到工程落地
认知科学把记忆分为情景、语义、程序三种类型,每一种在 Agent 中都有直接对应。从 Mem0 的两阶段流水线到 Memobase 的用户画像设计,再到记忆压缩的多层策略和基于本地模型的日志脱敏——将理论变为工程。
2026-07-24用户记忆系统 —— 让 Agent 在对话结束后还记得你
上下文学习是临时的,会话结束就消失。用户记忆是持久的、可审查的。从三层次评估框架到四种存储格式(Simple Notes / Enhanced Notes / JSON Cards / Advanced JSON Cards),以及记忆的层次结构——让 Agent 从"有用工具"进化为"懂你的助手"。
2026-07-24事件驱动异步 Agent —— 从排队柜台到灵活秘书
LLM 的训练范式假设同步(发出工具调用后下一条必须是工具结果),而真实部署要求异步(用户随时打断、多任务并发、外部事件随时到达)。事件驱动架构如何填平这条鸿沟——从事件循环骨架到紧急度分级的三种处理策略,再到让同步模型支持异步打断的五条工程规则。
2026-07-24MCP 协议 —— Agent 工具生态的通用插座标准
MCP 让工具开发者只需实现一次就能对接所有 Agent 框架。从客户端-服务器架构到工具/资源/提示三类原语,从 5 个服务器 = 55K token 的上下文开销问题到层次化组织与动态发现,再到信任模型的四类安全风险——理解 MCP 的价值和边界。
2026-07-24感知、执行与协作 —— Agent 的三类主动工具
感知工具如何避免静默截断和格式陷阱,执行工具的四层安全体系(输入验证→权限控制→提议者-审核者→Sidecar),协作工具的子 Agent 设计和人工介入策略——这是 Agent 手脚和感官的设计方法论。
2026-07-24工具设计原则 —— 决定 Agent 能走多远的不是模型,是工具的接口质量
从能力表达形态的选择(专用工具 vs Skill+通用执行器),到工具粒度的整合与分离,再到工具描述的艺术和参数保真的隐蔽陷阱——六条通用设计原则,加上 MCP 协议的统一生态,构成了 Agent 工具设计的完整方法论。
2026-07-24主动工具发现 —— 当上千个工具不能用全塞进去解决时
一次性注入全部工具 schema → 上下文被"说明书"塞满。从检索预筛选到层次化匹配再到 Skills 渐进式披露,三代的工具发现演进。核心洞察:把"工具选择"转化为"知识检索"才是正解,Skills 用"按需查阅"替代了"预注册 + 语义匹配"的繁重基础设施。
2026-07-24工具设计 —— Agent 的手脚和感官
Agent 的智能之所以能动人,是因为它有工具——连接语言大脑与真实世界的感官和手脚。从五类工具的完整分类(感知/执行/协作/事件触发/用户沟通),到两大核心挑战(数千工具如何选择、异步事件如何处理),建立工具设计的全局坐标系。
2026-07-24