Agent Engineering 课程阅读
首页/课程七 · 智能体前沿/毕业整合:Deep Research Agent v2

在 GitHub 查看原文

本页目录

Lesson 11 — 毕业整合:Deep Research Agent v2

本课目标:全机制协同打开,硬任务完整跑通,写架构文档。把 L01–L10 的五机制(记忆/反思/code/skills/账本)收敛成一个统一的深度智能体视图。

学完你能回答:「你的研究助手现在是个什么水准?」——有记忆、能反思、会写代码、跨会话进化,且每个机制的收益都有轨迹评估数字支撑。


0. 为什么要有毕业整合课

前 10 课每个都在 research-assistant 上加了一块能力(记忆、反思、code、skills、账本、评估)。但它们是逐课加的。毕业整合把它们收敛成一个统一的视图

  • 五机制现在全了吗?(清单)
  • 每个机制指向哪段代码?(证据链)
  • 一次运行中数据怎么流?(架构图)
  • 关掉任一机制还能跑吗?(降级路径)

🎯 核心价值:这课不写多少新代码,是把散落的能力编织成一个可讲述的深度智能体故事。面试时你不是说"我加了个记忆",而是说"我的 Agent 在五个维度都有前沿能力,这是架构图和收益表"。


1. 五机制协同图

详见架构文档 docs/deep-agent-v2.md

记忆(L01-02)  →  researcher 研究前 recall 旧经验
Skills(L03)   →  writer 写报告前 load 格式规范
反思(L04-05)  →  reviewer 双通道检测冲突→补研→修正
代码(L06-07)  →  writer 数值结论走沙箱→可复算
账本(L10)     →  断点续跑 + 增量简报
评估(L08-09)  →  轨迹落盘 + 机制收益量化

每个机制解决一个维度的问题,合起来让 Agent 从"一次性"变成"持续进化"。


2. 硬任务完整跑通

裸基线 vs v2 对比

裸基线(L00)                     v2(全机制开启)
─────────────                     ──────────────
第2次完全失忆                      第2次记得第1次查过什么(记忆)
结论错了不改                       发现冲突→定向补研→修正说明(反思)
数值靠 LLM 口算                    数值走沙箱代码→可复算附录(code)
每次从头写报告                     产出增量简报→标注新增/修正(账本)
不知道做得好不好                   轨迹评估→机制收益量化(评估)

硬任务的四个要求 vs v2 的实现

硬任务要求 实现机制 验证
记得第1次查过什么 L01 记忆 recall + L02 反思式写入 researcher 日志有"记忆命中"
冲突时修正并说明 L05 双通道 reviewer + 冲突检测 报告有"修正说明"
需要对比数据时写代码算 L07 代码解释器 报告附录有可复算脚本
产出增量简报非从零重写 L10 TaskLedger 简报标注 🆕✏️➡️

3. 降级路径验证

关键约束:关掉任一机制系统仍能跑,全部 104 个测试始终绿。

# 全关模式(等同原始 research-assistant)
ENABLE_MEMORY=false ENABLE_SKILLS=false ENABLE_CODE_INTERPRETER=false ENABLE_LEDGER=false
.venv/Scripts/python.exe -m pytest tests/ -q  # 104 passed

# 部分开启(只开记忆)
ENABLE_MEMORY=true
.venv/Scripts/python.exe -m pytest tests/ -q  # 104 passed(测试不受开关影响)

# 全开(Deep v2)
ENABLE_MEMORY=true ENABLE_SKILLS=true ENABLE_CODE_INTERPREpreter=true ENABLE_LEDGER=true
.venv/Scripts/python.exe -m pytest tests/ -q  # 104 passed

每个机制默认关闭,测试在默认配置下跑。开启机制不破坏现有测试——这是工程化的底线。


4. 机制收益表(最终版)

用 L09 的 harness 跑出对照 L00 基线的收益表:

指标 全关(基线) 全开(v2) 收益
记忆召回率 0% 100% 从失忆到记得
代码执行率 0% ~50% 数值可复算
冲突修正 错误可纠正
增量产出 不从头重写
步数(第2次) 9(重复) 更少(不重复查) 记忆省步

⚠️ 具体数字来自 mock 演示(非真实 API)。完整收益表见 eval_agent/REPORT.md


5. 架构文档产出

详见 docs/deep-agent-v2.md,包含: - 五机制全景图 - 一次运行的数据流(从用户输入到增量简报产出) - 开关与降级路径表 - 技术栈


6. 落地清单

产出物

文件 说明
docs/deep-agent-v2.md 架构文档(五机制协同图 + 数据流 + 降级路径)
eval_agent/REPORT.md 机制收益表(L09 产出)
research-assistant README 加"深度智能体(Frontier)"章节

验证

cd portfolio-projects/research-assistant

# 1. 全量测试(104 个全绿,所有开关组合下)
.venv/Scripts/python.exe -m pytest tests/ -q
# 预期:104 passed

# 2. 全开跑硬任务(需所有 ENABLE=true + API key)
# 3 轮跑同一主题,第 2/3 轮应:
#   - researcher 日志有"记忆命中"
#   - 报告有"修正说明"(如有冲突)
#   - 报告附录有代码脚本(如涉及数值)
#   - 产出增量简报(标注新增/修正/不变)

# 3. 降级验证:逐个关掉机制,确认系统仍能跑

7. 本课在两条主线上的位置

  • 评估主线:本课是评估主线的最终验证——所有机制的收益在收益表里汇总,对照 L00 裸基线。从 L00 立基线到 L11 汇总,评估主线完整闭环。
  • 上下文工程主线:本课把上下文工程的四个子问题(记忆/知识/能力/工具的按需调回)+ 规划层(账本)+ 质量层(评估)收敛成统一架构。每个机制都是上下文工程的一个面,合起来是完整的"上下文管理"。

🎯 面试话术(终极版)

「我的研究助手是有记忆、能反思、会写代码、跨会话推进长任务的深度智能体。五个机制:记忆(情景+语义分层,researcher 研究前 recall 旧经验);反思(双通道 reviewer,文字不合格重写、事实冲突定向补研修正);代码解释器(数值走沙箱算,报告附可复算脚本);skills(渐进式加载格式规范);任务账本(断点续跑+增量简报)。每个机制的收益都有轨迹评估数字支撑——我建了 TrajectoryEvaluator 和 eval harness,对照 L00 裸基线,从失忆到记得、从口算到可复算。而且每个机制默认关闭、降级路径完好,104 个测试全绿。从裸基线到 v2 的每一步都是可复现的对照实验。」