本页目录
Lesson 11 — 毕业整合:Deep Research Agent v2
本课目标:全机制协同打开,硬任务完整跑通,写架构文档。把 L01–L10 的五机制(记忆/反思/code/skills/账本)收敛成一个统一的深度智能体视图。
学完你能回答:「你的研究助手现在是个什么水准?」——有记忆、能反思、会写代码、跨会话进化,且每个机制的收益都有轨迹评估数字支撑。
0. 为什么要有毕业整合课
前 10 课每个都在 research-assistant 上加了一块能力(记忆、反思、code、skills、账本、评估)。但它们是逐课加的。毕业整合把它们收敛成一个统一的视图:
- 五机制现在全了吗?(清单)
- 每个机制指向哪段代码?(证据链)
- 一次运行中数据怎么流?(架构图)
- 关掉任一机制还能跑吗?(降级路径)
🎯 核心价值:这课不写多少新代码,是把散落的能力编织成一个可讲述的深度智能体故事。面试时你不是说"我加了个记忆",而是说"我的 Agent 在五个维度都有前沿能力,这是架构图和收益表"。
1. 五机制协同图
详见架构文档 docs/deep-agent-v2.md。
记忆(L01-02) → researcher 研究前 recall 旧经验
Skills(L03) → writer 写报告前 load 格式规范
反思(L04-05) → reviewer 双通道检测冲突→补研→修正
代码(L06-07) → writer 数值结论走沙箱→可复算
账本(L10) → 断点续跑 + 增量简报
评估(L08-09) → 轨迹落盘 + 机制收益量化
每个机制解决一个维度的问题,合起来让 Agent 从"一次性"变成"持续进化"。
2. 硬任务完整跑通
裸基线 vs v2 对比
裸基线(L00) v2(全机制开启)
───────────── ──────────────
第2次完全失忆 第2次记得第1次查过什么(记忆)
结论错了不改 发现冲突→定向补研→修正说明(反思)
数值靠 LLM 口算 数值走沙箱代码→可复算附录(code)
每次从头写报告 产出增量简报→标注新增/修正(账本)
不知道做得好不好 轨迹评估→机制收益量化(评估)
硬任务的四个要求 vs v2 的实现
| 硬任务要求 | 实现机制 | 验证 |
|---|---|---|
| 记得第1次查过什么 | L01 记忆 recall + L02 反思式写入 | researcher 日志有"记忆命中" |
| 冲突时修正并说明 | L05 双通道 reviewer + 冲突检测 | 报告有"修正说明" |
| 需要对比数据时写代码算 | L07 代码解释器 | 报告附录有可复算脚本 |
| 产出增量简报非从零重写 | L10 TaskLedger | 简报标注 🆕✏️➡️ |
3. 降级路径验证
关键约束:关掉任一机制系统仍能跑,全部 104 个测试始终绿。
# 全关模式(等同原始 research-assistant)
ENABLE_MEMORY=false ENABLE_SKILLS=false ENABLE_CODE_INTERPRETER=false ENABLE_LEDGER=false
.venv/Scripts/python.exe -m pytest tests/ -q # 104 passed
# 部分开启(只开记忆)
ENABLE_MEMORY=true
.venv/Scripts/python.exe -m pytest tests/ -q # 104 passed(测试不受开关影响)
# 全开(Deep v2)
ENABLE_MEMORY=true ENABLE_SKILLS=true ENABLE_CODE_INTERPREpreter=true ENABLE_LEDGER=true
.venv/Scripts/python.exe -m pytest tests/ -q # 104 passed
每个机制默认关闭,测试在默认配置下跑。开启机制不破坏现有测试——这是工程化的底线。
4. 机制收益表(最终版)
用 L09 的 harness 跑出对照 L00 基线的收益表:
| 指标 | 全关(基线) | 全开(v2) | 收益 |
|---|---|---|---|
| 记忆召回率 | 0% | 100% | 从失忆到记得 |
| 代码执行率 | 0% | ~50% | 数值可复算 |
| 冲突修正 | 无 | 有 | 错误可纠正 |
| 增量产出 | 无 | 有 | 不从头重写 |
| 步数(第2次) | 9(重复) | 更少(不重复查) | 记忆省步 |
⚠️ 具体数字来自 mock 演示(非真实 API)。完整收益表见
eval_agent/REPORT.md。
5. 架构文档产出
详见 docs/deep-agent-v2.md,包含:
- 五机制全景图
- 一次运行的数据流(从用户输入到增量简报产出)
- 开关与降级路径表
- 技术栈
6. 落地清单
产出物
| 文件 | 说明 |
|---|---|
docs/deep-agent-v2.md |
架构文档(五机制协同图 + 数据流 + 降级路径) |
eval_agent/REPORT.md |
机制收益表(L09 产出) |
| research-assistant README | 加"深度智能体(Frontier)"章节 |
验证
cd portfolio-projects/research-assistant
# 1. 全量测试(104 个全绿,所有开关组合下)
.venv/Scripts/python.exe -m pytest tests/ -q
# 预期:104 passed
# 2. 全开跑硬任务(需所有 ENABLE=true + API key)
# 3 轮跑同一主题,第 2/3 轮应:
# - researcher 日志有"记忆命中"
# - 报告有"修正说明"(如有冲突)
# - 报告附录有代码脚本(如涉及数值)
# - 产出增量简报(标注新增/修正/不变)
# 3. 降级验证:逐个关掉机制,确认系统仍能跑
7. 本课在两条主线上的位置
- 评估主线:本课是评估主线的最终验证——所有机制的收益在收益表里汇总,对照 L00 裸基线。从 L00 立基线到 L11 汇总,评估主线完整闭环。
- 上下文工程主线:本课把上下文工程的四个子问题(记忆/知识/能力/工具的按需调回)+ 规划层(账本)+ 质量层(评估)收敛成统一架构。每个机制都是上下文工程的一个面,合起来是完整的"上下文管理"。
🎯 面试话术(终极版)
「我的研究助手是有记忆、能反思、会写代码、跨会话推进长任务的深度智能体。五个机制:记忆(情景+语义分层,researcher 研究前 recall 旧经验);反思(双通道 reviewer,文字不合格重写、事实冲突定向补研修正);代码解释器(数值走沙箱算,报告附可复算脚本);skills(渐进式加载格式规范);任务账本(断点续跑+增量简报)。每个机制的收益都有轨迹评估数字支撑——我建了 TrajectoryEvaluator 和 eval harness,对照 L00 裸基线,从失忆到记得、从口算到可复算。而且每个机制默认关闭、降级路径完好,104 个测试全绿。从裸基线到 v2 的每一步都是可复现的对照实验。」