本页目录
Lesson 09 — 毕业整合:Long-Haul Research Agent v5
本课目标:八机制协同跑完长途任务——8k 窗口 30 源:改道生效、跨会话偏好在场、关键事实 20/20、主窗全程安全区、压缩失业。收益矩阵五档定稿(killer row:截断买到活着买不到记得),课程十一全仓注册,九开关默认全关纯净零税。
1. v5 全套端到端(一条命令)
cd harness-lessons/09_capstone_v5
python code.py # 全套端到端 + 收益矩阵 + 可选真模型章(默认跳过)
八机制的协同分工(谁在哪一刻起作用):
| 时刻 | 机制 | 实测表现 |
|---|---|---|
| 组装 system | L08 三层架构 | 核心+索引常驻,命中技能按需(省 58%) |
| 每次调用前 | L01 账本 | 27 次调用全部 safe 区(峰值 837/8,000) |
| 工具结果进门 | L04 整形 | 子窗内待命(超长文档截断带显式标记) |
| 过程干活 | L05 子代理 | 全文只进子窗,主窗只收结论 |
| 工作集存放 | L06 工作区 | 原文落盘+进度事实源+后半程 recitation |
| 装不下时 | L02 压缩 | 0 次触发——外置让压缩失业(兜底待命) |
| 人要说话 | L07 改道 | 第 10 源后指令安全点生效,4 营销源跳过(连 fetch 都省) |
| 会话之间 | L03 记忆 | 会话 1 偏好(中文/500 字)在会话 2 合成窗口在场 ✅ |
两条剧本线的验收(测试锁死):跨会话线——前 15 源=会话 1(用户中途给偏好→写入记忆文件),会话 2 只带记忆文件+工作区 attach 续跑并合成,PREF 探针机械在场;改道线——「优先 safety、跳过 marketing」于安全点合并进 plan.md,源序可见改变、跳过三态标注。
2. 收益矩阵(五档 × 六指标,确定性可复现)
| 配置 | 完成源数 | 主窗峰值 | 在场率 | 计费token | fetch | 改道 | 跨会话 | 结局 |
|---|---|---|---|---|---|---|---|---|
| A baseline·长程裸奔 | 10/30 | 越限即死 | 0/20 | 44,203 | 11 | — | — | 死于 S11 |
| B 只硬截断 | 30/30 | 4,292 | 8/20 | 74,981 | 30 | — | — | 活着但失忆(killer row) |
| C +会计与压缩 | 30/30 | 5,272 | 20/20 | 106,844 | 30 | — | — | 完赛且记得 |
| D +外置 | 30/30 | 718 | 20/20 | 39,708 | 30 | — | — | 主窗坍缩,压缩失业 |
| E 全套 v5 | 26/30(+4跳) | 837 | 20/20 | 39,294 | 26 | ✅ | ✅ | 跑得远且听得见人话 |
逐档读法:A→B 买到活着买不到记得(killer row,静默截断把半篇当全篇);B→C 登记契约把「丢什么」从按位置盲丢变成按价值保留(压缩不省钱,省空间);C→D 外置让主窗坍缩 5,272→718、压缩失业(能外置的别压缩的终局);D→E 加回人与时间的维度——改道、跨会话、三层 system,计费还是最低。矩阵双跑逐字节一致(tests/test_harness_capstone.py 锁死),报告存 eval_agent/HARNESS_REPORT.md。
3. 纯净回归:九开关默认全关
enable_context_ledger / enable_compaction / enable_memory_files / enable_tool_shaping / enable_subagent_isolation / enable_workspace / enable_steering / enable_tool_gate / enable_layered_system 出厂全 False(机械锁 test_all_harness_flags_default_off);全关时主链路 prompt 逐字节与 v4 一致(各课关态回归)。矩阵五档均为 eval 侧显式装配的结果——长途能力零税。
4. 可选真模型章(破例,主验收不依赖)
mock 层验收的是机械纪律(窗口算术/省略显式/登记存活/隔离零泄漏/偏好在场);两件事 mock 测不了:压缩摘要的语义保真与迷航改善的体感。显式开启(HARNESS_REAL_MODEL=1 + ZHIPUAI_API_KEY,自担费用,复用 cost_budget 硬上限护栏)后按 code.py Part 3 的建议做 8 源缩小版真实抽查。两类结论分开陈述,绝不混报——这是全课程 mock 诚实边界的收口。
5. 全仓注册清单(本课完成)
- 根 README(中英):课程总览
10 门/105 节→11 门/115 节、课程路线表+mermaid+目录树加 harness-lessons、新增课程十一逐课章节、徽章 lessons 115 / tests 实测数(pytest 实跑,绝不手算——485 事故纪律); - research-assistant:README 加「🧠 长途研究(Harness v5)」章 + 五版本演进图 + 449 测试计数;
docs/harness.md架构文档; .github/ISSUE_TEMPLATE/bug-report.yml模块下拉加 Harness lessons(课程九漏过的坑不重演);- 仓库
CHANGELOG.md课程十一条目;.gitignore补运行产物(workspace/、memory_files/)。
6. 本课在两条主线上的位置(全课收口)
窗口经济:预算第四层(空间)交卷——记账、控源、外置、压缩、懒加载五件套,每件都有账本数字背书;30 源任务从「物理不可能」(需 23,383 token)变成「全程安全区」(峰值 837)。外置化:虚拟内存图满员——窗口只装「此刻在场」,其余住文件/子窗/索引,按需换入;模型每半年换一代,这套纪律是可迁移资产。
🎯 面试话术
「我的研究 agent 五个版本收口:能跑、有脑子、关进笼子、一直在岗、跑得远。v5 的验收数字:8k 窗口跑完 30 源,主窗峰值 837、每次调用都在安全区;20 条关键事实 100% 在场,跨源矛盾可发现;第 10 源改道生效、跳过的源连 fetch 都省了;会话 1 的用户偏好只靠记忆文件活到会话 2 的合成。收益矩阵五档对着裸基线量:裸奔死于第 11 源,硬截断活着但失忆——截断买到活着买不到记得;全套档计费还是最低。九个开关默认全关、纯净跑零税;mock 验收机械纪律,认知收益留给真模型章,两类结论从不混报。」