Agent Engineering 课程阅读
首页/课程十一 · Agent 执行骨架/毕业整合:Long-Haul Research Agent v5

在 GitHub 查看原文

本页目录

Lesson 09 — 毕业整合:Long-Haul Research Agent v5

本课目标:八机制协同跑完长途任务——8k 窗口 30 源:改道生效、跨会话偏好在场、关键事实 20/20、主窗全程安全区、压缩失业。收益矩阵五档定稿(killer row:截断买到活着买不到记得),课程十一全仓注册,九开关默认全关纯净零税。


1. v5 全套端到端(一条命令)

cd harness-lessons/09_capstone_v5
python code.py      # 全套端到端 + 收益矩阵 + 可选真模型章(默认跳过)

八机制的协同分工(谁在哪一刻起作用):

时刻 机制 实测表现
组装 system L08 三层架构 核心+索引常驻,命中技能按需(省 58%)
每次调用前 L01 账本 27 次调用全部 safe 区(峰值 837/8,000)
工具结果进门 L04 整形 子窗内待命(超长文档截断带显式标记)
过程干活 L05 子代理 全文只进子窗,主窗只收结论
工作集存放 L06 工作区 原文落盘+进度事实源+后半程 recitation
装不下时 L02 压缩 0 次触发——外置让压缩失业(兜底待命)
人要说话 L07 改道 第 10 源后指令安全点生效,4 营销源跳过(连 fetch 都省)
会话之间 L03 记忆 会话 1 偏好(中文/500 字)在会话 2 合成窗口在场 ✅

两条剧本线的验收(测试锁死):跨会话线——前 15 源=会话 1(用户中途给偏好→写入记忆文件),会话 2 只带记忆文件+工作区 attach 续跑并合成,PREF 探针机械在场;改道线——「优先 safety、跳过 marketing」于安全点合并进 plan.md,源序可见改变、跳过三态标注。

2. 收益矩阵(五档 × 六指标,确定性可复现)

配置 完成源数 主窗峰值 在场率 计费token fetch 改道 跨会话 结局
A baseline·长程裸奔 10/30 越限即死 0/20 44,203 11 死于 S11
B 只硬截断 30/30 4,292 8/20 74,981 30 活着但失忆(killer row)
C +会计与压缩 30/30 5,272 20/20 106,844 30 完赛且记得
D +外置 30/30 718 20/20 39,708 30 主窗坍缩,压缩失业
E 全套 v5 26/30(+4跳) 837 20/20 39,294 26 跑得远且听得见人话

逐档读法:A→B 买到活着买不到记得(killer row,静默截断把半篇当全篇);B→C 登记契约把「丢什么」从按位置盲丢变成按价值保留(压缩不省钱,省空间);C→D 外置让主窗坍缩 5,272→718、压缩失业(能外置的别压缩的终局);D→E 加回人与时间的维度——改道、跨会话、三层 system,计费还是最低。矩阵双跑逐字节一致(tests/test_harness_capstone.py 锁死),报告存 eval_agent/HARNESS_REPORT.md

3. 纯净回归:九开关默认全关

enable_context_ledger / enable_compaction / enable_memory_files / enable_tool_shaping / enable_subagent_isolation / enable_workspace / enable_steering / enable_tool_gate / enable_layered_system 出厂全 False(机械锁 test_all_harness_flags_default_off);全关时主链路 prompt 逐字节与 v4 一致(各课关态回归)。矩阵五档均为 eval 侧显式装配的结果——长途能力零税

4. 可选真模型章(破例,主验收不依赖)

mock 层验收的是机械纪律(窗口算术/省略显式/登记存活/隔离零泄漏/偏好在场);两件事 mock 测不了:压缩摘要的语义保真迷航改善的体感。显式开启(HARNESS_REAL_MODEL=1 + ZHIPUAI_API_KEY,自担费用,复用 cost_budget 硬上限护栏)后按 code.py Part 3 的建议做 8 源缩小版真实抽查。两类结论分开陈述,绝不混报——这是全课程 mock 诚实边界的收口。

5. 全仓注册清单(本课完成)

  • 根 README(中英):课程总览 10 门/105 节11 门/115 节、课程路线表+mermaid+目录树加 harness-lessons、新增课程十一逐课章节、徽章 lessons 115 / tests 实测数(pytest 实跑,绝不手算——485 事故纪律);
  • research-assistant:README 加「🧠 长途研究(Harness v5)」章 + 五版本演进图 + 449 测试计数;docs/harness.md 架构文档;
  • .github/ISSUE_TEMPLATE/bug-report.yml 模块下拉加 Harness lessons(课程九漏过的坑不重演);
  • 仓库 CHANGELOG.md 课程十一条目;.gitignore 补运行产物(workspace/、memory_files/)。

6. 本课在两条主线上的位置(全课收口)

窗口经济:预算第四层(空间)交卷——记账、控源、外置、压缩、懒加载五件套,每件都有账本数字背书;30 源任务从「物理不可能」(需 23,383 token)变成「全程安全区」(峰值 837)。外置化:虚拟内存图满员——窗口只装「此刻在场」,其余住文件/子窗/索引,按需换入;模型每半年换一代,这套纪律是可迁移资产。

🎯 面试话术

「我的研究 agent 五个版本收口:能跑、有脑子、关进笼子、一直在岗、跑得远。v5 的验收数字:8k 窗口跑完 30 源,主窗峰值 837、每次调用都在安全区;20 条关键事实 100% 在场,跨源矛盾可发现;第 10 源改道生效、跳过的源连 fetch 都省了;会话 1 的用户偏好只靠记忆文件活到会话 2 的合成。收益矩阵五档对着裸基线量:裸奔死于第 11 源,硬截断活着但失忆——截断买到活着买不到记得;全套档计费还是最低。九个开关默认全关、纯净跑零税;mock 验收机械纪律,认知收益留给真模型章,两类结论从不混报。」