Agent Engineering 课程阅读

在 GitHub 查看原文

本页目录

L09 练习

毕业课的练习偏综合:动真实系统、答架构题。


练习 1:真跑一次(动手类,需 API key)

八开关在 .env 里全开(ENABLE_SCHEDULES=true 等八项 + ZHIPUAI_API_KEY),用真实入口跑 3 个 tick:

cd portfolio-projects/research-assistant
PYTHONPATH=src python -m research_assistant.daemon --topic "你关心的真主题" --interval-hours 0.01 --max-ticks 3

观察:真实 LLM 判级 vs 课程 mock 的规则判级差在哪?(建仓简报被判成什么级?)inbox.db 里落了什么?

验收:贴出三个 tick 的日志与收件箱条目;标注哪一步与 mock 演示不同、为什么(真实判级有内容理解力,规则只有关键词)。


练习 2:设计实验——v4 的「关一个机制」消融(设计实验类)

L08 的矩阵是递进式(逐层加);消融是反向问法:全开减一个,哪项指标崩?

  1. 从 full 档出发,逐个关掉 watcher / judge / heartbeat,各跑一遍 run_ambient_eval 的场景函数。
  2. 填一张消融表:关 watcher → 哪几项退化?关 judge → 哪项?关 heartbeat → 哪项?
  3. 思考:递进矩阵和消融矩阵各适合回答什么问题?(递进:机制的边际收益(值不值得加);消融:机制的不可替代性(能不能去掉)。两者结论可能不同——某机制边际收益小但去掉后另一机制会崩,说明有依赖耦合。)

验收:消融表 + 一个「递进看不出来、消融才暴露」的依赖(提示:关 watcher 后 incremental_run 实际失效——daemon 传 change_set=None 走全量——judge 面对的简报形态完全变了)。


练习 3:给 kb-qa 装常驻能力值不值(迁移判断类)

课程九曾用「kb-qa 是线性链用不上轨迹治理」做边界证据。现在的问题:kb-qa 用得上常驻机制吗?

逐个机制过一遍:调度触发(盯什么?知识库文档目录的变化!)、变化检测(make_dir_fetch 就是现成的)、增量研究(对 kb-qa 是「增量重建索引」)、打扰判级(「知识库更新了 3 篇文档」值得通知谁?)、心跳(索引服务死了没人知道吗?)。

验收:一张「机制 × kb-qa 适用性」表。预期结论:常驻层的前半段(调度/变化检测/增量)对 kb-qa 完全适用(文档目录盯梢 → 增量入库),后半段(判级/打扰)价值弱(更新知识库不需要打扰人)。这说明本课程的边界与课程九不同——agent-ops 押在「轨迹 vs 链」上,ambient 押在「有没有持续变化的外部世界要盯」上。能讲清这两条边界的差别,就是真懂了。


练习 4:思考题——下一个版本是什么(开放类)

v4 之后,这个系统还缺什么才算「完整的常驻研究同事」?

候选方向(各写一句「要解决的核心问题」+「最难的一步」): - 多主题共存:N 个调度共享一个 daemon——时段预算怎么在主题间分配? - 用户反馈回路:对每条通知点「有用/没用」——判级怎么在线学习(L04 流派④)? - 多信源交叉:同一主题盯 3 个信源——矛盾的信源谁可信? - 报告演进:增量简报之外,维护一份「活文档」(始终最新的全景报告)——和账本什么关系?

验收:挑一个方向写 300 字的 mini 任务书(现状缺口/落地改动/验收标准三段)——这也是对你「能不能自己立项」的毕业检验。