Agent Engineering 课程阅读

在 GitHub 查看原文

本页目录

L11 练习

练习 1:全开模式跑硬任务 3 轮(设计实验类)

本课是毕业整合,需要真实跑一遍验证:

  1. 开启所有机制(ENABLE_MEMORY=true ENABLE_SKILLS=true ENABLE_CODE_INTERPRETER=true ENABLE_LEDGER=true)。
  2. 跑同一主题 3 轮(如"MCP 生态演进")。
  3. 验证: - 第 2 轮 researcher 日志有"记忆命中"? - 第 2/3 轮产出增量简报(标注 🆕✏️➡️)? - 涉及数值的报告有代码附录?
  4. 用 L09 harness 出最终收益表。

验收:3 轮轨迹 + 收益表。诚实标注:如果某机制没触发(如无冲突),说明任务集没覆盖到该场景——需要调任务设计。

需 API key。无 key 时跑 mock 模式 + 标注"未实测"。


练习 2:逐个关掉机制,验证降级

逐个关闭机制,确认系统仍能跑且降级行为正确:

  1. 关记忆:researcher 不注入旧记忆(日志无"记忆命中")。
  2. 关 skills:writer 不遵循格式规范(默认格式)。
  3. 关代码:数值走 LLM 直出(无附录)。
  4. 关账本:每次从头研究(无增量简报)。
  5. 每次关一个,跑测试确认 104 全绿。

验收:每个机制的降级行为符合预期,测试全绿。这证明"降级路径完好"。


练习 3:写一份「Deep Agent 设计复盘」

总结整个 frontier-lessons 的设计经验:

  1. 五个机制里,哪个边际收益最大?哪个性价比最低(成本高收益低)?
  2. 如果只保留 3 个机制(砍掉 2 个),保留哪 3 个?为什么?
  3. 下一步会加什么机制?(候选:多 Agent 记忆共享、工具自动生成、轨迹自训练)

验收:一页设计复盘,体现你对"什么机制值、什么不值"的独立判断。面试时这是"我不只是实现了,还思考过取舍"的证据。