L11 练习
练习 1:全开模式跑硬任务 3 轮(设计实验类)
本课是毕业整合,需要真实跑一遍验证:
- 开启所有机制(
ENABLE_MEMORY=true ENABLE_SKILLS=true ENABLE_CODE_INTERPRETER=true ENABLE_LEDGER=true)。 - 跑同一主题 3 轮(如"MCP 生态演进")。
- 验证: - 第 2 轮 researcher 日志有"记忆命中"? - 第 2/3 轮产出增量简报(标注 🆕✏️➡️)? - 涉及数值的报告有代码附录?
- 用 L09 harness 出最终收益表。
验收:3 轮轨迹 + 收益表。诚实标注:如果某机制没触发(如无冲突),说明任务集没覆盖到该场景——需要调任务设计。
需 API key。无 key 时跑 mock 模式 + 标注"未实测"。
练习 2:逐个关掉机制,验证降级
逐个关闭机制,确认系统仍能跑且降级行为正确:
- 关记忆:researcher 不注入旧记忆(日志无"记忆命中")。
- 关 skills:writer 不遵循格式规范(默认格式)。
- 关代码:数值走 LLM 直出(无附录)。
- 关账本:每次从头研究(无增量简报)。
- 每次关一个,跑测试确认 104 全绿。
验收:每个机制的降级行为符合预期,测试全绿。这证明"降级路径完好"。
练习 3:写一份「Deep Agent 设计复盘」
总结整个 frontier-lessons 的设计经验:
- 五个机制里,哪个边际收益最大?哪个性价比最低(成本高收益低)?
- 如果只保留 3 个机制(砍掉 2 个),保留哪 3 个?为什么?
- 下一步会加什么机制?(候选:多 Agent 记忆共享、工具自动生成、轨迹自训练)
验收:一页设计复盘,体现你对"什么机制值、什么不值"的独立判断。面试时这是"我不只是实现了,还思考过取舍"的证据。