Agent Engineering 课程阅读

在 GitHub 查看原文

本页目录

L12 练习

练习 1:循环检测策略对比(方法练习)

本课复现了 SoM 消融。另一个复现方向:循环检测策略对比。

  1. idea:观察哈希检测循环(L06)vs 让 LLM 自判卡住,哪个准?
  2. 最小实现: - 造一个打转场景(agent 连续点假按钮)。 - A 版用观察哈希检测(连续 2 步不变→循环)。 - B 版每步问 mock LLM「你卡住了吗」(mock 模拟 LLM 有时自知有时不自知)。 - 对比两版的循环检出率 + 误报率。
  3. 预期:A 检出率高且零误报(规则确定);B 检出率低(LLM 常不自知)。

验收:两版对照表,A 优于 B。这验证 L06「规则检测比 LLM 自判可靠」的选型。


练习 2:观察表示消融(设计实验类)

第三个复现方向:观察表示消融。

  1. 假设:元素编号列表(L02 主路线)比纯文本正文在操作型任务上成功率高。
  2. 实验:用 L04 的 agent 循环,A 版用元素编号列表观察,B 版用纯文本观察(无编号,LLM 得说「点 LangGraph 链接」再解析)。跑本地任务集对比。
  3. 预期:A 高(编号精确可执行);B 低(文本→元素的解析易错)。

验收:两版成功率对照。这验证 L02「元素编号列表优于纯文本」的选型,是观察空间设计的核心证据。


练习 3:三轴框架应用(理解类)

用三轴框架(成本/泛化/可控)分析两个真实系统:

  1. browser-use(开源 web agent 框架):通用 VLM+脚手架。在三轴上分别什么表现?
  2. AutoGLM(智谱专用模型+轻脚手架):专用模型派。在三轴上?
  3. 如果你要给一个「安全敏感的金融研究」场景选 agent,选哪个?为什么?

验收:两系统在三轴上的对比表,并能基于「可控性」选 browser-use(金融场景安全红线要求动作层可拦截,黑盒专用模型难满足)。这训练用框架做真实选型。


练习 4:思考题——这门课的设计保质期(取舍类)

L12 反思课程本身的前提。回答:

  1. L01-L11 手写的哪些层会被下一代模型吃掉?(提示:SoM、简单 DSL、观察提取)
  2. 哪些层不会被吃掉?为什么?(提示:安全层、评估层、降级链、证据链)
  3. 如果 3 年后通用 VLM 的 grounding 完美 + 能直接输出动作,这门课还有价值吗?

验收:能区分「会被吃掉的脚手架」和「不会的工程价值」。并判断「即使模型变强,这门课的评估方法论、安全工程、可靠性设计仍有价值——它们教的是工程思维不是具体脚手架」。这是对课程自身价值的批判性审视——好的课程要知道什么会过时、什么不会。