L06 练习
练习 1:扩失败模式——超时风暴(方法练习)
当前失败模式清单有 6 类。补一个真实场景:超时风暴——agent 连续多步都触发 TimeoutError(页面慢/元素飘),每步重试都超时。
- 在
tricky.html加一个超慢元素(点击后setTimeout5 秒才响应)。 - 让裸 agent 点它,观察:每步等 10 秒超时、连续多步、总耗时爆炸。
- 给可靠性层加「连续 K 次 TimeoutError → 换策略」规则。
验收:加固 agent 检出连续超时后换策略(不再死等),总耗时显著降。这训练你处理「时间维度」的可靠性。
练习 2:量化 loop_n 的甜蜜点(设计实验类)
本课 loop_n=2(连续 2 步观察不变算循环)。这个值设多少最优?
- 假设:loop_n 太小(1)会误报(正常翻页间偶有观察不变);太大(5)检测慢(浪费步数)。
- 实验:在刁难页上跑 loop_n=1/2/3/5 四档,记录:误报率(正常操作被判循环的比例)、检测延迟(从开始打转到检出循环的步数)、最终成功率。
- 预期:loop_n=1 误报高;loop_n=5 检测慢但准;loop_n=2-3 是甜蜜点。
验收:四档对照表,能画出 loop_n 与误报/延迟的权衡曲线。诚实标注这是 mock 演示(真实 LLM 的观察变化模式不同,但权衡趋势成立)。
练习 3:换策略的选择逻辑(理解类)
本课检测到循环后注入教训让 LLM 换策略。但「换什么策略」LLM 不一定选对。回答:
- 当前注入的教训是「尝试 back()/scroll/换元素」——LLM 可能选错(比如该 back 却 scroll)。
- 能不能基于失败模式给更具体的建议?比如「URL 没变→死链→建议 back」「观察有遮罩→弹窗→建议先关遮罩」。
- 这需要可靠性层做什么额外的检测?(提示:不只看观察哈希,还要看观察内容特征)
验收:能说出「教训越具体,LLM 换策略越准——但需要可靠性层做语义分析(不只是哈希)。这是规则检测向 LLM 辅助检测的演进方向」。L09 落地时会权衡具体度与实现成本。
练习 4:思考题——人工接管点的现实意义(取舍类)
本课有「连续 K 次换策略仍卡 → 人工接管」。回答:
- 为什么不无限换策略?无限换的成本是什么?
- 人工接管在 research-assistant 落地(L09)时,怎么实现?(提示:browse 工具返回「需人工接管」状态,researcher 节点降级到 search 摘要)
- 这和 L07 安全主线的「敏感动作强制人工确认」是同一种机制吗?区别在哪?
验收:能说出「无限换策略 = 成本失控 + 可能换到危险动作;人工接管是兜底」。并区分「可靠性触发的人工接管」(agent 卡住,被动)和「安全触发的人工确认」(agent 要做敏感动作,主动拦截)——前者是能力边界,后者是安全红线。两者在 L09 会合流到 browse 工具的统一接口。