Agent Engineering 课程阅读

在 GitHub 查看原文

本页目录

L11 练习

练习 1:补一个真实硬任务的镜像版任务(方法练习)

当前 mini-benchmark 8 任务都是本地 test_pages。补一个「真实硬任务镜像版」:

  1. 选一个真实公开页(如 arXiv 某论文页),仿造一个本地镜像页(含相同结构:标题/作者/摘要/日期)。
  2. 加进 mini-benchmark 作 T9:checker 检查提取到的论文标题/日期。
  3. 跑两版(裸/加固),标注「镜像版」。

验收:T9 进任务集,能跑通。诚实标注「镜像版不等同真实页,但复刻了关键结构」。这是 L00 双轨制的延续——本地镜像为主、真实只读为辅。


2:全开跑真实硬任务(设计实验类)

用真实 API + playwright 跑硬任务,出真实收益(非 mock):

  1. 假设:真实收益的趋势和 mock 一致(browse 多拿详情页字段、加固后成功率↑),但具体数字不同。
  2. 实验: - 配齐 ZHIPUAI_API_KEY + playwright + ENABLE_BROWSER=true。 - 跑硬任务「对比 LangGraph release」3 次。 - 记录:每次拿到的证据种类、引用可回访率、步数、是否成功。
  3. 预期:真实 LLM 可能多几步(探索性),但 browse 拿到详情页字段的结论成立。

验收:真实收益表(3 次跑的平均),与 mock 表对比,趋势一致 + 数字差异诚实标注。这是从 mock 到真实的最后一公里验证。


练习 3:架构文档的讲述力(理解类)

本课产出 docs/browser-agent.md。回答:

  1. 架构文档里哪个图/表对面试最有用?(提示:四层全景图 + 收益表)
  2. 如果面试官只看 30 秒,你让他看哪部分?
  3. 架构文档和代码的对应关系——每个机制指向哪段代码?(提示:browser_tool.py / nodes.py / config.py)

验收:能指出「四层全景图 + 收益表是 30 秒讲清楚的载体」,并说出每个机制在代码里的位置。这是把代码变成可讲述故事的能力。


练习 4:思考题——browser 会不会让 Agent 变危险(取舍类)

Agent 有了「手」能做错事(L07 已证)。回答:

  1. browser 能力越强(多步/视觉/...),攻击面是不是越大?
  2. 怎么在「能力增强」和「安全」之间平衡?(提示:安全层默认开、敏感动作确认、allowlist 维护)
  3. 如果未来 UI-TARS 这类专用模型让 agent 能力暴涨(L12 主题),安全层还够吗?

验收:能说出「能力↑ → 攻击面↑,但安全层(动作层拦截)不依赖 agent 自觉,能力涨它仍硬拦」。并预判 L12:专用模型可能让 prompt 防御更难(模型更易被注入说服),但动作层 allowlist/敏感确认仍有效——这就是「动作层是压舱石」的长期价值。