Agent Engineering 课程阅读
首页/课程八 · GUI Agent

🖥️ 课程八:GUI Agent

前七门课把 research-assistant 养成了**会思考**的深度智能体,但它只有脑子没有手——「研究世界」的唯一渠道是搜索摘要。本课教 **2025–2026 仍未收敛的前沿**:让 Agent 直接操作浏览器完成任务(打开页面、点击、翻页、提取、下载),给 research-assistant 长出一双**稳、安全、可评估**的手。课程风格延续第七门课:README 不讲「标准做法」,讲「三大流派(文本/视觉/专用模型)取舍是什么、选 X 因为……」;代码是「手写核心机制 + 设计实验验证有没有用」。所有落地改动作用于 research-assistant,`enable_browser` 默认关,123 项测试始终绿。

在 GitHub 查看本课目录

00

全景与基线

三大流派地图 + WebArena/SeeAct/OSWorld 导读 + 硬任务定义 + 跑裸基线(搜索摘要拿不到什么)

01

Playwright 地基

BrowserSession 确定性控制(auto-wait/超时兜底/上下文管理器)+ 慢加载/弹窗页

02

观察空间

page_to_obs 三种页面表示(原始HTML/元素编号列表/纯文本)+ token 对比(省 9x)

03

行动空间

受限动作 DSL(click/type/scroll/back/finish)+ 解析校验 + 非法动作结构化错误回注

04

最小 GUI Agent

observe→think→act 循环 + 滑动窗口上下文裁剪 + mock LLM 零 API 跑通

05

视觉路线

SoM 标注截图喂 glm-4v-plus + 文本/视觉/混合三路线同任务对比(token/成功率)

06

可靠性工程

失败模式清单 + 循环检测(观察哈希)+ 换策略 + 刁难页 before/after

07

网页注入攻防

GUI 注入比 RAG 危险一个量级(做错事非说错话)+ 动作层防御(allowlist/敏感确认/注入扫描)

08

评估 mini-benchmark

WebArena 思路:自托管本地任务集 + 功能性验收 + 轨迹评估器双层评估

09

落地:长出「手」

browser_tool.py 接入 researcher(async + 安全默认开 + 降级链 + 17 测试)

10

深度浏览证据链

deep_browse 多步取证 + 证据链(URL+访问时间+快照)+ 报告引用可回访

11

毕业整合

会上网的 Deep Research Agent:四层协同 + 架构文档 + 收益表(成功率 75%→100%)

12

前沿追踪

专用模型 vs 通用 VLM+脚手架三轴框架 + SoM 有无消融最小复现