本页目录
Lesson 12 — 前沿追踪:专用模型派与 OS 级 Computer Use
本课目标:吃透 GUI agent 领域最大的未决之争——端到端专用模型 vs 通用 VLM+脚手架,做一次最小复现(消融实验)验证一个 idea。建立「脚手架会不会被下一代模型吃掉」的判断框架。
学完你能回答:「UI-TARS 这类专用模型会淘汰你手写的脚手架吗?」——答案是三轴判断框架(成本/泛化/可控性),且我在自己的可复现基准上做过消融实验,不转述观点,做对照实验。
0. 这门课最大的未决之争
L00 立了三大流派,其中专用模型派(UI-TARS/CogAgent/AutoGLM)是最大的变量。它们不靠手写脚手架(观察提取+动作DSL+循环+可靠性),而是端到端训练一个 GUI 专用模型——截图进去,动作出来。
通用 VLM+脚手架(本课路线) 专用模型派(UI-TARS 等)
───────────────────── ─────────────────────
截图 → SoM标注 → VLM → DSL → 执行 截图 → 专用模型 → 动作 → 执行
手写观察/行动/可靠/安全四层 端到端,脚手架被模型吃掉
可控、可白名单、可复现 强(专训大幅超通用VLM+脚手架)
但表达力受限 但成本高、泛化存疑、可控性差
🎯 核心认知:这个争论的实质是「脚手架的工程价值会不会被模型能力吃掉」。如果下一代专用模型强到不需要 SoM/DSL/循环检测,我们 L01-L11 手写的一切就成了过度工程。本课不站队,建判断框架 + 做消融实验自己验证。
1. 专用模型派代表
📖 CogAgent(Hong et al. 2023, arXiv:2312.08914)——智谱系高分辨率 GUI 专用 VLM。证明专用模型在高分辨率截图理解上超通用 VLM。
📖 UI-TARS(Qin et al. 2025, arXiv:2501.12326)——端到端 GUI 模型,证明专训能大幅超过通用 VLM+脚手架。它直接从截图学动作,不需要外接 SoM/DSL。
📖 AutoGLM(Liu et al. 2024, arXiv:2411.00820)——智谱手机/网页 agent,证明专训+脚手架结合的路线(不是纯端到端,而是专用模型+轻脚手架)。
三者的共同信号:专训 GUI 数据能让模型在 GUI 任务上大幅超通用 VLM。这是专用模型派的核心论据。
2. 三轴判断框架:脚手架会不会被吃掉
判断「专用模型会不会淘汰脚手架」,用三个轴:
| 轴 | 专用模型派 | 通用 VLM+脚手架(本课) | 判断 |
|---|---|---|---|
| 成本 | 训练贵(专用数据+算力)、推理贵(大模型) | 训练零(用现成 VLM)、推理可按需(文本便宜) | 脚手架短期赢——专用模型训练成本不是个人/小团队能负担 |
| 泛化 | 专训数据覆盖外的新场景可能拉胯 | 通用 VLM 泛化好,脚手架适配新场景快 | 脚手架赢——GUI 场景长尾多,通用+脚手架更灵活 |
| 可控性 | 黑盒,难加 allowlist/敏感确认/循环检测 | 脚手架每层可校验可拦截 | 脚手架赢——安全红线要求可控,黑盒模型难满足 |
结论:短期/中小团队/安全敏感场景 → 脚手架赢(成本+泛化+可控)。长期/大厂/标准化高频任务 → 专用模型可能赢(专训质量碾压)。
🎯 「脚手架会不会被吃掉」的判断:会的部分(SoM 标注、简单 DSL)会被下一代 VLM 吃掉——通用 VLM grounding 变准就不需要 SoM。不会被吃的部分(安全层 allowlist/敏感确认、可靠性循环检测、评估 mini-benchmark)是工程价值,与模型能力无关——模型再强,动作层安全拦截仍要人控。
3. 从浏览器到 OS 级 Computer Use
GUI agent 的版图不止浏览器:
| 层级 | 代表 | 难度 |
|---|---|---|
| 浏览器(本课) | WebArena/SeeAct/本课 | 中(DOM 可提取) |
| OS 级(桌面) | Anthropic Computer Use、OSWorld | 高(跨 App、文件系统、窗口管理) |
| 手机 | AutoGLM、AppAgent | 高(触屏手势、App 沙箱) |
📖 OSWorld(Xie et al. 2024, arXiv:2404.07972)——OS 级基准,证明 agent 在跨 App/文件系统任务上远低于人类。
从浏览器到 OS 的增量:观察空间从 DOM 变成像素(OS 没有 DOM);行动空间从 click/type 扩到键盘快捷键/拖拽/跨 App 切换。本课的观察-行动接口框架仍然适用,但实现要换——OS 级更依赖视觉路线(无 DOM 可提取)。
4. 最小复现:消融实验
本课选一个方向做「最小 idea 复现」(≤200 行 + 本地任务集对照实验 + repro_note):
复现方向:SoM 有无消融
Idea:SoM 标注(L05)让通用 VLM 的 grounding 变准。但 SoM 要画框编号(成本)。消融:有 SoM vs 无 SoM(直接坐标),视觉路线成功率差多少?
最小实现: - 视觉路线两版:A 有 SoM(截图画框编号,VLM 答编号);B 无 SoM(VLM 直接答坐标)。 - 在本地任务集上跑,对比成功率。 - mock VLM(无 API 时):A 的 mock 按编号答(准);B 的 mock 按坐标答(模拟飘,加随机偏移)。
预期:A 成功率高(编号精确)、B 低(坐标飘)——证明 SoM 的价值。但诚实标注:mock 不能真证 VLM grounding,需 --real 跑 glm-4v-plus 才算真复现。
这是 frontier L12「最小复现」方法在 GUI 场景的延续:抽核心 idea → 最小实现 → 对照实验 → 诚实 repro_note(成功或失败都记,失败只要归因清楚也是合格产出)。
其他候选方向(练习里做)
- 循环检测策略对比(观察哈希 vs LLM 自判卡住)
- 观察表示消融(元素编号列表 vs 纯文本)
5. 落地清单
本课是方法收尾课,无 research-assistant 代码改动。产出:
| 文件 | 说明 |
|---|---|
README.md(本文件) |
专用模型派 + 三轴框架 + OS 级版图 + 复现方向 |
code.py |
SoM 有无消融实验(最小复现) |
repro_note.md |
复现笔记(idea/取舍/结果/与论文差异) |
exercise.md |
练习 |
验收
cd gui-agent-lessons/12_frontier
python code.py # 跑 SoM 消融(mock)
# 预期输出:
# - 有 SoM 版成功率高(编号精确)
# - 无 SoM 版成功率低(坐标飘,mock 模拟)
# - repro_note.md 诚实记录(mock 限制 + 真实需 --real)
⚠️ mock 复现验证的是「机制本身」,不是「真实 VLM 的 grounding 能力」。真实复现需
--real+ glm-4v-plus。repro_note 会诚实标注这个降级。
6. 本课在两条主线上的位置
- 评估主线:本课是评估主线的方法延伸——把 L08 mini-benchmark 用于消融实验(不只是评机制收益,还评 idea 的真伪)。这训练「用自己的可复现基准验证论文 idea」的能力,是前沿追踪的核心方法。
- 观察-行动接口主线:本课反思观察-行动接口的未来——专用模型可能让接口的某些层(观察提取 SoM、简单行动 DSL)被模型吃掉,但安全层和评估层不会。这是对整个课程设计的前提的批判性审视——好的工程要知道自己的保质期。
🎯 面试话术
「专用 GUI 模型 vs 通用 VLM+脚手架这个争论我有三轴判断框架:成本(脚手架短期赢,专训太贵)、泛化(脚手架赢,GUI 长尾多)、可控性(脚手架赢,安全要可拦截)。而且我在自己的可复现基准上做过 SoM 消融——有 SoM vs 无 SoM 对照,验证 SoM 对 grounding 的价值。我不转述论文观点,我做对照实验。我的判断:SoM/简单 DSL 会被下一代 VLM 吃掉,但安全层(allowlist/敏感确认)和评估层(mini-benchmark)是工程价值,与模型能力无关,不会被吃。」