Agent Engineering 课程阅读

在 GitHub 查看原文

本页目录

Lesson 12 练习

code.py(零依赖,mock 评估数据)观察成本/质量决策表的变化。


练习 1:改 mock 数据,看结论翻转

code.py 用 mock 的四指标 + token 数据演示决策。把 glm-4-flash 的 faithfulness 调到和 glm-4 几乎持平,重跑,看「生成该用哪个模型」的结论是否翻转。

思考:模型选型是数据驱动的决策,不是信仰。如果 flash 质量追平且免费,那就没理由用 glm-4——但前提是你真的跑了评估。「拍脑袋选贵的」和「拍脑袋选便宜的」都是玄学。


练习 2:为什么 context 指标是对照组?

code.py 里 context_precision/context_recall 对两个模型应该基本相同。想想为什么。

思考:context 指标衡量的是检索质量(召回的材料对不对),而检索用的是同一套 KBRetriever + embedding,与生成模型无关。它们相同,正好验证「我们只换了生成模型这一个变量」——这是对照实验的基本功。如果 context 指标也变了,说明实验被污染了。


练习 3:分环节选型的成本账

L12 的结论是「生成用 glm-4、改写/judge 用 flash」。假设一次问答:改写 1 次 + 检索 + 生成 1 次 + judge 1 次。算一下如果全用 glm-4 vs 分环节选型,成本差多少(用 config 里的 model_price_table)。

思考:不是所有环节都需要最强模型。改写(condense question)和 judge 是「格式化/判断」任务,flash 够用;生成是「面向用户的质量」任务,值得用 glm-4。按环节匹配模型能力,是 LLM 应用降本的最大杠杆。


✅ 完成本课后,你应该能回答

  1. 质量-成本-延迟三角是什么?怎么权衡?
  2. 为什么不同环节该用不同模型?举例。
  3. 对照实验里为什么 context 指标应保持不变?
  4. 怎么把「选哪个模型」从拍脑袋变成有数据支撑的决策?