Agent Engineering 课程阅读

在 GitHub 查看原文

本页目录

L09 练习

练习 1:跑真实模式并解读收益表(设计实验类)

本课的 mock 模式是演示。跑真实模式:

  1. 配好 ZHIPUAI_API_KEY,开启所有机制。
  2. python eval_agent/run_harness.py --real
  3. 对比真实数字 vs mock 数字: - 真实的记忆召回率是多少?(可能不是 100%——取决于 recall 质量) - 真实的成功率是多少?(可能不是 100%——真实任务更难)
  4. 解读:哪个机制的边际收益最大?哪个性价比(收益/成本)最高?

验收:真实收益表 + 解读。诚实标注:如果真实数字和 mock 差很远,说明 mock 的预设不准——这正常,mock 只是流程演示。

没 key 时跳过,标注"未实测"。


练习 2:实现多次运行取分布

本课单次运行取值。改进:

  1. 每个配置 × 任务跑 3 次。
  2. 指标取均值 ± 标准差(如"成功率 80% ± 10%")。
  3. 报告里标注置信区间。

验收:收益表里有标准差列。思考:为什么 Agent 评估要看分布?(非确定性——单次可能是运气)。


练习 3:加 A/B 测试的统计显著性

两个配置对比时,不只是看数字差,要判断"差值是否显著":

  1. 用 t-test 或 bootstrap 判断全关 vs 全开的指标差异是否统计显著。
  2. p < 0.05 才说"这个机制显著提升了 X"。
  3. 不显著时标注"无显著差异(可能需要更多样本)"。

验收:收益表里有 p 值列。面试能讲清"Agent 改进不能只看数字差,要判显著性"。