Agent Engineering 课程阅读

在 GitHub 查看原文

本页目录

L08 练习

练习 1:量化 L01 记忆机制的实际收益(设计实验类)

本课建了评估体系,现在用它量化 L01(记忆)的收益:

  1. 跑两组硬任务: - A 组:enable_memory=false(失忆基线) - B 组:enable_memory=true(有记忆) - 每组跑同一主题 3 次,记录轨迹。
  2. 用 TrajectoryEvaluator 评估: - 对比 A/B 两组的指标卡。 - 重点看:has_memory_recall(B 应为 true)、步数效率(B 第 2-3 次应步数更少——不重复查已知)。
  3. 产出收益表:记忆开/关的指标差异。

验收:收益表显示 B 组第 2 次运行步数 < A 组(记忆让 Agent 不重复查)。诚实标注:真实 API 下数字需实测,mock 下是演示。


练习 2:改进循环检测为 embedding 相似度

本课的循环检测用字符级相似度(粗糙)。改进:

  1. 用 embedding 计算连续步骤输出的语义相似度。
  2. 语义相似度 > 阈值(如 0.95)= 无实质进展 = 循环。
  3. 对比字符级 vs embedding 级的检测准确率。

验收:embedding 级能抓到字符不同但语义相同的打转。思考:trade-off 是什么?(embedding 要 API 调用,有成本)。


练习 3:实现「工具调用合理性」评估

本课只评工具调用成功率,不评"该不该用"。改进:

  1. 定义"工具调用合理性":该用时用了(命中)、不该用时没乱用(克制)。
  2. 用 LLM judge 逐步判断"这一步该不该调工具"。
  3. 统计合理率:合理调用数 / 总调用数。

验收:能检测"不该调工具却调了"(如简单问题硬要搜索)和"该调却没调"(如需要数据却口算)。