L08 练习
练习 1:量化 L01 记忆机制的实际收益(设计实验类)
本课建了评估体系,现在用它量化 L01(记忆)的收益:
- 跑两组硬任务:
- A 组:
enable_memory=false(失忆基线) - B 组:enable_memory=true(有记忆) - 每组跑同一主题 3 次,记录轨迹。 - 用 TrajectoryEvaluator 评估:
- 对比 A/B 两组的指标卡。
- 重点看:
has_memory_recall(B 应为 true)、步数效率(B 第 2-3 次应步数更少——不重复查已知)。 - 产出收益表:记忆开/关的指标差异。
验收:收益表显示 B 组第 2 次运行步数 < A 组(记忆让 Agent 不重复查)。诚实标注:真实 API 下数字需实测,mock 下是演示。
练习 2:改进循环检测为 embedding 相似度
本课的循环检测用字符级相似度(粗糙)。改进:
- 用 embedding 计算连续步骤输出的语义相似度。
- 语义相似度 > 阈值(如 0.95)= 无实质进展 = 循环。
- 对比字符级 vs embedding 级的检测准确率。
验收:embedding 级能抓到字符不同但语义相同的打转。思考:trade-off 是什么?(embedding 要 API 调用,有成本)。
练习 3:实现「工具调用合理性」评估
本课只评工具调用成功率,不评"该不该用"。改进:
- 定义"工具调用合理性":该用时用了(命中)、不该用时没乱用(克制)。
- 用 LLM judge 逐步判断"这一步该不该调工具"。
- 统计合理率:合理调用数 / 总调用数。
验收:能检测"不该调工具却调了"(如简单问题硬要搜索)和"该调却没调"(如需要数据却口算)。