Agent Engineering 课程阅读

在 GitHub 查看原文

本页目录

L07 练习

练习 1:量化「代码计算 vs LLM 口算」的准确率(设计实验类)

本课说代码计算比 LLM 口算可靠。设计实验量化:

  1. 构造 20 道计算题(数值对比、占比、分组统计),有标准答案。
  2. 对比: - LLM 口算:直接问 LLM"X 占比是多少",看答案精度。 - 代码计算:让 LLM 生成代码,沙箱执行,看答案精度。
  3. 统计:①答案误差(与标准答案的偏差)②完全正确率(误差 < 1%)。
  4. 预期:代码计算完全正确率接近 100%,LLM 口算在复杂计算(多步/分组)时误差大。

验收:输出准确率对比表。诚实标注:简单计算(如 2+3)LLM 也能对,复杂计算(如分组占比)代码明显更准。


练习 2:让 researcher 也接入代码解释器

本课只接了 writer。researcher 也能用代码:

  1. researcher 拿到搜索结果后,如果需要去重/统计,生成代码执行。
  2. 代码结果作为 finding 的一部分(带"由代码计算"标记)。
  3. 思考:researcher 用代码和 writer 用代码的区别?(researcher 是中间步骤,writer 是最终报告)

验收:researcher 的 findings 里出现代码计算结果。轨迹里能看到 researcher 调了 code interpreter。


练习 3:实现代码生成的 few-shot prompt

本课的代码生成 prompt 只有"生成分析代码"。改进为 few-shot:

  1. 在 prompt 里附 2-3 个"好代码"示例(研究场景的典型分析代码)。
  2. 让 LLM 参照示例生成更规范的代码。
  3. 对比 zero-shot vs few-shot 的代码质量(能否跑通、输出是否规范)。

验收:few-shot 生成的代码成功率高于 zero-shot。诚实标注 few-shot 的 token 成本(示例占额外 token)。