👨⚕️ 主页: gis分享者 👨⚕️ 感谢各位大佬 点赞👍 收藏⭐ 留言📝 加关注✅! 👨⚕️ 收录于专栏:AI大模型原理和应用面试题 
文章目录
- 一、🍀回答重点
- 二、🍀扩展知识
-
- 2.1 ☘️自动化评估怎么搭
- 2.2 ☘️关键指标体系
- 2.3 ☘️对比评估和 A/B 测试
- 2.4 ☘️业界的 Benchmark 和评估工具
- 三、🍀面试官追问
一、🍀回答重点
评估 AI Agent 比评估普通大模型回答复杂得多,因为 Agent 不只是\”回答问题\”,是\”完成任务\”。一个任务可能涉及 10 多轮推理、七八次工具调用和复杂的决策路径,光看最终结果远远不够,整个执行过程都得审一遍。
Agent 的评估从四个维度展开:
1)任务完成度,最核心的指标,Agent 到底有没有把事办成。有明确成功标准的任务,比如\”帮我创建一个 GitHub Issue\”,直接用二元指标判断成功或失败。开放式任务,比如\”写一篇技术分析报告\”,需要更细粒度的评分,用人工评审或者 LLM-as-a-Judge 来打分。
2)执行效率,关注 Agent 完成任务的\”经济性\”。用了多少轮循环、消耗了多少 token、总共花了多长时间。两个 Agent 都完成了同一个任务,一个 5 轮循环花了 3 万 token,另一个 20 轮循环花了 15 万 token,高下立判。
3)决策质量,评估 Agent 在推理过程中做的选择是否合理。工具选对了没有、参数传准了没有、有没有做无意义的操作。这个维度需要审查 Agent 的执行 Trace,通常由有经验的工程师来判断。
4)安全性和可靠性,Agent 有没有做不该做的事,有没有泄露敏感信息、执行危险操作、遇到异常是不是处理得当。



