一、评测设计决策树
② 评测全景给出了工程界的四个维度(粒度/时机/来源/目的)和学界的六类方法。本节用这些维度构建一个决策树–拿到任何系统,沿着决策树走,就能推出评测方案。
问题 1:评测对象复杂度?-> 决定粒度
单步(输入 -> [LLM] -> 输出):
-> 端到端够了(只有最终输出可评)
多步固定(节点1 -> 节点2 -> 节点3):
-> 端到端 + 组件级(可加节点忠实度)
多步动态(自主决策,路径不确定):
-> 端到端 + 组件级 + 决策质量(可加轨迹评测)
每跨一层,增加一个可评层级。这不是程度差异,是性质差异:单步只能评结果,多步能评过程,动态多步还能评决策。
问题 2:在什么阶段?-> 决定时机
开发期(发布前):
-> 离线评测(用预定义测试集)
\”发布前能不能用?\”
生产期(线上运行):
-> 在线评测(对生产 trace 打分)
\”线上有没有出问题?\”
Langfuse/Phoenix/DeepEval 均支持
问题 3:有什么判分资源?-> 决定来源
有标准答案(真值可用):
-> 代码评测(便宜、可靠)
例: 天气 API 返回值 = 真值
无标准答案但有质量标准:
-> LLM-as-judge(通用,但有偏差,详见第二节)
例: 营销文案质量
需要人类判断:
-> 人工标注(金标准,不可规模化)
有真实用户反馈:
-> 用户反馈(真实但稀疏)
关键洞察:真值存在于任务中,不存在于平台中。 同一个平台,提取任务有真值(正确日期可定义),生成任务无真值(没有唯一正确答案)。
问题 4:为什么评测?-> 决定目的
防止退化: -> 回归测试
持续质量: -> 质量监控
版本对比: -> A/B 实验
异常发现: -> 告警
四个问题走完,评测方案就确定了。
二、LLM-as-judge 深入
问题 3 中,\”无标准答案\”是最常见的场景,LLM-as-judge 是此时的默认选择。但 LLM-as-judge 有已知的偏差和可靠性问题。
三种偏差
Zheng et al.(“Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena”, NeurIPS 2023, arXiv:2306.05685) identifies three bias




