欢迎光临
我们一直在努力

评测思维框架:从场景到方案

一、评测设计决策树

② 评测全景给出了工程界的四个维度(粒度/时机/来源/目的)和学界的六类方法。本节用这些维度构建一个决策树–拿到任何系统,沿着决策树走,就能推出评测方案。

问题 1:评测对象复杂度?-> 决定粒度

单步(输入 -> [LLM] -> 输出):
-> 端到端够了(只有最终输出可评)

多步固定(节点1 -> 节点2 -> 节点3):
-> 端到端 + 组件级(可加节点忠实度)

多步动态(自主决策,路径不确定):
-> 端到端 + 组件级 + 决策质量(可加轨迹评测)

每跨一层,增加一个可评层级。这不是程度差异,是性质差异:单步只能评结果,多步能评过程,动态多步还能评决策。

问题 2:在什么阶段?-> 决定时机

开发期(发布前):
-> 离线评测(用预定义测试集)
\”发布前能不能用?\”

生产期(线上运行):
-> 在线评测(对生产 trace 打分)
\”线上有没有出问题?\”
Langfuse/Phoenix/DeepEval 均支持

问题 3:有什么判分资源?-> 决定来源

有标准答案(真值可用):
-> 代码评测(便宜、可靠)
例: 天气 API 返回值 = 真值

无标准答案但有质量标准:
-> LLM-as-judge(通用,但有偏差,详见第二节)
例: 营销文案质量

需要人类判断:
-> 人工标注(金标准,不可规模化)

有真实用户反馈:
-> 用户反馈(真实但稀疏)

关键洞察:真值存在于任务中,不存在于平台中。 同一个平台,提取任务有真值(正确日期可定义),生成任务无真值(没有唯一正确答案)。

问题 4:为什么评测?-> 决定目的

防止退化: -> 回归测试
持续质量: -> 质量监控
版本对比: -> A/B 实验
异常发现: -> 告警

四个问题走完,评测方案就确定了。

二、LLM-as-judge 深入

问题 3 中,\”无标准答案\”是最常见的场景,LLM-as-judge 是此时的默认选择。但 LLM-as-judge 有已知的偏差和可靠性问题。

三种偏差

Zheng et al.(“Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena”, NeurIPS 2023, arXiv:2306.05685) identifies three bias

赞(0)
未经允许不得转载:171主机测评 » 评测思维框架:从场景到方案
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址