用强模型按 rubric 打分 · 从评测流水线到偏差校准 · 面向做 Agent 与 RAG 评测的工程师

做 Agent 或 RAG 到一定阶段,绕不开一个问题:生成结果好不好,谁来判?人工标注贵又慢,BLEU、ROUGE 这类字面匹配又抓不住语义与推理质量。于是大家转向 LLM-as-a-Judge——让一个强模型来当裁判给答案打分。面试里这道题很能区分人:会用的人一句"让 GPT 打个分"就完事,真踩过坑的人会立刻补一句"但它有位置偏好、会自我偏袒、分还不稳,得校准加人工抽检"。这篇把做法和坑一次讲透。

核心做法:给强模型一份 rubric,让它按标准打分

LLM-as-a-Judge 的骨架很简单:把待评的输出连同一份明确的评分标准(rubric)一起喂给一个能力足够强的模型,让它输出分数或裁决。关键从来不是"调用模型",而是把评判标准写清楚。常见有三种模式:

  • 单点打分(Pointwise / 直接评分)

:对单个回答按 1–5 或 1–10 打分。最灵活,但绝对分数最不稳定。

  • 成对比较(Pairwise)

:给 A、B 两个回答,让裁判选更好的一个。比绝对打分更可靠,因为"比大小"比"定绝对值"容易,常用于模型间对比。

  • 参考对照(Reference-based)

:给出标准答案,让裁判判断待评答案是否与之一致。适合有黄金答案的任务。

一个可用的 prompt 骨架长这样——先给维度化的 rubric,再要求先说理由后给分(让模型"先想后判",减少拍脑袋):

# 评分维度写死,别让模型自由发挥
你是严格的评审。按以下维度对回答打分(1-5):
- 事实正确性:有无与资料矛盾/编造
- 完整性:是否覆盖问题要点
- 相关性:是否答非所问

规则:
1) 只依据【资料】判断,资料没提到即视为无依据
2) 先逐维给出简短理由,最后输出 JSON:
   {"correctness":x,"completeness":x,"relevance":x}

【问题】...
【资料】...
【待评回答】...

为什么要"先理由后分数"?因为如果先出分,模型会倾向于事后为分数编理由;先推理再打分,相当于给它一次自省的机会,分数质量明显更高(这也是 CoT 在评测上的体现)。

坑一:三类系统性偏差,人不会犯而模型会

LLM 裁判的分数不是无偏噪声,而是带有可预测的系统性偏差。这是本题的采分核心,能说清一两种就算过关:

  • 位置偏好(Position Bias)

:做成对比较时,很多模型会系统性偏向第一个(或某些模型偏向第二个)出现的答案。哪怕把 A、B 内容对调,裁决也可能跟着位置走,而不是跟着质量走。

  • 长度/冗长偏好(Verbosity Bias)

:模型倾向给更长、看起来更详尽的回答打高分,即便内容并不更对。啰嗦被误当成了"充分"。

  • 自我偏袒(Self-Enhancement / Self-Preference Bias)

:裁判模型倾向于给和它同源、风格相近的输出打高分——用 GPT 评 GPT、拿它给自家产出的答案打分,天然虚高。

此外还有格式偏好(带 Markdown、列表、"作为一个 AI…"腔调的更讨喜)和打分不稳定——同一份输入、同样的 prompt,温度不为 0 时两次调用可能给出不同分数,分布还容易挤在 3、4 分中间(中庸偏置),拉不开区分度。

坑二:把打分当真值,却从不校准和抽检

最常见的落地错误,是把 LLM 裁判的分数直接当成 ground truth 来汇报和决策,从不回头验证它准不准。正确姿势是把裁判本身当成一个"待评的分类器":

  1. 先对齐人工

:准备一小批人工标注的金标集,算裁判打分与人工的一致率(如 Cohen’s Kappa、Spearman 相关)。裁判都对不齐人,它给全量打的分就没有意义。

  1. 持续人工抽检

:全量用模型评,但按比例随机抽一部分回到人工复核,监控裁判是否漂移、是否在某类 case 上系统性判错。

  1. 校准分数

:若发现裁判整体偏高/偏中庸,可做分数映射校准;关注相对排序而非纠结绝对分值。

怎么对治:一套能显著降偏的组合拳

好在这些偏差大多有成熟的缓解手段。下表把常见偏差与对策对齐,是面试时"你会怎么做"的高分答案:

常见偏差 / 问题 表现 对策
位置偏好 偏向靠前/靠后的答案 交换 A/B 顺序各评一次,两次一致才采信;不一致记为平局
长度偏好 长答案天然拿高分 rubric 里明确"简洁充分优于冗长";必要时控长度或惩罚啰嗦
自我偏袒 偏袒同源模型输出 换用不同厂商的裁判模型;避免用被评模型给自己打分
打分不稳 同输入两次不同分 温度设 0;多次采样取多数/均值;用离散档位而非连续分
中庸偏置 分数挤在中间拉不开 改用成对比较;rubric 给每档明确锚点描述
标准漂移 裁判本身判不准 金标集对齐 + 定期人工抽检监控一致率

再叠加几条通用增益:用维度化 rubric 拆分打分(分开评正确性、完整性、相关性,比一个笼统总分更稳);要求结构化输出(JSON)便于解析与统计;成对比较优先于绝对打分(更可靠);成本敏感时也可用多个较弱裁判投票近似一个强裁判。

一句话总结

LLM-as-a-Judge 的正解是"强模型 + 明确 rubric + 先理由后打分",但它带着位置、长度、自我偏袒三类系统性偏差,还打分不稳、爱走中庸——所以别把分数当真值:交换顺序去位置偏、成对比较更可靠、温度设 0 提稳定,再用金标集校准 + 人工抽检兜底,裁判本身也是要被评的分类器。

这里给大家精心整理了一份全面的AI大模型学习资源包括:AI大模型全套学习路线图(从入门到实战)、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等,资料免费分享

👇👇扫码免费领取全部内容👇👇
在这里插入图片描述

1. 成长路线图&学习规划

要学习一门新的技术,作为新手一定要先学习成长路线图方向不对,努力白费

这里,我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。
在这里插入图片描述

2. 大模型经典PDF书籍

书籍和学习文档资料是学习大模型过程中必不可少的,我们精选了一系列深入探讨大模型技术的书籍和学习文档,它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础(书籍含电子版PDF)

在这里插入图片描述

3. 大模型视频教程

对于很多自学或者没有基础的同学来说,书籍这些纯文字类的学习教材会觉得比较晦涩难以理解,因此,我们提供了丰富的大模型视频教程,以动态、形象的方式展示技术概念,帮助你更快、更轻松地掌握核心知识

在这里插入图片描述

4. 2026行业报告

行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5. 大模型项目实战

学以致用 ,当你的理论知识积累到一定程度,就需要通过项目实战,在实际操作中检验和巩固你所学到的知识,同时为你找工作和职业发展打下坚实的基础。

在这里插入图片描述

6. 大模型面试题

面试不仅是技术的较量,更需要充分的准备。

在你已经掌握了大模型技术之后,就需要开始准备面试,我们将提供精心整理的大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余。

在这里插入图片描述

7. 资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇
在这里插入图片描述

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐