排序与打分标注:让模型学会判断“哪个更好”
引言
分类标注回答的是“这是什么”,排序与打分标注回答的是“哪个更好、好多少”。在搜索、推荐、对话、生成等场景中,模型往往不只需要判断对错,还需要在多个候选之间做出优劣判断。这类标注比分类更主观,也更难做一致,但它是训练奖励模型、排序模型和偏好对齐的关键数据来源。这篇文章系统梳理排序与打分标注的类型、方法、难点和质量控制。
一、排序打分标注的常见类型
类型 |
标注形式 |
典型应用 |
|---|---|---|
绝对打分 |
给单个对象打 1–5 分 |
回复质量评估 |
成对比较 |
两个对象选更好的 |
偏好数据采集 |
列表排序 |
多个对象从优到劣排序 |
搜索结果排序 |
多维度打分 |
每个维度分别打分 |
相关性 + 流畅度 + 安全性 |
分级判定 |
按预设等级归类 |
搜索相关性分级 |
连续打分 |
0–1 之间的实数 |
精排模型训练 |
不同任务对标注精度的要求不同。成对比较通常比绝对打分更容易保持一致,但信息量也更低。
二、绝对打分标注
2.1 量表设计
绝对打分最常用的是李克特量表。设计时需要注意:
刻度数量:5 点或 7 点最常见,太多会增加认知负担
锚点定义:每个分值要有明确的文字描述
中间选项:是否设置“中立”需要根据任务决定
方向一致:所有维度的高分都代表更好,避免混淆
2.2 量表锚点示例
分值 |
相关性 |
流畅度 |
|---|---|---|
5 |
完全解答用户问题 |
母语级自然流畅 |
4 |
基本解答,略有冗余 |
通顺,个别用词不当 |
3 |
部分相关,信息不完整 |
可理解,有明显不自然 |
2 |
勉强相关,答非所问 |
语法错误较多 |
1 |
完全不相关 |
无法理解 |
2.3 绝对打分的优缺点
优点 |
缺点 |
|---|---|
操作直观,标注速度快 |
不同标注员标准差异大 |
信息量比成对比较丰富 |
容易受近期样本影响 |
可直接用于回归训练 |
中间分值含义模糊 |
适合多维度评估 |
难以校准 |
三、成对比较标注
3.1 基本形式
给标注员展示同一个输入的两条输出,让其选择更好的那条,或判定为平局。
输入:帮我写一封请假邮件
回复 A:……
回复 B:……
标注:A 更好 / B 更好 / 差不多
3.2 平局的处理
平局选项的设计是一个重要决策:
不设平局:强制二选一,数据干净但可能引入噪声
设平局:更符合真实感受,但平局数据在训练中较难利用
设“都不好”:额外选项,用于过滤低质量候选
实践中常见做法是允许平局,但在训练时对平局对做特殊处理或降权。
3.3 成对比较的优缺点
优点 |
缺点 |
|---|---|
一致性高于绝对打分 |
单次比较信息量少 |
认知负担低 |
需要大量比较对 |
适合训练奖励模型 |
无法直接得到绝对分数 |
可用于 DPO 等算法 |
传递性可能不成立 |
3.4 传递性问题
成对比较可能出现循环偏好:A 优于 B,B 优于 C,C 优于 A。这通常来自标注噪声或真实偏好的非传递性。处理方式包括:
多人标注取多数
用 Bradley-Terry 模型拟合全局分数
检测并剔除异常比较对
四、列表排序标注
4.1 基本形式
给标注员展示一个输入和多个候选输出,要求按质量从高到低排序。
输入:推荐一部科幻电影
候选:
A. 《银翼杀手2049》
B. 《星际穿越》
C. 《沙丘》
D. 《降临》
排序:B > A > D > C
4.2 排序与打分的转换
列表排序可以转换为成对比较数据。n 个对象的完整排序等价于 n(n-1)/2 个成对比较。这为奖励模型训练提供了丰富的数据。
4.3 排序标注的难点
认知负担大:候选越多,排序越困难
中间项模糊:两端容易区分,中间难分
顺序偏见:倾向保持展示顺序
疲劳效应:后期排序质量下降
对策:控制候选数量在 3–5 个,随机化展示顺序,分段排序再合并。
五、多维度打分标注
5.1 为什么需要多维度
单一总分无法告诉模型具体哪里不好。多维度打分能提供更细粒度的信号。
场景 |
常见维度 |
|---|---|
对话回复 |
相关性、有用性、流畅度、安全性 |
搜索相关性 |
主题相关、意图匹配、时效性 |
机器翻译 |
忠实度、流畅度 |
摘要生成 |
信息量、简洁度、连贯性 |
代码生成 |
正确性、可读性、效率 |
5.2 维度独立性与相关性
设计维度时要考虑:
维度之间是否独立,避免重复计分
某些维度是否应该有一票否决权
总分是加权求和还是取最低分
维度数量是否超出标注员的认知负荷
5.3 一票否决维度
安全、事实性等维度通常设为一票否决:无论其他维度多好,只要该维度不合格,整体判定为不可用。
六、分级判定标注
6.1 搜索相关性分级
搜索场景常用分级判定替代打分。以常见的四级相关性为例:
等级 |
含义 |
|---|---|
完美 |
直接回答查询意图 |
优秀 |
高度相关,信息略少 |
一般 |
部分相关,需进一步点击 |
不相关 |
与查询无关 |
6.2 分级判定的优势
等级定义明确,一致性高于连续打分
可直接用于排序模型的标签
便于统计和分析
适合大规模标注
6.3 分级与打分的映射
分级可以映射为数值用于训练:
完美 = 3
优秀 = 2
一般 = 1
不相关 = 0
七、标注中的偏见与对策
7.1 常见偏见
偏见 |
表现 |
对策 |
|---|---|---|
长度偏见 |
偏好更长的回复 |
控制长度变量,专门培训 |
格式偏见 |
偏好带列表和标题的回复 |
隐藏格式或统一格式 |
位置偏见 |
偏好先展示或后展示的选项 |
随机化顺序 |
自我偏好 |
偏好与自己风格相似的 |
多人交叉,隐藏来源 |
权威偏见 |
偏好看起来更专业的措辞 |
强调内容而非风格 |
从众偏见 |
受他人标注影响 |
独立标注后再讨论 |
7.2 位置偏见的检测
位置偏见可以通过交换顺序来检测。如果 A 在前时被选中的比例显著高于 A 在后时,说明存在位置偏见。
A vs B:A 被选 62%
B vs A:A 被选 48%
差异 14%,存在位置偏见
7.3 偏见缓解措施
随机化候选顺序
隐藏模型来源和版本
控制回复长度差异
统一格式要求
定期做偏见审计
对标注员进行专项培训
八、质量控制
8.1 一致性指标
指标 |
适用场景 |
说明 |
|---|---|---|
Kappa 系数 |
分类式判定 |
衡量分类一致性 |
Spearman 相关 |
打分排序 |
衡量打分排序一致性 |
Kendall's Tau |
列表排序 |
衡量排序一致性 |
一致率 |
成对比较 |
简单直观 |
组内相关 ICC |
连续打分 |
衡量打分者间信度 |
8.2 黄金标准题
在标注任务中混入已知答案的题目,用于检测标注员状态:
明显优劣的对比,正确率应接近 100%
难度适中的对比,正确率应高于 80%
平局样本,检测是否过度选择
定期更新黄金题,避免记忆
8.3 校准会议
定期组织标注员讨论争议样本:
收集分歧最大的样本
集体讨论达成共识
更新标注规范
记录典型案例
重新校准打分标准
8.4 标注规范示例
回复偏好标注规范(节选) 1. 优先看事实准确性。若一方存在事实错误,直接判负。
2. 准确性相当时,看是否完整解答用户问题。
3. 完整性相当时,看语言是否自然流畅。
4. 以上都相当时,才考虑长度和格式。
5. 不要因为回复更长就认为更好。
6. 不要因为回复用了列表就认为更好。
7. 若两条回复质量确实接近,选择“差不多”。
九、数据组织与训练用途
9.1 数据格式
{
"prompt": "帮我写一封请假邮件",
"responses": [
{"id": "A", "text": "...", "model": "v1"},
{"id": "B", "text": "...", "model": "v2"}
],
"comparison": {
"winner": "B",
"annotator": "a001",
"confidence": "high"
},
"scores": {
"A": {"relevance": 4, "fluency": 5, "safety": 5},
"B": {"relevance": 5, "fluency": 4, "safety": 5}
}
}
9.2 训练用途
标注类型 |
训练目标 |
|---|---|
绝对打分 |
回归模型 / 奖励模型 |
成对比较 |
Bradley-Terry 奖励模型 |
列表排序 |
排序模型 / 列表损失 |
分级判定 |
排序模型 / 分类模型 |
多维度打分 |
多任务奖励模型 |
9.3 Bradley-Terry 模型
成对比较数据最常用的建模方式是 Bradley-Terry:
# P(A 优于 B) = sigmoid(score_A - score_B)
loss = -log(sigmoid(score_winner - score_loser))
DPO 等直接偏好优化方法也基于成对比较数据,但不需要显式训练奖励模型。
十、常见问题与对策
问题 |
表现 |
对策 |
|---|---|---|
一致性低 |
不同人判断差异大 |
细化规范,增加校准 |
位置偏见 |
顺序影响结果 |
随机化顺序,交换检测 |
长度偏见 |
长回复被偏爱 |
控制长度,专项培训 |
平局过多 |
标注员不愿判断 |
明确平局标准,设置激励 |
疲劳降质 |
后期标注变随意 |
控制时长,增加休息 |
传递性违反 |
出现循环偏好 |
多人标注,模型拟合 |
标注成本高 |
需要大量比较对 |
主动学习,AI 预标注 |
十一、当前趋势
AI 辅助偏好标注:用模型预判,人工只需修正
RLAIF:用 AI 反馈替代部分人类偏好标注
合成偏好数据:用模型生成候选,人工筛选排序
多模态偏好:图像、视频、音频的偏好标注
细粒度偏好:按维度分别做偏好比较
在线偏好学习:从用户行为中隐式获取偏好
偏好数据的可解释性:要求标注员给出排序理由
总结
排序与打分标注是让模型学会“判断优劣”的关键环节。绝对打分信息丰富但一致性难保证,成对比较一致性高但信息量有限,列表排序和多维度打分则在两者之间寻找平衡。无论采用哪种形式,偏见控制和一致性管理都是核心挑战。在大模型时代,偏好数据已经成为对齐训练的基础设施,而标注体系的设计质量,直接决定了模型能否真正理解人类的偏好。
延伸阅读方向
Bradley-Terry 模型与 Elo 评分系统
RLHF 中的奖励模型训练与评估
DPO 与直接偏好优化方法族
排序学习:Pointwise、Pairwise、Listwise
标注一致性:Kappa、ICC、Kendall's Tau 的计算与解释
偏见检测:位置偏见、长度偏见的量化方法