Daily

AsmBB
登录

排序与打分标注:让模型学会判断“哪个更好”
0

#67 (ツ) admin
创建于 03:49, 浏览:1 次。

排序与打分标注:让模型学会判断“哪个更好”


引言

分类标注回答的是“这是什么”,排序与打分标注回答的是“哪个更好、好多少”。在搜索、推荐、对话、生成等场景中,模型往往不只需要判断对错,还需要在多个候选之间做出优劣判断。这类标注比分类更主观,也更难做一致,但它是训练奖励模型、排序模型和偏好对齐的关键数据来源。这篇文章系统梳理排序与打分标注的类型、方法、难点和质量控制。


一、排序打分标注的常见类型

类型

标注形式

典型应用

绝对打分

给单个对象打 1–5 分

回复质量评估

成对比较

两个对象选更好的

偏好数据采集

列表排序

多个对象从优到劣排序

搜索结果排序

多维度打分

每个维度分别打分

相关性 + 流畅度 + 安全性

分级判定

按预设等级归类

搜索相关性分级

连续打分

0–1 之间的实数

精排模型训练

不同任务对标注精度的要求不同。成对比较通常比绝对打分更容易保持一致,但信息量也更低。


二、绝对打分标注

2.1 量表设计

绝对打分最常用的是李克特量表。设计时需要注意:

  • 刻度数量:5 点或 7 点最常见,太多会增加认知负担

  • 锚点定义:每个分值要有明确的文字描述

  • 中间选项:是否设置“中立”需要根据任务决定

  • 方向一致:所有维度的高分都代表更好,避免混淆

2.2 量表锚点示例

分值

相关性

流畅度

5

完全解答用户问题

母语级自然流畅

4

基本解答,略有冗余

通顺,个别用词不当

3

部分相关,信息不完整

可理解,有明显不自然

2

勉强相关,答非所问

语法错误较多

1

完全不相关

无法理解

2.3 绝对打分的优缺点

优点

缺点

操作直观,标注速度快

不同标注员标准差异大

信息量比成对比较丰富

容易受近期样本影响

可直接用于回归训练

中间分值含义模糊

适合多维度评估

难以校准


三、成对比较标注

3.1 基本形式

给标注员展示同一个输入的两条输出,让其选择更好的那条,或判定为平局。

输入:帮我写一封请假邮件

回复 A:……
回复 B:……

标注:A 更好 / B 更好 / 差不多

3.2 平局的处理

平局选项的设计是一个重要决策:

  • 不设平局:强制二选一,数据干净但可能引入噪声

  • 设平局:更符合真实感受,但平局数据在训练中较难利用

  • 设“都不好”:额外选项,用于过滤低质量候选

实践中常见做法是允许平局,但在训练时对平局对做特殊处理或降权。

3.3 成对比较的优缺点

优点

缺点

一致性高于绝对打分

单次比较信息量少

认知负担低

需要大量比较对

适合训练奖励模型

无法直接得到绝对分数

可用于 DPO 等算法

传递性可能不成立

3.4 传递性问题

成对比较可能出现循环偏好:A 优于 B,B 优于 C,C 优于 A。这通常来自标注噪声或真实偏好的非传递性。处理方式包括:

  • 多人标注取多数

  • 用 Bradley-Terry 模型拟合全局分数

  • 检测并剔除异常比较对


四、列表排序标注

4.1 基本形式

给标注员展示一个输入和多个候选输出,要求按质量从高到低排序。

输入:推荐一部科幻电影

候选:
A. 《银翼杀手2049》
B. 《星际穿越》
C. 《沙丘》
D. 《降临》

排序:B > A > D > C

4.2 排序与打分的转换

列表排序可以转换为成对比较数据。n 个对象的完整排序等价于 n(n-1)/2 个成对比较。这为奖励模型训练提供了丰富的数据。

4.3 排序标注的难点

  • 认知负担大:候选越多,排序越困难

  • 中间项模糊:两端容易区分,中间难分

  • 顺序偏见:倾向保持展示顺序

  • 疲劳效应:后期排序质量下降

对策:控制候选数量在 3–5 个,随机化展示顺序,分段排序再合并。


五、多维度打分标注

5.1 为什么需要多维度

单一总分无法告诉模型具体哪里不好。多维度打分能提供更细粒度的信号。

场景

常见维度

对话回复

相关性、有用性、流畅度、安全性

搜索相关性

主题相关、意图匹配、时效性

机器翻译

忠实度、流畅度

摘要生成

信息量、简洁度、连贯性

代码生成

正确性、可读性、效率

5.2 维度独立性与相关性

设计维度时要考虑:

  • 维度之间是否独立,避免重复计分

  • 某些维度是否应该有一票否决权

  • 总分是加权求和还是取最低分

  • 维度数量是否超出标注员的认知负荷

5.3 一票否决维度

安全、事实性等维度通常设为一票否决:无论其他维度多好,只要该维度不合格,整体判定为不可用。


六、分级判定标注

6.1 搜索相关性分级

搜索场景常用分级判定替代打分。以常见的四级相关性为例:

等级

含义

完美

直接回答查询意图

优秀

高度相关,信息略少

一般

部分相关,需进一步点击

不相关

与查询无关

6.2 分级判定的优势

  • 等级定义明确,一致性高于连续打分

  • 可直接用于排序模型的标签

  • 便于统计和分析

  • 适合大规模标注

6.3 分级与打分的映射

分级可以映射为数值用于训练:

完美 = 3
优秀 = 2
一般 = 1
不相关 = 0

七、标注中的偏见与对策

7.1 常见偏见

偏见

表现

对策

长度偏见

偏好更长的回复

控制长度变量,专门培训

格式偏见

偏好带列表和标题的回复

隐藏格式或统一格式

位置偏见

偏好先展示或后展示的选项

随机化顺序

自我偏好

偏好与自己风格相似的

多人交叉,隐藏来源

权威偏见

偏好看起来更专业的措辞

强调内容而非风格

从众偏见

受他人标注影响

独立标注后再讨论

7.2 位置偏见的检测

位置偏见可以通过交换顺序来检测。如果 A 在前时被选中的比例显著高于 A 在后时,说明存在位置偏见。

A vs B:A 被选 62%
B vs A:A 被选 48%

差异 14%,存在位置偏见

7.3 偏见缓解措施

  • 随机化候选顺序

  • 隐藏模型来源和版本

  • 控制回复长度差异

  • 统一格式要求

  • 定期做偏见审计

  • 对标注员进行专项培训


八、质量控制

8.1 一致性指标

指标

适用场景

说明

Kappa 系数

分类式判定

衡量分类一致性

Spearman 相关

打分排序

衡量打分排序一致性

Kendall's Tau

列表排序

衡量排序一致性

一致率

成对比较

简单直观

组内相关 ICC

连续打分

衡量打分者间信度

8.2 黄金标准题

在标注任务中混入已知答案的题目,用于检测标注员状态:

  • 明显优劣的对比,正确率应接近 100%

  • 难度适中的对比,正确率应高于 80%

  • 平局样本,检测是否过度选择

  • 定期更新黄金题,避免记忆

8.3 校准会议

定期组织标注员讨论争议样本:

  1. 收集分歧最大的样本

  2. 集体讨论达成共识

  3. 更新标注规范

  4. 记录典型案例

  5. 重新校准打分标准

8.4 标注规范示例

回复偏好标注规范(节选)

1. 优先看事实准确性。若一方存在事实错误,直接判负。

2. 准确性相当时,看是否完整解答用户问题。

3. 完整性相当时,看语言是否自然流畅。

4. 以上都相当时,才考虑长度和格式。

5. 不要因为回复更长就认为更好。

6. 不要因为回复用了列表就认为更好。

7. 若两条回复质量确实接近,选择“差不多”。


九、数据组织与训练用途

9.1 数据格式

{
  "prompt": "帮我写一封请假邮件",
  "responses": [
    {"id": "A", "text": "...", "model": "v1"},
    {"id": "B", "text": "...", "model": "v2"}
  ],
  "comparison": {
    "winner": "B",
    "annotator": "a001",
    "confidence": "high"
  },
  "scores": {
    "A": {"relevance": 4, "fluency": 5, "safety": 5},
    "B": {"relevance": 5, "fluency": 4, "safety": 5}
  }
}

9.2 训练用途

标注类型

训练目标

绝对打分

回归模型 / 奖励模型

成对比较

Bradley-Terry 奖励模型

列表排序

排序模型 / 列表损失

分级判定

排序模型 / 分类模型

多维度打分

多任务奖励模型

9.3 Bradley-Terry 模型

成对比较数据最常用的建模方式是 Bradley-Terry:

# P(A 优于 B) = sigmoid(score_A - score_B)
loss = -log(sigmoid(score_winner - score_loser))

DPO 等直接偏好优化方法也基于成对比较数据,但不需要显式训练奖励模型。


十、常见问题与对策

问题

表现

对策

一致性低

不同人判断差异大

细化规范,增加校准

位置偏见

顺序影响结果

随机化顺序,交换检测

长度偏见

长回复被偏爱

控制长度,专项培训

平局过多

标注员不愿判断

明确平局标准,设置激励

疲劳降质

后期标注变随意

控制时长,增加休息

传递性违反

出现循环偏好

多人标注,模型拟合

标注成本高

需要大量比较对

主动学习,AI 预标注


十一、当前趋势

  • AI 辅助偏好标注:用模型预判,人工只需修正

  • RLAIF:用 AI 反馈替代部分人类偏好标注

  • 合成偏好数据:用模型生成候选,人工筛选排序

  • 多模态偏好:图像、视频、音频的偏好标注

  • 细粒度偏好:按维度分别做偏好比较

  • 在线偏好学习:从用户行为中隐式获取偏好

  • 偏好数据的可解释性:要求标注员给出排序理由


总结

排序与打分标注是让模型学会“判断优劣”的关键环节。绝对打分信息丰富但一致性难保证,成对比较一致性高但信息量有限,列表排序和多维度打分则在两者之间寻找平衡。无论采用哪种形式,偏见控制和一致性管理都是核心挑战。在大模型时代,偏好数据已经成为对齐训练的基础设施,而标注体系的设计质量,直接决定了模型能否真正理解人类的偏好。

延伸阅读方向
  • Bradley-Terry 模型与 Elo 评分系统

  • RLHF 中的奖励模型训练与评估

  • DPO 与直接偏好优化方法族

  • 排序学习:Pointwise、Pairwise、Listwise

  • 标注一致性:Kappa、ICC、Kendall's Tau 的计算与解释

  • 偏见检测:位置偏见、长度偏见的量化方法

排序与打分标注:让模型学会判断“哪个更好”
0

AsmBB v3.0 (check-in: 3df85ed0b218e51a); SQLite v (check-in: 831d0fb2836b71c9);
©2016..2020 John Found; Licensed under EUPL. Powered by Assembly language Created with Fresh IDE