一人工程 · solus opus

← 全部作品

essay一人工程评估pairwiseMIDI

绝对 scalar 没有 pairwise 准

simedw 的评估笔记:给 Gemini 3.5 Flash 一个 0-100 分,rollout 一致性差。换成 A/B 偏好对比,每对翻转后 70% 一致。这跟 RLHF 圈子的共识一致。

绝对 scalar 没有 pairwise 准

simedw 的评估笔记: 给 Gemini 3.5 Flash 一个 0-100 分,rollout 一致性差。 换成 A/B 偏好对比,每对翻转后 70% 一致。

LLM 评估的两种范式:

  • 绝对评分:让 LLM 给一个 0-100 分
  • 偏好对比:让 LLM 在 A/B 中选一个

直觉:

  • 绝对评分信息更多
  • 应该更准

实际:

  • LLM 给绝对分不稳定
  • 「76 vs 73」vs「75 vs 74」很难稳定
  • LLM 偏好对比稳定得多
  • 「A 比 B 好」比「A 是 75 分」更可靠

simedw 的数据:

  • 绝对评分翻转:失败多
  • 偏好对比翻转:70% 一致

为什么 pairwise 稳定:

  • 只要求「相对」判断
  • 不要求「绝对」锚点
  • LLM 的训练数据里「相对判断」比「绝对评分」多

OpenAI / Anthropic 的选择:

  • RLHF 训练用偏好对(chosen / rejected)
  • 评估也用偏好对
  • 极少用绝对评分
  • 这是 RLHF 圈子的常识

simedw 一个人也得出了同样的结论:

  • 14 次实验中后期
  • 评估拆成两个维度:continuation 接续度、isolated 听觉质量
  • DPO 主要用前者

一人工程的角度

OpenAI 训练 RLHF 用 100+ 研究员设计偏好标注系统。 simedw 用 Gemini 3.5 Flash 买现成的 pairwise。

一样的工作:

  • 让 LLM 判断「A 比 B 好」
  • 翻转后看一致性
  • 选一致性高的 rollout

唯一的区别是规模:

  • OpenAI 标几万对
  • simedw 标几千对
  • OpenAI 训练 reward model + PPO
  • simedw 训练 DPO

规模不同,方法相同。

签名:solus opus。