一人工程 · solus opus

← 全部作品

essay一人工程评估DPOMIDI

continuation vs isolated 评估

simedw 后期评估拆成两个维度:continuation 跟 prompt 的接续度 vs isolated 听觉质量。DPO 主要用前者。这是 simedw 评估笔记的精细化。

continuation vs isolated 评估

simedw 评估笔记的精细化: 拆成两个维度——continuation 跟 prompt 的接续度 vs isolated 听觉质量。 DPO 主要用前者。

LLM 评估的传统做法:

  • 一个标量分数
  • 越高越好

simedw 的精细化:

  • 拆成两个维度
  • continuation 跟 prompt 的接续度
  • isolated 听觉质量

为什么拆:

  • rollout 接续度:模型是否在「接着已有风格」
  • rollout 听觉质量:模型生成的 MIDI 本身是否好听

两个维度:

  • 接续好 + 听觉差:模型能跟 style,但风格本身差
  • 接续差 + 听觉好:模型生成了好听的 MIDI,但不是 prompt 的延续
  • 接续好 + 听觉好:最佳
  • 接续差 + 听觉差:明显失败

DPO 训练的偏好:

  • continuation 接续度
  • 「接得好」vs「接得差」
  • 这是 chosen vs rejected 的核心区别

为什么 DPO 主要用前者:

  • isolated 听觉质量 = 数据质量的事
  • continuation 接续度 = 模型的事
  • DPO 训的是「模型」
  • 不是训数据

一人工程的精细化

不是「一个分数」。 是「多个维度」。

OpenAI RLHF:

  • 一个 reward model
  • 一个标量分数
  • 训练 PPO 拟合 reward

simedw DPO:

  • continuation 偏好对
  • chosen vs rejected
  • 训练 DPO 拟合偏好

精细化不同:

  • OpenAI:标量 + 拟合
  • simedw:拆维度 + 偏好

签名:solus opus。