一人工程 · solus opus

← 全部作品

essay一人工程DPO偏好MIDI

DPO β=0.03 是甜蜜点

simedw 的 DPO 实验:β=0.01 偏好 61.08%,β=0.03 偏好 57.14%,β=0.10 退到 38.10%。共识样本下 β=0.03 升到 69.05%。β 太大反而破坏模型。

DPO β=0.03 是甜蜜点

simedw 的 DPO 实验:

  • base: 24.55%
  • β=0.01: 61.08%
  • β=0.03: 57.14%
  • β=0.10: 38.10%
  • consensus(β=0.03): 69.05%

β 是 DPO 训练里的正则强度。 β 小:直接学人类偏好。 β 大:被原模型约束,不偏走。

直觉:

  • β 太低:模型被偏好牵着鼻子走,rollout 会跑偏
  • β 太高:偏好信号被原模型「锁死」,DPO 失效

simedw 试出来的甜蜜点:β=0.03。

但:

  • 单样本 DPO 评估噪声大
  • 多个评估者一致的样本(consensus)效果更稳
  • consensus(β=0.03) → 69.05% 偏好

一人工程的角度

DPO 是 LLM 训练领域的研究热点。 在钢琴 MIDI 续写上 DPO 有用吗? simedw 试了 14 次实验之一,结果 β=0.03 + consensus 提升 69.05% 偏好。

OpenAI 的 RLHF 团队:

  • 几百研究员
  • 几千万美元训练成本
  • 几万条偏好对
  • 评估用 pairwise 模型 + reward model

simedw 一个人:

  • 半年
  • 几千条偏好对(足够 DPO 起步)
  • Gemini pairwise 做评估(买现成的)
  • 结论跟 OpenAI 类似

结论:

β 小一点,DPO 起步。 β 大一点,DPO 失效。 甜蜜点在 0.01-0.05 之间。

签名:solus opus。