essay一人工程DPO偏好MIDI
DPO β=0.03 是甜蜜点
simedw 的 DPO 实验:β=0.01 偏好 61.08%,β=0.03 偏好 57.14%,β=0.10 退到 38.10%。共识样本下 β=0.03 升到 69.05%。β 太大反而破坏模型。
DPO β=0.03 是甜蜜点
simedw 的 DPO 实验:
- base: 24.55%
- β=0.01: 61.08%
- β=0.03: 57.14%
- β=0.10: 38.10%
- consensus(β=0.03): 69.05%
β 是 DPO 训练里的正则强度。 β 小:直接学人类偏好。 β 大:被原模型约束,不偏走。
直觉:
- β 太低:模型被偏好牵着鼻子走,rollout 会跑偏
- β 太高:偏好信号被原模型「锁死」,DPO 失效
simedw 试出来的甜蜜点:β=0.03。
但:
- 单样本 DPO 评估噪声大
- 多个评估者一致的样本(consensus)效果更稳
- consensus(β=0.03) → 69.05% 偏好
一人工程的角度
DPO 是 LLM 训练领域的研究热点。 在钢琴 MIDI 续写上 DPO 有用吗? simedw 试了 14 次实验之一,结果 β=0.03 + consensus 提升 69.05% 偏好。
OpenAI 的 RLHF 团队:
- 几百研究员
- 几千万美元训练成本
- 几万条偏好对
- 评估用 pairwise 模型 + reward model
simedw 一个人:
- 半年
- 几千条偏好对(足够 DPO 起步)
- Gemini pairwise 做评估(买现成的)
- 结论跟 OpenAI 类似
结论:
β 小一点,DPO 起步。 β 大一点,DPO 失效。 甜蜜点在 0.01-0.05 之间。
签名:solus opus。