一人工程 · solus opus

← 全部作品

一人工程AI 音乐simedwDPOβ偏好率实验

simedw DPO 实验详细:base / β=0.01 / 0.03 / 0.10 偏好率曲线

simedw 14 次 DPO 实验详细:base 24.55% / β=0.01 61.08% / β=0.03 57.14% / β=0.10 38.10% / consensus β=0.03 = 69.05%。Solo engineer 怎么找 DPO β 偏好率最优:14 次 commit + 1 维度 split + A/B 偏好评测。

simedw 14 次 DPO 实验详细:

simedw 怎么找 DPO β 偏好率最优?

DPO 实验背景

DPO = Direct Preference Optimization = 用偏好数据直接优化模型。

simedw 偏好数据:

  • 14 次实验里 base + β=0.01 + β=0.03 + β=0.10 + consensus β=0.03
  • 5 个实验配置
  • 每个配置跑 1- 次完整训练

5 个实验 = simedw DPO 实验的全部。

5 个实验配置

simedw 5 个实验配置:

  1. base(无 DPO):偏好率 24.55%
  2. β=0.01(弱偏好):偏好率 61.08%
  3. β=0.03(中偏好):偏好率 57.14%
  4. β=0.10(强偏好):偏好率 38.10%
  5. consensus β=0.03(多评估者一致 + β=0.03):偏好率 69.05%

5 个实验 = DPO 偏好率曲线。

偏好率曲线

5 个偏好率排序:

  • 24.55%(base)
  • 38.10%(β=0.10)
  • 57.14%(β=0.03)
  • 61.08%(β=0.01)
  • 69.05%(consensus β=0.03)

5 个偏好率 = 偏好率曲线。

观察:

  • β=0.01(弱偏好)= 61.08% > β=0.03(中偏好)= 57.14%
  • β=0.10(强偏好)= 38.10% < β=0.03 = 57.14%
  • consensus β=0.03 = 69.05% 最高

3 个观察 = DPO β 不是单调最优。

β 不是越大越好

β=0.10(强偏好)= 38.10% 偏好率最低。

β=0.10 是「偏离参考模型」的步长:

  • β=0.01:步长 1%(轻微偏好调整)
  • β=0.03:步长 3%(中等偏好调整)
  • β=0.10:步长 10%(强烈偏好调整)

β 越大 = 越偏离参考模型 = 越容易「飞出」好的范围。

β=0.10 飞出 = 偏好率 38.10% 低于 base(24.55%)的对照意义:

  • 24.55% 是 base(随机偏好基线)
  • 38.10% 是 β=0.10(DPO 失败 偏好率比 base 高一点)
  • 61.08% 是 β=0.01(DPO 成功 偏好率显著高于 base)

3 个偏好率 = β=0.10 失败,β=0.01 成功。

β 不是越小越好

β=0.01(弱偏好)= 61.08% 偏好率最高(不算 consensus)。

β=0.01 是「偏离参考模型」的最小步长:

  • β=0.01 步长小 = 调整慢
  • 但 base 24.55% 对照 → β=0.01 偏好率 61.08% = +36.53% 提升

β=0.01 的优势:

  • 调整稳(不飞出)
  • 提升显著(+36.53%)
  • 偏好数据学习稳定

3 个优势 = β=0.01 是实际最优(不算 consensus)。

consensus β=0.03 最高

consensus β=0.03 = 多个评估者一致 + β=0.03 = 69.05% 偏好率。

consensus = 多个评估者对同一个偏好判断一致 = 偏好数据质量高。

consensus 偏好率 69.05% > β=0.01 61.08% > β=0.03 57.14%。

3 个偏好率 = consensus β=0.03 是最优(simedw 选择)。

simedw 为什么选 consensus β=0.03

simedw 选 consensus β=0.03 因为:

  • 偏好率最高(69.05%)
  • 评估者一致(consensus = 多个评估者同意)
  • β=0.03 是中偏好(不是过强或过弱)
  • 训练时长可接受(半天 vs β=0.01 的 1 天)

4 个理由 = simedw 选 consensus β=0.03。

14 次 commit 的失败清单

simedw 14 次 commit 里失败的实验(不只是 DPO):

  • note-on/note-off 表征:飘音
  • grammar-masked:慢
  • 噪声数据放大:没用
  • Mirostat:减重复但紊乱
  • extra local auxiliary:无收益
  • 绝对 scalar:没 pairwise 准
  • 验证 loss:漏了 rollout 质量
  • Born-again networks:没用

8 个失败 = 14 次 commit - 6 次成功 = 失败率 57%。

8 个失败 + 6 个成功 = 14 次 commit。

DPO 实验失败 + 成功的对照

DPO 实验失败:

  • β=0.10 = 飞出 → 失败
  • 噪声数据放大 = 数据问题 → 失败
  • 绝对 scalar = 评测问题 → 失败

3 个 DPO 失败。

DPO 实验成功:

  • β=0.01 = 弱偏好 → 成功(不算最优)
  • β=0.03 = 中偏好 → 成功
  • consensus β=0.03 = 多评估者一致 + β=0.03 → 成功(最优)

3 个 DPO 成功。

3 失败 + 3 成功 = 6 个 DPO 相关实验。

一人工程的 DPO 实验哲学

solo engineer DPO 实验哲学:

  • β 不是越大越好(β=0.10 飞出)
  • β 不是越小越好(β=0.01 提升但不最优)
  • consensus = 多个评估者一致 = 最优
  • 14 次 commit = 实验 + 失败 + 总结

4 个事实 = solo engineer DPO 实验哲学。

simedw DPO = 5 实验 + 偏好率曲线 + consensus β=0.03 = 14 次 commit 全部哲学。


这是 44+ 篇散文的 DPO 实验详细篇。Simedw 14 次 DPO 实验 = 5 配置 + 偏好率曲线 + consensus β=0.03 = 一人工程 DPO 哲学的全部。