simedw DPO 实验详细:base / β=0.01 / 0.03 / 0.10 偏好率曲线
simedw 14 次 DPO 实验详细:base 24.55% / β=0.01 61.08% / β=0.03 57.14% / β=0.10 38.10% / consensus β=0.03 = 69.05%。Solo engineer 怎么找 DPO β 偏好率最优:14 次 commit + 1 维度 split + A/B 偏好评测。
simedw 14 次 DPO 实验详细:
simedw 怎么找 DPO β 偏好率最优?
DPO 实验背景
DPO = Direct Preference Optimization = 用偏好数据直接优化模型。
simedw 偏好数据:
- 14 次实验里 base + β=0.01 + β=0.03 + β=0.10 + consensus β=0.03
- 5 个实验配置
- 每个配置跑 1- 次完整训练
5 个实验 = simedw DPO 实验的全部。
5 个实验配置
simedw 5 个实验配置:
- base(无 DPO):偏好率 24.55%
- β=0.01(弱偏好):偏好率 61.08%
- β=0.03(中偏好):偏好率 57.14%
- β=0.10(强偏好):偏好率 38.10%
- consensus β=0.03(多评估者一致 + β=0.03):偏好率 69.05%
5 个实验 = DPO 偏好率曲线。
偏好率曲线
5 个偏好率排序:
- 24.55%(base)
- 38.10%(β=0.10)
- 57.14%(β=0.03)
- 61.08%(β=0.01)
- 69.05%(consensus β=0.03)
5 个偏好率 = 偏好率曲线。
观察:
- β=0.01(弱偏好)= 61.08% > β=0.03(中偏好)= 57.14%
- β=0.10(强偏好)= 38.10% < β=0.03 = 57.14%
- consensus β=0.03 = 69.05% 最高
3 个观察 = DPO β 不是单调最优。
β 不是越大越好
β=0.10(强偏好)= 38.10% 偏好率最低。
β=0.10 是「偏离参考模型」的步长:
- β=0.01:步长 1%(轻微偏好调整)
- β=0.03:步长 3%(中等偏好调整)
- β=0.10:步长 10%(强烈偏好调整)
β 越大 = 越偏离参考模型 = 越容易「飞出」好的范围。
β=0.10 飞出 = 偏好率 38.10% 低于 base(24.55%)的对照意义:
- 24.55% 是 base(随机偏好基线)
- 38.10% 是 β=0.10(DPO 失败 偏好率比 base 高一点)
- 61.08% 是 β=0.01(DPO 成功 偏好率显著高于 base)
3 个偏好率 = β=0.10 失败,β=0.01 成功。
β 不是越小越好
β=0.01(弱偏好)= 61.08% 偏好率最高(不算 consensus)。
β=0.01 是「偏离参考模型」的最小步长:
- β=0.01 步长小 = 调整慢
- 但 base 24.55% 对照 → β=0.01 偏好率 61.08% = +36.53% 提升
β=0.01 的优势:
- 调整稳(不飞出)
- 提升显著(+36.53%)
- 偏好数据学习稳定
3 个优势 = β=0.01 是实际最优(不算 consensus)。
consensus β=0.03 最高
consensus β=0.03 = 多个评估者一致 + β=0.03 = 69.05% 偏好率。
consensus = 多个评估者对同一个偏好判断一致 = 偏好数据质量高。
consensus 偏好率 69.05% > β=0.01 61.08% > β=0.03 57.14%。
3 个偏好率 = consensus β=0.03 是最优(simedw 选择)。
simedw 为什么选 consensus β=0.03
simedw 选 consensus β=0.03 因为:
- 偏好率最高(69.05%)
- 评估者一致(consensus = 多个评估者同意)
- β=0.03 是中偏好(不是过强或过弱)
- 训练时长可接受(半天 vs β=0.01 的 1 天)
4 个理由 = simedw 选 consensus β=0.03。
14 次 commit 的失败清单
simedw 14 次 commit 里失败的实验(不只是 DPO):
- note-on/note-off 表征:飘音
- grammar-masked:慢
- 噪声数据放大:没用
- Mirostat:减重复但紊乱
- extra local auxiliary:无收益
- 绝对 scalar:没 pairwise 准
- 验证 loss:漏了 rollout 质量
- Born-again networks:没用
8 个失败 = 14 次 commit - 6 次成功 = 失败率 57%。
8 个失败 + 6 个成功 = 14 次 commit。
DPO 实验失败 + 成功的对照
DPO 实验失败:
- β=0.10 = 飞出 → 失败
- 噪声数据放大 = 数据问题 → 失败
- 绝对 scalar = 评测问题 → 失败
3 个 DPO 失败。
DPO 实验成功:
- β=0.01 = 弱偏好 → 成功(不算最优)
- β=0.03 = 中偏好 → 成功
- consensus β=0.03 = 多评估者一致 + β=0.03 → 成功(最优)
3 个 DPO 成功。
3 失败 + 3 成功 = 6 个 DPO 相关实验。
一人工程的 DPO 实验哲学
solo engineer DPO 实验哲学:
- β 不是越大越好(β=0.10 飞出)
- β 不是越小越好(β=0.01 提升但不最优)
- consensus = 多个评估者一致 = 最优
- 14 次 commit = 实验 + 失败 + 总结
4 个事实 = solo engineer DPO 实验哲学。
simedw DPO = 5 实验 + 偏好率曲线 + consensus β=0.03 = 14 次 commit 全部哲学。
这是 44+ 篇散文的 DPO 实验详细篇。Simedw 14 次 DPO 实验 = 5 配置 + 偏好率曲线 + consensus β=0.03 = 一人工程 DPO 哲学的全部。