一人工程 · solus opus

← 全部作品

一人工程AI 音乐simedwscheduled samplinglossrollout验证

simedw scheduled sampling 50%:验证 loss 上升但 rollout 质量变好

Simedw scheduled sampling 实验:50% 概率用模型预测的 pitch 作为后续字段输入。验证 loss 上升但 rollout 质量变好。Gemini pairwise 偏好 64.3% vs 35.7%。Solo engineer 怎么理解验证 loss vs rollout 质量悖论。

simedw scheduled sampling 50% 实验详细:

simedw 14 次实验里最反直觉的一次。

scheduled sampling 是什么

scheduled sampling = 训练时按概率用模型预测的 token 作为后续字段输入(替代 ground truth)。

传统训练:

  • 100% 用 ground truth
  • 模型只看「正确答案」
  • 不接触自己预测的 token

scheduled sampling:

  • 50% 概率用模型预测
  • 50% 概率用 ground truth
  • 模型在训练时就接触自己预测的 token
  • 减少 train-test mismatch

2 个对照。

simedw 用 50% 概率(不是 100% scheduled sampling)。

simedw scheduled sampling 实验结果

simedw scheduled sampling 实验结果:

  • 验证 loss 上升(比 100% ground truth 训练差)
  • rollout 质量变好(比 100% ground truth 训练好)
  • Gemini pairwise 偏好 64.3% vs 35.7%

3 个实验结果。

验证 loss 上升 = simedw 不应该选 scheduled sampling(按验证 loss 选)。

但 Gemini pairwise 64.3% 偏好率 = simedw 应该选 scheduled sampling(按 Gemini pairwise 选)。

验证 loss vs rollout 质量悖论

验证 loss 上升 + rollout 质量变好 = 悖论。

按验证 loss 选:

  • 100% ground truth(验证 loss 低)
  • 0% scheduled sampling(验证 loss 最低)
  • 不选 scheduled sampling

按 rollout 质量选:

  • 50% scheduled sampling
  • rollout 质量好(Gemini pairwise 64.3%)
  • 选 scheduled sampling

2 个选择冲突 = 悖论。

悖论的解释

悖论的解释:

  • 验证 loss 抓「逐 token 准确度」
  • rollout 抓「完整序列质量」
  • 逐 token 准确度高 ≠ 完整序列质量好
  • scheduled sampling 牺牲逐 token 准确度,换取完整序列质量

4 个解释。

simedw 为什么选 rollout 质量

simedw 选 rollout 质量作为评测标准,因为:

  • 最终用户用 rollout 听(不逐 token 检查)
  • 完整序列质量 = 用户体验
  • 逐 token 准确度 = 模型内部指标,不是用户指标

3 个理由 = simedw 选 rollout 质量。

跟 DPO 实验的对照

DPO 实验:

  • DPO 偏好率高 = 选 DPO(不按验证 loss 选)
  • consensus β=0.03 = 69.05%

scheduled sampling 实验:

  • rollout 质量好 = 选 scheduled sampling(不按验证 loss 选)
  • Gemini pairwise 64.3% vs 35.7%

2 个实验对照 = simedw 不按验证 loss 选,按偏好率选。

14 次 commit 里跟验证 loss 相关的失败

simedw 14 次 commit 里跟验证 loss 相关的失败:

  • 验证 loss 漏了 rollout 质量(simedw 自己总结)
  • 验证 loss 作为单一评测指标失败

2 个失败。

验证 loss 作为单一评测指标失败 = simedw 评测困境的一部分(与第 44 篇评测困境详细对应)。

simedw 怎么平衡验证 loss 和 rollout 质量

simedw 平衡:

  • 验证 loss 作为 sanity check(不是主要评测)
  • rollout 质量作为主要评测(Gemini pairwise + 自己听)
  • 自动指标作为辅助(重复音 + 长停顿)

3 个评测维度。

一人工程的验证 loss vs rollout 哲学

solo engineer 验证 loss vs rollout 哲学:

  • 验证 loss 抓逐 token 准确度
  • rollout 抓完整序列质量
  • 两者不一致时选 rollout
  • 验证 loss 是 sanity check,不是主要评测

4 个事实 = solo engineer 评测哲学。

一人工程的 scheduled sampling 哲学

solo engineer scheduled sampling 哲学:

  • scheduled sampling 牺牲逐 token 准确度
  • scheduled sampling 换完整序列质量
  • rollout 质量 > 验证 loss
  • 按 rollout 选 scheduled sampling

4 个事实 = solo engineer scheduled sampling 哲学。

simedw scheduled sampling = 50% 概率 + Gemini pairwise 64.3% + 选 rollout 质量 = 一人工程 scheduled sampling 哲学的全部。


这是 47+ 篇散文的 scheduled sampling 篇。Simedw 验证 loss 上升但 rollout 质量变好 = 64.3% vs 35.7% 偏好率 = 选 rollout 不选验证 loss = 一人工程 scheduled sampling 哲学的全部。