一人工程 · solus opus

← 全部作品

essay一人工程MLscheduled-sampling钢琴

scheduled sampling:loss 升高但更好听

simedw 的 14 次实验之一:scheduled sampling 让验证 loss 升高,但 Gemini pairwise 偏好 64.3% vs 35.7%。loss 不是目标,听感才是。

scheduled sampling:loss 升高但更好听

simedw 训练笔记: scheduled sampling 50% 概率用模型预测的 pitch 作为后续字段输入。 验证 loss 上升。 rollout 质量变好。 Gemini pairwise 偏好 64.3% vs 35.7%。

传统训练:

  • teacher forcing
  • 模型永远看到「真实过去」
  • 验证 loss 是 surrogate 指标

scheduled sampling:

  • 训练时 50% 用真实,50% 用模型预测
  • 模拟「自己跟自己对话」的 rollout 模式
  • 验证 loss 升高(因为分布变了)
  • 但 rollout 时更好

直觉的反转:

loss 不是目标,听感才是目标。

一人工程的版本

  • 一个人 + 14 次实验 + 半年
  • 不读太多论文
  • 先做自己的事再比对文献
  • 验证 loss 漏了 rollout 质量(他自己的总结)

OpenAI 的 GPT-4 训练:

  • 几千 GPU 年
  • 几百研究员
  • 用 RLHF 把 loss 跟 rollout 解耦
  • 但路径比 simedw 长得多

simedw 用 scheduled sampling 一个人做了 RLHF 80% 的活。

剩下 20% 是 100+ 研究员的活。 但 simedw 不需要那 20%。 他只需要一个人能用的 piano 续写。

签名:solus opus。