一人工程 · solus opus

← 全部作品

essay一人工程评估MIDIprompt

Prompt 长度不是越长越好

simedw 的 rollout 评估曲线:4-note prompt 最难,8-note 还行,16-32 显著靠谱。Prompt 短反而是更难的不是更简单的。

Prompt 长度不是越长越好

simedw 的 rollout 评估曲线:

  • 4-note prompt:最难
  • 8-note prompt:还行
  • 16-note prompt:显著靠谱
  • 32-note prompt:最稳

直觉反直觉:

  • prompt 长 = 给模型更多信息 = 应该更好?
  • 实际:4-note prompt 比 32-note prompt 更难

为什么?

  • 4-note 给的上下文太少

  • 模型要从很短的 seed 推断「风格 / 和声 / 节奏 / 调性」

  • 这个推断难度比「接着已有风格延续」高得多

  • 16-32 note 是「听感风格已建立」的甜蜜区

  • 模型只需要「接着已有风格」

这跟 LLM 评估曲线类似:

  • 短 prompt = 难度高
  • 中长 prompt = 模型发挥稳定
  • 超长 prompt = 模型开始重复 prompt

DPO 在短 prompt 上优势最小:

  • 4-note 上 base vs DPO 差距小
  • 16-32 note 上 DPO 拉开差距

原因:

  • DPO 学的是「续写偏好」
  • 续写需要「已建立风格」作为前提
  • 没有风格,DPO 学的是噪声

一人工程的角度

OpenAI 训练 RLHF:

  • 评估大多在长 prompt 上
  • 短 prompt 评估信噪比差
  • RLHF 团队都知道这点

simedw 一个人:

  • 自己听 14 次实验
  • 记下 prompt 长度曲线
  • 跟 DPO 趋势对齐

这个观察如果放在 RLHF 圈子里也能 publish:

「DPO 在 prompt < 8 token 时表现不显著」

签名:solus opus。