一人工程 · solus opus

← 全部作品

essay一人工程数据MIDI清洗

数据清洗胜过 5× 堆量

simedw 试过 5 倍数据,模型反而更差。回到清洗,最后好了一截。「一人工程」的另一种版本:堆量不是答案,聪明清洗才是。

数据清洗胜过 5× 堆量

simedw 训练 125M 钢琴 transformer 时的一个细节: 试过 5 倍数据。模型更差。 回到清洗。模型更好了。

数据集:

  • 几十万个 MIDI 文件
  • 约 300M note events

清洗流水线:

  • 选钢琴主导的
  • 砍掉多轨病理混录
  • 按密度 / 音域 / 时间覆盖筛
  • 指纹去重(忽略全局移调 + 等比 tempo)
  • 同曲不同版本归到同一 split

堆量版本:

  • 同样 5 倍数据
  • 不做精细清洗
  • pitch entropy 高
  • chord density 偏高
  • rollout 听起来「更杂」

结论:

清洗胜过堆量。

一人工程的角度

这是 OpenAI 不会告诉你的事。 OpenAI 训练 GPT-4 的时候:

  • 几十 TB 文本
  • 几百万 GPU 小时
  • 一支 100+ 研究员
  • 几乎不强调「清洗胜过堆量」

simedw 一个人:

  • 几十万个 MIDI
  • 4 张 RTX 4090
  • 半年
  • 强调「清洗胜过堆量」

不一样的规模。 不一样的资源。 但 simedw 的原则在 LLM 训练里其实是常识:

5% 的数据 + 95% 的清洗 > 100% 的数据 + 5% 的清洗

FineWeb-Edu、ProofPile-2、Sci-web 都在做这件事。 只是 LLM 圈子把它包装成「高质量数据」而不直接叫「清洗」。

签名:solus opus。