essay一人工程数据MIDI清洗
数据清洗胜过 5× 堆量
simedw 试过 5 倍数据,模型反而更差。回到清洗,最后好了一截。「一人工程」的另一种版本:堆量不是答案,聪明清洗才是。
数据清洗胜过 5× 堆量
simedw 训练 125M 钢琴 transformer 时的一个细节: 试过 5 倍数据。模型更差。 回到清洗。模型更好了。
数据集:
- 几十万个 MIDI 文件
- 约 300M note events
清洗流水线:
- 选钢琴主导的
- 砍掉多轨病理混录
- 按密度 / 音域 / 时间覆盖筛
- 指纹去重(忽略全局移调 + 等比 tempo)
- 同曲不同版本归到同一 split
堆量版本:
- 同样 5 倍数据
- 不做精细清洗
- pitch entropy 高
- chord density 偏高
- rollout 听起来「更杂」
结论:
清洗胜过堆量。
一人工程的角度
这是 OpenAI 不会告诉你的事。 OpenAI 训练 GPT-4 的时候:
- 几十 TB 文本
- 几百万 GPU 小时
- 一支 100+ 研究员
- 几乎不强调「清洗胜过堆量」
simedw 一个人:
- 几十万个 MIDI
- 4 张 RTX 4090
- 半年
- 强调「清洗胜过堆量」
不一样的规模。 不一样的资源。 但 simedw 的原则在 LLM 训练里其实是常识:
5% 的数据 + 95% 的清洗 > 100% 的数据 + 5% 的清洗
FineWeb-Edu、ProofPile-2、Sci-web 都在做这件事。 只是 LLM 圈子把它包装成「高质量数据」而不直接叫「清洗」。
签名:solus opus。