一人工程 · solus opus

← 全部作品

一人工程AI 音乐simedw数据清洗堆量表征哲学

simedw 数据清洗胜过堆量:试过 5× data → 模型更差

Simedw 试过 5 倍数据 → 模型更差。数据清洗胜过堆量。清洗 5 步:选钢琴主导 + 砍多轨病理 + 按密度/音域/时间筛选 + 指纹去重 + 同曲归 split。Solo engineer 哲学 = 清洗 > 堆量 = 表征 > 优化。

simedw 数据清洗胜过堆量详细:

simedw 试过 5 倍数据 → 模型更差。

5× data 实验

simedw 数据集:

  • 几十万个 MIDI 文件
  • 约 300M note events
  • 钢琴主导(已清洗)

5× data 实验:

  • 1× data = 300M notes(simedw 默认)
  • 5× data = 1.5B notes(加未清洗数据)
  • 比较 1× vs 5× 偏好率

3 个实验条件。

5× data 实验结果:

  • 偏好率更差(5× vs 1×)
  • 5× data 模型更差

2 个实验结果。

5× data 模型更差 = simedw 不增加数据,回到清洗。

5× data 为什么更差

5× data 为什么更差:

  • 加了未清洗数据(多轨病理混录 / 全局移调 / 等比 tempo 变奏)
  • 未清洗数据噪声多
  • 模型被噪声数据带偏
  • 偏好率下降

4 个原因。

simedw 重新理解数据:

  • 数据多 ≠ 模型好
  • 数据多 + 数据清洗差 = 模型差
  • 数据少 + 数据清洗好 = 模型好
  • 清洗胜过堆量

4 个理解。

simedw 数据清洗 5 步

simedw 数据清洗 5 步:

  1. 选钢琴主导:保留钢琴 MIDI,砍掉非钢琴
  2. 砍多轨病理混录:去除多轨 + 病理录音
  3. 按密度/音域/时间覆盖筛:保留合理 MIDI
  4. 指纹去重:忽略全局移调 + 等比 tempo 去重
  5. 同曲不同版本归到同一 split:避免 data leakage

5 个清洗步骤。

清洗 vs 堆量

数据清洗 vs 堆量:

  • 清洗 5 步 = 300M notes
  • 堆量 1× = 300M notes
  • 堆量 5× = 1.5B notes
  • 清洗 > 1× 堆量
  • 清洗 > 5× 堆量

5 个对照 = 清洗胜出。

跟大公司数据哲学的对照

大公司 AI 数据哲学:

  • 数据越多越好(爬更多 web)
  • 不重视清洗(粗清洗)
  • 模型容量够大,垃圾进垃圾出也能学
  • 数据量是核心

simedw 数据哲学:

  • 数据清洗比堆量重要
  • 重视清洗(5 步清洗)
  • 模型容量小(125M),垃圾进垃圾出失败
  • 数据质量是核心

4 个对照。

一人工程的数据哲学

solo engineer 数据哲学:

  • 数据清洗 > 数据堆量
  • 5 步清洗(钢琴主导 + 砍多轨 + 密度筛选 + 指纹去重 + 同曲归 split)
  • 模型容量小 → 数据质量更重要
  • 表征 > 优化 = 数据清洗 > 数据堆量

4 个事实 = solo engineer 数据哲学。

一人工程的数据哲学总结

solo engineer 数据哲学:

  • 5× data 失败
  • 清洗 5 步成功
  • 清洗 > 堆量
  • 表征 > 优化 = 清洗 > 堆量

4 个事实 = solo engineer 数据哲学的全部。

simedw 数据 = 300M piano-only + 5 步清洗 + 试过 5× 失败 = 一人工程数据哲学的全部。


这是 49+ 篇散文的数据篇。Simedw 试过 5× data → 模型更差 → 回到清洗 = 5 步清洗(钢琴主导 + 砍多轨 + 密度筛选 + 指纹去重 + 同曲归 split)= 清洗 > 堆量 = 一人工程数据哲学的全部。