一人工程AI 音乐simedw数据清洗堆量表征哲学
simedw 数据清洗胜过堆量:试过 5× data → 模型更差
Simedw 试过 5 倍数据 → 模型更差。数据清洗胜过堆量。清洗 5 步:选钢琴主导 + 砍多轨病理 + 按密度/音域/时间筛选 + 指纹去重 + 同曲归 split。Solo engineer 哲学 = 清洗 > 堆量 = 表征 > 优化。
simedw 数据清洗胜过堆量详细:
simedw 试过 5 倍数据 → 模型更差。
5× data 实验
simedw 数据集:
- 几十万个 MIDI 文件
- 约 300M note events
- 钢琴主导(已清洗)
5× data 实验:
- 1× data = 300M notes(simedw 默认)
- 5× data = 1.5B notes(加未清洗数据)
- 比较 1× vs 5× 偏好率
3 个实验条件。
5× data 实验结果:
- 偏好率更差(5× vs 1×)
- 5× data 模型更差
2 个实验结果。
5× data 模型更差 = simedw 不增加数据,回到清洗。
5× data 为什么更差
5× data 为什么更差:
- 加了未清洗数据(多轨病理混录 / 全局移调 / 等比 tempo 变奏)
- 未清洗数据噪声多
- 模型被噪声数据带偏
- 偏好率下降
4 个原因。
simedw 重新理解数据:
- 数据多 ≠ 模型好
- 数据多 + 数据清洗差 = 模型差
- 数据少 + 数据清洗好 = 模型好
- 清洗胜过堆量
4 个理解。
simedw 数据清洗 5 步
simedw 数据清洗 5 步:
- 选钢琴主导:保留钢琴 MIDI,砍掉非钢琴
- 砍多轨病理混录:去除多轨 + 病理录音
- 按密度/音域/时间覆盖筛:保留合理 MIDI
- 指纹去重:忽略全局移调 + 等比 tempo 去重
- 同曲不同版本归到同一 split:避免 data leakage
5 个清洗步骤。
清洗 vs 堆量
数据清洗 vs 堆量:
- 清洗 5 步 = 300M notes
- 堆量 1× = 300M notes
- 堆量 5× = 1.5B notes
- 清洗 > 1× 堆量
- 清洗 > 5× 堆量
5 个对照 = 清洗胜出。
跟大公司数据哲学的对照
大公司 AI 数据哲学:
- 数据越多越好(爬更多 web)
- 不重视清洗(粗清洗)
- 模型容量够大,垃圾进垃圾出也能学
- 数据量是核心
simedw 数据哲学:
- 数据清洗比堆量重要
- 重视清洗(5 步清洗)
- 模型容量小(125M),垃圾进垃圾出失败
- 数据质量是核心
4 个对照。
一人工程的数据哲学
solo engineer 数据哲学:
- 数据清洗 > 数据堆量
- 5 步清洗(钢琴主导 + 砍多轨 + 密度筛选 + 指纹去重 + 同曲归 split)
- 模型容量小 → 数据质量更重要
- 表征 > 优化 = 数据清洗 > 数据堆量
4 个事实 = solo engineer 数据哲学。
一人工程的数据哲学总结
solo engineer 数据哲学:
- 5× data 失败
- 清洗 5 步成功
- 清洗 > 堆量
- 表征 > 优化 = 清洗 > 堆量
4 个事实 = solo engineer 数据哲学的全部。
simedw 数据 = 300M piano-only + 5 步清洗 + 试过 5× 失败 = 一人工程数据哲学的全部。
这是 49+ 篇散文的数据篇。Simedw 试过 5× data → 模型更差 → 回到清洗 = 5 步清洗(钢琴主导 + 砍多轨 + 密度筛选 + 指纹去重 + 同曲归 split)= 清洗 > 堆量 = 一人工程数据哲学的全部。