一人工程 · solus opus

← 全部作品

一人工程AI 音乐simedw模型尺寸17M64M125MiOS

simedw 模型尺寸哲学:17M / 64M / 125M 三档

Simedw 33M / 64M / 125M 三档(注:实际可能接近 17M)。Medium 几乎总赢 small,large 略胜 medium 不惊艳。当前把 64M 压到接近 125M 质量以适配 iOS。Solo engineer 模型尺寸哲学 = iOS 部署优先 + medium 最优。

simedw 模型尺寸哲学详细:

simedw 17M / 64M / 125M 三档对比。

三档模型尺寸

simedw 模型三档:

  • small:17M(注:simedw 笔记写 33M,但可能是 smaller 版本)
  • medium:64M
  • large:125M

3 档模型尺寸。

simedw 评测三档:

  • small 17M:基础能力,偏好率基线
  • medium 64M:质量显著提升
  • large 125M:略胜 medium

3 档评测。

medium 几乎总赢 small

medium(64M)几乎总赢 small(17M):

  • 续写接续度:medium 显著优
  • 听觉质量:medium 显著优
  • 风格一致:medium 显著优

3 个 medium 优势。

medium > small 是常规预期,但 simedw 发现:

  • 收益差距比预期大(64M 显著优于 17M,不是 5% 差距,是 30%+ 差距)
  • small 难以 beat(17M 没法替代 64M)

2 个 simedw medium > small 发现。

large 略胜 medium 不惊艳

large(125M)略胜 medium(64M):

  • 续写接续度:large 略胜
  • 听觉质量:large 略胜
  • 风格一致:large 不明显

3 个 large vs medium 对照。

large 略胜 = 不惊艳。simedw 发现:

  • 125M 比 64M 提升不显著
  • 边际收益下降
  • 训练时长翻倍(125M 训练时长 vs 64M)
  • iOS 部署困难(125M FP32 = 500MB,INT8 = 125MB)

4 个 large 不惊艳原因。

simedw 当前策略

simedw 当前策略:

  • 默认训练 64M(medium)
  • 64M 压到接近 125M 质量(用架构优化、数据训练)
  • 不直接训练 125M(边际收益低 + 部署难)

3 个 simedw 策略。

64M 压到接近 125M 质量的方法:

  • 长上下文训练(512 notes 上限)
  • Scheduled sampling(rollout 质量提升)
  • DPO 偏好训练(consensus β=0.03 = 69.05%)
  • 数据清洗(300M piano-only)

4 个 64M 优化方法。

模型尺寸 vs 部署约束

模型尺寸 vs 部署约束:

  • 17M 模型:iOS 部署容易(17MB INT8),但质量差
  • 64M 模型:iOS 部署可接受(64MB INT8),质量好
  • 125M 模型:iOS 部署难(125MB INT8),质量略胜

3 个尺寸部署约束。

simedw 选 64M:质量好 + 部署可接受。

模型尺寸 vs 训练时长

模型尺寸 vs 训练时长:

  • 17M 模型:训练 1-2 小时
  • 64M 模型:训练半天(4-6 小时)
  • 125M 模型:训练 1-2 天

3 个尺寸训练时长。

simedw 训练时长哲学:

  • 半天训练可接受(64M)
  • 1-2 天训练太长(125M)
  • 1-2 小时训练太短(17M 质量不够)

3 个 simedw 训练时长哲学。

模型尺寸 vs 数据量

模型尺寸 vs 数据量:

  • 17M 模型 + 300M notes:过拟合
  • 64M 模型 + 300M notes:合适
  • 125M 模型 + 300M notes:可能欠拟合

3 个尺寸数据对照。

simedw 没扩数据(5×data 失败)+ 64M + 300M notes 是合适的。

一人工程的模型尺寸哲学

solo engineer 模型尺寸哲学:

  • medium 几乎总赢 small(64M > 17M)
  • large 不显著胜 medium(125M 略胜)
  • 模型尺寸受部署约束(iOS 部署可接受 = 64M)
  • 模型尺寸受训练时长约束(半天 = 64M)

4 个事实 = solo engineer 模型尺寸哲学。

一人工程的模型尺寸哲学总结

solo engineer 模型尺寸哲学:

  • 17M:太小,过拟合
  • 64M:合适,medium 默认
  • 125M:太大,部署难
  • 大模型 ≠ 更好(125M 略胜 64M)

4 个事实 = solo engineer 模型尺寸哲学的全部。

simedw 模型尺寸 = 64M medium 默认 + 优化到接近 125M 质量 + iOS 部署优先 = 一人工程模型尺寸哲学的全部。


这是 51+ 篇散文模型尺寸篇。Simedw 17M / 64M / 125M 三档对照 = medium 几乎总赢 small + large 略胜 medium 不惊艳 + 64M 优化到接近 125M = 一人工程模型尺寸哲学的全部。