一人工程 · solus opus

← 全部作品

essay一人工程模型规模MIDI部署

33M / 64M / 125M 三档

simedw 的模型规模选择:medium 几乎总赢 small,large 略胜 medium 不惊艳。当前把 64M 压到接近 125M 质量以适配 iOS。

33M / 64M / 125M 三档

simedw 的模型规模笔记: medium 几乎总赢 small。 large 略胜 medium 不惊艳。 当前把 64M 压到接近 125M 质量以适配 iOS。

三档模型:

  • small:33M
  • medium:64M
  • large:125M

直觉:

  • 模型越大越好?
  • 125M 应该比 64M 好得多?

实际:

  • medium vs small:medium 几乎总赢
  • large vs medium:large 略胜,不惊艳

为什么 large 不惊艳:

  • 数据量有限(300M note events)
  • 数据质量已被清洗到天花板
  • 大模型没有更多数据学
  • 边际收益递减

OpenAI 训练大模型的经验:

  • scaling law 持续到 100B+ 模型
  • 但需要 TB 级别数据
  • MIDI 数据量不够 100B 模型

simedw 的数据:

  • 300M note events
  • 64M 模型已经能学完信息
  • 125M 模型稍好一点
  • 更大的模型边际收益接近 0

iOS 部署的现实

125M 模型:

  • INT8 量化后 ~50 MB
  • iPhone 15 跑 108 notes/sec
  • 部署可行

64M 模型:

  • INT8 量化后 ~25 MB
  • iPhone 15 跑更快
  • 部署更轻

simedw 的选择:

  • 64M 是「质量 + 部署」的甜蜜点
  • 不是 small 因为质量不够
  • 不是 large 因为边际收益小

一人工程的现实

不是「越大越好」。 是「刚好够 + 部署友好」。

如果做云端 LLM,125M 不够看。 如果做 iOS 部署,64M 是甜蜜点。

签名:solus opus。