一人工程 · solus opus

← 全部作品

一人工程AI 音乐洞穴人格式isoprophlexsimedwDPO训练

man trains thing thing train model

洞穴人格式第三篇。plink 是领域、note 是表示、training 是方法。三层抽象对应 AI 音乐的三个层级:领域、表示、方法。simedw 14 次 DPO 实验走的就是方法层。

第一篇 plink 是「man hits thing thing go plink」——AI 音乐整个领域的通用代词。

第二篇 note 是「man says thing thing say note」——symbolic 层精确代词。

第三篇 training 是「man trains thing thing train model」——训练视角。

simedw 的 14 次 DPO 实验

simedw 在 GitHub README 和 blog 记录了 14 次 DPO 训练实验。每次换 β:0.005 / 0.01 / 0.03 / 0.10。

β=0.03 偏好率 57.14%。β=0.10 偏好率 38.10%。β=0.03 内部 consensus 达 69.05%。

不是 β 越大越好,也不是越小越好。β 是「偏离参考模型」的步长:太小不动,太大飞了。0.03 是 simedw 实验找到的局部最优。

故意没读论文

simedw 在 comment 里写「deliberately 没读太多论文,先做自己的事再比对文献」。

这是「先做后读」哲学:不要被研究范式套住,不要被论文 framing 锁住,自己做出来再说。

OpenAI / Google / Anthropic 的研究员必须读最新论文——reputation 在 peer review,实验设计必须守规范。

一人工程不需要守规范。先做再说。simedw 最后用 GitHub Copilot 类比钢琴补全——「GPT-2 but for piano」。这是他自己的 framing,不是 Stanford CRFM 的 Anticipatory Music Transformer framing,不是任何论文的 framing。

训练失败清单

simedw 训练 14 次,记录了 8 个明确失败:

  • note-on/note-off 表征:飘音
  • grammar-masked:慢
  • 噪声数据放大:没用
  • Mirostat:减重复但紊乱
  • extra local auxiliary:无收益
  • 绝对 scalar:没 pairwise 准
  • 验证 loss:漏了 rollout 质量
  • Born-again networks:没用

这是 8 个明确的失败记录。一人工程实验失败的代价是 simedw 自己承担,没人帮他擦屁股。所以他记录每个失败,避免重复。

training 是 solo 工程的核心

三人工程 = 训练团队 + 一周会议 + 模型架构 review + 数据集 review + 实验设计 review。

一人工程 = simedw 一人 + 一台机器 + 14 次 git commit + 14 次 README 更新。

训练在 solo engineer 那里不是「技术决策」,是「commit log」。每条 commit 都是一个实验决策,每条 commit 都能在 README 找到对应的失败/成功记录。

洞穴人第三个代词

plink / note / training 三层抽象:

  • plink = 抽象层 1(领域)—— AI 音乐整个领域
  • note = 抽象层 2(表示)—— symbolic 层精确代词
  • training = 抽象层 3(方法)—— 怎么训练一个 AI 模型

洞穴人用三个词描述 AI 音乐,因为 AI 音乐本身就是三层结构。少一个词,描述就缺一层。

simedw 14 次实验是在第三层(方法层)反复探索。一人工程的方法层探索靠的是 commit log + README 记录,不是 paper + peer review。


这是 isoprophlex 洞穴人格式系列的第三篇。第一篇 plink(领域)、第二篇 note(表示)、第三篇 training(方法)。三个代词对应 AI 音乐的三个抽象层。simedw 的 14 次实验就是方法层探索的全部记录。