一人工程 · solus opus

← 全部作品

essay一人工程评估自动指标MIDI

自动指标抓不出钢琴最佳模型

simedw 的评估笔记:自动指标(重复 pitch n-gram / pitch entropy / chord density / 长停顿)只能抓明显失败,挑不出最佳模型。人耳闭环是必要的。

自动指标抓不出钢琴最佳模型

simedw 的评估笔记: 自动指标只能抓明显失败。 挑不出最佳模型。

LLM 评估的传统方法:

  • BLEU / ROUGE / METEOR / chrF
  • 自动计算
  • 标量输出
  • 排行榜

simedw 用的自动指标:

  • 重复 pitch n-gram
  • pitch entropy
  • chord density
  • 长停顿

这些指标做什么:

  • 重复 n-gram:抓「模型卡死 / 重复 100 次同一音」
  • pitch entropy:抓「模型只用 3 个音」
  • chord density:抓「模型不用和弦」
  • 长停顿:抓「模型卡在长音」

这些都抓什么:

  • 明显失败
  • rollout 听起来是噪音的版本

抓不出什么:

  • 哪个是「最佳模型」
  • A 模型 64.3% 偏好 vs B 模型 35.7% 偏好
  • 自动指标几乎相同

直觉:

  • 自动指标是 surrogate
  • 应该跟目标对齐
  • 对齐后能用

实际:

  • 自动指标 ≠ rollout 质量
  • 两个 rollout 听起来差很多
  • 自动指标几乎相同

simedw 的选择:

  • 自动指标淘汰明显失败
  • 人耳挑最佳模型
  • Gemini 3.5 Flash pairwise 加 confirm

一人工程的角度

不是「让自动指标越准越好」。 是「让自动指标 + 人耳闭环」配合。

自动指标:

  • 快速淘汰
  • 不用每轮听

人耳闭环:

  • 慢但准
  • 区分「最佳」vs「次佳」

LLM 训练圈的做法:

  • 标几万对偏好
  • 训 reward model
  • 用 reward model 闭环
  • 不用人听

simedw 的做法:

  • 不标几万对
  • 训 reward model 太重
  • 买 Gemini 3.5 Flash pairwise
  • 偶尔人耳

规模不同,方法相同:

  • 自动指标筛
  • pairwise 选
  • 人耳 confirm

签名:solus opus。