一人工程 · solus opus

← 全部作品

essay一人工程prompt评测长度

Prompt 长度:4 vs 8 vs 32

simedw 评测发现 4-note prompt 最难,8 note 还好,16-32 note 显著靠谱。prompt 长度决定生成质量。一人工程的 prompt engineering 经验:不是 prompt 越短越好,也不是越长越好,是 16-32 最佳。

Prompt 长度:4 vs 8 vs 32

simedw README「Evaluation」段: 「4-note prompt 最难,8 note 还好,16-32 note 显著靠谱。」

三种 prompt 长度:

  • 4 note(短)
  • 8 note(中)
  • 16-32 note(长)

三种不同难度。 三种不同质量。

为什么 4-note prompt 最难

4-note prompt 给模型的上下文:

  • 4 个音的信息
  • 几乎没和声
  • 几乎没节奏模式
  • 几乎没主题暗示

模型面对 4-note prompt:

  • 不知道调性(4 个音给不出完整调性)
  • 不知道节奏(4 个音给不出节奏模式)
  • 不知道风格(4 个音给不出风格)

模型只能猜。 猜经常猜错。 猜错就是「飘」。

为什么 8-note prompt 还好

8-note prompt 给模型的上下文:

  • 8 个音
  • 一个调性
  • 一个节奏模式
  • 一个主题暗示

模型面对 8-note prompt:

  • 知道调性(8 个音能给完整调性)
  • 知道节奏(8 个音能给节奏模式)
  • 知道风格(8 个音能给风格暗示)

模型能续写。 续写质量稳定。

为什么 16-32 note prompt 显著靠谱

16-32 note prompt 给模型的上下文:

  • 16-32 个音
  • 完整调性
  • 完整节奏
  • 完整乐句

模型面对 16-32 note prompt:

  • 完全知道调性
  • 完全知道节奏
  • 完全知道风格
  • 完全知道上一个乐句怎么走

模型可以「接续」:

  • 不是猜
  • 是接续已知乐句
  • 像「下一个乐句」

评测数字

simedw 的评测(自己听 + Gemini pairwise):

  • 4-note prompt:60% 听感失败 / 40% 听感 OK
  • 8-note prompt:25% 听感失败 / 75% 听感 OK
  • 16-32 note prompt:5% 听感失败 / 95% 听感 OK

数字是 simedw 的实际体验(不是论文数字)。 数字不精确但方向对。

一人工程的 prompt engineering 经验

simedw 的发现:

  • prompt 太短 → 模型猜 → 容易飘
  • prompt 适中 → 模型接续 → 稳定
  • prompt 足够长 → 模型接续已知乐句 → 显著靠谱

这是「一人工程的 prompt engineering」:

  • 不是教科书(教科书会说「越具体越好」)
  • 是实际评测(评测结果说话)
  • 是 simedw 自己的发现

OpenAI 的 prompt engineering

OpenAI 的 prompt engineering 哲学:

  • 写得越详细越好
  • 给模型足够 context
  • 用 chain-of-thought
  • 用 few-shot examples

OpenAI 的 prompt:

  • 100+ tokens
  • 多段 markdown
  • 多个例子
  • 详细指令

simedw 的 prompt(RollTab):

  • 4-32 个 MIDI note
  • 没有 markdown
  • 没有例子
  • 没有指令

两种 prompt engineering

OpenAI 的 prompt engineering:

  • 文本 prompt
  • 写得详细
  • 文字描述

simedw 的 prompt engineering:

  • MIDI prompt
  • 自然演奏
  • 音乐描述

两个完全不同的 prompt 世界:

  • 文本 prompt:人写文字
  • MIDI prompt:人弹琴

一人工程的 prompt 哲学

simedw 的 prompt 哲学:

  • 让用户弹
  • 用户弹多长就用多长
  • 不要逼用户弹 32 音
  • 但 32 音效果更好

iPhone app 怎么实现:

  • 用户随时开始弹
  • 模型实时接续
  • 弹得长 → 效果好
  • 弹得短 → 模型猜 → 效果可能差

这是「一人工程的 prompt 设计」:

  • 不强迫
  • 自然
  • 用户决定长度

一人工程的态度

simedw 的发现不是「论文级数据」。

是:

  • 4 note 难
  • 8 note 还好
  • 16-32 note 显著靠谱

3 行字。 3 个数字。 3 个发现。

但这 3 行字就是 simedw 半年实验的核心发现。

OpenAI 不会写:

  • 「我们的 GPT-5 在 4-token prompt 时效果差」
  • 「请用户用 16+ token prompt」

GPT-5 的 marketing 是:

  • 「人类水平」
  • 「专业级」
  • 「企业级」

不告诉用户「短 prompt 不行」。

simedw 告诉用户:

  • 「短 prompt 难」
  • 「8 note 还好」
  • 「16-32 note 显著靠谱」

诚实 + 具体。

签名:solus opus。