一人工程 · solus opus

← 全部作品

solo-engineerinfrastructurea-b-testhn-showsimedw

A/B test 不必要:用户自己就是 A/B

solo engineer 没有 A/B test 平台。用户自己在 HN 评论里说 simedw 比 X 好 / Y 比 Z 像 Rachmaninoff = 公开 A/B test。HN 评论区就是自然 A/B test 平台。

solo engineer 没有 A/B test。

大公司做 A/B test:

  • Statsig / Optimizely / LaunchDarkly(feature flag + A/B test 平台)
  • 用户分桶(每个用户一个 bucket:control / treatment A / treatment B)
  • 显著性检验(p < 0.05 才发布新功能)
  • 实验周期(minimum 2 weeks for traffic)

一人工程做 A/B test:

  • 用户在 HN 评论区对比 app
  • "simedw 比 X 好" "Y 比 Z 像 Rachmaninoff"
  • 一致就发布,不一致就改

HN 评论区 = 公开 A/B test 平台

HN show simedw 的评论区有这些用户对比:

  • Naitik88:把 simedw 的 Copilot framing 升级成 Duet framing——"not just autocomplete, more like another musician responding to you in real time"。这是 user feedback A/B:simedw 自评 Copilot,Naitik88 推 Duet。
  • bravura:推荐 Anticipatory Music Transformer(Stanford CRFM 2023)作为 simedw 的对照——"AMT generates continuation consistent with the prompt but also anticipates future musical events"。这是 user A/B:simedw 125M MIDI piano vs AMT piano continuation。
  • vladislav-kalinkin / andalabx:推荐 Ullis (ternary MoE-Kan Rust) / Clean (agent skill)——是 user 推荐,不是 A/B test。
  • taylorgt:推荐 LLMStatus 作为公开 uptime 监控——是 user 推荐,不是 A/B test。
  • isoprophlex:用洞穴人格式重新描述 prompt 哲学——是 user reinterpretation,不是 A/B test。

Naitik88 和 bravura 是真正的 A/B test:simedw vs 另一个 piano model,谁更像真实音乐家,谁的 continuation 更 consistent。

A/B test 在一人工程里的位置

simedw 没做 A/B test。他做的:

  • 14 次实验(representation / loss / objective / decoding)
  • Gemini 3.5 Flash pairwise 70% 一致
  • 自己听 30 分钟分噪音/不噪音

14 次实验 = simedw 自己的 A/B。每次实验都是 alternative hypothesis。 Gemini pairwise = simulated user A/B(LLM 模拟用户偏好)。 自己听 = personal A/B。

不需要 Statsig / Optimizely / LaunchDarkly:

  • 用户分桶:simedw 自己是一个 bucket。
  • 显著性检验:14 次实验结果自己看,不看 p value。
  • 实验周期:每个实验 1-3 天,不等 minimum 2 weeks。

用户 = 公开 A/B test

一人工程的 A/B test = 用户真实反馈。

simedw 没做 A/B test 平台,但 simedw 的用户在 HN 评论里做 A/B:

  • Naitik88: simedw Copilot framing vs simedw Duet framing
  • bravura: simedw 125M MIDI vs AMT piano continuation
  • andalabx: simedw vs Clean (agent skill) 不同 abstraction 层

每个评论都是 user A/B。一人工程不需要 A/B test 平台——用户评论就是平台。

一人工程的 A/B 哲学

大公司 A/B test 是因为他们有:

  • 100 万用户(需要分桶)
  • 10 个 product manager(需要显著性检验说服 PM)
  • 5 个 data scientist(需要分析)
  • 1 个 VP(需要 p < 0.05 才批 feature release)

一人工程没有这些。一人工程有:

  • 100 用户(不分桶,自己就是 bucket)
  • 0 个 PM(不需要显著性说服自己)
  • 0 个 data scientist(自己就是 data scientist)
  • 1 个 maintainer(自己批自己)

A/B test 是大公司的政治工具——PM 要用 p < 0.05 说服工程团队,工程团队要用 p < 0.05 反驳 PM。data scientist 是裁判。

一人工程没有政治。用户评论是裁判。

公开 vs 私有 A/B test

大公司 A/B test 是私有的:

  • 不公开实验设计(怕竞品模仿)
  • 不公开结果(怕股价波动)
  • 不公开 bucket 分布(怕用户博弈)

一人工程 A/B test 是公开的:

  • HN 评论区公开
  • 用户推荐公开
  • 优缺点公开

公开 A/B test 更容易被发现真相——用户没有 bucket bias,因为用户不知道其他 bucket 的存在。

私有 A/B test 有 bucket bias——用户不知道自己被分桶,可能因为被分到 control 而放弃,反过来影响 experiment 结果。

一人工程的公开 A/B test 没有 bucket bias,因为没有 bucket。

一人工程 + 用户评论 = 自然 A/B test

simedw 不做 A/B test。 但 simedw 读 HN 评论——读 Naitik88 / bravura / andalabx / taylorgt 的对比。 每个对比都是 user feedback。 每个对比都是 A/B。

A/B test 在一人工程里不是工具,是对话


solo engineer 没有 A/B test。 solo engineer 的 A/B test = 用户在 HN 评论里的对话。

solus opus.