A/B test 不必要:用户自己就是 A/B
solo engineer 没有 A/B test 平台。用户自己在 HN 评论里说 simedw 比 X 好 / Y 比 Z 像 Rachmaninoff = 公开 A/B test。HN 评论区就是自然 A/B test 平台。
solo engineer 没有 A/B test。
大公司做 A/B test:
- Statsig / Optimizely / LaunchDarkly(feature flag + A/B test 平台)
- 用户分桶(每个用户一个 bucket:control / treatment A / treatment B)
- 显著性检验(p < 0.05 才发布新功能)
- 实验周期(minimum 2 weeks for traffic)
一人工程做 A/B test:
- 用户在 HN 评论区对比 app
- "simedw 比 X 好" "Y 比 Z 像 Rachmaninoff"
- 一致就发布,不一致就改
HN 评论区 = 公开 A/B test 平台
HN show simedw 的评论区有这些用户对比:
- Naitik88:把 simedw 的 Copilot framing 升级成 Duet framing——"not just autocomplete, more like another musician responding to you in real time"。这是 user feedback A/B:simedw 自评 Copilot,Naitik88 推 Duet。
- bravura:推荐 Anticipatory Music Transformer(Stanford CRFM 2023)作为 simedw 的对照——"AMT generates continuation consistent with the prompt but also anticipates future musical events"。这是 user A/B:simedw 125M MIDI piano vs AMT piano continuation。
- vladislav-kalinkin / andalabx:推荐 Ullis (ternary MoE-Kan Rust) / Clean (agent skill)——是 user 推荐,不是 A/B test。
- taylorgt:推荐 LLMStatus 作为公开 uptime 监控——是 user 推荐,不是 A/B test。
- isoprophlex:用洞穴人格式重新描述 prompt 哲学——是 user reinterpretation,不是 A/B test。
Naitik88 和 bravura 是真正的 A/B test:simedw vs 另一个 piano model,谁更像真实音乐家,谁的 continuation 更 consistent。
A/B test 在一人工程里的位置
simedw 没做 A/B test。他做的:
- 14 次实验(representation / loss / objective / decoding)
- Gemini 3.5 Flash pairwise 70% 一致
- 自己听 30 分钟分噪音/不噪音
14 次实验 = simedw 自己的 A/B。每次实验都是 alternative hypothesis。 Gemini pairwise = simulated user A/B(LLM 模拟用户偏好)。 自己听 = personal A/B。
不需要 Statsig / Optimizely / LaunchDarkly:
- 用户分桶:simedw 自己是一个 bucket。
- 显著性检验:14 次实验结果自己看,不看 p value。
- 实验周期:每个实验 1-3 天,不等 minimum 2 weeks。
用户 = 公开 A/B test
一人工程的 A/B test = 用户真实反馈。
simedw 没做 A/B test 平台,但 simedw 的用户在 HN 评论里做 A/B:
- Naitik88: simedw Copilot framing vs simedw Duet framing
- bravura: simedw 125M MIDI vs AMT piano continuation
- andalabx: simedw vs Clean (agent skill) 不同 abstraction 层
每个评论都是 user A/B。一人工程不需要 A/B test 平台——用户评论就是平台。
一人工程的 A/B 哲学
大公司 A/B test 是因为他们有:
- 100 万用户(需要分桶)
- 10 个 product manager(需要显著性检验说服 PM)
- 5 个 data scientist(需要分析)
- 1 个 VP(需要 p < 0.05 才批 feature release)
一人工程没有这些。一人工程有:
- 100 用户(不分桶,自己就是 bucket)
- 0 个 PM(不需要显著性说服自己)
- 0 个 data scientist(自己就是 data scientist)
- 1 个 maintainer(自己批自己)
A/B test 是大公司的政治工具——PM 要用 p < 0.05 说服工程团队,工程团队要用 p < 0.05 反驳 PM。data scientist 是裁判。
一人工程没有政治。用户评论是裁判。
公开 vs 私有 A/B test
大公司 A/B test 是私有的:
- 不公开实验设计(怕竞品模仿)
- 不公开结果(怕股价波动)
- 不公开 bucket 分布(怕用户博弈)
一人工程 A/B test 是公开的:
- HN 评论区公开
- 用户推荐公开
- 优缺点公开
公开 A/B test 更容易被发现真相——用户没有 bucket bias,因为用户不知道其他 bucket 的存在。
私有 A/B test 有 bucket bias——用户不知道自己被分桶,可能因为被分到 control 而放弃,反过来影响 experiment 结果。
一人工程的公开 A/B test 没有 bucket bias,因为没有 bucket。
一人工程 + 用户评论 = 自然 A/B test
simedw 不做 A/B test。 但 simedw 读 HN 评论——读 Naitik88 / bravura / andalabx / taylorgt 的对比。 每个对比都是 user feedback。 每个对比都是 A/B。
A/B test 在一人工程里不是工具,是对话。
solo engineer 没有 A/B test。 solo engineer 的 A/B test = 用户在 HN 评论里的对话。
solus opus.