04 贝叶斯更新与新证据:信念该改变多少
TL;DR:贝叶斯更新回答一个问题——新证据出现后,你对一个主张的信心该改变多少?关键不是"相信还是不信",而是置信度应从多少变到多少。核心逻辑:先验概率(原来信多少)× 新证据的强度 = 后验概率(现在该信多少)。直觉误区:要么太顽固(新证据改不动旧信念),要么太轻信(一个正面案例就全盘接受)。正确做法:把信念变成"概率区间",用证据逐步更新。
概念解释
贝叶斯更新的定义
贝叶斯更新(Bayesian Updating)是一种概率推理方法:当新证据出现时,用先验概率(P(H))和证据在该假设下的似然(P(E|H))计算后验概率(P(H|E))。核心公式:后验 ∝ 先验 × 似然。
为什么"相信还是不信"是错误的二分
| 二分思维 | 贝叶斯思维 |
|---|---|
| "这个方案可行"或"不可行" | "可行性的置信度是 60%" |
| 一个正面案例就全盘接受 | 根据案例质量调整置信度 |
| 反面证据出现就全盘否定 | 降低置信度但不一定降到零 |
| 讨论变成"信不信"的对立 | 讨论变成"证据强度够不够" |
三个直觉陷阱
| 陷阱 | 表现 | 贝叶斯修正 |
|---|---|---|
| 基础概率忽略 | "Agent 在 A 团队成功了,所以我们也行" | 先问"类似项目的一般成功率是多少" |
| 过度自信 | "我有 95% 把握" | 问"历史上类似估计的命中率是多少" |
| 锚定在先验 | 证据再强也改变不了旧信念 | 给证据一个合理的更新幅度 |
目录
| 章节 | 说明 |
|---|---|
| 贝叶斯直觉 | 不用公式也能用 |
| 证据强度的判断 | 什么样的证据值得更新 |
| 软件工程示例 | 更新对 Agent 效果的信念 |
| 适用边界与误用 | 贝叶斯不是什么 |
贝叶斯直觉
不用数学公式也能掌握的三个直觉:
- 先问基础率:在判断"这个方案能不能成功"之前,先问"类似方案的一般成功率是多少"。如果基础率只有 20%,一个正面案例不能让你直接跳到 80%。
- 证据有强弱:随机对照实验的证据强度远高于"我朋友说成功了"。证据越强,更新幅度越大。
- 不是"信不信",是"多少":把信念从二分变成概率区间——"60%觉得可行,但有 40% 可能是其他因素"。新证据调整这个百分比。
证据强度的判断
| 证据类型 | 更新强度 | 工程对应 |
|---|---|---|
| 随机对照实验 | 大幅更新 | A/B 测试 |
| 准实验 | 中等更新 | 前后对照带对照组 |
| 机制论证 | 小幅更新 | 代码和日志的逻辑分析 |
| 单案例 | 微幅更新 | "我朋友试过了" |
| 相关性 | 几乎不更新 | 散点图 |
关键:一个正面案例不值得大幅更新——因为基础率可能就是 50% 随机成功。只有实验级别的证据才值得大幅调整信念。这与 因果与证据总览:从主张到可验证决策 的证据强度阶梯一致。
软件工程示例
主张:"Agent 能缩短交付周期 30%。"
| 阶段 | 信念 | 证据 | 更新 |
|---|---|---|---|
| 初始 | 50%(不确定) | 无 | 基础率:AI 工具在工程中的成功率约 30-50% |
| 案例1 | →55% | 一个团队试点成功 | 微幅更新——单案例 |
| 机制 | →60% | Agent 减少模板代码(机制成立) | 小幅更新——机制但不量化 |
| 实验 | →75% | A/B 测试:处理组比对照组快 28% | 大幅更新——实验证据 |
| 护栏 | →65% | 评审负荷上升,一个护栏触发 | 下调——新证据改变方向 |
核心:每一步的信念变化都对应一个证据强度——不是"信了"或"没信",而是置信度随证据逐步调整。这避免了"一个成功就全盘接受"和"证据再多也不改"两个极端。
适用边界与误用
- 贝叶斯不替代实验:它告诉你"证据够不够",但获得证据仍需因果分析和实验。
- 不追求精确数字:直觉版贝叶斯用的是"大幅/中幅/微幅"而非精确概率。
- 先验不是偏见:基础率是客观统计,不是主观偏见——但如果基础率数据本身有偏,结论也会偏。
- 不能用来合理化:先验和似然都需要证据支撑,不能凭感觉选一个先验然后宣布"概率更新了"。
关联笔记
- 批判性思维总览:从主张到可检验论证(贝叶斯是检验论证的工具)
- 认知偏差:系统性错误的模式(偏差扭曲先验和似然的判断)
- 因果与证据总览:从主张到可验证决策(证据强度阶梯)
- 04 指标与决策复盘:避免 Goodhart 式自欺(复盘就是事后贝叶斯更新)
参考资料
评论 (0)