0.1 1990 年 9 月的一个专栏
《Parade》是随周日报纸附送的一本杂志,每周有几千万人翻看。杂志里有个问答专栏叫“问问玛丽莲”,主持人玛丽莲·沃斯·莎凡特(Marilyn vos Savant)因为曾以“世界最高智商”被载入吉尼斯纪录而出名,读者什么怪问题都寄给她。
1990 年 9 月 9 日,她刊出了一位读者的来信。问题只有几行:
“假设你在参加一个电视游戏节目,面前有三扇门。一扇门后是一辆汽车,另外两扇门后各是一只山羊。你选了一扇,比如 1 号门。主持人知道每扇门后面是什么 ,他打开了另一扇门,比如 3 号门,后面是一只山羊。然后他问你:‘你想换成 2 号门吗?’换门对你有利吗?”
玛丽莲的回答也只有几行:应该换。换门赢车的机会是 2/3,坚持原来的门只有 1/3。
① 你选一扇门 1 号门 1 你的选择 2 3 ② 主持人打开一扇羊门 他知道车在哪 1 你的选择 2 羊 3 ③ 换,还是不换? 剩下两扇门 1 你的选择 2 羊 3 坚持 1 号?还是换成 2 号? 图 0-1 三扇门游戏的三步。关键细节在第二步:主持人知道车在哪,而且他一定会打开一扇羊门。
在读下去之前,请你也做一次选择。不要算,凭第一感觉。
主持人打开 3 号门露出山羊之后,你的判断是:
换到 2 号门更好
坚持 1 号门更好
换不换都一样,剩下两扇门,各 50%
如果你选了第三项,你站在了大多数人这边——包括当年许多写信的数学博士。
0.2 一万封信
专栏刊出后,信件像雪片一样飞来。据《纽约时报》1991 年的报道,玛丽莲前后收到约一万封来信,其中近一千封署名带着“博士”头衔,不少来自大学的数学系和统计系。绝大多数人认为她错了。
信的语气一封比一封重。有人劝她“先找本概率论教科书读一读,再来回答这类问题”;有人说全国的数学素养已经够糟了,她这是在火上浇油;据她后来公开的读者来信,还有人干脆写道:“你就是那只山羊。”
更有分量的怀疑来自保罗·埃尔德什(Paul Erdős)。他是 20 世纪发表论文最多的数学家之一,一生合作者多达数百人。据他的同事、数学家瓦佐尼(Andrew Vázsonyi)本人的回忆,1995 年埃尔德什到他家做客,听了这道题,坚持答案是一半对一半,怎么解释都不接受;瓦佐尼用计算机模拟了大量局游戏——换门的一方赢了约三分之二。埃尔德什看到模拟结果,才勉强接受。
这就是本书的第一个反差:一位专栏作家是对的,近千位博士中的大多数是错的;一位顶尖数学家,最后是被一台计算机的“掷骰子”说服的,而不是被推理说服的。
如果你手边没有计算机,也可以看本书做的一次模拟:让计算机模拟 1 万局,每一局都同时记下“坚持”和“换门”各自的输赢,结果如表 0-1。
表 0-1 计算机模拟 10,000 局换门游戏(固定随机种子,可复现)
策略 赢车局数 胜率 理论值
始终坚持第一次选的门 3,335 33.4% 1/3
始终换门 6,665 66.7% 2/3
0.3 为什么越聪明,越容易错?
这些博士并不笨。他们犯错,恰恰因为他们脑中有一条“显然正确”的规则:剩下两种可能,就各占一半。
抛一枚硬币,正面和反面各占一半,对吧?
对。两种可能,各 50%。
明天要么下雨、要么不下雨,所以下雨的概率是 50%?
当然不是。沙漠里和雨林里,“明天下雨”的机会差得远。
那么“两种可能各一半”这条规则,是从哪里来的?
来自硬币本身的对称 :两面没有哪一面更特殊。
三扇门的游戏里,剩下的两扇门对称吗?
……1 号门是我随手选的;2 号门是主持人知道答案之后 ,特意留下来没开的。它们的来历不一样。
这就是症结。“剩下两扇门”看起来一模一样,可它们背后的信息 不一样。主持人的动作不是随机的——他知道车在哪,而且他一定会避开车。他的选择本身,就泄露了一点消息。
我们的直觉擅长看“眼前有几种可能”,却不擅长追问“这些可能是怎么来的、谁知道什么”。这正是概率要教给我们的东西。
先别急着看解释。如果把游戏改成 100 扇门:你选 1 扇,主持人打开其余 99 扇中的 98 扇羊门,只留下 1 扇。你还觉得是五五开吗?
大多数人到这里会动摇:你最初选中车的机会只有 1/100;主持人小心翼翼地绕开车,留下的那一扇门,几乎“必然”就是车所在的那扇。换门赢的机会是 99/100。三扇门只是同一个道理的缩小版。完整的推导,我们留到第 5 章,用一件叫“贝叶斯定理”的工具来做。
0.4 这本书要做什么
很多人对概率望而却步,是因为第一次见到它,就是一堆排列组合公式和“袋中取球”的习题。公式背熟了,却从没有人告诉你:这些公式到底在量什么?
本书的回答,就写在书名里:
类比
尺子量长度,秤量重量,温度计量冷热。概率,是量“不确定”的尺子 :它把一件事“有多可能”,量成 0 到 1 之间的一个数。这不只是修辞——在今天的数学里,概率的正式身份就叫“测度”(measure),和长度、面积、体积是同一家族。
既然是尺子,它就有刻度、有用法,也有量不了的东西。我们会按黄金圈的顺序,从“为什么”走到“怎么做”,再走到“是什么”:
为什么(Why) :第 1–2 章。概率到底在量什么?它为什么诞生在赌桌上?
怎么做(How) :第 3–13 章。一块积木一块积木地搭起工具:数清可能、条件概率、贝叶斯、期望与方差、各种分布、大数定律、中心极限定理,最后走到统计推断。这部分覆盖大一概率课的核心内容。
是什么(What) :第 14–16 章。天气预报、地质勘探、投资、制药、供应链、航天里的概率;今天的人工智能与大语言模型怎样“掷骰子”;以及读完之后,你看世界的方式会有什么不同。
第1–2章 是什么 · 从哪来 第 3 章 数清所有可能 第 4 章 条件概率与独立 第 5 章 贝叶斯定理 第 6 章 随机变量与期望 第 7 章 方差与风险 第 8 章 数个数的分布 第 9 章 连续的分布 第 10 章 大数定律 第 11 章 中心极限定理 第 12 章 相关与马尔可夫链 第 13 章 从概率到统计 第 14 章 概率在现实世界 第 15 章 概率与人工智能 尾章 概率思维 Why 它是什么、从哪来 How ① 描述可能性 How ② 描述随机量 How ③ 从一个到大量 What 走进世界 认知阶梯:每一章是一级台阶,由下往上 图 0-2 全书的认知阶梯。每一章回答一个问题,这个问题都由上一章的结论引出。颜色贯穿全书:靛蓝 代表可能性,珊瑚红 代表新证据,琥珀 代表风险,翠绿 代表频率与数据。
全书反复出现三句话。现在它们还只是口号,读到尾章时,你应该能自己把它们推出来:
单次不可测,大量有规律。 证据来了,就更新。 既看平均,也看分布。
三扇门的谜底,会在第 5 章彻底揭开。到那时你会发现:你不需要比那些博士更聪明,只需要多一件工具。
序章带走
直觉只数“有几种可能”,概率还要追问“这些可能从哪来、谁知道什么”。
换门赢的概率是 2/3,不是 1/2;计算机模拟 1 万局,换门胜率 66.7%。
“两种可能各一半”只在对称 时成立;主持人的知情动作打破了对称。
概率是量“不确定”的尺子;数学上它就叫“测度”。
于是,下一个问题 直觉在这里失灵了。那么,我们天天挂在嘴边的“概率”,到底是什么?
上一章留下的问题: 直觉在这里失灵了。那么,我们天天挂在嘴边的“概率”,到底是什么?
教科书常这样开头:“设 Ω 为样本空间,𝓕 为其上的 σ-代数……”读到这里,大多数人已经合上了书。
本章换一种开法:先不碰任何符号,跟你过一天普通的日子。你会发现,概率要回答的问题,你每天都在遇到,只是从来没有人告诉你它们叫这个名字。
1.1 你的一天里藏着概率
下面六个场景,每一个都藏着一个你也许没认真想过的问题。现在只提问,不作答。它们是本书埋下的六个伏笔,会在后面的章节里一个一个被揭开。
07:30 出门前看天气
手机上写着:“今天降水概率 70%。”
这个 70% 到底是什么的 70%?明天只会“下”或“不下”,这句话怎么才算说对了?
本章回收一半 · 第 10 章再回收 · 第 14 章揭晓
08:10 地铁穿过城市地下
隧道要避开溶洞,石油公司要在几千米深处找油层,城市规划要考虑地震。新闻里说:“旧金山湾区未来 30 年发生 6.7 级以上地震的概率是 72%。”
看不见地下,怎么决定在哪里打井?“30 年内 72%”又是什么意思?
第 5 章回收一半 · 第 14 章揭晓
12:00 午休时看一眼基金 App
宣传页写着:“过去十年,年均收益 10%。”
年均收益是正的,为什么不少拿着同一只基金的人,最后却亏了钱?
第 7 章回收一半 · 第 14 章揭晓
15:00 收到体检报告
某项筛查显示“阳性”。报告上写着这项检测的准确率很高。
检测准确率 90%,阳性就等于 90% 患病吗?一款新药,又凭什么被认定“有效”?
第 5、13 章回收一半 · 第 14 章揭晓
18:30 下班路过超市
货架上的牛奶总是刚好够卖。可每天来买牛奶的人数都不一样,多了会过期,少了会断货。
需求每天都在变,备多少货才能做到“95% 的日子不断货”?
第 11 章回收一半 · 第 14 章揭晓
21:00 新闻里的火箭发射
一枚运载火箭由成千上万个零件组成,每个零件都经过严格测试。
假如一万个零件、每个 99.99% 可靠,整枚火箭有多可靠?
第 4 章回收一半 · 第 14 章揭晓
六个场景横跨气象、地质、金融、医药、零售和航天。它们的共同点是:结果还没发生,或者已经发生但我们看不见,而我们必须现在就做决定。 概率就是为这种处境发明的。
表 1-1 六个伏笔在书中的位置
伏笔 场景 要用到的积木 揭晓
A 降水概率 70% 频率、校准、集合预报 第 1、10、14 章
B 找油与地震风险 贝叶斯更新、概率分布 第 5、14 章
C 年均 10% 却亏钱 期望与方差 第 7、14 章
D 阳性与新药 贝叶斯、假设检验 第 5、13、14 章
E 备多少货 正态分布、中心极限定理 第 11、14 章
F 火箭的可靠性 独立事件相乘 第 4、14 章
1.2 第一性原理:不确定从哪里来?
我们用第一性原理,把问题拆到最朴素的地方:“不确定”到底是什么?
你抛出一枚硬币,它还在空中翻转。它会落在正面还是反面?
不知道,一半一半吧。
可硬币遵守牛顿力学。如果你知道它出手的速度、转速、高度、空气阻力,能不能算出它怎么落?
理论上能。统计学家迪亚科尼斯等人研究过:用机械装置抛硬币,结果可以做到几乎完全可预测;就连人手抛的硬币,落地时保持出手时朝上那一面的机会也略高于一半(约 51%)。
那“一半一半”说的是硬币本身,还是说的是你?
……说的是我。是我不知道那些初始条件。
再想三扇门:车就停在某扇门后,早就确定了。对主持人来说,1 号门有车的概率是多少?对你呢?
对主持人,要么是 1,要么是 0,他知道答案。对我,是 1/3。同一扇门,两个人的概率不一样。
这段对话推出了本书的第一块基石:
第一, 日常生活里的大多数“不确定”,来自信息不够 ,而不是世界本身在“随机”。硬币、骰子、天气、地下的油层、体内的病灶,都是这样。(物理学里确实存在本质上的随机,比如放射性原子何时衰变;但我们在生活中遇到的,绝大多数属于前一种。)
第二, 正因如此,概率依赖于你知道什么 。信息变了,概率就该变。主持人开门之所以改变了局面,正是因为他给了你新信息。
于是,我们不再把概率想成世界的“脾气”,而是想成我们手里的一件测量工具 :在信息不完整时,量一量每种结果各有多大分量。
1.3 一把从 0 到 1 的尺子
既然是测量工具,就要有刻度。概率的刻度只有一段:从 0 到 1。
0 表示不可能:一颗普通骰子掷出 7 点。
1 表示必然:一颗骰子掷出的点数小于 7。
中间的数表示“有几成把握”:0.5 是五五开,0.7 是七成。
为什么偏偏是 0 到 1,而不是 0 到 100 或者别的?因为把所有可能的结果放在一起,它们合起来必然会发生一个,这个“全部”被定为 1。某个结果的概率,就是它在全部之中占的份额 。百分数只是把同一把尺子乘了 100。
0 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 1 不可能 必然 双色球头奖 约 1/1772 万 掷出 6 点 1/6 硬币正面 1/2 降水概率 70% 明早日出 几乎为 1 新药 I 期→获批 约 7.9% 23 人有人同生日 50.7% 湾区 30 年大地震 72% 图 1-1 概率尺。生活中的不确定事件,都能在这把尺子上找到位置。注意尺子两端附近的“挤”:双色球头奖(约 1772 万分之一)几乎贴着 0,但不等于 0。数据来源见第 3、14 章。
这把尺子立刻送给我们一条最有用的规则:一件事不发生的概率 = 1 − 它发生的概率。 降水概率 70%,不下雨就是 30%。它看起来平淡无奇,可在第 3 章你会看到,许多难题就是靠“反过来算”一下子变简单的。
赔率不是概率。 赌场和体育博彩常说“赔率 3 比 1”,意思是“不发生 : 发生 = 3 : 1”,换成概率是 1/(3+1) = 0.25。两者可以互相换算,但不是同一个数。本书只用概率。
1.4 概率的三张面孔
尺子有了,可“0.7”这个读数是怎么得来的?回答这个问题的方式有三种,它们分别对应概率的三张面孔。
对称 数出来的 骰子六面一样 每面 1/6 古典概率 · 帕斯卡、费马 频率 看出来的 掷 6000 次 6 点约 1000 次 频率解释 · 伯努利、冯·米塞斯 信念 判断出来的 明天下雨? 我有七成把握 主观解释 · 贝叶斯、拉普拉斯 图 1-2 概率的三张面孔。三种方式得来的读数,最后都要落到同一把 0 到 1 的尺子上,也都遵守同样的运算规则(第 2 章末的三条公理)。
第一张面孔:对称。 骰子的六个面做得一模一样,没有理由偏向哪一面,所以每面 1/6。这是最早的概率,靠“数”出来:有利的情况数 ÷ 所有同等可能的情况数。它的前提是对称 ——序章的博士们正是在这里栽了跟头,他们把不对称的两扇门当成了对称的。
第二张面孔:频率。 如果一枚图钉落地“尖朝上”的概率是多少?图钉不对称,没法数。那就抛它一千次,看尖朝上占几成。这张面孔说:概率是大量重复时,结果出现的比例会稳定到的那个数。
第三张面孔:信念。 “这位候选人赢得选举的概率是 60%”“这口井打出油的概率是 30%”。选举只有一次,这口井也只打一次,没法重复一千遍。这时的概率,是一个理性的人根据手头证据,对结果有几成把握 。新证据来了,把握就要更新。
表 1-2 概率的三张面孔
面孔 读数从哪来 擅长 短处
对称(古典) 数同等可能的情况 骰子、扑克、抽签 现实中很少有真正的对称
频率 大量重复,看比例 保险、质检、天气统计 一次性事件无法重复
信念(主观) 根据证据判断把握 一次性决策、诊断、搜索 起点因人而异,需要用证据校正
这三张面孔吵了三百年,今天依然有人在吵。但本书不需要你站队:在对称或可重复的场合,三种读数往往吻合;更重要的是,它们遵守完全相同的运算规则。 这正是下一章结尾那三条公理的意义。
1.5 频率会稳定下来
第二张面孔有个隐含的承诺:比例会“稳定”下来。这是真的吗?我们让计算机替三个人各抛一万次硬币。
1 10 100 1,000 10,000 0 0.25 0.5 0.75 1 理论值 0.5 抛掷次数(对数刻度) 正面比例 图 1-3 三个人各抛一万次硬币(模拟,固定随机种子)。前几十次,正面比例忽高忽低(最初几次甚至是 0 或 1);到第一万次,三人分别是 0.502、0.504、0.505。单次不可测,大量有规律。
历史上也真有人这么干过。18 世纪的布丰抛了 4,040 次,正面约占 50.7%;统计学家卡尔·皮尔逊抛了 24,000 次,正面约占 50.05%。
这张图里藏着全书的第一句口号:单次不可测,大量有规律。 你永远猜不中下一次是正是反,但你可以很有把握地说,一万次里正面会在五千次上下。它为什么一定会稳定、稳定得有多快,要等第 10 章的大数定律来证明。
回到早上的天气预报:“降水概率 70%”是什么的 70%?
按频率的面孔来读:在所有“发布 70% 降水概率”的日子里,大约有 70% 的日子真的下了雨 ,才算预报得准。单独某一天下没下雨,既不能证明它对,也不能证明它错——就像抛一次硬币出了反面,证明不了“正面概率 0.5”是错的。
美国国家气象局的正式定义还更精确一些:它是“预报区内任意一点,在预报时段内出现可测量降水”的概率。这个数怎样算出来、怎样检验,第 10、14 章揭晓。
概率是
在信息不完整时,衡量“有几成把握”的尺子
0 到 1 之间的数,所有结果合起来等于 1
会随着新信息改变的量
对大量重复中的频率,可以检验的陈述
概率不是
对单次结果的预言(70% 下雨,照样可能晴天)
世界的“脾气”或运气好坏
“两种可能就各一半”
一个一旦算出就永远不变的数
一个医生对病人说:“这种手术的成功率是 90%。前面九个病人都成功了,所以你这一次要小心了。”这句话错在哪里?
90% 是对大量手术的频率描述,并不意味着“每十次必有一次失败”。只要每次手术彼此不影响,前九次成功并不会让第十次更危险。把长期比例当成“必须补上的配额”,是一个非常普遍的错觉,第 4 章会给它一个名字:赌徒谬误。
单次不可测,大量有规律。
本章带走
概率是一把量“不确定”的尺子:刻度从 0 到 1,读数取决于你知道什么。
生活里的不确定,大多来自信息不够 ;所以信息变了,概率就该变。
三张面孔——对称、频率、信念——读数的来路不同,但落在同一把尺子上。
“降水概率 70%”是一句关于大量相似日子 的话,单独一天无法验证它。
不发生的概率 = 1 − 发生的概率。
于是,下一个问题 这把尺子并非生来就有。人类是在哪里、为了什么问题,第一次认真去量“运气”的?
上一章留下的问题: 这把尺子并非生来就有。人类是在哪里、为了什么问题,第一次认真去量“运气”的?
几何学诞生于丈量土地,天文学诞生于观星定历。这些学问的起点都很体面。概率论的起点却有点不好意思说出口:它诞生在赌桌上。
这并非偶然。赌博是人类最早的、可以大量重复 、又有真金白银 作为反馈的不确定游戏。算错了,钱包立刻告诉你。本章沿着时间走一遍,看一群赌徒、律师、数学家和牧师,怎样把“运气”变成一把尺子。
2.1 一位赌徒医生
吉罗拉莫·卡尔达诺是 16 世纪的医生、数学家,也是一个嗜赌如命的人。他在自传里承认自己几十年间几乎天天赌博。大约 1564 年,他写下一本小册子《论赌博游戏》,第一次尝试系统地计算掷骰子的机会:两颗骰子共有 36 种等可能的组合,点数之和是 7 的有 6 种……
这本书在他身后近一百年、1663 年才出版。那时,概率论的奠基工作已经由别人完成了。
卡尔达诺已经摸到了第一张面孔——对称:把所有同等可能的情况列出来,数一数有利的占几成。 但他还缺少一个把零散算法串起来的问题。这个问题在 90 年后出现了。
2.2 德·梅雷的困惑
1654 年的巴黎,有位喜欢赌博的贵族文人,人称德·梅雷骑士。据说他遇到了一件想不通的事。
他知道一个赌局对自己有利:一颗骰子掷 4 次,赌至少出现一个 6。 他又想:两颗骰子一起掷,出现“双 6”的机会是单颗出 6 的 1/6;那么把次数也放大 6 倍,两颗骰子掷 24 次,赌至少出现一次双 6 ,应该同样有利。4 : 6 = 24 : 36,比例一模一样。
德·梅雷的第二个赌局,对他是有利、不利,还是和第一个一样?
他后来的结论是:第二个赌局长期来看让他输钱。(他是否真能从赌桌上察觉出这么小的差别,历史学家有疑问;但这道题被他交给了帕斯卡,这是有信件为证的。)
用第 1 章的“反过来算”,两个概率都能一步算出:
一颗骰子掷 1 次不 出 6 的概率是 5/6;掷 4 次全都不出 6 是 (5/6)⁴ ≈ 0.482。所以至少一个 6 的概率是 1 − 0.482 = 0.518 。
两颗骰子掷 1 次不出双 6 是 35/36;掷 24 次全不出是 (35/36)²⁴ ≈ 0.509。所以至少一次双 6 是 1 − 0.509 = 0.491 。
0.5:公平线 一颗骰子掷 4 次 至少一个 6 0.5177 赌徒长期赚 两颗骰子掷 24 次 至少一次双 6 0.4914 赌徒长期亏 0.44 0.47 0.50 0.53 0.56 横轴只画了 0.44–0.56 这一小段,差别被放大了 图 2-1 德·梅雷的两个赌局。第一个略高于公平线,第二个略低于公平线。“按比例放大”这条直觉规则,在概率里不成立。
“按比例放大”错在哪里?“至少出现一次”的概率不是随次数成比例增长的 ——否则掷 7 次骰子,至少出一个 6 的概率就成了 7/6,超出了尺子的刻度。每多掷一次,新增的机会都要打折扣,因为有一部分“早就出过 6 了”。
2.3 1654 年夏天的通信
德·梅雷还带来一个更难的问题,史称“点数问题 ”:两人赌博,约定先赢 3 局者拿走全部赌注;可比分到 2 : 1 时,赌局被迫中断。赌注该怎么分才公平?
按已经赢的局数分,2 : 1,甲拿三分之二,行吗?
看起来合理。
那如果比分是 1 : 0 时中断呢?按局数,甲拿全部?
那对乙太不公平了,乙还有很大机会翻盘。
所以公平的分法,应该看过去,还是看未来?
看未来:看如果继续赌下去,每个人赢的机会 各有多大。
这正是 1654 年夏天,布莱兹·帕斯卡与皮埃尔·德·费马在一系列通信里的思路。费马的办法是把“未来所有可能的走向”一一列出;帕斯卡的办法是一步一步往回推。两条路得到同一个答案。
比分 甲 2 : 1 乙 先到 3 局者赢 甲赢 1/2 乙赢 1/2 甲 3 : 1 乙,甲胜 2 : 2,再赌一局 1/4 1/4 甲胜 乙胜 甲获胜 = 1/2 + 1/4 = 3/4 乙获胜 = 1/4 64 枚 → 甲 48,乙 16 图 2-2 点数问题的概率树。假想赌局继续:甲只差 1 局,乙差 2 局。甲获胜的概率是 3/4,所以 64 枚金币中甲应得 48 枚,乙 16 枚——这正是帕斯卡信中的例子。
这次通信通常被视为概率论的诞生。它留下了两样东西:第一, 把所有可能的未来列清楚(第 3 章的样本空间);第二, 用“赢的机会 × 奖金”来定价(第 6 章的期望)。
2.4 惠更斯:一个赌局值多少钱?
1657 年,荷兰物理学家惠更斯听说了巴黎的讨论,写了一本小书《论赌博中的计算》,这是第一本正式出版的概率论著作。他提出了一个朴素的问题:一张彩票,公平的价格是多少?
他的回答是:把每种结果的奖金乘以它的概率,再加起来。一张“一半机会赢 10 元、一半机会赢 0 元”的彩票,值 5 元。这个数后来叫期望 。三百多年后,它依然是保险定价、投资决策、机器学习的起点。
2.5 伯努利的二十年
到此为止,概率还只是赌桌上的算术。真正把它带出赌场的,是瑞士巴塞尔的雅各布·伯努利。
他想回答一个问题:骰子的概率可以数出来,可一个人活过六十岁的概率、一场瘟疫夺走某个城市人口的概率 ,没法数,怎么办?他的答案是:观察足够多的例子,看频率。可是,凭什么相信观察到的频率就接近真正的概率?
伯努利为这个问题思考了大约二十年,证明了一条他称为“黄金定理”的结果:只要重复的次数足够多,观察到的频率偏离真实概率超过任意给定小量的机会,可以小到任意程度。 这就是第一个“大数定律”。他没能看到它出版:他 1705 年去世,《猜度术》1713 年才印出来。
这条定理在对称和频率两张面孔之间架起了一座桥,也为保险业提供了数学上的底气:个人的寿命无法预测,一万人的死亡率却可以。单次不可测,大量有规律。
2.6 钟形曲线、逆概率与“常识的计算”
18 世纪,接力棒传到几位关键人物手里:
棣莫弗 (1733):流亡伦敦的法国数学家,终生未得教职,靠做私人数学教师、在咖啡馆下棋等营生糊口。他发现抛很多次硬币时,正面次数的分布会贴近一条钟形曲线。这条曲线后来叫“正态分布”,第 9、11 章的主角。
贝叶斯 (1763):英国一位长老会牧师。他生前没发表的一篇论文,由朋友普莱斯整理后在皇家学会宣读。论文回答的是一个“反过来”的问题:看到了结果,怎样推断原因? 这是第 5 章的主角。
拉普拉斯 (1812、1814):法国的“牛顿”。他把前人的成果汇成一部巨著,又写了一本给大众读的《概率的哲学随笔》,里面有一句名言:“概率论不过是把常识归结为计算。”
高斯 (1809):用钟形曲线描述测量误差,把概率带进了天文学和测量学。
2.7 从赌场到宇宙
17 世纪末以后,概率像水一样渗进了几乎所有学科:
保险与人口: 1693 年哈雷编出第一张可靠的生命表,年金和寿险从此能按死亡率定价。
物理: 麦克斯韦和玻尔兹曼用概率描述气体里亿万个分子,温度和压强成了“大量分子的平均”。20 世纪的量子力学更进一步:电子在哪里,本身就只能用概率描述。
生物: 孟德尔的豌豆实验本质上是概率实验;高尔顿用钉板演示遗传中的钟形分布。
社会: 人口普查、民意调查、犯罪统计,都成了概率的地盘。
1564 卡尔达诺写《论赌博游戏》 1663 年才出版 1654 帕斯卡—费马通信 点数问题 1657 惠更斯 期望 1713 伯努利《猜度术》 大数定律 1733 棣莫弗 钟形曲线 1763 贝叶斯遗稿发表 逆概率 1812 拉普拉斯 集大成 1867 切比雪夫 不等式 1900 希尔伯特第 6 问题 要求公理化 1933 柯尔莫哥洛夫 三条公理 图 2-3 概率论的四百年。颜色对应全书的语义:靛蓝 是“数清可能”,琥珀 是期望与风险,翠绿 是频率与大量,珊瑚红 是用证据反推。
2.8 地基的裂缝,与柯尔莫哥洛夫的三条公理
概率用得越来越广,它的地基却一直不牢。1889 年,法国数学家贝特朗提出一个悖论:“在一个圆里随机画一条弦,它比圆内接正三角形的边更长的概率是多少?” 按三种看似都合理的“随机画法”,分别得到 1/2、1/3、1/4 三个答案。
问题出在“随机”两个字没有说清楚。1900 年,希尔伯特在著名的 23 个数学问题中(第 6 问题)呼吁:像几何那样,给概率论建立公理。
答卷在 1933 年交出。苏联数学家柯尔莫哥洛夫出版了薄薄一本《概率论基础》,把概率建立在测度论(研究长度、面积、体积的数学)之上。他的核心想法一句话就能说完:
类比
把所有可能的结果摊成一张总面积为 1 的地图 。每一件事情是地图上的一块区域,它的概率就是这块区域的面积 。
这个类比在哪里会失效?地图上的面积可以随手量,可概率地图上“每一块该画多大”,公理并不告诉你——那要靠对称、频率或证据去定。公理只管规则 ,不管读数 。
有了“面积”这个类比,三条公理几乎是自明的:
表 2-1 柯尔莫哥洛夫的三条公理(1933)
公理 数学写法 面积的说法
一、非负 P(A) ≥ 0 任何一块的面积不会是负数
二、规范 P(Ω) = 1 整张地图的面积是 1
三、可加 A、B 不重叠时,P(A 或 B) = P(A) + P(B)(对可数无穷多块也成立) 互不重叠的几块,总面积等于各块相加
就这三条。本书后面的所有规则——补集、条件概率、贝叶斯、期望、大数定律——都可以从它们推出来。第 1 章那三张面孔之所以能共用一把尺子,正是因为它们都遵守这三条规则。
用这三条公理,证明第 1 章的“不发生的概率 = 1 − 发生的概率”。
事件 A 和“A 不发生”(记作 Aᶜ)互不重叠,合起来正好是整张地图 Ω。由公理三,P(A) + P(Aᶜ) = P(Ω);由公理二,P(Ω) = 1。所以 P(Aᶜ) = 1 − P(A)。一条“常识”,被三条公理变成了定理。
公理化做到了
统一规则:任何面孔得到的概率都得遵守
消除悖论:说清“随机”指的是哪张地图
让概率成为严格的数学分支
公理化没有做
告诉你某件事的概率具体是多少
裁决频率派与信念派谁对
保证你选的“地图”符合现实
把所有可能摊成一张面积为 1 的地图。
本章带走
概率诞生在赌桌上,因为那里有可以大量重复、又有即时反馈的不确定。
德·梅雷的困惑:“至少一次”的概率不随次数成比例增长;用“反过来算”一步解决。
帕斯卡与费马:公平分赌注要看未来的可能 ,不看过去的比分。
惠更斯的期望、伯努利的大数定律、贝叶斯的逆概率,是后面各章的伏线。
柯尔莫哥洛夫:概率 = 一张总面积为 1 的地图上的面积;三条公理管住全部规则。
于是,下一个问题 柯尔莫哥洛夫说,一切从“样本空间”开始。第一块积木:怎样把“所有可能”列清楚、数清楚?
上一章留下的问题: 柯尔莫哥洛夫说,一切从“样本空间”开始。第一块积木:怎样把“所有可能”列清楚、数清楚?
上一章我们把概率想成一张总面积为 1 的地图。要用这张地图,第一步当然是把地图画出来 :到底有哪些可能的结果?这一步听起来最简单,却是历史上大数学家也会翻车的地方。
3.1 样本空间:一张列全了的清单
一次试验所有可能结果组成的集合,叫样本空间 ,通常记作 Ω(希腊字母,读作“欧米伽”)。用大白话说:在结果揭晓之前,把“可能会看到什么”一个不漏地写下来。
抛一枚硬币:Ω = {正,反}。
掷一颗骰子:Ω = {1, 2, 3, 4, 5, 6}。
明天的最高气温:Ω 是某个温度区间里的所有实数(这种“连续”的清单留到第 9 章)。
抛两枚硬币,可能的结果有几种?
三种:两个正面、两个反面、一正一反。
这三种结果机会相等吗?
……应该相等吧?
把两枚硬币涂成不同颜色,一枚蓝、一枚红,再列一次。
蓝正红正、蓝正红反、蓝反红正、蓝反红反。四种。“一正一反”其实包含了两种。
所以“一正一反”的概率是?
2/4 = 1/2,而不是 1/3。
如果你刚才也答了“三种、各 1/3”,你有一位显赫的同伴:18 世纪法国大数学家达朗贝尔,《百科全书》的主编之一。他在 1754 年为“抛两次硬币至少一次正面”算出了 2/3,理由正是把结果列成了三种。正确答案是 3/4。
这个错误的教训是:样本空间要列到“每个结果机会相等”的那一层 ,不能把几种结果捆在一起当成一种。给硬币涂上颜色,是一个很有用的思维小技巧——哪怕真实的硬币长得一模一样,它们依然是两枚 。
3.2 事件:地图上的一块
我们关心的往往不是单个结果,而是一类结果。“掷出偶数”是 {2, 4, 6},“掷出大于 4 的点”是 {5, 6}。这样一块结果的集合,叫事件 。在第 2 章的地图上,事件就是一块区域,它的概率就是这块区域的面积。
几块区域之间可以组合,最常用的有三种:
B A Ω A 或 B(并) 至少一个发生 B A Ω A 且 B(交) 两个同时发生 A Ω 非 A(补) A 不发生 图 3-1 事件的三种组合。矩形 Ω 是整张地图(面积 1),圆是事件。这种图叫维恩图。
A 或 B (并):至少有一个发生。
A 且 B (交):两个同时发生。
非 A (补):A 不发生。它的面积是 1 − P(A),第 1 章已经用过。
从图上一眼就能读出一条重要公式:两个圆合起来的面积,等于两个圆面积之和,再减去重叠部分 (它被数了两次):
P(A 或 B) = P(A) + P(B) − P(A 且 B)加法公式(容斥原理)。当 A、B 不重叠时,最后一项为 0,就是第 2 章的公理三。
一副 52 张的扑克牌,抽一张。是红桃或者是 K 的概率是多少?
红桃 13 张,K 有 4 张,但红桃 K 被数了两次。所以是 13/52 + 4/52 − 1/52 = 16/52 ≈ 0.31。
3.3 等可能时:数格子
如果样本空间里每个结果机会相等——骰子、扑克、抽签都是如此——那么算概率就变成了数格子 :
P(A) = A 包含的结果数 ÷ 全部结果数古典概型:只在“每个结果等可能”时成立。
红骰子的点数 蓝骰子 的点数 1 2 3 4 5 6 1 2 3 4 5 6 7 2 3 4 5 6 7 8 3 4 5 6 7 8 9 4 5 6 7 8 9 10 5 6 7 8 9 10 11 6 7 8 9 10 11 12 和为 7:6 格 → 6/36 = 1/6 和为 12:1 格 → 1/36 图 3-2 两颗骰子的 36 种结果。给骰子涂上颜色,每一格才是等可能的。点数和为 7 的格子最多,这就是很多骰子游戏围绕“7”设计规则的原因。
这张 6 × 6 的方格,就是卡尔达诺在 1564 年前后数过的东西。它回答了很多赌徒凭经验知道、却说不出道理的事:为什么 7 最常见(6 格),为什么 2 和 12 最罕见(各 1 格)。
3.4 格子太多怎么办:乘法原理
两颗骰子 36 格还能画出来。可要是问:一个 6 位数字密码有多少种?一副牌洗乱后有多少种顺序?这时就不能一格一格画了,要学会不画也能数 。
最基本的工具是乘法原理 :如果一件事分几步完成,第一步有 a 种做法,第二步有 b 种,那么一共有 a × b 种。图 3-2 就是 6 × 6。
类比
乘法原理就像点套餐:主食 3 选 1,饮料 4 选 1,甜点 2 选 1,一共能搭出 3 × 4 × 2 = 24 种不同的套餐。每多一道“选择题”,可能性就成倍地长。
6 位数字密码:每位 10 种,共 10⁶ = 100 万种。随手一猜,猜中的概率是百万分之一。
5 个人排成一队:第一位有 5 种人选,第二位剩 4 种……共 5 × 4 × 3 × 2 × 1 = 120 种。这个连乘记作 5!,读作“5 的阶乘”。
一副 52 张的牌洗乱:52! ≈ 8 × 10⁶⁷ 种顺序。这个数大到什么程度?你认真洗一次牌,得到的顺序几乎可以肯定在人类历史上从未出现过。
3.5 排列与组合:在不在乎顺序
计数最常见的分岔口只有一个问题:顺序重要吗?
从 10 个人里选出班长、副班长、学习委员,顺序重要(谁当班长不一样),有 10 × 9 × 8 = 720 种,这叫排列 。从 10 个人里选 3 个人组成值日小组,顺序不重要,同样 3 个人不论按什么顺序选出来都是同一个小组。每个小组在 720 种排列里被数了 3! = 6 次,所以只有 720 ÷ 6 = 120 种,这叫组合 ,记作 C(10, 3)。
C(n , k ) = n ! ÷ ( k ! × (n − k )! )从 n 个里选 k 个、不计顺序的方法数。先按排列数,再除掉每组内部的 k! 种顺序。
表 3-1 四种常见的计数场景
场景 顺序重要? 可以重复? 公式 例子
密码、车牌 是 是 nᵏ 4 位数字密码:10⁴ = 10,000
排座次、选职务 是 否 n!/(n−k)! 10 人选 3 个职务:720
选小组、抽奖 否 否 C(n, k) 10 人选 3 人小组:120
全部排队 是 否 n! 5 人排队:120
用这套工具,可以算出彩票的真实面目。以双色球为例:从 33 个红球里选 6 个(不计顺序),再从 16 个蓝球里选 1 个。
C(33, 6) × 16 = 1,107,568 × 16 = 17,721,088双色球一等奖需要 7 个号码全中:中奖概率约 1772 万分之一。
1772 万分之一是什么感觉?如果你每周买两注、风雨无阻,平均要买大约 17 万年才能中一次头奖。这就是图 1-1 里那个几乎贴着 0 的点。
3.6 生日问题:反过来算
一个房间里至少要有多少人,才能让“至少两个人同一天生日”的概率超过一半?(不考虑 2 月 29 日)
大约 183 人(365 的一半) 大约 60 人 大约 23 人
答案是 23 人 。大多数人会猜一百多,因为他们在想“有人和我 同一天生日”——那确实需要很多人。可问题问的是任意两个人 。23 个人两两配对,一共有 C(23, 2) = 253 对,每一对都有可能撞上。
正面算“至少两人同生日”很麻烦:可能是两人同一天,也可能三人同一天,还可能有两对……第 1 章的规则在这里派上用场:反过来算。
第 1 个人的生日随便:365/365。
第 2 个人要避开第 1 个人:364/365。
第 3 个人要避开前两个:363/365。
……第 23 个人要避开前 22 个:343/365。
全部都不相同的概率,是这些分数连乘,约 0.493。所以至少两人同生日的概率是 1 − 0.493 = 0.507 。
0 10 20 30 40 50 60 70 0 0.5 1 10 人:11.7% 23 人:50.7% 57 人:99.0% 房间里的人数 n 至少两人同生日的概率 图 3-3 生日问题。曲线在 20 人左右陡然上升:23 人过半,57 人时已达 99%。
这个结果在现实中有很多化身。密码学里有一种“生日攻击”,利用的就是“找任意两个撞在一起,比找一个和指定目标撞上容易得多”。在大数据里发现“离奇的巧合”,往往也只是生日问题:可能配对的数量太多了,总有几对会撞上。
数格子适用于
每个结果机会均等 的场合:骰子、扑克、抽签、彩票
可以借助对称性论证等可能的场合
数格子不适用于
结果机会不等:图钉落地、天气、比赛输赢
把几种结果捆成一种时(达朗贝尔的错误)
结果是连续的数(第 9 章)
先把地图画全,再数格子;正面难算,就反过来算。
本章带走
样本空间是一张列全了的清单;事件是清单上的一块;等可能时,概率就是数格子。
列样本空间要列到“每个结果等可能”那一层——给硬币涂上颜色。
P(A 或 B) = P(A) + P(B) − P(A 且 B)。
乘法原理、排列、组合:关键只问一句“顺序重要吗”。
“至少一个”的问题,先算“一个都没有”,再用 1 去减。
于是,下一个问题 数清所有可能,得到的是一张静止的地图。可一旦得知一条新消息,地图就变了——概率该怎样跟着变?
上一章留下的问题: 数清所有可能,得到的是一张静止的地图。可一旦得知一条新消息,地图就变了——概率该怎样跟着变?
第 1 章说过:概率取决于你知道什么。这句话现在要兑现成一条可以计算的规则。本章的主角叫条件概率 ,它是整个概率论里用得最多、也最容易用错的工具。三扇门、医学检测、法庭证据、火箭可靠性,全都绕不开它。
4.1 新消息 = 缩小地图
还是两颗骰子,一蓝一红。“点数和至少为 10”的概率是多少?数格子:(4,6)(5,5)(6,4)(5,6)(6,5)(6,6),共 6 格,6/36 = 1/6。
现在我偷看了一眼,告诉你:蓝骰子是 6。和至少为 10 的概率还是 1/6 吗?
应该变大了。蓝骰子已经是 6,红骰子只要 4 以上就行。
在这条消息之下,还有哪些格子是可能的?
只剩蓝骰子为 6 的那一行,6 格。其他 30 格被排除了。
这 6 格里,和至少为 10 的有几格?
红骰子是 4、5、6 的三格。3/6 = 1/2。
所以这条消息做了什么?
它把地图从 36 格缩成了 6 格。我在新的小地图 里重新数格子。
2 3 4 5 6 7 3 4 5 6 7 8 4 5 6 7 8 9 5 6 7 8 9 10 6 7 8 9 10 11 7 8 9 10 11 12 还不知道任何消息 和 ≥ 10:6/36 = 1/6 7 8 9 10 11 12 得知“蓝骰子是 6” 和 ≥ 10:3/6 = 1/2 新消息 行 = 蓝骰子,列 = 红骰子 灰色的 30 格被消息排除 图 4-1 条件概率就是缩小地图。一条消息排除了一部分可能,你在剩下的区域里重新量面积。同一件事的概率,从 1/6 变成了 1/2。
这就是条件概率的全部思想。写成公式:
P(A | B) = P(A 且 B) ÷ P(B)“在 B 已经发生的条件下,A 的概率”。竖线读作“在……条件下”。分母 P(B) 是缩小后地图的面积,分子是其中属于 A 的面积。
用数字验证:P(A 且 B) = 3/36,P(B) = 6/36,相除得 1/2。和数格子的结果一样。
类比
条件概率像舞台上的追光灯。原本整个舞台都亮着(全部 36 格);消息传来,灯光收拢,只照亮舞台的一角(6 格)。你只看亮着的地方,重新估算“有几成”。
类比的边界:追光灯随意打在哪里都行,条件概率却要求你如实 知道被照亮的是哪一块。序章的博士们,正是没看清主持人把灯打在了哪里。
一个家庭有两个孩子,已知“至少有一个是男孩”。两个都是男孩的概率是多少?(假设男女各半、彼此独立)
先画地图:给孩子标上“老大、老二”,共四格:男男、男女、女男、女女,各 1/4。消息“至少一个男孩”排除了女女,剩三格。其中男男只有一格,所以是 1/3 ,不是很多人以为的 1/2。如果消息换成“老大是男孩”,地图只剩男男、男女两格,答案才是 1/2。消息的措辞不同,缩出来的地图就不同。
4.2 一步一步走:乘法公式与概率树
把条件概率的公式挪一下位置,就得到一条同样重要的规则:
P(A 且 B) = P(B) × P(A | B)乘法公式:两件事都发生 = 先发生一件 × 在此条件下再发生另一件。
它让我们可以一步一步 算复杂的事件,就像沿着一棵树往下走。看一个工厂的例子:零件由两条生产线制造,A 线产量占 60%,次品率 2%;B 线占 40%,老设备,次品率 5%。
一个零件 A 线 0.6 B 线 0.4 次品 0.02 0.6 × 0.02 = 0.012 合格 0.98 0.6 × 0.98 = 0.588 次品 0.05 0.4 × 0.05 = 0.020 合格 0.95 0.4 × 0.95 = 0.380 次品合计 = 0.032 图 4-2 概率树。每条树枝上写条件概率;从根走到叶,沿途相乘 ,得到这条路径的概率;所有通向“次品”的路径加起来 ,就是总的次品率。
树上的两条规则值得背下来:沿着树枝走,相乘;把几条路径汇总,相加。 后一条有个正式的名字,叫全概率公式 :
P(次品) = P(A 线) × P(次品 | A 线) + P(B 线) × P(次品 | B 线) = 0.012 + 0.020 = 0.032全概率公式:按“来源”把地图切成几块,分块算,再加起来。
现在换一个方向提问:质检员从成品里挑出一个次品,它来自 B 线的概率是多少?这是“看到结果、反推来源”的问题,它将是下一章的主角。先记住这棵树,下一章还要用。
4.3 独立:一件事对另一件事“没透露任何消息”
有时候,消息并不改变概率。蓝骰子掷出几点,对红骰子掷出几点毫无影响。这种情况叫独立 :
A 与 B 独立 ⇔ P(A | B) = P(A) ⇔ P(A 且 B) = P(A) × P(B)知道 B 发生了,对判断 A 毫无帮助。这时“都发生”的概率可以直接相乘。
独立让计算变得非常简单:第 2 章德·梅雷的 (5/6)⁴,就是把 4 次互不影响的“不出 6”相乘。可“能直接相乘”这件事太方便了,方便到人们常常在不该乘的地方也乘 。
独立是
一件事的发生,不改变另一件事的概率
可以把概率直接相乘的前提
需要论证或检验的假设
独立不是
互斥(不能同时发生)——互斥的两件事(只要概率都大于 0)一定不独立:一个发生,另一个就一定不发生
“看起来没关系”——共同的原因会把两件事悄悄绑在一起
对任何重复都自动成立的性质
4.4 赌徒谬误:硬币没有记忆
据记载,1913 年 8 月的一个晚上,蒙特卡洛赌场的一张轮盘连续开出了 26 次黑色。从第十几次开始,赌客们纷纷把重注押在红色上:“连开这么多黑,下一把总该轮到红了。”他们输掉了数以百万计的法郎。
单零轮盘有 18 个黑格、18 个红格、1 个绿格。连开 26 次黑的概率是 (18/37)²⁶,约 1.4 亿分之一,确实罕见。可是在已经开出 25 次黑之后,下一次开红的概率是多少? 还是 18/37。轮盘没有记忆,每一次转动都与之前独立。
这种“前面出得多,后面就该少”的错觉,叫赌徒谬误 。它的根源是把第 1 章的频率面孔用错了:大数定律说的是比例 在长期会稳定,而不是说过去的偏差会被“追回来”。一万次抛硬币里,前面多出的几十次正面不会被“还掉”,它只会在一万次的分母里变得微不足道。第 10 章会把这件事讲透。
有人买彩票专挑“很久没开出的号码”,说它们“该出了”;也有人专挑“最近常出的热号”。谁的策略更好?
如果摇奖机是公正的,每期开奖独立,那么两种策略完全一样:每个号码每期的机会都相同。冷号不会“该出了”,热号也不会“手气正旺”。中奖概率改变不了;买得越多,按第 6 章的期望算,长期亏得越多。(顶多,避开大家爱选的号码,能减少与人平分头奖的可能。)
4.5 当独立被滥用:一个法庭上的教训
赌徒谬误最多让人输钱。把独立用错,后果可以严重得多。
英国律师萨莉·克拉克的两个婴儿,先后在出生后几周内死亡。她被控谋杀。一位知名儿科专家在法庭上作证:像她这样的家庭,一个婴儿发生“婴儿猝死综合征”的概率约为 1/8,543,两个都发生,就是 1/8,543 的平方,约 7300 万分之一 。陪审团判她有罪。
2001 年,英国皇家统计学会发表公开声明,指出这个计算没有统计学依据。2003 年,她的定罪在第二次上诉中被撤销;撤销的直接原因,是一位病理学家未向辩方披露关键的微生物检验结果。
那次计算至少错在两处,本章能看清第一处:两次猝死并不独立。 同一个家庭有共同的基因和环境,一个孩子猝死,意味着这个家庭可能带有某种风险因素,第二个孩子的风险随之上升。把不独立的事件直接相乘,会把概率压得荒谬地小。
第二处错误更隐蔽:即使“两次都是自然死亡”的概率真的很小,那也不等于“她无罪”的概率很小。“无辜者遇到这种事的概率”和“遇到这种事的人是无辜者的概率”,是两个完全不同的数。把它们混为一谈,有个专门的名字:检察官谬误 。要把它们分开,需要下一章的工具。
4.6 火箭有多可靠
第 1 章的问题:一万个零件,每个 99.99% 可靠,整枚火箭有多可靠?
假设每个零件都必须正常工作(这叫串联 ),且它们的故障彼此独立,那么整体可靠性就是一万个 0.9999 相乘:
0.9999¹⁰⁰⁰⁰ ≈ 0.37 。
每个零件“万无一失”,整枚火箭却只有约三成七的把握。这个数恰好接近 1/e(e ≈ 2.718,自然常数;第 8 章会看到它为什么总是出现)。可靠性工程的第一课就在这里:零件越多,每个零件就必须越可靠。
1 10 100 1,000 10,000 100,000 0 50% 100% 单件 99% 单件 99.9% 单件 99.99% 串联的零件数(对数刻度) 整体可靠性 图 4-3 串联系统的可靠性随零件数下降。三条曲线有同一个规律:当零件数达到“单件失效率的倒数”时,整体可靠性都跌到约 37%。
工程师的对策是冗余 :关键部件装两套,只要有一套工作就行(这叫并联 )。如果每套失效的概率是 1%,且彼此独立,两套同时失效的概率就是 1% × 1% = 0.01%。独立在这里成了朋友。
但这份“朋友”的前提同样是独立。1986 年“挑战者号”航天飞机的固体火箭助推器接缝处,设计了主、副两道 O 形密封圈,第二道本应是冗余。可发射当天气温极低,低温让两道密封圈同时变硬、失去弹性——一个共同原因,让两套“独立”的备份一起失效。 工程上把这类问题叫“共因失效”。在第 14 章,我们还会回到航天。
证据来了,就更新 ——在缩小后的地图里重新量。
本章带走
条件概率 = 缩小地图后重新量面积;独立 = 消息不改变地图上的比例。
P(A | B) = P(A 且 B) ÷ P(B);P(A 且 B) = P(B) × P(A | B)。
概率树:沿枝相乘,汇总相加(全概率公式)。
独立才能直接相乘;互斥不是独立;共同原因会破坏独立。
轮盘没有记忆:赌徒谬误把长期比例误当成必须补上的配额。
于是,下一个问题 条件概率让我们从“原因”推“结果”。生活中更常见的却是反过来:看到了结果,要猜原因。
上一章留下的问题: 条件概率让我们从“原因”推“结果”。生活中更常见的却是反过来:看到了结果,要猜原因。
医生看到检查结果,要判断病因;侦探看到现场痕迹,要推断凶手;地质学家看到地震波的回声,要猜地下有没有油;搜救队听不到信号,要重新判断飞机在哪。它们都是同一个问题:已知结果,反推原因有多大可能。
本章的工具只有一行公式,却可能是整个概率论里最有用的一行。我们先用它解一道让大多数医生答错的题,再用它彻底解开序章的三扇门。
5.1 医生的难题
某种疾病在某个年龄段人群中的患病率是 1%。一项筛查:患者中 90% 会被查出阳性;健康人中也有 9% 会被误报为阳性。一位女士筛查结果为阳性。她真正患病的概率大约是多少?
心理学家吉仁泽(Gerd Gigerenzer)和同事把这道题(数字与此相同)交给 160 位妇科医生。据他们 2007 年的报告,只有约 21% 的医生选了正确答案。最多的人选了 90% 或 81%。
正确答案是约 10% 。如果你也选错了,别急着沮丧,先看看它为什么反直觉。
5.2 换个说法:数人头
“1%”“90%”“9%”这种写法,要求你在脑子里做条件概率的乘除,大脑并不擅长。换一种说法,把百分数变成具体的人数 ,这叫“自然频数”:
第一, 想象 1,000 位女士。患病率 1%:其中 10 人 患病,990 人健康。
第二, 10 位患者中 90% 查出阳性:9 人 阳性。
第三, 990 位健康人中 9% 被误报:约 89 人 阳性。
第四, 所有阳性的人:9 + 89 = 98 人。其中真正患病的:9 人。
1,000 人,每个点是一个人 患病且阳性 9 人 患病但漏检 1 人 健康却阳性 89 人 健康且阴性 901 人 阳性共 98 人 其中真患病 9 人 9 ÷ 98 ≈ 9% 图 5-1 1,000 个人的自然频数。红点(患病且阳性)只有 9 个,琥珀色的点(健康却阳性)有 89 个。一个阳性结果,更可能来自后者。
9 ÷ 98 ≈ 9%。一旦画成人数,答案几乎是“看出来”的。
错觉从哪里来?健康人太多了。 9% 的误报率看起来不高,可它乘的是 990 个健康人;90% 的检出率看起来很高,可它乘的只是 10 个患者。一个很小的比例乘以一个很大的人群,照样压倒一个很大的比例乘以一个很小的人群。
那个被忽略的“1%”叫基础比率 (或先验 ):在看到任何检测结果之前,这件事本来有多常见。忽略它而犯的错,叫基础比率谬误 。
5.3 把数人头写成公式
把上面四步抽象一下,就是贝叶斯定理。设 H 是我们关心的原因(患病),E 是看到的证据(阳性):
P(H | E ) = P(E | H ) × P(H ) ÷ P(E )后验 = 似然 × 先验 ÷ 证据的总概率。分母 P(E) 用第 4 章的全概率公式算:所有能产生这条证据的路径加起来。
公式里的四个词各有含义,值得逐个认识:
表 5-1 贝叶斯定理的四个部件(以筛查为例)
名称 符号 含义 本例
先验 P(H) 看到证据之前 ,原因有多常见 1%
似然 P(E | H) 假如原因成立,出现这条证据的可能 90%
证据总概率 P(E) 不论原因如何,出现这条证据的总可能 0.9% + 8.9% = 9.8%
后验 P(H | E) 看到证据之后 ,原因的可能 0.9% ÷ 9.8% ≈ 9.2%
用第 4 章的工厂验证一下:挑出一个次品,它来自 B 线的概率是多少?先验 P(B 线) = 0.4,似然 P(次品 | B 线) = 0.05,证据总概率 P(次品) = 0.032(第 4 章已算出)。后验 = 0.05 × 0.4 ÷ 0.032 = 62.5% 。B 线只生产四成的零件,却贡献了六成多的次品。
类比
贝叶斯定理像一台天平。一边是先验:这种原因本来有多常见;另一边是似然:这种原因有多擅长“制造”眼前的证据。后验就是天平最后的倾斜程度。
筛查题里,“患病”在似然上占优(90% 对 9%),可“健康”在先验上占了 99 : 1 的压倒优势,天平仍然偏向健康。类比的边界:真正的天平只称两样东西,贝叶斯可以同时比较任意多个原因(三扇门就有三个)。
5.4 先验改变一切
同一项检测,用在不同人群里,阳性的含义天差地别。保持检出率 90%、误报率 9% 不变,只改变患病率:
表 5-2 同一项检测,在不同先验下的“阳性含金量”
人群 患病率(先验) 阳性者真患病(后验)
大规模普查,罕见病 0.1% 1.0%
本节例题 1% 9.2%
有症状、医生怀疑后转诊 10% 52.6%
高度疑似病例 50% 90.9%
这就是为什么医生不会给所有人做所有检查:在先验很低的人群里,阳性结果大多是误报。 也是为什么阳性之后通常要做第二项、更精确的检查。
第 4 章留下的“检察官谬误”,现在也能看清了。“一个无辜的母亲遇到两次婴儿猝死的概率很小”,是似然 P(证据 | 无辜);法庭真正需要的,是后验 P(无辜 | 证据)。要从前者得到后者,必须把“无辜母亲遇到两次猝死”和“母亲两次杀害婴儿”这两种罕见情况放在一起比 ——后者同样十分罕见。只报前一个数,就像只告诉你“健康人被误报的概率只有 9%”,却不提健康人有 990 个。
5.5 三扇门的最终揭晓
现在回到序章。用贝叶斯的四个部件,一步一步来。
原因(H): 车在 1 号、2 号或 3 号门后。
先验: 各 1/3。
证据(E): 你选了 1 号门,主持人打开了 3 号门,是羊。
似然: 这是整道题的关键,要问三次。
假如车在 1 号门后(你选中了),主持人会开 3 号门的可能是多少?
2 号、3 号都是羊,他随便开一扇,开 3 号的可能是 1/2。
假如车在 2 号门后呢?
他不能开你选的 1 号,也不能开有车的 2 号,只能开 3 号。可能性是 1。
假如车在 3 号门后呢?
他绝不会打开有车的门。可能性是 0。
那么哪个原因最擅长“制造”眼前这条证据?
车在 2 号门后。它让“开 3 号门”成为必然;车在 1 号门后,只让它成为五五开。
车在 1 号门 车在 2 号门 车在 3 号门 先验 开门前,车在 各门后的概率 1/3 1/3 1/3 似然 假如车在这扇门后, 主持人会开 3 号门 的可能性 1/2 1 0 后验 看到主持人 开了 3 号门之后 1/3 2/3 0 先验 × 似然 = 1/6、1/3、0 → 按比例放大到合计为 1 → 后验 图 5-2 用贝叶斯解三扇门。先验一样,似然不一样:主持人的知情让“车在 2 号门”对证据的解释力是“车在 1 号门”的两倍。后验因此是 1/3 对 2/3。
先验 × 似然:1/3 × 1/2 = 1/6,1/3 × 1 = 1/3,1/3 × 0 = 0。三项加起来是 1/2,这就是证据的总概率 P(E)。各自除以 1/2,后验是 1/3、2/3、0 。换门赢的概率是 2/3。
回头看那些博士的错误:他们默认主持人开 3 号门这件事,对“车在 1 号”和“车在 2 号”一视同仁 ,也就是把两个似然都当成了一样。这正是“两扇门对称”的错觉。真正打破对称的,是主持人的知情与约束 。
如果主持人不知道车在哪,只是随手打开了另一扇门,碰巧是羊。这时换门还有利吗?
重新算似然:车在 1 号门时,他随手开 3 号门且是羊的可能是 1/2;车在 2 号门时,他随手开 3 号门(是羊)的可能也是 1/2;车在 3 号门时,开 3 号门会露出车,不符合“是羊”的证据,可能为 0。先验 × 似然 = 1/6、1/6、0,后验是 1/2、1/2、0。换不换真的一样。 同样的画面,只因为主持人“知不知道”,答案就变了——概率取决于信息是怎样产生的。
5.6 后验变成下一轮的先验
贝叶斯最强大的地方在于它可以一轮一轮地做 。筛查阳性之后,那位女士患病的概率是 9.2%。如果她再做一次检测,又是阳性呢?(前提是两次检测的误差彼此独立;同一种检测重复做往往不满足,所以临床上常换一种检测来确认。)
这时,第一次的后验 9.2% 就成了第二次的先验。重新算一遍:约 50% 。第三次再阳性,约 91%。每一条新证据,都在上一轮认识的基础上把天平再推一下。
证据来了,就更新。
这句口号有两层意思。第一, 要更新:固守先验、对新证据视而不见,是偏执。第二, 要按比例更新:一条证据该让你改变多少看法,取决于它的似然比——P(证据 | 患病) ÷ P(证据 | 健康),本例是 90% ÷ 9% = 10——而不是它有多醒目。一次阳性不该让你从 1% 跳到 90%,也不该让你无动于衷。
5.7 在大洋底找一架飞机
2009 年 6 月 1 日,法航 447 航班在从里约热内卢飞往巴黎途中坠入大西洋。水面上的残片很快被找到,可沉在几千米深海底的机身和黑匣子,几轮搜索下来毫无踪迹。
2010 年,法国事故调查局请美国一家叫 Metron 的公司做了一次贝叶斯分析。他们把所有信息都写成概率:飞机最后发出的位置、类似事故的漂移规律构成先验地图 ;之前每一轮搜索都“搜过但没找到”,按搜索的可靠程度把这些区域的概率往下调 。他们还考虑了一个被忽视的可能:飞机上的水下定位信标也许根本没工作,所以之前“没听到信号”并不能排除那片区域。
2011 年春,搜索按新地图恢复,不到一周——4 月 3 日——就在高概率区域找到了残骸。
搜索前:先验地图 虚线区合计 67% 搜过虚线区、没找到 虚线区降到 29% 颜色越深 = 残骸在那一格的概率越大(示例参数) 图 5-3 贝叶斯搜索的原理(示例参数)。搜过一片区域而没找到,并不等于“那里没有”,只是那里的概率按“搜到的把握”打了折扣;被扣掉的概率按比例流向其他区域。下一轮就去新的最亮处搜。
早在 1968 年,美国海军搜寻失踪的“蝎子号”核潜艇时,就用过同样的办法。贝叶斯搜索告诉我们一件反直觉的事:“没找到”也是证据。 它和“找到了”一样,会改变地图。
伏笔 B: 看不见地下,怎么决定在哪打井?勘探团队从区域地质资料得到先验(这个盆地里类似构造出油的比例),再用地震勘探的回波数据作为证据更新它;甚至一口“干井”也是证据,会改写整片区域的概率地图。第 14 章细说。
伏笔 D: 检测准确率 90%,阳性就等于 90% 患病吗?不是。阳性的含金量取决于先验:在患病率 1% 的人群里,只有约 9%。至于新药怎样被证明“有效”,那需要第 13 章的假设检验。
贝叶斯思维是
先问“这件事本来有多常见”(先验)
再问“这条证据在各种原因下出现的可能”(似然)
按比例更新,并把后验当作下一轮的先验
贝叶斯思维不是
把 P(证据 | 原因) 当成 P(原因 | 证据)
先验想定多少就定多少、从不校正
一条醒目的证据就推翻一切
本章带走
后验 = 先验 × 似然,再按比例放大到合计为 1。
把百分数换成人数(自然频数),贝叶斯题大多能“看出来”。
先验很低时,即使检测很准,阳性也大多是误报——基础比率不能丢。
三扇门:主持人的知情让两扇门的似然不同,后验 1/3 对 2/3。
后验成为下一轮的先验;“没找到”也是证据。
于是,下一个问题 到此为止,我们只关心“某件事发生没有”。可很多时候,我们关心的是一个数:赢多少钱、坏几个零件、等几分钟。
上一章留下的问题: 到此为止,我们只关心“某件事发生没有”。可很多时候,我们关心的是一个数:赢多少钱、坏几个零件、等几分钟。
前五章,我们的问题都是“是或否”:下不下雨、中不中奖、患不患病。可决策需要的往往是数量 :这笔投资能赚多少?这批货里会有几个次品?下一班地铁还要等几分钟?本章给不确定的结果贴上数字,然后回答一个惠更斯在 1657 年就问过的问题:平均能得到多少?
6.1 随机变量:给每个结果贴一个价签
随机变量 这个名字起得不太好:它既不“随机”,也不是通常意义的“变量”。它其实是一条规则 :给样本空间里的每一个结果,贴上一个数字。
类比
想象超市货架上的每件商品(样本空间里的每个结果)都贴着一张价签(随机变量的值)。你闭着眼随手拿一件,拿到哪件是不确定的,但每件商品的价签是事先定好的 。“随机”来自你拿到哪一件,而不是价签本身。
掷两颗骰子,把每个结果贴上“点数之和”:(3,4) 贴 7,(6,6) 贴 12。这是一个随机变量,常记作 X 。
抽检 20 个零件,贴上“次品个数”:0、1、2……
一笔投资,贴上“一年后的盈亏”:+3 万、−1 万……
同一个样本空间可以贴很多种价签。两颗骰子既可以贴“点数和”,也可以贴“较大的那个点数”,还可以贴“是否出现双数”。选哪种价签,取决于你关心什么。
6.2 分布:每个价签有多大分量
贴好价签后,我们关心的是:每个数值出现的概率各是多少?把所有可能的值和它们的概率列成一张表或一幅图,就叫这个随机变量的分布 (离散情形也叫“分布列”)。
两颗骰子的点数和:从第 3 章的 36 格里数一数就知道,和为 7 的有 6 格,和为 6 或 8 的各 5 格……和为 2 或 12 的各 1 格。
1/36 2 2/36 3 3/36 4 4/36 5 5/36 6 6/36 7 5/36 8 4/36 9 3/36 10 2/36 11 1/36 12 平衡点 = 期望 = 7 概率(每格 1/36) 点数和 图 6-1 两颗骰子点数和的分布,以及它的平衡点。所有柱子的高度加起来是 36/36 = 1——分布就是把第 2 章那“总面积为 1 的地图”按数值重新摊开。
分布是随机变量的“身份证”:只要知道分布,关于这个随机量的一切概率问题都能回答。比如“点数和不超过 4 的概率”,就是把 2、3、4 三根柱子加起来:(1 + 2 + 3)/36 = 1/6。这种“从最小值一路累加到某个数”的量有个名字,叫分布函数 ,记作 F (x ) = P(X ≤ x )。到第 9 章处理连续的数时,它会成为主角。
6.3 期望:分布的平衡点
分布包含了全部信息,可有时我们只想要一个数来概括它:平均会得到多少?
掷一颗骰子一万次,把点数全加起来再除以一万,大概会得到多少?
1 到 6 每个大约各出现一万次的六分之一,平均应该是 (1+2+3+4+5+6)/6 = 3.5。
如果骰子被做了手脚,6 点出现的概率是一半,其余五个点各占十分之一呢?
那就不能简单地除以 6 了。6 出现得多,应该给它更大的分量:1×0.1 + 2×0.1 + 3×0.1 + 4×0.1 + 5×0.1 + 6×0.5 = 4.5。
所以一般的做法是?
每个值乘以它的概率,再全部加起来。
E[X ] = Σ(每个可能的值 × 它的概率)期望(expectation),也叫均值。E 是 expectation 的首字母;Σ(读作“西格玛”)表示“全部加起来”。
几何上,期望有一个很好的图像:把分布的柱子想成砝码摆在一块木板上,期望就是木板能平衡的那个支点 (图 6-1)。两颗骰子的分布左右对称,平衡点正好在 7。
期望是
期望有限时,大量重复的平均值会稳定到的那个数
分布的“重心”或平衡点
公平价格的起点
期望不是
“最可能出现的值”(骰子永远掷不出 3.5)
“一半机会比它大、一半比它小”的值(那是中位数)
单次一定能拿到的数
6.4 一张彩票值多少钱
惠更斯的问题:一张彩票,公平价格是多少? 答案就是它的期望。以双色球为例,每注 2 元。固定奖级的奖金是公开的;一、二等奖的奖金随奖池浮动,这里各取一个示例值。
表 6-1 一注双色球的期望奖金(一、二等奖金为示例值)
奖级 中奖概率(约) 奖金(元) 概率 × 奖金(元)
一等 1/17,721,088 5,000,000 0.28
二等 1/1,181,406 200,000 0.17
三等 1/109,389 3,000 0.03
四等 1/2,303 200 0.09
五等 1/129 10 0.08
六等 1/17 5 0.29
合计 约 1/15 中任意奖 约 0.94
中奖概率由组合数算出(方法见第 3 章)。未计个人所得税。据公开的规则说明,销售额中约 49% 用于当期奖金、另有约 2% 进入调节基金,与本表“期望约为售价一半”的量级一致。
花 2 元,期望拿回约 0.94 元。从期望看,每买一注,平均亏掉一半多。 这不是说买彩票一定是“傻”,人们买的也许是一周的念想;但你应该清楚自己在为什么付钱。
保险也是“期望为负”的:保险公司要付房租和工资,还要赚钱,所以你交的保费一定高于你的期望赔付。那为什么买保险可能是明智的,而买彩票通常不是?
两者的期望都是负的,差别在分布的形状 。保险把“小概率的毁灭性损失”(房子烧了、得了重病)换成“确定的小额支出”,压缩了坏结局;彩票把“确定的小额支出”换成“小概率的巨额收入”,你的日子本来不会因为没中奖而崩溃。只看期望,看不出这种差别。这正是下一章要讲的:既看平均,也看分布。
6.5 期望的超能力:可以拆开来加
期望有一条性质,用起来像魔法:
E[X + Y ] = E[X ] + E[Y ]期望的线性性:和的期望 = 期望的和。无论 X 与 Y 是否独立,都成立。
两颗骰子的点数和,期望就是 3.5 + 3.5 = 7,不用画分布。更神奇的是它在复杂问题上的威力。
一场晚会,n 位客人把帽子存进衣帽间。散场时服务员把帽子弄乱了,随机还给每个人一顶。平均有几个人拿回了自己的帽子?
直接去数所有可能的发还方式,会陷入复杂的排列计算。换个思路:给第 i 位客人配一个“小开关” I i ,拿回自己的帽子记 1,否则记 0。拿回帽子的总人数就是所有开关之和。
每个人拿回自己帽子的概率是 1/n ,所以每个开关的期望是 1/n 。
n 个开关的期望加起来:n × 1/n = 1 。
不论是 3 位客人还是 3000 位,平均都恰好有 1 个人拿回自己的帽子。各个开关之间明明互相牵连(一个人拿了别人的帽子,就影响了别人),可线性性并不在乎。
同样的技巧也能用在第 3 章的生日问题上:23 个人有 253 对,每对同生日的概率是 1/365,所以平均 有 253/365 ≈ 0.69 对同生日。
6.6 圣彼得堡悖论:期望不是一切
1713 年,尼古拉·伯努利(雅各布的侄子)提出了一个让期望陷入尴尬的游戏:
抛一枚硬币,直到出现正面为止。第 1 次就出正面,你得 2 元;第 2 次才出,得 4 元;第 3 次得 8 元……第 k 次得 2ᵏ 元。你愿意花多少钱玩一次?
算期望:第 1 次正面的概率 1/2,奖金 2 元,贡献 1 元;第 2 次的概率 1/4,奖金 4 元,又贡献 1 元……每一项都贡献 1 元,无穷多项加起来——期望是无穷大 。按惠更斯的逻辑,你应该愿意倾家荡产去玩一次。可几乎没有人愿意付超过二三十元。
1 10 100 1,000 10,000 100,000 1,000,000 0 20 40 60 一次巨奖,平均被推到 74 元 一百万局后约 58 元 已玩局数(对数刻度) 每局平均收入(元) 图 6-2 模拟一百万局圣彼得堡游戏(固定随机种子)。每局平均收入不收敛,而是隔一阵被一次罕见的巨奖推高一截。期望无穷大,但要“兑现”它,需要天文数字的局数和一个永不破产的庄家。
问题出在哪里?1738 年,尼古拉的堂弟丹尼尔·伯努利给出了一个影响深远的回答:钱的价值不是线性的。 对一个穷人,多 1000 元改变生活;对一个富翁,多 1000 元毫无感觉。人们在意的不是钱的期望,而是“满足感”的期望。这个想法后来发展成经济学里的“效用理论”。
还有一个更朴素的原因:现实里没有无限有钱的庄家。 如果庄家最多只能付 100 万元,超过的部分都截断,这个游戏的期望就只剩约 21 元(前 19 项各贡献 1 元,其余被截断的部分合计约 2 元)。
既看平均,也看分布。
本章带走
随机变量是给每个结果贴的价签;期望是分布的平衡点,也是大量重复时平均值的去向。
分布 = 每个值及其概率;所有概率加起来是 1。
E[X] = Σ 值 × 概率;它不必是一个能实际出现的值。
期望的线性性:和的期望 = 期望的和,不需要独立。
一注双色球的期望约为售价的一半;圣彼得堡游戏的期望无穷,却没人愿意高价去玩——期望不是决策的全部。
于是,下一个问题 两个赌局期望相同,一个稳稳当当,一个可能让你倾家荡产。期望看不出这种差别——什么能看出?
上一章留下的问题: 两个赌局期望相同,一个稳稳当当,一个可能让你倾家荡产。期望看不出这种差别——什么能看出?
一条河的平均水深 1 米,你敢不敢蹚过去?这取决于它是处处 1 米,还是一半地方 10 厘米、一半地方 2 米。平均数只告诉你中心在哪里,却不告诉你离中心有多远 。本章给“有多分散”找一把尺子,然后用它解开第 1 章的伏笔 C:年均收益 10%,为什么很多人亏了钱。
7.1 同样的平均,不同的命运
设想两个选择。甲:一半机会拿 90 元,一半机会拿 110 元。乙:一半机会拿 0 元,一半机会拿 200 元。两者的期望都是 100 元。
甲:稳 标准差 10 元 0 100 200 1/2 1/2 期望 100 结果(元) 乙:险 标准差 100 元 0 100 200 1/2 1/2 期望 100 结果(元) 图 7-1 期望相同,分布不同。甲的结果紧挨着 100 元,乙的结果离 100 元很远。我们需要一个数,描述结果离期望“通常有多远”。
怎样用一个数描述“离期望有多远”?先试试:把每个结果与期望的差距,按概率平均一下。
甲:(90 − 100) × 1/2 + (110 − 100) × 1/2 = 0。乙也是 0。不行,正负抵消了。
那就去掉正负号。有两种办法:取绝对值,或者平方。
取绝对值,甲是 10,乙是 100。平方的话,甲是 100,乙是 10,000。
平方后单位也变成了“元的平方”。怎么变回来?
再开个平方根:甲 10 元,乙 100 元。
7.2 方差与标准差
“差距平方的平均”叫方差 ,它的平方根叫标准差 :
Var(X ) = E[(X − μ)²], σ = √Var(X )μ(读作“缪”)是期望 E[X];σ(读作“西格玛”,小写)是标准差,与 X 同一单位。常用的等价算法:Var(X) = E[X²] − μ²。
一颗骰子:μ = 3.5,E[X ²] = (1 + 4 + 9 + 16 + 25 + 36)/6 = 91/6,所以方差 = 91/6 − 3.5² ≈ 2.92,标准差约 1.71。意思是:掷出的点数通常离 3.5 大约一个半到两个点。
取绝对值明明更直观,为什么数学家偏爱平方?
两个原因。第一, 平方处处光滑,便于求导和优化(最小二乘法就是这么来的)。第二, 也是更重要的:独立随机量相加时,方差可以直接相加 ,就像直角三角形的两条直角边,平方和等于斜边的平方。绝对值没有这个性质。7.5 节会用到它。
在投资里,收益率的标准差有个通俗的名字:波动率 。在工厂里,零件尺寸的标准差决定了次品率。在天气预报里,温度预报的标准差决定了你该不该多带一件外套。标准差是“不确定”的尺寸。
7.3 年均 10%,为什么会亏钱
回到第 1 章的伏笔 C。设想一只基金(示例),每年的表现像抛硬币:一半机会涨 60%,一半机会跌 40%。
这只基金的“年均收益”(期望收益率)是 (60% − 40%)/2 = 10%。你持有 20 年,下面哪个说法对?
大多数人会赚钱,因为每年平均赚 10% 赚赔各一半 大多数人会亏钱
先看两年。最典型的情况是一年涨、一年跌:1 × 1.6 × 0.6 = 0.96 。涨 60% 再跌 40%,或者先跌后涨,结局都是亏 4%。原因在于:跌是从一个更大的数上跌,涨是从一个更小的数上涨。
20 年里,大约有 10 年涨、10 年跌,典型的结局是 0.96¹⁰ ≈ 0.66 ,亏掉三分之一。要想不亏,20 年里至少要涨 11 年,这个概率只有约 41%。换句话说,约 59% 的人会亏钱。
可是期望呢?每年期望涨 10%,20 年后期望是 1.1²⁰ ≈ 6.7 倍 。两个数怎么差这么多?
0 5 10 15 20 0.001 0.01 0.1 1 10 100 期望 6.7 倍 中位数 0.66 倍 持有年数 财富(起点 = 1,对数刻度) 灰线:其中 40 位投资者;一万人中 59% 亏损 图 7-2 模拟一万名投资者持有这只示例基金 20 年(固定随机种子)。蓝色虚线是期望,每年涨 10%;红色实线是中位数(排在正中间那个人),每年缩水约 2%。期望被少数格外幸运的人拉高:本书模拟中,最幸运的 1% 投资者拥有全体财富的约四成。
“年均收益 10%”说的是期望 ,也就是所有可能结局按概率的平均。可是你只活一次,你的财富走的是一条 路径。当波动很大时,这条典型路径的增长率会远远低于期望,甚至为负。决定你典型结局的,不是算术平均收益,而是几何平均收益 :√(1.6 × 0.6) − 1 ≈ −2%。
7.4 波动拖累:方差吃掉的收益
这个现象有一个简洁的近似公式:
几何平均收益 ≈ 算术平均收益 − σ² / 2波动越大,“典型”增长率就被拖得越低。这是近似式,波动很大时误差会变大。
本例中,算术平均 10%,年波动率 σ = 50%(涨跌离 10% 各差 50 个百分点),σ²/2 = 12.5%。近似得到 10% − 12.5% = −2.5%,与精确值 −2.0% 相近。
这就是为什么投资者关心波动:方差不只是“让人心惊肉跳”,它直接吃掉长期收益。 1956 年,贝尔实验室的凯利给出了一个著名的公式,告诉赌徒和投资者每次该下多大的注,才能让长期几何增长最快。它的精神是:下注太重,哪怕每一注的期望都为正,也会被波动拖进深渊。第 14 章会再回到这一点。
7.5 分散:把鸡蛋放进不同的篮子
标准差有一条和期望同样重要的运算规则:
若 X 与 Y 独立:Var(X + Y ) = Var(X ) + Var(Y )注意是方差相加,不是标准差相加。所以两个标准差 3 与 4 的独立量相加,和的标准差是 √(9 + 16) = 5,而不是 7。
这条规则带来一个意外的推论。把钱平均分给 n 项彼此独立、波动都是 σ 的资产,组合的波动是:
σ组合 = σ / √n 平均 n 个独立量,波动缩小到 1/√n。这条“√n 法则”会在第 10、11 章反复出现。
分成 4 份,波动减半;分成 25 份,只剩五分之一。可现实中的资产很少彼此独立:经济不好时,大多数股票一起跌。
1 10 20 30 40 50 0% 5% 10% 15% 20% 彼此独立:σ/√n 相关系数 0.3 分散的下限 ≈ 11% 组合中的资产数 n 组合的波动(标准差) 图 7-3 分散的威力与极限。资产彼此独立时,波动随 1/√n 一路下降;只要两两之间有一点相关(这里 0.3),波动就会停在一个“地板”上。能分散掉的只是各自的风险,所有资产共同承受的那部分风险分散不掉。
这张图也解释了保险公司为什么能经营:一万份互不相关的车险,赔付总额的相对波动非常小。可一场大地震或大洪水会让大量保单同时 出险,相关性一下子变高,分散失效。这就是为什么保险公司自己也要买保险(叫“再保险”)。
7.6 切比雪夫的保证
标准差告诉我们结果“通常”离期望多远。能不能说得更硬一点:离得很远的概率,最多有多大?
1867 年,俄国数学家切比雪夫证明了一个对任何方差有限的分布 都成立的保证(法国数学家比耐梅在 1853 年已得到同样的结果,所以它有时也叫比耐梅—切比雪夫不等式):
P( |X − μ| ≥ k σ ) ≤ 1 / k ²切比雪夫不等式:离期望超过 k 个标准差的概率,不超过 1/k²。
超过 2 个标准差:不超过 25%。
超过 3 个标准差:不超过约 11%。
超过 10 个标准差:不超过 1%。
这个保证很“松”:对于第 9 章的钟形分布,超过 2 个标准差的实际概率只有约 4.6%。但它的价值在于不挑分布 ,你对分布一无所知时,它依然成立。第 10 章,我们正是用它证明大数定律。
方差(风险)衡量的是
结果偏离期望的典型幅度,向上向下都算
“有多难预测”
长期复利被拖累的程度
方差不等于
“坏事”——风险投资靠的正是高方差里的少数大赢家
最坏情况有多坏(那要看分布的尾部,第 11 章)
对任何人都一样的代价(承受力不同,同一方差意义不同)
既看平均,也看分布。
本章带走
期望说中心在哪,标准差说离中心多远;只看期望做决策,会被方差偷袭。
方差 = 偏差平方的平均;标准差 = 方差的平方根,与原量同单位。
一半涨 60%、一半跌 40%:期望年增 10%,典型路径年缩 2%,20 年后约 59% 的人亏钱。
几何平均 ≈ 算术平均 − σ²/2:波动直接吃掉复利。
独立量相加,方差相加;平均 n 个独立量,波动缩到 1/√n;相关性给分散设了下限。
切比雪夫:离期望 k 个标准差以外的概率 ≤ 1/k²,对任何方差有限的分布都成立。
于是,下一个问题 期望与方差是随机量的两项体检指标。现实里反复出现几种固定的随机模式——它们各自长什么样?
上一章留下的问题: 期望与方差是随机量的两项体检指标。现实里反复出现几种固定的随机模式——它们各自长什么样?
化学里有元素周期表:一百多种元素组合出万千物质。概率里也有类似的东西:少数几种“标准分布”,组合出现实中绝大多数随机现象。 认识了它们,你面对一个新问题时,第一件事就是问:“它像哪一种?”
本章介绍“数个数”的三种分布。它们都从同一块最小的积木长出来。
8.1 最小的积木:一次“是或否”
一次只有两种结果的试验:投篮进或不进、零件合格或不合格、用户点击或不点击。把“是”记 1、“否”记 0,“是”的概率为 p 。这叫伯努利试验 ,以第 2 章那位花了 20 年证明大数定律的雅各布·伯努利命名。
它的期望是 p (1 × p + 0 × (1 − p )),方差是 p (1 − p )。注意方差在 p = 0.5 时最大:五五开的事情最难猜。
从这块积木出发,问三种不同的问题,就长出三种分布:
做 n 次,成功几次? → 二项分布
要做几次,才第一次成功? → 几何分布
次数极多、每次成功概率极小,一段时间内成功几次? → 泊松分布
8.2 二项分布:做 n 次,成功几次
一条生产线的次品率是 5%。随机抽检 20 个零件,恰好有 2 个次品的概率是多少?
先想一种具体情况:前两个是次品,后 18 个合格。它的概率是?
假设各个零件互不影响(独立),就是 0.05 × 0.05 × 0.95¹⁸。
“第 3 个和第 7 个是次品,其余合格”呢?
还是 0.05² × 0.95¹⁸。只要是 2 个次品、18 个合格,不管位置在哪,概率都一样。
那么这样的“位置安排”一共有几种?
从 20 个位置里选 2 个放次品,顺序无关——第 3 章的组合数 C(20, 2) = 190 种。
P(X = k ) = C(n , k ) × p k × (1 − p )n−k 二项分布:n 次独立试验、每次成功概率 p,恰好成功 k 次的概率。组合数负责“位置”,乘方负责“每种位置的概率”。
代入数字:190 × 0.05² × 0.95¹⁸ ≈ 18.9%。
它的期望和方差不需要硬算。X 是 n 个伯努利开关之和,由第 6 章的线性性,期望是 np ;这些开关彼此独立,由第 7 章的方差可加性,方差是 np (1 − p )。抽检 20 个,平均有 1 个次品。
抛 10 次硬币:正面几次? n = 10,p = 0.5 0 1 2 3 11.7% 4 5 24.6% 6 7 11.7% 8 9 10 抽检 20 个零件:几个次品? n = 20,p = 0.05 0 35.8% 1 37.7% 2 18.9% 3 4 5 6 横轴:发生次数 纵轴:概率 图 8-1 两个二项分布。p = 0.5 时左右对称;p 很小时挤在左边。抽检 20 个零件,一个次品都没有的概率是 35.8%——所以“这批一个次品也没抽到”并不能证明次品率为 0。
一位篮球运动员罚球命中率 80%。一场比赛罚 10 次,全部命中的概率是多少?至少命中 8 次呢?
全中:0.8¹⁰ ≈ 10.7%。至少 8 次:P(8) + P(9) + P(10) = C(10,8)·0.8⁸·0.2² + C(10,9)·0.8⁹·0.2 + 0.8¹⁰ ≈ 30.2% + 26.8% + 10.7% ≈ 67.8%。一个 80% 的罚球手,每三场里大约有一场会罚丢 3 个以上,这并不说明他“状态不好”。
8.3 几何分布:要等几次
掷一颗骰子,直到出现 6 为止。要掷几次?
第 1 次就出 6:概率 1/6。第 1 次没出、第 2 次出:5/6 × 1/6。第 k 次才第一次出 6:前 k − 1 次都失败,再成功一次:
P(第 k 次首次成功) = (1 − p )k−1 × p , 平均要等 1/p 次几何分布。成功概率 1/6,平均要等 6 次;成功概率 1%,平均要等 100 次。
0.05 0.10 0.15 1 5 10 15 20 平均要等 6 次 超过 10 次:约 16% 第几次掷出第一个 6 概率 图 8-2 等待第一个 6。最可能的是第 1 次就成功,可平均要等 6 次,而且有约 16% 的时候要等 10 次以上。等待时间的分布有一条长长的尾巴。
几何分布有一个违反直觉的性质,叫无记忆性 :你已经掷了 10 次都没出 6,从现在起还要等几次?答案的分布和一开始完全一样,平均还是 6 次。骰子不知道你已经等了多久。这正是第 4 章赌徒谬误的数学版本。
8.4 泊松分布:稀有事件的计数
一家客服中心平均每分钟接到 2 个电话。下一分钟恰好接到 5 个的概率是多少?
这类问题的共同特点是:机会极多,每个机会发生的概率极小,彼此独立。 城市里有几百万人,每个人在这一分钟打电话的概率都很小;一本书有几十万个字,每个字印错的概率很小;一个军团有几百匹马,每匹马某一年踢死人的概率很小。
把二项分布的 n 推向无穷大、p 推向 0,同时保持平均次数 λ = np 不变,二项分布就收敛成一个只需要一个参数的分布:
P(X = k ) = e−λ λk / k !, 期望 = 方差 = λ泊松分布,1837 年由法国数学家泊松提出。λ(读作“兰姆达”)是平均发生次数;e ≈ 2.718 是自然常数。
客服的例子:λ = 2,P(5) = e⁻² × 2⁵ / 5! ≈ 3.6%。
这里也兑现了第 4 章的一个承诺:为什么 0.9999¹⁰⁰⁰⁰ 恰好约等于 1/e?一万个零件、每个故障概率万分之一,平均故障数 λ = 1。“一个都不坏”的概率近似等于泊松分布的 P(0) = e⁻¹ ≈ 0.368。 第 4 章图 4-3 里三条曲线都在“零件数 = 失效率的倒数”处跌到 37%,原因相同:那里 λ 都等于 1。
8.5 马踢与泊松:一个著名的吻合
俄裔德国统计学家博特基维茨出版了一本小书,书名叫《小数定律》。书里有一组后来被写进无数教科书的数据:普鲁士军队的各个军(army corps)里,每年有多少士兵被马踢死。
后来的统计学家费希尔整理出最常被引用的版本:10 个军团、20 年,一共 200 个“军团·年”,总共 122 人被马踢死,平均每个军团每年 0.61 人。
表 8-1 马踢致死人数:观察与泊松预测
一个军团一年死亡人数 0 1 2 3 4
实际观察(军团·年) 109 65 22 3 1
泊松预测(λ = 0.61) 108.7 66.3 20.2 4.1 0.6
25 50 75 100 109 108.7 0 人 65 66.3 1 人 22 20.2 2 人 3 4.1 3 人 1 0.6 4 人 实际观察(次数) 泊松预测(λ = 0.61) 一个军团一年内被马踢死的人数 图 8-3 马踢数据与泊松预测。只用一个数(平均 0.61),就预测出了整张分布。每一次马踢都是偶然的,200 个军团·年合在一起,却精确地服从一条规律。
马踢是偶然的,某个军团某一年死了 4 个人看起来像“厄运”。可泊松分布说:在 200 个军团·年里,出现一次“4 人”恰恰是意料之中的。这对理解新闻很有用:“某地一周内发生三起同类事故”,未必说明出了什么新问题,也可能只是泊松分布的正常波动。 要判断是不是真的变了,需要第 13 章的检验。
单次不可测,大量有规律。
8.6 分布家族的谱系
表 8-2 “数个数”的分布家族
分布 回答的问题 参数 期望 方差 典型场景
伯努利 一次,成不成? p p p(1−p) 一次点击、一次投篮
二项 n 次,成几次? n, p np np(1−p) 抽检、民调、临床试验有效人数
几何 第几次才成? p 1/p (1−p)/p² 等待、重试、抽卡
泊松 一段时间里发生几次? λ λ λ 来电、事故、突变、网站访问
用这些分布之前,要检查
每次试验是否独立
成功概率是否每次相同
(泊松)事件是否一个一个地、互不影响地发生
这些条件被破坏的例子
传染病:一个病例会引出更多病例,不独立
早晚高峰:来电速率随时间变化,λ 不固定
同一批原料的零件:一坏坏一批,彼此相关
本章带走
一块“是或否”的积木,问三种问题,长出三种分布:二项数成功次数,几何数等待次数,泊松数稀有事件。
二项:C(n,k)·pᵏ·(1−p)ⁿ⁻ᵏ,期望 np;组合数管位置,乘方管概率。
几何:平均等 1/p 次,无记忆——等了很久不会让成功更近。
泊松:期望等于方差等于 λ;“一个都不发生”的概率是 e⁻λ。
马踢数据:一个平均数就预测了整张分布。
于是,下一个问题 这些都是“数个数”的分布。可时间、身高、误差是连续的,恰好等于某个值的概率是 0——那还怎么谈概率?
上一章留下的问题: 这些都是“数个数”的分布。可时间、身高、误差是连续的,恰好等于某个值的概率是 0——那还怎么谈概率?
到目前为止,我们的随机变量都只取一个一个分开的值:0、1、2、3……可世界上大量的量是连续 的:身高、体重、气温、等车的时间、零件的尺寸、股价的涨幅。本章要解决一个看似荒谬的问题,然后认识连续世界里最重要的三种分布。
9.1 一个荒谬的问题
随机找一位成年男性,他的身高恰好 是 170 厘米的概率是多少?
170 厘米很常见,应该挺大的吧,百分之几?
“恰好”是指 170.000000……后面无穷多位都是 0。169.9999 不算,170.0001 也不算。
那……可能的身高有无穷多个值,每个值都分一份,每份只能是 0。
可是每个值的概率都是 0,加起来怎么会是 1?
这就是矛盾所在。也许问题问错了。
问题确实问错了。现实中从来没有人关心“恰好 170.000……”,我们关心的是区间 :身高在 169.5 到 170.5 之间的概率是多少?在 180 以上的概率是多少?对连续的量,概率只属于区间,不属于单个点。 至于“每点为 0、加起来却是 1”的矛盾:第 2 章公理三的“相加”只对可以一个一个数下去的块成立,一条线段上的点多到数不过来,不能逐点相加。
类比
一根 1 米长的铁丝,重 100 克。铁丝上“一个点”有多重?0 克——点没有长度。可一段 1 厘米的铁丝有 1 克重。说“一个点”的重量没有意义,但可以说“每厘米多重”,这叫线密度 。概率也是这样:单点的概率是 0,但可以说“每单位长度有多少概率”,这叫概率密度 。
9.2 从直方图到密度曲线
测量一万名成年男性的身高(示例:均值 170 厘米,标准差 7 厘米),画直方图。先按 10 厘米一组,再按 5 厘米、1 厘米一组。
组距 10 厘米 150 170 190 组距 5 厘米 150 170 190 组距 1 厘米 150 170 190 纵轴 = 每厘米的概率(密度);柱子面积 = 落在该组的概率 图 9-1 组距越细,直方图越贴近一条光滑曲线。为了让不同组距可以比较,纵轴画的是“每厘米的概率”,而不是每组的人数。这条极限曲线就是概率密度曲线 。
这条曲线有两条规则,都是第 2 章那张“面积地图”的延续:
第一, 曲线下、某个区间上方的面积 ,就是随机量落在该区间的概率。
第二, 曲线下的总面积是 1。
P(a < X < b ) = 密度曲线 f (x ) 在 a 与 b 之间围成的面积 = ∫a b f (x ) dx 学过微积分的读者会认出,这是一个积分。没学过也不要紧:只要记住“概率 = 曲线下的面积”。
密度是
“每单位长度上有多少概率”
乘上一小段长度,才近似等于概率
曲线越高的地方,结果越集中
密度不是
概率本身——它可以大于 1(在很窄的区间里堆得很高)
单点的概率——单点的概率永远是 0
第 6 章提过的分布函数 F (x ) = P(X ≤ x ),在连续世界里就是“从最左边一直累积到 x 的面积”。它从 0 爬到 1,爬得最陡的地方,正是密度最高的地方。期望的算法也照搬过来,只是把“求和”换成了“求面积”:E[X ] = ∫ x f (x ) dx 。它依然是密度曲线的平衡点。
9.3 均匀分布:最公平的连续随机
计算机里的“随机数”函数,通常给出 0 到 1 之间的一个数,每一段长度相同的区间机会相同。它的密度是一条水平线,高度为 1。落在 0.2 到 0.5 之间的概率就是这段的长度 0.3。它的期望是 0.5,方差是 1/12。
别小看这个最朴素的分布:几乎所有计算机模拟,都是从 0 到 1 的均匀随机数出发,再“变形”成其他分布的。 本书里所有“模拟”的图,也都是这样生成的。
9.4 指数分布:等待的时间
第 8 章的泊松分布数的是“一段时间里来了几个”。换个问法:下一个要等多久? 如果事件按泊松的方式发生,平均每分钟 λ 次,那么等待时间 T 服从指数分布 :
P(T > t ) = e−λt , 平均等待 1/λ“等了 t 还没等到”的概率随时间指数衰减。
0 10 20 30 40 0 0.05 0.10 10 分钟内 63% 超过 10 分钟:e⁻¹ ≈ 37% 等待时间(分钟) 密度 图 9-2 平均间隔 10 分钟的指数分布。最短的等待最常见,但有 37% 的时候要等 10 分钟以上,13.5% 的时候要等 20 分钟以上。
指数分布继承了几何分布的无记忆性 :已经等了 10 分钟,还要再等多久?分布和刚开始等时一模一样。这听起来荒唐,但在很多场合是真的:放射性原子不会“衰老”,一个已经存在了一万年的碳-14 原子,下一秒衰变的概率和一个刚产生的原子相同。这就是为什么放射性有固定的半衰期 :无论剩下多少,每过一个半衰期,大量原子中都约有一半衰变。
公交车按泊松方式随机到站,平均每 10 分钟一班。你随机时刻到站台,平均要等多久?(直觉答案是 5 分钟)
是 10 分钟。由于无记忆性,从你到达的那一刻起,等下一辆车的时间依然是平均 10 分钟的指数分布。这常被称为“检查悖论”:你随机到达时,更容易落进一个长的 间隔里(长间隔占的时间多),所以你碰上的那个间隔,平均比 10 分钟更长。如果公交车严格每 10 分钟一班,你平均才只需等 5 分钟。准点,就是在减小方差。
9.5 正态分布:钟形曲线
第 2 章的棣莫弗、第 9.2 节的身高直方图、封面的高尔顿板,都指向同一条曲线:中间高、两边低、左右对称,像一口钟。它叫正态分布 ,也叫高斯分布,由两个参数决定:中心位置 μ 和宽窄 σ。
f (x ) = 1/(σ√(2π)) · e−(x−μ)²/(2σ²) 公式不需要背。只要记住:曲线在 μ 处最高;σ 越大,曲线越矮越宽;离 μ 越远,密度下降得越快(指数里是距离的平方,下降极快)。
μ−3σ μ−2σ μ−1σ μ μ+1σ μ+2σ μ+3σ ±3σ:99.7% ±2σ:95.4% ±1σ:68.3% 钟形曲线下的总面积 = 1 图 9-3 68-95-99.7 法则。不论 μ 和 σ 是多少,正态分布落在 ±1σ、±2σ、±3σ 以内的概率都是这三个数。
这三个数值得记住:
约 68% 落在 μ ± 1σ 以内:示例中,约三分之二的男性身高在 163 到 177 厘米之间。
约 95% 落在 μ ± 2σ 以内:156 到 184 厘米。
约 99.7% 落在 μ ± 3σ 以内:超出这个范围的,一千人里只有约 3 人。
对照第 7 章的切比雪夫:对任意分布,超出 ±2σ 的概率不超过 25%;对正态分布,实际只有约 4.6%。知道了分布的形状,保证就能从“松”变“紧”。
9.6 标准化:一把通用的尺子
身高、考试分数、零件尺寸,单位和量级都不同,怎么比较“有多不寻常”?把每个值换算成“离均值几个标准差”:
z = (x − μ) / σz 值(标准分)。换算后,任何正态分布都变成 μ = 0、σ = 1 的“标准正态分布”,只需要一张表。
表 9-1 标准正态分布:常用的 z 值
z 低于 z 的概率 高于 z 的概率 常见用途
0 50.0% 50.0% 正中间
1 84.1% 15.9%
1.28 90.0% 10.0% 前 10%
1.645 95.0% 5.0% 库存服务水平 95%(第 11、14 章)
1.96 97.5% 2.5% 95% 置信区间(第 11、13 章)
2.326 99.0% 1.0% 服务水平 99%
3 99.87% 0.13% “三西格玛”质量控制
例:一位身高 185 厘米的男性,z = (185 − 170)/7 ≈ 2.14,查表或计算可知高于他的人约占 1.6%。
讲到这里,一个问题自然浮现:为什么身高、测量误差、考试成绩、高尔顿板上的弹珠,都偏偏长成这条曲线? 它背后一定有某种普遍的机制。答案要等两章:先在第 10 章弄清“大量”意味着什么,再在第 11 章揭晓钟形曲线的来历。
本章带走
连续的量,单点概率为 0;概率是密度曲线下的面积,总面积为 1。
密度 = 每单位长度的概率,可以大于 1;分布函数 = 从左累积的面积。
均匀分布是一切模拟的起点。
指数分布描述等待:P(T > t) = e⁻λᵗ,无记忆,对应放射性的半衰期。
正态分布:68-95-99.7;用 z = (x − μ)/σ 换成通用的尺子。
于是,下一个问题 我们已经会描述一个随机量。概率论最深刻的发现,却发生在成千上万个随机量叠在一起的时候。
上一章留下的问题: 我们已经会描述一个随机量。概率论最深刻的发现,却发生在成千上万个随机量叠在一起的时候。
走进任何一家赌场,你都能看到两种截然不同的命运。赌桌边的客人,今晚可能大赢,可能大输,谁也说不准。可赌场老板的账本,月月都在稳稳地赚钱,误差小得像一家自来水公司。同一张轮盘,为什么对一个人是赌博,对赌场却是生意?
本章回答全书第一句口号背后的“为什么”,它的名字叫大数定律 。
10.1 掷骰子的平均
第 1 章我们看过抛硬币的比例会稳定下来。现在做一个更一般的实验:五个人各掷十万次骰子,一边掷,一边记录“到目前为止的平均点数”。
1 10 100 1,000 10,000 100,000 1 2 3 4 5 6 期望 3.5 灰色带:3.5 ± 2σ/√n 掷骰次数 n(对数刻度) 平均点数 图 10-1 五条平均点数的轨迹(模拟,固定随机种子)。起初它们在 1 到 6 之间乱跳;随着次数增加,被收进越来越窄的灰色带里。十万次后,五个人的平均分别是 3.498、3.494、3.498、3.494、3.500。
人类也真的做过这种实验。第 1 章提过布丰和皮尔逊抛硬币;最有名的一次来自二战:数学家克里奇在丹麦被德军拘押,在拘押营里闲着没事,抛了一万次硬币,正面 5,067 次。
10.2 大数定律:三行证明
把观察写成一句话:独立重复同一个随机试验,样本平均值会越来越接近期望。 更精确地说:
对任意小的 ε > 0,当 n → ∞ 时,P( |X̄ n − μ| > ε ) → 0弱大数定律。X̄ₙ 是前 n 次的平均;ε(读作“艾普西龙”)是你能容忍的误差。无论你把误差要求定得多严,只要次数足够多,平均值超出误差的概率都可以小到任意程度。
这就是第 2 章雅各布·伯努利花了 20 年证明的“黄金定理”(他证的是“是或否”这类伯努利试验的情形,成功概率可以是任意值)。今天,借助第 7 章的两件工具,证明只要三行:
第一行, 平均值的期望还是 μ(期望的线性性)。
第二行, 平均值的方差是 σ²/n (独立量的方差相加,再除以 n ²)。所以它的标准差是 σ/√n ,这就是图 10-1 里那条越来越窄的灰色带。
第三行, 由切比雪夫不等式:P(|X̄ n − μ| > ε) ≤ σ² / (n ε²)。n 越大,右边越小,最终趋于 0。
证完了。(这个证明额外用到了“方差有限”;只要求期望存在的版本同样成立,只是证明更难。)数学家后来还证明了更强的版本(强大数定律:平均值“几乎必然”收敛到 μ),但直觉是一样的。
类比
大数定律像一大群人齐步走。每个人的步子都有点歪,有人偏左、有人偏右,可一千个人的平均位置几乎走在一条直线上:各自的偏差方向不同,彼此抵消了。
类比的边界:抵消的前提是偏差方向彼此无关(独立)。如果所有人都被同一阵风吹向左边,平均位置也会一起偏。第 7 章的“相关性地板”就是这阵风。
10.3 赌场为什么总是赢
单零轮盘上押红色:18 个红格,18 个黑格,1 个绿色的 0。押 1 元,赢了得 1 元,输了失去 1 元。对赌场来说,每一注的期望利润是:
(+1) × 19/37 + (−1) × 18/37 = 1/37 ≈ 2.7%庄家优势。赌场并不需要作弊,只需要那一个绿格。
2.7% 很小,小到一个客人一晚上根本感觉不到。一个人押 100 注,结果的标准差约是 10 注,远大于 2.7 注的期望亏损,所以运气完全盖过了劣势,他可能大赢。可赌场一个月收下几百万注:
100 1,000 10,000 100,000 1,000,000 1000万 -20% -10% 0 +10% +20% 庄家优势 2.7% 0 以下 = 赌场亏钱的区域 95% 的结果落在绿色带内 赌场收下的注数(对数刻度) 赌场每注平均利润 图 10-2 赌场每注平均利润的 95% 范围。100 注时,赌场有相当的机会亏钱(绿色带跨过 0);一万注时,几乎不会亏;一百万注时,利润率被锁死在 2.7% 附近。对赌场来说,这不是赌博,而是按 2.7% 抽成的生意。
于是全书第一句口号有了精确的含义:
单次不可测,大量有规律。 规律的精度,随 √n 提高。
一位赌客说:“既然每注的期望只亏 2.7%,我只要赢一点就走,不就能赢赌场了吗?”这个策略能改变期望吗?
不能。“见好就收”改变的是结果的分布 :你会有很多次小赢就走,也会有少数几次一直没赢、越陷越深的大输。可每一注的期望都是 −2.7%,把任意多注按任意规则组合,总期望依然是负的(这在数学上叫“不存在能打败负期望游戏的下注系统”)。策略可以改变你赢的次数,改变不了你平均亏多少。
10.4 保险:把个人的不确定,变成集体的确定
赌场利用大数定律赚钱,保险公司利用它提供保障。一个 40 岁的人明年会不会生重病,谁也说不准;十万个 40 岁的人明年有多少人生重病,可以预测得相当准。保险公司按这个比例收保费,每个人交一笔确定的小钱,换掉一个不确定的大风险。
这也是第 2 章那句话的现实版:伯努利的定理为保险业提供了数学上的底气。但要记住它的前提——第 7 章说过,只有彼此近似独立的风险才能被“平均掉” 。一场覆盖整座城市的洪水,会让成千上万张保单同时出险。
10.5 蒙特卡洛:用随机算出确定
数学家乌拉姆大病初愈,在家玩单人纸牌。他想知道一局牌能成功摆完的概率,试图用组合数学去算,发现复杂得无从下手。他转念一想:干脆摆一百局,数数成功了几局,不就行了?
他把这个想法告诉了冯·诺伊曼。两人意识到,刚问世的电子计算机可以飞快地“摆”出成百上千局,用来模拟核反应中中子的随机运动。同事梅特罗波利斯给这个方法起了个代号,取自摩纳哥的赌城:蒙特卡洛 。
蒙特卡洛方法的原理,就是大数定律:想知道一个概率或期望,就大量模拟,让频率替你算。最简单的例子是估计圆周率:
随机撒点:2,000 个 落在四分之一圆内:1,555 个 比例:0.7775 四分之一圆面积 = π/4 π ≈ 4 × 0.7775 = 3.110 误差按 1/√n 缩小: 想多一位准确数字, 要多撒约 100 倍的点 图 10-3 用随机撒点估计 π(模拟,固定随机种子)。落进四分之一圆的比例,趋近于它的面积 π/4。只撒 2,000 个点,得到 3.110,误差约 1%。
2,000 个点只得到 3.110,这恰恰说明了蒙特卡洛的代价:误差按 1/√n 缩小,想多一位准确数字,就要多算 100 倍。 对于 π 这种有公式的数,这很笨;可对于核反应、天气集合预报、期权定价、药物分子模拟、航天器着陆点这类根本写不出公式的问题,蒙特卡洛往往是唯一的办法。本书第 14 章会反复看到它。
10.6 “70% 会下雨”怎样检验
第 1 章说,单独一天下没下雨,无法检验“降水概率 70%”。大数定律给出了检验的办法:把预报员所有说过“70%”的日子收集起来,看其中下雨的比例是不是接近 70%。 对 10%、30%、50%、90% 也一样。这叫校准 (calibration)。
表 10-1 两位预报员的校准检验(示例数据)
预报的降水概率 预报员甲:实际下雨比例 预报员乙:实际下雨比例
10% 11% 3%
30% 28% 12%
50% 52% 31%
70% 69% 55%
90% 88% 80%
示例数据,仅用于说明“校准”的含义。每一行需要足够多的日子(例如上百天),比例才有意义——这本身就是大数定律。
预报员甲“说七成,就真有七成”,他是校准良好的。预报员乙系统性地高估 下雨的可能:他说 70% 的日子,实际只有 55% 下了雨。现实中确实有类似的现象,据纳特·西尔弗在《信号与噪声》中的分析,一些商业气象服务和地方电视台的预报存在明显的“湿偏差”:例如某商业天气频道说“20%”的日子,实际下雨的只有约 5%——宁可让你白带一次伞,也不愿让你挨一次淋。
校准是衡量任何 概率判断的试金石:医生的诊断、投资经理的预测、你自己说的“我有八成把握”。尾章会再回到这一点。
10.7 大数定律不是“平衡法则”
最后,必须给大数定律竖一道围栏,因为它是被误解得最多的定理之一。
抛一万次硬币,正面和反面的次数之差,通常有多大?
大数定律说比例接近一半,那差距应该很小吧,几个?
正面次数的标准差是 √(10000 × 0.5 × 0.5) = 50。正反之差等于“正面数的 2 倍减一万”,标准差是 100。
差距通常有几十到上百次?那比例怎么还会接近一半?
差 100 次,意味着正面约 5,050 次,正面比例 50.5%,只偏了 0.5 个百分点。抛一百万次,差距的标准差涨到 1000,正面比例却只偏约 0.05 个百分点。
所以次数之差在变大,比例之差在变小 。前面多出来的正面,从来没有被“还回去”,只是被越来越大的分母冲淡了。
大数定律说的是
比例 (平均值)会稳定到期望
稳定的速度按 1/√n
前提是独立、同分布、期望存在
大数定律没说
过去的偏差会被“补回来”(赌徒谬误)
次数之差会变小(它反而按 √n 变大)
少量样本也可靠(特沃斯基和卡尼曼称之为“相信小数定律”的错觉,与第 8 章博特基维茨的书名同名不同义)
对期望不存在的分布也成立(第 6 章的圣彼得堡游戏)
最后一条值得多看一眼。图 6-2 里,圣彼得堡游戏的平均收入一直不收敛,正是因为它的期望是无穷大,大数定律的前提不成立。有些随机现象的尾巴太“肥”,大量也救不了。 第 11 章会再遇到它们。
本章带走
独立重复时,平均值会稳定到期望,偏离的幅度按 σ/√n 缩小——这就是“大量有规律”。
证明只需三步:平均的期望是 μ,方差是 σ²/n,再用切比雪夫不等式。
赌场靠 2.7% 的庄家优势和几百万注,把赌博变成生意;保险把个人风险变成集体确定。
蒙特卡洛:用大量随机模拟求确定的答案,精度每提高 10 倍要多算 100 倍。
检验概率判断要看校准:说 70% 的事,是否约 70% 发生了。
比例会收敛,次数之差不会;过去的偏差不会被补回来。
于是,下一个问题 大数定律说平均值终会稳定。可它没说:在稳定之前,平均值是怎样围着真值抖动的?这抖动有没有形状?
上一章留下的问题: 大数定律说平均值终会稳定。可它没说:在稳定之前,平均值是怎样围着真值抖动的?这抖动有没有形状?
身高是钟形的,测量误差是钟形的,考试成绩常常是钟形的,封面上高尔顿板的弹珠也是钟形的。这些东西毫不相干:一个来自基因,一个来自仪器,一个来自试卷,一个来自钉子。为什么它们长成了同一个形状?
本章的答案,被很多统计学家称为概率论里最美的定理。它会同时解开封面高尔顿板的谜,并告诉你为什么一千人的民调就能代表一个国家。
11.1 回到高尔顿板
封面上的高尔顿板有 12 排钉子。弹珠每碰到一颗钉子,向左或向右各有 1/2 的机会,彼此独立。它最后落进哪一格,只取决于一件事:12 次里向右了几次。
弹珠落进最左边那一格,需要怎样走?
12 次全部向左。只有 1 条路线。
落进正中间那一格呢?
6 次向右、6 次向左,顺序随意。路线数是 C(12, 6) = 924 条。
每条具体路线的概率都是 (1/2)¹² = 1/4096。那么中间那一格的概率是?
924/4096 ≈ 22.6%。最边上那一格只有 1/4096 ≈ 0.02%。
所以钟形是从哪里来的?
不是因为中间“更受欢迎”,而是因为通向中间的路线多得多 。左右抵消的走法数不胜数,一路偏到底的走法寥寥无几。
0 1 1 12 2 66 3 220 4 495 5 792 6 924 7 792 8 495 9 220 10 66 11 12 12 1 柱顶数字 = 通向这一格的路线数(共 2¹² = 4096 条) 正中间一格:924 条路线 924 ÷ 4096 ≈ 22.6% 12 次碰钉中向右的次数(= 落入第几格) 图 11-1 高尔顿板就是一个二项分布(第 8 章),n = 12,p = 1/2。柱顶是通往每一格的路线数;蓝色虚线是正态曲线,二者已经很接近。
1733 年,棣莫弗就是这样发现钟形曲线的:他注意到,抛硬币次数很多时,二项分布的柱子顶端会贴近一条光滑曲线。可硬币只是一个特例。真正出人意料的发现是:起点是什么形状,几乎无关紧要。
11.2 从一颗歪骰子出发
硬币本来就是对称的,也许钟形只是对称的产物?我们换一个极不对称的起点:第 6 章那颗做了手脚的骰子,6 点出现的概率是一半,其余五个点各占十分之一。它的分布是一根高柱加一排矮柱,一点都不像钟。
把 30 颗这样的歪骰子一起掷,点数之和的分布会是什么形状?
依然严重偏向高点 一根高柱加一排矮柱,只是位置右移 接近对称的钟形
1 颗之和 1 6 2 颗之和 2 12 5 颗之和 5 30 30 颗之和 110 135 160 横轴:点数之和 起点是一颗“6 点占一半”的骰子(第 6 章) 图 11-2 把歪骰子的点数加起来。1 颗时毫无钟形的影子;2 颗时已经出现一个“肩膀”;5 颗时隐约成钟,但还有一点左偏;30 颗时,与正态曲线几乎重合。以上都是精确计算,不是模拟。
这就是中心极限定理 :
许多独立随机量之和(或平均),只要每个方差有限、且没有哪一个大到能左右总和,无论每一个是什么分布,标准化后的分布都会趋近正态分布若每个量的期望为 μ、标准差为 σ,n 个之和近似服从均值 nμ、标准差 σ√n 的正态分布;n 个的平均近似服从均值 μ、标准差 σ/√n 的正态分布。
第 10 章的大数定律说:平均值会稳定到 μ,偏离幅度按 σ/√n 缩小。中心极限定理补上了后半句:偏离的形状是钟形。 两个定理合起来,“大量”的面貌就完整了:它往哪里去(μ),离得多远(σ/√n ),怎样分布(正态)。
11.3 为什么是钟形?第一性原理
为什么加法会“抹掉”原来的形状?从最朴素的地方想:
第一, 每个随机量都有期望和方差,也有更细的“个性”:偏向哪边、尾巴多长、有几个峰。
第二, 把很多个加在一起时,期望相加,方差相加,这两项会一直保留下来。
第三, 可是“个性”在相加中互相冲淡:这一个偏左,那一个偏右;这一个在这里多一点,那一个在那里多一点。加得越多,个性被抹得越平。
第四, 最后只剩下期望和方差这两项“共性”。而在期望和方差都给定的所有分布里,正态分布恰好是“额外信息最少”(数学上叫熵最大)的那一个。
这就是为什么身高接近正态:它由成百上千个基因和环境因素共同决定,每个因素的贡献都很小,大致相加。测量误差也一样:温度的微小变化、手的微小抖动、仪器的微小噪声,许多小扰动叠在一起。
类比
中心极限定理像一大锅汤。你往里面加了胡萝卜、洋葱、番茄、骨头,每种食材各有各的味道。可熬够了时间,喝起来只剩一种“汤的味道”,你分不出哪一口来自哪种食材。够多的小贡献加在一起,个性消失,只剩共性。
类比的边界:如果锅里有一大块“压倒一切”的食材(比如一整瓶辣椒酱),汤就是辣椒酱的味道。中心极限定理同样要求:没有哪一个随机量大到能左右总和。
11.4 √n 法则:一千人为什么能代表一个国家
民意调查问 1,000 个人,就敢说全国有 52% 的人支持某项政策,误差 ±3 个百分点。凭什么?
每个受访者是一个伯努利试验:支持记 1,不支持记 0。支持率就是 1,000 个伯努利量的平均。由中心极限定理,这个平均近似正态,标准差是 √(p (1 − p )/n )。p 在 50% 附近时,这个数约为 0.5/√n 。再用第 9 章的 1.96(正态分布 95% 落在 ±1.96σ 以内):
误差范围 ≈ 1.96 × 0.5 / √n ≈ 1 / √n 95% 置信的误差范围。n = 1000 时约 ±3.1 个百分点。
100 300 1,000 3,000 10,000 0 ±2.5 ±5 ±7.5 ±10 100 人:±9.8 1,000 人:±3.1 10,000 人:±1.0 样本量(受访人数,对数刻度) 误差范围(百分点) 图 11-3 民调误差随样本量下降,但下降得很慢:从 100 人增加到 1 万人,成本涨 100 倍,误差只从 ±9.8 降到 ±1.0 个百分点。
表 11-1 样本量与误差范围(支持率约 50%,95% 置信)
受访人数 误差范围 说明
100 ±9.8 个百分点 只能看出大势
1,000 ±3.1 个百分点 常见的全国民调规模
10,000 ±1.0 个百分点 成本高 10 倍,误差只降到约 1/3
公式里有一个引人注目的缺席者:总人口。 无论是一座 10 万人的城市还是一个 14 亿人的国家,只要是真正的随机抽样,1,000 人的误差都约为 ±3%。这就像尝汤:只要汤搅匀了,一勺就能尝出咸淡,不管锅有多大。
“搅匀了”三个字至关重要。1936 年美国大选前,《文学文摘》杂志寄出约 1000 万张调查问卷,收回约 240 万张,预测共和党的兰登将大胜。结果罗斯福以约 61% 的得票率压倒性连任。同一年,盖洛普只用了约 5 万人的样本,就预测对了胜负(虽然低估了罗斯福的领先幅度)。
《文学文摘》的名单主要来自电话簿和汽车登记册,在大萧条时期,这些人明显比全体选民富裕;再加上愿意寄回问卷的人本身就不随机。样本再大,只要不随机,误差就不会按 1/√n 缩小。
11.5 备多少货才够
第 1 章的问题:需求每天都在变,备多少货才能做到“95% 的日子不断货”?
设想一家门店的某种牛奶(示例):日需求平均 100 盒,标准差 20 盒,每天之间相互独立;从下单到到货要 4 天。在这 4 天里,总需求是 4 个日需求之和:
期望:4 × 100 = 400 盒;
标准差:20 × √4 = 40 盒(方差相加,不是标准差相加);
由中心极限定理,总需求近似正态。要让 95% 的情况下够卖,库存要覆盖到 400 + 1.645 × 40 ≈ 466 盒 。
多出的 66 盒叫安全库存 。想从 95% 提到 99%,1.645 要换成 2.326,安全库存就涨到约 93 盒。最后那几个百分点的可靠性,是最贵的。严格说,这保证的是“每个补货周期内不断货的概率为 95%”(周期服务水平),与“95% 的日子不断货”相近,但并不相同。第 14 章还会讲到整条供应链上的连锁反应。
11.6 不是所有东西都是钟形
中心极限定理太成功了,成功到人们常常忘了它的前提。
1987 年 10 月 19 日,“黑色星期一”,道琼斯工业指数一天下跌 22.6%。当时美国股市的日波动标准差大约在 1% 量级,这次下跌相当于偏离了 20 多个标准差。如果日收益真的服从正态分布,这样的事件在宇宙的整个寿命里都几乎不可能发生一次。
可它发生了,而且金融市场里类似的“不可能”并不罕见。原因是中心极限定理的前提被打破了:交易者不是独立的 ,恐慌会传染;冲击也不都是“小”的 ,一条消息就能让所有人同时行动。这样的分布,尾巴比正态分布“肥”得多,极端事件远比钟形曲线预言的频繁。
接近正态的
许多独立小因素的和 :身高、测量误差
大样本的平均 :民调支持率、质检的平均尺寸
大量独立需求的总和:一家店一周的销量
往往不是正态的
彼此传染、相互放大的量:股市暴跌、疫情初期
由少数巨大个体主导的量:财富、城市人口、网站流量
有明显上下限或强烈偏斜的单个量:等待时间、保险单笔赔付
单次不可测,大量有规律 —— 前提是彼此独立、没有哪一个大到能左右全局。
本章带走
许多独立小因素相加,个性被抹平,只剩期望和方差,形状趋于钟形——这就是中心极限定理。
高尔顿板:通往中间的路线最多,所以中间最高。
起点再歪,加得够多也会变成钟形;n 个之和的标准差是 σ√n,平均的是 σ/√n。
民调误差 ≈ 1/√n,与总人口无关,但前提是真正随机。
安全库存 = z × σ × √(提前期):可靠性越高,代价增长越快。
传染与巨头会打破前提,造成“肥尾”。
于是,下一个问题 至此我们一次只看一个随机量。现实中的随机量却总是成群出现、彼此牵连:身高与体重,今天与明天。
上一章留下的问题: 至此我们一次只看一个随机量。现实中的随机量却总是成群出现、彼此牵连:身高与体重,今天与明天。
前面几章反复用到一个前提:独立 。方差能相加、大数定律能成立、中心极限定理能生效,都靠它。可第 4 章的挑战者号、第 7 章的相关性地板、第 11 章的黑色星期一都在提醒我们:现实中的随机量常常彼此牵连。本章给“牵连”找三件工具:联合分布、相关系数、马尔可夫链。
12.1 联合分布:一张二维的表
观察一座城市里人们出门带不带伞,同时记下当天的天气。两个随机量放在一起,它们的概率可以排成一张二维表(示例数据):
表 12-1 天气与带伞的联合分布(示例)
带伞 不带伞 合计(天气的边缘分布)
晴 0.10 0.60 0.70
雨 0.25 0.05 0.30
合计(带伞的边缘分布) 0.35 0.65 1.00
这张表叫联合分布 ,表中四个数加起来是 1——依然是第 2 章那张面积为 1 的地图,只是被横竖切成了四块。从它可以读出三类信息:
联合概率: 又下雨又带伞的概率是 0.25。
边缘分布: 把一行或一列加起来,就回到单个随机量。下雨的概率是 0.30,带伞的概率是 0.35。它们写在表的“边缘”,因此得名。
条件分布: 用第 4 章的方法缩小地图。下雨的日子里带伞的比例:0.25 ÷ 0.30 ≈ 83%;晴天里带伞的比例:0.10 ÷ 0.70 ≈ 14%。
两个随机量独立 ,意思是联合概率处处等于边缘概率的乘积。这里 P(雨) × P(带伞) = 0.30 × 0.35 = 0.105,而实际是 0.25,所以天气和带伞不独立——这当然不意外。
12.2 协方差:两个量是否“同进同退”
联合分布表包含全部信息,但当取值很多时,表会大得看不过来。能不能用一个数概括“两个量一起变的倾向”?
身高和体重:高个子通常体重也大。怎样用数字刻画这种“同进同退”?
看每个人是否“同时高于平均”或“同时低于平均”。
那就把每个人身高离平均的差,乘以体重离平均的差。同时偏高或同时偏低,乘积是正的;一高一低,乘积是负的。
再对所有人取平均。正的多,说明同进同退;负的多,说明此消彼长;正负抵消,说明看不出关系。
Cov(X , Y ) = E[ (X − μX )(Y − μY ) ], ρ = Cov(X , Y ) / (σX σY )协方差(Cov)的大小受单位影响(厘米×公斤);除以两个标准差,得到没有单位的相关系数 ρ(读作“柔”),它总在 −1 到 1 之间。
ρ = 0 无线性关系 ρ = 0.5 中等正相关 ρ = 0.9 强正相关 ρ = −0.7 较强负相关 图 12-1 不同相关系数下的散点图(模拟,固定随机种子)。ρ 越接近 1 或 −1,点越接近排成一条直线;ρ = 0 时看不出直线趋势。
协方差还补全了第 7 章的方差加法。当两个量不独立时:
Var(X + Y ) = Var(X ) + Var(Y ) + 2 Cov(X , Y )正相关让和的波动变大,负相关让它变小。第 7 章图 7-3 的“分散地板”,就来自那些分散不掉的协方差项。
这条公式也解释了“对冲”:保险公司持有一些在灾难时反而赚钱的资产,农民签下锁定价格的合同,都是在加入负相关 的量,让总波动变小。
相关系数衡量的是
两个量之间直线 关系的强弱和方向
一个没有单位、在 −1 到 1 之间的数
相关系数不能说明
独立:Y = X² 时,X 在 −1 到 1 之间对称变化,ρ = 0,可 Y 完全由 X 决定
斜率大小:ρ = 0.9 不代表 X 增加一点,Y 就增加很多
因果:见下一节
12.3 相关不等于因果
夏天,冰淇淋的销量和溺水事故的数量同时上升。把两者画成散点图,相关系数很高。难道吃冰淇淋会导致溺水?
气温高(夏天) 共同原因 冰淇淋销量上升 溺水事故增加 强相关 但没有因果 引起 引起 图 12-2 混杂因素。气温同时推高了冰淇淋销量和下水游泳的人数。两者的相关是真的,因果却是假的。
这种同时影响两个量的第三者,叫混杂因素 。它无处不在:喝咖啡的人肺癌率高(吸烟者往往也爱喝咖啡),住院的人死亡率高(病重的人才住院),消防车来得多的火灾损失大(火大才派更多车)。
这一年秋季,伯克利研究生院录取了约 44% 的男性申请者,女性只有约 35%。这看起来像是性别歧视。可统计学家比克尔等人在 1975 年逐个院系一查,发现大多数院系女性的录取率并不比男性低,有些还更高。
秘密在于:女性更多地申请了录取率本来就低、竞争激烈的院系,男性更多地申请了录取率高的院系。“申请哪个院系”就是混杂因素。分组看是一回事,合起来看是另一回事,这种现象叫辛普森悖论 。
怎样才能从相关走到因果?最有力的办法是随机分组 :用抛硬币决定谁吃药、谁吃安慰剂。硬币不看年龄、不看病情、不看贫富,于是所有混杂因素在两组之间被平均分配。两组结果若有差别,就只能归因于药本身。这正是第 13 章临床试验的逻辑。
12.4 今天与明天:马尔可夫链
以上讨论的是同一时刻的两个量。还有一种牵连来自时间:今天的状态影响明天。 今天下雨,明天多半也下雨;今天股价跌了,明天的情绪也受影响。
俄国数学家马尔可夫做了一个在当时看来很古怪的研究:他数了普希金长诗《叶甫盖尼·奥涅金》开头的 20,000 个字母,把每个字母标成元音或辅音,统计“元音后面接元音”和“辅音后面接元音”各有多频繁。
结果二者差别很大:元音后面更可能跟着辅音。字母不是独立出现的,下一个字母依赖于上一个。他用这个例子说明,大数定律在“有依赖”的序列里也能成立。
马尔可夫研究的这种模型,后来叫马尔可夫链 。它的核心假设只有一句:明天只取决于今天,不取决于昨天以前。 用一个示例天气模型来看:
晴 雨 0.2 0.4 0.8 0.6 明天只取决于今天 0 5 10 0 0.25 0.5 平稳:1/3 第 n 天下雨的概率(第 0 天晴) 天数 n 图 12-3 左:两状态天气链(示例参数)。每个箭头上是“从今天的状态到明天的状态”的转移概率,从同一状态出发的箭头加起来是 1。右:从晴天出发,“第 n 天下雨”的概率很快稳定在 1/3。
右图说明了马尔可夫链最重要的性质:走得足够久,它会忘记起点 ,停在一个固定的比例上,叫平稳分布 。这个比例可以直接算出:长期来看,“晴转雨”的流量要等于“雨转晴”的流量,即 P(晴) × 0.2 = P(雨) × 0.4,所以 P(雨) = 1/3。
这个模型里,雨天平均连续几天?(提示:第 8 章的几何分布)
每个雨天之后,“转晴”的概率是 0.4,就像每天抛一枚成功率 0.4 的硬币,直到成功为止。由几何分布,平均要 1/0.4 = 2.5 天。所以一段雨平均持续 2.5 天;同理,一段晴平均持续 1/0.2 = 5 天。
12.5 一条链,排出整个互联网
1998 年,斯坦福的两个研究生佩奇和布林想出了一个给网页排序的办法。设想一个“随机冲浪者”:在一个网页上随机点一个链接,跳到下一页,再随机点一个……偶尔也会厌倦,随便打开一个网页重新开始。这就是一条马尔可夫链,状态是网页,转移概率由链接决定。
冲浪者走得足够久之后,他出现在每个网页上的比例——也就是平稳分布——就衡量了这个网页有多“重要”:被很多重要网页链接的网页,冲浪者更常经过。这个比例就是 PageRank ,谷歌搜索最初的核心。
马尔可夫的想法今天依然活跃:语音识别、基因序列分析、排队系统、金融信用评级的迁移,乃至今天的大语言模型“根据前文预测下一个词”,都能看到它的影子——只不过现代模型看的“前文”远不止一个词。第 15 章会专门讲这条从马尔可夫通往大语言模型的路。
本章带走
牵连有两种:同一时刻的相关,以及今天对明天的依赖。
联合分布是二维的面积地图;行列求和得边缘分布,缩小地图得条件分布。
相关系数 ρ 衡量直线关系,在 −1 到 1 之间;ρ = 0 不等于独立。
Var(X+Y) = Var X + Var Y + 2Cov:负相关可以对冲风险。
相关不等于因果;混杂因素和辛普森悖论是两大陷阱;随机分组是走向因果的钥匙。
马尔可夫链:明天只看今天;走得够久会忘掉起点,停在平稳分布上(PageRank)。
于是,下一个问题 以上一切都假定分布已知。现实里我们手上只有数据。怎样从有限的数据反推背后的规律,又有多大把握?
上一章留下的问题: 以上一切都假定分布已知。现实里我们手上只有数据。怎样从有限的数据反推背后的规律,又有多大把握?
前十二章,我们几乎总是先知道规律,再预测结果:骰子是公平的,所以和为 7 的概率是 1/6;次品率是 5%,所以抽 20 个有 0 个次品的概率是 35.8%。可现实往往反过来:我们只看得到结果,要猜规律。 这枚硬币公平吗?这款新药有效吗?这位候选人的支持率是多少?
从“已知规律推结果”到“已知结果推规律”,这一步转身,就是从概率走进了统计 。
类比
概率像照着菜谱做菜 :菜谱(规律)在手,预测做出来是什么味道(数据)。统计像尝一口菜猜菜谱 :味道在嘴里,推断放了多少盐。第 5 章的贝叶斯定理,第 11 章的“尝一勺汤”,都已经是统计的雏形。
13.1 点估计:用样本猜总体
想知道全国成年人的平均睡眠时间,不可能问遍每个人。随机抽 1,000 人,算出他们的平均值,用它来猜全国的平均值。被猜的那个未知的数叫参数 ,用来猜的数叫估计量 。
用样本平均估计总体平均 μ;
用样本中的比例估计总体比例 p (民调就是这样);
用样本方差估计总体方差 σ²。
为什么可以这样猜?第 10 章的大数定律保证:样本越大,样本平均越接近 μ。但一个具体的样本平均,总会和 μ 有些偏差。只报一个数不够,还要报它有多可靠。
计算样本方差时,统计学家通常用“偏差平方和 ÷ (n − 1)”,而不是 ÷ n。为什么要少除一个?
因为偏差是相对于样本平均 计算的,而样本平均是从同一批数据里算出来的,它天然“靠近”这些数据,于是偏差平方和会系统性地偏小。除以 n − 1 恰好把这个偏小补回来,让估计平均而言不偏不倚。直觉上:n 个数据里,有一个“自由度”已经被用来算平均了,只剩 n − 1 个在提供关于波动的信息。
13.2 置信区间:给估计配一把误差尺
第 11 章已经算过:1,000 人的民调,误差范围约 ±3.1 个百分点。一般地,样本平均近似服从正态分布,标准差是 σ/√n (这叫标准误 ),于是:
95% 置信区间 ≈ 样本平均 ± 1.96 × 标准误用样本标准差 s 代替未知的 σ,标准误写成 s/√n。
“95% 置信”到底是什么意思?最好的解释方式,是把同样的调查做很多次:
48% 50% 52% 54% 56% 58% 真实支持率 52%(现实中未知) 第 1 次 第 2 次 第 3 次 第 4 次 第 5 次 第 6 次 第 7 次 第 8 次 没盖住真值 第 9 次 第 10 次 第 11 次 第 12 次 第 13 次 第 14 次 第 15 次 第 16 次 第 17 次 第 18 次 第 19 次 第 20 次 每条线段 = 一次民调给出的“支持率 ± 3.1 个百分点” 图 13-1 20 次独立民调,各自给出一个 95% 置信区间(模拟,固定随机种子)。每次的区间位置都不同;其中 19 个盖住了真值,1 个没有。
“95% 置信”的意思是
这种做法 ,重复很多次,约 95% 的区间会盖住真值
是对方法可靠性的保证
它不是说
“真值有 95% 的概率落在这个具体区间里”——在频率学派看来,真值是固定的,这个区间要么盖住了它,要么没有
95% 的数据 落在这个区间里
吉尼斯啤酒厂的化学师戈塞特经常面对一个难题:大麦和酵母的试验,每次只有几个样本。他发现,样本很少时,用样本标准差代替真实标准差会让区间“太窄”,过于自信。他推导出一个比正态分布尾巴更厚的分布来修正它。
酒厂不允许员工用真名发表研究,他就署名“Student”(学生)。这个分布至今叫学生 t 分布 。样本越少,t 分布的尾巴越厚,区间越宽;样本多了,它就变回正态分布。
13.3 假设检验:一位女士和八杯茶
统计学家费希尔在《实验设计》(1935)中用它作范例;据后人记述,它的原型是罗萨姆斯特德农业试验站的一次下午茶:一位女士声称她能尝出一杯奶茶是先倒茶还是先倒奶。在座的人大多不信。费希尔想:怎样用一个实验,公平地检验她的说法?
他设计了这样的实验:准备 8 杯奶茶,4 杯先倒奶,4 杯先倒茶,随机排好顺序,请她挑出哪 4 杯是先倒奶的。
假如她其实分辨不出,只是瞎猜,她恰好把 4 杯全挑对的概率是多少?
从 8 杯里挑 4 杯,一共有 C(8, 4) = 70 种挑法,只有 1 种全对。所以是 1/70,约 1.4%。
如果她真的全挑对了,你会怎么想?
要么她真有这本事,要么她是在 1.4% 的运气里撞上了。1.4% 太小了,我倾向于相信她。
如果她挑对了 3 杯呢?
瞎猜挑对 3 杯或更多的概率是 (16 + 1)/70 ≈ 24%。这很常见,不足以说明她有本事。
1/70 0 杯 16/70 1 杯 36/70 2 杯 16/70 3 杯 1/70 4 杯 p 值 ≈ 1.4% 假如她只是瞎猜(原假设):猜对几杯“先加奶”的概率 4 杯“先加奶”中猜对的杯数 图 13-2 假如她只是瞎猜,挑对杯数的分布。全部挑对的概率只有 1/70。据后人记述,那位女士全部挑对了。
这就是假设检验 的逻辑,它是一种“概率版的反证法”:
第一, 先假设“什么都没发生”:她在瞎猜,药没有效,硬币是公平的。这叫原假设 。
第二, 在原假设成立的前提下,算出“出现眼前这样的结果、甚至更极端结果”的概率。这个概率叫 p 值 。
第三, 如果 p 值很小(传统上以 5% 为界),就说:原假设下这种结果太罕见了,我们拒绝 原假设。
13.4 两类错误
检验总有可能犯错,而且错有两种:
表 13-1 假设检验的两类错误
真相:药无效 真相:药有效
判定:有效 第一类错误(假阳性) 概率 α,通常定为 5% 正确 概率 1 − β,叫“功效”
判定:无效 正确 第二类错误(假阴性) 概率 β,常要求 ≤ 20%
药无效时 药有效时 判定线:超过就宣布“有效” α:假阳性 β:假阴性 试验观察到的疗效(以标准误为单位) ← 看起来没效果 看起来有效果 → 图 13-3 两类错误的此消彼长(示例)。判定线往右挪,假阳性变少,假阴性变多;往左挪则相反。想同时减少两种错误,只能让两个钟形离得更开或变得更窄——最常用的办法是增加样本量 (或降低测量噪声)。
这张图和第 5 章的医学检测是同一个故事:α 就是误报率,1 − β 就是检出率。医学检测要在“不放过病人”和“不吓坏健康人”之间取舍,新药审批要在“不批准无效的药”和“不错杀有效的药”之间取舍。没有哪一条判定线能同时消灭两种错误。
13.5 一款新药凭什么被认定“有效”
第 1 章的问题:一款新药,凭什么被认定“有效”?现在可以回答了。
随机分组: 用抛硬币式的方法决定谁用新药、谁用安慰剂或标准疗法。第 12 章说过,这能让年龄、病情、生活习惯等混杂因素在两组间平均分配。
双盲: 病人和医生都不知道谁在哪一组,避免心理作用和评估偏差。
事先定好规则: 在试验开始前就写明 α(通常双侧 5%)、所需功效(常为 80% 或 90%),并据此算出需要多少病人。
检验: 试验结束后,若两组疗效之差的 p 值小于事先定的界限,才宣布“有统计学意义”。
1954 年的索尔克脊髓灰质炎疫苗试验是早期的典范:约 180 万名儿童参与,其中约 65 万人进入随机双盲、安慰剂对照的部分,其余地区作为观察对照。今天的新药几乎都要经过这样的试验。第 14 章会看到,即使有了这套方法,一款新药从进入临床到获批,成功率也不到一成。
13.6 p 值的三个误读
p 值可能是科学中被误读得最多的数字。2016 年,美国统计协会罕见地发表了一份关于 p 值的正式声明,提醒研究者不要误用它。最常见的误读有三个:
误读一:“p = 0.03,所以原假设为真的概率是 3%。” 错。p 值是 P(这样的数据 | 原假设),不是 P(原假设 | 这样的数据)。这正是第 4、5 章的检察官谬误,要得到后者,还需要先验。
误读二:“p < 0.05,所以效果很大。” 错。p 值小可能只是因为样本很大。一种让血压平均降低 0.5 毫米汞柱的药,在十万人的试验里 p 值可以极小,但临床上几乎没有意义。要同时看效应有多大。
误读三:“p > 0.05,所以没有效果。” 错。可能只是样本太小、功效不足,看不出来。“没有证据证明有效”不等于“有证据证明无效”。
一位研究者同时检验 20 种食物与某种疾病的关系,结果发现“吃西兰花”那一项 p = 0.04,于是宣布“西兰花与该病显著相关”。你该怎么看?
即使 20 种食物都与该病毫无关系,每一项也有 5% 的机会“碰巧显著”。20 项里至少有一项显著的概率是 1 − 0.95²⁰ ≈ 64%。这就像第 3 章的生日问题:机会多了,总会撞上几个。这种问题叫多重比较 ;只报告显著的那一项、不提其他 19 项,叫 p 值操纵 。正确的做法是事先声明要检验什么,并对多次检验做校正。
13.7 幸存者偏差:看不见的那一半样本
据西塞罗在《论神性》中的记载,有人带着“无神论者”迪亚戈拉斯去看神庙里的一排排还愿画:画上都是在海难中向神祈祷、最后平安归来的人。“你不是认为神不管人间的事吗?看,这么多人因为祈祷而得救。”
迪亚戈拉斯回答:“那些祈祷了却淹死的人,他们的画在哪里?他们的人数可要多得多。”
两千多年前的这句反问,点破了统计里最隐蔽的一类错误:你看到的样本,已经被“活下来”这道筛子筛过一遍。 这叫幸存者偏差 。前面几节讲的置信区间和假设检验,都默认样本是从总体里随机抽出来的;幸存者偏差恰恰让这个前提悄悄失效。
弹孔在哪里,装甲就该加在哪里吗?
二战中,军方统计返航轰炸机上的弹孔:机翼和机身上很多,发动机上很少。装甲很重,只能加在一部分位置。该加在哪里?
弹孔最多的地方,机翼和机身。那里最常挨打。
这些数据来自哪些飞机?
……返航的飞机。被击落的没法统计。
如果发动机中弹的飞机大多掉下去了,返航飞机的发动机上会是什么样子?
几乎没有弹孔。不是发动机不挨打,而是挨了打的回不来。那么装甲应该加在返航飞机没有 弹孔的地方。
返航飞机上的弹孔(示意) 弹孔 发动机、驾驶舱:几乎没有弹孔 缺失的弹孔,在没飞回来的飞机上 图 13-4 返航飞机的弹孔分布(示意)。弹孔少的地方,恰恰可能是最致命的地方。
这个故事通常归于统计学家沃尔德。需要说明的是:流行的讲法是简化版。历史上,他在哥伦比亚大学统计研究组写的是一系列技术备忘录,讨论怎样仅凭幸存飞机的损伤,去估计飞机各部位的脆弱程度 ——他正视了“只有幸存者数据”这个难题,并给出了修正方法。
第一性原理:它是一个条件概率
用第 4 章的语言,幸存者偏差一句话就能说清:你想知道的是 P(特征),你手里的数据却是 P(特征 | 活下来)。 “活下来”是一条消息,它把地图缩小了——而且缩到了哪里,恰恰和你关心的特征有关。
第一, 如果“能否活下来”和你研究的特征无关(独立),缩小后的地图比例不变,样本依然可靠。
第二, 如果二者有关——发动机中弹就回不来、业绩差的基金就被关掉——缩小后的地图就系统性地歪了,而且样本再大也纠正不了。这和第 11 章《文学文摘》的教训是同一个:不随机的样本,误差不会按 1/√n 缩小。
基金排行榜上的“常胜将军”
设想 1,000 只基金,基金经理全都毫无选股能力:每年的超额收益纯属运气,平均为 0,标准差 8%。规则是:累计亏损超过 15%,基金就被清盘或并入别的基金,从排行榜上消失。10 年后,我们只看还“活着”的基金。
-15% -10% -5% 0 +5% +10% 真实能力 = 0 幸存者平均 +1.6% 全部 1000 只 活到第 10 年的 550 只 每只基金存续期间的平均年超额收益(模拟,示例参数) 图 13-5 模拟 1,000 只“零能力”基金(固定随机种子,示例参数)。灰色是全部基金,绿色是活到第 10 年的基金。被清盘的全是运气差的,于是幸存者的平均年超额收益约为 +1.6%——一个完全由筛选制造出来的“本事”。
现实中确实如此。金融学家埃尔顿、格鲁伯和布莱克 1996 年的研究估计,只统计幸存基金,会让美国共同基金的平均业绩每年被高估约 0.9 个百分点。“过去十年年均收益最高的基金”这类榜单,天然就是一张幸存者名单。 这也是第 7 章、第 14 章讨论“年均收益”时要多留一个心眼的原因。
生活里的幸存者
成功学: 辍学创业成功的故事家喻户晓,同样辍学、同样拼命却失败的人,没有人给他们出传记。
“以前的东西质量更好”: 今天还在用的老家具、老房子,是当年同批产品里最结实的那一小部分;差的早就坏掉、拆掉了。
高楼坠猫: 1987 年一项兽医研究发现,从 6 层以上坠落的猫,伤势反而比从较低楼层坠落的轻。有人提出物理解释(猫达到终端速度后会放松身体),也有人指出幸存者偏差的可能:摔死的猫往往不会被送到兽医那里,也就不在统计里。
发表偏差: 第 13.6 节的“多重比较”还有一个放大器——得出“显著”结果的研究更容易被发表,“什么也没发现”的研究躺在抽屉里。读者看到的文献,本身就是一份幸存者名单。
“奥斯卡得主更长寿”: 2001 年一项研究称奥斯卡得主比未获奖的同行多活近 4 年。后来的重新分析指出,得主必须先活到获奖那一天,这段“不可能死去的时间”被错算成了获奖带来的好处;修正后差距缩小到约 1 年,且不再具有统计显著性。这是幸存者偏差的一个变体,叫“不朽时间偏差”。
一家培训机构宣传:“我们的学员毕业后平均涨薪 50%。”至少提出三个问题,检查这里面有没有幸存者偏差。
第一,这个平均数是怎么算的:是所有报名的人,还是只算“完成课程并回复了问卷”的人?中途退出、找不到工作的人往往不会回复。第二,入学前是否有筛选?如果只收本来就优秀的人,涨薪可能来自筛选而不是培训。第三,对照组在哪里:同样背景、没上这门课的人,同期涨了多少?没有分母和对照组的“成功率”,大多是一张幸存者名单。
防范幸存者偏差
先问:失败的、消失的、没回复的,去哪了?
从起点追踪全体,而不是从终点往回看(前瞻性研究)
用随机抽样或随机分组,而不是“能找到谁就问谁”
事先登记研究计划,无论结果如何都公布
幸存者偏差不是
样本太小——样本再大,筛过的样本照样歪
数据造假——每一条数据可能都是真的,只是缺了一整块
只存在于成功学——医学、金融、工程、历史研究里都有
13.8 两种眼光
本章讲的置信区间和 p 值,属于频率学派 :参数是固定的未知数,概率只描述“重复抽样”时数据的表现。第 5 章的贝叶斯定理则代表另一种眼光,贝叶斯学派 :参数本身也可以有概率分布,先验加数据得到后验,可以直接说“支持率在 49% 到 55% 之间的概率是 95%”。
这正是第 1 章概率的两张面孔——频率与信念——在统计学里的延续。两派争论了一个世纪,今天的实践者大多两种工具都用:频率方法便于事先约定规则、控制错误率,适合药物审批这样需要“规则先定”的场合;贝叶斯方法便于融合先验知识、逐步更新,适合搜索、诊断和机器学习。重要的不是站队,而是清楚每个数字回答的是哪个问题。
证据来了,就更新 ——但要先想清楚: 这个数,是 P(数据 | 假设),还是 P(假设 | 数据)?
本章带走
概率从规律推数据,统计从数据推规律;每个统计结论都应该带着它的误差尺。
置信区间 ≈ 估计值 ± 1.96 × 标准误;“95%”说的是方法的可靠性。
假设检验是概率版的反证法:原假设下这么罕见,就拒绝它。
两类错误此消彼长;想同时减少,最常用的办法是增加样本量。
p 值不是原假设为真的概率,不代表效应大小,也怕多重比较。
幸存者偏差:数据若已被“活下来”筛过,你看到的是条件概率,样本再大也纠正不了。
频率与贝叶斯是两种眼光,回答不同的问题。
于是,下一个问题 工具已经齐全。走出教室,看它们在真实世界里怎样工作。
上一章留下的问题: 工具已经齐全。走出教室,看它们在真实世界里怎样工作。
第 1 章埋下了六个伏笔。一路走来,它们各被回收了一半。本章把它们逐一完整揭开。你会发现,六个行业用的是同一套积木:数清可能、按证据更新、看期望也看分布、用大量模拟代替无法计算的公式。
14.1 天气预报:70% 是怎么算出来的
07:30 出门前看天气
这个 70% 到底是什么的 70%?明天只会“下”或“不下”,这句话怎么才算说对了?
现代天气预报的核心是数值模式:把大气切成几千万个小格子,用物理方程一步步推算未来。可 1963 年,气象学家洛伦兹发现,这类方程对初始条件高度敏感:今天的观测只要有一点点误差,几天后的预报就可能面目全非。1972 年,他用一个演讲题目把它说得家喻户晓:“巴西的一只蝴蝶扇动翅膀,会不会在得克萨斯引起一场龙卷风?”
既然今天的状态永远量不准,预报员就换了个思路:不只算一次,而是算很多次。 把初始状态在误差范围内轻轻扰动,得到几十个“可能的今天”,各自往前推算。这叫集合预报 。欧洲中期天气预报中心(ECMWF)1992 年起将其投入业务,今天每次运行 51 个成员(1 个控制预报加 50 个扰动预报)。
今天 第2天 第4天 第6天 第8天 第10天 20° 25° 30° 35° 40° 30°C 第 7 天:10/30 个成员 > 30°C → 高温概率约 33% 最高气温预报(示例) 每条细线是一个集合成员 图 14-1 集合预报示意(示例数据,不是真实预报)。头两天各成员几乎重合,说明预报可信;往后散成一把扇子,扇面越宽,不确定越大。某一天有多少比例的成员给出降雨或高温,就近似是那件事的概率。
这是第 10 章蒙特卡洛方法的直接应用:用大量模拟的频率 来估计概率 。模式输出后,气象部门还会用历史数据做统计校正,让“说 70% 的日子真有约 70% 下雨”,也就是第 10 章的校准 。
至于“70%”的精确含义,美国国家气象局的定义是:预报区域内任意一点,在预报时段内出现可测量降水的概率。它有时被写成 PoP = C × A:预报员有多大把握会下雨(C),乘以预计下雨的面积比例(A)。“有 80% 把握会有雨、预计覆盖一半地区”,和“100% 会下雨、但只覆盖四成地区”,给出的都是 40%。
70% 是一个关于“大量相似情形”的频率,通常综合集合模拟、统计模型与预报员判断,并经过历史校准。 单独一天无法验证它;把所有“70%”的日子放在一起,约七成下了雨,它就说对了。
14.2 地质勘探:看不见的地下
08:10 地铁穿过城市地下
看不见地下,怎么决定在哪里打井?“30 年内 72%”又是什么意思?
一口深海探井的成本可以高达上亿美元,而你在钻下去之前永远看不到油。石油地质学家把“这里有没有可开采的油藏”拆成几个必须同时满足的条件:有生油的烃源岩、有能储油的储层、有圈闭、有封盖、油气能运移进去。这正是第 4 章的乘法公式:
地质成功概率 = P(烃源) × P(储层) × P(圈闭) × P(封盖) × P(运移)示例:0.8 × 0.7 × 0.6 × 0.7 × 0.8 ≈ 19%。每一项都“挺有把握”,乘起来不到两成。这与第 4 章火箭的串联可靠性是同一个道理。
这些概率从哪来?先验来自区域地质研究和相邻区块的历史;地震勘探的反射数据是证据,用第 5 章的方式更新它们。一口干井同样是证据:它会改写整片区域的概率地图,就像法航 447 搜索中“搜过没找到”的海域。在矿产勘查中,还有一套专门的空间统计方法叫“克里金法”,用已知钻孔的品位按距离和相关性去估计未钻位置,它源于 1950 年代南非矿业工程师克里格的工作。
即使找到了油,储量也是一个随机量。工程师对孔隙度、厚度、面积、采收率等不确定参数做蒙特卡洛模拟,得到储量的分布:
0 40 80 120 160 0% 10% 50% 90% 100% P90(证实):23 P50(概算):50 P10(可能):108 可采储量(百万桶,示例) 储量至少为 x 的概率 图 14-2 储量的超越概率曲线(示例参数)。行业规范(SPE-PRMS)规定:用概率法时,“证实储量”要有至少 90% 的把握实际采出量不低于它,即 P90。P50、P10 分别对应更乐观的估计。
“旧金山湾区 30 年内发生 6.7 级以上地震的概率 72%”来自美国地质调查局 2015 年发布的第三版加州统一地震破裂预测(UCERF3)。它综合了断层滑动速率、历史地震记录和多种模型,本质上也是一个大型概率模型。如果把 30 年内 72% 粗略折算成每年概率相同,大约是每年 4%(1 − 0.281/30 ):单独某一年大概率平安,但放到一代人的时间尺度上,发生的可能远大于不发生。 这就是为什么建筑抗震规范要按几十年一遇、几百年一遇的地震来设计。
打井靠乘法公式 拆解成功条件,靠贝叶斯 用勘探数据和干井更新,靠蒙特卡洛 得到储量分布(P90/P50/P10)。“30 年 72%”是一个把长期风险折算成可决策数字的概率模型输出。
14.3 投资与复利:你只活一次
12:00 午休时看一眼基金 App
年均收益是正的,为什么不少拿着同一只基金的人,最后却亏了钱?
第 7 章已经给出了核心答案:期望收益描述的是“所有平行世界的平均”,而你的财富只走一条 路径。在高波动下,这条典型路径的增长率是几何平均,大约是算术平均减去方差的一半。这里还有三个补充:
第一,“年均收益”的口径。 宣传里的“年均”如果是算术平均,会系统性地高估你的实际复利。真正能反映长期结果的是几何平均(年化复合收益率)。另外,许多投资者追涨杀跌、在高点买入,他们自己的实际收益还常常低于基金本身的收益。
第二,下注的大小。 1956 年凯利给出的公式说:在一个期望为正的重复赌局里,下注比例过大,长期几何增长反而会变小甚至为负。例如一枚正面概率 60% 的硬币、赔率 1 赔 1,凯利比例是每次押全部资金的 20%;押 40% 左右时,长期增长率已降到接近零。好机会也可能因为押得太重而输光。
第三,分散与再平衡。 第 7、12 章说过,低相关的资产组合能降低波动,从而减少波动拖累;定期把比例调回目标,也能在一定程度上把波动转化为收益。但相关性在危机时会突然升高,分散并不能消除所有风险。
“年均 10%”若是算术平均,你的典型结局取决于几何平均 ≈ 10% − σ²/2。波动越大,拖累越重;再加上择时失误和过度下注,拿着同一只基金的人,完全可能大多数亏钱。既看平均,也看分布。
14.4 生物制药:阳性与有效
15:00 收到体检报告
检测准确率 90%,阳性就等于 90% 患病吗?一款新药,又凭什么被认定“有效”?
前一半第 5 章已经回答:阳性的含金量取决于先验。在患病率 1% 的人群里,即使检出率 90%、误报率 9%,阳性者真正患病的也只有约 9%。这就是为什么筛查阳性之后要做确诊检查,为什么罕见病的大规模筛查必须配合高特异性的检测和确诊流程。
后一半由第 12、13 章回答:随机双盲对照试验,事先约定 α 与功效,检验两组疗效的差别。可即便方法严谨,新药之路依然漫长:
进入 I 期 100 进入 II 期 52.0 × 52.0% 进入 III 期 15.0 × 28.9% 提交上市申请 8.7 × 57.8% 获批上市 7.9 × 90.6% 每 100 个进入临床的候选药,约 8 个最终获批 阶段成功率 图 14-3 新药研发漏斗。据生物技术创新组织(BIO)等机构 2021 年发布的报告,2011–2020 年进入 I 期临床的药物,最终获批的比例约 7.9%。各阶段的成功率相乘得到总成功率——又一次乘法公式。
概率在制药里还有更多角色:
药物筛选: 从上万个候选分子里挑有希望的,本质是在低先验下做检测,第 5 章的基础比率问题在这里格外突出:大部分“初筛阳性”都会在后续试验中被淘汰。
剂量与个体差异: 不同病人对同一剂量的反应是一个分布。药代动力学模型用概率描述这种差异,决定“多大剂量能让绝大多数人有效、极少数人中毒”。
生物等效性: 仿制药要证明与原研药“等效”,监管机构要求药物暴露量之比的 90% 置信区间落在 80% 到 125% 之间——一个置信区间,直接决定一款药能否上市。
阳性 ≠ 患病:要把检测的似然与人群的先验放进贝叶斯天平。“有效”也不是某位医生的印象,而是随机分组排除混杂、事先约定错误率、再用假设检验和置信区间给出的、可以重复检验的结论。
14.5 供应链:在不确定中备货
18:30 下班路过超市
需求每天都在变,备多少货才能做到“95% 的日子不断货”?
第 11 章已经算出安全库存的公式:在提前期 L 天内,需求之和近似正态,标准差是 σ√L 。
300 350 400 450 500 平均需求 400 备货 466 = 400 + 1.645 × 40 95%:够卖 5%:断货 提前期 4 天内的总需求(盒,示例) 安全库存 66 图 14-4 安全库存(示例参数)。备货线划在需求分布的第 95 百分位:95% 的情况够卖,5% 会断货。安全库存 = z × σ × √L = 1.645 × 20 × 2 ≈ 66 盒。
现实的供应链还要处理几个更深的问题:
该备到哪个百分位? “报童模型”给出一个漂亮的答案:设每少备一件损失 C u (少赚的利润),每多备一件损失 C o (过期或降价的损失),最优备货量应让“够卖的概率”等于 C u / (C u + C o )。示例:一盒蛋糕进价 3 元、售价 8 元、过期后 1 元处理,少备损失 5 元、多备损失 2 元,最优的够卖概率是 5/7 ≈ 71%。利润高、残值高的商品多备,易腐、利薄的商品少备。 这是期望与分布结合的典型决策。
集中库存的好处: 把 4 个城市仓库合并成 1 个中心仓,各地需求的波动会相互抵消,总安全库存约降到原来的 1/√4 = 一半(前提是各地需求近似独立)。这就是第 7 章的 √n 法则在物流中的版本。
牛鞭效应: 1997 年,斯坦福的李效良等人研究了一个现象:终端消费者对尿不湿的需求相当平稳,可零售商向批发商、批发商向工厂、工厂向原料商的订单,一级比一级波动得厉害,像甩鞭子一样越甩越大。原因之一是每一级都在根据下游订单的波动“多备一点”,把噪声层层放大。治本之道是让各级共享真实的终端需求数据:用更好的信息,减小每一级感受到的方差。
备货量 = 提前期内的平均需求 + z × σ × √L。z 由服务水平决定(95% 对应 1.645),而该选多高的服务水平,取决于缺货与积压的代价之比。
14.6 航空航天:把“万无一失”算出来
21:00 新闻里的火箭发射
假如一万个零件、每个 99.99% 可靠,整枚火箭有多可靠?
第 4 章算过:约 37%。航天工程对抗这个数字的方法,全都能在本书里找到:
冗余: 关键系统装多套,只要一套工作就行,把串联的“乘法灾难”变成并联的“乘法保护”。
警惕共因失效: 挑战者号的两道 O 形圈同时被低温击败。1986 年事故调查中,物理学家费曼在调查报告附录中写道:他询问的工程师估计航天飞机失事的概率约为百分之一量级,而管理层给出的数字是十万分之一。事后看,航天飞机 135 次任务中失事 2 次,约为 1/68。一个概率估计如果与现实相差上千倍,它就不是估计,而是愿望。
实时的贝叶斯更新: 飞船在太空中靠惯性测量和无线电测距确定位置,每一种测量都有噪声。1960 年,卡尔曼提出了一种滤波算法:用物理规律预测 下一刻的位置(先验),再用新的测量修正 它(似然),得到更准的估计(后验),一秒一秒地循环。阿波罗登月的导航计算机就使用了它。它本质上就是第 5 章的“后验成为下一轮的先验”。
蒙特卡洛着陆: 火星车进入大气层时,速度、角度、风、大气密度都有不确定性。工程师模拟成千上万次进入过程,得到可能着陆点的分布,也就是“着陆椭圆”。
陡坡 巨石区 99% 的模拟着陆点在椭圆内 每个点 = 一次模拟的着陆位置(示例) 约 5 公里 图 14-5 着陆椭圆示意(示例参数)。每个点是一次模拟的着陆位置。选择着陆场时,要让整个椭圆避开陡坡和巨石。随着导航与控制技术的进步,着陆椭圆越来越小:2012 年“好奇号”火星车的着陆椭圆约为 20 × 7 公里;1997 年“火星探路者”的着陆椭圆则有约 200 公里量级。
一万个 99.99% 串联只剩约 37%。航天的回答是:用冗余把串联变并联,用独立性分析防共因失效,用卡尔曼滤波做实时贝叶斯更新,用蒙特卡洛模拟把“着陆在哪”变成一个可以设计的分布。
14.7 还有更多
六个伏笔只是冰山一角。再看几个你每天都在接触的例子:
垃圾邮件过滤: 一封邮件出现“中奖”“免费”“转账”这些词,它是垃圾邮件的后验概率是多少?早期最成功的过滤器之一,就是把每个词当作一条证据,按贝叶斯定理逐词更新。
推荐系统与广告: “看过这个的人也看了……”背后是条件概率;广告投放要估计每个用户点击的概率,再乘以出价,按期望排序。
人工智能: 大语言模型每一步输出的,是下一个词的一个概率分布 ,然后从中抽样。生成文字时的“温度”参数,调的正是这个分布的“尖锐程度”:温度低,回答更确定、更保守;温度高,更多样、也更容易出错。下一章专门讲它。
传染病: 一个感染者平均传给几个人(基本再生数),以及每个人传给多少人的分布,决定了疫情会熄灭还是爆发。少数“超级传播者”造成的肥尾,让防控更难预测。
电话与网络: 1909 年,丹麦工程师埃尔朗用泊松分布研究电话交换机需要多少条线路,开创了排队论。今天的数据中心、网络路由器、医院急诊排班,都还在用他的思路。
质量控制: “三西格玛”“六西格玛”,说的就是用正态分布的尾部概率来设定生产公差。
表 14-1 概率在现实世界:问题与工具的对照
领域 核心问题 用到的积木 对应章节
天气 明天下雨的概率 蒙特卡洛集合、频率、校准 1、10
地质 这里有没有油、有多少;地震风险 乘法公式、贝叶斯更新、储量分布 4、5、10
投资 长期能赚多少、该押多少 期望、方差、几何平均、相关性 6、7、12
制药 阳性可信吗;药有效吗 贝叶斯、随机对照、假设检验、置信区间 5、12、13
供应链 备多少货 正态分布、中心极限、√n 法则 9、11
航天 整体多可靠、落在哪 独立与冗余、卡尔曼滤波、蒙特卡洛 4、5、10
保险 保费该收多少 期望、大数定律、相关性 6、10、12
互联网与 AI 排序、过滤、生成 马尔可夫链、贝叶斯、概率分布 5、12、15
单次不可测,大量有规律。 证据来了,就更新。 既看平均,也看分布。
本章带走
六个行业,同一套积木:数清可能,按证据更新,看期望也看分布,算不出来就模拟。
天气:集合预报 = 蒙特卡洛;70% 要靠校准来检验。
地质:成功概率是多个条件的乘积;储量是一个分布(P90/P50/P10)。
投资:你只走一条路径,几何平均决定典型结局;押得太重,好机会也会输光。
制药:阳性要看先验;“有效”要靠随机对照和检验。
供应链:安全库存 = z·σ·√L;服务水平由缺货与积压的代价之比决定。
航天:冗余对抗串联,卡尔曼滤波就是实时贝叶斯。
于是,下一个问题 六个行业之外,还有一个今天最受瞩目的领域:会写文章、会写代码、会和你对话的人工智能。它和概率是什么关系?
上一章留下的问题: 六个行业之外,还有一个今天最受瞩目的领域:会写文章、会写代码、会和你对话的人工智能。它和概率是什么关系?
你向一个聊天机器人提问,它流畅地写出一段回答,有时还引经据典、条理分明。于是有人觉得它“无所不知”,也有人不屑地说它“只是在预测下一个词”。
这两种说法都没说到点子上。本章要说明:“预测下一个词”并不简单,它正是一个概率问题;本书前十四章的积木,几乎每一块都在这台机器里找得到。 理解了这一点,你既不会神化它,也不会低估它,还能看懂它为什么会一本正经地胡说八道。
15.1 它到底在做什么
当一个大语言模型回答你的问题时,每写出一个字之前,它最核心的一步是什么?
在一个巨大的数据库里查找现成的答案 像人一样先想好整段话,再写出来 给“下一个词”的每种可能打一个概率,再从中挑一个
答案是第三项。这类模型每一步的输出,不是一个词,而是一张概率分布 :词表里每一个候选的“词元”(token,可能是一个字、一个词,或词的一部分),各有多大可能出现在下一个位置。
今天天气很 ___ 模型输出:下一个词的概率 好 41% 热 22% 冷 12% 不错 10% 晴朗 9% 糟糕 6% 所有候选词的概率 加起来等于 1 (第 2 章的公理二) 真实模型要给词表里 十几万个词元都打分 图 15-1 “今天天气很”之后,下一个词的概率分布(示例数值)。真实模型的词表有十几万个词元,每一个都会分到一个概率,合计为 1。
然后,程序从这张分布里抽一个 ,接到文字末尾,再把加长了的文字重新交给模型,求下一个词的分布……如此循环,一个词一个词地“掷”出整段回答。
类比
大语言模型像一颗会变形的骰子。普通骰子六个面一样大;这颗骰子有十几万个面,每个面上写着一个词元,每掷一次之前,它会看一眼前面已经写下的文字,重新调整每个面的大小 。“今天天气很”之后,“好”那一面变得很大,“香蕉”那一面几乎消失。
类比的边界:真实的骰子不会“看”任何东西;模型调整面大小的规则,是从海量文字里学来的,这正是它难的地方(15.4 节)。
15.2 从马尔可夫到大语言模型
第 12 章里,马尔可夫在 1913 年数了《叶甫盖尼·奥涅金》的两万个字母,发现下一个字母依赖上一个。这其实就是最早的“语言模型”:用前文预测下一个符号。
1948 年,信息论的奠基人香农在《通信的数学理论》中把这个想法往前推了一步:他根据英文中字母和单词的统计频率,只看前一两个单词就随机生成下一个,得到一串“有点像英语”的句子。看的前文越长,生成的句子越像样。
此后七十多年,语言模型沿着同一条路走:
表 15-1 “用前文预测下一个词”的演进
年代 方法 看多长的前文 概率从哪里来
1913 马尔可夫链 前 1 个字母 数频率
1948 香农的 n 元近似 前 1–2 个单词 数频率
20 世纪 80 年代起 n 元语言模型(语音识别、机器翻译) 前几个词 数频率,再做平滑
2017 年起 Transformer 神经网络 数千到上百万个词元(因模型而异) 由神经网络计算
表的最后一列是关键的转折。为什么不能一直“数频率”下去?
要知道“在某段前文之后,下一个词是什么”的概率,最直接的办法是什么?
在海量文本里找出所有出现过这段前文的地方,数一数后面各跟了什么词。这就是第 1 章的频率面孔。
如果前文只有 20 个词元,而词表有 10 万个词元,可能的前文一共有多少种?
第 3 章的乘法原理:10 万的 20 次方,也就是 10¹⁰⁰。
这个数有多大?
可观测宇宙里的原子数大约是 10⁸⁰。人类写过的所有文字,连其中微不足道的一角都覆盖不了。
那么你刚刚提出的问题,绝大多数前文在数据里出现过几次?
零次。根本没得数。
这就是为什么现代模型不再“查表”,而要概括 :它学的不是“这段话后面跟什么”,而是“意思相近、结构相近的话,后面倾向于跟什么”。神经网络就是一台学习这种概括的机器。它的输出依然是一张概率分布,只是这张分布不再靠数格子得到,而是靠学。
15.3 一整句话的概率:第 4 章的乘法公式
模型一次只给一个词打分,怎么谈“一整句话”的概率?用第 4 章的乘法公式,沿着概率树一步一步乘下去:
P(词₁, 词₂, …, 词ₙ) = P(词₁) × P(词₂ | 词₁) × P(词₃ | 词₁ 词₂) × … × P(词ₙ | 前面所有词)概率的链式法则。任何一段文字的概率,都可以拆成“每一步在前文条件下的条件概率”的乘积——不需要任何独立性假设。
今天 天气 0.30 我 0.20 是 0.15 很 0.50 不 0.15 真 0.12 好 0.41 热 0.22 冷 0.12 每一步:在前文条件下,给下一个词一张概率分布,再从中抽一个 整句的概率 = 沿途条件概率相乘(第 4 章的乘法公式) P(天气 很 好 | 今天) = 0.30 × 0.50 × 0.41 ≈ 0.06 图 15-2 一句话的概率是沿途条件概率的乘积(示例数值)。模型生成文字,就是在这棵巨大的概率树上一步一步往下走;每一个分叉,都是一次“掷骰子”。
这也解释了一个现象:回答越长,整段“恰好是这一段”的概率就越小 ,因为每一步都要乘一个小于 1 的数(第 4 章火箭可靠性的同一道理)。所以同一个问题问两次,得到一字不差的长回答反而罕见。
15.4 它是怎么学会的:最大似然与“惊讶度”
模型里有数以十亿计的可调参数。训练的目标,用一句话说:让模型给“真实出现的下一个词”打出尽可能高的概率。
拿一句训练文本“今天天气很好”来说:模型读到“今天天气很”,要预测下一个词。如果它给“好”打了 41%,还不错;如果只打了 1%,说明它很“惊讶”。衡量惊讶的办法,来自香农:
惊讶度 = −log₂ P(真实的下一个词)单位是“比特”。概率 1 的事毫不惊讶(0 比特);概率 1/2 的事惊讶 1 比特;概率 1% 的事约 6.6 比特。训练所用的“交叉熵损失”,就是在所有训练文本上的平均惊讶度(实践中常用自然对数,只差一个常数倍)。
表 15-2 概率与惊讶度
模型给真实下一个词的概率 惊讶度(比特) 直观感受
100% 0 完全料到
50% 1.0 像猜硬币
41% 1.3 本章示例中的“好”
10% 3.3 有点意外
1% 6.6 很意外
0.1% 10.0 大吃一惊
训练的过程,就是一遍遍读文本、一遍遍微调参数,让平均惊讶度越来越低。在统计学里,这叫最大似然估计 :第 5 章的“似然”,在这里变成了“模型让真实文本出现的可能性”,训练就是把它推到最大。
训练用的文本有多少?以 Meta 公司 2024 年公开的 Llama 3 为例,预训练用了超过 15 万亿个词元。换一把能感受的尺子:一个人每天读 8 小时、每分钟读 250 个英文单词,要读二十多万年 (估算,按 1 个词元约 0.75 个单词折算)。第 10 章的大数定律在这里以一种新的面貌出现:见过的例子足够多,模型估出的概率才可能接近真实语言的规律。
预训练之后还有一步。 只会“续写”的模型未必会好好回答问题。所以还要用人工写的示范回答做微调,再用人类对回答好坏的偏好继续调整(常称“基于人类反馈的强化学习”),目标是让“有帮助、诚实、无害”的回答获得更高的概率。经过这一步,模型的输出依然是概率分布,只是分布的形状被重新塑造了。
15.5 温度:调节骰子的“尖锐程度”
拿到概率分布后,怎么选下一个词?最省事的办法是每次都选概率最大的那个。可研究者发现,这样生成的长文往往会陷入重复、单调的套话。所以实践中通常按概率抽样 ,并用一个叫“温度”的参数来调节分布:
温度低 (小于 1):高概率的词被进一步放大,低概率的词被压缩。回答更稳定、更保守。温度趋于 0 时,几乎总是选最可能的词。
温度等于 1 :按模型原始的分布抽样。
温度高 (大于 1):分布被“摊平”,冷门词更有机会被选中。回答更多样,也更容易跑偏。
温度 0.5:更确定 好 热 冷 不错 晴朗 糟糕 67% 1.4% 温度 1:原始分布 好 热 冷 不错 晴朗 糟糕 41% 6.0% 温度 1.5:更分散 好 热 冷 不错 晴朗 糟糕 32% 8.9% 横轴:候选词(好、热、冷、不错、晴朗、糟糕) 图 15-3 同一张分布在三种温度下的样子(示例数值)。温度 0.5 时“好”的概率升到约 67%;温度 1.5 时降到约 32%,“糟糕”从 6% 升到约 9%。
还有一种常见做法叫“核采样”(top-p):只保留概率从高到低累加到某个比例(例如 90%)的那一小撮候选词,再在其中抽样,把长长的冷门尾巴直接剪掉。这是第 11 章“尾巴”思想的一个工程版本:尾巴里的词单个概率很小,但它们合起来并不小,放任不管就会不时冒出怪词。
同一个问题问聊天机器人两次,为什么答案常常不一样?这是它“没想清楚”吗?
主要原因是抽样 。每一步都是从分布里抽一个词,只要温度不为 0,两次就可能在某一步抽到不同的词,之后的整条路径就分岔了(图 15-2 的概率树)。这和掷两次骰子得到不同点数一样,并不说明骰子坏了。反过来,如果多次回答的核心结论都一致,那个结论就更值得信任;如果每次说法都不同,说明模型在这个问题上的分布本来就很“平”,它自己也没把握。
15.6 为什么会“一本正经地胡说八道”
大语言模型有时会编造不存在的论文、书名、法规条文,而且说得有鼻子有眼。人们把这叫“幻觉”。用概率的眼光看,原因并不神秘:
第一,它优化的是“像”,不是“真”。 训练目标是让文本的概率高,而一段编造的引文,在格式、语气、用词上可以和真引文一模一样“像”。尾章会讲到的琳达问题说的是同一件事:说得通,不等于可能性大;流畅,不等于真实。
第二,罕见的事实,数据不够。 一位不太出名的学者的生日、一部冷门法规的条款编号,在训练文本里可能只出现过几次甚至没有。第 10 章说过,大数定律需要“大量”;数据稀少的地方,模型只能靠概括去“猜”,猜出来的往往是“看起来合理”的东西。
第三,每一步都必须掷出一个词。 在默认设置下,模型总要从分布里抽出点什么,而不会自动停下来说“我不知道”。除非训练时专门鼓励它表达不确定,否则它就会顺着最像样的路径写下去。
据 OpenAI 2023 年发布的 GPT-4 技术报告,只做过预训练的模型在选择题(MMLU 测试集的一个子集)上的校准 相当好:报告原话是“它对一个答案的预测信心,大体与答对的概率相符”。可经过后训练之后,报告写道“校准降低了”——模型变得更“有礼貌”、更会回答问题,却也更容易表现出与实际正确率不相称的自信。
这正是第 10 章“校准”这把尺子在人工智能上的应用。它提醒我们:一个系统说话的语气有多笃定,和它实际有多可靠,是两回事。
工程师减少幻觉的办法,也大多能在本书找到影子:让模型先检索可靠资料再回答(“检索增强生成”),相当于证据来了,就更新 ,在证据的条件下重新计算分布;让模型多次作答再比对一致性,相当于用大量抽样估计把握(第 10 章);训练模型在把握不足时说“不确定”,相当于要求它校准。
15.7 人工智能里处处是概率
大语言模型只是一个例子。放眼整个人工智能,概率几乎是它的通用语言:
表 15-3 人工智能中的概率积木
人工智能中的做法 本质上是 对应章节
大语言模型逐词生成 条件概率分布 + 链式乘法 + 抽样 4、12
训练时最小化交叉熵 最大似然估计 5、13
温度、核采样 调节分布的尖锐程度、剪掉尾巴 9、11
随机梯度下降:每次只用一小批数据估计改进方向 用样本平均估计总体平均 10、13
图像生成的扩散模型:从一团正态分布的随机噪声出发,一步步去噪成图 正态分布、从学到的分布中抽样 9、11
强化学习:让智能体最大化长期回报 期望 6
垃圾邮件过滤、医学影像辅助诊断 贝叶斯更新、基础比率 5
评估模型:“准确率 85%”要附置信区间,比较两个模型要做检验 置信区间、假设检验 13
大语言模型是
一台学出来的条件概率机器 :给定前文,输出下一个词元的分布
用海量文本、以最大似然为目标训练出来的
通过抽样一步步生成文字,所以同一问题可以有不同回答
大语言模型不是
一个存着现成答案、逐字检索的数据库
“只会背诵”的复读机——可能的前文多到无法背诵,它必须概括
自带事实核查的百科全书:流畅不等于真实
一个关于“它是否真正理解”已有定论的问题——这仍在争论之中
单次不可测,大量有规律 ——每个词是一次抽样,海量文本里藏着规律。证据来了,就更新 ——每写一个词,前文就变了,分布跟着变。既看平均,也看分布 ——温度调的,正是分布的形状。
本章带走
大语言模型是一台条件概率机器:看前文,给下一个词打概率,抽一个,再重复。
从马尔可夫(1913)、香农(1948)到 Transformer(2017),核心问题始终是“用前文预测下一个符号”。
可能的前文多达 10¹⁰⁰ 种,无法数频率,只能靠神经网络概括。
整段话的概率 = 各步条件概率之积;训练 = 最大似然 = 降低平均惊讶度。
温度调节分布的尖锐程度;抽样让回答有变化。
幻觉来自“像”与“真”的错位、罕见事实的数据稀少,以及未经校准的自信。
于是,下一个问题 机器可以学会给每个词打概率,却未必学会给自己的把握打分。人呢?拥有与缺乏“概率思维”,差别在哪里?
上一章留下的问题: 机器可以学会给每个词打概率,却未必学会给自己的把握打分。人呢?拥有与缺乏“概率思维”,差别在哪里?
16.1 再回到三扇门
序章里,近千位博士中的大多数在三扇门前出了错;一位顶尖的数学家要靠计算机模拟才被说服。现在请你再读一遍那道题,然后试着在不看第 5 章的情况下,给自己讲一遍为什么应该换门。
用自己的话,讲清三扇门为什么应该换。
一种讲法:你最初选中车的概率是 1/3,这个数不会因为主持人开门而改变,因为无论车在哪,主持人总能 打开一扇羊门,他的动作对“你是否选中”没有提供信息。剩下的 2/3 原本分在另外两扇门上;主持人知道车在哪,他替你排除了其中一扇羊门,这 2/3 就全部集中到了没被打开的那扇门上。
另一种讲法(第 5 章):先验各 1/3;主持人开 3 号门的似然,在“车在 1 号”时是 1/2,在“车在 2 号”时是 1;后验是 1/3 对 2/3。
如果你讲得出来,你就已经拥有了那些博士当时缺少的东西。不是更高的智商,而是一个习惯:不只数“有几种可能”,还要追问“这些可能是怎么来的、谁知道什么、这条信息是怎样产生的”。
这就是概率思维。它不是一套公式,而是几个看问题的习惯。
16.2 概率思维的五个习惯
习惯一:先把可能列全。 面对不确定,第一步不是猜答案,而是问“可能会发生什么”。给硬币涂上颜色(第 3 章),让每种结果机会相当;正面难算,就反过来算“一个都不发生”。很多决策失误,不是算错了,而是根本没想到某种可能。
习惯二:问“本来有多常见”。 一条醒目的证据面前,先停一下,想想基础比率(第 5 章)。阳性之前,患病率是多少?“这个人看起来像程序员”之前,全城有多少人是程序员?忽略先验,是聪明人最常犯的错误。
习惯三:证据来了,按比例更新。 不固守,也不摇摆。一条证据该让你改变多少看法,取决于它在不同假设下出现的可能差多少(似然比),而不是它有多刺眼。“没找到”也是证据(第 5 章的搜索)。
习惯四:既看平均,也看分布。 期望告诉你“平均得到多少”,方差和尾巴告诉你“会不会出局”(第 6、7、11 章)。任何可能让你一次输光的策略,无论期望多诱人,都要先问:我承受得起最坏的情况吗?你只走一条路径。
习惯五:分清“单次”与“大量”。 概率对大量重复说话,对单次只给把握。所以要用过程 而不是运气 来评价决策;用校准而不是“这次对没对”来评价预测(第 10 章);并且时刻检查:这些事件真的独立吗?这个相关背后有没有混杂因素(第 4、12 章)?
单次不可测,大量有规律。 证据来了,就更新。 既看平均,也看分布。
这三句话,你在序章第一次读到时,它们只是口号。现在,你应该能从三扇门、马踢数据、赌场、民调、仓库和火箭里,自己把它们推出来。
16.3 有与没有的差别
拥有概率思维的人,并不会更少遇到坏运气;但他们更少被运气愚弄 。看三个经典的例子。
第一个是幸存者偏差 (第 13.7 节)。还记得那些弹孔吗?发动机上几乎没有弹孔,不是因为那里不挨打,而是那里挨了打的飞机没能飞回来。成功学书籍里的创业故事、排行榜上的“常胜基金”、“我爷爷抽烟喝酒活到九十九”,都是只看到了飞回来的飞机。有概率思维的人,看到一份成功名单时,第一反应是问:失败的那些,去哪了?
心理学家卡尼曼在给以色列空军飞行教官讲课时,一位教官反驳他:“每次我表扬学员做了一个漂亮的动作,下一次他就做得更差;每次我痛骂他,下一次他就做得更好。所以批评比表扬有用。”
卡尼曼意识到,这是均值回归 :一次表现是能力加上运气。特别好的一次,往往运气也好,下一次运气回到平常,表现就“变差”;特别差的一次同理。教官的表扬和批评可能都没起作用,他看到的只是随机波动。
心理学家特沃斯基和卡尼曼描述了一位虚构的女士琳达:31 岁,单身,直言不讳,非常聪明,学哲学出身,学生时代关心社会正义问题。然后问:下面哪种更可能?(甲)琳达是银行柜员;(乙)琳达是银行柜员,并且积极参与女权运动。
在他们的一组实验中,约 85% 的受访者选了乙。可“银行柜员且女权主义者”只是“银行柜员”的一部分,它的概率不可能 更大——这是第 3 章维恩图里最基本的一条:交集不会大于其中任何一个集合。
故事越具体、越生动,听起来越“像真的”,概率却只会越小。这叫合取谬误 。它提醒我们:“说得通”和“可能性大”是两回事。
表 16-1 有无概率思维的差别
情境 缺乏概率思维 拥有概率思维 对应章节
三扇门、两个选项 “剩两种可能,各一半” 追问可能怎么来的、谁知道什么 序章、5
轮盘连开 10 次黑 “该出红了” 独立事件没有记忆 4、10
体检一项阳性 “我得病了” 先问患病率,再按证据更新 5
新闻里的罕见事件 印象深,就觉得常见 看基础比率和分母 3、5、8
一项决策结果很差 “决策错了” 分清决策质量与运气;看长期校准 1、10
高收益投资 只看平均收益 看波动、尾部、能否承受最坏情况 6、7、14
两件事同时变化 “一个导致另一个” 找混杂因素;能随机分组就随机分组 12、13
成功者的经验 照搬 问失败者在哪里(幸存者偏差) 13、尾章
表扬后变差、批评后变好 “批评更有效” 先想到均值回归 尾章
AI 给出一段流畅的回答 说得头头是道,就信 流畅不等于真实;问依据,看它是否校准 15
预测未来 “一定会”“绝不会” “七成把握”,并记录校准 1、10
概率思维是
在信息不完整时,诚实地给出“几成把握”
随证据按比例更新
为最坏情况留余地,同时抓住期望为正的机会
用过程与校准评价自己
概率思维不是
对一切都说“不确定”、拒绝下判断
用数字包装直觉(萨莉·克拉克案的 7300 万分之一)
冷漠:知道 1% 的风险,不代表不在乎那 1% 里的人
保证每次都对
16.4 回头看这段阶梯
第1–2章 是什么 · 从哪来 第 3 章 数清所有可能 第 4 章 条件概率与独立 第 5 章 贝叶斯定理 第 6 章 随机变量与期望 第 7 章 方差与风险 第 8 章 数个数的分布 第 9 章 连续的分布 第 10 章 大数定律 第 11 章 中心极限定理 第 12 章 相关与马尔可夫链 第 13 章 从概率到统计 第 14 章 概率在现实世界 第 15 章 概率与人工智能 尾章 概率思维 Why 它是什么、从哪来 How ① 描述可能性 How ② 描述随机量 How ③ 从一个到大量 What 走进世界 认知阶梯:每一章是一级台阶,由下往上 图 16-1 全书的认知阶梯。每一级都由上一级引出:知道了概率是什么(1–2),就要数清可能(3);可能会随消息变(4),于是要从结果反推原因(5);结果常常是个数(6),数有平均也有波动(7),常见的波动有固定的模式(8–9);大量叠加时出现稳定的规律(10–11),牵连与时间让规律更丰富(12),最后从数据反推规律(13),走进世界(14),也走进今天的人工智能(15)。
16.5 本书的核心贡献
概率是一把尺子 它把“有多可能”量成 0 到 1 之间的数,数学上就叫测度;读数取决于你知道什么,所以信息变了,概率就该变。
一切从数清可能开始 样本空间要列到等可能的那一层;事件是地图上的一块,概率是它的面积;正面难算就反过来算。
条件概率与贝叶斯:证据来了,就更新 新消息缩小地图;后验 = 先验 × 似然;先验不能丢,P(证据 | 假设) 不等于 P(假设 | 证据)。
期望与方差:既看平均,也看分布 期望是平衡点,方差是不确定的尺寸;波动拖累复利,分散有相关性的地板,负期望的游戏没有必胜的下注法。
大数定律与中心极限定理:单次不可测,大量有规律 平均值按 σ/√n 收敛到期望,偏离的形状是钟形;前提是独立、没有巨头,否则会出现肥尾。
从概率到统计,再到世界 用置信区间给估计配上误差尺,用假设检验控制错误率,用随机分组走向因果;天气、地质、投资、制药、供应链、航天,都在用同一套积木。
人工智能是一台条件概率机器 大语言模型看前文、给下一个词打概率、抽样、再重复;它用最大似然学会,用温度调节分布,也会因“像”与“真”的错位而产生幻觉。
16.6 留给你的问题
回想你最近一次“事后看来很蠢”的决定。当时你手上的信息下,它的期望和风险是怎样的?是决策错了,还是运气差?
写下十件你“有八成把握”的事,一个月后看看是否约有八件成真。你的把握校准得怎么样?
下一次看到“某某与某某显著相关”的新闻时,试着列出三个可能的混杂因素。
你身边有哪些“幸存者”的经验正在被当作规律?失败的人去了哪里?
你的工作里,有没有哪个环节是在把许多“99.9% 可靠”的步骤串联起来?整条链有多可靠?冗余加在哪里最划算?
如果只能把本书的一句话教给一个孩子,你会选哪一句?为什么?
16.7 术语表
样本空间 Ω 一次试验所有可能结果的集合(第 3 章)。
事件 样本空间的一部分;它的概率是这部分的“面积”(第 2、3 章)。
条件概率 P(A | B) 已知 B 发生时 A 的概率 = P(A 且 B) ÷ P(B)(第 4 章)。
独立 一件事是否发生,不改变另一件事的概率;此时可以直接相乘(第 4 章)。
全概率公式 按来源分块算概率再相加(第 4 章)。
贝叶斯定理 后验 = 似然 × 先验 ÷ 证据总概率(第 5 章)。
先验 / 似然 / 后验 看到证据前的概率 / 假设成立时出现该证据的概率 / 看到证据后的概率(第 5 章)。
随机变量 给每个结果贴上数字的规则(第 6 章)。
分布 随机变量各个取值及其概率;连续时用密度描述(第 6、9 章)。
期望 E[X] 按概率加权的平均,分布的平衡点(第 6 章)。
方差 / 标准差 偏离期望的平方的平均 / 其平方根,衡量不确定的尺寸(第 7 章)。
二项 / 几何 / 泊松分布 n 次成功几次 / 第几次才成功 / 稀有事件发生几次(第 8 章)。
指数 / 正态分布 等待时间 / 钟形曲线(第 9 章)。
大数定律 独立重复时,平均值收敛到期望(第 10 章)。
中心极限定理 许多独立小量之和近似服从正态分布(第 11 章)。
相关系数 ρ 两个量直线关系的强弱与方向,−1 到 1(第 12 章)。
马尔可夫链 下一步只取决于当前状态的随机过程(第 12 章)。
置信区间 估计值 ± 误差范围;95% 指方法在重复中约 95% 会盖住真值(第 13 章)。
p 值 原假设成立时,出现至少这么极端结果的概率(第 13 章)。
幸存者偏差 只看到通过了某种筛选(活下来、成功、被发表)的样本,而把被筛掉的忽略,导致结论系统性偏差(第 13 章)。
蒙特卡洛方法 用大量随机模拟来估计概率与期望(第 10、14 章)。
词元(token) 语言模型处理文字的最小单位,可能是一个字、一个词或词的一部分(第 15 章)。
链式法则 一段序列的概率 = 各步条件概率之积(第 4、15 章)。
交叉熵 / 惊讶度 模型给真实结果的概率取负对数,再求平均;训练大语言模型就是让它变小(第 15 章)。
温度 调节模型输出分布尖锐程度的参数:越低越确定,越高越多样(第 15 章)。
最后,回到书名。尺子不能替你决定房子该盖多高,但没有尺子,你连地基都打不直。概率也不能替你做决定,它只是让你在看不清未来时,看清自己到底看清了多少 。愿这把尺子,从此一直放在你的口袋里。
本书由大语言模型在人工设定的流程下写成。第 15 章说过:流畅,不等于真实。 所以在全书完成后,我们做了一轮联网核查:把书中可核查的史实、数字和引语逐条列出,打开原始网页(论文、官方报告、机构页面、百科条目及其存档)对照,再按结果修改正文。本附录记录每一条的状态与出处,方便你自己去查。
A.1 核查方法与结果
核查时间: 2026 年 9 月 30 日;逐条抓取下列网页原文,不依赖记忆。
本书推导的数字 (组合数、贝叶斯后验、期望、模拟结果等)另行用程序复算,模拟均使用固定随机种子,可以复现。
结果: 共 87 条。已核实 60 条;已修正 13 条(发现原稿有误或不够准确,已改写正文);部分核实 6 条(核心内容成立,但细节只找到二手来源,正文已用“据……”限定);已复算 8 条。
局限: 以百科条目为出处的,是其所引文献的二手转述;少数官方网站拒绝抓取,改用存档或百科。欢迎读者按链接追溯一手文献并指正。
这轮核查改了什么。 最典型的几处:棣莫弗“在咖啡馆给赌徒算题谋生”缺乏依据,已改;高尔顿板的年份由 1873 改为 1874;埃尔德什被计算机说服的故事,改为引用当事人瓦佐尼的回忆;西尔弗关于“国家气象局校准良好”的转述在其摘录中找不到,已删去;GPT-4 技术报告的校准结论改用原话;索尔克疫苗试验、盖洛普民调、萨莉·克拉克案都补上了关键细节。这些错误在原稿中读起来毫无破绽——这正是事实核查必不可少的原因。
A.2 逐条核查表
序章 · 三扇门
第 1 章 · 概率是一把尺子
第 2 章 · 从赌桌到宇宙
第 3–4 章 · 数清可能、条件概率
第 5 章 · 贝叶斯
第 6–9 章 · 期望、方差、分布
第 10–13 章 · 大数、中心极限、相关、统计
第 14 章 · 现实世界
第 15 章 · 概率与人工智能
尾章 · 概率思维
A.3 延伸阅读
Hald, A. A History of Probability and Statistics and Their Applications before 1750 . Wiley, 1990.
Stigler, S. M. The History of Statistics: The Measurement of Uncertainty before 1900 . Harvard University Press, 1986.
Salsburg, D. The Lady Tasting Tea . W. H. Freeman, 2001.
Kahneman, D. Thinking, Fast and Slow . 2011.
Silver, N. The Signal and the Noise . 2012.
Blitzstein, J. & Hwang, J. Introduction to Probability (2nd ed.). CRC Press, 2019——覆盖本书第 3–13 章的标准大学教材。
《概率是一把尺子》 · 从三扇门讲起:用第一性原理看懂不确定的世界 Articulate 工作室 史实口径:年代与事件以一手文献及主流科学史研究为准(Hald《概率统计史》、Stigler《统计学史》、Todhunter 等);轶事有多种版本者正文已注明“据……记述”。数字口径:标“公开”者来自官方或论文;标“估算”者来自第三方研究;标“示例”者为便于理解而设的演示参数,非真实产品或市场数据。书中模拟图使用固定随机种子,可复现。逐条事实核查与出处见书末附录。