大数定律
“大数定律:一次试验是运气,多次的平均是规律。”
公式
x̄ₙ = (X₁ + X₂ + ⋯ + Xₙ) / n → μ (n → ∞)怎么读: 重复同一个实验很多次,结果的平均值随着次数增加,会趋近理论期望值 μ
- Xᵢ
- — 第 i 次试验的结果
- x̄ₙ
- — n 次试验的样本均值
- n
- — 试验次数——越大越稳定
- μ
- — 理论期望值(真实均值)
引子
抛 10 次硬币可能很不稳,但抛一万次,正面出现的比例就会稳稳地靠近 0.5——偶然被统计驯服了。
通俗地说
大数定律说的是:重复同一个随机实验很多次,结果的平均值会越来越接近理论期望值 μ。单次结果依然不可预测,但平均值变得可预测。
直觉
单一的随机事件会波动。但把成千上万次叠加起来求平均,上下起伏会相互抵消,只留下真实值。样本越大,任何一次「幸运」事件的影响就以 1/n 的速度消退——于是平均值「忘掉运气」,安定在期望值上。
如何构建
两个量——样本均值 x̄ₙ 和真实均值 μ。定律说随着 n 增大,它们的差距趋于 0。为什么?因为样本均值的波动(标准差)以 σ/√n 的速度缩小。n 变成 100 倍,波动就缩小到 1/10。无限次抛下去,波动趋于消失,把平均值钉在 μ 上。
示例
一枚均匀硬币抛 10 次可能出现 7 次正面(比例 0.7)——并不稀奇。但抛 10000 次,正面数会聚集在 5000 附近(比例 ≈ 0.500)。骰子也一样——多次投掷的平均值会收敛到 (1+2+3+4+5+6)/6 = 3.5。
常见误区
小心赌徒谬误。连续五次正面并不意味着反面「该来了」。每一次抛掷依然是 50:50。比例之所以趋近 0.5,不是因为过去被「补偿」了,而是因为大量的后续试验把早期的偏差「稀释」了。
用在哪里
保险(大量保单的赔付率是可预测的)、赌场的庄家优势、民意调查、蒙特卡洛模拟、质量控制,以及一切依赖大样本的统计估计——只要个体不可预测但群体可预测,就用得到它。
从何而来
雅各布·伯努利在 1713 年身后出版的《猜度术》中证明了它,并称之为自己的「黄金定理」。这是数学第一次证明了偶然性背后隐藏的秩序。
前置概念
小测验
一枚均匀硬币刚刚连续五次正面朝上。下一次抛掷正面朝上的概率是多少?
- 远小于 0.5
- 0.5✓
- 远大于 0.5
- 0
练习
一枚均匀骰子被反复投掷,平均点数会收敛到多少?
答案: 3.5
- 期望值 = (1+2+3+4+5+6)/6
- = 21/6 = 3.5
要点: 样本均值会收敛到期望值 μ。
抛掷均匀硬币非常多次,正面出现的比例会收敛到多少?
答案: 0.5
- 正面出现的概率是 1/2
- 所以比例会收敛到 0.5
要点: 长期比例等于该事件的概率。
连续四次正面之后,求均匀硬币下一次正面朝上的概率。
答案: 0.5
- 每次抛掷都是独立的——不受过去影响
- 概率仍然是 0.5
要点: 赌徒谬误——硬币没有记忆。
用大数定律解释:即使偶尔出现大赢家,赌场为什么长期依然盈利?
答案: undefined
- 每局游戏的期望值都小幅偏向庄家(庄家优势)
- 单局会有波动——玩家可能赢一大笔
- 但数百万局之后,平均值会收敛到庄家优势,所以赌场获利
要点: 小优势乘以大数量,等于稳赚。