数学公理体系大全:第二十五章 柯尔莫哥洛夫概率公理:随机性的数学基石 第二十五章 柯尔莫哥洛夫概率公理随机性的数学基石引言从赌徒的直觉到测度论的严格化概率可能是数学中最古老、最贴近日常直觉却又最迟获得稳固逻辑基础的学科。从古巴比伦人掷骰骨占卜到文艺复兴时期卡尔达诺与伽利略对赌局胜率的系统整理再到1654年帕斯卡与费马那封开启近代概率论的著名通信——人类对不确定性的量化始终与“等可能”的朴素观念缠绕在一起。1812年拉普拉斯在《概率的分析理论》中把这种观念凝练为一个经典定义事件的概率等于有利情形数与所有等可能情形数之比。此定义简单而强大足以处理骰子、纸牌与抽奖问题却暗含一个致命缺陷“等可能”本身就是一个概率概念定义陷入了循环论证。更严重的是一旦可能结果为无穷多——比如向靶心投掷飞镖每个点被击中的概率为零——比值定义便彻底崩溃不可数个零无法求和为一有限可加性在此无力回天。整个19世纪概率论经历了一段奇特而尴尬的“青春期”。伯努利在《猜测术》中证明了弱大数定律棣莫弗与拉普拉斯发现了中心极限定理的雏形高斯以误差理论奠定了最小二乘法泊松给出了稀有事件定律。这些成就在物理学、天文学和社会统计中攻城略地其数学技巧日益精深但其逻辑根基却始终漂浮在直觉与物理模拟的迷雾之中。1889年法国数学家伯特兰在《概率计算》中提出了著名的“弦长悖论”在圆内随机选取一条弦弦长大于内接正三角形边长的概率究竟是1/2、1/3还是1/4这个悖论尖锐地暴露了“随机”一词在没有严格数学定义时可以拥有多种互不相容的含义概率论的基础危机从此公开化。与概率论内部的挣扎几乎同步另一条线索正在实变函数论中迅速展开。从19世纪末到20世纪初博雷尔与勒贝格发展出了测度与积分的革命性理论。勒贝格在1902年的博士论文中用可列可加测度统一了长度、面积、体积的概念并建立了以他名字命名的积分理论。博雷尔更是明确地指出概率论的语言本质上就是测度论的语言——事件是集合概率是集合的测度期望则是积分。然而将这一洞见落实为一套严密的公理体系却还需要三十年的积累与一位天才的综合。1933年年仅三十岁的苏联数学家安德雷·柯尔莫哥洛夫出版了一本薄薄的小册子——德文版《概率论基础》。在这本不足百页的著作中他以惊人的简洁与洞察力完成了概率论的彻底公理化概率空间就是总测度为1的测度空间随机变量是此空间上的可测函数期望即勒贝格积分独立性是乘积测度的因子分解条件期望则由Radon‑Nikodym定理严格定义。一夜之间长达两个世纪的基础争论烟消云散。概率论从一门依赖直觉的“应用技艺”升格为数学分析中根基稳固、前景无量的合法子领域并由此开启了随机过程、鞅论、随机微分方程等一系列20世纪最壮观的理论洪流。本章将完整展开柯尔莫哥洛夫的概率公理体系。我们从概率空间的三条公理出发阐释可列可加性为何是克服连续统悖论的唯一钥匙并以离散概率空间和几何概率模型为具体实例。接着我们系统推导概率测度的基本运算法则——单调性、次可加性、连续性——揭示这些性质如何无一例外地根植于可列可加性公理。然后严格定义条件概率证明全概率公式与贝叶斯公式并以此建立事件独立性的公理化定义与乘积空间的构造。在引入随机变量的可测性定义之后我们将期望视为勒贝格积分展现其线性性、单调收敛定理以及分布于积分之间的统一关系。条件期望的公理化定义——基于Radon‑Nikodym定理——将被详细阐述并揭示其作为“给定信息下的最佳预测”与“平方可积函数的正交投影”的深刻几何内涵。最后我们以在有限方差假设下弱大数定律的严格推导作为高潮展示概率公理如何将“长期频率趋于概率”这一古老直觉转化为不可动摇的数学定理。以此为起点概率公理的伟力还将延伸至几乎必然收敛、中心极限定理以及整个随机世界的深处。25.1 概率空间的三条公理25.1.1 可列可加性从有限走向无穷的必经之路古典概率定义最脆弱的环节不在有限世界而在无穷疆域。考虑在区间 ([0,1]) 上“均匀地”随机选点。每一点 (\omega) 被选中的概率应为多少如果对每个 (\omega) 赋予正概率 (p0)则取充分多但有限个这样的点其概率和即已超过1违背归一性。因此只能令每一点的概率为零(\mathbb{P}({\omega}) 0)。但整个区间由不可数个这样的零概率点组成总概率却为1。有限可加性无法处理这一跳跃它只能保证有限个零概率点的并集概率为零却无力言说不可数并集的整体行为。这便是“连续统悖论”的测度论面孔不可数多个零之和未必为零。历史上许多学者曾试图用有限可加性在连续空间上建立概率但均遇到了无法解决的困难。例如若只要求有限可加性我们可以构造一个“概率”使得每个单点概率为零整个区间概率为一然而却不能满足我们需要的极限封闭性——而概率论的一切精细论证大数定律、中心极限定理都离不开极限的交换。勒贝格测度论给出的回答是放弃对不可数求和的幻想转而采用可列可加性countable additivity。我们承认单点集的概率为零但整个区间并非可数个点的并集这是康托尔对角线法的一个推论因此可列可加性并不要求整个区间的概率等于单点概率之和。相反我们只要求对于两两不交的可数事件序列并集的概率等于概率之和。这一看似微小的改变恰好匹配了分析学中取极限的一切需求——序列极限、级数求和、逼近论断——同时规避了连续统的困境。概率空间因此成为勒贝格意义下总测度为1的测度空间。25.1.2 为什么需要σ代数在定义概率测度之前必须明确我们可以对哪些集合赋予概率。直觉上我们希望所有子集都可测但实变函数论中的一个经典结果——维塔利定理——表明在实数轴上接受选择公理的前提下存在不可测的勒贝格集。这意味着如果坚持要在所有子集上定义概率就必须放弃可列可加性或平移不变性等看似合情合理的要求。这迫使我们在建立概率空间时只能将概率测度定义在一个满足某些封闭性的子集族上——这个子集族就是σ代数。25.1.3 概率空间的严格定义定义 25.1.1σ代数与可测空间设 (\Omega) 为非空集合称为样本空间其元素 (\omega) 代表一个基本结果。(\Omega) 上的一个σ代数(\mathcal{F}) 是 (\Omega) 子集构成的集族满足(\Omega \in \mathcal{F})若 (A \in \mathcal{F})则补集 (A^c \in \mathcal{F})若 ({A_n}{n1}^\infty \subseteq \mathcal{F})则可数并 (\bigcup{n1}^\infty A_n \in \mathcal{F})。(\mathcal{F}) 中的元素称为事件。二元组 ((\Omega, \mathcal{F})) 称为可测空间它划定了我们可以合法赋予概率的那些子集。定义 25.1.2概率测度与概率空间在可测空间 ((\Omega, \mathcal{F})) 上函数 (\mathbb{P}: \mathcal{F} \to [0, 1]) 称为概率测度若满足(P1) 归一性(\mathbb{P}(\Omega) 1)。(P2) 可列可加性对任意两两不交的事件列 ({A_n}{n1}^\infty)即 (A_i \cap A_j \emptyset)(i \neq j)有[\mathbb{P}!\left(\bigcup{n1}^\infty A_n\right) \sum_{n1}^\infty \mathbb{P}(A_n).]三元组 ((\Omega, \mathcal{F}, \mathbb{P})) 称为概率空间。这一结构表明概率论无非是总测度为1的测度论。自此概率的一切独特概念——随机变量、期望、独立性、条件化——都在此框架中获得了统一定义。推论 25.1.3空集的概率(\mathbb{P}(\emptyset) 0)。证明取事件列 (A_1 \Omega)且对 (n \ge 2) 令 (A_n \emptyset)。这些集合显然两两不交并集为 (\Omega)。由可列可加性[1 \mathbb{P}(\Omega) \sum_{n1}^\infty \mathbb{P}(A_n) 1 \sum_{n2}^\infty \mathbb{P}(\emptyset).]若 (\mathbb{P}(\emptyset) 0)则右端无穷级数将发散至无穷矛盾。故必须 (\mathbb{P}(\emptyset) 0)。∎25.1.4 离散概率空间最简单的概率空间是离散概率空间。此时 (\Omega) 为有限集或可数集σ代数通常取为幂集 (\mathcal{F} \mathcal{P}(\Omega))即所有子集。概率测度完全由每个样本点 (\omega) 上分配的非负质量 (p_\omega) 决定满足 (\sum_{\omega \in \Omega} p_\omega 1)。对任何事件 (A \subseteq \Omega)定义[\mathbb{P}(A) \sum_{\omega \in A} p_\omega.]可列可加性退化为级数的可列可加性因而自动成立。古典概型等可能模型是离散概率空间的特例设 (|\Omega| N) 有限且对称性要求所有样本点等可能即 (p_\omega 1/N)。此时 (\mathbb{P}(A) |A| / N)与拉普拉斯公式完全一致。区别在于这里的“等可能”是模型的一条附加假设而非概率的定义本身——循环已被彻底打破。古典概型虽简单却已蕴含组合计数的大量精妙问题生日悖论、德梅雷问题、扑克牌概率皆可在此框架内精确求解。25.1.5 几何概率与贝特朗悖论的澄清连续型概率空间的范本是几何概率。设 (\Omega \subseteq \mathbb{R}^n) 为勒贝格可测集且其勒贝格测度满足 (0 \lambda(\Omega) \infty)。令 (\mathcal{F}) 为 (\Omega) 的全体勒贝格可测子集定义[\mathbb{P}(A) \frac{\lambda(A)}{\lambda(\Omega)}, \quad A \in \mathcal{F}.]这便是“均匀随机取点”的严格表述。单位区间上的均匀分布是其中最简例子(\Omega [0,1])(\mathbb{P}(A) \lambda(A))。贝特朗悖论的“矛盾”在此框架下烟消云散。所谓随机选取一条弦可以对应三种不同的概率空间每种都满足公理要求只是样本空间和概率测度不同随机端点模型在圆周上独立选取两点弦长为 (2\sin(\theta/2))对应概率 (1/3)。随机半径模型固定一条半径随机选取其上一点作垂直弦对应概率 (1/2)。随机中点模型在圆内均匀选取中点弦垂直于中点与圆心的连线对应概率 (1/4)。三种模型都是合法的概率空间悖论并非逻辑矛盾而是日常语言中“随机”一词的歧义性所导致的模型混淆。公理化澄清了这一点概率值依赖于所选择的概率空间而选择哪一个空间取决于所建模的物理机制——这正是应用概率论的核心哲学。25.2 概率测度的基本性质三条公理看似简约却足以推导出概率运算的全部基本法则。这些推导完全平行于一般测度论却因归一性而带上概率特有的色彩。25.2.1 有限可加性、单调性与互补律定理 25.2.1有限可加性若 (A, B \in \mathcal{F}) 且 (A \cap B \emptyset)则 (\mathbb{P}(A \cup B) \mathbb{P}(A) \mathbb{P}(B))。此结论可推广至任意有限个两两不交的事件。证明在可列可加性中取序列 (A, B, \emptyset, \emptyset, \dots) 即得。∎定理 25.2.2互补律(\mathbb{P}(A^c) 1 - \mathbb{P}(A))。证明(\Omega A \cup A^c) 且不交由有限可加性 (1 \mathbb{P}(\Omega) \mathbb{P}(A) \mathbb{P}(A^c))。∎定理 25.2.3单调性若 (A \subseteq B)则 (\mathbb{P}(A) \le \mathbb{P}(B))。证明将 (B) 写为不交并 (B A \cup (B \setminus A))由非负性即得 (\mathbb{P}(B) \mathbb{P}(A) \mathbb{P}(B \setminus A) \ge \mathbb{P}(A))。∎25.2.2 次可加性与容斥原理定理 25.2.4次可加性对任意可数个事件 ({A_n})[\mathbb{P}!\left(\bigcup_{n1}^\infty A_n\right) \le \sum_{n1}^\infty \mathbb{P}(A_n).]证明将并集不交化令 (B_1 A_1)(B_n A_n \setminus \bigcup_{k1}^{n-1} A_k)(n \ge 2)。诸 (B_n) 两两不交且 (\bigcup B_n \bigcup A_n)。由于 (B_n \subseteq A_n)有 (\mathbb{P}(B_n) \le \mathbb{P}(A_n))。再由可列可加性[\mathbb{P}!\left(\bigcup A_n\right) \sum \mathbb{P}(B_n) \le \sum \mathbb{P}(A_n). \quad \qedhere]次可加性是博雷尔‑坎泰利引理的核心工具这一引理又构成强大数定律与0‑1律的基石。定理 25.2.5简单容斥公式对任意 (A, B \in \mathcal{F})[\mathbb{P}(A \cup B) \mathbb{P}(A) \mathbb{P}(B) - \mathbb{P}(A \cap B).]推广至 (n) 个事件的容斥原理同样成立表达为各阶交的概率的交替和[\mathbb{P}!\left(\bigcup_{i1}^n A_i\right) \sum_{i} \mathbb{P}(A_i) - \sum_{ij} \mathbb{P}(A_i \cap A_j) \cdots (-1)^{n-1} \mathbb{P}(A_1 \cap \cdots \cap A_n).]证明(A \cup B A \cup (B \setminus A)) 为不交并故 (\mathbb{P}(A \cup B) \mathbb{P}(A) \mathbb{P}(B \setminus A))。又 (B (B \setminus A) \cup (A \cap B)) 为不交并因而 (\mathbb{P}(B \setminus A) \mathbb{P}(B) - \mathbb{P}(A \cap B))。代入即得。∎容斥原理在组合概率中有广泛应用例如计算匹配问题、相遇问题以及随机置换中不动点个数的分布。25.2.3 连续性极限与概率可交换可列可加性一个极为宝贵的等价形式是连续性对于单调的事件序列概率与极限可交换。这一性质在极限定理的证明中扮演枢纽角色。定理 25.2.6递增连续性设事件列 ({A_n}) 递增即 (A_1 \subseteq A_2 \subseteq \cdots)。则[\mathbb{P}!\left(\bigcup_{n1}^\infty A_n\right) \lim_{n\to\infty} \mathbb{P}(A_n).]定理 25.2.7递减连续性设事件列 ({A_n}) 递减即 (A_1 \supseteq A_2 \supseteq \cdots)。则[\mathbb{P}!\left(\bigcap_{n1}^\infty A_n\right) \lim_{n\to\infty} \mathbb{P}(A_n).]递增连续性证明构造不交事件列 (B_1 A_1)(B_n A_n \setminus A_{n-1})(n \ge 2)。这些 (B_n) 两两不交且 (\bigcup_{k1}^n B_k A_n)(\bigcup_{k1}^\infty B_k \bigcup_{k1}^\infty A_k)。由可列可加性[\mathbb{P}!\left(\bigcup_{n1}^\infty A_n\right) \sum_{k1}^\infty \mathbb{P}(B_k) \lim_{n\to\infty} \sum_{k1}^n \mathbb{P}(B_k) \lim_{n\to\infty} \mathbb{P}(A_n).]递减连续性可由互补律转化为递增连续性的情形。∎可以证明在有限可加性的前提下递增连续性与可列可加性是等价的。这意味着我们完全可以将连续性作为公理而将可列可加性作为推论——这正是某些公理体系的做法。连续性定理的威力在于它允许我们将“极限进入概率”不加犹豫地使用这在大数定律的证明中尤为关键。25.3 条件概率信息更新下的概率律如果说概率测度刻画的是试验前的“先验”不确定性那么条件概率则刻画了在获知某些事件已经发生的前提下不确定性如何被修正和重分配。这是概率论区别于一般测度论的核心概念之一。25.3.1 条件概率的定义及其测度性质定义 25.3.1条件概率设 (A, B \in \mathcal{F}) 且 (\mathbb{P}(B) 0)。在事件 (B) 发生的条件下事件 (A) 的条件概率定义为[\mathbb{P}(A \mid B) \frac{\mathbb{P}(A \cap B)}{\mathbb{P}(B)}.]直观上已知 (B) 发生后样本空间从 (\Omega) 缩小至 (B)所有事件的概率按比例重新归一化。可以验证对固定的 (B)集函数 (\mathbb{P}(\cdot \mid B)) 自身满足概率测度的三条公理非负性显然(\mathbb{P}(B \mid B) 1)对于两两不交的 ({A_n})[\mathbb{P}!\left(\bigcup_{n1}^\infty A_n \mid B\right) \frac{\mathbb{P}!\left((\bigcup A_n) \cap B\right)}{\mathbb{P}(B)} \frac{\sum \mathbb{P}(A_n \cap B)}{\mathbb{P}(B)} \sum \mathbb{P}(A_n \mid B),]其中第二等号利用了原测度 (\mathbb{P}) 的可列可加性。因此条件概率并非独立于原测度的新实体而仅仅是原测度在缩小的子空间上的重新标准化。25.3.2 乘法定理联合概率的序贯分解定理 25.3.2乘法定理若 (A_1, A_2, \dots, A_n \in \mathcal{F}) 且满足 (\mathbb{P}(A_1 \cap \dots \cap A_{n-1}) 0)从而后续所有条件概率均有定义则[\mathbb{P}(A_1 \cap A_2 \cap \dots \cap A_n) \mathbb{P}(A_1),\mathbb{P}(A_2 \mid A_1),\mathbb{P}(A_3 \mid A_1 \cap A_2)\cdots\mathbb{P}(A_n \mid A_1 \cap \dots \cap A_{n-1}).]证明将右端每个条件概率按定义展开为分数所有中间分母与相邻分子依次相消最终留下 (\mathbb{P}(A_1 \cap \dots \cap A_n))。∎乘法定理是贝叶斯网络、马尔可夫链以及任何序贯决策模型的逻辑起点它提供了将高维联合分布合法地分解为一串低维条件分布乘积的法则使得复杂系统的概率建模变得可能。25.3.3 全概率公式与贝叶斯公式定理 25.3.3全概率公式设 ({B_n}{n \in \mathbb{N}}) 为 (\Omega) 的一个可数划分即诸 (B_n) 两两不交且 (\bigcup{n} B_n \Omega)并假设 (\mathbb{P}(B_n) 0) 对所有 (n) 成立。则对任何事件 (A)[\mathbb{P}(A) \sum_{n} \mathbb{P}(A \mid B_n),\mathbb{P}(B_n).]证明(A A \cap \Omega \bigcup_n (A \cap B_n))且这些交集两两不交。由可列可加性[\mathbb{P}(A) \sum_n \mathbb{P}(A \cap B_n) \sum_n \mathbb{P}(A \mid B_n),\mathbb{P}(B_n). \quad \qedhere]全概率公式是“分而治之”策略的概率版本把复杂事件拆解到互斥的完备情景中分别计算然后加权平均。它的连续版本则通向条件期望的积分定义。定理 25.3.4贝叶斯公式在相同的划分条件下[\mathbb{P}(B_k \mid A) \frac{\mathbb{P}(A \mid B_k),\mathbb{P}(B_k)}{\sum_n \mathbb{P}(A \mid B_n),\mathbb{P}(B_n)}.]证明由条件概率定义(\mathbb{P}(B_k \mid A) \frac{\mathbb{P}(A \cap B_k)}{\mathbb{P}(A)})。分子写为 (\mathbb{P}(A \mid B_k)\mathbb{P}(B_k))分母用全概率公式展开即得。∎贝叶斯公式是统计推断的数学灵魂。它将“原因 (B_k) 导致结果 (A)”的似然度 (\mathbb{P}(A \mid B_k)) 与“观察到结果 (A) 后原因 (B_k) 的后验可信度” (\mathbb{P}(B_k \mid A)) 联系起来后验概率正比于似然与先验概率 (\mathbb{P}(B_k)) 的乘积。这一简洁而深刻的倒置推理支撑着从医学诊断、机器学习朴素贝叶斯分类到科学哲学的全部逻辑。例医学检验的贝叶斯分析 某疾病在人群中的发病率为 1%检验的灵敏度患者检出阳性为 95%特异度健康人检出阴性为 90%。某人检测呈阳性其真正患病的概率是多少由贝叶斯公式[\mathbb{P}(\text{患病} \mid \text{阳性}) \frac{0.95 \times 0.01}{0.95 \times 0.01 0.10 \times 0.99} \approx 0.0876,]仅有约 8.8%——远低于多数人的直觉。这一结果清楚地展示了先验概率稀薄时后验概率如何被假阳性率显著稀释。贝叶斯公式在此不仅是一项计算工具更是一种纠正直觉偏误的思维框架。25.4 独立性与乘积空间25.4.1 事件独立性的公理化定义在条件概率的框架下若 (\mathbb{P}(B) 0)则事件 (A) 与 (B)独立的直觉含义是 (\mathbb{P}(A \mid B) \mathbb{P}(A))即 (B) 的发生不改变 (A) 的概率。为避免对零概率事件作条件化柯尔莫哥洛夫直接以乘积形式作为定义。定义 25.4.1两事件的独立性(A, B \in \mathcal{F}) 称为独立若[\mathbb{P}(A \cap B) \mathbb{P}(A),\mathbb{P}(B).]此定义不依赖条件概率因此对 (\mathbb{P}(B) 0) 的事件同样适用——概率为零的事件与任何事件均独立。定义 25.4.2相互独立性一族事件 ({A_i}{i \in I}) 称为相互独立若对任意有限子族 (A{i_1}, \dots, A_{i_k})[\mathbb{P}(A_{i_1} \cap \dots \cap A_{i_k}) \prod_{j1}^k \mathbb{P}(A_{i_j}).]两两独立任意两个事件独立并不意味着相互独立。著名的伯恩斯坦反例清楚地展示了这一点同时抛掷两枚公平的硬币定义事件 (A) “第一枚为正面”(B) “第二枚为正面”© “两枚结果相同”同为正面或同为反面。易见 (\mathbb{P}(A)\mathbb{P}(B)\mathbb{P}©1/2)。任意两个事件的交(A \cap B)两枚均为正面概率 (1/4 \mathbb{P}(A)\mathbb{P}(B))(A \cap C)第一枚正面且两枚相同等价于两枚均为正面概率 (1/4 \mathbb{P}(A)\mathbb{P}©)(B \cap C) 同理概率 (1/4 \mathbb{P}(B)\mathbb{P}©)。故 (A,B,C) 两两独立。但三事件同时发生 (A \cap B \cap C) 要求两枚均为正面概率为 (1/4)而乘积 (\mathbb{P}(A)\mathbb{P}(B)\mathbb{P}© 1/8)等式不成立。因此它们不相互独立。相互独立是一个极强的条件要求所有有限子族的乘积等式同时成立。对于包含 (n) 个事件的一族需要验证 (2^n - n - 1) 个等式除了单个事件和全部事件的平凡等式其复杂度随 (n) 指数增长。这一严苛的定义正是确保复杂随机系统中“完全无相互影响”所必需的。25.4.2 乘积概率空间与独立随机变量的构造独立性不仅是性质更是一个构造性原理如何从简单的概率空间出发构建一个联合空间使得多个坐标彼此独立答案在于乘积测度。定理 25.4.3乘积概率空间设 ((\Omega_1, \mathcal{F}_1, \mathbb{P}_1)) 和 ((\Omega_2, \mathcal{F}_2, \mathbb{P}_2)) 为两个概率空间。记 (\Omega \Omega_1 \times \Omega_2)(\mathcal{F} \mathcal{F}_1 \otimes \mathcal{F}_2)包含全体可测矩形 (A \times B) 的最小σ代数。则存在唯一的概率测度 (\mathbb{P} \mathbb{P}_1 \times \mathbb{P}_2) 在 (\mathcal{F}) 上满足[(\mathbb{P}_1 \times \mathbb{P}_2)(A \times B) \mathbb{P}_1(A),\mathbb{P}_2(B), \quad \forall A \in \mathcal{F}_1, B \in \mathcal{F}_2.]该测度由卡拉西奥多里扩张定理保证存在且唯一。在此乘积空间上坐标投影 (X_1(\omega_1,\omega_2) \omega_1) 与 (X_2(\omega_1,\omega_2) \omega_2) 即为相互独立的随机变量分别具有给定的分布 (\mathbb{P}_1, \mathbb{P}_2)。对于有限个概率空间的乘积可以逐次应用此定理。而当我们需要构造一列独立随机变量时——这是大数定律和中心极限定理的起点——就需要无限乘积空间的构造。这依赖于柯尔莫哥洛夫相容性定理给定一列边际分布满足自然的相容条件必存在唯一的概率测度于乘积空间之上使各坐标投影具有指定的有限维分布。这一深刻定理为随机过程的严格定义铺平了道路布朗运动、泊松过程乃至一般的马尔可夫过程其存在性均奠基于此。25.5 随机变量与分布函数25.5.1 随机变量可测函数的新装定义 25.5.1随机变量设 ((\Omega, \mathcal{F}, \mathbb{P})) 为概率空间。函数 (X: \Omega \to \mathbb{R}) 称为随机变量若对每个实数 (x)[{\omega \in \Omega : X(\omega) \le x} \in \mathcal{F}.]等价地对任意博雷尔集 (B \in \mathcal{B}(\mathbb{R}))逆像 (X^{-1}(B) \in \mathcal{F})。这一要求正是测度论中可测函数的定义它确保了我们可以合法地谈论“(X) 落入某集合”的概率。一个随机变量 (X) 在 (\mathbb{R}) 上诱导出一个概率测度 (\mathbb{P}_X)称为 (X) 的分布或律[\mathbb{P}_X(B) \mathbb{P}(X \in B) \mathbb{P}!\left(X^{-1}(B)\right), \quad B \in \mathcal{B}(\mathbb{R}).]于是((\mathbb{R}, \mathcal{B}(\mathbb{R}), \mathbb{P}_X)) 本身也是一个概率空间。随机变量的所有概率信息完全包含在这个分布之中。25.5.2 分布函数脱离样本空间的抽象定义 25.5.2累积分布函数随机变量 (X) 的分布函数(F_X: \mathbb{R} \to [0,1]) 定义为[F_X(x) \mathbb{P}(X \le x).]定理 25.5.3分布函数的特征任何分布函数 (F) 满足三条特征性质单调不减(x \le y \Rightarrow F(x) \le F(y))右连续性(\lim_{h \to 0^} F(xh) F(x))边界条件(\lim_{x \to -\infty} F(x) 0)(\lim_{x \to \infty} F(x) 1)。反之凡满足这三条的任意函数 (F)必为某个适当构造的概率空间上的随机变量的分布函数。这一优美的一一对应使我们获得了一种脱离样本空间具体构造的“分布语言”今后讨论随机变量完全可以只讨论其分布函数而不必在意背后的 (\Omega) 究竟是什么。这一抽象自由正是公理化的巨大恩赐。分布函数可以用来对随机变量进行分类。如果 (F) 是阶梯函数则 (X) 为离散型如果存在非负可积函数 (f) 使得 (F(x) \int_{-\infty}^x f(t) , dt)则 (X) 为绝对连续型(f) 称为概率密度函数还存在奇异型分布如康托尔分布其分布函数连续但几乎处处导数为零。勒贝格分解定理表明任何分布函数都可以唯一地分解为离散部分、绝对连续部分和奇异连续部分的凸组合。25.5.3 随机变量的独立性定义 25.5.4随机变量独立性一族随机变量 ({X_i}{i \in I}) 称为独立若它们生成的σ代数 (\sigma(X_i)) 相互独立即对任意有限子族及任意博雷尔集 (B{i_1}, \dots, B_{i_k})[\mathbb{P}!\left(X_{i_1} \in B_{i_1}, \dots, X_{i_k} \in B_{i_k}\right) \prod_{j1}^k \mathbb{P}!\left(X_{i_j} \in B_{i_j}\right).]等价地联合分布函数可分解为各边际分布函数的乘积[F_{X_{i_1}, \dots, X_{i_k}}(x_{i_1}, \dots, x_{i_k}) \prod_{j1}^k F_{X_{i_j}}(x_{i_j}).]对于独立随机变量联合分布完全由边际分布决定——这是乘积测度存在性的直接推论。独立性使得我们可以将高维概率的计算简化为低维乘积这是几乎所有极限定理分析的基础。25.6 期望勒贝格积分在概率论中的化身25.6.1 期望作为积分定义 25.6.1期望设 (X) 为概率空间 ((\Omega, \mathcal{F}, \mathbb{P})) 上的随机变量。若 (X \ge 0)定义其期望为勒贝格积分[\mathbb{E}[X] \int_\Omega X , d\mathbb{P}.]对一般的 (X)写 (X X^ - X^-)其中 (X^ \max(X,0), X^- \max(-X,0))。若 (\mathbb{E}[X^]) 或 (\mathbb{E}[X^-]) 至少一方有限则定义[\mathbb{E}[X] \mathbb{E}[X^] - \mathbb{E}[X^-].]若二者皆有限等价于 (\mathbb{E}[|X|] \infty)称 (X)可积。这一简单的定义将概率论的计算彻底统一在勒贝格积分的麾下。过去需要分别记忆的“离散求和”与“连续积分”公式现在仅仅是勒贝格积分在不同分布下的呈现。更一般地有如下“无意识统计学家定律”对于任何可测函数 (g)[\mathbb{E}[g(X)] \int_{\mathbb{R}} g(x) , dF_X(x),]当 (X) 有密度 (f) 时右侧化为 (\int g(x) f(x) , dx)当 (X) 离散取值 (x_i) 概率 (p_i) 时化为 (\sum_i g(x_i) p_i)。这些公式并非多个独立定义而是同一积分在换元变换下的不同表现。公理化从此根除了离散与连续之间的割裂。25.6.2 期望的基本性质期望承袭了勒贝格积分的一切优良性质。定理 25.6.2线性性若 (X, Y) 可积(a, b \in \mathbb{R})则[\mathbb{E}[aX bY] a\mathbb{E}[X] b\mathbb{E}[Y].]定理 25.6.3单调收敛定理若 (0 \le X_1 \le X_2 \le \cdots) 几乎必然且 (X_n \uparrow X)则 (\mathbb{E}[X_n] \uparrow \mathbb{E}[X])。定理 25.6.4控制收敛定理若 (X_n \to X) 几乎必然且存在可积的 (Y) 使得 (|X_n| \le Y) 对所有 (n) 成立则 (\mathbb{E}[X_n] \to \mathbb{E}[X])。定理 25.6.5法图引理若 (X_n \ge 0)则 (\mathbb{E}[\liminf X_n] \le \liminf \mathbb{E}[X_n])。这些定理为极限与期望的交换提供了坚实的条件是整个概率论分析机体的“脊椎”。特别是控制收敛定理它确保了在适当的有界控制下极限和期望可以安全地交换——这一点在特征函数、傅里叶变换以及中心极限定理的证明中反复出现。25.6.3 方差、协方差与相关性定义 25.6.6随机变量 (X) 的方差定义为 (\operatorname{Var}(X) \mathbb{E}[(X - \mathbb{E}[X])^2])。展开并利用期望的线性性可得计算式 (\operatorname{Var}(X) \mathbb{E}[X^2] - (\mathbb{E}[X])^2)。定理 25.6.7比奈梅等式若 (X) 与 (Y) 独立则 (\operatorname{Var}(X Y) \operatorname{Var}(X) \operatorname{Var}(Y))。证明展开平方交叉项的期望为 (\mathbb{E}[(X - \mathbb{E}X)(Y - \mathbb{E}Y)])。由独立性此期望等于 (\mathbb{E}[X - \mathbb{E}X];\mathbb{E}[Y - \mathbb{E}Y] 0)。∎方差的非负性导出柯西‑施瓦茨不等式在概率空间中的版本((\mathbb{E}[XY])^2 \le \mathbb{E}[X2]\mathbb{E}[Y2])等号成立当且仅当 (X) 与 (Y) 几乎必然线性相关。由此可定义相关系数它是衡量线性相关程度的标准化量取值范围为 ([-1, 1])。25.7 条件期望柯尔莫哥洛夫的又一杰作初等条件概率的定义要求 (\mathbb{P}(B) 0)。然而在连续型随机变量的场景下形如 (\mathbb{P}(X \in A \mid Y y)) 的条件概率将不可避免地遇到分母 (\mathbb{P}(Y y) 0) 的困境。直接以除法定义已不可能。柯尔莫哥洛夫在1933年的同一本著作中运用Radon‑Nikodym定理给出了条件期望的公理化定义彻底解决了这一难题并为整个现代随机过程理论奠定了基石。25.7.1 给定σ代数的条件期望定义 25.7.1条件期望设 (X) 为概率空间 ((\Omega, \mathcal{F}, \mathbb{P})) 上的可积随机变量(\mathcal{G} \subseteq \mathcal{F}) 是一个子σ代数。(X) 在给定 (\mathcal{G}) 下的条件期望记作 (\mathbb{E}[X \mid \mathcal{G}])是满足以下两个条件的随机变量在几乎必然相等的意义下唯一(\mathbb{E}[X \mid \mathcal{G}]) 是 (\mathcal{G})-可测的对任意 (G \in \mathcal{G})有[\int_G \mathbb{E}[X \mid \mathcal{G}] , d\mathbb{P} \int_G X , d\mathbb{P}.]存在性与唯一性的证明概要在可测空间 ((\Omega, \mathcal{G})) 上定义集函数 (\nu(G) \int_G X , d\mathbb{P})。由于 (X) 可积(\nu) 是一个有限符号测度并且若 (\mathbb{P}(G) 0) 则 (\nu(G) 0)即 (\nu) 关于限制测度 (\mathbb{P}|{\mathcal{G}}) 绝对连续。由Radon‑Nikodym定理存在唯一的(\mathbb{P})-几乎处处(\mathcal{G})-可测函数 (Y d\nu / d(\mathbb{P}|{\mathcal{G}}))满足 (\nu(G) \int_G Y , d\mathbb{P})。此 (Y) 即定义为 (\mathbb{E}[X \mid \mathcal{G}])。这一构造将条件期望的存在唯一性完全纳入了测度论的核心定理之中优雅而有力。当 (\mathcal{G}) 由可数划分生成时条件期望在每个原子上取常数值——恰为 (X) 在该原子上的平均——这与初等条件概率完全吻合。25.7.2 条件期望的直观与性质条件期望具有深刻的几何解释。设 (X \in L^2(\mathcal{F}))平方可积则可将随机变量全体视为 Hilbert 空间内积为 (\langle U, V \rangle \mathbb{E}[UV])。此时(L^2(\mathcal{G})) 是 (L^2(\mathcal{F})) 的一个闭子空间而条件期望 (\mathbb{E}[X \mid \mathcal{G}]) 正是 (X) 在该子空间上的正交投影。这意味着[\mathbb{E}\big[(X - \mathbb{E}[X \mid \mathcal{G}])^2\big] \inf_{Z \in L^2(\mathcal{G})} \mathbb{E}\big[(X - Z)^2\big],]即条件期望是在给定信息 (\mathcal{G}) 下对 (X) 的最小均方误差预测。这一观点将概率论、统计决策理论与泛函分析紧密缝合在一起。条件期望的关键运算性质包括线性性(\mathbb{E}[aX bY \mid \mathcal{G}] a\mathbb{E}[X \mid \mathcal{G}] b\mathbb{E}[Y \mid \mathcal{G}])。塔性质若 (\mathcal{H} \subseteq \mathcal{G})则 (\mathbb{E}[\mathbb{E}[X \mid \mathcal{G}] \mid \mathcal{H}] \mathbb{E}[X \mid \mathcal{H}])。信息分层下的重复条件化等价于直接关于更粗的σ代数条件化。提取已知因子若 (Z) 是 (\mathcal{G})-可测且有界则 (\mathbb{E}[ZX \mid \mathcal{G}] Z,\mathbb{E}[X \mid \mathcal{G}])。独立性若 (X) 与 (\mathcal{G}) 独立则 (\mathbb{E}[X \mid \mathcal{G}] \mathbb{E}[X]) 为常数。当 (\mathcal{G} \sigma(Y)) 由随机变量 (Y) 生成时通常记 (\mathbb{E}[X \mid Y] : \mathbb{E}[X \mid \sigma(Y)])。可以证明存在博雷尔可测函数 (h) 使得 (\mathbb{E}[X \mid Y] h(Y)) 几乎必然此 (h(y)) 即为“给定 (Y y) 时 (X) 的条件期望”。这一概念是回归分析的理论根基条件期望 (\mathbb{E}[Y \mid X]) 就是 (Y) 对 (X) 的回归函数在所有 (X) 的可测函数中均方误差最小。这些性质使条件期望成为鞅martingale概念的核心一个随机过程 (M_n) 关于信息流 (\mathcal{F}n) 是鞅当且仅当 (\mathbb{E}[M{n1} \mid \mathcal{F}_n] M_n)。这一极简的定义开启了随机分析、金融数学、最优停时理论的宏伟大门。25.8 大数定律概率公理的凯旋概率论最古老、最关乎哲学的核心命题莫过于大数定律独立重复试验的算术平均值“应当”稳定于某个常数。在柯尔莫哥洛夫的公理体系中这一定律不再是经验归纳而成为了公理的逻辑推论。我们在此给出在有限方差假设下弱大数定律的初等证明它以切比雪夫不等式为支点干净利落地揭示频率稳定性何以从可列可加性与独立性中必然涌现。25.8.1 马尔可夫与切比雪夫不等式定理 25.8.1马尔可夫不等式设 (Y \ge 0) 为随机变量。则对任意 (a 0)[\mathbb{P}(Y \ge a) \le \frac{\mathbb{E}[Y]}{a}.]证明注意到 (\mathbb{E}[Y] \ge \mathbb{E}[Y \mathbf{1}{{Y \ge a}}] \ge \mathbb{E}[a \mathbf{1}{{Y \ge a}}] a,\mathbb{P}(Y \ge a))。∎马尔可夫不等式极其朴素却极为强大——它仅需期望的概念和单调性是许多尾概率估计的原型。定理 25.8.2切比雪夫不等式设随机变量 (X) 具有有限期望 (\mu) 和有限方差 (\sigma^2)。则对任意 (\varepsilon 0)[\mathbb{P}(|X - \mu| \ge \varepsilon) \le \frac{\sigma2}{\varepsilon2}.]证明令 (Y (X - \mu)^2 \ge 0)则 (\mathbb{E}[Y] \sigma^2)。由马尔可夫不等式(\mathbb{P}(|X - \mu| \ge \varepsilon) \mathbb{P}(Y \ge \varepsilon^2) \le \sigma2/\varepsilon2)。∎切比雪夫不等式将偏离概率转化为方差的控制方差越小随机变量越集中于期望附近。25.8.2 弱大数定律定理 25.8.3弱大数定律切比雪夫版本设 (X_1, X_2, \dots) 为独立同分布i.i.d.随机变量具有公共期望 (\mu) 和有限方差 (\sigma^2)。令 (S_n \sum_{i1}^n X_i)。则对任意 (\varepsilon 0)[\lim_{n \to \infty} \mathbb{P}!\left( \left| \frac{S_n}{n} - \mu \right| \ge \varepsilon \right) 0.]换言之样本均值 (\frac{S_n}{n})依概率收敛于 (\mu)。证明由期望的线性性(\mathbb{E}[S_n/n] \mu)。利用独立性及比奈梅等式[\operatorname{Var}!\left(\frac{S_n}{n}\right) \frac{1}{n^2} \sum_{i1}^n \operatorname{Var}(X_i) \frac{\sigma^2}{n}.]应用切比雪夫不等式[\mathbb{P}!\left( \left| \frac{S_n}{n} - \mu \right| \ge \varepsilon \right) \le \frac{\operatorname{Var}(S_n/n)}{\varepsilon^2} \frac{\sigma^2}{n \varepsilon^2} \to 0 \quad (n \to \infty). \quad \qedhere]这一短小精悍的证明是概率公理力量的一次凝缩展示仅从概率测度的可列可加性、期望的积分定义以及独立性的乘积分解出发长期频率的稳定性被严格导出。切比雪夫版本要求方差有限但柯尔莫哥洛夫本人随后证明的强大数定律——样本均值几乎必然收敛于 (\mu)——仅在期望 (\mathbb{E}|X_1| \infty) 的假设下即可成立。几乎必然收敛是一种比依概率收敛更强的收敛模式它保证在样本空间的一个概率为1的子集上逐点的算术平均严格趋于 (\mu)。强大数定律的证明需借助博雷尔‑坎泰利引理、截断技术以及柯尔莫哥洛夫极大不等式它是公理体系所能抵达的更深层次的真理。值得强调的是弱大数定律并没有说“第 (n) 次试验后的偏差一定很小”而是说“大的偏差发生的概率随着 (n) 增大而趋于零”。这是对频率稳定性最为精确的数学表达也是整个推断统计学的逻辑根基——它告诉我们在独立重复的假定下用样本平均去估计总体期望是一致依概率可行的。25.9 概率公理化的哲学意义柯尔莫哥洛夫1933年的公理化其冲击力远超技术层面。它完成了一场概念上的“哥白尼式革命”重塑了我们对概率本质的理解。1. 概率是什么——语义中立的隐定义在公理化之前概率的“定义”始终众说纷纭拉普拉斯的古典定义诉诸“等可能”冯·米塞斯的频率定义依赖无穷序列的假定极限凯恩斯的主观概率则将概率视为信念的度量。每一种解释都深陷哲学泥淖。柯尔莫哥洛夫以隐定义的手法优雅地规避了这场争论他不定义概率“是什么”只规定概率测度必须遵守的三条公理。任何满足这些规则的数学模型都是一个合法的概率模型。至于这些模型是用于描述长期频率、主观置信度还是量子叠加态则交由各应用领域的科学家自行诠释。公理化的中立性使概率论成为跨越频率学派与贝叶斯学派的通用语言两者都可以在同一个公理平台上安营扎寨其分歧仅在于先验概率的来源和解释而非数学框架本身。2. 概率论与分析学的统一公理化之前概率论在很大程度上被视为“应用数学”甚至“工程技巧”其主要推理依赖组合技巧与形式化代数难以容纳严格的分析极限论证。柯尔莫哥洛夫将其完全嵌入测度论与泛函分析的框架后勒贝格积分、Radon‑Nikodym定理、希尔伯特空间理论、紧性论证等分析利器一夜之间成为概率论的标准装备。概率论从数学的“外省”迁入了“首都”并在那里催生了随机分析、随机偏微分方程等新的繁华城区。3. 大数定律从“规律”到“定理”在频率学派看来概率是由长期频率定义的因此“频率趋于概率”几乎成为同义反复。而在公理体系中概率是原始概念大数定律则成为一个需要——并且可以被——证明的定理。这一转变使概率论从“归纳科学”迈入“演绎科学”为其赋予了与几何学、数论同等的逻辑尊严。我们可以像证明勾股定理一样严格地推导出频率的稳定性——前提是接受独立同分布的假定。科学解释的方向被彻底颠倒不是概率依赖于频率而是频率的极限行为由概率公理内在保证。4. 现代概率论的基石杜布的鞅论、费勒的马尔可夫过程、伊藤的随机积分与随机微分方程——这些20世纪概率论最璀璨的成就无一例外地建立在柯尔莫哥洛夫公理的平台之上。没有可列可加性提供的极限封闭性没有条件期望的严格Radon‑Nikodym定义这一切理论都将因地基动摇而无法矗立。可以说1933年的这本小册子不仅是概率论的“欧几里得《几何原本》”更是开启整个随机世界数学大门的钥匙。25.10 结语三条公理撑起随机世界从三条质朴的公理——总测度为一、可列可加性、σ代数封闭性——出发概率论构建了一座足以刻画从硬币抛掷到量子涨落、从布朗运动到金融衍生品定价的恢弘数学殿堂。事件运算的代数、贝叶斯更新、随机变量及其分布、期望作为积分、独立性与乘积空间、条件期望与鞅……所有这些深刻而优美的概念都只是这三条公理在不同光照角度下的逻辑投影。概率公理化的历程是数学公理化方法伟大力量的缩影。一个长期依赖直觉与经验的领域经过公理的重铸不仅赢得了无可指责的严格性更在严格性的土壤中绽放出匪夷所思的创造力。1933年那本薄薄的小册子中埋下的种子如今已长成一片覆盖随机分析、统计物理、机器学习、量子场论的浩瀚森林。在后续章节中我们将踏入独立性与大数定律的更深处展开博雷尔‑坎泰利引理、柯尔莫哥洛夫0‑1律、中心极限定理与几乎必然收敛的精细刻画。在那里我们将看到可列可加性如何衍生出更惊人的结论无限维联合分布的存在性、尾事件的确定性、独立和的正态吸引域——概率公理的伟力还远未穷尽。