目录
- 前言
- 1. 引言
- 2. 定义期望值
- 3. 样本均值与期望值
- 4. 具有误导性的期望值
- 5. 引入矩
- 6. 众数、均值与中位数
- 7. 结语
- 结语
- 参考
前言
学习 Steven Brunton 讲授的概率与统计入门概述视频,本篇文章记录第二十八讲:期望值:概率分布的均值,记录下个人学习笔记,和大家一起分享交流😄
video:https://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V
1. 引言
今天我将介绍概率论与统计学中一个相当重要的概念 — 随机变量X XX的期望值,其含义是:若你反复从该分布中随机采样,这些样本的平均值最可能落在哪个数值上,这就是期望值的核心含义。
对于给定的分布,比如关于变量X XX的常规高斯分布,对于高斯分布而言,期望值恰好与最可能值(众数)及中位数重合,也就是分布的均值μ \muμ,但并非所有概率分布和随机变量X XX都符合这种情况,有时你会得到反直觉甚至具有误导性的结果,稍后我会详细说明这一点。
通俗来说,期望值就是概率分布的质量中心,我们计算期望值的方法,本质上是对X XX的所有可能取值进行加权平均,权重就是每个取值出现的概率。
2. 定义期望值
下面我用数学公式来表达,我们先从离散型随机变量开始讨论,比如伯努利分布、二项分布或泊松分布这类具有离散取值的随机变量,其期望值的计算公式为:
E ( X ) = ∑ all k x k P ( X = x k ) \mathbb{E}(X) = \sum_{\text{all} \, k} x_k P(X=x_k)E(X)=allk∑xkP(X=xk)
我们将对X XX的所有可能取值进行求和,通常这些取值都是整数形式,我们将对随机变量X XX所有可能的取值k kk进行求和,将随机变量的实际取值x k x_kxk与其对应概率P ( X = x k ) P(X=x_k)P(X=xk)相乘后求和,这本质上就是随机变量所有可能取值x k x_kxk的加权平均值。
假设我正在抛硬币,我将一枚均匀硬币抛掷一百次,随机变量X XX表示正面朝上的次数,接下来我对所有可能的正面朝上次数进行求和,若抛掷一百次,可能出现零次正面、一次正面、…、直至一百次正面等所有情况。
因此,我需要将零到一百次的所有可能取值乘以根据二项分布计算得到的对应具体正面次数的概率,再进行求和。例如,我可以直接查阅帕斯卡三角形来获取这些数值,这个计算结果明确显示,我最有可能获得 50 次正面,若实际得到这个数字,我丝毫不会感到意外,在 100 次抛硬币实验中,期望值应该是 50 次左右。
对于连续型随机变量,比如高斯正态分布,当X XX是连续变量时,期望值就需要通过积分来计算:
E ( X ) = ∫ − ∞ ∞ x f ( x ) d x \mathbb{E}(X) = \int_{-\infty}^{\infty}xf(x)dxE(X)=∫−∞∞xf(x)dx
现在,随机变量 X 的期望值将等于X XX所有可能取值的积分,这实际上就是该分布中所有可能的x xx值与其对应概率f ( x ) d x f(x)dxf(x)dx的加权平均值。
OK,以上就是离散型随机变量和连续型随机变量的期望值定义。
3. 样本均值与期望值
这里还有另一种理解方式,这种理解方式极其重要且实用,这里讨论的主要是概率论范畴,但统计学中也有对应的概念。
如果我实际收集现实世界中的测量数据,比如我进行一百次抛硬币实验并记录结果,或者当我随机采访一千名路人测量身高时,收集到的样本数据很可能趋近于这些理论分布。
因此,如果我对X XX进行多次采样,假设抽取n nn个样本点,若对X XX进行n nn次独立采样并计算平均值,则样本均值:
X ˉ = 1 n ∑ j = 1 n X j \bar{X} = \frac{1}{n} \sum_{j=1}^{n}X_jXˉ=n1j=1∑nXj
这就是样本均值,当n → ∞ n \rightarrow \inftyn→∞时,样本均值将收敛于该随机变量的期望值,即:
lim n → ∞ X ˉ = E ( X ) = μ \lim_{n \rightarrow \infty} \bar{X} = \mathbb{E}(X) = \mun→∞limXˉ=E(X)=μ
这是一个非常重要的结论,我们稍后会回到这一点,这正是大数定律的核心内容,稍后我们将证明这一点,但本质上这就是大数定律的表述:当对某个分布进行充分采样并计算样本均值时,该均值将收敛于该分布的理论期望值,样本均值将收敛于该分布的真实均值μ \muμ,且当样本量n → ∞ n \rightarrow \inftyn→∞时,围绕μ \muμ的方差将趋近于零。
这是一个至关重要的结论,这也再次说明了期望值的实际意义,它是该随机变量多次试验平均值的极限,稍后我们将通过编程来实际验证这一点,我们将进行 100 次抛硬币实验,观察结果如何逐步收敛,我们将多次重复实验,观察这些样本均值的方差变化,这将帮助我们深入理解统计数据的特性。
我们也可以反过来思考:如果收集了 50 个样本并得出均值,该如何进行推理?实际从这个特定分布中采样的可能性有多大?我得到的这组样本序列,在已知其均值和方差的情况下,究竟有多大可能性会出现?
4. 具有误导性的期望值
这种方法非常实用且简单,但也可能产生相当大的误导性,这里我想指出几个容易产生误导的地方:
图中粉色曲线是一个高斯分布,其均值μ \muμ即为期望值,黄色曲线是另一个完全不同的分布,黄色分布具有完全相同的期望值,即分布的质量中心完全重合。
实际上,该双峰分布在均值μ \muμ处的概率密度极低,甚至可能为零—所有权重都集中在两个双峰峰值处,从该分布中几乎不可能抽到接近μ \muμ值的样本。
这确实有些奇特,在形态奇特的分布中,确实可能出现各种异常现象,我需要其他数值和参数来定义这个分布,并将两者区分开来,其中一个关键数值就是标准差。
因此,期望值本质上是一种平均值,标准差(或方差)用于衡量数据分布的离散程度,显然黄色曲线的离散程度高于粉色曲线,这正是两者的区别所在。
5. 引入矩
这被称为一阶矩,期望值是一阶矩,其概念类似于转动惯量,这确实与矩的概念十分相似,方差和标准差与二阶矩密切相关,实际上还存在更高阶的矩,例如三阶矩、四阶矩、五阶矩等等,这些高阶矩共同构成了概率分布的独特 “指纹”。
因此,若已知黄色分布与粉色分布的全部矩,就能深入分析二者的特性并加以区分,这就像函数的泰勒级数展开,这就像将概率密度函数按均值、标准差、三阶矩、四阶矩、五阶矩等参数展开。
这里需要说明的是,期望值、方差等这些统计量就是被称为矩,期望值就是一阶矩,二阶矩对应方差或标准差,随着阶数递增还会存在更高阶矩(如三阶、四阶等),这些矩如同概率密度的指纹特征,类似于泰勒级数展开的形式,后续我们将运用这一特性,这确实是个引人入胜的领域。
这与概率密度函数的拉普拉斯变换密切相关,拉普拉斯变换在概率统计中无处不在,最精妙的体现莫过于能生成各阶矩的矩母函数,不过这是后话了。
其实我想说明的是,即使两个分布具有相同的期望值,它们也可能截然不同,而且期望值本身并不代表该点附近是分布的高概率区域,这确实有些反直觉,因此期望值未必是X XX最可能出现的取值。
6. 众数、均值与中位数
接下来我将明确定义几个关键概念,X XX最可能出现的取值称为众数,这是函数中出现概率最高的X XX取值。此外还有均值或者说平均值,这正是我们前面计算的结果,这就是期望值,这是一种加权平均的概念。
第三种数值是中位数,这通常是统计学中最实用的指标,在存在异常值或特殊分布的情况下,这就是我们所说的分布中心,它实际上就是位于分布正中心的数值。
接下来我将逐一阐述并定义这些概念,但我想特别指出中位数具有稳健性这一特性,这是一种稳健的统计方法,因此当存在异常值时,期望值对异常值会高度敏感,中位数对异常值具有极强的稳健性。
我说的异常值是指什么?让我举个例子来说明,假设我们来看财富分布的情况,比如美国民众银行账户里的存款金额,假设其标称形式如下所示:
这个分布呈现明显的峰值特征,同时两侧拖曳着厚重的尾部,这代表某个国家民众的财富分布状况,但在分布曲线的最远端,存在着像比尔·盖茨和埃隆·马斯克这样的极端值,这些拥有千亿美元净资产的超级富豪群体,其数量必然极为稀少,但这会显著拉高整体平均值。
因此,若剔除这些异常值,实际分布的均值会明显偏离预期水平,但中位数具有稳健性,能准确反映此处的分布峰值。我特意查证了相关数据,美国家庭财富中位数约为 20 万美元,这个数值大致对应该分布的峰值区域,家庭平均财富为 100 万美元,这几乎完全是由于极端离群值的存在所致,因此这些异常值不仅略微拉高了均值,更是使其增长了五倍之多。
这些分布在尾端的异常数据 — 无论是罕见事件还是离群值 — 所蕴含的财富总量,正在改变整个分布的期望值,因此,分布的中位数 — 即位于中间位置的值 — 对于另一侧少数异常值的干扰具有更强的稳健性。
现在我来具体说明其含义,分布的中位数是满足累积分布函数值为1 2 \frac{1}{2}21的X XX值,这意味着恰好一半概率落在左侧,另一半概率落在右侧。众数是出现概率最高的取值,即概率密度函数在X XX处取得最大值的点,可将其表示为P ( x ) max P(x)_{\max}P(x)max,这种表述同样成立。均值或平均值就是X XX的期望值。
7. 结语
OK,这部分内容确实不少,我想说的应该就是这些了,本质上,期望值是概率论与统计学中一个非常有用的量,它是描述分布特征最重要的数值之一,但并非唯一重要的数值,我还需要了解方差及更高阶矩的信息。
它对异常值极为敏感,因此若存在异常值或罕见事件,中位数或许是更稳健的选择,但期望值计算简便,且在大样本极限下,样本均值会收敛于统计中的期望值,这就是大数定律,我们稍后会进行证明。
结语
期望值是概率分布的 “质量中心”—E ( X ) = ∑ x k P ( X = x k ) \mathbb{E}(X) = \sum x_k P(X=x_k)E(X)=∑xkP(X=xk)(离散)或∫ x f ( x ) d x \int x f(x)dx∫xf(x)dx(连续)—这一简洁定义背后承载着从赌博赔率到物理质心再到统计推断的广泛解释力。Brunton 揭示了大数定律(LLN)赋予期望值的操作意义:X ˉ = 1 n ∑ X j → n → ∞ E ( X ) = μ \bar{X} = \frac{1}{n}\sum X_j \xrightarrow{n\to\infty} \mathbb{E}(X) = \muXˉ=n1∑Xjn→∞E(X)=μ—样本均值是期望值的 “观测实现”,期望值是样本均值的 “理论极限”。这为统计学中的参数估计提供了最根本的理论保证。
然而本讲也以双峰分布和财富分布两个例子发出重要警告:期望值≠典型值。两个期望值完全相同的分布可能形态迥异(单峰 vs 双峰),从双峰分布中甚至几乎不可能抽到恰好等于μ \muμ的样本。财富分布的案例更具冲击力:美国家庭财富中位数约 20 万美元,但均值却因极少数亿万富翁的存在而被拉到 100 万美元—期望值对异常值极度敏感,离群值的杠杆效应可达 5 倍之多。
由此自然引出描述分布所需的完整工具链:众数(最可能值)、中位数(F ( x ) = 0.5 F(x)=0.5F(x)=0.5,异常值稳健)、均值(期望,计算简便但敏感)。这三个 “中心度量” 分别捕捉了分布的不同侧面。进一步地,Brunton 将期望值置于矩(moments)的统一框架中—一阶矩 = 期望(位置),二阶矩 = 方差(离散度),更高阶矩 = 偏度、峰度等——这些矩如同分布的 “泰勒展开系数”,共同构成概率密度的独特指纹。后续的矩母函数(moment generating function)将提供从分布中统一提取所有矩的生成器视角 🤗。
参考
- https://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V