ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Steve Brunton | Probability Bootcamp | 笔记 | 第二部分:统计导论 | Lecture 24 | 将正态分布标准化为均值0、方差1

Steve Brunton | Probability Bootcamp | 笔记 | 第二部分:统计导论 | Lecture 24 | 将正态分布标准化为均值0、方差1 目录前言1. 引言2. 为什么要标准化3. 推导正态标准化函数4. 结语结语参考前言学习 Steven Brunton 讲授的概率与统计入门概述视频本篇文章记录第二十四讲将正态分布标准化为均值0、方差1记录下个人学习笔记和大家一起分享交流videohttps://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V1. 引言OK我们之前介绍了随机变量函数的概念假设我们有一个随机变量X XX比如它服从高斯正态分布现在要构造一个新的随机变量Y YY这个Y YY是X XX的某个函数g gg的映射结果。这个函数g gg可以是X 2 X^2X2、a X b aXbaXb的形式也可以是X \sqrt{X}X​或者任意其他你设定的函数形式我们可以通过特定步骤来推导Y YY的概率密度函数和累积分布函数。基于已知的X XX的概率密度函数与累积分布函数进行推导我们首先基于X XX的累积分布函数构建Y YY的累积分布函数再通过求导得到新变量Y YY的概率密度函数。我们此前已经证明若存在均值为μ \muμ、标准差为σ \sigmaσ的正态分布并引入新随机变量Y a X b YaXbYaXb这相当于对原变量进行了缩放与平移变换这是关于X XX的线性函数通过数学推导可得出结论新变量Y YY同样服从正态分布其均值也按相同比例进行了缩放与平移变换而标准差变为了a σ a \sigmaaσ即Y ∼ N ( a μ b , a 2 σ 2 ) Y \sim \mathcal{N}(a \mu b, a^2 \sigma^2)Y∼N(aμb,a2σ2)这一特性具有极其重要的应用价值接下来我将展示这一特性的重要应用场景其核心原理非常简单。2. 为什么要标准化我们经常会遇到具有特定均值和标准差的正态分布随机变量假设随机变量X XX服从正态分布其均值为μ \muμ标准差为σ \sigmaσ即X ∼ N ( μ , σ 2 ) X \sim \mathcal{N}(\mu, \sigma^2)X∼N(μ,σ2)。在早期对于任意均值和标准差的正态分布无论是手工计算还是用计算机处理都相当困难因此我们实际采用的方法是将这个高斯分布转换为标准单位正态分布也就是均值为 0标准差为 1 的高斯分布。现在有一个新随机变量Y YY服从均值为 0标准差为 1 的正态分布即Y ∼ N ( 0 , 1 ) Y \sim \mathcal{N}(0,1)Y∼N(0,1)假设要计算P ( X 7 ) P(X 7)P(X7)的概率具体操作如下你需要将其映射到标准正态分布中的某个概率值变量Y YY小于对应值的概率是多少。这个标准单位正态分布的所有概率或者说它的全部累积分布函数这些数据通常附在教科书末尾或是收录在可供查阅的统计表格中这样你就能在此处完成计算然后将结果对应回原始数据。如今我们已无需手动查表计算现在只需通过计算机就能直接计算这些概率其底层实现很可能仍在调用上世纪 70 年代编写的 Fortran 编译代码不过这些操作现在确实不需要我们亲自处理了。不过有个概念仍然很实用若能将X XX这个扭曲的正态分布映射为标准正态分布就能计算诸如该分布在− σ -\sigma−σ到σ \sigmaσ区间内的面积概率这个概率值实际上等同于标准正态分布在− 1 -1−1到1 11区间内的概率。通过标准正态分布可以轻松计算下方区域的概率值再借助映射关系就能将其转换为原始分布对应的概率值因此这种映射关系实际上非常简单明了。3. 推导正态标准化函数如果X ∼ N ( μ , σ 2 ) X \sim \mathcal{N}(\mu, \sigma^2)X∼N(μ,σ2)这个正态分布我该如何构建Y YY使其均值为 0标准差为 1 呢这很简单可以这样构造令Y X − μ σ Y \frac{X - \mu}{\sigma}YσX−μ​即可在这种表示法中缩放系数a 1 σ a \frac{1}{\sigma}aσ1​平移系数b − μ σ b - \frac{\mu}{\sigma}b−σμ​。若将这两个参数代入公式即可得到均值为 0、标准差为 1 的标准正态分布这就是最终得到的分布形态实际上只需对X XX进行线性变换即可将其平移μ \muμ个单位通过平移使其中心对齐然后将其除以σ \sigmaσ这样就能将标准差从σ \sigmaσ降至 1。通过这种方式你可以将正态分布转换为标准正态分布而标准正态分布有现成的查询表和简便函数可供使用这种分布形式非常便于分析希望你能轻松分析和运用它在两者之间灵活转换是你可能会用到的重要技巧如今虽然计算这些概率不再需要依赖查表法但这种方法在某些情况下仍然具有实用价值。举个例子来说明假设我需要计算随机变量X XX落在区间[ a , b ] [a,b][a,b]内的概率即计算P ( a ≤ X ≤ b ) P(a \le X \le b)P(a≤X≤b)我需要你算的就是正态分布曲线下方这个区域的面积接下来我需要将其转换到标准正态分布上这样计算概率会更方便。因此这个概率就等于随机变量Y YY落在区间[ a − μ σ , b − μ σ ] [\frac{a-\mu}{\sigma},\frac{b-\mu}{\sigma}][σa−μ​,σb−μ​]之间的概率即计算P ( a − μ σ ≤ Y ≤ b − μ σ ) P(\frac{a-\mu}{\sigma} \le Y \le \frac{b-\mu}{\sigma})P(σa−μ​≤Y≤σb−μ​)这个概率是可以通过查表计算的因为针对这类Y YY变量我们已有现成的累积分布函数查询表可供使用P ( a ≤ X ≤ b ) P ( a − μ σ ≤ Y ≤ b − μ σ ) Φ ( b − μ σ ) − Φ ( a − μ σ ) P(a \le X \le b) P(\frac{a-\mu}{\sigma} \le Y \le \frac{b-\mu}{\sigma}) \Phi(\frac{b-\mu}{\sigma}) - \Phi(\frac{a-\mu}{\sigma})P(a≤X≤b)P(σa−μ​≤Y≤σb−μ​)Φ(σb−μ​)−Φ(σa−μ​)这其实就是标准正态分布的累积分布函数这个函数在实际应用中极为常见我们通常用大写字母Φ \PhiΦ来表示它这意味着我们可以在书末的查值表中找到对应的数值你可以直接查阅这个数值或者通过函数调用来获取这个值。因此我们需要将区间[ a , b ] [a,b][a,b]映射到标准正态分布上通过计算a − μ σ \frac{a-\mu}{\sigma}σa−μ​和b − μ σ \frac{b-\mu}{\sigma}σb−μ​这两个标准化值我们可以利用已明确定义的累积分布函数来求解标准正态分布中这两个临界值之间的区域面积这就是标准误差函数或称标准 S 型函数在大多数统计学教程的附录中都配有对应的数值表同时也可以通过函数调用的方式直接计算。4. 结语OK以上我们简要介绍了运用基础线性变换的方法通过减去均值并调整方差尺度将任意正态分布转换为标准正态分布这种标准化处理不仅简化了计算过程更使得概率分布的特性在此体系下显得更为直观明晰。结语本讲将 L23 的 CDF 变换方法论落地为一项日常概率计算中最常用的操作标准化—Z X − μ σ ∼ N ( 0 , 1 ) Z \frac{X-\mu}{\sigma} \sim \mathcal{N}(0,1)ZσX−μ​∼N(0,1)。这条极简公式是整个正态分布家族的统一接口无论原始分布的μ \muμ和σ \sigmaσ取何值经过 “减去均值除以标准差” 的线性变换后一切正态概率问题都归约为标准正态 CDFΦ ( z ) \Phi(z)Φ(z)在两点处的取值之差P ( a ≤ X ≤ b ) Φ ( b − μ σ ) − Φ ( a − μ σ ) P(a \le X \le b) \Phi(\frac{b-\mu}{\sigma}) - \Phi(\frac{a-\mu}{\sigma})P(a≤X≤b)Φ(σb−μ​)−Φ(σa−μ​)。Brunton 提到的 “黏土板查表” 虽已成历史但标准化的价值远未过时。其一它提供了解析层面的洞察力68-95-99.7 经验法则、离均值几个σ \sigmaσ的直觉判断、p pp值与显著性水平的解读全部建立在这个标准化坐标系之上。其二在数值计算中所有统计软件从scipy.stats.norm.cdf()到底层 Fortran 代码本质上都在执行标准化→Φ \PhiΦ求值这一流程—标准化不是绕过计算机的取巧手段而是计算机内部处理正态概率的算法骨架。从分布理论来看本讲也揭示了正态分布在所有分布中的独特地位它是唯一一个线性变换后保持分布族不变仅参数变化的分布之一且标准化操作将该族的所有成员映射到唯一的 “原型”N ( 0 , 1 ) \mathcal{N}(0,1)N(0,1)—这一性质使得正态分布在数学上具有某种 “中心性”与 CLT 赋予它的概率中心地位形成了双重呼应 。参考https://www.youtube.com/playlist?listPLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V
返回列表