正态分布

✍ dations ◷ 2025-08-09 01:24:40 #正态分布

正态分布（英语：normal distribution）又名高斯分布（英语：Gaussian distribution），是一个非常常见的连续概率分布。正态分布在统计学上十分重要，经常用在自然和社会科学来代表一个不明的随机变量。若随机变量 X {displaystyle X} 服从一个位置参数为 μ {displaystyle mu } 、尺度参数为 σ {displaystyle sigma } 的正态分布，记为：则其概率密度函数为 f ( x ) = 1 σ 2 π e − ( x − μ ) 2 2 σ 2 {displaystyle f(x)={frac {1}{sigma {sqrt {2pi }}}};e^{-{frac {left(x-mu right)^{2}}{2sigma ^{2}}}}!}正态分布的数学期望值或期望值 μ {displaystyle mu } 等于位置参数，决定了分布的位置；其方差 σ 2 {displaystyle sigma ^{2}} 的开平方或标准差 σ {displaystyle sigma } 等于尺度参数，决定了分布的幅度。正态分布的概率密度函数曲线呈钟形，因此人们又经常称之为钟形曲线（类似于寺庙里的大钟，因此得名）。我们通常所说的标准正态分布是位置参数 μ = 0 {displaystyle mu =0} ，尺度参数 σ 2 = 1 {displaystyle sigma ^{2}=1} 的正态分布（见右图中红色曲线）。正态分布是自然科学与行为科学中的定量现象的一个方便模型。各种各样的心理学测试分数和物理现象比如光子计数都被发现近似地服从正态分布。尽管这些现象的根本原因经常是未知的，理论上可以证明如果把许多小作用加起来看做一个变量，那么这个变量服从正态分布（在R.N.Bracewell的Fourier transform and its application中可以找到一种简单的证明）。正态分布出现在许多区域统计：例如，采样分布均值是近似地正态的，即使被采样的样本的原始群体分布并不服从正态分布。另外，正态分布信息熵在所有的已知均值及方差的分布中最大，这使得它作为一种均值以及方差已知的分布的自然选择。正态分布是在统计以及许多统计测试中最广泛应用的一类分布。在概率论，正态分布是几种连续以及离散分布的极限分布。正态分布最早是棣莫弗在1718年著作的书籍的（Doctrine of Change），及1734年发表的一篇关于二项分布文章中提出的，当二项随机变量的位置参数n很大及形状参数p为1/2时，则所推导出二项分布的近似分布函数就是正态分布。拉普拉斯在1812年发表的《分析概率论》（Theorie Analytique des Probabilites）中对棣莫佛的结论作了扩展到二项分布的位置参数为n及形状参数为1>p>0时。现在这一结论通常被称为棣莫佛－拉普拉斯定理。拉普拉斯在误差分析试验中使用了正态分布。勒让德于1805年引入最小二乘法这一重要方法；而高斯则宣称他早在1794年就使用了该方法，并通过假设误差服从正态分布给出了严格的证明。“钟形曲线”这个名字可以追溯到Jouffret他在1872年首次提出这个术语“钟形曲面”，用来指代二元正态分布（bivariate normal）。正态分布这个名字还被Charles S. Peirce、Francis Galton、Wilhelm Lexis在1875分别独立地使用。这个术语是不幸的，因为它反映和鼓励了一种谬误，即很多概率分布都是正态的。（请参考下面的“实例”）这个分布被称为“正态”或者“高斯”正好是Stigler名字由来法则的一个例子，这个法则说“没有科学发现是以它最初的发现者命名的”。有几种不同的方法用来说明一个随机变量。最直观的方法是概率密度函数，这种方法能够表示随机变量每个取值有多大的可能性。累积分布函数是一种概率上更加清楚的方法，请看下边的例子。还有一些其他的等价方法，例如cumulant、特征函数、动差生成函数以及cumulant-生成函数。这些方法中有一些对于理论工作非常有用，但是不够直观。请参考关于概率分布的讨论。正态分布的概率密度函数均值为 μ {displaystyle mu } 方差为 σ 2 {displaystyle sigma ^{2}} (或标准差 σ {displaystyle sigma } )是高斯函数的一个实例：(请看指数函数以及 π {displaystyle pi } .)如果一个随机变量 X {displaystyle X} 服从这个分布，我们写作 X {displaystyle X} ~ N ( μ , σ 2 ) {displaystyle N(mu ,sigma ^{2})} . 如果 μ = 0 {displaystyle mu =0} 并且 σ = 1 {displaystyle sigma =1} ，这个分布被称为标准正态分布，这个分布能够简化为右边是给出了不同参数的正态分布的函数图。正态分布中一些值得注意的量：累积分布函数是指随机变量 X {displaystyle X} 小于或等于 x {displaystyle x} 的概率，用概率密度函数表示为正态分布的累积分布函数能够由一个叫做误差函数的特殊函数表示：标准正态分布的累积分布函数习惯上记为 Φ {displaystyle Phi } ，它仅仅是指 μ = 0 {displaystyle mu =0} ， σ = 1 {displaystyle sigma =1} 时的值，将一般正态分布用误差函数表示的公式简化，可得：它的反函数被称为反误差函数，为：该分位数函数有时也被称为probit函数。probit函数已被证明没有初等原函数。正态分布的分布函数 Φ ( x ) {displaystyle Phi (x)} 没有解析表达式，它的值可以通过数值积分、泰勒级数或者渐进序列近似得到。动差生成函数或矩生成函数或动差产生函数被定义为 exp ⁡ ( t X ) {displaystyle exp(tX)} 的期望值。正态分布的动差产生函数如下：可以通过在指数函数内配平方得到。特征函数被定义为 exp ⁡ ( i t X ) {displaystyle exp(itX)} 的期望值，其中 i {displaystyle i} 是虚数单位. 对于一个正态分布来讲，特征函数是：把矩生成函数中的 t {displaystyle t} 换成 i t {displaystyle it} 就能得到特征函数。正态分布的一些性质：一些正态分布的一阶动差如下：标准正态的所有二阶以上的累积量为零。正态分布有一个非常重要的性质：在特定条件下，大量统计独立的随机变量的平均值的分布趋于正态分布，这就是中心极限定理。中心极限定理的重要意义在于，根据这一定理的结论，其他概率分布可以用正态分布作为近似。近似正态分布平均数为 μ = n p {displaystyle mu =np} 且方差为 σ 2 = n p ( 1 − p ) {displaystyle sigma ^{2}=np(1-p)} .近似正态分布平均数为 μ = λ {displaystyle mu =lambda } 且方差为 σ 2 = λ {displaystyle sigma ^{2}=lambda } .这些近似值是否完全充分正确取决于使用者的使用需求正态分布是无限可分的概率分布。正态分布是严格稳定的概率分布。在实际应用上，常考虑一组数据具有近似于正态分布的概率分布。若其假设正确，则约68.3%数值分布在距离平均值有1个标准差之内的范围，约95.4%数值分布在距离平均值有2个标准差之内的范围，以及约99.7%数值分布在距离平均值有3个标准差之内的范围。称为“68-95-99.7法则”或“经验法则”。多元正态分布的协方差矩阵的估计的推导是比较难于理解的。它需要了解谱原理（spectral theorem）以及为什么把一个标量看做一个1×1矩阵(matrix)的迹(trace)而不仅仅是一个标量更合理的原因。请参考协方差矩阵的估计（estimation of covariance matrices）.某饮料公司装瓶流程严谨，每罐饮料装填量符合平均600毫升，标准差3毫升的正态分配法则。随机选取一罐，求（1）容量超过605毫升的概率；（2）容量小于590毫升的概率。容量超过605毫升的概率 = p ( X > 605)= p ( ((X-μ) /σ) > ( (605 – 600) / 3) )= p ( Z > 5/3) = p( Z > 1.67) = 1 - 0.9525 = 0.0475容量小于590毫升的概率 = p (X < 590) = p ( ((X-μ) /σ) < ( (590 – 600) / 3) )= p ( Z < -10/3) = p( Z < -3.33) = 0.00046-标准差(6-sigma或6-σ)的品质管制标准6-标准差(6-sigma或6-σ)，是制造业流行的品质管制标准。在这个标准之下，一个标准正态分配的变量值出现在正负三个标准差之外，只有2* 0.0013= 0.0026 (p (Z < -3) = 0.0013以及p(Z > 3) = 0.0013)。也就是说，这种品质管制标准的产品不良率只有万分之二十六。假设例中的饮料公司装瓶流程采用这个标准，而每罐饮料装填量符合平均600毫升，标准差3毫升的正态分配。那么预期装填容量的范围应该多少？6-标准差的范围 = p ( -3 < Z < 3)= p ( - 3 < (X-μ) /σ < 3) = p ( -3 < (X- 600) / 3 < 3)= p ( -9 < X – 600 < 9) = p (591 < X < 609) 因此，预期装填容量应该介于591至609毫升之间。假设某校入学新生的智力测验平均分数与标准差分别为100与12。那么随机抽取50个学生，他们智力测验平均分数大于105的概率？小于90的概率？本例没有正态分配的假设，还好中心极限定理提供一个可行解，那就是当随机样本长度超过30，样本平均数 x ¯ {displaystyle {bar {x}}} 近似于一个正态变量，因此标准正态变量 Z = X ¯ − μ σ / n {displaystyle Z={frac {{bar {X}}-mu }{sigma /{sqrt {n}}}}} 。平均分数大于105的概率 P ( Z > 105 − 100 12 / 50 ) = P ( Z > 5 / 1.7 ) = P ( Z > 2.94 ) = 0.0016 {displaystyle P(Z>{frac {105-100}{12/{sqrt {50}}}})=P(Z>5/1.7)=P(Z>2.94)=0.0016}平均分数小于90的概率 P ( Z < 90 − 100 12 / 50 ) = P ( Z < − 5.88 ) = 0.0000 {displaystyle P(Z<{frac {90-100}{12/{sqrt {50}}}})=P(Z<-5.88)=0.0000}在计算机模拟中，经常需要生成正态分布的数值。最基本的一个方法是使用标准的正态累积分布函数的反函数。除此之外还有其他更加高效的方法，Box-Muller变换就是其中之一。另一个更加快捷的方法是ziggurat算法。下面将介绍这两种方法。一个简单可行的并且容易编程的方法是：求12个在（0,1）上均匀分布的和，然后减6(12的一半)。这种方法可以用在很多应用中。这12个数的和是Irwin-Hall分布；选择一个方差12。这个随即推导的结果限制在（-6,6）之间，并且密度为12，是用11次多项式估计正态分布。Box-Muller方法是以两组独立的随机数U和V，这两组数在(0,1]上均匀分布，用U和V生成两组独立的标准正态分布随机变量X和Y:这个方程的提出是因为二自由度的卡方分布（见性质4）很容易由指数随机变量（方程中的lnU）生成。因而通过随机变量V可以选择一个均匀环绕圆圈的角度，用指数分布选择半径然后变换成（正态分布的）x,y坐标。

正态分布

相关