正态分布计算器

输入均值 μ 与标准差 σ,即可算出概率密度 f(x)、累积概率 P(X ≤ x)、区间概率 P(a ≤ X ≤ b) 与双侧尾概率,也能反查 95% 等任意百分位对应的 x 值;填 μ = 0、σ = 1 就是标准正态分布,结果同步给出 z 分数与 68-95-99.7 经验法则,不必再查表。

给一个 x,算密度 f(x)、P(X ≤ x)、P(X ≥ x) 与 z 分数。

分布的中心,也是这条钟形曲线的对称轴与最高点位置。

必须大于 0,衡量数据的分散程度:σ 越大曲线越矮越胖。填方差请先开方;标准正态分布填 μ = 0、σ = 1。

要考察的取值,如「智商 130」「身高 180」「考试分数 85」。

x = 130 处的累积概率 P(X ≤ x)
97.7250%

z 分数 =(130100)÷ 15 = 2即 x 位于均值右侧 2 个标准差处;P(X ≥ x) = 0.0227501319

双侧尾概率 P(|X − μ| ≥ |x − μ|) = 0.0455002639(常用作双尾检验的 p 值);概率密度 f(x) = 0.0035993978—— 它是曲线的高度,不是概率本身,连续分布中单点概率恒为 0。

数值 x130
z 分数2
P(X ≤ x)0.9772498681
P(X ≥ x)0.0227501319
双侧尾概率0.0455002639
概率密度 f(x)0.0035993978
均值 μ100
标准差 σ / 方差 σ²15 / 225

经验法则参考:

μ ± 1σ(85 ~ 11568.27%
μ ± 2σ(70 ~ 13095.45%
μ ± 3σ(55 ~ 14599.73%

怎么用

  1. 选问法:单点概率、区间概率还是反查 x 值想知道「考 130 分能超过多少人」选「单点概率」,它同时给出 P(X ≤ x)、P(X ≥ x) 与 z 分数;想知道「身高在 165~175 之间的人占比」选「区间概率」;想知道「前 5% 的分数线是多少」选「反查 x 值」。三种问法用的是同一条曲线,只是问的方向不同。
  2. 填均值 μ 与标准差 σμ 是分布中心,也是钟形曲线的对称轴;σ 衡量分散程度,必须大于 0,σ 越大曲线越矮越胖。题目若给的是方差 σ²,请先开方再填,例如方差 225 应填 σ = 15。做标准正态分布的题目就填 μ = 0、σ = 1,此时 x 本身就是 z 分数。
  3. 填要考察的取值单点概率填一个 x(如智商 130、身高 180、耗时 8.5 秒);区间概率填下限 a 与上限 b,需满足 a ≤ b;反查 x 值则选 90%、95%、99% 或自定义一个 0~1 之间的累积概率 p,p 指的是 P(X ≤ x),选 0.95 就是求 95% 分位数。
  4. 读结果:分清密度与概率大字是最常用的那个答案——单点模式给 P(X ≤ x),区间模式给 P(a ≤ X ≤ b),反查模式给 x 值。下方表格列出 z 分数、两侧尾概率、双侧尾概率(双尾检验的 p 值)和概率密度 f(x)。注意 f(x) 是曲线高度不是概率,σ 很小时它可以大于 1;连续分布中任意单点的概率恒等于 0,所以 P(X ≤ x) 与 P(X < x) 相等。
  5. 用经验法则交叉验证结果区底部固定列出 μ±1σ、μ±2σ、μ±3σ 三个区间及其概率(68.27%、95.45%、99.73%)。把你的 x 与这三条线比一比,就能快速判断算出来的概率是否合理:例如 x 恰好等于 μ+2σ 时,P(X ≥ x) 应约等于 (1−95.45%)/2 = 2.28%。

核心要点

正态分布由均值 μ 和标准差 σ 两个参数完全确定。所有概率问题都先标准化成 z = (x − μ)/σ, 再查标准正态累积函数 Φ(z)

  • 三种问法:单点 P(X ≤ x) = Φ(z);区间 P(a ≤ X ≤ b) = Φ(z_b) − Φ(z_a);反查 x = μ + σ·Φ⁻¹(p)
  • 典型算例μ = 100σ = 15x = 130z = 2P(X ≤ 130) = 97.72%P(X ≥ 130) = 2.28%
  • 经验法则μ ± 1σ 覆盖 68.27%,μ ± 2σ 覆盖 95.45%,μ ± 3σ 覆盖 99.73%。
  • 易错点:密度 f(x) 是曲线高度不是概率,可以大于 1;单侧 95% 用 1.645,双侧 95% 用 1.96,别混用。

原理与公式

正态分布(normal distribution),又称高斯分布,是统计学中最重要的连续分布: 大量微小、独立的随机因素叠加起来,结果往往就近似正态分布(中心极限定理)。 它的形状是一条对称的钟形曲线,位置由均值 μ 决定, 胖瘦由标准差 σ 决定,记作 X ~ N(μ, σ²)

概率密度函数(PDF)

f(x) = 1/(σ√(2π)) · e^(−(x−μ)²/(2σ²))
峰值出现在 x = μ 处,高度为 1/(σ√(2π)); 标准正态分布(μ = 0σ = 1)的峰值是 1/√(2π) = 0.3989422804。曲线在 x = μ ± σ 处有拐点,整条曲线下的总面积恒为 1。
密度不是概率f(x) 只有乘上区间宽度、 也就是取曲线下的面积后才是概率,因此 σ 很小时 f(x) 完全可以大于 1(σ = 0.1 时峰值 ≈ 3.99)。

累积分布函数(CDF)与标准化

P(X ≤ x) = Φ((x − μ)/σ),其中 Φ 是标准正态分布的累积函数:
Φ(z) = ½·[1 + erf(z/√2)],等价地 Φ(z) = ½·erfc(−z/√2)
z = (x − μ)/σ标准分z 分数, 表示 x 距离均值有几个标准差。Φ 没有初等函数形式的原函数, 手算只能查表,本工具用误差函数 erf/erfc 直接求值。

三类问题的算法

① 单点(左尾/右尾)P(X ≤ x) = Φ(z)P(X ≥ x) = 1 − Φ(z) = Φ(−z)
② 区间P(a ≤ X ≤ b) = Φ(z_b) − Φ(z_a)
③ 反查(分位数):给定 p = P(X ≤ x)x = μ + σ·Φ⁻¹(p)
因为单点概率恒为 0,< 在这里没有区别,端点取不取等号都一样。

计算示例

设智商 X ~ N(100, 15²)
单点x = 130z = (130 − 100)/15 = 2
P(X ≤ 130) = Φ(2) = 0.9772498681(97.72%),P(X ≥ 130) = 0.0227501319(2.28%),f(130) = 0.0035993978
区间P(85 ≤ X ≤ 115) = Φ(1) − Φ(−1) = 0.6826894921(68.27%)
反查p = 0.95 Φ⁻¹(0.95) = 1.6448536270 x = 100 + 15 × 1.6448536270 = 124.6728044043

经验法则与常用分位数

68-95-99.7 法则P(|X − μ| ≤ σ) = 0.6826894921P(|X − μ| ≤ 2σ) = 0.9544997361P(|X − μ| ≤ 3σ) = 0.9973002039, 对应 3σ 之外约 0.27%(约万分之 27)。
常用 Φ 值Φ(1) = 0.8413447461Φ(1.645) ≈ 0.95Φ(1.96) ≈ 0.975Φ(2) = 0.9772498681Φ(2.576) ≈ 0.995Φ(3) = 0.9986501020
常用分位数(单侧):90% → 1.2815515655, 95% → 1.6448536270,97.5% → 1.9599639845, 99% → 2.3263478740,99.5% → 2.5758293035
单侧与双侧别混用:双侧 95% 对应的是 ±1.96(左右各留 2.5%),单侧 95% 才是 1.645

在质量控制中的用法

休哈特控制图取 μ ± 3σ 作为控制限,正是因为正常波动下超出该范围的 概率只有约 0.27%,一旦超限就有理由怀疑过程发生了异常 (现行国家标准 GB/T 17989.2-2020《控制图 第2部分:常规控制图》, 等同采用 ISO 7870-2:2013)。
六西格玛管理里的 3.4 DPMO(每百万机会 3.4 个缺陷) 则常被误解:它不是 的双侧超限概率(那只有约 0.002 ppm),而是考虑过程均值长期漂移 1.5σ 之后、按 4.5σ 的单侧尾概率 3.4×10⁻⁶ 得到的。

适用前提与精度

正态模型适合单峰、近似对称、极端值稀少的连续数据(身高、测量误差、加工偏差、 考试成绩等)。收入房价(右偏)、等待时间(指数分布)、事故计数(泊松分布)、 是/否计数(二项分布)都不宜直接套用,可先做对数变换或改用相应分布。
精度μσx 与区间端点以原始文本直接交给高精度十进制引擎,z = (x − μ)/σμ ± kσ 等线性运算不经浮点转换,规避原生浮点误差(0.1 + 0.2 = 0.3);Φerf/erfcΦ⁻¹ 由双精度算法求值。尾概率一律从它所在的那一侧直接算出,不用 1 − 另一侧 相减,因此 P(Z ≥ 10) = 7.6×10⁻²⁴ 这样的极端尾部不会被舍入成 0;区间概率也按端点所在的一侧做差, 避免 Φ(6) − Φ(5) 这类相近大数相减丢精度。
双精度的能力是分档的,下面按 |z|xμ 有几个标准差)说明,请对号入座:

  • |z| ≤ 37(尾概率 ≥ 10⁻³⁰⁰ 量级):常用范围,Φerf/erfcΦ⁻¹ 的相对误差约 1e-15,远细于展示的 10 位小数。日常统计、 假设检验、质量控制都落在这一档。
  • 37 < |z| < 38.5(尾概率约 10⁻³⁰⁸ ~ 10⁻³²³:进入双精度的次正规数区间,数值仍是正数但有效位逐步减少, 越靠近下沿有效数字越少,此时不再保证 1e-15 的相对误差。
  • |z| ≥ 38.5(尾概率 < 10⁻³²³:已小于双精度能表示的最小正数(约 5×10⁻³²⁴)。 这类结果不会显示成 0,而是标注为 <1e-323 这样的上界并附加说明——它数学上仍严格大于 0, 只是超出可精确表示的范围;概率密度 f(x) = φ(z)/σ 同理,上界按 σ 折算。要看清这一档尾部,需要对数尺度或 任意精度的统计软件。
  • 互补的一侧:当尾概率小到 10⁻¹⁷ 量级时, 与它互补的累积概率会显示为 1——这是双精度能表示的最接近值, 请以同时给出的那一侧尾概率为准。

支持范围μσx 与端点的绝对值上限为 1e150σ 需大于 1e-150;反查模式的累积概率需满足 0 < p < 1。 超出范围会明确报错,而不是静默返回无穷大或失真结果;范围之内但尾概率超出 双精度的组合(例如 σ = 1e-150x − μ = 0.01, 此时 z = 1e148)会照上面第三档标注上界,同样不会静默给 0。 所有计算在浏览器本地完成,不上传数据。

常见问题

正态分布的概率怎么算?P(X ≤ x) 的公式是什么?
分两步:先把 x 标准化成 z 分数 z = (x − μ)/σ,再查标准正态分布的累积函数 Φ(z),即 P(X ≤ x) = Φ((x − μ)/σ)。举例:智商服从 μ = 100、σ = 15 的正态分布,问 P(X ≤ 130),先算 z = (130 − 100)/15 = 2,再查 Φ(2) = 0.9772498681,即约 97.72% 的人智商不超过 130,反过来 P(X ≥ 130) = 2.28%。Φ 没有初等函数形式的表达式,手算只能查标准正态分布表,本工具用误差函数 erf 直接算出,在常用的 |z| ≤ 37 范围内相对误差约 1e-15,比表格的 4 位小数细得多(再往外会受双精度限制,详见「适用前提与精度」)。区间概率同理:P(a ≤ X ≤ b) = Φ(z_b) − Φ(z_a)。
概率密度 f(x) 和累积概率 P(X ≤ x) 有什么区别?密度会大于 1 吗?
f(x) 是曲线在 x 处的高度(概率密度),P(X ≤ x) 是曲线从最左边到 x 之间的面积(累积概率)。只有面积才是概率,所以累积概率一定落在 0~1 之间,而密度可以大于 1:当 σ = 0.1 时峰值 f(μ) = 1/(σ√(2π)) ≈ 3.99,这不矛盾,因为它乘以极窄的区间宽度后仍远小于 1。由此还能推出一个常被问到的结论:连续分布中任意单点的概率恒为 0(宽度为 0 的面积是 0),所以 P(X ≤ x) 与 P(X < x) 完全相等,做题时不必纠结端点是否取等号——这一点和离散的二项分布正好相反。
z 分数怎么算?为什么要先化成标准正态分布?
z = (x − μ)/σ,含义是「x 距离均值有几个标准差」:z = 2 表示在均值右侧 2 个标准差处,z = −1.5 表示在左侧 1.5 个标准差处。标准化的意义在于所有正态分布经这一步都会变成 μ = 0、σ = 1 的标准正态分布,于是一张表、一套算法就能覆盖全部情况,不必为每组 μ、σ 单独制表。z 分数还让不同量纲的成绩可比:数学考 85 分(班级 μ = 70、σ = 10,z = 1.5)比英语考 90 分(μ = 80、σ = 20,z = 0.5)更靠前,尽管卷面分更低。国内高考等考试常用的标准分(T 分 = 500 + 100z 之类的线性变换)也是由 z 分数换算来的。
正态分布的 68-95-99.7 经验法则是怎么来的?3σ 之外的比例是多少?
它就是把 k = 1、2、3 代进正态分布累积函数算出来的:P(|X − μ| ≤ σ) = 68.2689%,P(|X − μ| ≤ 2σ) = 95.4500%,P(|X − μ| ≤ 3σ) = 99.7300%。所以落在 3σ 之外的比例是 1 − 0.9973002 = 0.0026998,约 0.27%,即每一万个产品约 27 个超限,这正是休哈特控制图取 ±3σ 作为控制限的依据(现行国家标准为 GB/T 17989.2-2020《控制图 第2部分:常规控制图》)。顺带说清一个常见混淆:六西格玛管理里的「3.4 DPMO(每百万缺陷 3.4 个)」并不是 6σ 双侧超限概率(那只有约 0.002 ppm),而是假设过程均值会长期漂移 1.5σ 后、按 4.5σ 单侧尾概率 3.4e-6 算出来的。
已知概率反查 x 值怎么算?95% 分位数为什么是 μ + 1.645σ 而不是 μ + 1.96σ?
反查用的是累积函数的反函数(分位数函数):x = μ + σ·Φ⁻¹(p)。例如 μ = 100、σ = 15 求 95% 分位数,Φ⁻¹(0.95) = 1.6448536270,x = 100 + 15 × 1.6448536270 = 124.6728044043,意思是约 95% 的数据不超过 124.67。1.645 与 1.96 的区别在于单侧还是双侧:1.645 满足 P(Z ≤ 1.645) = 95%,是把 5% 全放在右边一侧;1.96 满足 P(−1.96 ≤ Z ≤ 1.96) = 95%,是左右各留 2.5%,所以 1.96 对应的其实是 97.5% 分位数。求分位数、单侧临界值时用 1.645,做双侧置信区间时用 1.96,选错会让结论宽窄差一截。
什么样的数据才能按正态分布算?不符合正态分布怎么办?
适合的典型是「由大量微小独立因素叠加而成」的量:同性别同年龄段的身高、测量误差、加工尺寸偏差、考试成绩、同一工序的重复读数等,它们大多单峰、左右对称、极端值稀少(成人体重则通常略微右偏,套用前先画图看看)。明显不适合的有:收入与房价(右偏长尾,常先取对数变成对数正态)、等待时间与故障间隔(多为指数分布)、点击次数与事故数(泊松分布)、只有是/否两种结果的计数(二项分布)。判断方法上,先画直方图或 Q-Q 图看形状,再做正式检验,一般用夏皮罗-威尔克(Shapiro-Wilk)或安德森-达令(Anderson-Darling)。这里有个常被忽略的前提:经典 K-S 检验要求理论分布的参数事先完全指定,如果 μ、σ 是用同一批数据估计出来的,普通 K-S 临界值就不再成立,需要改用 Lilliefors 校正或模拟临界值。另外样本量很大时这类检验会对微小偏离过度敏感,此时更应看图形与偏度、峰度。若确实不是正态分布,可以做对数变换后再用本工具,或改用非参数方法。要提醒的是:即使原始数据不服从正态分布,样本均值在样本量足够大时仍近似正态(中心极限定理),所以「对均值做推断」和「对单个观测值算概率」是两件事,不能混为一谈。
标准正态分布表怎么查?查表结果和正态分布计算器算的一样吗?
查表分三步:先标准化 z = (x − μ)/σ,再用 z 的整数位与十分位定行、百分位定列,交叉格就是 Φ(z)。例如 z = 1.96,找「1.9」行、「0.06」列,读到 0.9750。要留意国内教材的表有两种口径:一种直接给 Φ(z) = P(Z ≤ z)(1.96 对应 0.9750),另一种只给 0 到 z 之间的面积 Φ(z) − 0.5(对应 0.4750),两者差 0.5,用之前先看表头写的是哪一种。表通常只排到 z = 3.49、保留 4 位小数,负数要用对称性 Φ(−z) = 1 − Φ(z) 折算。本工具用误差函数直接求值,在表格覆盖的范围内与表一致(Φ(1.96) = 0.9750021049),同时不受表的上下限和位数限制,尾部很小时也会给出量级而不是四舍五入成 0。
Excel 里正态分布怎么算?NORM.DIST、NORM.S.DIST 和 NORM.INV 有什么区别?
NORM.DIST(x, 均值, 标准差, 累积) 是主力函数:第四个参数填 TRUE 得累积概率 P(X ≤ x),填 FALSE 得概率密度 f(x)。NORM.S.DIST(z, 累积) 是它的标准正态版本,只需要一个 z,相当于把 μ = 0、σ = 1 写死。反查方向用 NORM.INV(概率, 均值, 标准差),标准正态版本是 NORM.S.INV(概率)。举例:=NORM.DIST(130,100,15,TRUE) 得 0.977250,=NORM.INV(0.95,100,15) 得 124.672804,与本页算例一致。不带点号的 NORMDIST、NORMSDIST、NORMINV 是为兼容早期版本保留的旧函数,结果相同。本页把这几件事放在同一屏:单点模式一次给出 P(X ≤ x)、P(X ≥ x)、f(x) 与 z 分数,反查模式对应 NORM.INV,不必记函数名和参数顺序。

相关指南