二项分布、泊松分布还是正态分布?分布选型与实算

数学更新于 2026-09-23

一道概率题最难的常常不是代公式,而是判断该用哪个分布。二项分布描述试验次数 n 固定、每次只有成功失败两种结果时成功次数的分布;泊松分布描述单位时间或单位空间内事件发生次数的分布,只需要一个平均次数 λ;正态分布描述连续数值围绕均值的钟形分布。选错分布,后面每一步都白算。

三个分布怎么分:先问自己在数什么

选分布只看两件事:结果是「个数」还是「数值」,以及试验次数写不写得出来。 个数加上固定次数,走二项分布;个数但次数没有上限,走泊松分布;连续数值,走正态分布。 这一步判对了,剩下的就是把参数填进计算器。

二项分布问的是「50 次里中几次」,泊松分布问的是「这 10 分钟里来几个」,正态分布问的是「这个数值落在哪一段」。

先分「数次数」还是「量数值」

不良件数、来电通数、进球个数都是整数,属于离散型,只能由二项或泊松描述; 配送时长、体重、加工尺寸这些可以取到小数点后任意位的量是连续型,由正态分布描述。 混用的典型后果是:拿正态分布去问「恰好 30 件不良的概率」,答案永远是 0,因为连续分布的单点概率就是 0。

再看试验次数固定不固定

同样是数次数,「抽 50 件」的 n 明确等于 50,每件要么不良要么合格,这是标准的伯努利重复试验; 而「晚高峰平均每 10 分钟 3 通电话」根本说不清一共有多少次机会,只能用单位区间的平均次数 λ 来刻画。 下面这张表把常见情形和对应工具对齐,拿不准时照着对号入座。

你手上有的信息该用的分布关键参数典型问法
试验次数 n 固定、每次成败独立、单次成功率 p 已知二项分布n、p抽 50 件里有几件不良
只知道单位时间或单位区间的平均发生次数,次数无上限泊松分布λ10 分钟内来几通电话
连续测量值,且有均值与标准差正态分布μ、σ配送时长超过 40 分钟的比例
从有限批量里不放回抽取,且抽样比偏大超几何分布(抽样比小时可用二项近似)批量 N、不良数 D、抽样数 n200 件里含 4 件不良,抽 50 件
只问单个事件发生与否,不数次数古典概率有利数、总数掷一次骰子出 6 的概率

超几何分布本站暂未单独成页,抽样比小于 5% 时按二项分布计算,误差通常可忽略。

把上面的判断压缩成可执行的四步,照着走一遍基本不会选错:

  1. 先分清在数次数还是在量数值结果是 0、1、2 这类整数就走二项或泊松;是时长、重量这类连续量就走正态分布。
  2. 再看试验次数是不是固定的n 写得出来用二项;只说得出「平均多少次」、次数没有上限的用泊松。
  3. 把参数对齐到同一个口径p 必须是单次试验的成功率,λ 必须和问题里的时间窗一致,换算窗口时 λ 要同比缩放。
  4. 算完回头验一次期望二项 E=np,泊松 E=λ。算出的期望和现实量级差太远,多半是分布选错或参数没对齐。

次数固定:抽检 50 件怎么算

试验次数固定时用二项分布,核心公式把「选哪几次成功」和「每次的概率」两部分相乘。 从 n 次里挑出 k 次成功,有 C(n,k) 种选法,每种选法的概率都是 pᵏ(1−p)ⁿ⁻ᵏ。

P(X=k) = C(n,k) × pᵏ × (1−p)ⁿ⁻ᵏ

拿一个真实场景试试:一批货的不良率 p=2%,抽检 n=50 件,想知道抽到 0 件、1 件、2 件不良分别是多大概率。 以 k=2 为例,C(50,2)=1225,代入得 1225×0.02²×0.98⁴⁸≈18.58%。

不良件数 k恰好 k 件的概率至多 k 件的累积概率
0 件约 36.42%约 36.42%
1 件约 37.16%约 73.58%
2 件约 18.58%约 92.16%
3 件约 6.07%约 98.23%

n=50、p=2% 的二项分布,结果为估算并四舍五入到小数点后两位。

最常被问的其实是反过来那一问:至少有 1 件不良的概率。 直接用 1 − P(X=0) = 1 − 0.98⁵⁰ ≈ 63.58%。 也就是说,2% 的不良率看着很低,抽 50 件却有六成多的机会至少碰上一件。

打开「二项分布计算器恰好与累积成功概率·区间·期望方差

组合数 C(50,2) 从哪来

公式里的 C(n,k) 就是组合数,表示从 n 个里不计顺序地选出 k 个的方案数。 n 一大,手算阶乘立刻溢出,比如 C(50,25) 已经是 15 位数。 这一步交给排列组合计算器最稳妥,它用大整数精确计算,不会因为浮点误差丢精度。

单独算一下组合数 C(n,k)大数精确,不丢精度

恰好、至多、至少三种问法别混

同一组 n 和 p,问法不同要取的数完全不同。 「恰好 2 件」取单点概率 18.58%,「至多 2 件」要把 k=0、1、2 三项加起来得 92.16%, 「至少 3 件」则是 1 减去至多 2 件,约 7.84%。 验收场景里真正有用的往往是后两种:约定不良品超过 2 件就退整批,那 7.84% 就是这批货被退回的概率。 填计算器时先想清楚自己问的是哪一种,比记公式更要紧。

期望和方差怎么读

二项分布的期望 E(X)=np,方差 Var(X)=np(1−p)。 本例期望是 50×2%=1 件,标准差约 0.99 件,意思是「抽 50 件平均碰上 1 件不良,上下浮动 1 件左右都很正常」。 把这个量级记在心里,算出来的概率离谱不离谱,一眼就能看出来。

只有平均次数:客服热线怎么算

当你只知道「平均每段时间发生几次」、说不出总共试了多少次时,用泊松分布。 它只要一个参数 λ,即同一观察区间内的平均发生次数。

P(X=k) = λᵏ × e^(−λ) ÷ k! (式中 e≈2.71828,λ 为区间平均次数)

设某客服团队晚高峰平均每 10 分钟接到 3 通电话,即 λ=3。 代入公式可得:这 10 分钟一通都没有的概率约 4.98%,恰好 3 通约 22.40%,恰好 5 通约 10.08%, 至多 1 通(用于判断要不要留人值守)约 19.91%。

λ 的含义
同一观察区间内的平均发生次数,必须和问题的时间窗一致。
λ 怎么估
历史总次数 ÷ 区间个数,例如 5 天共 90 通、30 个 10 分钟窗口,λ=3。
期望
E(X)=λ,本例为 3 通。
方差
Var(X)=λ,泊松分布的期望与方差相等,这是它的识别特征。
标准差
√λ,λ=9 时标准差正好是 3 通。
适用前提
事件彼此独立、发生率稳定,不能有明显的扎堆或相互触发。

λ 怎么从历史数据估出来

λ 不是拍脑袋定的,它来自历史记录:把观察期内的总发生次数,除以同等长度的区间个数。 接着上面的例子,若连续 5 个工作日记录晚高峰话务,每天划成 6 个 10 分钟窗口、合计 30 个窗口, 期间共接 90 通电话,那么 λ = 90 ÷ 30 = 3 通/10 分钟。 样本窗口越多,λ 越稳;窗口太少时估出来的 λ 波动大,算出的概率只能当量级参考。 还要留意口径一致:若统计里混进了非高峰时段,得到的其实是被稀释过的平均值,不能拿来算晚高峰。

换时间窗时 λ 要跟着变

问题从 10 分钟换成半小时,λ 不能照抄。 观察区间放大 3 倍,平均次数也放大 3 倍,λ 从 3 变成 9。 此时「半小时接到至少 10 通电话」的概率约 41.26%,标准差是 √9=3 通。

λ 和区间不匹配是最高频的错
把「每 10 分钟 3 通」直接拿去算半小时的概率,等于悄悄把话务量缩水到三分之一, 算出的排班人数会明显偏少。先统一时间窗再代公式,是泊松题的第一步。
打开「泊松分布计算器恰好、至多、至少概率·期望方差·算例

n 大到算不动:两种近似谁更贴

n 上千时二项分布要累加上千项,手算不现实,于是有了泊松近似和正态近似两条路。 两者条件不同,误差方向也不同,用错反而比不近似更偏。

用同一道题横向比一次:抽检 n=1000 件、不良率 p=2%,问不良件数达到 31 件及以上的概率。 期望 np=20 件,标准差 √(1000×0.02×0.98)≈4.43 件。

算法参数取值结果与精确值的差
二项分布(精确)n=1000, p=2%约 1.26%
泊松近似λ=np=20约 1.35%高约 0.09 个百分点
正态近似(含 ±0.5 修正)μ=20, σ≈4.43,分界取 30.5约 0.89%低约 0.37 个百分点

同一道题三种算法对比,结果均为估算;p 很小时分布右偏,正态近似的右尾误差更明显。

结论很清楚:p 小、分布右偏时泊松近似更贴,正态近似会低估右尾。 课本常说「n 大就能用正态近似」,但没提这个前提——p 离 0.5 越远,偏差越值得当回事。

泊松近似:n 大、p 小

经验条件是 n≥20 且 p≤0.05,取 λ=np。 前面 n=50、p=2% 那道题,二项算至少 1 件不良是 63.58%,泊松近似给 63.21%,差距不到 0.4 个百分点,完全够用。 但 p 接近 0.5 时就不行了:n=20、p=0.5 时二项 P(X=10)≈17.62%,硬套 λ=10 的泊松只有约 12.51%,差了 5 个百分点。

正态近似:为什么要 ±0.5

正态近似的条件通常写作 np≥5 且 n(1−p)≥5,即两侧都有足够多的期望次数。 因为二项是离散的、正态是连续的,整数 30 要摊成 29.5 到 30.5 这一段,这步叫连续性修正。 算 P(X≥31) 就以 30.5 作分界,漏掉这半格,短区间的概率会明显失真。

打开「正态分布计算器概率密度·累积概率·区间概率·z分数与分位数

「至少一次」怎么算最省事

「至少一次」不要正面硬算,用补事件最快:至少发生一次 = 1 − 一次都不发生。 一次都不发生的概率是 (1−p)ⁿ,所以整个式子非常短。

P(至少一次) = 1 − (1−p)ⁿ

单次概率 1%、连着试 100 次,结果是 1 − 0.99¹⁰⁰ ≈ 63.40%,而不是直觉上的「试满 100 次总该中一回」。 这个数和前面泊松近似给的 63.21%(λ=np=1)几乎一致,正好互为验算。

至少一次 ≠ n×p
n×p 算的是平均发生次数,不是概率。p=1%、n=200 时 n×p=2,按概率读就成了 200%。 只有当 n×p 远小于 1 时,两者才勉强接近;超过这个范围必须用补事件公式。

反过来求:要抽多少件才有九成把握

这个公式更实用的用法是反解 n——不问「抽 50 件能不能发现问题」,而问「要抽多少件才够」。 把不等式 1 − (1−p)ⁿ ≥ 目标把握度移项,两边取对数即可。

n ≥ ln(1 − 目标把握度) ÷ ln(1 − p)

仍设不良率 p=2%,想有九成把握至少发现 1 件不良,代入得 n ≥ ln(0.10) ÷ ln(0.98) ≈ 113.97, 向上取整要抽 114 件;把标准提到九成五,需要 ln(0.05) ÷ ln(0.98) ≈ 148.28,即 149 件。 从九成提到九成五,抽检量要多三成,这也是抽样方案里把握度不能随口定高的原因。

互斥相加与独立相乘别混用

同一个「中奖概率」,问法不同算法完全不同。 双色球从 33 个红球选 6 个、再从 16 个蓝球选 1 个,方案数 C(33,6)×16 = 1107568×16 = 17721088 种,单注中一等奖约 1/1772 万。 同一期买 100 注不同号码是互斥事件,概率直接相加,约 100/17721088 ≈ 0.00056%; 连续 100 期每期买 1 注是独立重复试验,得用 1−(1−p)¹⁰⁰ 算。

算一算至少发生一次的概率支持交并事件与重复试验

五个最容易算错的地方

分布选对之后,出错通常集中在参数口径上。下面五个坑,前四个都能靠核对参数避开。

不放回抽样按二项算批量 200 件含 4 件不良、抽 50 件时,超几何算一件不良都没有约 31.3%,二项给 36.4%;批量换成 5000 件时两者约 36.2% 与 36.4%,几乎重合。抽样比超过 5% 就别用二项代替。
独立性其实不成立同一批次的产品质量高度相关,来电也会在推送后扎堆。事件互相影响时,二项和泊松的前提就破了,算出的概率会系统性偏低。
λ 和时间窗不同口径λ 按 10 分钟统计,问题却问半小时,必须先把 λ 乘以 3。这类错误不会报错,只会悄悄给出一个偏小的答案。
把离散当连续问单点正态分布里 P(X=31) 恒等于 0。要问「恰好 31 件」,要么回到二项或泊松,要么用 30.5 至 31.5 的区间概率替代。
期望方差公式串台二项 Var=np(1−p),泊松 Var=λ,正态的 σ² 是独立给定的参数。若一组计数数据的方差远大于均值,说明它并不服从泊松分布。

三个分布本来就是一家人

很多人把二项、泊松、正态当成三套互不相干的公式背,其实它们同源。 二项分布在 n 趋大、p 趋小而 np 保持不变时,极限就是参数为 λ=np 的泊松分布; 在 n 趋大而 p 不太靠近两端时,极限则是均值 np、方差 np(1−p) 的正态分布。 理解这层关系有个直接好处:近似不是「换了个公式」,而是同一个分布在不同极限下的简写, 所以近似条件说白了就是在问「现在离哪个极限更近」。

一个反向用法
泊松分布期望等于方差这一点,可以当作数据体检工具。 把历史计数的均值和方差都算出来,两者接近才适合套泊松; 方差明显更大,说明事件在扎堆,直接套公式会低估极端情况。

照着选型四步把分布定下来,再把 n、p 或 λ 填进对应的计算器,恰好、至多、至少几种概率连同期望方差一次就能出来。

常见问题

二项分布和泊松分布有什么区别,什么时候该用哪个?
区别在于试验次数是否固定。二项分布需要两个参数 n 和 p,适用于「抽 50 件、每件不良率 2%」这类次数写得出来、每次只有成败两种结果的场景;泊松分布只要一个 λ,适用于「晚高峰平均每 10 分钟来 3 通电话」这类单位时间或单位空间内的计数,次数理论上没有上限。判断口诀是:能明确说出「一共试了多少次」就用二项,只能说出「平均多少次」就用泊松。
泊松分布的 λ 怎么求,可以小于 1 吗?
λ 是同一观察区间内的平均发生次数,用历史数据的总次数除以区间个数即可。比如 5 个工作日晚高峰共接 90 通电话、每天统计 6 个 10 分钟窗口,λ = 90 ÷ 30 = 3 通/10 分钟。λ 完全可以小于 1,例如「平均每年 0.3 次设备故障」,此时 P(X=0)=e^(−0.3)≈74.1%,说明多数年份一次都不出。关键是 λ 和问题问的时间窗必须是同一个口径。
二项分布什么时候可以用泊松分布近似,条件是什么?
常用的经验条件是 n 较大、p 较小,教材多取 n≥20 且 p≤0.05,近似时令 λ=np。以 n=50、p=2% 为例,二项算出至少 1 件不良约 63.6%,泊松近似约 63.2%,差距不到 0.5 个百分点。但 p 接近 0.5 时近似会失真:n=20、p=0.5 时二项 P(X=10)≈17.6%,硬套 λ=10 的泊松只有约 12.5%,差了 5 个百分点。
二项分布用正态分布近似时,为什么要加减 0.5?
因为二项分布是离散的、正态分布是连续的。离散分布问「恰好 30 件」有确定概率,连续分布里任何单点概率都是 0,所以要把整数 30 摊成区间 29.5 到 30.5,这一步叫连续性修正。算 P(X≥31) 就用 30.5 作分界。近似的前提通常要求 np≥5 且 n(1−p)≥5;p 很小时分布右偏,正态近似的尾部误差仍然偏大。
「至少一次」的概率怎么算,为什么不等于 n 乘以 p?
用补事件:至少发生一次的概率 = 1 − 一次都不发生的概率 = 1 − (1−p)ⁿ。单次中奖率 1%、连着抽 100 次,结果是 1 − 0.99¹⁰⁰ ≈ 63.4%,而不是 100×1% 推出的「必然中」。n×p 算的是平均发生次数(期望),当 p 很小、n×p 远小于 1 时它才勉强接近概率;只要 n×p 超过 1,这个算法就会给出超过一的概率,显然不成立。
抽检 50 件算不良品概率,该用二项分布还是超几何分布?
严格说不放回抽样属于超几何分布,但抽样比很小时用二项分布近似误差可以忽略。批量 200 件含 4 件不良、抽 50 件(抽样比 25%),超几何算出一件不良都没有的概率约 31.3%,二项给 36.4%,差 5 个百分点;批量换成 5000 件、不良率同为 2% 时,两者分别约 36.2% 和 36.4%,几乎重合。经验口径是抽样比不超过 5% 再放心用二项。
二项分布和泊松分布的期望、方差公式分别是什么?
二项分布的期望 E(X)=np,方差 Var(X)=np(1−p),标准差是它的平方根。n=50、p=2% 时期望是 1 件,标准差约 0.99 件。泊松分布更特别,期望和方差都等于 λ,标准差为 √λ,所以 λ=9 时标准差正好是 3。反过来也能用这一点做体检:若一组计数数据的样本方差明显大于均值,说明事件之间并不独立,未必适合直接套泊松分布。
双色球中一等奖的概率怎么算,买 100 注概率是多少?
双色球从 33 个红球里选 6 个、再从 16 个蓝球里选 1 个,组合数为 C(33,6)×16 = 1107568×16 = 17721088 种,单注中一等奖的概率约为 1/1772 万。同一期买 100 注不同号码属于互斥事件,概率直接相加,约为 100/17721088 ≈ 0.00056%;而连续 100 期每期买 1 注属于独立重复试验,要用 1−(1−p)¹⁰⁰ 计算,两种问法的算法不能混用。

用到的计算器

相关指南

来源与更新

文中公式为通用概率论算法:二项分布概率质量函数 P(X=k)=C(n,k)pᵏ(1−p)ⁿ⁻ᵏ, 泊松分布 P(X=k)=λᵏe^(−λ)÷k!(式中 e 为自然常数),正态分布采用标准正态累积函数 Φ(z)。 本文不含税率、利率、社保等时效性参数,无需登记政策日历;算例检索并复核于 2026-09-23。

所有算例均按高精度浮点计算后四舍五入,标注为估算值。抽检场景里「这批货接不接收」由 GB/T 2828.1 计数抽样检验程序或供需双方约定的抽样方案判定,标准原文可在国家标准全文公开系统查询;本文只计算概率,不替代验收判定口径,实际执行以标准与合同约定为准。

最近更新 2026-09-23

本文为概率分布选型与计算的学习参考,算例结果为估算;抽检验收、质量判定与彩票规则以相关标准、企业方案及官方公告为准。