二项分布、泊松分布还是正态分布?分布选型与实算
一道概率题最难的常常不是代公式,而是判断该用哪个分布。二项分布描述试验次数 n 固定、每次只有成功失败两种结果时成功次数的分布;泊松分布描述单位时间或单位空间内事件发生次数的分布,只需要一个平均次数 λ;正态分布描述连续数值围绕均值的钟形分布。选错分布,后面每一步都白算。
三个分布怎么分:先问自己在数什么
选分布只看两件事:结果是「个数」还是「数值」,以及试验次数写不写得出来。 个数加上固定次数,走二项分布;个数但次数没有上限,走泊松分布;连续数值,走正态分布。 这一步判对了,剩下的就是把参数填进计算器。
二项分布问的是「50 次里中几次」,泊松分布问的是「这 10 分钟里来几个」,正态分布问的是「这个数值落在哪一段」。
先分「数次数」还是「量数值」
不良件数、来电通数、进球个数都是整数,属于离散型,只能由二项或泊松描述; 配送时长、体重、加工尺寸这些可以取到小数点后任意位的量是连续型,由正态分布描述。 混用的典型后果是:拿正态分布去问「恰好 30 件不良的概率」,答案永远是 0,因为连续分布的单点概率就是 0。
再看试验次数固定不固定
同样是数次数,「抽 50 件」的 n 明确等于 50,每件要么不良要么合格,这是标准的伯努利重复试验; 而「晚高峰平均每 10 分钟 3 通电话」根本说不清一共有多少次机会,只能用单位区间的平均次数 λ 来刻画。 下面这张表把常见情形和对应工具对齐,拿不准时照着对号入座。
| 你手上有的信息 | 该用的分布 | 关键参数 | 典型问法 |
|---|---|---|---|
| 试验次数 n 固定、每次成败独立、单次成功率 p 已知 | 二项分布 | n、p | 抽 50 件里有几件不良 |
| 只知道单位时间或单位区间的平均发生次数,次数无上限 | 泊松分布 | λ | 10 分钟内来几通电话 |
| 连续测量值,且有均值与标准差 | 正态分布 | μ、σ | 配送时长超过 40 分钟的比例 |
| 从有限批量里不放回抽取,且抽样比偏大 | 超几何分布(抽样比小时可用二项近似) | 批量 N、不良数 D、抽样数 n | 200 件里含 4 件不良,抽 50 件 |
| 只问单个事件发生与否,不数次数 | 古典概率 | 有利数、总数 | 掷一次骰子出 6 的概率 |
超几何分布本站暂未单独成页,抽样比小于 5% 时按二项分布计算,误差通常可忽略。
把上面的判断压缩成可执行的四步,照着走一遍基本不会选错:
- 先分清在数次数还是在量数值:结果是 0、1、2 这类整数就走二项或泊松;是时长、重量这类连续量就走正态分布。
- 再看试验次数是不是固定的:n 写得出来用二项;只说得出「平均多少次」、次数没有上限的用泊松。
- 把参数对齐到同一个口径:p 必须是单次试验的成功率,λ 必须和问题里的时间窗一致,换算窗口时 λ 要同比缩放。
- 算完回头验一次期望:二项 E=np,泊松 E=λ。算出的期望和现实量级差太远,多半是分布选错或参数没对齐。
次数固定:抽检 50 件怎么算
试验次数固定时用二项分布,核心公式把「选哪几次成功」和「每次的概率」两部分相乘。 从 n 次里挑出 k 次成功,有 C(n,k) 种选法,每种选法的概率都是 pᵏ(1−p)ⁿ⁻ᵏ。
拿一个真实场景试试:一批货的不良率 p=2%,抽检 n=50 件,想知道抽到 0 件、1 件、2 件不良分别是多大概率。 以 k=2 为例,C(50,2)=1225,代入得 1225×0.02²×0.98⁴⁸≈18.58%。
| 不良件数 k | 恰好 k 件的概率 | 至多 k 件的累积概率 |
|---|---|---|
| 0 件 | 约 36.42% | 约 36.42% |
| 1 件 | 约 37.16% | 约 73.58% |
| 2 件 | 约 18.58% | 约 92.16% |
| 3 件 | 约 6.07% | 约 98.23% |
n=50、p=2% 的二项分布,结果为估算并四舍五入到小数点后两位。
最常被问的其实是反过来那一问:至少有 1 件不良的概率。 直接用 1 − P(X=0) = 1 − 0.98⁵⁰ ≈ 63.58%。 也就是说,2% 的不良率看着很低,抽 50 件却有六成多的机会至少碰上一件。
打开「二项分布计算器」恰好与累积成功概率·区间·期望方差组合数 C(50,2) 从哪来
公式里的 C(n,k) 就是组合数,表示从 n 个里不计顺序地选出 k 个的方案数。 n 一大,手算阶乘立刻溢出,比如 C(50,25) 已经是 15 位数。 这一步交给排列组合计算器最稳妥,它用大整数精确计算,不会因为浮点误差丢精度。
单独算一下组合数 C(n,k)大数精确,不丢精度恰好、至多、至少三种问法别混
同一组 n 和 p,问法不同要取的数完全不同。 「恰好 2 件」取单点概率 18.58%,「至多 2 件」要把 k=0、1、2 三项加起来得 92.16%, 「至少 3 件」则是 1 减去至多 2 件,约 7.84%。 验收场景里真正有用的往往是后两种:约定不良品超过 2 件就退整批,那 7.84% 就是这批货被退回的概率。 填计算器时先想清楚自己问的是哪一种,比记公式更要紧。
期望和方差怎么读
二项分布的期望 E(X)=np,方差 Var(X)=np(1−p)。 本例期望是 50×2%=1 件,标准差约 0.99 件,意思是「抽 50 件平均碰上 1 件不良,上下浮动 1 件左右都很正常」。 把这个量级记在心里,算出来的概率离谱不离谱,一眼就能看出来。
只有平均次数:客服热线怎么算
当你只知道「平均每段时间发生几次」、说不出总共试了多少次时,用泊松分布。 它只要一个参数 λ,即同一观察区间内的平均发生次数。
设某客服团队晚高峰平均每 10 分钟接到 3 通电话,即 λ=3。 代入公式可得:这 10 分钟一通都没有的概率约 4.98%,恰好 3 通约 22.40%,恰好 5 通约 10.08%, 至多 1 通(用于判断要不要留人值守)约 19.91%。
- λ 的含义
- 同一观察区间内的平均发生次数,必须和问题的时间窗一致。
- λ 怎么估
- 历史总次数 ÷ 区间个数,例如 5 天共 90 通、30 个 10 分钟窗口,λ=3。
- 期望
- E(X)=λ,本例为 3 通。
- 方差
- Var(X)=λ,泊松分布的期望与方差相等,这是它的识别特征。
- 标准差
- √λ,λ=9 时标准差正好是 3 通。
- 适用前提
- 事件彼此独立、发生率稳定,不能有明显的扎堆或相互触发。
λ 怎么从历史数据估出来
λ 不是拍脑袋定的,它来自历史记录:把观察期内的总发生次数,除以同等长度的区间个数。 接着上面的例子,若连续 5 个工作日记录晚高峰话务,每天划成 6 个 10 分钟窗口、合计 30 个窗口, 期间共接 90 通电话,那么 λ = 90 ÷ 30 = 3 通/10 分钟。 样本窗口越多,λ 越稳;窗口太少时估出来的 λ 波动大,算出的概率只能当量级参考。 还要留意口径一致:若统计里混进了非高峰时段,得到的其实是被稀释过的平均值,不能拿来算晚高峰。
换时间窗时 λ 要跟着变
问题从 10 分钟换成半小时,λ 不能照抄。 观察区间放大 3 倍,平均次数也放大 3 倍,λ 从 3 变成 9。 此时「半小时接到至少 10 通电话」的概率约 41.26%,标准差是 √9=3 通。
n 大到算不动:两种近似谁更贴
n 上千时二项分布要累加上千项,手算不现实,于是有了泊松近似和正态近似两条路。 两者条件不同,误差方向也不同,用错反而比不近似更偏。
用同一道题横向比一次:抽检 n=1000 件、不良率 p=2%,问不良件数达到 31 件及以上的概率。 期望 np=20 件,标准差 √(1000×0.02×0.98)≈4.43 件。
| 算法 | 参数取值 | 结果 | 与精确值的差 |
|---|---|---|---|
| 二项分布(精确) | n=1000, p=2% | 约 1.26% | — |
| 泊松近似 | λ=np=20 | 约 1.35% | 高约 0.09 个百分点 |
| 正态近似(含 ±0.5 修正) | μ=20, σ≈4.43,分界取 30.5 | 约 0.89% | 低约 0.37 个百分点 |
同一道题三种算法对比,结果均为估算;p 很小时分布右偏,正态近似的右尾误差更明显。
结论很清楚:p 小、分布右偏时泊松近似更贴,正态近似会低估右尾。 课本常说「n 大就能用正态近似」,但没提这个前提——p 离 0.5 越远,偏差越值得当回事。
泊松近似:n 大、p 小
经验条件是 n≥20 且 p≤0.05,取 λ=np。 前面 n=50、p=2% 那道题,二项算至少 1 件不良是 63.58%,泊松近似给 63.21%,差距不到 0.4 个百分点,完全够用。 但 p 接近 0.5 时就不行了:n=20、p=0.5 时二项 P(X=10)≈17.62%,硬套 λ=10 的泊松只有约 12.51%,差了 5 个百分点。
正态近似:为什么要 ±0.5
正态近似的条件通常写作 np≥5 且 n(1−p)≥5,即两侧都有足够多的期望次数。 因为二项是离散的、正态是连续的,整数 30 要摊成 29.5 到 30.5 这一段,这步叫连续性修正。 算 P(X≥31) 就以 30.5 作分界,漏掉这半格,短区间的概率会明显失真。
打开「正态分布计算器」概率密度·累积概率·区间概率·z分数与分位数「至少一次」怎么算最省事
「至少一次」不要正面硬算,用补事件最快:至少发生一次 = 1 − 一次都不发生。 一次都不发生的概率是 (1−p)ⁿ,所以整个式子非常短。
单次概率 1%、连着试 100 次,结果是 1 − 0.99¹⁰⁰ ≈ 63.40%,而不是直觉上的「试满 100 次总该中一回」。 这个数和前面泊松近似给的 63.21%(λ=np=1)几乎一致,正好互为验算。
反过来求:要抽多少件才有九成把握
这个公式更实用的用法是反解 n——不问「抽 50 件能不能发现问题」,而问「要抽多少件才够」。 把不等式 1 − (1−p)ⁿ ≥ 目标把握度移项,两边取对数即可。
仍设不良率 p=2%,想有九成把握至少发现 1 件不良,代入得 n ≥ ln(0.10) ÷ ln(0.98) ≈ 113.97, 向上取整要抽 114 件;把标准提到九成五,需要 ln(0.05) ÷ ln(0.98) ≈ 148.28,即 149 件。 从九成提到九成五,抽检量要多三成,这也是抽样方案里把握度不能随口定高的原因。
互斥相加与独立相乘别混用
同一个「中奖概率」,问法不同算法完全不同。 双色球从 33 个红球选 6 个、再从 16 个蓝球选 1 个,方案数 C(33,6)×16 = 1107568×16 = 17721088 种,单注中一等奖约 1/1772 万。 同一期买 100 注不同号码是互斥事件,概率直接相加,约 100/17721088 ≈ 0.00056%; 连续 100 期每期买 1 注是独立重复试验,得用 1−(1−p)¹⁰⁰ 算。
算一算至少发生一次的概率支持交并事件与重复试验五个最容易算错的地方
分布选对之后,出错通常集中在参数口径上。下面五个坑,前四个都能靠核对参数避开。
三个分布本来就是一家人
很多人把二项、泊松、正态当成三套互不相干的公式背,其实它们同源。 二项分布在 n 趋大、p 趋小而 np 保持不变时,极限就是参数为 λ=np 的泊松分布; 在 n 趋大而 p 不太靠近两端时,极限则是均值 np、方差 np(1−p) 的正态分布。 理解这层关系有个直接好处:近似不是「换了个公式」,而是同一个分布在不同极限下的简写, 所以近似条件说白了就是在问「现在离哪个极限更近」。
照着选型四步把分布定下来,再把 n、p 或 λ 填进对应的计算器,恰好、至多、至少几种概率连同期望方差一次就能出来。
常见问题
- 二项分布和泊松分布有什么区别,什么时候该用哪个?
- 区别在于试验次数是否固定。二项分布需要两个参数 n 和 p,适用于「抽 50 件、每件不良率 2%」这类次数写得出来、每次只有成败两种结果的场景;泊松分布只要一个 λ,适用于「晚高峰平均每 10 分钟来 3 通电话」这类单位时间或单位空间内的计数,次数理论上没有上限。判断口诀是:能明确说出「一共试了多少次」就用二项,只能说出「平均多少次」就用泊松。
- 泊松分布的 λ 怎么求,可以小于 1 吗?
- λ 是同一观察区间内的平均发生次数,用历史数据的总次数除以区间个数即可。比如 5 个工作日晚高峰共接 90 通电话、每天统计 6 个 10 分钟窗口,λ = 90 ÷ 30 = 3 通/10 分钟。λ 完全可以小于 1,例如「平均每年 0.3 次设备故障」,此时 P(X=0)=e^(−0.3)≈74.1%,说明多数年份一次都不出。关键是 λ 和问题问的时间窗必须是同一个口径。
- 二项分布什么时候可以用泊松分布近似,条件是什么?
- 常用的经验条件是 n 较大、p 较小,教材多取 n≥20 且 p≤0.05,近似时令 λ=np。以 n=50、p=2% 为例,二项算出至少 1 件不良约 63.6%,泊松近似约 63.2%,差距不到 0.5 个百分点。但 p 接近 0.5 时近似会失真:n=20、p=0.5 时二项 P(X=10)≈17.6%,硬套 λ=10 的泊松只有约 12.5%,差了 5 个百分点。
- 二项分布用正态分布近似时,为什么要加减 0.5?
- 因为二项分布是离散的、正态分布是连续的。离散分布问「恰好 30 件」有确定概率,连续分布里任何单点概率都是 0,所以要把整数 30 摊成区间 29.5 到 30.5,这一步叫连续性修正。算 P(X≥31) 就用 30.5 作分界。近似的前提通常要求 np≥5 且 n(1−p)≥5;p 很小时分布右偏,正态近似的尾部误差仍然偏大。
- 「至少一次」的概率怎么算,为什么不等于 n 乘以 p?
- 用补事件:至少发生一次的概率 = 1 − 一次都不发生的概率 = 1 − (1−p)ⁿ。单次中奖率 1%、连着抽 100 次,结果是 1 − 0.99¹⁰⁰ ≈ 63.4%,而不是 100×1% 推出的「必然中」。n×p 算的是平均发生次数(期望),当 p 很小、n×p 远小于 1 时它才勉强接近概率;只要 n×p 超过 1,这个算法就会给出超过一的概率,显然不成立。
- 抽检 50 件算不良品概率,该用二项分布还是超几何分布?
- 严格说不放回抽样属于超几何分布,但抽样比很小时用二项分布近似误差可以忽略。批量 200 件含 4 件不良、抽 50 件(抽样比 25%),超几何算出一件不良都没有的概率约 31.3%,二项给 36.4%,差 5 个百分点;批量换成 5000 件、不良率同为 2% 时,两者分别约 36.2% 和 36.4%,几乎重合。经验口径是抽样比不超过 5% 再放心用二项。
- 二项分布和泊松分布的期望、方差公式分别是什么?
- 二项分布的期望 E(X)=np,方差 Var(X)=np(1−p),标准差是它的平方根。n=50、p=2% 时期望是 1 件,标准差约 0.99 件。泊松分布更特别,期望和方差都等于 λ,标准差为 √λ,所以 λ=9 时标准差正好是 3。反过来也能用这一点做体检:若一组计数数据的样本方差明显大于均值,说明事件之间并不独立,未必适合直接套泊松分布。
- 双色球中一等奖的概率怎么算,买 100 注概率是多少?
- 双色球从 33 个红球里选 6 个、再从 16 个蓝球里选 1 个,组合数为 C(33,6)×16 = 1107568×16 = 17721088 种,单注中一等奖的概率约为 1/1772 万。同一期买 100 注不同号码属于互斥事件,概率直接相加,约为 100/17721088 ≈ 0.00056%;而连续 100 期每期买 1 注属于独立重复试验,要用 1−(1−p)¹⁰⁰ 计算,两种问法的算法不能混用。