二项分布计算器
二项分布计算器用于计算独立重复试验中的成功次数概率。输入试验次数 n、单次成功概率 p 与成功次数 k,即可得到恰好、最多、少于、至少、多于 k 次及区间成功概率,并查看期望、方差与标准差。
给一个成功次数 k,同时算出「恰好 k 次」以及最多 / 少于 / 至少 / 多于 k 次这四个方向的累积概率。切换模式时试验次数 n 与成功概率 p 会保留,k 与 a、b 各自保留、互不带值。
独立重复做了多少次同样的试验:掷 10 次硬币填 10,抽检 100 件填 100。 本页最大支持 10000;更大的 n 请改用正态近似(np ≥ 5 且 n(1−p) ≥ 5 时近似良好)。
只填 0 到 1 的小数,本页没有百分比开关:30% 请填 0.3, 2% 不良率请填 0.02,均匀硬币填 0.5。 这个 p 必须是每一次试验都相同的那个概率。
你关心的成功次数,需满足 0 ≤ k ≤ n。k 必须是整数:填 2.5 本页直接报错,不像 Excel BINOM.DIST 那样悄悄截尾成 2 再给个答案。
做 10 次独立试验、每次成功概率都是同一个 p,恰好成功 6 次的概率是 0.205078125;最多 6 次(含 6)的概率是 0.828125, 至少 6 次(含 6)的概率是 0.376953125。这批试验平均会成功 5 次。
分布整体(描述这批 n = 10 次试验的整条分布,与上面填的 k无关):
读结果前先看这几条口径:① 四个累积量是四个不同的量,端点已写进标签——「最多 k 次」含 k, 「少于 k 次」不含 k,「至少 k 次」含 k,「多于 k 次」不含 k;区间模式的 P(a ≤ X ≤ b) 含 a 也含 b(与 Excel BINOM.DIST.RANGE 一致)。 ② 概率显示到 10 位小数,非常接近 1 的累积概率会显示成 1——那不是等于 1, 只是这个位数看不出差别;要读那个极小的差,请看它互补的另一侧尾概率(例如 P(X ≤ 99) 显示 1 时,去看 P(X > 99) = 7.888609052e-31)。 ③ 小于 0.0001 的概率改用 10 位有效数字显示(如 7.888609052e-29),任何真实大于 0 的概率都不会显示成 0;个别极小值超出普通浮点数的表示范围时, 本页仍给出真值并标注「该值大于 0」。 ④ 期望、方差、标准差描述的是整个分布,与你填的 k 无关,所以它们单列在 「分布整体」一节,改 k 时这三个数不变。 ⑤ 三条模型前提:n 次试验相互独立、每次成功概率都是同一个 p、有放回抽样(或总体足够大、抽样比 n/N ≤ 5% 以致无放回的影响可忽略)。 不满足就不是二项分布:无放回小总体应改用超几何分布,每次 p 不同应改用泊松二项分布, 两者本页都不做。
怎么用
- 先分清要算「恰好」还是「一段区间」:问「恰好成功 k 次的概率是多少」选「单点:恰好 k 次」,它会同时给出恰好 k 次,以及最多 k 次(含 k)、少于 k 次(不含 k)、至少 k 次(含 k)、多于 k 次(不含 k)这四个方向的累积概率。问「成功次数落在 a 到 b 次之间的概率是多少」选「区间:a 到 b 次」,区间含两端。两个模式共用试验次数 n 与成功概率 p,切换时不会清空。
- 填试验次数 n:n 是独立重复做了多少次同样的试验:掷 10 次硬币填 10,抽检 100 件产品填 100,抽 10 次卡填 10。n 必须是 1 到 10000 之间的整数。更大的 n 本页会明确报错而不是硬算,此时实务上应改用正态近似(np ≥ 5 且 n(1−p) ≥ 5 时近似良好)或泊松近似。
- 填单次成功概率 p,只填小数:p 是每一次试验成功的概率,只接受 0 到 1 之间的小数,本页没有百分比开关:30% 请填 0.3,2% 的不良率填 0.02,均匀硬币填 0.5,抽卡单抽 3% 填 0.03。填成 30 或 30% 会直接报错并提示换算方式。这个 p 必须是每一次试验都相同的那一个概率——分批次、分机台各不相同时不能用二项分布。
- 填成功次数 k(或区间端点 a、b):k 是你关心的成功次数,需满足 0 ≤ k ≤ n,且必须是整数:填 2.5 本页直接报错,不像 Excel 的 BINOM.DIST 那样悄悄截尾成 2 再给一个看似正常的答案。区间模式填 a 与 b,需满足 a ≤ b;填反了本页报错,不会替你对调。任何一栏留空都会报错,不会被当作 0、0.5 或 n。
- 读结果:先看大字,再看四个累积量:大字是主答案——单点模式给 P(X = k),区间模式给 P(a ≤ X ≤ b)。下面的表格逐条列出四个累积方向,每一个都把端点写进了标签,不会只写「累积概率」让你猜含不含 k。概率显示到 10 位小数,小于 0.0001 时改用 10 位有效数字(如 7.888609052e-29),任何真实大于 0 的概率都不会显示成 0。
- 用「分布整体」三个数交叉验证:结果区底部单列期望 E(X) = np、方差 D(X) = np(1−p) 与标准差 σ。它们描述的是整条分布,与你填的 k 无关,改 k 时这三个数不变。用它们可以快速判断结果是否合理:算出来的 k 若离 np 有三四个 σ 那么远,对应的概率就应该很小;n = 100、p = 0.5 时 np = 50、σ = 5,k = 99 离均值近 10 个 σ,概率 7.9e-29 正与之相称。
核心要点
二项分布计算器回答的是:在 n 次相互独立、成功概率均为 p 的试验中,成功次数落在指定位置或区间的概率。以掷 10 次均匀硬币为例,恰好出现 6 次正面的概率是 0.205078125(约 20.51%),而最多 6 次(含 6 次)的概率是 0.828125;「恰好」只取一项, 「最多」则累加 0 到 6 次,问法不同,结果也不同。
- 公式:
P(X = k) = C(n,k)·pᵏ·(1−p)ⁿ⁻ᵏ,k = 0, 1, …, n。累积就是把对应的那些项加起来。 - 四个累积量互不相同:还是
n = 10、p = 0.5、k = 6,P(X ≤ 6) = 0.828125(含 6)、P(X < 6) = 0.623046875(不含 6)、P(X ≥ 6) = 0.376953125(含 6)、P(X > 6) = 0.171875(不含 6)。 - 区间含两端:
n = 10、p = 0.3、 成功次数落在 2 到 4 次之间的概率P(2 ≤ X ≤ 4) = 0.7004233215,与 ExcelBINOM.DIST.RANGE的口径一致。 - 期望与方差:
E(X) = np、D(X) = np(1−p)、σ = √(np(1−p))。 它们描述整条分布,与你填的 k 无关。 - 易错点:
p只填 0~1 的小数(30% 填0.3);「至少 6 次」含 6 而「多于 6 次」不含 6;非常接近 1 的累积概率会显示成 1,那不是等于 1,要读那个极小的差请看另一侧尾概率(P(X ≤ 99)显示 1 时,看P(X > 99) = 7.888609052e-31)。
原理与公式
二项分布(binomial distribution)描述这样一件事:一次试验只有「成功 / 失败」 两种结果,成功的概率固定为 p,把这样的试验独立地重复 n 次(所谓 n 重伯努利试验),那么成功次数 X 服从参数为 n、p 的二项分布,记作 X ~ B(n, p)。 它是离散分布:X 只能取 0、1、…、n 这 n+1 个整数值。
概率质量函数(恰好 k 次)
P(X = k) = C(n,k)·pᵏ·(1−p)ⁿ⁻ᵏ,其中 C(n,k) = n! / (k!·(n−k)!) 是组合数(二项式系数), 表示「n 次里哪 k 次成功」共有多少种排法。需要单独算一个精确的大整数组合数时, 请用二项式系数计算器或排列组合计算器——本页把 C(n,k) 当作公式内部的一环,不单独作为结果输出。
四个累积方向
每一个都是把属于它的那些项加起来,端点是否包含在内一定要看清:
P(X ≤ k) = Σᵢ₌₀ᵏ P(X = i)——最多 k 次,含 k。P(X < k) = Σᵢ₌₀ᵏ⁻¹ P(X = i)——少于 k 次,不含 k;k = 0时是空和,精确等于 0。P(X ≥ k) = Σᵢ₌ₖⁿ P(X = i)——至少 k 次,含 k。P(X > k) = Σᵢ₌ₖ₊₁ⁿ P(X = i)——多于 k 次,不含 k;k = n时是空和,精确等于 0。- 区间:
P(a ≤ X ≤ b) = Σᵢ₌ₐᵇ P(X = i),含 a 也含 b。
期望、方差与标准差
E(X) = np,D(X) = np(1−p),σ = √(np(1−p))。把 X 拆成 n 个 0-1 变量之和即可推出: 期望恒可加,方差在独立时可加。这三个数描述整条分布,与当前的 k 无关。
三个算例(可逐步手算核对)
- 掷 10 次均匀硬币,恰好 6 次正面:
n = 10、p = 0.5、k = 6。C(10,6) = 210,0.5¹⁰ = 1/1024,P(X = 6) = 210/1024 = 0.205078125;P(X ≤ 6) = 848/1024 = 0.828125、P(X < 6) = 638/1024 = 0.623046875、P(X ≥ 6) = 386/1024 = 0.376953125、P(X > 6) = 176/1024 = 0.171875;E(X) = 5、D(X) = 2.5、σ = 1.5811388301。 - 抽检 5 件、不良率 20%,恰好 2 件不良:
n = 5、p = 0.2、k = 2。C(5,2) = 10,P(X = 2) = 10 × 0.2² × 0.8³ = 10 × 0.04 × 0.512 = 0.2048;P(X ≤ 2) = 0.94208、P(X > 2) = 0.05792;E(X) = 1、D(X) = 0.8、σ = 0.894427191。把p与1−p弄反会得到 0.0512,一眼可辨。 - 做 10 次、单次成功率 30%,成功 2 到 4 次:
n = 10、p = 0.3、a = 2、b = 4。P(2 ≤ X ≤ 4) = 0.2334744405 + 0.266827932 + 0.200120949 = 0.7004233215;两侧尾概率P(X < 2) = 0.1493083459、P(X > 4) = 0.1502683326,三段相加恰为 1;E(X) = 3、D(X) = 2.1、σ = 1.4491376746。
适用前提
三条缺一不可:① n 次试验相互独立;② 每次的成功概率都是同一个 p;③ 有放回抽样, 或总体足够大(抽样比 n/N ≤ 5%)以致无放回的影响可忽略。 不满足就不是二项分布:无放回的小总体应改用超几何分布,每次 p 不同应改用泊松二项分布,两者本页都不做。 n 很大且 np ≥ 5、n(1−p) ≥ 5 时可以用正态分布近似(本页只做精确计算, 不输出近似值);要从样本反推总体比例的区间,请用置信区间计算器—— 本页是已知 p 正推概率,不做统计推断、不出 p 值与显著性判读。 只需要「全成功 / 全失败 / 至少一次」这三种特例,用概率计算器更快。
精度与显示口径
全程使用高精度十进制运算(40 位有效数字),概率显示到 10 位小数; 小于 0.0001 的概率改用 10 位有效数字显示(如 7.888609052e-29)。四个累积量各自从自己那一侧直接求和, 不用「1 减去另一侧」——后者在远尾会把有效数字全部相消掉:n = 100、p = 0.5、k = 99 时P(X > 99) = 2⁻¹⁰⁰ = 7.888609052e-31, 若用 1 − P(X ≤ 99) 去算会得到一个精确的 0。也正因如此,非常接近 1 的累积概率会显示成 1,那只是 10 位小数看不出差别,不代表等于 1;要读那个极小的差,请看它互补的另一侧尾概率。n 的上限是 10000,k、a、b 必须是 0 到 n 之间的整数,p 必须是 0 到 1 之间的小数(端点合法,此时分布退化为一个点、方差为 0)。 所有计算在浏览器本地完成,不上传数据。
常见问题
- 二项分布的概率怎么算?公式 C(n,k)pᵏ(1−p)ⁿ⁻ᵏ 里每一项是什么意思?
- 公式是 P(X = k) = C(n,k) × pᵏ × (1−p)ⁿ⁻ᵏ,三部分各有分工:pᵏ 是「指定的那 k 次全成功」的概率,(1−p)ⁿ⁻ᵏ 是「剩下 n−k 次全失败」的概率,两者相乘得到某一种具体成败排列的概率;C(n,k) 是组合数,表示「哪 k 次成功」有多少种排法,把所有排法数起来就得到总概率。举个能手算的例子:掷 10 次均匀硬币恰好 6 次正面,C(10,6) = 210,p⁶(1−p)⁴ = 0.5¹⁰ = 1/1024,所以 P = 210 ÷ 1024 = 0.205078125,约 20.51%。再看一个不对称的:抽检 5 件、不良率 0.2,恰好 2 件不良的概率是 C(5,2) × 0.2² × 0.8³ = 10 × 0.04 × 0.512 = 0.2048。注意 p 与 1−p 不能对调,把上例的 0.2 与 0.8 弄反会得到 0.0512,差了 4 倍。
- 二项分布里「恰好 k 次」「最多 k 次」「至少 k 次」的概率有什么区别,算出来为什么差这么多?
- 它们是四个不同的量,差别全在端点上。以掷 10 次硬币、k = 6 为例:恰好 6 次 P(X = 6) = 0.205078125,只数 k = 6 这一项;最多 6 次 P(X ≤ 6) = 0.828125,把 k = 0 到 6 共七项全加起来,含 6;少于 6 次 P(X < 6) = 0.623046875,只加到 k = 5,不含 6;至少 6 次 P(X ≥ 6) = 0.376953125,从 6 加到 10,含 6;多于 6 次 P(X > 6) = 0.171875,从 7 加到 10,不含 6。可以验算:P(X ≤ 6) + P(X > 6) = 1,P(X ≤ 6) − P(X < 6) = P(X = 6)。做题时最容易错的就是「至少」与「多于」:中文里「至少 6 次」含 6,「超过 6 次」「多于 6 次」不含 6,一字之差结果从 0.377 变成 0.172。本页把四个量同屏给出,每个标签都写明含不含端点,不必自己换算。
- 二项分布的期望和方差是多少?为什么是 np 和 np(1−p)?
- 期望 E(X) = np,方差 D(X) = np(1−p),标准差 σ = √(np(1−p))。推导很直观:把 X 拆成 n 个只取 0 或 1 的伯努利变量之和 X = X₁ + … + Xₙ,每个 Xᵢ 的期望是 p、方差是 p(1−p);期望永远可加,所以 E(X) = np;n 次试验相互独立时方差也可加,所以 D(X) = np(1−p)。代两个数:掷 10 次均匀硬币,E(X) = 10 × 0.5 = 5 次、D(X) = 2.5、σ ≈ 1.5811388301;抽检 100 件、不良率 2%,平均出 2 件不良,σ = √(100×0.02×0.98) ≈ 1.4。有两点常被忽略:一是方差在 p = 0.5 时最大、在 p 趋近 0 或 1 时趋于 0(p = 0 或 1 时分布退化成一个点,方差精确为 0);二是这三个数描述的是整条分布,与你当前算的那个 k 没有关系,换个 k 它们不会变。
- 什么情况下能用二项分布?无放回抽样、每次概率不一样该怎么办?
- 三个前提缺一不可:① n 次试验相互独立,前一次的结果不影响后一次;② 每一次的成功概率都是同一个 p;③ 有放回抽样,或者总体足够大以致无放回的影响可忽略(经验判据是抽样比 n/N ≤ 5%,例如从 10000 件里抽 100 件可以按二项分布算,从 20 件里抽 5 件不行)。不满足时该换模型:无放回的小总体抽样用超几何分布,硬套二项分布会低估方差、把风险算得偏小;每批次、每台机器的 p 各不相同用泊松二项分布;试验之间彼此影响(例如前道工序失败会抬高后道失败率)则二项分布整个不适用。另外还有两种常见近似:n 很大而 p 很小(np 在 10 以内)时可用 λ = np 的泊松分布近似;n 很大且 np ≥ 5、n(1−p) ≥ 5 时可用正态分布近似。本页只做二项分布的精确计算,不做这些近似与替代分布。
- Excel 算二项分布用 BINOM.DIST,第四个参数填 TRUE 还是 FALSE?和本页结果对不上是为什么?
- 第四个参数 cumulative 决定算哪一个量:填 FALSE 得到概率质量函数,也就是「恰好成功 k 次」;填 TRUE 得到累积分布函数,也就是「最多 k 次(含 k)」。所以 =BINOM.DIST(6,10,0.5,FALSE) = 0.2050781 对应本页的 P(X = 6),=BINOM.DIST(6,10,0.5,TRUE) = 0.828125 对应 P(X ≤ 6)。区间用 BINOM.DIST.RANGE(n, p, a, b),含 a 也含 b,与本页的区间模式口径一致。结果对不上通常是三种情况:一是 TRUE/FALSE 选反了,把「最多」当成了「恰好」;二是 p 填成了百分数(填 30 而不是 0.3),本页会直接报错,Excel 则返回 #NUM!;三是 k 填了小数——Excel 会把 number_s 与 trials 截尾取整后照算,本页认为静默改写输入比报错更危险,所以直接报错。还有一个显示差异:Excel 单元格默认只显示几位小数,远尾概率容易被显示成 0,本页显示到 10 位小数、极小值改用有效数字,不会把真实大于 0 的概率印成 0。
- 二项分布计算器的累积概率为什么显示为 1,数学上真的等于 1 吗?
- 不是。本页概率显示到 10 位小数,凡是与 1 的差别小于 5×10⁻¹¹ 的数都会显示成 1,但它在数学上仍严格小于 1。例子:n = 100、p = 0.5、k = 99 时,P(X ≤ 99) 显示为 1,可它其实是 1 − 2⁻¹⁰⁰,差了约 7.9×10⁻³¹。要读这个极小的差,请看它互补的那一侧尾概率——同一屏上的 P(X > 99) = 7.888609052e-31 就是它。这也是本页坚持四个累积量各自从自己那一侧直接求和、而不是用「1 减去另一侧」的原因:后者在这种量级下会把 7.9e-31 整个吃掉、返回一个精确的 0。真正等于 1 的情况只有两种:P(X ≤ n)、P(X ≥ 0) 这类覆盖全部取值的量,以及 p = 0 或 p = 1 的退化分布。