置信区间计算器

输入样本均值、标准差、样本量或粘贴原始数据,即可计算总体均值与总体比例的 90%、95%、99% 置信区间,并查看误差幅度、临界值和 Wilson 区间。

身高、成绩、耗时、金额等连续数值的平均水平,用 x̄ ± 临界值 × 标准误。

置信水平越高区间越宽。95% 是论文与报告的默认口径,医学、质量控制常用 99%。

已知均值、标准差、样本量时直接填三个数。

默认选它:总体标准差 σ 未知、用样本 s 代替时,临界值取自由度 n−1 的 t 分布。

不知道标准差可先用标准差计算器算出来再填这里。

t 分布需要 n ≥ 2(自由度 df = n − 1);n 必须是整数,上限 9007199254740991。

95% 置信区间(总体均值 μ)
93.808304 ~ 106.191696

点估计 100 ± 误差幅度 6.191696,临界值 t* = 2.063899(df = 24)

含义:按同样方法反复抽样,约 95% 的区间会盖住真实的总体均值;不是「真值有 95% 的概率落在这个区间」。

点估计100
样本量 n25
标准误 SE3
误差幅度 E6.191696
临界值 t*2.063899
自由度 df24
下限93.808304
上限106.191696
区间宽度12.383391
显著性水平 α0.05
单尾概率 α/20.025
标准差15

怎么用

  1. 选估计对象:总体均值还是总体比例数据是身高、成绩、耗时、金额这类连续数值,要估计平均水平,选「总体均值 μ」;数据是「支持/不支持」「合格/不合格」这类计数占比,选「总体比例 p」。两者的标准误公式不同,选错会算出偏大或偏小的区间。
  2. 选置信水平点 90%、95%、99% 任一档,或点「自定义」填 80、98、99.9 等。95% 是论文、报告、行业调查的默认口径;医学试验与质量控制常用 99%。置信水平越高,区间越宽——想更有把握,就得接受更粗的结论。
  3. 填样本信息估计均值时,可直接填样本均值 x̄、标准差 s、样本量 n;也可切到「粘贴原始数据」,把一列数字(逗号、空格或换行分隔)贴进来,工具会自动算出 x̄、样本标准差 s 和 n,并按 t 分布出区间。估计比例时,填成功次数 x 与样本量 n,例如 100 人里 45 人支持就填 45 和 100。
  4. 选 t 分布还是 z 分布估计均值时默认用 t 分布:总体标准差 σ 未知、只能用样本标准差 s 代替,临界值就取自由度 df = n − 1 的 t 值。只有 σ 真的已知(由历史数据、行业标准或仪器精度给定,而不是这批样本算出来的)才切到 z,并在标准差栏填这个已知的 σ。「粘贴原始数据」模式只能算出样本 s,因此固定用 t,不提供 z 选项。估计比例时固定用 z(正态近似),也无需选择。
  5. 读结果并核对顶部大字是区间的下限与上限,下面列出点估计、标准误 SE、误差幅度 E、临界值 t*/z*、自由度 df 与区间宽度,可直接抄进作业或报告。比例还会同时给出 Wilson 得分区间;当样本不满足 x ≥ 5 且 n − x ≥ 5 时,请以 Wilson 区间为准。

核心要点

置信区间用样本估计总体,公式统一是「点估计 ± 临界值 × 标准误」: 均值用 x̄ ± t* · s/√n,比例用 p̂ ± z* · √(p̂(1−p̂)/n)

  • 选分布:总体标准差 σ 未知用 t(自由度 df = n − 1);σ 已知用 z;粘贴原始数据只能得到样本 s,固定用 t;估计比例固定用 z
  • 典型算例x̄ = 100s = 15n = 25,95% 置信区间为 [93.808304, 106.191696]
  • 正确解读:约 95% 的同类区间会盖住真值,不是「真值有 95% 概率落在这个区间」。
  • 边界:比例接近 0 或 1、样本又小时 Wald 区间失效,改看 Wilson 得分区间;所有计算在浏览器本地完成,不上传数据。

原理与公式

置信区间(confidence interval,CI)是用样本推断总体的区间估计:在点估计两侧留出 一段「误差幅度」,得到一个大概率覆盖真实总体参数的范围。所有形式都可以写成同一个骨架 —— 点估计 ± 临界值 × 标准误

总体均值 μ 的置信区间

σ 未知(最常见,用 t 分布)
x̄ ± t*(1−α/2, n−1) · s/√n
σ 已知(用 z 分布)
x̄ ± z*(1−α/2) · σ/√n
其中 α = 1 − 置信水平s/√n标准误(standard error,SE),t* · SE误差幅度(margin of error,E)。自由度 df = n − 1

两条公式的区别只在 σ 是不是外生已知的:σ 来自历史数据、行业标准或仪器精度时才能用 z; 只要标准差是从这批样本算出来的,它就是 s,必须用 t。 因此本工具的「粘贴原始数据」模式固定用 t——原始数据只能推出 s,把它当作已知 σ 会系统性低估区间,样本越小低估越离谱 (如数据为 0, 10 时,95% 的 t 区间是 [−58.531024, 68.531024],误用 z 只有 [−4.799820, 14.799820])。

总体比例 p 的置信区间

Wald 正态近似区间p̂ ± z* · √(p̂(1−p̂)/n),其中 p̂ = x/n
Wilson 得分区间(小样本、极端比例下更可靠):
中心 = (p̂ + z*²/2n) / (1 + z*²/n)
半宽 = z*/(1 + z*²/n) · √(p̂(1−p̂)/n + z*²/4n²)
Wilson 区间的端点永远落在 0~1 之间,不会像 Wald 那样越界。
Wald 端点越界时本工具会截断到 0 或 1,并同时标出截断前的原始端点——截断后的区间不再对称,此时展示的宽度小于 2 × 误差幅度,请直接以 Wilson 区间为准。
更严格的场合:药品检验、医疗器械验证、监管报送等要求 「实际覆盖率不低于名义水平」的正式用途,可改用基于二项分布精确概率的Clopper–Pearson 精确区间,它比 Wilson 更保守(区间更宽), 换来的是不会低于名义覆盖率。

常用临界值

z*:90% → 1.644854,95% → 1.959964,99% → 2.575829
t*(95%):df = 112.706205df = 102.228139df = 24 2.063899df = 302.042272df = 1001.983972df = 1000 1.962339df 越大越接近 z*df → ∞t* 单调递减收敛到 z*, 但对任何有限 df 都严格大于 z*

计算示例(均值,t 分布)

样本均值 x̄ = 100,样本标准差 s = 15,样本量 n = 25,置信水平 95%:
df = 25 − 1 = 24t* = 2.063899
SE = 15 / √25 = 3
E = 2.063899 × 3 = 6.191696
CI = 100 ± 6.191696 = [93.808304, 106.191696]

计算示例(比例,z 分布)

100 人中 45 人支持,p̂ = 0.45,置信水平 95%:
SE = √(0.45 × 0.55 / 100) = 0.049749
E = 1.959964 × 0.049749 = 0.097507
Wald CI = [0.352493, 0.547507],即 35.25%~54.75%
Wilson CI = [0.356145, 0.547554]

怎么让区间变窄

对未被截断的对称区间,区间宽度 = 2 × 临界值 × 标准误(比例区间被截断到 0/1 时该等式不成立),因此只有三条路:降低置信水平、 减小数据波动 s、加大样本量 n。由于 SE 里是 √n误差幅度减半需要样本量变成 4 倍。反推样本量: 估计比例用 n ≈ z*²·p̂(1−p̂)/E²(最保守取 p̂ = 0.5), 估计均值用 n ≈ (z*·s/E)²

适用前提与精度

均值区间要求样本随机独立,且总体近似正态或样本量足够大(中心极限定理); 比例区间的正态近似经验判据是 x ≥ 5n − x ≥ 5, 不满足时以 Wilson 区间为准。区间只反映抽样误差, 无法弥补抽样偏差、测量误差或问卷设计缺陷。
精度:均值、标准差与原始数据以原始文本直接交给高精度十进制引擎, 不经浮点转换,规避原生浮点误差(0.1 + 0.2 = 0.3)与大整数精度丢失; 临界值 z*t* 由双精度分位数算法求得(相对误差约 1e-10),远细于展示的 6 位小数。t*df < 10000 时由不完全贝塔函数表示的尾概率反解,df ≥ 10000 时改用 Cornish–Fisher 渐近展开——超大自由度下 df/(df+t²) 会因过于接近 1 而在双精度中失真,换用展开式后 n = 10¹⁵ 仍能正确收敛到 t* → z* = 1.959964。 所有档位的单尾概率 α/2 都按 (100 − 置信水平)/200 在十进制下求出,不走 1 − α/2,因此极高置信水平不会被舍入成 1 而失效。
支持范围:置信水平 0 < 水平 ≤ 99.9999999999998%(单尾概率 α/2 ≥ 1e-15);样本量 n 1 ~ 9007199254740991 的整数(超过双精度安全整数上限后 n df 已无法唯一表示);均值、标准差与单个数据点的绝对值上限为 1e150,以保证输出始终是有限数值。超出以上范围会明确报错, 而不是静默返回无穷大或失真结果。计算均在浏览器本地完成,不上传数据。

常见问题

95% 置信区间怎么算?置信区间计算公式是什么?
总体均值的置信区间是「点估计 ± 临界值 × 标准误」:x̄ ± t*(1−α/2, n−1) × s/√n。三步走:① 算标准误 SE = s/√n;② 按置信水平和自由度 df = n−1 查临界值 t*;③ 用 x̄ 加减 t*×SE 得到上下限。举例:样本均值 x̄ = 100、样本标准差 s = 15、n = 25,95% 时 df = 24、t* ≈ 2.063899,SE = 15/√25 = 3,误差幅度 E = 2.063899 × 3 ≈ 6.191696,区间为 [93.808304, 106.191696]。若总体标准差 σ 已知,把 t* 换成 z*(95% 时 z* ≈ 1.959964)即可。
均值置信区间使用 t 值和 z 值的条件有什么区别?
判断标准是总体标准差 σ 知不知道,而不是样本大不大。σ 未知、只能用样本标准差 s 顶替时用 t 分布,自由度 df = n − 1(n 是样本量,比如 n = 25 就是 df = 24);σ 已知时用 z 分布,没有自由度这一说。t 分布比正态分布尾部更厚,同样置信水平下 t* 总比 z* 大一点,区间也更宽,这就是为估计 σ 付出的代价。n 越大两者差距越小:df = 30 时 95% 的 t* ≈ 2.042272,已经很接近 z* ≈ 1.959964,所以大样本下用 z 近似影响很小。要特别注意:只有一列原始数据时 σ 一定是未知的,把算出来的 s 当成 σ 去套 z 会严重低估区间——例如数据只有 0 和 10 两个值,95% 的正确 t 区间是 [−58.53, 68.53],误用 z 会缩成 [−4.80, 14.80]。所以本工具的「粘贴原始数据」模式固定用 t。估计总体比例时固定用 z。
95% 置信区间是什么意思?能说真值有 95% 的概率落在区间里吗?
不能这么说,这是常见误读之一。频率学派的定义针对「方法」而不是「这一个区间」:按同样方式反复抽样、每次都算一个 95% 置信区间,长期来看约 95% 的区间会盖住真实的总体参数。真值是一个固定的未知常数,它要么在你手上这个区间里,要么不在,没有概率可言。正确的说法是「我们有 95% 的把握认为总体均值在 93.81 到 106.19 之间」。另外,置信区间只覆盖抽样误差,不能修正抽样方式偏差、测量错误或问卷设计问题——样本不随机时,区间再窄也没有意义。
95% 置信区间太宽怎么办?目标误差为 ±3% 时样本量怎么算?
对未被截断的对称区间来说,区间宽度 = 2 × 临界值 × 标准误,能动的只有三处:降低置信水平(99% 换成 95%)、减小数据本身的波动 s、或者加大样本量 n。因为 SE 里是 √n,把误差幅度减半需要样本量变成 4 倍,这是成本较高但直接有效的方式。反过来可按目标误差 E 倒推样本量:估计比例时 n ≈ z²·p̂(1−p̂)/E²,保守取 p̂ = 0.5,要做到 95% 置信、±3 个百分点,n ≈ 1.959964² × 0.25 / 0.03² ≈ 1068,这正是民调常见 1000 人出头样本量的由来;估计均值时用 n ≈ (z·s/E)²。
比例置信区间怎么算?Wald 区间和 Wilson 区间有什么区别?
常规做法是 Wald 正态近似区间:p̂ ± z × √(p̂(1−p̂)/n)。例如 100 人里 45 人支持,p̂ = 0.45,SE = √(0.45×0.55/100) ≈ 0.049749,95% 时 z* ≈ 1.959964,区间约为 [0.352493, 0.547507],即 35.25%~54.75%。但 Wald 区间在样本小或比例接近 0/1 时表现很差:p̂ = 0 时它会给出宽度为 0 的荒谬区间 [0, 0],端点还可能跑到 0 以下——例如 10 人里 1 人成功、99% 置信时,原始端点约为 [−0.144, 0.344],截断到 0 后区间宽度就不再等于 2 × 误差幅度,工具会同时把截断前的端点标出来。所以本工具同时给出 Wilson 得分区间(把 z² 项纳入中心与半宽),它天然落在 0~1 内、小样本覆盖率更接近名义水平。经验判据是 x ≥ 5 且 n − x ≥ 5,不满足就以 Wilson 区间为准。若是药品检验、医疗器械验证、监管报送这类要求「实际覆盖率不低于名义水平」的正式用途,还可以进一步改用基于二项分布精确概率的 Clopper–Pearson 精确区间,它比 Wilson 更保守(区间更宽),代价是效率略低。
90%、95%、99% 置信区间该选哪个?和显著性水平 α 是什么关系?
置信水平 = 1 − α,选择本质上是在「把握」和「精度」之间取舍:95%(α = 0.05)是学术论文、市场调研与行业报告的通行默认,兼顾两者;99%(α = 0.01)区间更宽但结论更稳,用于医学试验、药品检验、安全与质量控制等误判代价高的场景;90%(α = 0.10)区间最窄,多见于探索性分析、初步摸底或样本本来就很小的时候。注意口径必须先定后算:不能算完看结果不理想再回头调低置信水平,那会让区间失去意义。同一组数据下,90%、95%、99% 的区间是层层包含的关系,本工具切换一下就能对比宽度差多少。

相关指南