p值计算器

在线 p 值计算器支持 z、t、卡方 χ² 与 F 统计量:输入统计量和自由度,即可计算单侧或双侧 p 值、左右尾概率与临界值,并按显著性水平 α 判断是否拒绝原假设。

大样本均值 / 比例检验、A/B 转化率检验、标准分。总体标准差已知或样本量足够大(一般 n ≥ 30)时用 z,不需要自由度。

可以填负数,符号只表示方向;双侧 p 值只看绝对值。SPSS 输出里的 t 值、Excel 里算出的 z 值都可以直接粘贴。

只问「有没有差异」用双侧(最常用,论文默认);事先就只关心「是不是更高」用右侧、「是不是更低」用左侧。方向必须在看数据之前定好,看完数据再改会让 p 值失去意义。

α 只决定判定线和临界值,不改变 p 值本身。0.05 是论文与报告的通行口径,医学、质量控制常用 0.01,多重比较时还要把 α 除以比较次数。

标准正态分布 z·双侧检验(无自由度参数
p = 0.012419

p < α = 0.05拒绝原假设 H₀:在该显著性水平下,结果具有统计学意义。(拒绝域:统计量 < -1.959964 或 > 1.959964;显著性标记 *·显著

p 值的含义是「假定原假设成立时,重复抽样得到当前这么极端甚至更极端结果的概率」,约相当于每 80.519637 次抽样才会碰上一次。它不是「原假设为真的概率」,也不是效应大小——差异是否重要还要看效应量与置信区间。

p 值(双侧0.012419
统计量2.5
左尾 P(X ≤ 统计量)0.99379
右尾 P(X ≥ 统计量)0.00621
双侧 p 值0.012419
临界值 ±1.959964
判定(α = 0.05显著,拒绝 H₀
置信水平 1 − α95%
等效 σ 数2.5 σ

论文里可写作「z = 2.5,p = 0.012419」。习惯上 p < 0.05 记 *、p < 0.01 记 **、p < 0.001 记 ***,本次为 *该标记只是报告惯例,正式结论仍以你事先设定的 α 为准。

怎么用

  1. 先确认手里的统计量是哪一种看你做的是什么检验:均值大样本或比例检验得到的是 z;单样本 / 配对 / 两独立样本 t 检验、回归系数得到的是 t;四格表、列联表、拟合优度得到的是 χ²;方差分析(ANOVA)、回归方程整体检验、方差齐性检验得到的是 F。SPSS 输出表里的「t」「χ²」「F」那一列就是统计量,Excel 用 T.TEST、CHISQ.TEST 只给 p 不给统计量,用 R 的 t.test()、chisq.test()、aov() 则两个都有。选错分布会得到完全不同的 p 值。
  2. 填自由度:z 不用填,t 和 χ² 填一个,F 填两个z 分布不依赖样本量,没有自由度。t 检验:单样本与配对 df = n − 1,两独立样本(假设方差齐)df = n₁ + n₂ − 2,Welch 校正给出的小数自由度(如 17.34)可以直接填。χ²:列联表 df = (行数 − 1) × (列数 − 1),四格表恒为 1,拟合优度 df = 类别数 − 1 − 估计参数个数。F 要填两个:分子自由度 df₁ = 组数 − 1(回归里是自变量个数 k),分母自由度 df₂ = n − 组数(回归里是 n − k − 1),顺序写反会算错。
  3. 选尾侧:默认双侧,事先定好方向才用单侧只问「有没有差异 / 有没有关系」用双侧,这是论文与报告的默认口径;事先就只关心一个方向(新方案是不是更高、废品率是不是更低)才用右侧或左侧,同样的统计量单侧 p 恰好是双侧的一半,更容易显著,所以方向必须在看数据之前定好。卡方检验与方差分析按惯例只看右侧:任何方向的偏离都会让 χ² 和 F 变大,左侧只在检验「方差是不是变小了」这类场景才用。
  4. 设定显著性水平 α,读判定与临界值α 是你愿意承担的「原假设为真却被拒绝」的错误概率,常用 0.05,医学与质量控制常用 0.01;做了多次比较还要把 α 除以比较次数(Bonferroni 校正)。结果区直接给出判定:p < α 就拒绝原假设,等价于统计量落进拒绝域(超过临界值)。α 只移动判定线,不改变 p 值本身。
  5. 读结果:p 值、左右尾、临界值与星号顶部是按你选的尾侧算出的 p 值与结论;下方同时给出左尾 P(X ≤ 统计量)、右尾 P(X ≥ 统计量) 和双侧 p,方便和别人的口径对齐——发现自己的 p 恰好是别人的两倍或一半,多半就是单双侧的差别。临界值可直接对照教材的界值表;星号按 * / ** / *** 分档,是报告惯例而非判定依据。p 小到 1e-300 量级也会以有效数字显示,不会塌陷成 0。

核心要点

p 值表示:在原假设成立的前提下,观察到当前结果或更极端结果的概率, 也就是统计量在对应分布上的尾部面积。用 p值计算器得到结果后, 将它与事先设定的显著性水平比较:p < α 时拒绝原假设。

  • 四种统计量各走各的分布:z 走标准正态,t 走自由度 df 的 t 分布, χ² 走自由度 df 的卡方分布,F 走 F(df₁, df₂)。选错分布或填错自由度, p 值会完全不同。
  • 单侧恰好是双侧的一半(z / t 等对称分布):t = 2.35、df = 18 → 双侧 p = 0.03038,右侧 p = 0.01519。方向要在看数据之前定好。
  • 典型算例z = 2.5 双侧 p = 0.012419χ² = 5.333333、df = 1p = 0.020921F = 4.26、df = (3, 24)p = 0.015119
  • p 值不是「原假设为真的概率」,也不是效应大小;p ≥ 0.05 只说明证据不足,不等于「没有差异」
  • 与临界值法等价α = 0.05、df = 1 的卡方临界值 3.841459,统计量超过它 ⟺ p < 0.05。 所有计算在浏览器本地完成,不上传数据。

原理与公式

假设检验的流程是:先立原假设 H₀(通常是「没有差异 / 没有关系」)与备择假设 H₁,再从数据算出一个统计量,最后问一句「如果 H₀ 是真的, 单凭抽样波动能不能碰巧出现这么极端的统计量?」这个概率就是 p 值。 p 越小,说明观测结果与 H₀ 越不相容,当它小于事先设定的显著性水平 α 时, 就拒绝 H₀。注意 p 值是在 H₀ 成立的前提下算出来的条件概率, 它回答不了「H₀ 有多大概率为真」——那需要贝叶斯方法。

四种统计量的尾概率公式

z(标准正态,无自由度)
右侧 p = P(Z ≥ z) = 1 − Φ(z)左侧 p = Φ(z)双侧 p = 2·(1 − Φ(|z|))
t(自由度 df)
双侧 p = P(|T| > |t|) = I_[df/(df+t²)](df/2, 1/2), 单侧取其一半(方向一致时)
χ²(自由度 df)
p = P(χ² ≥ 统计量) = Q(df/2, 统计量/2)(正则化上不完全伽马函数)
F(自由度 df₁, df₂)
p = P(F ≥ 统计量) = I_[df₂/(df₂+df₁·F)](df₂/2, df₁/2)
其中 Φ 是标准正态分布函数,I_x(a, b) 是正则化不完全贝塔函数。 四个分布之间还有两条常用关系:z² 服从 χ²(1)t² 服从 F(1, df)——所以 z 的双侧 p 恰好等于 χ²(1) 的右侧 p, 这也是四格表卡方与两比例 z 检验结论一致的原因。

计算示例一:t 检验(新培训是否提高成绩)

实验班与对照班各 10 人,做两独立样本 t 检验(假设方差齐),算得 t = 2.35df = n₁ + n₂ − 2 = 18α = 0.05
双侧 p = 0.03038 < 0.05 → 拒绝「培训无效」,差异显著
临界值 t(0.975, 18) = ±2.1009222.35 > 2.100922, 与 p 值结论一致
若事先就只关心「是否提高」,取右侧:p = 0.01519, 恰为双侧的一半;反方向的左侧 p = 0.98481
换成 α = 0.01 则临界值升到 ±2.878440p = 0.03038 > 0.01 → 同一份数据不再显著,可见 α 只移动判定线。

计算示例二:卡方与 F

四格表:A 方案 200 人中 60 人下单、B 方案 200 人中 40 人下单,χ² = 5.333333df = (2−1)(2−1) = 1
p = 0.020921 < 0.05χ²(0.95, 1) = 3.841459 → 两方案下单率有显著差异
方差分析:4 组共 28 个观测,df₁ = 4 − 1 = 3df₂ = 28 − 4 = 24,算得 F = 4.26
p = 0.015119 < 0.05F(0.95, 3, 24) = 3.008787 → 至少有两组均值不同(具体哪两组要做事后多重比较,并校正 α)
两者都只看右侧:任何方向的偏离都会让 χ² 与 F 变大,左侧仅用于「方差是不是变小了」 这类特殊检验,此时 F 分布不对称,左侧临界值 = 1 / F(1−α; df₂, df₁),不是右侧临界值的相反数。

常用临界值速查(α = 0.05)

z:双侧 ±1.959964,单侧 1.644854α = 0.01 时为 ±2.575829
t 双侧:df = 5 → 2.570582df = 10 → 2.228139df = 20 → 2.085963df = 30 → 2.042272df = 120 → 1.979930(df 越大越接近 1.96)
χ² 右侧:df = 1 → 3.841459df = 2 → 5.991465df = 3 → 7.814728df = 4 → 9.487729df = 5 → 11.070498df = 10 → 18.307038
F 右侧:(1, 10) → 4.964603(2, 20) → 3.492828(3, 24) → 3.008787(4, 30) → 2.689628

怎样正确解读 p 值

p 值只回答「数据与原假设有多不相容」,四件事它回答不了: ① 不是「原假设为真的概率」,也不是「结论出错的概率」; ② 不衡量效应大小——样本量足够大时,毫无实际意义的微小差异也能算出 p < 0.001; ③ p ≥ α 不能证明「无差异」,只能说证据不足, 真要论证等效需用等效性检验(TOST); ④ 反复更换检验方法、分组或反复看数据直到 p < 0.05(p-hacking) 会让 p 值失去意义。规范做法是:检验方向与 α 在看数据前定好, 结果同时报告效应量(Cohen’s d、Cramér’s V 等)与置信区间, 多重比较时校正 α(如 Bonferroni:把 α 除以比较次数)。

精度与支持范围

统计量与自由度以高精度十进制解析,用户输入的数字不经浮点转换即参与计算, 规避原生浮点误差(0.1 + 0.2 = 0.3)。尾概率由分布函数直接求出: 正态用互补误差函数、t 与 F 用正则化不完全贝塔函数(连续分数)、 χ² 用正则化不完全伽马函数(小于中心处用级数、大于中心处用连续分数), 每一侧尾部都从该侧本身求值而非用 1 − 另一侧相减, 因此 1e-24 乃至 1e-300 量级的极小 p 值仍保有有效数字, 不会塌陷成 0;临界值由同一尾概率二分反解,相对误差约 1e-10, 远细于展示的 6 位小数。
支持范围:zt 统计量可正可负(绝对值上限 1e150),χ²F 必须非负;t 的自由度 1 ~ 1e15 且允许 Welch 的小数自由度,χ²F 的自由度 1 ~ 1000000; 显著性水平 1e-14 ≤ α ≤ 0.5。真实 p 小于双精度可表示的最小值(约 1e-323)时会显示 0 并明确标注,而不是伪装成精确结果。 所有计算均在浏览器本地完成,不上传数据。

常见问题

p值计算器怎么算 z、t、卡方和 F 统计量对应的 p 值?
p 值是「假定原假设成立时,出现当前这么极端甚至更极端结果的概率」,也就是统计量在对应分布上的尾部面积,四种分布的公式分别是:z 用标准正态分布,右侧 p = 1 − Φ(z),双侧 p = 2·(1 − Φ(|z|));t 用自由度为 df 的 t 分布,双侧 p = P(|T| > |t|) = I_{df/(df+t²)}(df/2, 1/2)(正则化不完全贝塔函数);χ² 用自由度为 df 的卡方分布,p = P(χ² > 统计量) = Q(df/2, 统计量/2)(正则化上不完全伽马函数);F 用 F(df₁, df₂) 分布,p = P(F > 统计量) = I_{df₂/(df₂+df₁·F)}(df₂/2, df₁/2)。举例:z = 2.5 的双侧 p = 0.012419;t = 2.35、df = 18 的双侧 p = 0.03038;χ² = 5.333333、df = 1 的 p = 0.020921;F = 4.26、df = (3, 24) 的 p = 0.015119。本页用分布函数直接计算,不必手工查界值表。
p值小于多少算统计显著?p = 0.05 和 p = 0.01 有什么区别?
判定规则只有一条:p < α 就拒绝原假设,α 是你在做实验之前自己设定的显著性水平。学术论文与行业报告通行 α = 0.05,医学、药品、质量控制等代价更高的场景常用 α = 0.01,探索性研究有时放宽到 0.10。所以「p 小于多少算显著」取决于你选的 α,而不是有一个万能门槛:p = 0.03 在 α = 0.05 下显著,在 α = 0.01 下就不显著。报告惯例是用星号分档:p < 0.05 记 *,p < 0.01 记 **,p < 0.001 记 ***,0.05 ≤ p < 0.1 常写作「边缘显著」,只能作为倾向性描述。α 越小越不容易犯「假阳性」(第一类错误),但同时更容易漏掉真实差异(第二类错误),做多次比较时还要用 Bonferroni 等方法把 α 除以比较次数。
p值计算时单侧和双侧怎么选,两种 p 值能互相换算吗?
看备择假设的方向,而且必须在看数据之前定:只问「有没有差异」(μ ≠ μ₀)用双侧,这是默认口径;事先只关心一个方向、反方向的结果对决策毫无意义(新工艺是不是更快、次品率是不是更低)才用单侧。对 z 和 t 这类关于 0 对称的分布,两者可以直接换算:统计量方向与备择假设一致时,单侧 p = 双侧 p ÷ 2;方向相反时单侧 p = 1 − 双侧 p ÷ 2,会非常接近 1。例如 t = 2.35、df = 18:双侧 p = 0.03038,右侧 p = 0.01519,左侧 p = 0.98481。正因为单侧 p 只有一半,看完数据发现差一点不显著就改成单侧属于典型的「p-hacking」,审稿人和统计审计都会追查。卡方与 F 分布不对称,它们的「双侧」按惯例取两倍的较小尾部,且常规检验本身就只用右侧。
p值大于 0.05 是什么意思,p = 0.06 能说明两组没有差异吗?
不是。p ≥ α 只能说明「现有数据不足以拒绝原假设」,不能证明原假设成立——这是最常见的误读,也是美国统计学会(ASA)2016 年 p 值声明中专门点名的问题。p 值同时受效应大小和样本量影响:真实差异很小但样本量巨大时 p 会很小,真实差异不小但样本量太少时 p 也可能大于 0.05。所以看到 p = 0.06 正确的表述是「未观察到统计学显著差异」,同时应报告效应量(Cohen's d、Cramér's V、相关系数)和置信区间:如果 95% 置信区间很宽且包含 0,说明只是证据不足;如果区间很窄且贴近 0,才有底气说「差异即使存在也小到没有实际意义」。想真正论证「无差异」需要用等效性检验(TOST)而不是普通显著性检验。
p值与显著性水平 α、临界值是什么关系,为什么判定结论相同?
两者是同一件事的两种表述。临界值法:先由 α 和自由度反查界值表得到临界值,再看统计量有没有超过它;p 值法:先由统计量算出尾部概率 p,再和 α 比大小。因为尾部概率随统计量单调变化,「统计量超过临界值」与「p < α」永远同时成立。例如 α = 0.05、df = 1 的卡方临界值是 3.841459,χ² = 5.333333 > 3.841459,对应 p = 0.020921 < 0.05,两种方法都拒绝原假设。差别在信息量:临界值只给「过线 / 没过线」,p 值还告诉你过线多少——p = 0.049 与 p = 0.0001 同样「显著」,证据强度却相差几百倍,所以现代期刊要求直接报告精确 p 值(小于 0.001 时写 p < 0.001)而不是只写「p < 0.05」。本页两种口径同时给出,可以互相验证。
SPSS 的 Sig. 是 p 值吗,为什么和 p值计算器、Excel 或 R 对不上?
SPSS 输出表里的「Sig.」「Sig.(双尾)」就是 p 值,只是命名不同。结果对不上通常出在四处:① 单双侧口径——SPSS 的 t 检验默认输出双尾 Sig.,若你要单侧需自己除以 2,而 Excel 的 T.DIST 系列要显式选 1 或 2 尾;② 自由度——两独立样本 t 检验中「假设方差相等」与 Welch 校正(SPSS 输出的第二行)自由度不同,p 自然不同;③ 检验方法——四格表是否做了连续性校正、方差分析用的是哪种平方和分解,都会改变统计量;④ 有效数字——SPSS 默认只显示 3 位小数,极小的 p 会显示成 .000,此时应写「p < 0.001」而不是 p = 0。对应关系可以这样记:Excel 的 NORM.S.DIST(z, TRUE) 对应本页左尾,CHISQ.DIST.RT、F.DIST.RT、T.DIST.RT 对应右尾,T.DIST.2T 对应双侧;R 里则是 pnorm、pt、pchisq、pf 加 lower.tail 参数。对齐这四点后,本页与它们的结果应在展示的 6 位小数内一致。
p值计算结果显示 0 或 5.73303e-7 是什么意思,论文里怎么写?
p 值小于 0.0001 时本页自动切换成有效数字(科学计数法)显示,例如 z = 5 的双侧 p = 5.73303e-7,即 0.000000573303,表示约每 174 万次抽样才会碰到一次这么极端的结果。统计量再极端时(如 |z| > 38),真实 p 已小于双精度浮点能表示的最小正数(约 1e-323),本页会显示 0 并标注「小于双精度可表示的最小值」,这是数值表示的下限,不是真的等于 0。写进论文时按期刊惯例:小于 0.001 一律写「p < 0.001」,不要写 p = 0.000 或 p = 0;物理、天文等领域则习惯换算成 σ 数报告(本页给出等效 σ 数:3σ 对应双侧 p ≈ 0.0027,5σ 对应 p ≈ 5.7e-7)。极小的 p 只说明「与原假设不符的证据非常强」,并不代表效应很大,仍需配合效应量与置信区间。
p值计算器支持哪些统计检验,只有统计量没有原始数据能用吗?
正是为「只有统计量」的场景设计的:只要你已经拿到 z、t、χ² 或 F 值和相应自由度(教材例题、SPSS/Stata 输出、论文里别人报告的统计量),填进去就能得到 p 值与临界值,不必查界值表,也不需要原始数据。覆盖的常见检验包括 z 检验(大样本均值 / 比例、A/B 转化率)、各类 t 检验(单样本、配对、两独立样本、Welch 校正、回归系数)、卡方检验(独立性、齐性、拟合优度、单总体方差)与 F 检验(单因素及多因素方差分析、回归方程整体显著性、方差齐性)。如果手里是原始数据而非统计量,请改用本站的 t检验计算器、卡方检验计算器或标准分计算器,它们会先算统计量再给 p 值。支持范围:t 的自由度可到 1e15 且允许 Welch 的小数自由度,χ² 与 F 的自由度上限为 1000000,显著性水平 α 取值 1e-14 ~ 0.5;所有计算在浏览器本地完成,不上传数据。