t检验计算器

填入均值、标准差、样本量,或直接粘贴原始数据,立即算出 t 值、自由度、p 值、临界值、置信区间与 Cohen's d,并按显著性水平 α 给出是否显著的结论;支持单样本、两独立样本(Welch / 合并方差)与配对样本 t 检验。

一组数据与一个已知标准值(国标、历史均值、设计值)比较。

已知均值、标准差、样本量时直接填数字。

H₀:μ = 10 H₁:μ ≠ 10。单侧检验必须在看数据之前就按专业理由确定方向,否则等于把 α 悄悄放大一倍。

0.05 是论文与报告的通行口径;医学、质量控制常用 0.01。α 只影响「是否显著」的判定线,不改变 p 值本身。

按样本口径(除以 n−1)的标准差;不知道可先用标准差计算器算出来再填这里。

整数且 n ≥ 2,自由度 df = n − 1。

要比较的标准值,如国标 10mm、历史平均 75 分。

单样本 t 检验·双侧(≠)
t = 2.236068,p = 0.037541

p < α = 0.05拒绝原假设:差异在统计上显著。(df = 19,临界值 ±2.093024

「显著」只说明这个差异不太可能由抽样波动造成,不等于差异很大或很重要——请结合下方效应量 Cohen's d 与置信区间一起判断实际意义。

t 统计量2.236068
自由度 df19
p 值(双侧(≠)0.037541
临界值 t*2.093024
样本均值 x̄10.4
与假设值之差0.4
标准误 SE0.178885
效应量 Cohen’s d0.5
95% 置信区间下限10.025588
95% 置信区间上限10.774412
样本标准差 s0.8
假设值 μ₀ / d₀10
1 组:n = 20x̄ = 10.4,s = 0.8

怎么用

  1. 先确定是哪一种 t 检验一组数据和一个固定标准值(国标、设计值、历史均值)比,选「单样本」;两拨互不相干的对象比,如实验班与对照班、A 版与 B 版用户,选「双独立样本」;同一批对象前后两次测量或天然成对的数据,如培训前后成绩、同一批样品两台仪器的读数,选「配对样本」。同一批数据用错类型,t 值和自由度都会变。
  2. 选备择假设和显著性水平 α只想知道「有没有差别」选双侧(≠),这是默认也是论文最常用的口径;事先有明确方向依据(如新工艺只可能提高良率)才选右侧(>)或左侧(<)。α 一般取 0.05,医学试验、质量控制常取 0.01,探索性分析可取 0.10。方向和 α 都必须在看结果之前定好。
  3. 填数据:统计量或原始数据二选一已经有均值、标准差、样本量,直接切「填统计量」逐项填入;只有一列原始数字,就切「粘贴原始数据」,用逗号、空格或换行分隔粘进去,工具会自动算出均值、样本标准差(除以 n−1)和样本量。配对样本要粘贴前后两列,个数必须一一对应。
  4. 双样本再选一次方差假设两独立样本默认用 Welch 法,它不要求两个总体方差相等,自由度按 Welch–Satterthwaite 公式修正(通常是小数),方差恰好相等时结果也几乎不损失。只有在确有理由认为方差齐(如同一工艺、同一仪器)时才切到「合并方差」。结果区给出的方差比可作参考,超过 4 倍就别用合并方差了。
  5. 读结论:先看 p 值,再看效应量和置信区间顶部直接给出 t 值与 p 值:p < α 就拒绝原假设,认为差异显著。接着看 Cohen's d 判断差异大不大(0.2 小、0.5 中、0.8 大),再看均值差的 95% 置信区间——区间不含假设值(默认 μ₀ / d₀ = 0,填了非零假设值就以它为准)与「双侧显著」是一回事,区间宽说明证据还不够精确。t 值、自由度、标准误、临界值都可直接抄进作业或报告。

核心要点

t 检验判断「观察到的差异是不是抽样波动造成的」,三种类型共用同一个骨架:t =(点估计 − 假设值)÷ 标准误,再用自由度对应的 t 分布把 t 值换算成 p 值。

  • 选类型:对标准值比 → 单样本;两拨不同对象比 → 双独立样本; 同一批对象前后比 → 配对样本。配对数据当成独立样本算会白白丢掉精度。
  • 双样本默认 Welch:不要求方差齐;n₁ = n₂ s₁ = s₂ 时它与合并方差法结果完全相同。
  • 典型算例x̄ = 10.4s = 0.8n = 20μ₀ = 10 比较 → t = 2.236068df = 19、双侧 p = 0.037541,在 α = 0.05 下显著。
  • 别只看 p:显著 ≠ 差异大。配合 Cohen’s d(0.2 小 / 0.5 中 / 0.8 大)与置信区间一起读;所有计算在浏览器本地完成,不上传数据。
  • 先过一遍前提:观测独立、总体近似正态(或每组 n ≥ 30)。小样本又明显偏态、有离群值时改用 Mann–Whitney U(独立)或 Wilcoxon 符号秩检验(配对);三组以上两两比较要改用方差分析或校正 α,否则假阳性会累积。

原理与公式

t 检验(Student’s t-test)用于在总体标准差未知、只能用样本标准差 s 估计时,判断均值与某个假设值的差异是否超出抽样波动的解释范围。统计量统一写作t =(点估计 − 假设值)÷ 标准误,它服从自由度为 df 的 t 分布 ——同样的思路若 σ 已知就变成 z 检验,t 分布比正态分布尾部更厚,正是为 「用 s 顶替 σ」付出的代价。

三种 t 检验的公式

单样本(一组数据 vs 标准值 μ₀):
t = (x̄ − μ₀) / (s/√n)df = n − 1
配对样本(先求每对差值 d = x − y,再做单样本检验):
t = (d̄ − d₀) / (s_d/√n)df = n − 1n 是对数)
两独立样本 · 合并方差(Student)
s_p² = ((n₁−1)s₁² + (n₂−1)s₂²) / (n₁ + n₂ − 2)
t = (x̄₁ − x̄₂ − d₀) / (s_p·√(1/n₁ + 1/n₂))df = n₁ + n₂ − 2
两独立样本 · Welch(默认)
t = (x̄₁ − x̄₂ − d₀) / √(s₁²/n₁ + s₂²/n₂)
df = (s₁²/n₁ + s₂²/n₂)² / [ (s₁²/n₁)²/(n₁−1) + (s₂²/n₂)²/(n₂−1) ]
Welch 的自由度一般是小数,且不超过 n₁ + n₂ − 2;当 n₁ = n₂s₁ = s₂ 时它恰好退化成合并方差法的结果。

p 值与判定规则

p 值是「原假设为真时,出现比当前更极端结果」的概率:
双侧 p = P(|T| > |t|);右侧 p = P(T > t);左侧 p = P(T < t)
由 t 分布关于 0 对称,方向一致时单侧 p 恰为双侧的一半,方向相反时则是 1 − 双侧p/2(必然大于 0.5)。
判定:p < α 就拒绝原假设,等价于双侧下 |t| > t*(1−α/2, df)、 单侧下 t 越过 ±t*(1−α, df)。α 只是判定线,改 α 不会改变 p 值本身。

计算示例一:单样本(零件长度对国标)

20 个零件长度 x̄ = 10.4 mm、s = 0.8 mm,标准值 μ₀ = 10 mm,双侧 α = 0.05:
SE = 0.8/√20 = 0.178885
t = (10.4 − 10)/0.178885 = 2.236068df = 19
双侧 p = 0.037541 < 0.05 → 拒绝原假设,与标准值有显著差异
t*(0.975, 19) = 2.093024|t| > t*,与 p 值结论一致
95% CI = 10.4 ± 2.093024×0.178885 = [10.025588, 10.774412],不含 10
Cohen’s d = 0.4/0.8 = 0.5(中等效应)。若改成右侧检验,p = 0.01877,临界值降为 1.729133

计算示例二:两独立样本(Welch vs 合并方差)

甲班 x̄₁ = 82s₁ = 6n₁ = 32;乙班 x̄₂ = 78s₂ = 9n₂ = 30,双侧 α = 0.05:
WelchSE = √(36/32 + 81/30) = 1.955761t = 4/1.955761 = 2.04524df = 50.06957p = 0.046104
合并方差s_p = 7.599342SE = 1.93124t = 2.071208df = 60p = 0.042648
两者都在 0.05 边缘,方差比 2.25 时选哪种方法会影响结论的稳健程度——这正是默认用 Welch 的原因。均值差的 95% 置信区间(Welch)为 [0.071874, 7.928126],勉强不含 0。

计算示例三:配对样本(干预前后体重)

10 名参与者干预前后各测一次体重(kg),差值(前 − 后)的 d̄ = 1.71s_d = 0.82388
SE = 0.82388/√10 = 0.260534
t = 1.71/0.260534 = 6.563452df = 9p = 0.000104
95% CI = [1.120632, 2.299368] kg,Cohen’s d = 2.075546(极大效应)。配对设计消掉了个体之间的体重差异,因此 10 对数据就足以给出很强的证据。

效应量与置信区间

Cohen’s d = 差异 ÷ 标准差(单样本用 s,配对用 s_d,双样本用合并标准差 s_p),衡量差异相对于数据自身波动 有多大,与样本量无关:0.2 小、0.5 中、0.8 大是常用经验界限。 本工具同时给出差异的 (1 − α) 双侧置信区间(无论选双侧还是单侧备择假设, 这里都固定给双侧区间,便于横向比较宽度):区间不含假设值与「显著」是同一件事的两种说法, 而区间的宽窄告诉你估计有多精确。

适用前提与常见误用

前提:观测独立、总体近似正态(或样本量足够大)、用合并方差法时还需方差齐。 小样本且明显偏态时改用 Mann–Whitney U(独立)或 Wilcoxon 符号秩检验(配对)。
常见误用:把配对数据当独立样本(白白损失精度)、看完数据再改单双侧或改 α、 多次比较不校正(三组两两比较应改用方差分析或对 α 做 Bonferroni 校正)、 把「不显著」当成「证明了没有差异」。

精度与支持范围

均值、标准差与原始数据以原始文本直接交给高精度十进制引擎,不经浮点转换,规避原生浮点 误差(0.1 + 0.2 = 0.3)与大整数精度丢失;均值、平方和、标准差、标准误与 t 值全程十进制求值。p 值由 t 分布尾概率 P(|T| > t) = I_(df/(df+t²))(df/2, 1/2)(正则化不完全贝塔函数)算出, 自由度超过 10⁶ 时改用正态极限;临界值 t* 由同一尾概率反解, 自由度超过 10⁴ 时改用 Cornish–Fisher 渐近展开,二者相对误差约 1e-10,远细于展示的 6 位小数。
支持范围:样本量 n2 ~ 9007199254740991 的整数(各组n ≥ 2 才有样本标准差);粘贴数据每组最多 100000 个; 单个数值绝对值上限 1e150;显著性水平 1e-14 ≤ α ≤ 0.5。数据完全没有波动(标准差为 0)时标准误为 0、t 值无定义, 工具会明确报错而不是返回无穷大。所有计算均在浏览器本地完成,不上传数据。

常见问题

t检验怎么算?t 值和 p 值的计算公式是什么?
三种 t 检验共用一个骨架:t =(点估计 − 假设值)÷ 标准误。单样本 t =(x̄ − μ₀)/(s/√n),自由度 df = n − 1;配对样本先把每对数据相减得到差值 d,再对 d 做单样本检验,t =(d̄ − d₀)/(s_d/√n),df = n − 1;两独立样本 t =(x̄₁ − x̄₂)/SE,Welch 法的 SE = √(s₁²/n₁ + s₂²/n₂),合并方差法的 SE = s_p·√(1/n₁ + 1/n₂),其中 s_p² = ((n₁−1)s₁² + (n₂−1)s₂²)/(n₁+n₂−2)。p 值是 t 分布中比观测值更极端的概率,双侧 p = P(|T| > |t|),不能查表硬凑,要用自由度对应的 t 分布算。举例:20 个零件长度均值 10.4mm、标准差 0.8mm,与标准值 10mm 比较,SE = 0.8/√20 = 0.178885,t = 0.4/0.178885 = 2.236068,df = 19,双侧 p = 0.037541 < 0.05,判定与标准值有显著差异。
单样本、双独立样本和配对 t 检验分别在什么时候用?选错会怎样?
看数据的来源结构:和一个固定标准值比用单样本(如零件长度对国标 10mm、班级平均分对全市 75 分);两组来自不同对象、互不影响用双独立样本(实验班 vs 对照班、A 组 vs B 组用户);同一批对象测两次或天然成对用配对样本(减肥前后体重、同一批血样两种试剂的读数、左右眼视力)。最常见的错误是把配对数据当成两独立样本算:配对检验只看差值这一列的波动,把「个体之间本来就有高有低」这部分变异消掉了,标准误更小、更容易发现真实变化。本页示例的 10 对体重数据,按配对算 t = 6.563452、p = 0.000104,同一批数字若当成两独立样本,个体之间 68~91kg 的体重差异会把这 1.71kg 的变化完全淹没,t 只剩 0.512256、p = 0.614759,结论变成「毫无差异」。反过来把独立数据硬配对则会人为夸大显著性,两种错法方向不同,但都会让结论不可信。
t 检验的前提条件是什么?小样本或数据不正态还能做 t 检验吗?
三个前提:① 观测相互独立(随机抽样、个体之间不互相影响);② 总体近似正态,或样本量足够大——中心极限定理让均值的抽样分布趋于正态,经验上每组 n ≥ 30 时对轻度偏态已相当稳健;③ 用合并方差法时还要求两组方差齐(Welch 法免除这一条)。n 很小(比如每组只有 5~10 个)且数据明显偏态、有极端离群值时,t 检验的 p 值会不可靠,此时可改用非参数方法:两独立样本用 Mann–Whitney U 检验,配对样本用 Wilcoxon 符号秩检验。另外要注意,数据本身正态与否比样本量更值得先画图看一眼;如果一组数据完全没有波动(标准差为 0),标准误为 0,t 值没有定义,本工具会直接报错而不是给出无穷大。
p 值小于 0.05 就代表差异很大吗?p = 0.06 该怎么解释?
不代表。p 值回答的是「若原假设为真,出现这么极端的数据有多罕见」,它同时受差异大小和样本量影响:样本量足够大时,哪怕只差 0.1 分也能算出 p < 0.001,但这种差异在实际中可能毫无意义。所以要配合效应量 Cohen's d(差异 ÷ 标准差)一起看,通常 0.2 为小、0.5 为中、0.8 为大;再看均值差的置信区间——本页示例的两组分数差 4 分,95% 置信区间为 0.071874 到 7.928126,虽然不含 0(与 p = 0.046104 显著一致),但区间从「几乎没差」延伸到「差 8 分」,说明证据其实相当勉强。p = 0.06 只能说「按 0.05 的标准证据不足」,绝不等于「两组相同」,更不能事后把 α 改成 0.10 或再多收几个样本凑到 0.05——那属于 p-hacking。正确做法是照实报告 p 值、效应量与置信区间。
两独立样本 t 检验该选 Welch 还是合并方差?要先做方差齐性检验吗?
默认直接用 Welch。合并方差(Student)法把两组方差合成一个 s_p,只有在两个总体方差真的相等时才成立;一旦方差不齐,尤其是样本量还不相等,结论会明显偏移。本页示例(82±6,n=32 与 78±9,n=30)方差比 2.25:Welch 给出 t = 2.04524、df = 50.06957、p = 0.046104,合并方差法给出 t = 2.071208、df = 60、p = 0.042648,两者恰好一个刚过 0.05 一个更小,落在同一条判定线附近时选错方法就会得出不同结论。至于「先做 F 检验或 Levene 检验判断方差齐不齐,再决定用哪种 t 检验」,现在多数统计教材已不推荐:这种两步法本身会扭曲最终的 I 类错误率,而 Welch 在方差恰好相等时几乎不损失效能(当 n₁ = n₂ 且 s₁ = s₂ 时它与合并方差法的结果完全相同),所以更省事也更稳妥的做法是一律用 Welch。R 语言的 t.test() 默认就是 Welch。
单侧检验和双侧检验怎么选?把双侧 p 值除以 2 就是单侧 p 值吗?
由 t 分布对称性,当 t 的方向和备择假设一致时,单侧 p 确实等于双侧 p 的一半(本页零件示例双侧 p = 0.037541,右侧 p = 0.01877);但方向相反时不能这么除,正确结果是 1 − 双侧 p/2,一定大于 0.5,必然不显著。关键不在算法而在时机:单侧检验必须在收集数据之前就凭专业理由确定方向(如新工艺在原理上只可能提升良率),若看完数据发现差异方向再改成单侧,实际的 I 类错误率就从 5% 变成了 10%,属于统计造假。同样地,临界值也不同:df = 19 时双侧 0.05 的临界值是 ±2.093024,单侧 0.05 只要 1.729133,这正是单侧更容易「显著」的原因。拿不准就用双侧,这也是论文与报告的通行口径。
t 检验和 z 检验、方差分析有什么区别?三组以上还能用 t 检验吗?
分工不同。z 检验要求总体标准差 σ 已知(或样本量很大到可以拿 s 当 σ 用),t 检验则是 σ 未知、只能用样本标准差 s 估计时的版本,代价是 t 分布尾部更厚、临界值更大——df = 19 时双侧 0.05 的临界值是 2.093024,而正态只要 1.96,自由度越大两者越接近,df 超过 10⁶ 本工具就直接按正态极限处理。方差分析(ANOVA)则是把 t 检验推广到三组及以上:三组以上不要两两做 t 检验,因为每做一次都有 5% 的假阳性概率,做 3 次「至少错一次」的概率就升到 1 − 0.95³ ≈ 14.3%,组数越多膨胀越快;正确做法是先做单因素方差分析看整体有没有差异,事后比较再用 Tukey HSD,或者坚持两两 t 检验但把 α 做 Bonferroni 校正(三次比较用 0.05/3 ≈ 0.0167)。另外,比较的是「比例/计数」而不是均值时(如转化率、合格率),该用卡方检验或比例检验,不是 t 检验。
t 检验结果和 Excel 的 T.TEST、SPSS 或 R 对不上,是什么原因?
先核对四件事,多数不一致都出在这里。① 检验类型:Excel 的 T.TEST 第 4 个参数 type,1 = 配对、2 = 合并方差双样本、3 = Welch 双样本,选 2 还是 3 结果不同;SPSS 的独立样本表格会同时给「假设方差相等」和「不假设方差相等」两行,要看对行。② 单双侧:T.TEST 第 3 个参数 tails 填 1 得到的是单侧 p,本工具默认双侧,两者相差一倍。③ 标准差口径:必须用样本标准差(除以 n−1,Excel 的 STDEV.S),若用了总体标准差(除以 n,STDEV.P)算出的 t 会偏大。④ 差值方向:t 的正负取决于哪组当第 1 组,交换两组只会改变符号,p 值不变。此外 R 的 t.test() 默认是 Welch,而不少教材默认合并方差,这也是常见的差异来源。四项都对齐后,本工具与它们的结果应在展示的 6 位小数内一致。