:從t分布、自由度到實(shí)戰(zhàn)應(yīng)用)
1. 為什么t檢驗(yàn)經(jīng)常被人繞暈三個(gè)概念的本質(zhì)區(qū)別先說個(gè)很常見的現(xiàn)象。很多人學(xué)t檢驗(yàn)的時(shí)候腦子里是這樣的t檢驗(yàn)要用t值t值要查t分布表所以t檢驗(yàn)、t值、t分布是一家人……但到底誰決定誰答案其實(shí)就一句話**t檢驗(yàn)是一種假設(shè)檢驗(yàn)的方法t值是這種方法算出來的一個(gè)統(tǒng)計(jì)量t分布是t值這個(gè)統(tǒng)計(jì)量所服從的概率分布。**三者之間是方法—結(jié)果—參照系的關(guān)系不是并列關(guān)系。借用生活里的場(chǎng)景打個(gè)比方。假設(shè)你要判斷一杯奶茶是不是標(biāo)準(zhǔn)糖你喝了三口心里得出這杯偏甜的結(jié)論——這是檢驗(yàn)。你給甜度打個(gè)分8分、9分、10分——這是值。但是你怎么知道8分算不算偏甜你腦子里有一個(gè)對(duì)標(biāo)準(zhǔn)糖奶茶甜度的分布概念——這是分布。沒有分布做參照值只是孤立數(shù)字無法判定沒有值檢驗(yàn)就落了空沒有檢驗(yàn)這個(gè)框架你只是嘗了杯奶茶什么都沒驗(yàn)證。在統(tǒng)計(jì)學(xué)語境里t檢驗(yàn)處理的問題是當(dāng)樣本數(shù)量不大、總體標(biāo)準(zhǔn)差未知時(shí)樣本均值和某個(gè)已知值或另一個(gè)樣本均值之間的差異到底是因?yàn)檎鎸?shí)存在還是抽樣誤差造成的巧合為什么要專門發(fā)明t檢驗(yàn)而不是直接用z檢驗(yàn)因?yàn)閦檢驗(yàn)有個(gè)苛刻前提——要么總體標(biāo)準(zhǔn)差已知現(xiàn)實(shí)中幾乎不可能要么樣本量足夠大比如超過30甚至更大可以用樣本標(biāo)準(zhǔn)差去近似。但大量真實(shí)業(yè)務(wù)場(chǎng)景的樣本量是10、15、25這個(gè)量級(jí)用正態(tài)近似會(huì)低估極端值出現(xiàn)的概率導(dǎo)致你把沒顯著差異誤判成有顯著差異。t分布就是專門為小樣本標(biāo)準(zhǔn)差未知這種場(chǎng)景設(shè)計(jì)的修正版正態(tài)分布。理解了這層邏輯后面所有公式和情節(jié)都順了你算出樣本均值和標(biāo)準(zhǔn)誤相除得到t值。問題來了——這個(gè)t值是大是小那就得看它在t分布這條曲線上的哪一端。若它落在尾部足夠遠(yuǎn)的區(qū)域尾巴尖對(duì)應(yīng)的概率p小于你事先劃好的臨界值比如0.05說明如果真相是沒差異很難觀察到這么極端的數(shù)據(jù)于是你拒絕原假設(shè)。整個(gè)過程t分布是裁決的標(biāo)尺頁面t值是你在標(biāo)尺上留下的刻度。2. t分布為什么是一族曲線自由度到底在說什么2.1 從不認(rèn)識(shí)的那個(gè)標(biāo)準(zhǔn)差開始t分布的形狀不是固定的。它的形狀完全由自由度決定自由度一般記作 dfdegree of freedom。自由度這個(gè)概念初學(xué)的人很難真正理解因?yàn)樗悬c(diǎn)繞。最直白的解釋是你在計(jì)算某個(gè)統(tǒng)計(jì)量時(shí)可以自由變化的數(shù)據(jù)個(gè)數(shù)。比如有5個(gè)數(shù)告訴你平均數(shù)是10那么前4個(gè)數(shù)你能隨便填第5個(gè)數(shù)就沒有自由了它必須等于50減前4個(gè)數(shù)的和。這里自由度就是4。放在t檢驗(yàn)語境下單樣本t檢驗(yàn)的自由度是n-1這個(gè)減1就是被樣本均值吃掉的一個(gè)自由度。自由度影響什么影響t分布的形狀尤其影響尾巴胖瘦。自由度小樣本量小時(shí)樣本標(biāo)準(zhǔn)差本身就不穩(wěn)定估計(jì)出來的標(biāo)準(zhǔn)誤會(huì)忽高忽低于是t分布比標(biāo)準(zhǔn)正態(tài)分布更矮胖——中間更低、尾巴更厚。這意味著同樣的t值在自由度小的時(shí)候落進(jìn)極端區(qū)域的難度更大。換句話說樣本量越小你需要越大的t值才能說明問題這是t檢驗(yàn)用起來比較痛苦的地方也是它嚴(yán)謹(jǐn)?shù)母?。自由度大的時(shí)候t分布逐漸逼近標(biāo)準(zhǔn)正態(tài)分布。當(dāng)df超過30兩條曲線的差異肉眼幾乎看不出來了df到50以上差異基本可以忽略。所以你會(huì)發(fā)現(xiàn)t表和z表后面的數(shù)值越來越接近這解釋了為什么實(shí)際工作中樣本量過30以后很多人直接按正態(tài)近似處理——雖然嚴(yán)謹(jǐn)?shù)恼f法是應(yīng)該看具體分布但工程上的確夠用了。2.2 自由度相等的那幾個(gè)分布家族用表格對(duì)比直觀一些自由度 df分布特征對(duì)應(yīng)的典型場(chǎng)景1極端矮胖尾巴特別厚峰度極高極少見幾乎沒有實(shí)際檢驗(yàn)用它10明顯比正態(tài)分布胖尾部更厚單樣本或配對(duì)樣本n11時(shí)30基本接近正態(tài)但尾部略厚常規(guī)研究常見界限60及以上幾乎等同于標(biāo)準(zhǔn)正態(tài)分布大樣本下可近似z檢驗(yàn)無窮大完全等于標(biāo)準(zhǔn)正態(tài)分布理論極限狀態(tài)所有t分布都是關(guān)于0對(duì)稱的這是它在數(shù)學(xué)推導(dǎo)中的特性分子上的樣本均值偏差有正有負(fù)對(duì)稱性來自均值的抽樣分布對(duì)稱。查t表的時(shí)候你只需要查一測(cè)的臨界值另一側(cè)的臨界值取相反數(shù)即可。3. t值公式背后的判斷邏輯分子分母的游戲3.1 公式核心信號(hào)除以噪聲各種t檢驗(yàn)的公式長(zhǎng)得不太一樣但拆開看就是一個(gè)基本骨架t 差異量 / 差異的抽樣誤差分子是信號(hào)——你觀察到的差異有多大分母是噪聲——這種差異有多不穩(wěn)定。t值就是信號(hào)與噪聲的比值。比值越大說明差異越不像隨機(jī)波動(dòng)搞出來的比值越小說明差異很可能就是抽樣運(yùn)氣。以單樣本t檢驗(yàn)為例公式是t (x? - μ?) / (s / √n)其中x?是樣本均值μ?是已知的參照值s是樣本標(biāo)準(zhǔn)差n是樣本量。分母s/√n就是標(biāo)準(zhǔn)誤表示樣本均值估計(jì)總體均值時(shí)固有的不確定性。這個(gè)公式的樣子藏著三層邏輯樣本均值離參照值越遠(yuǎn)分子越大t值越大證據(jù)越強(qiáng)。樣本標(biāo)準(zhǔn)差越小分母越小t值越大說明數(shù)據(jù)本身比較一致這個(gè)差異更可信。樣本量越大分母也越小同樣幅度的差異在更大樣本下更說明問題這不是玄學(xué)因?yàn)闃颖玖吭龃髸r(shí)均值估計(jì)的精確度提高了。反過來看為什么有時(shí)專業(yè)上顯著的差異統(tǒng)計(jì)上不顯著很有可能是樣本量太小分母太大信號(hào)被噪聲吞了。所以有人說統(tǒng)計(jì)不顯著不代表沒有差異只是證據(jù)不夠——這句話在t檢驗(yàn)語境下完全成立。3.2 三種常見t檢驗(yàn)的公式變體實(shí)際工作中t檢驗(yàn)的三個(gè)主要應(yīng)用場(chǎng)景都要掌握獨(dú)立樣本t檢驗(yàn)兩組人/兩組產(chǎn)品對(duì)比較。它的t值公式稍微復(fù)雜一點(diǎn)需要合并兩個(gè)樣本的方差t (x?? - x?? - (μ? - μ?)) / Sp·√(1/n? 1/n?)其中Sp是合并標(biāo)準(zhǔn)差自由度是n?n?-2。這里的減法部分通常是0因?yàn)樵僭O(shè)默認(rèn)兩組均值相等μ?-μ?0。配對(duì)樣本t檢驗(yàn)同一批被試前后的對(duì)比。先算每對(duì)數(shù)據(jù)的差值d再對(duì)差值做單樣本t檢驗(yàn)t d? / (Sd / √n)d?是差值均值Sd是差值的標(biāo)準(zhǔn)差n是對(duì)數(shù)。自由度為n-1。它的好處是抵消了個(gè)體間差異的影響——例如同一批人測(cè)訓(xùn)練前后的成績(jī)個(gè)體差異比較大時(shí)不做配對(duì)噪聲會(huì)大得可怕做了配對(duì)每個(gè)人只需要跟自己的以前比個(gè)體差異被消除檢驗(yàn)效率會(huì)高很多。Welch t檢驗(yàn)兩組樣本方差不相等時(shí)。這是獨(dú)立樣本t檢驗(yàn)的修正版分母不再用合并方差而是直接用兩組各自方差和樣本量的組合t (x?? - x??) / √(s?2/n? s?2/n?)自由度修正公式比較復(fù)雜一般統(tǒng)計(jì)軟件自動(dòng)計(jì)算但核心意思是不等方差時(shí)原來的t檢驗(yàn)失效需要這個(gè)修正。很多學(xué)者建議實(shí)際操作中直接默認(rèn)用Welch檢驗(yàn)因?yàn)樗容^安全——即使兩個(gè)總體方差其實(shí)是相等的它的檢驗(yàn)功效損失也非常小。3.3 一個(gè)具體例子幫你看懂公式假設(shè)你要驗(yàn)證某批次產(chǎn)品的平均重量是否等于標(biāo)準(zhǔn)值500g。抽了10個(gè)樣品算出平均重量504g樣本標(biāo)準(zhǔn)差10g。標(biāo)準(zhǔn)誤 10 / √10 ≈ 3.16 t (504 - 500) / 3.16 ≈ 1.27 自由度 10 - 1 9查t分布表df9時(shí)雙側(cè)0.05對(duì)應(yīng)的臨界值是2.262。你算出的t1.27比2.262小p值大于0.05不能拒絕原假設(shè)。結(jié)論是目前樣本數(shù)據(jù)不足以證明這批產(chǎn)品平均重量偏離標(biāo)準(zhǔn)值。這句話的措辭很關(guān)鍵。不是這批次就是標(biāo)準(zhǔn)重量而是數(shù)據(jù)不足以否認(rèn)它是標(biāo)準(zhǔn)重量。這個(gè)邏輯區(qū)分了統(tǒng)計(jì)學(xué)上的不能拒絕和接受很多入行不久的人在這里絆倒過。4. 從數(shù)據(jù)到結(jié)論的完整流程實(shí)際跑一次t檢驗(yàn)4.1 分析前的三道檢查t檢驗(yàn)不是把數(shù)據(jù)丟進(jìn)去就算完了。在實(shí)際操作中我會(huì)先做三件檢查少一件后面的結(jié)果都可能不靠譜。第一檢查分布形態(tài)。t檢驗(yàn)要求樣本均值在抽樣分布上近似正態(tài)。嚴(yán)格說是總體正態(tài)但中心極限定理說樣本量不是特別小的時(shí)候即使總體不是正態(tài)均值抽樣分布也傾向于正態(tài)。先畫一張QQ圖或直方圖確認(rèn)沒有嚴(yán)重的重尾或極端偏態(tài)。若尾部出現(xiàn)非正態(tài)最明顯的問題就是小樣本下的檢驗(yàn)功效被扭曲此時(shí)考慮非參數(shù)檢驗(yàn)替代更穩(wěn)。第二檢查方差齊性。獨(dú)立樣本t檢驗(yàn)有個(gè)默認(rèn)前提——兩組總體方差大致相等。Levene檢驗(yàn)或F檢驗(yàn)可以幫你看這一點(diǎn)。若方差相差懸殊而被忽略容易得到錯(cuò)誤的p值。穩(wěn)妥做法是直接看軟件輸出的Welch檢驗(yàn)結(jié)果SPSS里同時(shí)給出兩種結(jié)果R里面t.test函數(shù)默認(rèn)用的就是Welch檢驗(yàn)。第三檢查離群值。一個(gè)離群值可能把均值拉偏也可能把標(biāo)準(zhǔn)差撐大直接影響t值。這些檢查做完了才算真正進(jìn)入檢驗(yàn)這一步。4.2 實(shí)操示例用Python和SPSS分別跑一遍以經(jīng)典的比較兩組學(xué)生學(xué)習(xí)成績(jī)?yōu)槔鼳組用了新教學(xué)方法B組用傳統(tǒng)方法。數(shù)據(jù)如下A組10人B組12人。A組: 82, 85, 79, 88, 84, 90, 78, 92, 85, 87 B組: 75, 80, 72, 78, 70, 74, 71, 76, 68, 73, 79, 74在Python里from scipy import stats a [82, 85, 79, 88, 84, 90, 78, 92, 85, 87] b [75, 80, 72, 78, 70, 74, 71, 76, 68, 73, 79, 74] # 默認(rèn)執(zhí)行Welch t檢驗(yàn) t_stat, p_value stats.ttest_ind(a, b, equal_varFalse) print(ft值: {t_stat:.3f}, p值: {p_value:.4f}) # 效應(yīng)量Cohens d import numpy as np n1, n2 len(a), len(b) s1, s2 np.std(a, ddof1), np.std(b, ddof1) sp np.sqrt(((n1-1)*s1**2 (n2-1)*s2**2) / (n1n2-2)) d (np.mean(a) - np.mean(b)) / sp print(fCohens d: {d:.2f})輸出結(jié)果t≈5.16p0.001說明新教學(xué)方法的優(yōu)勢(shì)在統(tǒng)計(jì)上非常顯著。但要強(qiáng)調(diào)的是p值小不等于效應(yīng)大所以還要算效應(yīng)量Cohens d這個(gè)在上面代碼里約等于2.24說明兩組均值差距超過兩個(gè)聯(lián)合標(biāo)準(zhǔn)差效應(yīng)量相當(dāng)大。如果在SPSS里操作菜單選分析→比較平均值→獨(dú)立樣本T檢驗(yàn)把成績(jī)放入檢驗(yàn)變量組別放入分組變量定義組1和組2結(jié)果輸出框會(huì)同時(shí)給出Levene方差齊性檢驗(yàn)和t檢驗(yàn)結(jié)果。此時(shí)第一行看方差齊性p值若p0.05則讀假設(shè)方差相等那一行若p0.05則讀不假定等方差那行。這里單獨(dú)說一句**別只看p值是否小于0.05要同時(shí)看置信區(qū)間。**輸出結(jié)果里通常會(huì)給出均值差的95%置信區(qū)間如果區(qū)間不包含0說明兩組差異顯著如果區(qū)間很寬說明估計(jì)精度差即使p值顯著實(shí)際差異大小也可能在很大范圍內(nèi)浮動(dòng)。4.3 p值、置信區(qū)間、效應(yīng)量一個(gè)都不能少這些年我在實(shí)際項(xiàng)目里復(fù)盤過太多p值顯著但結(jié)論翻車的案例。p值回答的問題是如果真相是零看到這個(gè)結(jié)果的概率是多少它不回答差異有多大。要做完整結(jié)論三角閉環(huán)必須走完指標(biāo)回答的問題核心用途t值信號(hào)強(qiáng)不強(qiáng)相對(duì)于噪聲判斷是否達(dá)到統(tǒng)計(jì)顯著p值是否可能由隨機(jī)誤差造成是否拒絕原假設(shè)的依據(jù)95%置信區(qū)間差異可能落在什么范圍評(píng)估估計(jì)精度和實(shí)際意義Cohens d差異在實(shí)際中是大還是小判斷應(yīng)用價(jià)值所以報(bào)告結(jié)果時(shí)標(biāo)準(zhǔn)寫法是新教學(xué)方法的成績(jī)顯著高于傳統(tǒng)方法t(20)5.16p0.00195%CI [7.31, 16.69]Cohens d2.24。括號(hào)里的每個(gè)數(shù)字都有對(duì)應(yīng)的讀者價(jià)值少了哪個(gè)都不完整。5. 用錯(cuò)t檢驗(yàn)的常見坑這些年我見過的高頻翻車現(xiàn)場(chǎng)5.1 主動(dòng)或被動(dòng)的多重比較問題t檢驗(yàn)本身沒問題問題出在用太多次。假設(shè)你有一組數(shù)據(jù)包含5個(gè)不同版本的頁面設(shè)計(jì)你想兩兩比較哪種設(shè)計(jì)轉(zhuǎn)化率最高。于是你進(jìn)行了C(5,2)10次t檢驗(yàn)。每次檢驗(yàn)的錯(cuò)誤率是0.0510次做完至少出現(xiàn)一次假陽性的概率是1-(0.95)^10≈0.40。也就是說哪怕所有版本其實(shí)毫無差異你也有四成把握找出一個(gè)顯著差異而且這不是巧合是個(gè)數(shù)學(xué)預(yù)期。這類問題的修正思路是多組比較用方差分析ANOVA先看整體是否有差異整體顯著后再用事后檢驗(yàn)比如Tukey HSD做配對(duì)比較。如果堅(jiān)持用t檢驗(yàn)也得做Bonferroni校正——把顯著水平除以比較次數(shù)比如0.05/100.005所有p值小于0.005才算顯著。這個(gè)方法很保守但至少不會(huì)讓你在答辯時(shí)翻車。5.2 正態(tài)性檢查的兩種極端一種極端是不做任何分布檢查直接把所有數(shù)據(jù)丟進(jìn)t檢驗(yàn)。另一種極端是過度糾結(jié)非要讓數(shù)據(jù)完全符合正態(tài)分布否則就放棄t檢驗(yàn)。真實(shí)情況比教案復(fù)雜。t檢驗(yàn)對(duì)正態(tài)性的敏感度在樣本量小的時(shí)候真的很敏感但那時(shí)離群值和偏態(tài)影響也很大樣本量中等以上時(shí)中心極限定理會(huì)幫你兜底。我的判斷標(biāo)準(zhǔn)是先畫圖看再看偏度和峰度是否在可接受范圍內(nèi)比如偏度絕對(duì)值小于2峰度絕對(duì)值小于9極端值有沒有可能影響均值。如果數(shù)據(jù)嚴(yán)重偏態(tài)比如收入數(shù)據(jù)那樣的右偏考慮對(duì)數(shù)據(jù)做對(duì)數(shù)變換或者直接用Wilcoxon秩和檢驗(yàn)代替。5.3 把相關(guān)樣本錯(cuò)當(dāng)獨(dú)立樣本這是比較隱蔽的坑。典型場(chǎng)景同一批患者治療前和治療后測(cè)了某項(xiàng)指標(biāo)有人會(huì)把治療前和治療后當(dāng)作兩組獨(dú)立樣本來做獨(dú)立樣本t檢驗(yàn)。問題在哪獨(dú)立樣本t檢驗(yàn)假設(shè)兩組數(shù)據(jù)互相獨(dú)立但同一批人的前后測(cè)量天然相關(guān)——基線血壓高的人通常治療后血壓也偏高。這種相關(guān)性能讓獨(dú)立樣本t檢驗(yàn)的標(biāo)準(zhǔn)誤變大檢驗(yàn)功效下降本來不該被放過的差異可能被當(dāng)成不顯著放過了。正確做法是配對(duì)樣本t檢驗(yàn)。判斷標(biāo)準(zhǔn)很簡(jiǎn)單**這組數(shù)據(jù)的兩個(gè)樣本之間能不能找到配對(duì)關(guān)系**同一個(gè)體前后、同一個(gè)家庭夫妻之間、同一塊地的兩種肥料處理這些都是配對(duì)。5.4 只看p值忽略樣本量與實(shí)際意義樣本量越大p值越容易小。在公司做AB實(shí)驗(yàn)樣本動(dòng)輒幾十萬一個(gè)轉(zhuǎn)化率差0.1%的差異就能跑出p0.001。統(tǒng)計(jì)上顯著業(yè)務(wù)上可能毫無價(jià)值——你不可能因?yàn)?.1%的轉(zhuǎn)化率提升改版那樣成本覆蓋不了。反過來樣本量小時(shí)明明實(shí)際差異很大p值卻不夠顯著不能下無差異的結(jié)論只能說證據(jù)不足。我一直建議看結(jié)果時(shí)先問效應(yīng)量多大、置信區(qū)間多寬再糾結(jié)p值怎么寫。p值只是法院的判決書不是事實(shí)本身。5.5 t檢驗(yàn)被濫用在小樣本10以下時(shí)自由度小于10時(shí)t分布尾巴極厚對(duì)正態(tài)性偏離的敏感度大幅上升。這個(gè)時(shí)候除非你能確認(rèn)總體接近正態(tài)否則謹(jǐn)慎使用t檢驗(yàn)。樣本只有6、7個(gè)時(shí)直接用非參數(shù)檢驗(yàn)Mann-Whitney U等反而更穩(wěn)妥。20以上的樣本量t檢驗(yàn)的穩(wěn)健性才真正發(fā)揮出來。6. 一個(gè)完整案例走一遍從業(yè)務(wù)問題到統(tǒng)計(jì)結(jié)論6.1 業(yè)務(wù)場(chǎng)景與數(shù)據(jù)準(zhǔn)備某食品廠質(zhì)檢員懷疑一批灌裝酒的凈含量不達(dá)標(biāo)。規(guī)格要求每瓶500ml隨機(jī)抽了16瓶實(shí)測(cè)如下單位ml498, 501, 497, 503, 496, 499, 502, 500, 495, 501, 498, 497, 504, 496, 499, 500這里要回答的核心業(yè)務(wù)問題是這批酒是否顯著低于500ml的標(biāo)準(zhǔn)線注意這里用顯著低于而不是低于——因?yàn)槌闃诱`差存在16瓶的均值恰好499.3ml并不能直接斷言生產(chǎn)線有偏差要看這個(gè)偏差在抽樣誤差的背景噪音下是否站得住。6.2 執(zhí)行檢驗(yàn)并解讀結(jié)果用單樣本t檢驗(yàn)已知總體均值μ?500先算出樣本均值x?≈499.25ml樣本標(biāo)準(zhǔn)差s≈2.54ml標(biāo)準(zhǔn)誤s/√n≈0.635ml。t (499.25 - 500) / 0.635 ≈ -1.18查t分布表自由度df15單側(cè)0.05的臨界值約1.753。此時(shí)要看負(fù)t值是否小于-1.753。算出來的-1.18并不比-1.753更極端所以p值約為0.13大于0.05不能拒絕原假設(shè)。結(jié)論表述抽樣數(shù)據(jù)不足以證明這批灌裝酒的平均凈含量顯著低于500ml但從置信區(qū)間看總體均值95%的置信區(qū)間估計(jì)是[497.9, 500.6]ml下限略低于500狀態(tài)不算理想。可以通知生產(chǎn)線關(guān)注灌裝頭校準(zhǔn)但不構(gòu)成整批退貨的證據(jù)。這個(gè)案例里單側(cè)檢驗(yàn)的方向選擇很重要——因?yàn)闃I(yè)務(wù)關(guān)心的只是是否低于不是是否不等于所以用單側(cè)檢驗(yàn)檢驗(yàn)功效更高。很多初學(xué)者習(xí)慣性地只用雙側(cè)結(jié)果是更容易得到不顯著的結(jié)論。實(shí)際業(yè)務(wù)中方向性假設(shè)要用方向性檢驗(yàn)但要事先確定方向不能看了數(shù)據(jù)再?zèng)Q定用單側(cè)那樣p值會(huì)被人為壓小是不誠(chéng)實(shí)的做法。6.3 踩過的坑與經(jīng)驗(yàn)總結(jié)這個(gè)案例雖然簡(jiǎn)單但有幾個(gè)細(xì)節(jié)值得單獨(dú)說。第一個(gè)是數(shù)據(jù)出現(xiàn)495這樣的離群低值時(shí)先做一次排查是測(cè)量?jī)x器誤差、記錄筆誤還是真實(shí)產(chǎn)品問題如果測(cè)量無誤這個(gè)點(diǎn)應(yīng)該保留。t檢驗(yàn)對(duì)離群值敏感是事實(shí)但動(dòng)不動(dòng)就刪數(shù)據(jù)是更大的罪過。先找原因再?zèng)Q定保留還是剔除而不是讓數(shù)據(jù)遷就你的顯著結(jié)果。第二個(gè)是顯著和重要的關(guān)系。這個(gè)例子里p0.13不顯著但如果樣本量擴(kuò)大到60瓶同樣的均值差異可能會(huì)變得顯著。差異的絕對(duì)量只有0.75ml業(yè)務(wù)上可能完全可以接受。這個(gè)時(shí)候統(tǒng)計(jì)檢驗(yàn)告訴你的是證據(jù)強(qiáng)度業(yè)務(wù)決策還要疊加成本、標(biāo)準(zhǔn)、風(fēng)險(xiǎn)容忍度。第三個(gè)我覺得最值得記是把原始數(shù)據(jù)保存好記錄每一次分析步驟。t檢驗(yàn)結(jié)果在論文或報(bào)表里看起來是一行數(shù)據(jù)但背后是整個(gè)分析鏈路。別人復(fù)核時(shí)你至少能清清楚楚告訴對(duì)方數(shù)據(jù)哪里來、清洗過沒有、為什么用單側(cè)、為什么保留/剔除某個(gè)離群值。這些元信息比p值本身重要得多它們決定了你的結(jié)論能不能經(jīng)得起推敲。