理統(tǒng)計核心概念:從隨機試驗到統(tǒng)計推斷)
1. 從最底層的“概率到底算什么”說起很多人學(xué)概率論與數(shù)理統(tǒng)計第一個卡住的地方不是公式而是不知道這些符號到底在描述什么。我當(dāng)年也是這樣。后來想通了概率論整個學(xué)科就是在回答一個問題——在不確定的世界里我們怎么用數(shù)學(xué)語言描述“某個結(jié)果會不會發(fā)生”這件事。帶著這個角度去讀定義一切都順了。1.1 隨機試驗、樣本空間與事件的定義先看三個基石概念。隨機試驗指的是在相同條件下可以重復(fù)進行、但每次結(jié)果不唯一且無法提前預(yù)知的試驗。注意三個關(guān)鍵點可重復(fù)、結(jié)果不唯一、事前不確定。拋硬幣是隨機試驗擲骰子是隨機試驗測量一批燈泡的壽命也是隨機試驗。樣本空間是一個隨機試驗所有可能結(jié)果的集合習(xí)慣記作Ω。用最簡單的話說就是這個試驗“可能出現(xiàn)的每一種情況”放進一個集合里。比如擲一顆骰子樣本空間就是{1,2,3,4,5,6}。如果試驗是記錄某個路口一小時內(nèi)通過的車流量樣本空間就是非負整數(shù)集合{0,1,2,...}是無限可列的。事件是樣本空間的子集也就是“若干個可能結(jié)果組成的集合”。比如擲骰子“出現(xiàn)偶數(shù)”就是一個事件對應(yīng)集合{2,4,6}。事件通常用大寫字母A、B、C表示。我一直跟朋友說這三者的關(guān)系就像“考場、所有考生的座位號、你關(guān)心的某些座位的集合”。樣本空間是考場里所有座位事件是你畫了圈的那些座位。這樣類比以后后面所有公式都不會再“懸空”。1.2 事件的關(guān)系與運算并、交、差、對立事件也是集合所以集合的交、并、補在事件里都有對應(yīng)而且每個運算背后都掛著具體的概率意義。事件A與事件B的并記作A∪B表示“A發(fā)生或B發(fā)生”至少有一個發(fā)生即可。交記作A∩B表示“A和B同時發(fā)生”。差記作A?B表示“A發(fā)生但B不發(fā)生”。對立事件記作A?表示“A不發(fā)生”對應(yīng)集合運算里的補集。這里最容易搞混的是“互斥”和“對立”。互斥是A∩B?意思兩者不可能同時發(fā)生對立即A∩B?且A∪BΩ不僅不同時發(fā)生而且兩者必有一個發(fā)生?;コ庵皇恰袄纤啦幌嗤鶃怼睂α⑹恰安皇悄闼谰褪俏一睢薄;コ馐录灰欢▽α⒌珜α⑹录欢ɑコ狻_€有一個很實用的運算規(guī)律是德摩根定律A∪B的對立事件等于A?∩B?A∩B的對立事件等于A?∪B?。翻譯成人話就是“都不發(fā)生”等于“不是A發(fā)生也不是B發(fā)生”而“不是同時發(fā)生”等于“至少有一個不發(fā)生”。做復(fù)雜事件的概率拆解時德摩根定律能幫你把難算的“至少”“都不”轉(zhuǎn)化成好算的形式。1.3 概率的公理化定義與三條件概率的公理化定義是柯爾莫哥洛夫給出的它最大的貢獻是把之前各種“概率是啥”的爭論統(tǒng)一成一個嚴(yán)謹框架對于一個事件A賦予一個實數(shù)P(A)叫作概率它只需要滿足三條件。非負性對任意事件AP(A)≥0。規(guī)范性P(Ω)1也就是說整個樣本空間發(fā)生的概率是1這是“一定會發(fā)生”的那件事??闪锌杉有詫τ趦蓛苫ゲ幌嗳莸氖录嗀?,A?,...有P(∪A?)∑P(A?)。簡單說就是彼此不重疊的事件它們至少發(fā)生一個的概率等于各自概率之和。三個條件并不抽象非負性保證概率不能是負數(shù)規(guī)范性把總概率錨定在1可列可加性給了我們“分情況相加”的口算依據(jù)。由這三條還能推出一堆重要性質(zhì)比如P(?)0P(A?)1?P(A)以及P(A∪B)P(A)P(B)?P(A∩B)。有一條性質(zhì)被無數(shù)人忽略但我認為它才是概率計算最常用的工具當(dāng)事件比較復(fù)雜時先算它的對立事件往往更輕松。比如“n個人中至少有兩人生日相同”的概率直接算要分2人相同、3人相同……算到懷疑人生反過來算“所有人都不相同”的概率只需要一個連續(xù)乘積公式再用1一減就完成。這個思路會陪伴你整個概率論課程。2. 把計算從“數(shù)數(shù)”升級成“推理”概率的計算有兩種底層路徑一種是靠“數(shù)清楚”所有情況另一種是靠“已知信息去推理”。前者對應(yīng)古典概型后者對應(yīng)條件概率和貝葉斯公式。2.1 古典概型與排列組合古典概型是所有概率模型里最樸素、最容易被接受的一種它成立需要兩個前提樣本空間是有限集合并且每個基本結(jié)果出現(xiàn)的可能性相同。“等可能”這個條件是靈魂也是考卷里最常給你設(shè)陷阱的地方。在古典概型中事件A的概率等于A包含的基本事件數(shù)除以樣本空間的基本事件總數(shù)記作P(A)|A|/|Ω|。實際操作時最需要注意的是“等可能”是否真的成立。拋一枚均勻硬幣正面和反面等可能但如果硬幣本身不均勻古典概型就不適用了。再比如“兩枚硬幣一正一反”和“兩枚都是正面”雖然從事件種類上看都是1種情況但如果把兩枚硬幣視為不同個體樣本空間應(yīng)該是{(正,正),(正,反),(反,正),(反,反)}一正一反對應(yīng)2種結(jié)果概率不是1/3而是1/2。做古典概型題我建議永遠問自己三個問題試驗的樣本空間有沒有寫全每個基本結(jié)果是不是真的等可能題目里涉及的是一步試驗還是多步試驗這三個問題想清楚了排列組合公式只是拿來算數(shù)的工具不會影響你的建模思路。2.2 幾何概型無窮場景下的“均勻”當(dāng)樣本空間里的結(jié)果是不可數(shù)的“連續(xù)區(qū)域”時古典概型就失效了因為“數(shù)量”沒法數(shù)。幾何概型把古典概型里的“個數(shù)之比”替換成“測度之比”。測度在二維平面里就是面積在一維直線里就是長度在三維空間里就是體積。幾何概型的核心仍是等可能只是這時候“等可能”被翻譯成均勻分布的思想每個點的出現(xiàn)機會均等于是概率等于目標(biāo)區(qū)域測度與總區(qū)域測度之比。最經(jīng)典的例子是“會面問題”兩人約定在某段時間到達先到者等一刻鐘后離開求兩人能碰面的概率。這個問題把到達時間畫成平面上的點再用幾何區(qū)域面積比例求解思路非常直觀。學(xué)幾何概型最大的收獲其實是“把隨機問題圖像化”一旦把概率畫成了面積抽象的概率就被翻譯成了可計算的幾何體。2.3 條件概率與獨立性的本質(zhì)條件概率定義很簡單在事件B已發(fā)生的條件下事件A發(fā)生的概率記作P(A|B)等于P(A∩B)/P(B)要求P(B)0。很多人記不住這個公式其實可以這樣想既然B已經(jīng)發(fā)生樣本空間就從Ω縮小成了B那A在“新樣本空間B”里所占的比例就是A∩B占B的比例。條件概率不是新東西它只是在“縮小樣本空間”之后的普通概率。由條件概率的定義可以直接推出乘法公式P(A∩B)P(B)P(A|B)P(A)P(B|A)。做兩步試驗時這個公式特別管用比如“先抽一張牌不放回再抽一張”的連續(xù)概率就得靠乘法公式一層層套。獨立性是另一個高頻概念。事件A與事件B獨立定義是P(A∩B)P(A)P(B)。注意數(shù)學(xué)上的獨立性不等于日常語言里的“沒關(guān)系”它強調(diào)的是“B是否發(fā)生不影響A發(fā)生的概率”也就是P(A|B)P(A)。如果根據(jù)實際背景就能判斷A的發(fā)生不會改變B的概率那么可以直接用乘積公式而不用真的去驗證定義。很多人混淆“互斥”和“獨立”?;コ馐录馕吨鳤和B不能同時發(fā)生一旦A發(fā)生了B必然不發(fā)生所以只要P(A)和P(B)都大于0互斥事件就不可能獨立。這個坑每年都有人踩。2.4 全概率公式和貝葉斯公式的實戰(zhàn)理解當(dāng)一件復(fù)雜事件C被分割成若干互斥的原因A?,A?,...,A?時P(C)可以通過分情況相加得到這就是全概率公式P(C)P(A?)P(C|A?)P(A?)P(C|A?)...P(A?)P(C|A?)核心在于找到一組“互斥且完整”的原因集合A?到A?它們把樣本空間完整切割開。比如一個產(chǎn)品可能來自甲乙丙三個車間次品率各不同現(xiàn)在要求總次品率就把“來自甲車間且是次品”“來自乙車間且是次品”“來自丙車間且是次品”三部分分別算出來再相加。貝葉斯公式解決的是反向問題當(dāng)一件結(jié)果已經(jīng)發(fā)生想反推是哪個原因?qū)е碌?。公式形如P(A?|C)[P(A?)P(C|A?)]/∑P(A?)P(C|A?)。這個公式看起來復(fù)雜本質(zhì)上只是“把條件概率方向調(diào)轉(zhuǎn)”。我建議不要死記字母要理解結(jié)構(gòu)分子是“選中第i條路徑的概率”分母是“所有路徑的總概率”兩者一比就是“在總結(jié)果中第i條路徑貢獻的占比”。醫(yī)學(xué)檢測、垃圾郵件識別、機器學(xué)習(xí)里的樸素貝葉斯分類器底層都是這個公式。3. 隨機變量概率論的核心抽象概率論真正強大的地方是把“隨機事件”從語言描述轉(zhuǎn)換成數(shù)學(xué)函數(shù)這個函數(shù)就是隨機變量。3.1 隨機變量的定義與分布函數(shù)隨機變量是定義在樣本空間Ω上的實值函數(shù)記作XX(ω)它把每個隨機試驗結(jié)果ω映射成一個實數(shù)。比如擲硬幣可以規(guī)定正面為1、反面為0記錄產(chǎn)品壽命得到的就是實數(shù)。隨機變量分成兩大類。離散型隨機變量只取有限個或可列無限個值連續(xù)型隨機變量的取值充滿某個區(qū)間無法逐個列舉。描述隨機變量最重要的工具是分布函數(shù)F(x)P(X≤x)。分布函數(shù)是萬能描述方式不管離散還是連續(xù)都能用它統(tǒng)一刻畫。它的性質(zhì)單調(diào)不減、右連續(xù)、當(dāng)x→?∞時趨于0、當(dāng)x→∞時趨于1。分布函數(shù)的意義在于把“概率”轉(zhuǎn)換成“函數(shù)”之后微積分工具就能進場了。對于連續(xù)型隨機變量還有一個概念叫概率密度函數(shù)f(x)滿足F(x)∫?∞? f(t)dt。密度函數(shù)不是概率本身它的值可以大于1真正表示概率的是曲線下的面積。這個概念初學(xué)者非常容易誤解看到密度值超過1就覺得不可能其實這恰恰說明密度函數(shù)和概率是兩回事。3.2 離散型隨機變量的常見分布離散分布里有幾個你必須形成條件反射的模型。0-1分布伯努利分布隨機變量只取0和1P(X1)p。一次試驗只有兩種結(jié)果時用它比如產(chǎn)品合格與否、一次射擊是否命中。二項分布X~B(n,p)描述n重伯努利試驗中成功次數(shù)的分布概率公式P(Xk)C(n,k)p?(1?p)???。它的前提是n次試驗相互獨立每次成功概率p相同。應(yīng)用場景流水線抽檢n件產(chǎn)品、考試中做n道獨立判斷題等。泊松分布X~P(λ)概率公式P(Xk)λ?e?λ/k!。它描述稀有事件在固定時間或空間內(nèi)發(fā)生次數(shù)的分布比如某站點一小時內(nèi)接到的投訴電話數(shù)、一頁書上印刷錯誤的個數(shù)。泊松分布還有一個重要用法當(dāng)n很大、p很小時可以用泊松分布近似二項分布取λnp工程上“小概率事件的大量重復(fù)”都可這么近似。離散分布的概率值只要把數(shù)值代入公式就能算難點都在建模判斷題目場景符不符合“獨立重復(fù)試驗”“事件稀有”等假設(shè)。3.3 連續(xù)型隨機變量的常見分布連續(xù)分布里最重要的幾個每個都對應(yīng)一類典型場景。均勻分布X~U(a,b)在區(qū)間(a,b)內(nèi)密度為常數(shù)1/(b?a)區(qū)間外為0。它的意義是“區(qū)間內(nèi)每個點機會均等”和幾何概型的思想完全一致。指數(shù)分布密度函數(shù)為f(x)λe?λxx0常用它描述獨立隨機事件發(fā)生的間隔時間比如設(shè)備兩次故障之間的時間、電話間隔時長。指數(shù)分布最大的特點是無記憶性P(Xst|Xs)P(Xt)。意思是“已經(jīng)在等一輛車等了s分鐘再需要等t分鐘以上的概率”和“剛開始等就等t分鐘以上的概率”一樣之前的等待完全不影響剩余等待時間。正態(tài)分布X~N(μ,σ2)這是整個概率論里出場率最高的分布。它的密度函數(shù)呈鐘形曲線均值μ決定中心位置方差σ2決定離散程度。一個重要結(jié)論是標(biāo)準(zhǔn)化如果X~N(μ,σ2)那么Z(X?μ)/σ服從標(biāo)準(zhǔn)正態(tài)分布N(0,1)。所有正態(tài)分布的概率計算都可以先標(biāo)準(zhǔn)化再查標(biāo)準(zhǔn)正態(tài)分布表。對于正態(tài)分布還有一條著名的經(jīng)驗法則約68%的數(shù)據(jù)落在μ±σ內(nèi)約95%落在μ±2σ內(nèi)約99.7%落在μ±3σ內(nèi)。質(zhì)量控制領(lǐng)域常說的“3σ原則”就來源于此。3.4 隨機變量函數(shù)的分布隨機變量X的某個函數(shù)Yg(X)本身也是一個隨機變量要求它的分布通常有兩條路。如果X是離散型把X取值代入g(X)得到Y(jié)的取值再把相同取值的概率合并相加即可。這種“變量替換”思路比較機械唯獨要注意合并相同值。如果X是連續(xù)型常用分布函數(shù)法先寫出Y的分布函數(shù)F_Y(y)P(Y≤y)P(g(X)≤y)轉(zhuǎn)化為關(guān)于X的不等式再用X的分布函數(shù)或密度函數(shù)去計算最后對y求導(dǎo)得到Y(jié)的密度函數(shù)。這個方法步驟多但套路固定只要把“≤y”對應(yīng)的X區(qū)域找對剩下都是微積分。還有一種更省事的場景當(dāng)g(X)是嚴(yán)格單調(diào)函數(shù)時可以用公式法直接求密度函數(shù)f_Y(y)f_X(h(y))·|h(y)|其中h是g的反函數(shù)。比如X服從均勻分布U(0,1)令Y?ln(1?X)可以直接算出Y服從參數(shù)為1的指數(shù)分布。這類變換在隨機模擬和數(shù)理統(tǒng)計里經(jīng)常出現(xiàn)可以說是“用已知分布生成新分布”的萬能鑰匙。4. 二維隨機變量與多維世界的關(guān)聯(lián)單個隨機變量只能描述一個指標(biāo)但現(xiàn)實問題通常同時涉及多個指標(biāo)。二維隨機變量是把兩個隨機變量作為一個整體研究重點在于它們之間的關(guān)聯(lián)。4.1 聯(lián)合分布、邊緣分布和條件分布設(shè)有兩個隨機變量X和Y二元函數(shù)F(x,y)P(X≤x,Y≤y)叫聯(lián)合分布函數(shù)。它描述的是“兩個條件同時滿足”的概率相當(dāng)于從整體上刻畫整個隨機向量的分布。由聯(lián)合分布可以“擠出”單個變量的分布叫邊緣分布。具體做法是讓另一個變量取遍所有可能值對離散型就是把另一個變量的所有取值概率加總對連續(xù)型就是對另一個變量積分。邊緣分布表達了“不管另一個變量取什么只看這個變量的分布”相當(dāng)于把二維表格按行或列求和。條件分布則是在限定一個變量取值后另一個變量的概率分布。離散型就是條件概率公式的直接套用連續(xù)型需要借助密度函數(shù)定義條件密度f(x|y)f(x,y)/f_Y(y)。這里要特別注意給定哪個變量作為條件、分母用哪個邊緣密度位置反了結(jié)果就完全不對。我個人理解聯(lián)合、邊緣、條件三者的關(guān)系就像一張“人員登記表”聯(lián)合分布是完整表格邊緣分布是只看某一列的數(shù)據(jù)匯總條件分布是篩選出某一行之后再看另一列的情況。4.2 隨機變量的獨立性判斷兩個隨機變量X和Y獨立最嚴(yán)謹?shù)亩x是對任意實數(shù)x,y聯(lián)合分布函數(shù)等于邊緣分布函數(shù)的乘積F(x,y)F_X(x)·F_Y(y)。連續(xù)型等價于聯(lián)合密度等于邊緣密度的乘積f(x,y)f_X(x)·f_Y(y)離散型等價于聯(lián)合概率等于邊緣概率的乘積。但實際做題時我?guī)缀醪粫娴娜ヲ炞C這個定義。更多的判斷方式是如果題目背景上兩個變量來自彼此獨立的試驗、互不影響直接認定獨立即可如果背景不明確再通過分布是否可分離來判斷。連續(xù)型函數(shù)里有一個隱蔽技巧——如果聯(lián)合密度f(x,y)可以拆成“只含x的函數(shù)”乘以“只含y的函數(shù)”且定義域是矩形區(qū)域那么X和Y獨立。但如果定義域本身有約束比如0xy1即使密度能拆成乘積形式X和Y也不獨立因為取值范圍相互糾纏。獨立性的意義在于簡化計算獨立條件下隨機變量函數(shù)的期望可以拆成期望的乘積具有可加性方差則更簡單協(xié)方差項為0。4.3 協(xié)方差與相關(guān)系數(shù)關(guān)聯(lián)程度的度量概率論里衡量兩個隨機變量之間線性關(guān)系的兩個核心指標(biāo)是協(xié)方差和相關(guān)系數(shù)。協(xié)方差定義為Cov(X,Y)E[(X?EX)(Y?EY)]展開后等于E(XY)?EX·EY。協(xié)方差的正負反映了兩個變量同向或反向變化的趨勢正數(shù)表示X增大時Y傾向于增大負數(shù)表示反向。但協(xié)方差的數(shù)值受量綱影響很大比如把單位從米換成厘米協(xié)方差數(shù)值就變大了但實際相關(guān)程度沒變。于是引入相關(guān)系數(shù)ρCov(X,Y)/(σ_X·σ_Y)它把協(xié)方差標(biāo)準(zhǔn)化到區(qū)間[?1,1]內(nèi)。|ρ|越接近1線性關(guān)系越強ρ0稱“不相關(guān)”注意不相關(guān)只表示沒有線性關(guān)系并不代表獨立。獨立一定不相關(guān)但不相關(guān)不一定獨立除非兩個變量服從聯(lián)合正態(tài)分布。這個區(qū)別讓無數(shù)人栽跟頭。我建議凡是遇到“獨立”和“不相關(guān)”的判斷題先問一句題目給出的是正態(tài)分布嗎如果沒說是正態(tài)就不能擅自把“不相關(guān)”升級成“獨立”。5. 數(shù)字特征把分布濃縮成幾個數(shù)完整的分布函數(shù)包含的信息太多了實際使用時不方便。于是概率論提供了幾個“濃縮指標(biāo)”用幾個數(shù)粗略刻畫分布的主要特征。5.1 數(shù)學(xué)期望的定義與理解數(shù)學(xué)期望通俗講就是按概率加權(quán)的平均值。離散型隨機變量的期望為EX∑x?p?連續(xù)型為EX∫xf(x)dx。如果從頻率派角度理解當(dāng)試驗次數(shù)足夠多時樣本均值會穩(wěn)定接近數(shù)學(xué)期望。期望有幾個重要性質(zhì)做題時會反復(fù)用到E(C)C常數(shù)的期望是它本身E(CX)C·EX常數(shù)可以提出去E(XY)EXEY和的期望等于期望之和若X與Y獨立則E(XY)EX·EY。我特別強調(diào)第三第四條期望的線性性永遠成立不需要任何前提但乘積可拆的條件是獨立。有些同學(xué)做著做著就把E(XY)隨手寫成EX·EY結(jié)果在非獨立場合翻車。期望一個最容易讓人忽略的地方是“期望不一定會發(fā)生”。比如擲骰子的期望是3.5但骰子永遠不會擲出3.5。所以期望只是描述分布的“中心位置”不代表“最可能的結(jié)果”。5.2 方差與標(biāo)準(zhǔn)差的含義方差定義為Var(X)E[(X?EX)2]描述的是隨機變量取值偏離期望的程度。方差越大說明取值越分散方差越小取值越集中。展開后更方便計算的形式是Var(X)E(X2)?(EX)2。標(biāo)準(zhǔn)差σ是方差的算術(shù)平方根它的實際價值在于量綱和原變量一致。比如身高單位是厘米方差單位是平方厘米標(biāo)準(zhǔn)差又回到厘米。方差的性質(zhì)也很重要Var(C)0常數(shù)沒有波動Var(CX)C2·Var(X)注意系數(shù)要平方若X與Y獨立則Var(XY)Var(X)Var(Y)。獨立才可加這是和期望最大的不同一般場合下Var(XY)Var(X)Var(Y)2Cov(X,Y)。方差計算中一個高頻易錯點用定義算E(X2)時不能拿(EX)2代替。很多題目故意把E(X2)和(EX)2混在一起只要記住“期望是平均平方是整體”就不會被繞暈。5.3 矩、協(xié)方差矩陣與更高階信息期望和方差只是前兩階矩。嚴(yán)格來說E(X?)稱為X的k階原點矩E(X?EX)?稱為k階中心矩。一階原點矩是期望二階中心矩是方差三階中心矩刻畫偏斜方向四階中心矩和分布峰度相關(guān)。對多維隨機變量把兩兩協(xié)方差排列成矩陣就得到協(xié)方差矩陣。比如二維隨機變量(X,Y)的協(xié)方差矩陣是對稱矩陣主對角線是方差副對角線是協(xié)方差。許多多元統(tǒng)計方法從主成分分析到線性判別分析底層都要先構(gòu)造協(xié)方差矩陣它可以說是多維數(shù)據(jù)的初步“體檢報告”。我自己的經(jīng)驗是學(xué)數(shù)字特征不要只背公式要有“用幾個數(shù)字講述分布特征”的意識。期望講中心、方差講離散、偏度講對稱、峰度講集中這幾個數(shù)組合起來比單看一個密度函數(shù)曲線要直觀得多。6. 大數(shù)定律與中心極限定理從個別走向整體概率論的理論價值集中體現(xiàn)在極限定理上當(dāng)試驗次數(shù)或樣本量足夠大時隨機現(xiàn)象會呈現(xiàn)出一種穩(wěn)定的規(guī)律性。6.1 大數(shù)定律的直觀與表述大數(shù)定律的核心思想用一句話說就是當(dāng)獨立重復(fù)試驗次數(shù)足夠多時樣本均值會依概率收斂于總體均值。最常見的表述是辛欽大數(shù)定律設(shè)X?,X?,...,X?是獨立同分布的隨機變量且E(X?)μ存在則對任意ε0有l(wèi)im P(|(1/n)∑X??μ|ε)1。翻譯成人話只要你不斷重復(fù)做同一件隨機試驗把結(jié)果平均出來這個平均值會越來越靠近理論期望。這就是“頻率的穩(wěn)定性”的數(shù)學(xué)表達也是古典概率中“概率可用頻率估計”這個想法的最嚴(yán)格背書。大數(shù)定律還有一個經(jīng)典應(yīng)用是蒙特卡洛方法想算一個復(fù)雜量的期望直接解析算不出來就直接做海量隨機模擬把樣本均值當(dāng)近似值。計算機里的隨機模擬為什么能工作靠的正是大數(shù)定律。我學(xué)這部分時最深的體會是“隨機”不等于“混亂”。大量獨立隨機個體疊加之后個體的隨機性被相互抵消整體反而會呈現(xiàn)規(guī)律這個哲學(xué)就是大數(shù)定律在說話。6.2 中心極限定理的核心思想中心極限定理回答的是另一個問題大量獨立隨機變量之和近似服從什么分布最常用的版本是這樣的設(shè)X?,X?,...,X?獨立同分布E(X?)μVar(X?)σ20則當(dāng)n足夠大時標(biāo)準(zhǔn)化后的樣本均值Z(X??μ)/(σ/√n)近似服從標(biāo)準(zhǔn)正態(tài)分布N(0,1)。它最驚人的地方在于不管原始分布是什么形態(tài)只要獨立同分布、方差存在只要n足夠大樣本均值的分布就都會收斂到正態(tài)分布。這解釋了為什么自然界和工程中正態(tài)分布無處不在——因為很多現(xiàn)象本質(zhì)上是大量微小隨機因素疊加的結(jié)果。很多教材喜歡強調(diào)它“近似計算二項分布概率”的功能當(dāng)n較大np和n(1?p)都不太小時可用正態(tài)分布近似二項分布。但在實際數(shù)據(jù)分析里中心極限定理更重要的價值是它支持了“在大樣本下樣本均值的抽樣分布近似正態(tài)”這個結(jié)論而這正是之后區(qū)間估計和假設(shè)檢驗的理論根基。6.3 抽樣分布從總體到樣本的橋梁從總體里抽出一部分個體計算統(tǒng)計量統(tǒng)計量本身也是隨機變量它的分布就叫抽樣分布。最重要的三個抽樣分布分別是卡方分布、t分布和F分布。它們都是從標(biāo)準(zhǔn)正態(tài)分布派生出來的卡方分布若Z?,...,Z?獨立同服從標(biāo)準(zhǔn)正態(tài)分布則它們的平方和服從自由度為k的卡方分布記作χ2(k)。它常用于方差估計和擬合優(yōu)度檢驗。t分布隨機變量TZ/√(V/k)其中Z服從標(biāo)準(zhǔn)正態(tài)分布V服從卡方分布且與Z獨立則T服從自由度為k的t分布。t分布形狀和標(biāo)準(zhǔn)正態(tài)很像但尾部更厚小樣本時優(yōu)勢明顯。F分布兩個獨立卡方變量分別除以各自自由度后的比值服從F分布。它主要用于方差分析、回歸分析中的假設(shè)檢驗。抽樣分布是整個數(shù)理統(tǒng)計的“幕后工作者”學(xué)假設(shè)檢驗時經(jīng)常要查這三張表。我建議你先記住一個結(jié)論從正態(tài)總體中抽樣時樣本均值經(jīng)過標(biāo)準(zhǔn)化后服從t分布方差未知時樣本方差除以總體方差的比值服從卡方分布。如果你不想記太多公式就把這三個分布的“出身”和“用途”刻在腦子里遇到檢驗題時自然知道選哪張表。7. 數(shù)理統(tǒng)計用樣本推斷總體數(shù)理統(tǒng)計和概率論的方向剛好相反。概率論是“已知分布推概率”數(shù)理統(tǒng)計是“已知部分數(shù)據(jù)反過來猜總體是什么樣的”。7.1 總體、樣本和統(tǒng)計量的定義總體是研究對象的全體通常用一個隨機變量X表示個體是總體中的每個單位樣本是從總體中抽取的一部分個體寫成X?,X?,...,X?。簡單隨機樣本是數(shù)理統(tǒng)計里最常用的樣本模型要求樣本中的每個個體都獨立且與總體同分布簡寫為“獨立同分布”。這個假設(shè)非常重要整個經(jīng)典統(tǒng)計推斷基本都以它為起點。統(tǒng)計量是不含未知參數(shù)的樣本函數(shù)比如樣本均值X?(1/n)∑X?樣本方差S21/(n?1)∑(X??X?)2。注意樣本方差分母用n?1而不是n這是為了滿足無偏性的要求如果除以n會系統(tǒng)性低估總體方差除以n?1樣本方差的期望才能恰好等于總體方差。統(tǒng)計量不是數(shù)據(jù)本身它們是加工數(shù)據(jù)的工具。形象地說樣本是一堆原始礦石統(tǒng)計量是把礦石冶煉后得到的金屬錠最后用金屬錠來判斷礦山的整體品質(zhì)。7.2 常用抽樣分布數(shù)理統(tǒng)計題目里頻繁提到的幾個結(jié)論我建議大家直接當(dāng)固定結(jié)論記住。若X?,...,X?來自正態(tài)總體N(μ,σ2)則樣本均值服從X?~N(μ,σ2/n)標(biāo)準(zhǔn)化后的量(X??μ)/(σ/√n)服從標(biāo)準(zhǔn)正態(tài)分布方差未知時(X??μ)/(S/√n)服從自由度為n?1的t分布樣本方差與總體方差之比(n?1)S2/σ2服從自由度為n?1的卡方分布樣本均值和樣本方差相互獨立。這些結(jié)論是關(guān)于正態(tài)總體的抽樣分布定理是整個參數(shù)估計和假設(shè)檢驗的“基礎(chǔ)設(shè)施”。每次做題前先把“來自哪個總體、方差已知還是未知、樣本量多少”標(biāo)出來再決定用正態(tài)、t還是卡方分布。7.3 點估計方法矩估計與極大似然估計點估計就是用樣本數(shù)據(jù)算出一個具體的數(shù)值去估計總體里的未知參數(shù)。矩估計的核心思想很直觀用樣本矩去替代總體矩。比如總體有一個未知均值μ就用樣本均值X?估計μ如果總體有兩個參數(shù)就令總體一階矩等于樣本一階矩、總體二階矩等于樣本二階矩解方程組。這種方法計算量小、適用范圍廣但估計精度通常不是最優(yōu)的。極大似然估計的思想更有意思既然我們觀測到了一組樣本數(shù)據(jù)那就應(yīng)該選擇讓“這組數(shù)據(jù)出現(xiàn)的概率”最大的參數(shù)值作為對未知參數(shù)的估計。具體步驟是寫出似然函數(shù)L(θ)∏f(x?;θ)對θ求導(dǎo)多參數(shù)時求偏導(dǎo)令導(dǎo)數(shù)為0解方程。實際計算中常先取對數(shù)再求導(dǎo)把連乘變成求和運算會輕松很多。極大似然估計在絕大多數(shù)情況下都有良好的大樣本性質(zhì)比如一致性和漸近正態(tài)性所以它是目前統(tǒng)計推斷中最主流的估計方法。我在實際課業(yè)里最常犯的錯誤是忘記寫對數(shù)似然的定義域有些參數(shù)取值范圍和樣本取值相關(guān)求導(dǎo)前必須先確認可取范圍否則解出來的參數(shù)可能根本不在定義域內(nèi)。7.4 估計量的評價標(biāo)準(zhǔn)與區(qū)間估計初步估計量本身也是隨機變量所以需要評價它“好還是不好”。三個經(jīng)典標(biāo)準(zhǔn)是無偏性估計量的期望等于真值參數(shù)即E(θ?)θ。沒有系統(tǒng)偏差。有效性無偏估計中方差越小越有效。兩個無偏估計擺在一起誰的波動小誰更優(yōu)秀。相合性樣本量越來越大時估計量要依概率收斂到真值。區(qū)間估計是點估計的升級不給出一個“點”而是給出一個“區(qū)間”附上這個區(qū)間包含真值的把握有多大。比如正態(tài)總體均值μ的1?α置信區(qū)間在方差已知時是X?±z_{α/2}·σ/√n。這里的1?α叫置信水平z_{α/2}是標(biāo)準(zhǔn)正態(tài)分布的上側(cè)分位數(shù)。置信區(qū)間最常見的誤讀是把“置信水平為95%”理解成“參數(shù)落在該區(qū)間的概率是95%”。正確理解是重復(fù)抽樣很多次每次都能算出一個區(qū)間其中有95%的區(qū)間會覆蓋住真值。被固定下來的一個區(qū)間要么包含真值要么不包含不存在概率問題。這個微妙區(qū)別當(dāng)年幫我避開了一個大坑。8. 基礎(chǔ)概念與重要定義速查表整理一份速查表方便你在復(fù)習(xí)時直接對照。表格里只列最核心的內(nèi)容細節(jié)還是回到正文去看。8.1 概率論部分速查表概念定義/公式關(guān)鍵注意點樣本空間所有可能結(jié)果的集合必須是“互斥且完整”的事件樣本空間的子集集合運算與事件運算一一對應(yīng)概率公理非負性、規(guī)范性、可列可加性事件概率滿足的基本規(guī)則條件概率P(AB)P(A∩B)/P(B)獨立事件P(A∩B)P(A)P(B)獨立與互斥不要混淆全概率公式分情況加總原因集要互斥且完整貝葉斯公式由結(jié)果反推原因分子是一條路徑的概率分布函數(shù)F(x)P(X≤x)萬能工具通用絕對值期望EX∑xp或∫xf(x)dx不一定等于最可能值方差VarE[(X?EX)2]E(X2)?(EX)2獨立時方差才可加協(xié)方差CovE(XY)?EXEY不相關(guān)≠獨立相關(guān)系數(shù)ρCov/(σ_Xσ_Y)標(biāo)準(zhǔn)化后的協(xié)方差范圍[?1,1]8.2 數(shù)理統(tǒng)計部分速查表概念定義/公式關(guān)鍵注意點簡單隨機樣本獨立同分布的樣本統(tǒng)計推斷的基本前提樣本均值X?(1/n)∑X?總體均值的自然估計樣本方差S21/(n?1)∑(X??X?)2分母n?1是為了無偏抽樣分布統(tǒng)計量的分布結(jié)合正態(tài)總體結(jié)論記憶矩估計樣本矩總體矩適用廣精度一般極大似然估計最大化似然函數(shù)先取對數(shù)再求導(dǎo)更簡單置信區(qū)間區(qū)間估計的形式置信水平是長期覆蓋率無偏性E(θ?)θ可用于檢驗估計方法是否可靠8.3 易混淆概念對比與高頻易錯點最后把最容易出錯的幾組概念列出來考前重點掃一眼。事件互斥與相互獨立。互斥是“不可能同時發(fā)生”獨立是“互不影響”。兩個都算的互斥事件只有一種情況其中至少一個概率為0。別把這兩個詞畫等號。不相關(guān)與獨立。不相關(guān)只說明沒有線性關(guān)系獨立是沒有任意形式的關(guān)系。獨立一定不相關(guān)逆命題不成立。只有在聯(lián)合正態(tài)分布的前提下不相關(guān)才能推出獨立。條件概率P(A|B)和乘積概率P(A∩B)。前者是“B已經(jīng)發(fā)生之后再看A”樣本空間被縮小到B后者是兩個事件同時發(fā)生的概率樣本空間還是Ω。很多復(fù)雜題反復(fù)在這兩者之間切換要隨時清楚現(xiàn)在站在哪個樣本空間里。泊松分布和指數(shù)分布。泊松分布描述的是特定時間區(qū)間內(nèi)事件發(fā)生“次數(shù)”的分布指數(shù)分布描述的是“連續(xù)發(fā)生間隔時間”的分布。兩者都常出現(xiàn)在排隊論和可靠性分析中一個管數(shù)量一個管時間。數(shù)字特征里也有一組要分清楚E(X2)、(EX)2、Var(X)。E(X2)是平方值的均值永遠不等于(EX)2除非X是常數(shù)方差是兩者差。另外還有一個很實用的建議復(fù)習(xí)時把每個分布都問一遍“它的前提條件是什么、期望和方差是多少、大概在哪類場景出現(xiàn)”能做出一條線的知識網(wǎng)絡(luò)比單獨背一個個公式有效得多。最后再多說一句概率論與數(shù)理統(tǒng)計這門課我自己的體會是“前期看概念中期靠刷題后期靠直覺”。概念階段如果得過且過后面所有公式都會變成無根之木。你不需要急著把所有公式混熟先把這一篇里的定義逐條看明白然后挑一兩道經(jīng)典題用每一個公式親手算一遍很多之前覺得玄乎的東西就落地了。還有一些邊界性的東西我沒有放進來比如大數(shù)定律和中心極限定理的完整證明、多元正態(tài)分布的詳細性質(zhì)原因是“基礎(chǔ)概念與重要定義匯總”真正能幫到人的是先把框架打好??蚣芊€(wěn)了后面再遇到更難的內(nèi)容你至少知道該往知識的哪個方向走。如果復(fù)習(xí)時間緊張優(yōu)先把第3節(jié)分布函數(shù)到第5節(jié)數(shù)字特征吃透再拿下第7節(jié)的抽樣分布結(jié)論考試的大頭基本就在這里面。祝接下來的學(xué)習(xí)順暢也歡迎在實踐之后回來對照這套框架檢查自己的理解是不是真的到位了。