Teaching Topics(教學主題)

本區塊整理機率論 (probability theory)、數理統計 (mathematical statistics)、統計推論 (statistical inference)、電腦實驗 (computer experiments) 與高斯過程 (Gaussian processes) 等主題式短篇教材。文章以課程講義為基礎重新精簡,保留必要的定義、定理與證明,同時加入更適合網頁閱讀的例子與導讀。

部分主題會搭配互動展示 (interactive demos)。同一篇文章可能出現在不同課程中,依據不同課程的綱要,可能以不同的順序被串聯在該課程的內容當中。

機率論

第 1 章 事件機率與條件化 10 個主題
  • 主題 1 隨機實驗、樣本空間與事件 : 機率論先由隨機實驗開始,整理實驗所有可能的結果,並以樣本空間、樣本點與事件建立後續機率模型所需的基本定義。
  • 主題 2 事件的集合運算 : 事件是樣本空間的子集合。本篇介紹聯集、交集、差集與餘集等集合運算及其基本性質,並推廣至有限與可數的聯集與交集、單調集合序列的極限,最後說明互斥與加集。
  • 主題 3 古典機率、幾何機率、客觀機率與主觀機率 : 機率最早是為了解決生活中遇到的隨機問題而發展。本篇介紹古典機率、幾何機率、客觀機率與主觀機率四種指定方式,以及它們各自的假設與限制。
  • 主題 4 域、σ-域與機率空間 : 機率公理要建立在哪裡?本篇依序介紹域、$\sigma$-域、可測空間與機率空間,說明哪些事件可以被測度機率,以及一個機率測度至少應滿足的三大公理。
  • 主題 5 機率公理及其推論 : 由柯爾莫哥洛夫三大公理出發,本篇依序推出虛無事件的機率、有限可加性、餘事件公式、全機率定理與加法原理、單調性、廣義加法原理,以及布爾與邦佛洛尼不等式,最後以單調事件序列的機率極限作結。
  • 主題 6 條件機率與乘法原理 : 條件機率描述在已知某個事件已經發生之後,我們如何重新評估另一個事件的機率。本篇從資訊的變化出發,介紹條件機率、乘法原理與廣義乘法原理,並以蒙提霍爾問題示範資訊如何改變機率。
  • 主題 7 獨立性與條件獨立 : 獨立性描述資訊進來後機率仍然不變的情形。本篇依序介紹獨立事件、互斥與獨立的關係、列聯表、完全獨立與成對獨立,以及可靠度的串聯與並聯系統,最後補充條件獨立。
  • 主題 8 樣本空間的分割與全機率定理 : 樣本空間的分割由一組互斥且周延的事件構成。本篇介紹分割的定義、全機率定理及其條件機率版本,並說明兩組分割彼此交集而成的二元分割與列聯表。
  • 主題 9 分組、混合與辛普森悖論 : 同一個比較在每個分組內都成立,混合後卻可能反轉。辛普森悖論說明,條件機率與全機率定理不只用來計算,也用來檢查比較是否公平。
  • 主題 10 貝氏定理 : 貝氏定理的分母即是全機率定理,它把事前機率與條件機率轉化為事後機率。本篇介紹貝氏定理、事前與事後機率的意義、計算流程的樹狀圖,以及由觀察結果反推來源的例題。
第 2 章 隨機變數 24 個主題
  • 主題 1 隨機變數與機率質量函數 : 隨機變數是定義在樣本空間上的實值函數,把樣本點對應到實數,並要求對任意實數 $x$,能使 $X(\omega)\leqslant x$ 的樣本點所形成的集合都是事件。值域中元素個數為有限或可數無限者為離散型;累積機率可寫成非負函數之積分者為連續型。離散型的機率質量函數在值域上記錄每一個點的單點機率,在值域之外為 $0$,並滿足三項性質。
  • 主題 2 累積分配函數 : 累積分配函數定義為 $F_{\sssig X}(x)=\mathbb{P}(X\leqslant x)$,定義域為整個實數線,函數值落在 $[0,1]$ 之中,離散型與連續型隨機變數都適用。它必然非遞減、右連續,兩端的極限分別為 $0$ 與 $1$;離散型的累積分配函數為階梯函數,每一階的躍升高度即為該質點的機率,故亦可由累積分配函數回頭求得機率質量函數。
  • 主題 3 機率密度函數 : 連續型隨機變數的累積分配函數若能寫成某個非負函數由 $-\infty$ 積到 $x$ 的積分,被積分的那個函數即為機率密度函數。在機率密度函數連續的點上,由微積分基本定理可知它就是累積分配函數的導函數。它是累積機率的變化率而非機率本身,故只要求非負,不必小於 $1$;在整個值域上的積分為 $1$,落在集合 $A$ 中的機率則為 $A$ 與值域交集上的積分。
  • 主題 4 以累積分配函數計算機率 : 任一隨機變數落在一段區間上的機率,都可由累積分配函數的兩個函數值相減得到,即 $F_{\sssig X}(b)-F_{\sssig X}(a)$;離散型可再寫成機率質量函數在該區間上的加總,連續型則為機率密度函數在該區間上的積分。連續型隨機變數的單點機率恆為 $0$,故區間端點的等號可以互換;離散型具有單點機率,端點的等號不可任意省略,其機率質量函數與累積分配函數之間另有五款對應關係。
  • 主題 5 混合型隨機變數 : 有一部分隨機變數並不純粹是離散型,也不純粹是連續型,它同時具備離散型的單點機率,與連續型的機率函數不是機率這兩項特性,稱作混合型隨機變數。分解定理指出,任一個 cdf 都可以寫成一個離散型 cdf 與一個處處連續的 cdf 之線性組合,係數 $\alpha$ 等於所有離散質點的機率總和;當兩個部分都不退化時,這樣的分解是唯一的。同樣的分解也適用於 pdf。
  • 主題 6 期望值 : 期望值是隨機變數的加權平均: 離散型以機率質量函數對各個取值加權求和,連續型以機率密度函數對取值加權積分,兩者都以絕對收斂為存在的條件。它是一個分配的聚集中心,在質點的類比之下即為物理學的質心,也是使平方離差的期望值達到最小的那個位置,故亦稱為母體平均數。若隨機變數非負,期望值還可以改由尾機率求得,離散型加總 $\mathbb{P}(X\geqslant x)$,連續型則積分 $\mathbb{P}(X>x)$。
  • 主題 7 期望值的性質與函數期望值 : 函數期望值定理指出,$g(X)$ 的期望值不必先求出 $g(X)$ 的分配,只要以 $X$ 的 pmf 或 pdf 對 $g(x)$ 加權求和或積分即可。期望值對線性組合具有可交換性: 期望值內若是線性函數的形式,可以先取期望值再做線性函數,非線性的部分則交由函數期望值定理處理。由這個複合性質設定各常數,可以得到常數的期望值還是自己本身、平移的期望值是期望值的平移、倍數的期望值是期望值的倍數三個子性質。本篇另有兩道例題,說明期望值可能發散,以及期望值如何改寫成累積分配函數的積分。
  • 主題 8 變異數 : 變異數是離差平方的期望值,用來衡量一個隨機變數平均的分散程度: 離散型以 pmf 對各個離差平方加權求和,連續型以 pdf 加權積分。實際計算時多改用平方的期望值減期望值的平方,也就是 $\mathrm{Var}(X)=\mathbb{E}(X^{2})-[\mathbb{E}(X)]^{2}$;同一套作法延伸到函數 $g(X)$ 便得到函數變異數。變異數恆為非負,對隨機變數平移一個常數不改變它的值,伸縮 $a$ 倍則使它成為原先的 $a^{2}$ 倍。
  • 主題 9 變異數的求算與標準差 : 三道例題示範變異數的求算: 線性關係下直接套用平方伸縮性,分段定義的密度以分段積分求出期望值與平方期望值,混合型則把離散部分與連續部分分開計算。期望值另有一項重要特性: 在所有實數之中,期望值使平方離差的期望值達到最小。若只知道期望值與變異數,$g(X)$ 的期望值與變異數仍可由泰勒級數展開求得近似值。標準差是變異數開根號後的量數,單位與期望值相同,性質由變異數承接而來,只是平方伸縮性在標準差中改為絕對伸縮性。
  • 主題 10 眾數 : 眾數是使機率函數在值域的閉包上取到最大值的那些點,一個分配可以有多個眾數,也可以沒有眾數。連續型求眾數時,先看密度取到最高值的位置落在值域的內點還是邊界點: 落在內點的用一階與二階條件判斷,是內解;落在邊界點的只能由密度本身的增減性質判斷,是角解。離散型則逐點比較機率的大小,對整數值隨機變數另有一個由相鄰機率比值出發的判準,在 pmf 為單峰的前提下可用來求解眾數。
  • 主題 11 中位數 : 中位數是把一個分配切成前後兩段的量數: 只要 $\mathbb{P}(X\leqslant\eta_{X})$ 與 $\mathbb{P}(X\geqslant\eta_{X})$ 都不小於 $\frac{1}{2}$,$\eta_{X}$ 就是 $X$ 的中位數。它可能不唯一,甚至可能不在值域內,取 $\inf\lbrace x\mid F_{X}(x)\geqslant\frac{1}{2}\rbrace$ 可以找到其中一個;若 $F_{X}$ 連續且在值域上嚴格遞增,中位數唯一且等於 $F_{X}^{-1}(\frac{1}{2})$。衡量離散程度時若把平方換成距離,則使 $\mathbb{E}(\lvert X-a\rvert)$ 達到最小的 $a$ 正是中位數,這與期望值使平方離差的期望值達到最小恰成對照。
  • 主題 12 分位數 : 分位數把中位數的想法推廣到任意比例: 給定一個介於 $0$ 與 $1$ 之間的 $p$,同時滿足 $\mathbb{P}(X\leqslant x_{p})\geqslant p$ 與 $\mathbb{P}(X\geqslant x_{p})\geqslant1-p$ 的 $x_{p}$ 稱為 $p$-分位數,直觀上它把整個分配切成前後兩段,前段佔全部的 $p$、後段佔全部的 $1-p$。換一個角度來看,$q-1$ 個分位數可以把一個分配均分為 $q$ 個等份,第 $k$ 個分界點記為 $q_{k}$;取 $q=4$、$q=10$ 與 $q=100$,便分別得到四分位數、十分位數與百分位數。
  • 主題 13 動差系統 : 母體動差以一個基準點 $c$ 與一個階數 $r$ 界定為 $\mathbb{E}[(X-c)^{r}]$: 取 $c=0$ 得到原動差 $\mu_{r}^{\prime}=\mathbb{E}(X^{r})$,取 $c=\mu_{X}$ 得到主動差 $\mu_{r}=\mathbb{E}[(X-\mu_{X})^{r}]$,改取絕對值則得到絕對動差。一階原動差就是期望值,二階主動差就是變異數。兩種動差可以經由二項式定理互相表示,而高階絕對動差存在時,低階絕對動差同樣存在。
  • 主題 14 形狀量數 : 形狀量數把一個分配的樣子化成數值。動差偏態係數 $\alpha_{3}=\mu_{3}/\sigma_{X}^{3}$ 為正、為零、為負,分別對應右偏、對稱與左偏;皮爾森的兩個偏態係數則改由期望值與眾數、中位數之間的距離著手,背後是單峰分配中 $\lvert\mu_{X}-m_o\rvert\fallingdotseq3\lvert\mu_{X}-\eta_{X}\rvert$ 這個經驗法則。峰態係數 $\alpha_{4}=\mu_{4}/\sigma_{X}^{4}$ 以常態分配的 $3$ 為比較基準,超額峰態係數則寫成 $\kappa=\alpha_{4}-3$;它衡量的是遠離期望值的取值所作的貢獻,不是峰的尖扁,因此改稱厚尾分配與薄尾分配。
  • 主題 15 動差母函數 : 動差母函數把 $e^{tX}$ 的期望值看成 $t$ 的函數: 只要存在某個 $h>0$,使 $\mathbb{E}(e^{tX})$ 對一切 $t\in(-h,h)$ 皆存在,這個期望值就稱為 $X$ 的動差母函數 $M_{X}(t)$。它起先是以工具函數的角色被引入。對 $t$ 微分 $r$ 次後在 $t=0$ 取值,所得的 $M_{X}^{(r)}(0)$ 正是 $r$ 階原動差 $\mathbb{E}(X^{r})$;反過來把 $M_{X}(t)$ 在 $t=0$ 泰勒展開,$\frac{t^{r}}{r!}$ 的係數也正是各階原動差。由於 $e^{tX}$ 無限可微,動差母函數一旦存在便保證各階動差都存在,但它並不是任何時候都存在。
  • 主題 16 動差母函數的唯一性 : 動差母函數的唯一性指出: 兩個隨機變數的 mgf 若存在且相等,則兩者的 pdf (或 pmf) 也會相等。有了這一項性質,只要把各階動差所組成的級數求和,得到一個認得出來的 mgf,就能反過來指出原本的分配是哪一個: 各階原動差皆為 $0.8$ 的是伯努利分配,偶階動差為 $\frac{(2m)!}{2^{m}m!}$ 而奇階動差為 $0$ 的是標準常態分配。離散型的 mgf 還可以展開成 $p_{1}e^{a_{1}t}+\cdots+p_{n}e^{a_{n}t}$,由各項的係數與指數直接還原 pmf。
  • 主題 17 機率母函數與累積量母函數 : 能夠生成一系列量數的函數不只 mgf 一種。機率母函數 $G_{X}(t)=\mathbb{E}(t^{X})$ 只對非負整數隨機變數定義,微分 $r$ 次後代入 $t=1$ 生成階乘動差,微分 $k$ 次後代入 $t=0$ 再除以 $k!$ 則還原 $\mathbb{P}(X=k)$。累積量母函數 $K_{X}(t)=\ln M_{X}(t)$ 由 mgf 取對數而得,前四個累積量依序是期望值、變異數、三階主動差與 $\mu_{4}-3\sigma_{X}^{4}$。最後說明 mgf 與 pgf 之間如何互相改寫。
  • 主題 18 特徵函數 : 特徵函數把工具函數換成 $e^{itX}$。由歐拉公式可知 $\lvert e^{itX}\rvert=1$,因此 $\mathbb{E}(e^{itX})$ 對每一個實值隨機變數與每一個 $t$ 都存在,這正是它與動差母函數最大的差別。它同樣以微分生成原動差,$r$ 階動差存在時 $\phi_{X}^{(r)}(0)=i^{r}\mathbb{E}(X^{r})$;也同樣具有唯一性,兩個分配相同若且唯若兩者的特徵函數處處相等,而且還能由反演公式反過來求出 cdf 與 pdf。標準柯西分配沒有 mgf,卻有形式簡單的 $\phi_{X}(t)=e^{-\lvert t\rvert}$,其樣本平均數與單一觀測值同分配正是由唯一性得到的。
  • 主題 19 機率不等式 : 在不知道機率分配形式、只掌握低階動差的情況下,機率仍然可以被界定。若 $h(\cdot)$ 為非負可測實值函數且 $\mathbb{E}[h(X)]$ 有限,則 $\mathbb{P}(h(X)\geqslant a)\leqslant\mathbb{E}[h(X)]/a$。在這條定理中取 $h(x)=x_{+}$ 得到馬可夫不等式,取 $h(x)=x^{2}$ 並施於 $\lvert X-\mu_{X}\rvert$ 得到柴比雪夫不等式,取 $h(y)=(y+c)^{2}$ 再對 $c$ 取下確界則得到單邊柴比雪夫不等式,亦即坎特利不等式,這三者用到的動差都不超過一階與二階。若改取 $h(x)=e^{tx}$ 而把整個動差母函數用上,得到的則是車諾夫不等式,它的前提嚴格得多,換來的是更貼近真實機率的上界。
  • 主題 20 機率不等式的例題 : 八道例題演練同一系列機率不等式的用法。前兩道不套現成的不等式,改由密度或機率函數本身的單調性造出不等關係,一道用積分、一道用等差級數的和。第三道由非負函數的機率界限取 $h(x)=(x-\mu_{X})^{2}$ 直接導出柴比雪夫不等式,第四道反過來由兩個尾機率求變異數的下界。第五道比較同一個上界在均勻分配與三點分配之下的鬆緊,第六道把柴比雪夫不等式代入卜瓦松分配。第七道以同一題的兩個小問對照馬可夫不等式與單邊柴比雪夫不等式,看出動差訊息愈多、上界愈精確。最後一道是車諾夫不等式的完整示範,代入卜瓦松分配的動差母函數之後,以一階與二階條件求出使上界最小的 $t^{*}$。
  • 主題 21 凸性與延森不等式 : 凸函數的定義是: 函數在任兩點所連之弦上的值,不低於同一位置的函數值;凹函數則恰好相反。延森不等式據此比較兩個動差: 若 $g$ 為凸函數則 $\mathbb{E}[g(X)]\geqslant g[\mathbb{E}(X)]$,若 $h$ 為凹函數則 $\mathbb{E}[h(X)]\leqslant h[\mathbb{E}(X)]$,兩邊都是動差,不再是尾機率的上界。由它可以直接得到算術平均數不小於幾何平均數、幾何平均數不小於調和平均數,期望值與中位數的距離不超過一個標準差,以及 KL 訊息數非負這三個結果。
  • 主題 22 鐘形分配的三個標準差區間 : 一個分配的形狀若已經大致確定,不必經由機率不等式,也能夠直接說出中央區間的機率,這種由過往經驗得到的判斷稱作經驗法則。鐘形分配經驗法則指出,隨機變數服從常態分配,或其分配可合理地以常態分配近似時,期望值左右一個、兩個與三個標準差之內的機率,依序約為 $0.6827$、$0.9545$ 與 $0.9973$。鐘形與土丘形只是對外觀的概括稱呼,不是某一種確切的分配,因此這三個數值的可靠程度,取決於該分配與常態分配的接近程度。
  • 主題 23 隨機變數的函數轉換: 一對一的情形 : 已知 $X$ 的機率分配,令 $Y=g(X)$,要如何求出 $Y$ 的機率分配?只要 $g(\cdot)$ 是定義在實數上的實值可測函數,$Y$ 便仍然是一個隨機變數。離散型有直接列表法、pmf 法與 mgf 法三種做法;連續型無法列表,改以 cdf 法由累積的機率相等下手,或以 Jacobian 法把原變數的 pdf 以新變數表示後再乘上導數的絕對值,而 mgf 法離散與連續通用。本篇例題所出現的轉換,其 $g(\cdot)$ 都是一對一函數,反函數直接存在;最後把取 $g$ 為 $X$ 自身 cdf 的情形寫成機率積分轉換。
  • 主題 24 非一對一的函數轉換 : $g(\cdot)$ 不是一對一函數時反函數並不存在,Jacobian 法的公式無法直接套用,cdf 法也不能再靠保序或反序取反函數。通用的作法是將原先的隨機變數分段,直到該段中反函數存在,各段分別轉換為新變數的 pdf 後再連接起來。本篇的三道例題分別以標準常態分配的平方、拉普拉斯分配的絕對值,以及均勻分配在 $(-2,1)$ 上的平方示範這個作法,每一題都以 cdf 法與 Jacobian 法各解一次。