生物統計學習筆記從概念、推導到實務判讀

CHAPTER 01

統計學的基本概念

Foundations of Statistics

章節目錄
  1. 統計學導論
  2. 資料的分類
  3. 敘述統計(descriptive statistics)
  4. 抽樣(個數n、平均X):標本標準差σ=i=1n(Xi-X)2n-1(之後會再說明)

統計學導論

統計學(statics)是一種從資料取得資訊的方法。

有了資料後,要如何從這些資料獲取他的資訊?這時候就需要運用一些統計的技術(處理資料的方法)來達成了。這就是敘述統計(descriptive statistics)的功能,敘述統計就是將資料組織、彙整以及表達成方便讀取資訊之統計方法,像是一些繪圖來呈現或者一些統計的數值如平均值、中位數、標準差等。

因為有各式各樣的資料,所以有各式各樣的統計方法來處理這些資料,所呈現出來的統計值也各有各的差異,因此這些方法及統計值將是我們學統計學的一個重點。

有時後要統計的量很龐大(母體數很大),要全部統計起來很麻煩,所以這時候就出現了推論統計(inferential statistics)。就是取母體中的一部分(抽樣)作樣本,然後從這些樣本來推論母體的狀況。(因為常常遇到母體數很大的狀況,所以抽樣就很重要,後面的許多方法都是有用到抽樣,所以抽樣也是一個很重要的概念)

有了資料,我們要如何做解釋?要如何敘述?這時候就需要一個估計、預測或決策的處理過程,而這個過程就是統計推論(statistical inference),而統計推論最常用的就是用假設檢定(hypothesis test)來判定,就是提出虛無假設後看可不可以拒絕,判斷的跟據可能是信賴水準(confidence level看信賴區間)或顯著水準(significance level看p值)。信賴水準是指一個估計過程將會正確的比例;顯著水準是指測量所下結論會是錯誤的頻率。

後面所介紹的許多檢定、資料處理方法大多是繞著假設檢定轉的,也就是說這些處理的方法是為了能夠用假設檢定來看,因此假設檢定是我們學統計的一大重點!

資料的分類

不連續的資料(Categorical(enumeration) data):數得完的不連續資料

Nominal資料中的各類別不連續且互相不重疊,類別中每個項目量是數得完的。

Ordinal各類別是有順序、有方向性的,可由小到大或由大到小排列。

連續的資料(Continuous Data):數不完的連續資料

Interval此資料分析中的「0」是相對性的,沒有特殊意義,可以任意訂定。

Ratio「0」就等等於「沒有」,是具有特殊意義的。

質的變數、定性變數或類別變數(Categorical Random Variable, qualitative variable)

(定性)隨機變數的各結果不以數量表示,而依其特性之類別表之。

例如:性別、國籍、物種…

量的變數、數值變數(Numerical Random Variable, quantitative variable)

為一種資料類型,資料中之觀察值可經由量測(measurement)與計數(count)得到。

例如:身高、體重、血壓、體溫…

敘述統計(descriptive statistics)

用來描述統計資料,通常放在論文的Table 1

樣本數(Sample size):觀察對象的總數,以”n”表示

類別變項(Categorical Variables):描述不連續資料

Frequency:個數

Percentage:個數除以總樣本數

連續變項(Continuous Variables)

描述數的中間值(Middle)和散佈情形(Spread)

描述數據的偏斜程度(Skewness)和峰值大小(Kurtosis),偏斜程度看統計曲線的尾巴,峰值大小看統計曲線的頭(較少用)

集中量數(Measures of the Middle)代表一組觀察體集中的情形

眾數(mode):出現最多次的數值

中位數(median)

奇數時第n+12位為中位數;偶數時第n2位和(n2+1)位的平均為中位數。

優點:前後50%的數值一定分布在兩側、可適用於偏斜分布資料、不受離群數(outliers)影響。

缺點:資料呈常態分布時,平均數更適合用來估計、不像平均數那麼常使用。

算數平均數(arithmetic median, mean)

X=i=1nXin

優點:能代表所有的數值、適用常態分佈

缺點:易受outliers影響、不適用於偏斜分布資料

截尾平均數(trimmed mean):把outliers去掉再算平均

幾何平均數(GM)

GM=nX1X2…Xn=elnx

優點:將歪斜、不常態的數據轉換(取ln),使之趨近常態分布方便分析

缺點:不適用於對稱資料、比中位數更易受到outliers影響離群數的影響力:Mean > GM > Median

變異量數(Measures of the Spread)對一組數據分散情形的描述

全距(range):最大最小值的差距

四分位距(interquartile range, IQR):即Q3(第三四分位數)-Q1(第一四分位數),用在歪斜(非常態)分布

變異數(variance)與標準差(standard deviation, SD)

母體(個數N、平均μ):母體標準差σ=i-1NXi-μ2N變異數為標準差的平方

抽樣(個數n、平均X):標本標準差σ=i=1n(Xi-X)2n-1(之後會再說明)

用隨機變數來算時:VarX=EX2-E(X)2(E(X)為期望值,為Xp(X)或XpXdX,X為隨機變數)

變異係數(coefficient of variation, CV):CV=SDX,去單位化,可用以比較(少用)

偏斜程度(Skewness)與峰度(Kurtosis)

偏斜程度(Skewness)用來測量數據的不對稱性,利用標準差的三次方進行計算 γ1=EX-μσ3=E[(X-μ)3]{E[(X-μ)2]}3/2=K3K23

峰值(Kurtosis)用來測量數據分布的高度,利用標準差的四次方計算,發現常態分布公式計算出來的結果正好等於3,所以通常在公式最後面補上-3,使常態分佈時為基準值0 γ2=K4K22=μ4σ4-3