在進行單變異數分析時,變項平方和的概念是:「加入這個變項(x)後,y減少多少殘差變異」。平方和的計算方式有Type I、Type II、Type III三種選擇,下面就跟大家介紹Type I平方和的概念、代號定義、公式、特性以及適用場景。

一、Type I平方和

概念:

  • 按照「變項放入模型的順序」依序檢驗。
  • 第一個變項的平方和 = 它獨自能解釋的變異量。
  • 第二個變項的平方和 = 在控制第一個變項之後,它額外能解釋的變異量。
  • 依此類推。

代號定義(假設模型中只有A和B兩個變數)

  • SSTotal依變數Y的總體變異程度,亦即所有觀察值與平均數差異的平方和。
  • SSType I(A)變數A進入模型後,相較於僅含截距的模型,能減少的殘差平方和。
  • SSType I(B|A)在模型已包含A的基礎上,加入變數B後能額外減少的殘差平方和。
  • SSType I(B)變數B進入模型後,相較於僅含截距的模型,能減少的殘差平方和。
  • SSType I(A|B)在模型已包含B的基礎上,加入變數A後能額外減少的殘差平方和。
  • SSResidual在包含所有自變數的模型中,觀測值與模型預測值之間差異的平方和,代表模型無法解釋的隨機誤差。
  • RSS(Intercept)模型僅包含截距項時的殘差平方和,等於SSTotal
  • RSS(A)模型僅包含變數A時的殘差平方和。
  • RSS(B)模型僅包含變數B時的殘差平方和。
  • RSS(A+B)模型同時包含A和B之後,全模型的殘差平方和。

公式(先放入A再放入B)

公式(先放入B再放入A)

特性:

  • 不平衡設計(各cell樣本數不相等)時,結果會隨變項進入順序不同而改變,SS(A|B) ≠ SS(A)。
  • 平衡設計(各cell樣本數相等)時,A、B能解釋的y變異部分不重疊,SS(A|B) = SS(A)。
  • 重疊的解釋變異區塊,會被先放入的變項搶走。

適用情境:

  • 實驗設計中變項有理論上的先後順序。
  • 探討控制了前面的變項後,新加入的變項還能增加多少解釋變異。

範例(兩個變數,先放A再放B,五筆資料)

【計算過程】

  1. SSType I(A) = RSS(Intercept) – RSS(A) = 74 – 21.1 = 52.9
  2. SSType I(B|A) = RSS(A) – RSS(A+B) = 21.1 – 0.2675 = 20.8325
  3. SSResidual = RSS(A+B) = 0.2675

【RSS(Intercept)計算過程】


【RSS(A)
計算過程】

  1. 當放入變數A時,迴歸模型為:

  • Y:應變數(依變項)。
  • β0截距項(當A、B皆為0時,Y的期望值)。
  • β1變數A的偏迴歸係數(代表在控制B不變的情況下,A每變動一單位,Y的平均變動量)。
  • ε隨機誤差項(RandomError)。
  1. 利用最小平方法 (Ordinary Least Squares, OLS)尋找一組係數β0-1,使得殘差平方和達到最小。

2-1.根據最小平方法(OLS的矩陣公式:

故可得:β0 = 1.1,β1 = 2.3,

迴歸公式為:

2-2. 根據公式計算預測值:

2.56 + 7.29 + 4 + 5.29 + 1.96 = 21.1 (RSS(A))

 

=>RSS(B)、RSS(A+B)可透過同樣方式計算得出。

【驗證】

A的解釋變異量 + B的額外解釋變異量 + 殘差變異量 = 總變異量

SSType I(A) + SSType I(B|A) + SSResidual = 52.9 + 20.8325 + 0.2675 = 74 = SStotal

以上就是Type I平方和的介紹及範例,希望能幫助大家更瞭解Type I平方和的概念及適用場合,也請給我們一個google好評,謝謝~