迴歸分析 申論題歷屆試題與參考架構
地方特考三等,民國 102~112 年共 10 份試卷、40 題,其中 10 題附參考答題架構。考這一科的類科:統計。本頁列出歷年全部題目,參考架構只列開頭的「破題」,完整的答題架構、關鍵字與作答提醒請到站內查看。
112 年(考試時間 120 分鐘) 原卷 PDF
- 1
若以樣本 y 對 x 做線性迴歸,可得到迴歸估計式 ŷi ˆ0 ˆ1 xi 。假設 x 、 y之樣本平均及標準差分別為 x 、 y 、 sx 、 s y ,樣本相關係數為 r 。今先將x 、 y 標準化,即:xi x y y xi* , yi i * sx sy然後以 y * 對 x* 做線性迴歸,得到 yˆi* 0 1 xi* 。試求:
(一) ?(10 分)
(二) 1和 ̂1 的關係。(10 分)
(三) r 和 之關係。1 (5 分)
(25 分)
- 2
X 為前測成績,Y 為後測成績。假設甲乙兩班的前、後測成績關係分別為甲: Y 01 11X ε乙: Y 02 12 X ε下表資料中 G 代表班別(G = 1 為甲班,G = 0 為乙班),令 XG 為 X 和G 乘積。Y X G Y X G 5.3 4 1 3 3 0 10.4 9 1 15 8 0 9.2 8 1 9.4 5 0 10.1 9 1 13.1 6 0 7.3 6 1 9.1 3 0 4.3 3 1 17.7 11 0 9.7 9 1 7.3 7 0 6.3 6 1 10.2 10 0 6.6 5 1 19.4 12 0 9 9 1 13.6 9 0我們以上表資料分別配適以下四組迴歸:M1:Y 對 X 迴歸;M2:Y 對G 迴歸;M3:Y 對 X 和 G 複迴歸;M4:Y 對 X、G 和 XG 複迴歸。變異數分析結果如下:M1: Ŷ = 1.26 + 1.203 X M2: Ŷ = 11.78 - 3.94 G Source DF Adj SS F-Value P-Val Source DF Adj SS F-Value P-Val Regression 1 202.24 26.48 0.00 Regression 1 77.72 5.34 0.033 X 1 202.24 26.48 0.00 G 1 77.72 5.34 0.033 Error 18 137.49 Error 18 262.01 14.56 Total 19 339.73 M3: Ŷ = 3.39 + 1.133 X - 3.26 G M4: Ŷ = 2.52 + 1.251 X - 0.86 G - 0.343 XG Source DF Adj SS F-Value P-Val Source DF Adj SS F-Value P-Val Regression 2 254.79 25.50 0.000 Regression 3 258.451 16.96 0.00 X 1 177.07 35.44 0.000 X 1 141.449 27.84 0.00 G 1 52.55 10.52 0.005 G 1 0.419 0.08 0.778 Error 17 84.94 4.997 XG 1 3.658 0.72 0.409 Error 16 81.284 5.080在顯著水準 0.05 下,試求:
(一) 檢 定 「 兩 班 的 Y 對 X 關 係 是 否 平 行 ( 斜 率 相 同 )」, 即H 0:11 12 and 01 02 vs. H1:11 12 and 01 02 。(10 分)
(二)檢定「兩班是否有相同之 Y 對 X 線性關係(相同的斜率及截距) 」,即H 0:11 12 and 01 02 vs. H1:H 0 為非。 (15 分)
(25 分)
本題含圖表或公式,請對照原卷 PDF。
- 3
某資料有 40 個觀察值,因變數為 y1 ,, y40 ,自變數為 x1 , , x40 ,迴歸模式 yi 0 1 xi i 。
(一)其檢定之有效性是建立在對 i 的那些假設下?(10 分)
(二)若 ( x1 ,, x20 ) 為男生體重, ( x21 , , x40 ) 為女生體重, y 為其運動後心跳頻率。已知男生體重的變異量一般較女生大。今以 y 對 x 做簡單線性迴歸,可能會違反(一)中那些假設?(5 分)
(三)若 x1 ,, x10 是 10 個人第 1 年之測量值, x11 , , x20 為其第 2 年測量值,x21 , , x30 為其第 3 年測量值,x31 , , x40 為其第 4 年測量值。以 y 對 x 做簡單線性迴歸的話,會違反(一)中那些假設?(5 分)
(20 分)
- 4
連續變數 Y 代表因變數藥效(越大代表成效越佳) ,自變數 X 為類別變數,代表 A、B、C 三種藥物處方,三組人樣本數相同,各只接受其中一種處方。
(一)某軟體將 X 轉成以下虛擬變數(dummy variable) X 1 及 X 2 :1 當X A 0 當X A X 1 0 當X B ,及 X 2 1 當X B 0 當X C 0 當X C 然後以 Y 對 X 1 及 X 2 配適迴歸模式: Y 0 1 X 1 2 X 2 ε 。請就以下檢定結果比較三種藥物之藥效(如:何者顯著較佳,何者間無顯著差別)。(15 分)Term Coef SE Coef t-Value P-Value Constant 8.200 0.732 11.20 0.000 X1 -2.10 2.10 -1 0.32 X2 4.50 1.03 4.35 0.000
(二)另一種軟體轉虛擬變數的方式如下: 1 當X A 0 當X A X 1* 0 當X B ,及 X 2 1 當X B * 1 當X C 1 當X C 然後以 Y 對 X1* 及 X 2* 配適迴歸模式:Y 1 X1* 2 X 2* ε 。請就以下檢定結果比較三種藥物之藥效。(15 分)Term Coef SE Coef t-Value P-Value Constant 8.200 0.732 11.20 0.000 X1* -2.64 1.01 -2.61 0.009 X 2* 3.50 1.01 3.46 0.000
(30 分)
本題含圖表或公式,請對照原卷 PDF。
111 年(考試時間 120 分鐘) 原卷 PDF
- 1
一位統計分析師想瞭解身高( Yi ,以英寸為單位)是否可以用手掌張開長度( X 1 ,以公分為單位)和性別( X 2 ,男性是 1,女性是 0)來預測?他收集 66 名大學生為樣本。所配適的線性迴歸模型如下:Yi 0 1 X 1i 2 X 2 i i , i 1,, n.請依據表 1 回答下列問題。表1: ANOVA Source Sum of Squares DF Mean square F test Regression 840.8436 2 Error (1) (3) (5)(Lack of fit) (2) (4)(Pure error) 283.8476 45 Total 1220.4394 65
(一)請計算表 1 中(1)−(5)所列的線性迴歸的 ANOVA 相關訊息。 (10 分)
(二)在顯著水準 5%下,請檢定身高是否與手掌張開長度 ( X 1 ) 和性別( X 2 ) 有線性關係存在。請列出虛無假設/對立假設、檢定統計量及決策法則。在無需查表之下,你的建議結論為何?(5 分)
(三)在顯著水準 5%下,請檢定線性迴歸模型是否有顯著的缺適(lack of fit)?以了解線性迴歸模型是否足以描述身高與手掌張開長度( X 1 ) 和性別 ( X 2 ) 之間的關係。請列出虛無假設/對立假設、檢定統計量及決策法則。在無需查表之下,你的建議結論為何?請說明缺適檢定所需要之假設。(10 分)
(25 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
一位統計分析師分析奧林匹克男子田徑短跑 200 公尺數據,包含 1900 年至 2020 年間舉行的 28 次男子 200 公尺奧林匹克短跑比賽獲金牌的秒數,其中第一次和第二次世界大戰期間沒有舉辦奧運會,而 2020 年奧林匹克運動會因為 COVID-19 疫情實際是 2021 年在日本東京舉行。因此資料包含 year(以年為單位)和 Y(以秒為單位) ,其散布圖在圖 1。圖 1 奧林匹克年份和男子田徑短跑 200 公尺秒數散布圖這位統計分析師重新定義變數,他把“西元年(year)”平減 1963,並定義新的解釋變數 X,也就是 X=year−1963。樣本相關資訊如下,其中 n 為樣本數,請依據這些資訊回答問題。n X 0.1429, Y 20.5582, S XY ( X i -X )(Yi -Y )= 888.2171, i 1 n n S XX ( X i -X ) =36859.4286, SYY (Yi -Y ) 2 24.3354 i 1 i 1
(一)請計算 ( X , Y ) 的皮爾森相關係數。(5 分)
(二)該統計分析師配適模型 Yi 0 1 X i i,此處 i 是誤差項。請寫出以最小平方估計法所得到的估計迴歸線,並推導共變異數 ˆ 和 ̂ , 0 1也就是 Cov ( ˆ0 , ˆ1 ) 。(10 分)
(三)在顯著水準 0.05 之下,請檢定 H 0 : 1 0 是否顯著?請詳述檢定統計量之值、決策法則和結論。請問年份和獲金牌的秒數之間是否存在線性關係?以此資料是否可以推論人類在田徑短跑越跑越快?t 分配臨界值,t0.025 (26) 2.0555, t0.025 (27) 2.0518 。(10 分)
(25 分)
本題含圖表或公式,請對照原卷 PDF。
- 3
一位統計分析師受託分析 20 名年齡 40~60 歲高血壓患者的血壓相關數據,以評估可能影響血壓的重要因素,資料描述如下:血壓(Y,反應變數,以 mm Hg 為單位) ,年齡( X 1 ,以年為單位),重量( X 2 ,公斤),體表面積( X 3 ,平方公尺),高血壓病史( X 4 ,以年為單位),基礎脈搏( X 5 ,以每分鐘為單位),壓力指數( X 6 ,0−100 為範圍)。部分統計套裝軟體輸出結果在表 2 和表 3。表2反應變數 5個解釋變數 判定係數X1 X2-X6 0.451 X2 X1, X3-X6 0.925 X3 X1-X2, X4-X6 0.905 X4 X1-X3, X5-X6 0.196 X5 X1-X4, X6 0.754 X6 X1-X5 0.416表3解釋變數 Type I SS 偏判定係數X1 SSR(X1) 243.266 , 0.4344 X2 SSR(X2|X1) 306.886 , | 0.96891 X3 SSR(X3|X1,X2) 0.765 , | , 0.07763 X4 SSR(X4|X1,X2,X3) 0.250 , | , , 0.02755 X5 SSR(X5|X1,X2,X3,X4) 0.965 , | , , , 0.1092 X6 SSR(X6|X1,X2,X3,X4,X5) 1.023E-04 , | , , , , 1.3E-05
(一)這位分析師一開始採用(1)式中模型 1 的複迴歸分析,他擔心有多重共線性(Multicollinearity)問題。模型 1:Yi 1 X 1i 2 X 2 i 3 X 3i 4 X 4 i 5 X 5i 6 X 6 i i , i 1,…, n. (1)請協助這位分析師利用表 2 判斷是否有嚴重的多重共線性,並說明模型 1 是否合適?如果不合適,請詳細說明原因和判斷方法。 (5 分)
(二)表 3 第二欄的定義,若 SSR(Xi|Xj)代表給定 Xj 已在模型中,Xi 加入 模 型 中 的 額 外 平 方 和 ( extra sum of squares )。 請 計 算 SSR(X1,X2,X3,X4,X5,X6)。最後一欄符號代表偏判定係數(coefficient of partial determination) 。請說明偏判定係數 RY2, X 3 X1 , X 2 的計算式及其意義。請利用表 3 結果,建議分析師採用那些變數,詳細說明理由和判斷方法。 (10 分)
(三)請利用表 3 結果及 SST=560,SSR(X1,X2,X5)=551.568,計算 SSR(X5|X1,X2)和偏判斷係數 RY2, X 5 X1 , X 2 。(10 分)
(25 分)
本題含圖表或公式,請對照原卷 PDF。
- 4
一位教師擬瞭解學生的測試表現是否受智商和教學方法所影響,以60 名學生為實驗對象,在採用三種教學方法之下,獲得測試成績 Y,智商 X。前兩種教學方法 M1, M2 變數定義如下。1 教學法1 1 教學法2 M1 M2 0 其他 0 其他這位教師分別考慮的模型如下:模型 1 Yi 0 1 X i i , i 1,…, n.模型 2 Yi 0 2 M 1i 3 M 2i i , i 1,…, n.模型 3 Yi 0 1 X i 2 M 1i 3 M 2 i i , i 1,…, n.請使用表 4 部分電腦輸出 3 個模型的變異數分析(ANOVA, Analysis of Variance)報表來回答下列問題。
(一)在考慮模型 3 之下,請檢定智商 X 該解釋變數對於解釋測試成績是否有顯著的解釋能力。請用顯著水準 =0.05 檢定並詳述檢定統計量之值、決策法則、結論和所需之假設。t 分配臨界值,t0.975 (56) 2.0032 。(10 分)
(二)在考慮模型 3 之下,請檢定教學方法 M1 和 M2 這兩個虛擬變數是否在模型 3 對預測學生測試成績有效應。請在顯著水準 =0.05 ,檢定H 0: 2 =3 =0 ,請詳述檢定統計量之值、決策法則、結論和所需之假設。F 分配左尾臨界值,F0.95 (1, 56) = 4.0130 , F0.95 (2, 56) = 3.1619。(10 分)
(三)請使用表 4 說明那一種教學方法最能提升測試成績,須說明論述。(5 分)表4模型1 ANOVA表Analysis of Variance Source DF Sum of Squares Mean Square F value P-value Regression 1 816.928 816.928 14.72 0.0003 Error 58 3219.255 55.504 Total 59 4036.183模型2 ANOVA表Analysis of Variance Source DF Sum of Squares Mean Square F value P-value Regression 2 2880.033 1440.017 71 P-value Error 57 1156.150 20.283 Total 59 4036.183模型3 ANOVA表和參數估計Analysis of Variance Source DF Sum of Squares Mean Square F value P-value Regression 3 3512.745 1170.915 125.27 <.0001 Error 56 523.438 9.347 Total 59 4036.183模型3參數估計Variable DF Estimate Standard Error t value P-value Intercept 1 56.024 4.306 13.01 <.0001 X 1 0.350 0.043 8.14 <.0001 M1 1 -15.770 0.967 -16.3 <.0001 M2 1 -11.943 0.972 -12.28 <.0001
(25 分)
本題含圖表或公式,請對照原卷 PDF。
110 年(考試時間 120 分鐘) 原卷 PDF
- 1
下表為中華民國 110 年 10 月底人口數、性別比例及人口密度統計表。土地面積 人口數 性別比例(每百女 人口密度(每平縣市(平方公里) 總計 男 女 子所當男子數) 方公里人口數)新北市 2,052.57 4,014,869 1,960,442 2,054,427 95.43 1,956.02臺北市 271.7997 2,538,299 1,208,385 1,329,914 90.86 9,338.86桃園市 1,220.95 2,272,663 1,125,386 1,147,277 98.09 1,861.38臺中市 2,214.90 2,815,477 1,382,072 1,433,405 96.42 1,271.15臺南市 2,191.65 1,864,799 928,682 936,117 99.21 850.86高雄市 2,951.85 2,749,293 1,355,140 1,394,153 97.20 931.38宜蘭縣 2,143.63 451,175 227,222 223,953 101.46 210.47新竹縣 1,427.54 574,806 293,417 281,389 104.27 402.66苗栗縣 1,820.31 538,940 277,786 261,154 106.37 296.07彰化縣 1,074.40 1,257,033 638,686 618,347 103.29 1,169.99南投縣 4,106.44 485,983 248,298 237,685 104.47 118.35雲林縣 1,290.83 671,182 346,966 324,216 107.02 519.96嘉義縣 1,903.64 494,293 256,417 237,876 107.79 259.66屏東縣 2,775.60 805,717 410,328 395,389 103.78 290.29臺東縣 3,515.25 213,718 109,715 104,003 105.49 60.80花蓮縣 4,628.57 321,971 162,726 159,245 102.19 69.56澎湖縣 126.8641 106,147 54,656 51,491 106.15 836.7基隆市 132.7589 364,766 181,861 182,905 99.43 2,747.58新竹市 104.1526 452,844 223,672 229,172 97.60 4,347.89嘉義市 60.0256 265,208 128,102 137,106 93.43 4,418.25金門縣 151.656 141,180 70,367 70,813 99.37 930.92連江縣 28.8 13,516 7,822 5,694 137.37 469.31若性別比例為 X,人口密度為 Y,且∑ =2,256.69、∑ =33,358.11、∑ =233,202.3、∑ =147,581,075 及∑ =3,226,744,計算性別比例與人口密度之相關係數。(10 分)
(10 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
依題一的資料,以人口密度作為反應變數,其他皆為解釋變數進行迴歸模型分析,得到以下參數估計結果:Estimate Std error(Intercept) 10,890.376 3,076.995土地面積 -0.550 0.178人口數 總計 0.053 0.0101人口數 男 -0.110 0.022人口數 女 NA NA性別比例 -76.789 28.760
(一)參數估計表中之「NA」表示估計結果是不可得到的;詳述「人口數 女」之參數估計結果為「NA」之原因。(5 分)
(二)詳述「土地面積」之迴歸係數估計值的意義。(5 分)
(三)在顯著水準為 0.01 下,檢定各解釋變數之顯著性;並依此結果決定那些變數可被剔除。(10 分)
(20 分)
參考架構・破題
本題考複迴歸三個核心觀念:完全共線性導致設計矩陣不滿秩、偏迴歸係數的「控制其他變數不變」解釋、以及個別係數 t 檢定與變數篩選。破題先點出解釋變數間存在恆等式「人口數 總計=人口數 男+人口數 女」,全題即可一氣貫串。
完整答題架構與關鍵字:到站內看全文
- 3
依題二的迴歸模型分析,得到以下變異數分析(Analysis of variance,ANOVA)表:Source of Degrees of Sum of Mean F variation freedom squares square Regression (1) (4) (6) (8)Error (2) 18,022,930 (7)Total (3) (5)
(一)寫出 ANOVA 表中(1)至(8)的值。(8 分)
(二)計算判定係數 R²及調整判定係數 ,並詳述兩者之意義與差異。 (10 分)
(三)下表為各解釋變數之變異膨脹因子(variance inflation factor,VIF):土地面積 人口數 總計 人口數 男 性別比例VIF 1.178 2,876.474 2,870.672 1.341詳述何謂 VIF 及其值的意義。(12 分)
(30 分)
本題含圖表或公式,請對照原卷 PDF。
- 4
若 SSR 表示迴歸平方和(sum of squares for regression)
(一)詳述「額外的平方和(Extra sum of squares)」SSR( , | , )的意義。 (5 分)
(二)詳細推導SSR( , , , ) = SSR( ) + SSR( | ) + SSR( | , ) +SSR( | , , )。(10 分)
(15 分)
參考架構・破題
額外平方和是複迴歸做「變數貢獻分解」的工具,也是偏 F 檢定與序列(Type I)平方和的基礎。第一小題要講清楚它是「在已含某些變數的模型中再加入其他變數時,迴歸平方和的增加量,等於誤差平方和的減少量」;第二小題只要把每一項還原成定義形式做連鎖相消即可。以下用 X1、X2、X3、X4 表示四個解釋變數。
完整答題架構與關鍵字:到站內看全文
- 5
若考慮一因子變異數分析有 t 個處理,每個處理有 r 個觀測值,其模型表示如下:= + + , i=1,2,…,t ,j=1,2,..,r ,其中 為總平均數, 為第 i 個處理效應, 是隨機誤差項。
(一)若以線性迴歸模型= +改寫上述一因子變異數分析模型,請定義 , , 及 ,並詳述其維度。(10 分)
(二)為統計推論之目的,說明隨機誤差項所需的假設。 (5 分)
(三)若欲檢定是否存在處理效應,請詳述此檢定之虛無假設、對立假設、檢定統計量及其拒絕域。(10 分)t分配表tα
(25 分)
參考架構・破題
一因子變異數分析是線性模型的特例,本題要把 y_ij=μ+τ_i+ε_ij 改寫成矩陣式 Y=Xβ+ε。關鍵在指標(虛擬)變數的設計矩陣不滿秩、需要限制式,以及 Gauss-Markov 與常態假設分別支撐估計與推論,最後導出 F 檢定。全部觀測數 n=tr。
完整答題架構與關鍵字:到站內看全文
109 年(考試時間 120 分鐘) 原卷 PDF
- 1
一位主管欲知道碩士級分析師的月薪是否可以用年資來預測,以作為未來給薪的參考。他收集了30個樣本觀察值,資料包含年資(X,以年為單位)和月薪(Y,以千元為單位)。請依據下面數據和圖1回答問題。n X 5.34, Y 76, S XY ( X i -X )(Yi -Y )= 2198, i 1 n n S XX ( X i -X ) = 232.072, SYY (Yi -Y ) 2 21890 i 1 i 1 Y X圖1
(一)在配適 Yi 0 1 X i i 的簡單線性迴歸方程式下,請利用最小平方 法 計 算 參 數 β0 和 β1 估 計 值 ( estimates )。 如 果 將 模 型 改 為Yi 1 ( X i X ) i ,請寫出參數α和β1最小平方估計式(least- squares estimators)及其估計標準誤(standard errors)。(12分)
(二) 假 設 Yi ~ N ( 0 1 X i , 2 ) , 請 在 顯 著 水 準 0.05 下 , 檢 定H0 : 1 0。請試述檢定統計量之值、決策法則和結論。請寫出在應用最大概似估計(Maximum likelihood estimation)法, 的估計值。請寫出利用最小平方法, 的估計值。 (10分)
(三)請問年資是5年的碩士級分析師之平均薪資的95%信賴區間。 (4分)
(26 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
(一)一位分析師受託分析一組資料。資料來自於20位25歲至34歲的健康女性,其中包括反應變數 Y(身體脂肪)和三個解釋變數(X1:皮褶厚度,X2:大腿圓周和 X3:中臂圓周)用作預測身體脂肪。該分析師初步配適一個迴歸模型如下:模型1 Yi 0 1 X 1i 2 X 2 i 3 X 3i i i 1,, 20.另外,表1計算解釋變數之間的解釋能力。表1反應變數 解釋變數 判定係數, 99.86% , 99.82% , 99.04%請由表1計算變異數膨脹因子(variance inflation factor, VIF)評論該分析師所配適的迴歸模型1是否合適?如果不合適,請詳細說明原因和解決方法。(8分)
(二)一位分析師受託分析影響縣市首長滿意度的重要因素。滿意度分數Y(以1~10為評分範圍,分數愈高代表愈滿意)作為反應變數。該分析師找到一些重要的解釋變數。依據他所配適的複迴歸模型,有些預測值有超過10的情況。請問該分析師所配適的複迴歸模型是否合適?如果不合適,請詳細說明原因和解決的方法。(6分)
(三)一位分析師分析2017年1月至2019年12月的旅遊人數月資料。該分析師配適的迴歸模型如下:模型2 ln( yt ) 0 1t 2 M1 3 M 2 12 M11 t , t iid~ N(0, 2 )此處 t 是時間, t 為獨立且具有共同分配其平均數為0變異數 2 的常態分配, 是虛擬變數,第 i 個月為1,其他月份為0,i=1, 2,…, 11。請說明在線性迴歸模型下,如何檢查誤差項的所有假設是否有違反。圖2是模型2的標準化殘差值(studentized residual)對應時間的殘差圖。請問該分析師所配適的複迴歸模型是否合適?如果不合適,請詳細說明原因和解決的方法。(10分)圖2
(24 分)
本題含圖表或公式,請對照原卷 PDF。
- 3
一位數據分析師受託分析於33(n=33)位男學生,其腳長(Y,以公分為單位)和 X 身高(以英吋為單位)的關係。所建立的簡單線性模型如下:Yi 0 1 X i i , i 1,…, n.請使用表2部分電腦輸出報表來回答以下問題。表2第一欄是觀察值的順序,第二欄是殘差值。
(一) 請 說 明 何 謂 異 常 點 ( outlier ) 和 高 槓 桿 觀 察 值 ( high leverage,及其之間的區別。(8分)observation)
(二)表2第三欄是標準化的殘差值(studentized residual) 。請以此判斷是否有異常點存在?請說明判斷準則。表2第五欄是 Student 化刪除殘差(Studentized deleted residuals,以R-Student 表示)。第 i 個 R-Student 殘差是在假定將資料中的第 i個觀察值刪除,然後以剩下的 n-1個觀察值來建立新的估計迴歸方程式而標準化獲得的 R-Student 殘差值。請以此判斷是否有異常點存在?請說明判斷準則。(8分)1 ( X i X )2
(三)表2第六欄是 hii(hat value) ,其公式為 hii n , ( X j X )2 n j 1 n請問 hii 的值為何?請以此判斷是否有可能的高槓桿觀察值存i 1在 ? 請 說 明 判 斷 準 則 。 表 2 的 最 後 一 欄 , 第 八 欄 是 DFFITS(Difference in Fits)值。請以此判斷是否有可能的影響點(influential observation)存在?請說明判斷準則。 (8分)表2 Obs Residual Student Cook's D R- Hat Diag Cov DFFITS Residual Student Ratio H 1 0.541 0.443 0.011 0.438 0.101 1.173 0.147 2 0.906 0.718 0.009 0.712 0.035 1.070 0.136 3 -1.777 -1.410 0.041 -1.434 0.040 0.974 -0.293 4 0.390 0.308 0.002 0.304 0.033 1.097 0.056 5 -0.977 -0.772 0.010 -0.767 0.032 1.061 -0.140 6 -1.510 -1.194 0.024 -1.203 0.033 1.005 -0.222 7 1.490 1.179 0.024 1.186 0.033 1.007 0.219 8 -0.160 -0.127 0.000 -0.125 0.045 1.117 -0.027 9 1.023 0.809 0.011 0.804 0.032 1.057 0.147 10 -0.510 -0.403 0.003 -0.398 0.033 1.093 -0.073 11 1.957 1.563 0.067 1.602 0.052 0.956 0.374 12 0.157 0.125 0.000 0.123 0.052 1.125 0.029 13 1.023 0.809 0.011 0.804 0.032 1.057 0.147 14 0.556 0.444 0.005 0.438 0.050 1.110 0.101 15 -0.777 -0.614 0.006 -0.608 0.032 1.077 -0.111 16 -0.243 -0.192 0.001 -0.189 0.030 1.099 -0.034 17 -2.043 -1.632 0.073 -1.679 0.052 0.941 -0.392 18 -1.810 -1.458 0.078 -1.486 0.068 0.994 -0.402 19 0.140 0.110 0.000 0.109 0.031 1.101 0.019 20 2.356 1.944 0.236 2.041 0.111 0.926 0.721 21 0.623 0.522 0.022 0.516 0.141 1.221 0.209 22 0.490 0.388 0.003 0.382 0.033 1.093 0.071 23 0.790 0.627 0.008 0.620 0.039 1.083 0.125 24 -0.843 -0.697 0.031 -0.691 0.114 1.168 -0.248 25 -0.810 -0.641 0.007 -0.635 0.033 1.075 -0.117 26 1.490 1.179 0.024 1.186 0.033 1.007 0.219 27 0.490 0.388 0.003 0.382 0.033 1.093 0.071 28 -3.545 -3.437 3.274 -4.299 0.357 0.636 -3.200 29 0.089 0.073 0.000 0.072 0.086 1.168 0.022 30 0.257 0.203 0.001 0.200 0.030 1.098 0.035 31 -1.277 -1.013 0.021 -1.014 0.040 1.040 -0.207 32 1.323 1.065 0.040 1.067 0.066 1.061 0.283 33 0.190 0.153 0.001 0.151 0.068 1.144 0.041
(24 分)
本題含圖表或公式,請對照原卷 PDF。
- 4
一位統計分析師受託預測單位面積房價,欲了解房價受到那些因素所影響。收集了408筆有關於單位面積房價,屋齡(X1,以年為單位) ,到最近的地鐵站的距離(X2) ,便利商店數量(X3) ,房屋座落的緯度(X4)和經度(X5)。擬考慮的模型如下:模型1 Yi 0 1 X 1i 2 X 2 i 3 X 3i 4 X 4 i 5 X 5i i , i 1,…, n.模型2 Yi 0 1 X 1i 2 X 2 i 3 X 3i i , i 1,…, n.模型3 Yi 0 1 X 1i 2 X 2 i 4 X 4i 5 X 5i i , i 1,…, n.請使用表3部分電腦輸出三個模型的變異數分析表(ANOVA, Analysis of Variance)報表來回答以下問題。表3 模型1 ANOVA表Response: Y DF Sum of Mean F value P-value squares square Model 5 44260 8852.03227 134.46 <.0001 Error 402 26465 65.83443 Corrected Total 407 70726模型2 ANOVA表Response: Y DF Sum of Mean F value P-value squares square Model 3 41703 13901 193.50 <.0001 Error 404 29023 71.83833 Corrected Total 407 70726模型3 ANOVA表Response: Y DF Sum of Mean F value P-value squares square Model 4 41879 10470 146.27 <.0001 Error 403 28847 71.57982 Corrected Total 407 70726
(一)在考慮模型1之下,請檢定便利商店數量(X3)這個解釋變數是否可以從給定模型1中刪除。請用顯著水準 0.05 檢定並敘述對立假設、檢定統計量之值、決策法則和結論。 (8分)
(二)在考慮模型1之下,請檢定房屋座落的緯度(X4)和經度(X5)這兩個解釋變數是否在模型1對預測單位面積房價有影響。亦即請用 0.05 檢定 H0 : 4 5 0,並請敘述對立假設、檢定統計量之值、決策法則和結論。(8分)
(三)請計算模型1,2和3的調整的複判定係數 R(the 2 adjusted R-squared)並試述其意義。請敘述(一)(二)檢定,模型誤差項所需要的假設,並綜合(一)(二)檢定結果,請說明在模型1,2和3中,何者模式為最佳模型。(10分)
(26 分)
本題含圖表或公式,請對照原卷 PDF。
108 年(考試時間 120 分鐘) 原卷 PDF
- 1
考慮一簡單線性迴歸模型Yi = α + β X i + ε i , i=1,…,n, 其中Yi 為因變數, X i為自變數, ε i 為誤差項且與 X i 獨立。另外,也假設 ε i (i=1,…,n)具有獨立且相同的常態分布 N (0,σ 2 ),其中 σ 2 表變異數。 (每小題 5 分,共 20 分)
(一) 請 導 出 參 數 α ,β 的 最 小 平 方 估 計 式 αˆ ,βˆ , 並 證 明 其 不 偏 性(unbiasedness) 。
(二)如果其他假設不變,但Var (ε i ) = σ 2 X i2 , i=1,…,n。說明由(一)導出之 βˆ 是否仍具有不偏性?在此情形下,是否可提供較佳的估計式(以式子說明概念或作法,無需列出詳細結果)?
(三)如果其他假設不變,但 Cov(ε i , ε i +1 ) = ρσ 2 , i=1,…,n-1。說明由(一)導出之 βˆ是否仍具有不偏性?試舉例說明何種類型的數據會較容易發現 ρ ≠ 0 的情形。如何檢定 ρ = 0 (以式子說明概念或作法,無需列出詳細結果)?
(四) 假 設 自 變 數 Xi 無 法 直 接 被 觀 察 到 , 而 是 觀 察 到 一 個 替 代 變 數Wi ,i = 1,..., n, Wi = X i + δ i , δ i 為白噪音(white noise)與其他變數均獨立,且δ i(i=1,…,n)具有獨立且相同的常態分布 N (0,1) 。此時若將Wi 取代最小平方估計式 βˆ 中的 X i ,並令所得之新估計式為 βˆw 。說明此 βˆw 是否仍具有不偏性?當 n 很大時, βˆw 的漸近偏差為何?在此情形下是否可提供較佳的估計式(以式子說明概念或作法,無需列出詳細結果)?
(20 分)
參考架構・破題
本題以簡單線性迴歸為基礎,依序檢驗 OLS 估計式在「變異數不齊一」「誤差自我相關」「自變數有測量誤差」三種假設破壞下是否仍不偏,並提出修正方法。關鍵在於:前兩者只影響效率、不影響不偏性;測量誤差則造成偏誤(衰減偏誤)。
完整答題架構與關鍵字:到站內看全文
- 2
在一調查薪資結構的研究中,吾人欲了解薪資(Y)與以下兩變數(X1, X2)的關係,其中 X1 表性別(女性為 F,男性為 M) ,X2 表區域別(分為 A, B, C 三個區域) ,收集資料如下表:Y 6 4 3 4 4 2 X1 F F F M M M X2 A A B B C C一般來說,統計軟體的語法建立 Y 與兩變數的迴歸模型分析時,模式部分可寫為 Y~X1+X2(R 軟體)或 Y= X1 X2(SAS 軟體) ,或是直接點選 X1, X2 為自變數進行迴歸分析。請依據此精神與上述之資料,
(一) 定 義 一 個 設 計 矩 陣 ( design matirx ), 並 說 明 此 設 計 矩 陣 各 個 欄(column)的意義。寫下線性迴歸模型,以矩陣形式列出正規方程式(normal equation),解正規方程式求出參數估計值,列出三區域之兩兩比較薪資差異的估計值。 (14 分)
(二)完成下面之 ANOVA 表。(8 分)Analysis of Variance Table: Response: Y自由度 平方和 均方和 F 值變異來源(d.f.) (SS) (MS) F value迴歸殘差總和 8.833
(三)計算性別薪資差異(男性對女性)的 95%信賴區間,估計一個男性在區域A的平均薪資及其 95%信賴區間。最後,根據 ANOVA 表格中 F值說明其代表之意義。(10 分)
(32 分)
本題含圖表或公式,請對照原卷 PDF。
- 3
在一個關於放射線對腫瘤及壽命的影響研究中,研究人員利用老鼠設計了一項為期兩年的實驗。此實驗設計 30 隻老鼠每週照射不同劑量的放射線(劑量範圍為 1~10),並記錄其壽命(單位:週)。數據形式如下表:X(劑量) 1 1 1 2 2 2 3 3 … … 8 8 9 9 9 10 10 10 Y(壽命)104 104 104 104 104 98 104 94 … … 53 56 44 36 56 37 26 46根據資料,研究人員完成一迴歸分析及配適圖如下:Y 2 4 6 8 10 X
(一)根據分析結果,求 X 與 Y 之相關係數,完成下面之變異數分析表(ANOVA table)並說明此模型是否恰當?另,預測當 X=15 時之壽命,說明是否認同此預測值?(15 分)自由度 平方和 均方和 F 值變異來源(d.f.) (SS) (MS) F value迴歸殘差 ---總和 --- ---
(二)由於實驗時間的限制,事實上有 8 隻老鼠壽命記錄在 104 週時還是活著的狀態。試問若預算足夠而得以完整觀察所有老鼠的壽命時(如實驗時間 3 年),則迴歸分析的參數估計會如何變動(可配合圖形說明) ,亦即實驗數據因經費限制而對於真實之「壽命與輻射劑量關係」的分析結果可能產生怎樣的影響?(5 分)
(20 分)
本題含圖表或公式,請對照原卷 PDF。
- 4
一組資料內含 Y 及 X1~X5 等變數,資料有 31 筆觀察值。為了進行變數選取,考慮 Y 對 X1~X5 之一階(first order)所有可能迴歸模式。經由分析整理得到下表:no. of no. of X1 X2 X3 X4 X5 adjr2 Cp X1 X2 X3 X4 X5 adjr2 Cp variables variables 1 0 0 0 0 1 0.142 14.5 3 1 0 1 0 1 0.371 5.4 1 0 0 1 0 0 0.142 14.5 3 1 0 0 1 1 0.361 5.8 1 0 0 0 1 0 0.14 14.6 3 0 1 1 0 1 0.294 8.8 1 1 0 0 0 0 0.014 20.8 3 0 0 1 1 1 0.277 9.6 1 0 1 0 0 0 0.008 21 3 0 1 0 1 1 0.263 10.2 2 0 0 1 0 1 0.288 8.3 3 1 1 0 0 1 0.21 12.6 2 0 0 0 1 1 0.286 8.4 3 1 1 1 0 0 0.178 14 2 1 0 0 0 1 0.189 12.9 3 1 0 1 1 0 0.169 14.5 2 1 0 1 0 0 0.185 13.1 3 1 1 0 1 0 0.156 15.1 2 1 0 0 1 0 0.176 13.5 3 0 1 1 1 0 0.128 16.3 2 0 1 0 0 1 0.163 14.1 4 1 1 1 0 1 0.377 6.1 2 0 1 1 0 0 0.137 15.3 4 1 0 1 1 1 0.361 6.7 2 0 0 1 1 0 0.126 15.8 4 1 1 0 1 1 0.343 7.5 2 0 1 0 1 0 0.115 16.4 4 0 1 1 1 1 0.322 8.4 2 1 1 0 0 0 0.021 20.7 4 1 1 1 1 0 0.164 15.3 3 1 0 1 0 1 0.371 5.4 5 1 1 1 1 1 0.401 6
(一)以 adjusted R2 為準則,排序選取最佳三個模式。(6 分)
(二)以 Mallow’s Cp 為準則,排序選取最佳三個模式。 (6 分)
(三)採用 F 檢定法,說明向後消去法(Backward elimination, stay level=0.05)準則的選模過程,並列出所選取之模式。(10 分)
(四)除變數選擇外,針對模型 Y=β0 +β1X1+β2X2+β3X3+β4X4+β5X5+ε 分析得到另ㄧ表。請以第一列的值解釋 dfb.X2(-0.154)及 dffit(-0.371)的用途及其大概的原理。(6 分)Obs. dfb.X1 dfb.X2 dfb.X3 dfb.X4 dfb.X5 dffit cov.r cook.d hat 1 -0.101 -0.154 -0.23 0.201 -0.132 -0.371 2.008 0.024 0.396 2 0.1 0.083 0.072 -0.081 -0.044 0.177 1.608 0.005 0.226 3 -1.145 2.676 2.773 -2.481 1.735 4.332 0.001 0.902 0.23 … 30 0.019 0.053 0.049 -0.046 -0.016 -0.079 1.636 0.001 0.223 31 0.063 0.07 0.037 -0.048 -0.048 -0.184 1.498 0.006 0.179
(28 分)
本題含圖表或公式,請對照原卷 PDF。
107 年(考試時間 120 分鐘) 原卷 PDF
- 1
(一)何謂多重共線性(multicollinearity)?多重共線性對估計結果有何影響?如何偵測複迴歸模型中存在多重共線性?請詳述所需要的判斷準則。(12 分)
(二)一位分析師進行迴歸分析資料並配適複迴歸模型如(1)。Yi = β 0 + β1 X 1i + " + β 7 X 7 i + ε i , i = 1," ,100 (1)所獲得初步結果如圖 1。請用圖 1 部分統計電腦套裝軟體輸出結果,說明這位分析師所配適的模型是否合適?如果模型(1)不合適,請說明原因並提供所有可以解決問題的方法。(10 分)圖1
(22 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
醫院分析師希望研究患者滿意度(Y)與患者年齡(X1,以年為單位),疾病嚴重程度指數(X2)以及焦慮指數(X3)之間的關係。分析師隨機選擇了 46 名患者並收集了數據。請使用圖 2 部分統計電腦套裝軟體輸出結果來回答以下問題。圖 2
(一)請計算額外平方和(extra sum of squares)SSR( X 2 | X 1 , X 3) = ?(4 分)
(二)假設這位分析師採用模型是 Yi = β 0 + β1 X 1i + β 3 X 3i + ε i (2)該分析師想知道在模型(2)之下,增加疾病嚴重程度指數(X2)此額外變數,解釋其在顯著水準α=5%下是否有顯著的貢獻,並敘述對立假設、檢定統計量之值、決策法則和結論。(8 分)
(三)假設這位分析師採用模型是 Yi = β 0 + β1 X 1i + β 2 X 2i + β 3 X 3i + ε i (3)請檢定疾病嚴重程度指數(X2)和焦慮指數(X3)兩個解釋變數是否可以從模型(3)中刪除,也就是在已經有患者年齡(X1)解釋變數之下,解釋變數 X2 和 X3 可否從模型中移除?請在顯著水準α=5%檢定,並協助敘述對立假設、檢定統計量之值、決策法則和結論。在本小題的檢定問題中,請試述需要作何假設,才能執行這些統計檢定。(10 分)
(22 分)
本題含圖表或公式,請對照原卷 PDF。
- 3
一 位 分 析 師 考 慮 對 三 組 數 據 配 適 一 個 簡 單 迴 歸 模 型Yi = β 0 + β1 X i + ε i ,其中 β 0 、 β 1 為參數, ε 為隨機誤差,且假設其為具均數 0,標準差 σ 之常態分配。
(一)配適模型後,三組數據之殘差分析圖分別為 3(a)、3(b)、3(c),請分別說明配適迴歸模型是否恰當?若模型不合適或偏離模型假設時,請指出不恰當之處並請提出修正的方法。(21 分)
(二)在何種情況下,需要採用加權最小平方法(Weighted least squares)估計未知的參數?請協助提供散佈圖和殘差圖說明。(7 分)圖3(a) 標準化殘差時間序列圖(Standardized residuals vs. time)圖3(b) 標準化殘差對預測值圖(Standardized residuals vs. ݕො )圖 3(c) 標準化殘差對預測值圖(Standardized residuals vs. ݕො )
(28 分)
本題含圖表或公式,請對照原卷 PDF。
- 4
一位資料分析師受託分析一組數據,想要了解一個特定基因,稱之GT 基因,是否有影響老鼠斷奶時的重量。該分析師預計配適模型 1和模型 2。Y=斷奶時的重量(公克為單位)X1=年齡(以日為單位)X2=品種(品種 A=1,B=0)X3=GT 基因(有此基因=1,無此基因=0)X4=性別(公老鼠=1,母老鼠=0)模型 1: Yi = β 0 + β1 X 1i + β 2 X 2i + β 3 X 3i + β 4 X 4i + ε i ,模型 2: Yi = β 0 + β1 X 1i + β 2 X 2i + β 3 X 3i + β 4 X 4i + β 5 X 1i X 2i + ε i ,請 使 用 圖 4 和圖 5 中 部 分 統 計 電 腦 套 裝 軟 體 輸 出 變 異 數 分 析(ANOVA, Analysis of Variance)回答下列問題:
(一)請計算模型 1 和模型 2 的調整的複判定係數 R2 (the adjusted R-squared)。試述其意義,並判斷何種模型為佳。(8 分)
(二)在顯著水準 5%下,請檢定「GT 基因」在模型 1 中是否影響老鼠的重量?(4 分)
(三)請解釋在考慮模型 1 下,請說明如何檢定老鼠的性別之兩條迴歸線是相同的迴歸線。並請列出虛無假設、對立假設、檢定統計量及決策法則。(4 分)
(四)在顯著水準 5%下,請檢定 X1i X2i 相乘項在模型 2 中是否對解釋反應變數 Y 有顯著貢獻?請試述虛無假設、檢定統計量之值、決策法則和結論,以及所需要之假設。請解釋 X1i X2i 該項在迴歸模型的意義。(12 分)圖 4 模型 1 的變異數分析圖 5 模型 2 的變異數分析
(28 分)
本題含圖表或公式,請對照原卷 PDF。
106 年(考試時間 120 分鐘) 原卷 PDF
- 1
考慮一多元線性迴歸模型,其反應變數為 Y,解釋變數為 X1 , X2 , … , Xk,有 n 個觀測值,線性迴歸模型為 Yi = β 0 + β1 X i1 + β 2 X i 2 + ... + β k X ik + ε i , i = 1, ... , n ,其中誤差項 ε i之期望值為 0,變異數為 σ 2 ,且兩兩獨立,此模型以向量及矩陣方式表示為Y = Xβ + ε (*),其中⎡ Y1 ⎤ ⎡1 X 11 " X 1k ⎤ ⎡β0 ⎤ ⎡ ε1 ⎤ ⎢Y ⎥ ⎢1 X 21 " X 2k ⎥ ⎢β ⎥ ⎢ε ⎥ Y =⎢ ⎥ ,X =⎢ ⎥ ,β = ⎢ ⎥ ,ε = ⎢ 2 ⎥ 2 1 ⎢#⎥ ⎢ # " # ⎥ ⎢# ⎥ ⎢#⎥ ⎢ ⎥ ⎢ ⎥ ⎢ ⎥ ⎢ ⎥ ⎣Yn ⎦ n×1 ⎣1 X n1 " X nk ⎦ n×( k +1) ⎣ β k ⎦ ( k +1)×1 ⎣ε n ⎦ n×1請回答下列問題:(每小題 5 分,共 30 分)
(一)以向量及矩陣方式,試求出參數向量 β 之最小平方估計量向量 b。
(二)承題(一),令 A 為一個 2 × (k+1) 的矩陣,求 Ab 之變異數-共變異數矩陣。
(三)配適值向量表為 Yˆ = HY ,寫出矩陣 H。
(四)求出殘差向量 e = Y − Yˆ 之變異數-共變異數矩陣。
(五)令 A 為對稱矩陣,則 Y ' AY 稱為 Y 之二次式,將此模型之 SSE(error sum of square)= e' e 表成二次式,其中 Y ' 和 e' 分別是 Y 和 e 之轉置矩陣。
(六)求出 β 之最大概似估計量,對誤差項向量需要什麼假設。
(30 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
某無人車研發公司欲預測它的行車時間 Y,考慮了三個高度相關的解釋變數分別是行駛里數 X1,車種 X2,車齡 X3,收集過去 20 個月資料得到SSR(X1, X2, X3) = 4000, SSR(X1) = 1000, SSR(X1|X2) = 600, SSE(X1, X2, X3) = 800,請回答下列問題:(每小題 5 分,共 15 分)
(一)求偏判定係數 rYX3 .X1X 2。
(二)檢定偏相關係數 ρ YX3 .X1X 2 是否為 0,請求出 F 檢定統計量的值。
(三)求偏判定係數 rYX1X 2 .X3(以最簡分數表示)。全一張(背面)等 別:三等考試
(15 分)
參考架構・破題
本題考額外平方和(extra sum of squares)與偏判定係數。核心公式:偏判定係數=新增變數的額外迴歸平方和 ÷ 未納入該變數時模型的殘差平方和;偏相關檢定即部分 F 檢定。
完整答題架構與關鍵字:到站內看全文
- 3
一國內規模最大的律師事務所專門辦理職災案件,總經理想了解他們在捷運上的廣告有沒有增加他們的業務量,根據過去隨機抽取 11 月的資料,利用兩個解釋變數:一為單月廣告費用 X1(單位為百萬元,平均值為 1 單位,標準差為 2 單位),另一個為主要競爭對手單月廣告費用 X2(單位為百萬元,平均值為 1 單位,標準差為 2 單位)來預測職災案件的每月增加件數 Y(單位為件,平均值為 3 件,標準差為 2 件),下表是以不同解釋變數配適每月增加件數 Y 之迴歸模型的參數最小平方估計量和誤差平方和 SSE。迴歸模型代號 迴歸模型中的解釋變數 參數最小平方估計量 SSE LM1 X1 b1 = 0.3 5 LM2 X2 b2 = -0.1 8 LM3 X 1 , X2 b1 = 0.2, b2 = -0.2 4下面所有小題的計算若除不盡,一律四捨五入到小數第二位,否則不給分。
(一)分別求出三個迴歸模型 LM1~LM3 之判定係數。(6 分)
(二)分別求出三個迴歸模型 LM1~LM3 之修正判定係數。(6 分)
(三)使用題(二)的結果求出 Y 和 X1 之相關係數以及 Y 和 X2 之相關係數。(4 分)
(四)針對迴歸模型 LM3 於試卷上依序填入下列 ANOVA 表中(1)~(8)之 8 個空格內容。(8 分)Analysis of Variance Source DF Sum of Squares Mean Square F Value Model (1) (3) (6) (8) Error (2) (4) (7) Corrected Total 10 (5)
(五)針對迴歸模型 LM3 欲檢定 X2 的係數是否為 0,求出偏 F 檢定的計算值。(6 分)
(六)針對迴歸模型 LM3,當迴歸係數在什麼條件下,MSR 的期望值為σ 2 ?(5 分)
(七)若三個變數之變異數-共變異數矩陣為:⎡1 1 0 ⎤ V = ⎢1 4 1 ⎥ ⎢ ⎥ ⎢⎣0 1 16⎥⎦為了求其相關係數矩陣,需在 V 前後乘一個對角矩陣,寫出此對角矩陣。(5 分)
(40 分)
本題含圖表或公式,請對照原卷 PDF。
- 4
某大數據資料分析公司以 Y 對三個變數 X1, X2, X3 所做的複迴歸分析中,樣本大小n = 14,得到複判定係數 R2 = 90%,又將 Y 改對變數 X2 做迴歸分析時,得到判定係數 R2 = 70%,請回答下列問題:(每小題 5 分,共 15 分)
(一)此公司欲檢定 X1, X3 的迴歸係數是否為 0,請求出 F 檢定統計量的值。
(二)設速食店營收為 Y(單位為百萬元) ,廣告費為 X1,有得來速(drive-through)服務時 X2 = 1,沒有則 X2 = 0,做迴歸分析得到迴歸平面為 Y = 1+1.5 X1+2 X2,因有得來速服務多出來的平均營收為多少元?
(三)承題(二),令 R 2j 代表解釋變數 Xj 對另一個解釋變數做迴歸分析得到的判定係數,j = 1,2, 且 R12 = 0.65, R 22 = 0.95,求出 X2 之變異數膨脹因子(VIF),若 VIF 大於 10 代表模式有何問題?
(15 分)
104 年(考試時間 120 分鐘) 原卷 PDF
- 1
兩位科學家試圖研究某一個解釋變數 X 與某一個反應變數 Y 之間的直線關係。數據如下,請根據提供的數據回答以下問題:X 10 9 8 7 6 5 4 3 Y 45 20 34 58 70 57 55 44
(一)兩位科學家委託一位統計學家協助計算他們有興趣的直線關係。為了徹底了解 X與 Y 之間的直線關係,統計學家建議先試試「Y = A」,也就是說,X 與 Y 之間沒關係。請問根據以上數據,A 的估計值等於多少?(5 分)
(二)接下來,統計學家假設的直線關係是「Y = A + B × X」,其中「B × X」意味著「『直線斜率』乘以『X』 」。也就是說,統計學家第二次研究具有「直線截距」與「直線斜率」的直線關係。請問根據以上數據,直線斜率 B 的估計值等於多少?(10 分)
(三)最後,兩位科學家在收到上述分析報告之後,決定更動直線關係為「Y = B × X」。也就是說,兩位科學家第三次研究的議題是「無直線截距」的直線關係。請再一次根據以上數據,回答直線斜率 B 的估計值等於多少?(10 分)
(25 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
兩位科學家試圖研究某一個解釋變數 X 與某一個反應變數 Y 之間的直線關係。數據如下:X 10 9 8 7 6 5 4 3 Y 45 20 34 58 70 57 55 44這兩位科學家決定取得數據在「Y = A + B × X + ε,ε 為誤差項」這一項假設下的變異數分析表。請問:
(一)總平方和(total sum of squares)等於多少?(10 分)
(二)迴歸平方和(regression sum of squares)等於多少?(10 分)
(三)誤差平方和(residual sum of squares)等於多少?(5 分)
(25 分)
本題含圖表或公式,請對照原卷 PDF。
- 3
假設一組 38 個樣本、三個變數的數據集,其中三個變數分別是一個反應變數、一個解釋變數、加上一個源自前述解釋變數的「兩水準虛擬變數(dummy variable)」。也就是說,這一個虛擬變數只會出現兩種數字,假設不是「0」就是「1」 。請回答以下問題:
(一)如果數據科學家提出一個這樣的複迴歸模型「反應變數 = A + B × 解釋變數 + C × 虛擬變數+ D × 虛擬變數× 解釋變數」。請寫下「虛擬變數等於 1」的數學方程式?(5 分)
(二)請說明(一)的迴歸係數 A, B, C, D 的數值以描述在「『虛擬變數等於 0』與『虛擬變數等於 1』下的迴歸直線是同一條直線。」 (10 分)
(三)請說明(一)的迴歸係數 A, B, C, D 的數值以描述在「『虛擬變數等於 0』與『虛擬變數等於 1』下的迴歸直線是兩平行直線。」 (10 分)全一張(背面)等 別:三等考試
(25 分)
參考架構・破題
本題考含交互作用項的虛擬變數迴歸模型:Y=A+BX+CD+D·(D×X)。虛擬變數改變截距,交互作用項改變斜率;藉由係數限制判斷兩組迴歸線是否重合或平行。
完整答題架構與關鍵字:到站內看全文
- 4
統計學家為一位有興趣採用「迴歸分析」實踐「檢定三個處理平均數是否相等」的科學家寫下這樣的設計矩陣 X,1 1 0 1 1 0 1 1 0 1 0 1 1 0 1 1 0 1 1 0 0 1 0 0 1 0 0請回答以下問題:
(一)請計算 H 矩陣(hat matrix)。(5 分)
(二)請用(一)結果證明這時候 (I − H ) (I − H ) = (I − H ) ,其中 I 是一個對角線上是 1、其他都是 0 的方陣。(10 分)
(三)根據迴歸分析理論的計算,統計學家發現檢定「三個處理平均數相等」這一項虛無假設的檢定統計量是兩項「迴歸平方和」之間的「差」 。請問是那兩項迴歸平方和?回答問題時,請根據題意自行定義相關的符號。 (10 分)
(25 分)
參考架構・破題
本題以迴歸處理單因子變異數分析:9 筆觀測、3 個處理各 3 筆,設計矩陣含截距與兩個虛擬變數。考投影矩陣 H 的計算、I-H 的冪等性,以及以額外平方和建構「處理效應」檢定。
完整答題架構與關鍵字:到站內看全文
103 年(考試時間 120 分鐘) 原卷 PDF
- 1
考慮簡單線性迴歸模型如下:E (Y | X x) 0 1 x (1)若解釋變數 X 的值替代為 Z=aX+b,a≠0 且 b 為常數,則模型(1)改寫為:E (Y | Z z ) 0 1 z (2)請比較 0 與 0 、 1 與 1 的關係。(10 分)(1)與模型(2)的判定係數是否改變?(回答是或否即可)(2 分)
(12 分)
- 2
若反應變數為 Y,解釋變數為 X j ,j=1,2,..,p,及 n 個觀測值。考慮線性迴歸模型如下:Yi 0 1 X i1 2 X i 2 p X ip i , i=1,2,…,n (3)其中 i 為均數是 0,變異數是 2 的隨機誤差項。若將模型(3)以向量及矩陣方式表達如下:Y X (4)請分別定義 Y、X、β 及 ε 之向量及矩陣之表達式,並標示其行與列的大小。(8 分)試求模型(4)中,β 的最小平方估計式。(10 分)最小平方估計式為不偏的。(5 分)若欲求得 β 的最大概似估計式,需對誤差 ε 有如何的假設?(2 分)
(25 分)
- 3
表一為民國 101 年縣市有關教育的資料(最後兩列分別為各變數值的加總與平方後之加總),圖一為其對應之兩兩變數散布圖矩陣(Scatter matrix),表二為這些變數之變異共變異矩陣(Variance-covariance matrix)。若考慮 X 3 及 X 4 放入模型中,表三為其估計結果。表四為僅考慮 X 4 放入模型中的估計結果。以題二中迴歸模型(4)的表達方式,表五為僅考慮 X 3 在模型中 ( X T X ) 1 與 ( X T Y )的結果(上標 T 代表矩陣的轉置)。請回答下列問題:在 Y 與 X 1 的散布圖中,可看到一個明顯的離群值(Outlier),請說明為那一個縣市?(2 分)請計算所有變數之兩兩變數間的相關係數矩陣(Correlation matrix)。(10 分)(請接第二頁)全五頁第二頁等 別: 三等考試若將題 中所發現的離群值排除後,再計算 Y 與 X 1 的相關係數。另外,若將該離群值排除,已知不會影響 X 3 及 X 4 的相關係數。請建議後續統計分析(包含迴歸分析)該如何處理此一離群值。(6 分)請說明表三中三個「t statistic」的意義,及其值與所對應之 p value 所代表之結論。(6 分)請說明表三中「Residual standard error」的意義。(5 分)請說明表三中「F-statistic」的意義,及其值與所對應之 p value 所代表之結論。(5 分)請比較題 及題 的結論是否一致?無論一致與否,皆請說明為何能有這樣的結果。(5 分)表三與表四中所得到 X 4 的迴歸係數估計皆為正的,是否可說明「國中生視力不良率愈高,大專以上學歷所占比例愈高;高視力不良率可提升國民的教育程度,因此視力不良率很高不是一件不好的事。」請評論引號中的話。(5 分)請說明為何表四的「Multiple R-squared」比表三的值小,但表四的「Adjusted R-squared」卻比表三的值大。(5 分)僅考慮 X 3 在模型中的簡單線性迴歸模型,請計算其截距與斜率的估計值。(6 分)若考慮下列三個模型:Y 01 31 X 3 41 X 4 Y 02 32 X 3 Y 03 43 X 4 那一個模型為最適模型?請寫出理由及所根據的準則。(8 分)(請接第三頁)全五頁第三頁等 別: 三等考試表一15 歲以上民間人 平均每一教師 平均每一教師 視力不良率- 視力不良率-口之教育程度結 教導學生數- 教導學生數- 國小 國中構-大專及以上 國小 國中 ( X 3 ,%) ( X 4 ,%)(Y,%) ( X1) ( X2 )新北市 37.9 15.0 14.4 54.6 77.6臺北市 63.3 12.8 12.7 52.4 78.1臺中市 39.0 16.3 14.0 53.4 78.1臺南市 34.9 15.9 14.6 49.6 75.9高雄市 37.6 16.0 14.0 51.2 74.1宜蘭縣 29.2 13.6 13.4 43.3 68.2桃園縣 35.1 17.1 14.3 49.5 74.1新竹縣 34.8 15.2 12.8 47.0 70.1苗栗縣 27.1 12.9 12.1 43.9 67.2彰化縣 28.1 16.0 14.5 52.7 79.6南投縣 27.7 11.8 13.1 41.4 66.8雲林縣 24.7 13.5 13.8 44.9 65.8嘉義縣 22.9 12.1 12.8 41.5 67.4屏東縣 27.0 13.5 14.6 38.9 61.2臺東縣 19.4 9.5 11.8 31.1 55.1花蓮縣 29.4 10.9 12.3 36.6 59.5基隆市 35.1 14.8 12.5 53.0 74.4新竹市 46.1 16.7 13.2 49.7 73.3嘉義市 49.8 17.5 14.7 54.0 78.7總和 649.1 271.1 255.6 888.7 1345.2平方和 24124.55 3957.55 3454.52 42366.01 96138.94表二Y X1 X2 X3 X4 Y 108.29 11.24 1.91 47.15 49.93 X1 11.24 4.97 1.50 12.37 12.70 X2 1.91 1.50 0.89 3.36 3.65 X3 47.15 12.37 3.36 44.35 45.79 X4 49.93 12.70 3.65 45.79 49.93(請接第四頁)全五頁第四頁等 別: 三等考試表三Estimate Std Err t statistic p value Intercept -26.12 29.4966 -0.886 0.389 X3 0.58 1.2380 0.468 0.646 X4 0.47 1.1667 0.402 0.693 Residual standard error: 8.048 on 16 degrees of freedom Multiple R-squared: 0.4683, Adjusted R-squared: 0.4018 F-statistic: 7.046 on 2 and 16 DF, p-value: 0.006388表四Estimate Std Err t statistic p value Intercept -36.63 18.6525 -1.964 0.06611 X4 1.00 0.2622 3.813 0.00139 Residual standard error: 7.861 on 17 degrees of freedom Multiple R-squared: 0.461, Adjusted R-squared: 0.4293 F-statistic: 14.54 on 1 and 17 DF, p-value: 0.00139表五( X T X ) 1 Intercept X3 Intercept 2.7933940 -0.0585962 X3 -0.0585962 0.0012528 ( X T Y ) T = (649.1 31209.5)(請接第五頁)全五頁第五頁等 別: 三等考試10 12 14 16 35 40 45 50 55 Y 40 x1 14.0 x2 13.0 12.0 x3 x4 20 30 40 50 60 12.0 13.0 14.0 55 60 65 70 75 80圖一
(63 分)
本題含圖表或公式,請對照原卷 PDF。
102 年(考試時間 120 分鐘) 原卷 PDF
- 1
對以下之簡單線性迴歸模式( ) i.i.d . Yi = 1 + β1 X i + ε i , ε i ~ N 0,σ 2 , i = 1,K, n , X i 為已知自變數(independent variable)且不全為 0。令 β̂1 是參數 β1 之最小平方估β1計量(least squares estimator)及 α = e 。(每小題 10 分,共 20 分)
(一)請找出參數α 之最大概式估計量(maximum likelihood estimator)。( )
(二)請求出 β̂1 之期望值 E β̂1 及變異數Var β̂1 (請詳列推導過程)。 ( )
(20 分)
參考架構・破題
本題的模型截距固定為 1,只有斜率 β1 未知,相當於以 Yi-1 對 Xi 做通過原點的迴歸。α=e^β1 是參數的函數,利用最大概似估計量的不變性即可求得。
完整答題架構與關鍵字:到站內看全文
- 2
( xi , yi ), i = 1,K,10, 為對應以下簡單線性迴歸模式( ) i.i.d . Yi = β 0 + β1 X i + ε i , ε i ~ N 0, σ 2 , i = 1,K,10 ,之觀察值。對以下 xi 值時, yi 有重覆觀察值:xi 值 重覆觀察 yi 值90 81, 83 66 68, 60, 62 51 60, 64 35 51, 53 令 βˆ0 、 β̂1 為 β 0 及 β1 之最小平方估計量之值。給定以下結果:10 10 ∑ yi2 = 44249, ∑ ( yi − yˆ i )2 = 118.44, yˆ i = βˆ0 + βˆ1 xi 。i =1 i =1
(一)試完成以下對應虛無假設(null hypothesis)H 0 : β 0 = β1 = 0 之變異數分析表(ANOVA table):(1)~(8)自由度 平方和 均方和來源 F(degree of freedom) (sum of squares) (mean square)迴歸2 (3) (6) (8)(Regression)殘差(1) (4) (7)(Error)總和 (2) (5)並寫出 F 統計量之虛無分布(null distribution),即 F 統計量在虛無假設成立時之機率分布。(15 分)
(二)請算出缺適(lack of fit or goodness of fit)檢定統計量之值。並明確寫出檢定統計量之虛無分布。(10 分)全一張(背面)等 別: 三等考試類 科: 統計
(25 分)
本題含圖表或公式,請對照原卷 PDF。
- 3
( xi1, xi 2 , yi ), i = 1,K 4, 為對應以下多重線性迴歸模式( ) i.i.d . Yi = β 0 + β1 X i1 + β 2 X i 2 + ε i , ε i ~ N 0,σ 2 , i = 1,K,4 ,之觀察值。令 βˆ0 、 β̂1 及 βˆ2 為 β 0 、 β1 及 β 2 之最小平方估計量或其值。 X 為自變數矩陣,⎡1 x11 x12 ⎤ ⎢1 x21 x22 ⎥ X =⎢ ⎥。⎢1 x31 x32 ⎥ ⎢ ⎥ ⎣1 x41 x42 ⎦給定以下之結果:⎡4 0 0⎤ ⎡ βˆ0 ⎤ ⎡ 2.5 ⎤ ⎢ ⎥ ⎢ˆ⎥ ⎢ ⎥ 4 X X = 0 4 0 , β = ⎢ β1 ⎥ = 0 , ∑ ( yi − yˆi )2 = 0.5, t ˆ ⎢ ⎥ ⎢ ⎥ i =1 ⎢ ⎥ ⎢⎣0 0 2⎥⎦ ⎣ β 2 ⎦ ⎢⎣− 1.5⎥⎦ ˆ ∑ yi = 10, yˆi = βˆ0 + βˆ1xi1 + βˆ2 xi 2 。i =1
(一)算出 β̂ 之共變異數矩陣(covariance matrix),即 Cov βˆ , βˆ 。(5 分) ( )
(二)算出 R 2 。(5 分)
(三)給定α = 0.05 ,利用 t 統計量檢定H 0 : β 2 + 1 ≥ 0 versus H 0 : β 2 + 1 < 0 。(10 分)( t 2,0.05 = 2.92, t 2,0.025 = 4.303, t1,0.05 = 6.314, t1,0.025 = 12.706 )
(四)給定α = 0.05 ,利用 F 統計量檢定H 0 : β 0 = β1 = β 2 = 0 versus H1 : β 0 ≠ 0 or β1 ≠ 0 or β 2 ≠ 0 。(10 分)( F3,1,0.05 = 216, F3, 2,0.05 = 19.2, F2,1,0.05 = 200, F2, 2,0.05 = 19 )
(五)算出 β1 之 95%之信賴區間。(5 分)
(35 分)
本題含圖表或公式,請對照原卷 PDF。
- 4
考慮以下多重線性迴歸模式( ) i.i.d . Yi = β1 X i1 + β 2 X i 2 + L + β p X ip + ε i , ε i ~ N 0,σ 2 , i = 1,K, n 。令 Y = [Y1 Y2 L Yn ] t , X j = X 1 j[ X 2 j K X nj t , j = 1,K, p 。]假設 X ij , i = 1,K n, 不全為 0 且 X tj X k = 0, j ≠ k 。
(一)試以 Y 及 X j 來表示 β1 ,K, β p 之最小平方估計量以及殘差平方和(residual sum of squares)。(12 分)
(二)考慮另一線性迴歸模式 Yi = α1 X i1 + α 2 X i 2 + L + α p X ip + ζ i , i = 1,K, n , ( ) ζ i ~ N 0, a 2σ 2 為 彼 此 獨 立 之 隨 機 誤 差 且 a 為 正 常 數 。 試 求 以 Y 及 X j 來 表 示α1 ,K,α p 之加權最小平方估計量(weighted least squares estimator),且找出此加權最小平方估計量與在(一)之 β1 ,K, β p 最小平方估計量之關係式。(8 分)
(20 分)
參考架構・破題
本題為不含截距的多重迴歸,且各解釋變數向量兩兩正交(X'jXk=0),使 X'X 成為對角矩陣,各係數可分開估計。第二小題的誤差變異為常數倍 a²σ²,權數全部相同,加權最小平方估計量與 OLS 一致。
完整答題架構與關鍵字:到站內看全文
其他等別的「迴歸分析」
- 迴歸分析(高考三級)(45 題)
題目來源:考選部考畢試題查詢平臺(政府資訊公開資料);參考架構為本站自撰,僅供準備方向參考,非官方標準答案。最後更新:。