迴歸分析 申論題歷屆試題與參考架構
高考三級,民國 102~112 年共 10 份試卷、45 題,其中 14 題附參考答題架構。考這一科的類科:統計。本頁列出歷年全部題目,參考架構只列開頭的「破題」,完整的答題架構、關鍵字與作答提醒請到站內查看。
112 年(考試時間 120 分鐘) 原卷 PDF
- 1
請利用上述表格計算解釋變數與反應變數之間的相關係數到小數點第四位,並且由小到大排序計算結果。 (假設第一組數據集的相關係數為「r1」、第二組數據集的相關係數為「r2」、第三組數據集的相關係數為「r3」、第四組數據集的相關係數為「r4」。)(20分)
(20 分)
參考架構・破題
本題的四組數據即統計學經典的安斯庫姆四重奏(Anscombe's quartet)設計:四組資料的平均數、變異數與相關係數幾乎相同,差異只出現在小數第三、四位。命題者要求算到小數第四位再排序,考的是 Pearson 積差相關係數公式的熟練度與計算精確度,不是理論申論,因此計算表與公式代入過程本身就是得分點。
完整答題架構與關鍵字:到站內看全文
- 2
請利用上述表格針對模型「y = A + Bx」 ,計算各個數據集估計方程式的決定係數(coefficient of determination)到小數點第四位,並且由小到大排序計算結果。(假設第一組數據集的決定係數為「R21」 、第二組數據集的決定係數為「R22」、第三組數據集的決定係數為「R23」、第四組數據集的決定係數為「R24」。) (20分)
(20 分)
參考架構・破題
本題承接相關係數,計算四組資料在簡單線性模型 y = A + Bx 下的決定係數。關鍵觀念是:在含截距的簡單線性迴歸中,決定係數恰等於相關係數的平方(R² = r²),因此第一小題算出的 r 可直接沿用,但必須用未捨位的 r 平方,最後才捨到小數第四位。答題要同時呈現變異數分解的定義與捷徑算法,才顯示觀念完整。
完整答題架構與關鍵字:到站內看全文
- 3
請利用上述表格計算各個數據集估計模型「y = A + Bx」的截距到小數點第四位,並且由小到大排序計算結果。(20分)
(20 分)
參考架構・破題
本題要求以最小平方法估計四組資料在 y = A + Bx 下的截距,並算到小數第四位後排序。截距公式 A = ȳ − B·x̄ 必須先有斜率,因此答題順序上應先求 B = Sxy/Sxx,再回代求 A;由於四組截距數值極為接近,位數處理與代入順序是本題成敗所在。
完整答題架構與關鍵字:到站內看全文
- 4
請利用上述表格計算各個數據集估計模型「y = A + Bx」的斜率到小數點第五位,並且由小到大排序計算結果。(20分)
(20 分)
參考架構・破題
本題求四組資料的最小平方斜率並排序到小數第五位,位數要求比前幾題更嚴。核心公式只有一條 B = Sxy/Sxx,成敗全在計算的精確度與是否善用四組資料的結構(若前幾組的 x 欄相同,Sxx 相同,斜率差異只來自 Sxy)。
完整答題架構與關鍵字:到站內看全文
- 5
針對第三組數據集提出決定係數(coefficient of determination)最接近1.0的模型。(提示:繪製這一組數據集的散佈圖,並刪除一個影響點。) (20分)
(20 分)
參考架構・破題
本題按提示走即可:先畫第三組資料的散佈圖,會發現絕大多數點幾乎完全落在一條直線上,只有一個點明顯偏離並把迴歸線拉歪;把該影響點剔除後重新以最小平方法配適直線,決定係數即可逼近 1.0。答題重點不只是給出新模型,還要示範如何以統計診斷指標確認該點就是影響點,並交代刪除觀測值的正當性。
完整答題架構與關鍵字:到站內看全文
110 年(考試時間 120 分鐘) 原卷 PDF
- 1
某地區房屋成交紀錄包括了房價及坪數等資訊共 70 筆,以坪數為預測變數,簡單線性迴歸預測房價的殘差顯示,變異數並不是常數,如圖 1-1:圖1-1轉換前殘差圖圖1-2轉換後殘差圖將資料依房價排序後,每5筆計算房價平均數及標準差,並分別取其自然對數(LN)值,共14筆,其敘述性統計及相關係數如表1-1a、1-1b。表 1-1a 敘述統計個數 平均數 標準差房子坪數 70 57.7 22.5房價 70 4197207.0 2574255.1平均房價 14 6191190.0 3441255.7房價標準差 14 3383348.3 2156645.7 LN(平均房價) 14 15.471 .640 LN(房價標準差) 14 14.809 .729有效的 N(完全排除) 14表 1-1b 相關房子 平均 房價 LN(平均 LN(房價房價坪數 房價 標準差 房價) 標準差)房子坪數 Pearson 相關 1 .859** .379 .279 .469 .368個數 70 70 14 14 14 14房價 Pearson 相關 .859** 1 .975** .772** .984** .803**個數 70 70 14 14 14 14平均房價 Pearson 相關 .379 .975** 1 .766** .951** .785**個數 14 14 14 14 14 14房價標準差 Pearson 相關 .279 .772** .766** 1 .779** .973**個數 14 14 14 14 14 14 LN Pearson 相關 .469 .984** .951** .779** 1 .811** (平均房價) 個數 14 14 14 14 14 14 LN Pearson 相關 .368 .803** .785** .973** .811** 1 (房價標準差) 個數 14 14 14 14 14 14 **.在顯著水準為 0.01 時(雙尾),相關顯著。運用上述資訊,Box-Cox 轉換函數進行房價轉換後,以坪數預測房價轉換的殘差,如圖 1-2,迴歸模式的變異數分析表及係數預測的推論如表 1-2a、表 1-2b。表 1-2a Anovaa模式 平方和 df 平均平方和 F 顯著性1 迴歸 17.418 1 17.418 262.236 .000b殘差 4.517 68 .066總數 21.935 69 a.依變數:房價轉換b.預測變數:(常數),房子坪數表 1-2b 係數 a標準化未標準化係數 相關係數模式 t 顯著性B之 標準 Beta零階 偏 部分估計值 誤差 分配1 (常數) 13.803 .085 161.874 .000房子.022 .001 .891 16.194 .000 .891 .891 .891坪數a.依變數:房價轉換
(一)請運用表 1-1a、1-1b 的資訊,說明將使用的統計方法,並提出您建議的 Box-Cox 轉換函數為何?(20 分)
(二)轉換後的模式適切性,有那些假設需要驗證?圖 1-2 可以驗證那一項假設?(10 分)
(三)假設轉換後的模式適切性完全符合,請運用表 1-2a、表 1-2b 的資訊,寫出房子坪數對房價轉換的預測模式,並依照您在第(一)題的建議,改寫出房子坪數對於房價的預測模式,並說明坪數每增加一單位對房價的影響。(10 分)
(40 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
某研究團隊隨機觀察兩歲內男童的月齡(Month)與體重(weight)的數據共 125 筆,0~24 月齡各 5 筆。月齡 vs 體重的散布圖如下。研究團隊考慮以月齡的 4 次多項式迴歸模式來預測體重。預測變數為中心化月齡( = Month_c = Month − mean(Month)),考慮一~四次多項式模式,如下:M1: weight = + +ε M2: weight = + + +ε M3: weight = + + + +ε M4: weight = + + + + +ε各模式的變異數分析表如下:係數ANOVA 未標準化係數 標準化係數B 之估計值 標準誤 Beta 分配 t 顯著性平方和 df 平均平方和 F 顯著性M1 month_c Month_c .296 .009 .944 31.759 .000 M1 迴歸 567.658 1 567.658 1008.633 .000 (常數) (常數) 9.356 .067 139.427 .000殘差 69.224 123 .563 M2 month_c Month_c .296 .007 .944 41.028 .000總數 636.883 124 Month_c22 Month_c -.010 .001 -.210 -9.125 .000 M2 迴歸 594.740 2 297.870 862.311 .000 (常數) (常數) 9.887 .078 126.726 .000殘差 42.143 122 .345 M3 month_c Month_c .227 .017 .724 13.446 .000總數 636.883 124 Month_c Month_c22 -.010 .001 -.210 -9.805 .000 Month_c33 Month_c .001 .000 .240 4.456 .000 M3 迴歸 601.539 3 200.513 686.460 .000 (常數) 9.887 .073 136.166 .000殘差 35.344 121 .292 M4 month_c Month_c .227 .016 .724 14.207 .000總數 636.883 124 Month_c22 Month_c .003 .003 .058 .802 .424 M4 迴歸 605.486 4 151.371 578.540 .000 3 Month_c3 Month_c .001 .000 .240 4.708 .000殘差 31.397 120 .262 Month_c44 -9.787E-05 Month_c .000 -.279 -3.884 .000總數 636.883 124 (常數) (常數) 9.685 .086 112.476 .000
(一)在 5%的顯著水準下,請依序檢定下列虛無假說, : = = = 0、 : = = 0、 : = 0,直到不拒絕 ,以確定多 項 式 迴 歸 模 式 的 最 高 次 為 何 。( 30 分 )( 提 示 : 若 拒 絕, ≤ ,且不拒絕 , > ,則多項式模式最高次為 )
(二)請根據上述結果寫出多項式預測模式,並預測月齡為 10 月的男童體重,假設月齡為 10 月的男童體重估計變異數為 s 2 (Yˆ ) 0.298,請求出該男童體重的 95%預測區間。(15 分)
(三)由於每個月齡都有 5 筆資料,純誤差平方和(pure error sum of square, SSPE)為 25.54,請根據(一)的結果,在 5%的顯著水準下,完成該模式適合度檢定(test for lack of fit)。(15 分)附表F分配的百分位點分子自由度 F0.05 v1, v2 ∞分母自由度∞
(60 分)
本題含圖表或公式,請對照原卷 PDF。
109 年(考試時間 120 分鐘) 原卷 PDF
- 1
下表為2019年不動產經營業依據實價交易總金額、房仲店數,及平均每店全年傭收資料。 X 3 之定義為:若該縣市非為直轄市定義為0,若該縣市為直轄市定義為1。X1 Y X2 X3縣市房仲店數 交易總金額(億) 平均每店全年傭收(萬) 直轄市臺南市 437 2601 1666 1新北市 1167 6750 1620 1高雄市 704 3906 1533 1桃園市 904 4806 1489 1新竹縣市 411 1815 1236 0彰雲投 457 1970 1207 0臺中市 1323 5523 1169 1臺北市 1375 5306 1081 1其他縣市 850 2859 942 0以交易總金額為反應變數,得到下列迴歸估計結果:模型 估計值 標準誤 s R2截距項 482.770 747.674 869 0.783 A X1 4.089 0.813截距項 2024.181 3391.482 1823 0.045 B X2 1.450 2.514截距項 2214.667 718.778 1245 0.555 C X3 2600.667 880.320截距項 -4006.893 727.336 323.1 0.974 D X1 4.586 0.311 X2 3.066 0.459截距項 411.784 599.364 695.6 E X1 3.148 0.777 X3 1302.549 586.997截距項 4766.304 2455.545 1229 0.628 F X2 -2.261 2.083 X3 3274.570 1068.252截距項 -6603.893 671.369 156.3 0.995 X1 5.774 0.302 G X2 4.885 0.458 X3 -1235.952 272.105表中s為迴歸誤差之標準差的估計值。以顯著水準為0.05,回答下列問題:
(一)檢定各模型中X2之係數顯著性,並比較其結果。(16分)
(二)分別解釋並比較模型C與G中X3之係數估計值的意義。(5分)
(三)寫出模型D的變異數分析表(analysis of variance table),並檢定其迴歸係數是否皆等於0。(10分)
(四)計算模型E的R2。(6分)
(五)若以向前選取(forward selection)方法,請詳述選取變數的程序及最終會選到那些變數。(15分)
(六)若以向後剔除(backward elimination)方法,請詳述選取變數的程序及最終會選到那些變數。(8分)
(60 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
若隨機變數(X,Y)為二維常態分配,且X之均數為 x 、變異數為 x2 ,Y之均數為 y 、變異數為 y2 ,X與Y之相關係數為 。
(一)在給定 X xi 的情況下,Y之條件分配亦為常態分配,證明其均數為: y|x y y xi x ,i=1,2,…,n x變異數表達為 y2|x y2 1 2 ,n為觀測值個數。(12分)
(二)若將上述的結果表達為解釋變數X及反應變數Y之簡單線性迴歸模型如下:Yi 0 1 X i εi ,i=1,2,…,n εi 為隨機誤差;亦即Yi | X i xi N 0 1 xi , 2 請將 0 、 1 及 2 重新以 x 、 x2 、 y 、 y2 與 等符號表達之。(6分)
(三)寫出εi 的分配。(4分)
(四)證明 y2 2 。並說明在何種的狀況下 y2 2 。(8分)
(五)若 rXY 為 變數 X與Y之樣 本相關係數, R 2 為 該迴歸模型 之判定係 數(coefficient of determination),證明 rXY R 2 。(10分)附表一tα附表二
(40 分)
本題含圖表或公式,請對照原卷 PDF。
108 年(考試時間 120 分鐘) 原卷 PDF
- 1
(一)考慮下列涉及 3 條可能不同截距但相同斜率之直線的簡單線性迴歸模式:= + + ,= + + ,=1+ + ,= 1, ⋯ , ,其中 ,⋯, , ,⋯, , ,⋯, 為彼此獨立且期望值為0而變異數皆為 的隨機誤差。請利用上述所有資料求出 , , 的最小平方 估 計 量 ( least squares estimator ) , , 及 的變異數。(10 分)
(二)某國政府統計分析師利用迴歸方法分析該國經濟狀況的評估分數以及影響該國經濟狀況之重要指數 X,其所用之模式為= + + ,其中隨機誤差 有下列之機率密度函數表達:= ,−∞< <∞ 1+當 值大於0時,則該國的經濟評估為正向發展;反之即為負向發展。考慮另一變數 Q,當Y > 0,則 Q=1,反之當Y≤ 0,則 Q = 0,即 Q 為該國經濟是否為正向發展的指標。試求出一函數 h 使得h = β0 +β1 X,其中 = E(Q)為 Q 的期望值。(10 分)
(20 分)
參考架構・破題
第(一)小題是「共同斜率、不同截距」的多組迴歸,本質上是含指標變數的線性模型,用矩陣 b=(X'X)^{-1}X'Y 一次求出;第(二)小題是潛在變數(latent variable)推導二元反應模型,誤差為標準邏輯斯分配,所求的 h 就是 logit 連結函數。
完整答題架構與關鍵字:到站內看全文
- 2
下列是關於模式選取及模式診斷的問題。
(一)下表為給定 4 種不同迴歸模式來配適 13 組資料 ( yi , xi1 , xi 2 , xi 3 ) ,i=1,⋯,13,所得的 AIC(Akaike’s information criterion,赤池訊息標準)值。模式中的解模式 AIC BIC釋變數A , 25.41 (1) B , 65.11 (2) C , 51.03 52.72 D , , 25.03 (3)其中 為解釋變數 的資料值, = 1,2,3,隨機誤差 , ⋯ , 為彼此獨立,期望值為0,變異數皆為 的常態分配。請完成此表並利用 AIC 及 BIC(Bayesian information criterion,貝氏訊息標準)來選取最適合的模式。(log(a)為數字 a 的自然對數值,log(2)=0.69,log(3)=1.1,log(4)=1.39,log(9)=2.2,log(10)=2.3,log(13)=2.56)。(10 分)
(二)考慮下列複迴歸模式= + + + + , = 1, ⋯ ,100,其中隨機誤差 , ⋯ , 為彼此獨立,期望值為0,而變異數皆為的常態分配。下列的殘差圖(residual plot),請選出那些(個)不適當並請解釋為何不適當:
⑴ (y 軸)對 (x 軸)的圖,即 , , = 1, ⋯ ,100;
⑵ (y 軸)對 (x 軸)的圖,即 , , = 1, ⋯ ,100;
⑶ (y 軸)對 (x 軸)的圖,即 , , = 1, ⋯ ,100;
⑷ (y 軸)對 (x 軸)的圖,即 , , = 1, ⋯ ,100;
⑸ (y 軸)對 (x 軸)的圖,即 , , = 1, ⋯ ,100;其 中 資 料 , , , 是 代 表 第 天 收 集 的 資 料 ,yi 為第 i 個資料之配適值(fitted value),而ei 為第 個資料之殘差(residual)值。(5 分)
(15 分)
本題含圖表或公式,請對照原卷 PDF。
- 3
某跨國企業 A 公司其資料科學家利用下列複迴歸模式= + + + , = 1,⋯,10,來分析該公司一產品的銷售額變化量和該公司此產品價格變化量與競爭對手 B 公司其相對競爭產品價格變化量的關係,其中 為 A 公司在第 個地區的銷售額變化量, 為 A 公司的產品在第 個地區的價格變化量, 為 B 公司的競爭產品在第 個地區的價格變化量,而隨機誤差 , ⋯ , 為彼此獨立,期望值為0,且變異數皆為 的常態分配。給定銷售額變化量 , ⋯ , 及下列解釋變數矩陣 X 與反應變數向量 Y 的相關資訊:10 0 0 28 ∑10 i=1 yi = 0 20 0 , = -20 ,y= =2.8, y2i =130,0 0 20 12 i=1其中= , = ⋮ ,⋮ ⋮ ⋮以及 為矩陣 的轉置矩陣。
(一)計算判定係數(coefficient of determination) 及 ,其中 是觀察值 , , ⋯ , 與配適值(fitted values) , , ⋯ , 的相關係數(coefficient of correlation)。(8 分)
(二)在顯著水準α=0.05,利用 F 檢定法檢定: = = 0及 : ≠ 0 或 ≠ 0。且完成下列關於此檢定的變異數分析表(ANOVA table)。(11 分)自由度 平方和 均方和來源(degree of (sum of (mean F 統計量(source) freedom) squares) square)迴歸 (1) (4) (7) (9)誤差 (2) (5) (8)總和 (3) (6)
(三)在顯著水準α = 0.05,利用 F 檢定法檢定: + 2 = 0及 : + 2 ≠ 0。(8 分)
(四)假定因中美貿易戰的影響,若兩公司同在第 11 個地區競爭且其價格各自調高 1,即x11 =1及z11 =1。請計算在此地區 A 公司平均銷售額變化量 E(y11)= + + 的預測值及其 95%預測信賴區間,即 E(y11)的點估計及區間估計。(8 分)
(35 分)
本題含圖表或公式,請對照原卷 PDF。
- 4
下列是關於配適模式不正確時造成的影響以及模式適合度問題。
(一)某統計學家欲調查某一地區的當年新生人口與當年經濟成長率的關係是線性或是牽涉到更高的次方關係。此統計學家蒐集了下列在 不 同 經 濟 成 長 率 (單位為%) 的 新 生 人 口 資 料(單位為萬人),i=1,…,7,y1 =20 2 = 22 3 = 26 4 = 30 5 = 37 6 = 39 7 = 42 1 = −5 2 = −3 3 = −1 4 =0 5 =1 6 =3 7 =5並利用下列兩種迴歸模式來配適資料模式 A: = + +模式 B: = + + + +其中 ,⋯, 為彼此獨立且期望值為0,變異數皆為 的隨機誤差。但是真正的迴歸模式是= + + + 。如果 及 為使用模式 A 所得之 及 的最小平方估計量(least squares estimator),而 , 及 為使用模式 B 所得之 , 及的最小平方估計量,請得到這些估計量的期望值向量,即及 。(7 分)
(二)針對模式 A,請問是否可利用此統計學家所蒐集的資料作模式缺適檢定(lack of fit test)?如果可,請算出檢定統計量的值;如果不可,請解釋原因。(3 分)
(10 分)
本題含圖表或公式,請對照原卷 PDF。
- 5
某工業研究所欲研究某反應過程所散發之熱能 與某化合物含量 X 間的關係。利用簡單線性迴歸模式= + + , = 1,⋯,5,其中 為第 次反應過程所散發熱量之測量值, 為第 次反應過程此化合物含量,且隨機誤差 , ⋯ , 為彼此獨立,期望值為0,變異數皆為 的常態分配。根據 5 次反應過程所得之資料可得估計迴歸關係式為= 0.2+2.6x且判定係數(coefficient of determination) 為 0.845。
(一)計算調整判定係數(adjusted coefficient of determination)及 , ⋯ ,與 ,⋯, 的相關係數(coefficient of correlation)。(5 分)
(二)在顯著水準 = 0.05,利用 F 檢定法檢定: = 0及 : ≠ 0。(5 分)
(三)計算 的 95%信賴區間估計。(5 分)
(四) 為 的最小平方估計量(least squares estimator),且給定 的標準誤為 2.13。在顯著水準 = 0.05,利用 t 檢定法檢定: ≥ 4及 : < 4。(5 分)
(20 分)
參考架構・破題
本題為簡單線性迴歸的基本計算,n=5、R^2=0.845、b0=0.2、b1=2.6,關鍵是由 R^2 推出 F 值與 b1 的標準誤,再做調整判定係數、F 檢定、信賴區間與單尾 t 檢定。
完整答題架構與關鍵字:到站內看全文
107 年(考試時間 120 分鐘) 原卷 PDF
- 1
若由 與 的散布圖判斷,該圖中可能有一個離群值。請將該離群值排除後,重新計算 與 相關係數。(10 分)(下列的問題皆是在無離群值存在的狀況下作答。)
(10 分)
- 2
檢定模型 A 的 的迴歸係數是否為 0?(10 分)
(10 分)
- 3
針對模型 O,寫出其變異數分析表。檢定其迴歸係數是否同時為 0。 (10 分)
(10 分)
- 4
若 SSReg( | )代表給定 已在模型中, 加入模型中的額外平方和(extra sum of squares) 。請分別計算 SSReg( | ) 、SSReg( | ) 、SSReg( , | ) 、SSReg( , | , )。 (12 分)
(12 分)
- 5
藉由迴歸估計結果及報表,詳細說明「就業者之教育程度結構-大 專及以上」( )此一變數對於粗出生率的影響,是否具統計顯著意義?(10 分)
(10 分)
- 6
請詳細說明前述各模型選取準則的定義,包括 、 、 , 及 。並說明他們在模型選取的判斷原則為何?(12 分)
(12 分)
參考架構・破題
本題考變數選取(model selection)常用準則的定義與判斷方向。題目列出的符號在卷面上缺損,一般即為 R_p^2、R_{a,p}^2、Mallows' Cp、AIC_p、SBC_p(BIC)、PRESS_p 這一組,作答時逐一寫公式、意義與「越大越好或越小越好」。
完整答題架構與關鍵字:到站內看全文
- 7
在不同的 p 下,請依各準則判斷其所得之最適模型。 (12 分)
(12 分)
- 8
請決定一個影響粗出生率的最適迴歸模型,並說明理由。 (6 分)
(6 分)
- 9
計算所得的最適迴歸模型的均方誤(MSE),並說明其意義。(6 分)
(6 分)
- 10
寫出線性迴歸模型之誤差項的假設。並針對誤差項的各項假設,分別提出一種殘差分析的圖形,及說明在符合假設下各圖形應呈現的型態。 (12 分)(請接第五頁)全五頁第五頁α tα
(12 分)
106 年(考試時間 120 分鐘) 原卷 PDF
- 1
請回答下列問題:
(一)圖 1 是探討美國在游泳池溺斃(Swimming-pool drownings)的人數和美國核能發電廠發電(Nuclear power plants)數量數之間的關係,這兩個變數的相關係數為 90.12%。請試述以簡單線性迴歸分析是否具有因果關係或意義?請說明理由。 (5 分)1999 2000 2001 2002 2003 2004 2005 2006 2007 2008 2009 700 deaths 850 BkWh Swimming-pool drownings Nuclear power plants 600 deaths 800 BkWh 500 deaths 750 BkWh 400 deaths 700 BkWh 1999 2000 2001 2002 2003 2004 2005 2006 2007 2008 2009 Nuclear power plants Swimming-pool drownings圖1
(二)一位數據分析師擬研究滷肉飯銷售量受到那些因素所影響。所蒐集的可能解釋變數有價格、店內坪數、客流量、附近店家數、店內位置數、營業時間、店齡、配菜種類、選取肉的部位、米的種類等十個可能的解釋變數。該分析師計畫作複迴歸分析,要選擇重要解釋變數來描述反應變數(滷肉飯銷售量),請試述四種選擇重要變數的方法。又大數據的時代來臨,我們應用迴歸分析,有時會遇到高維度解釋變數的情況,解釋變數的個數(p)大到超過於樣本數(n)的情況,在高維度的解釋變數情況,請試述上述四種選擇重要變數之方法是否仍適用?如果你的答案為不適用,請說明理由。(10 分)(請接第二頁)全四頁第二頁
(15 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
一位分析師隨機抽取 55 位大學生並蒐集到五個變數。該分析師希望研究身高(Y,英吋)與受測者左前臂長度(X1,公分)、左腳長度(X2,公分)、頭圍(X3,公分)和鼻長(X4,公分)之間的關係。該分析師考慮配適下列三個迴歸模型:模型 1: Yi = β 0 + β1 X 1i + β 2 X 2 i + β 3 X 3i + β 4 X 4 i + ε i模型 2: Yi = β 0 + β1 X 1i + β 2 X 2 i + ε i模型 3: Yi = β 0 + β1 X 1i + ε i請使用表 1 和表 2 中部分 R 統計軟體輸出之變異數分析表(ANOVA,Analysis of Variance)報表來回答以下問題:(每小題 10 分,共 30 分)表1 模型 1 ANOVA 表Sum of Mean Response:Y DF F value squares square X1 1 590.21 590.21 123.8106 X2|X1 1 224.35 224.35 47.0621 X3|X1, X2 1 1.4 1.4 0.294 X4|X1, X2, X3 1 0.43 0.43 0.0896 Error 50 238.35 4.77表2 模型 2 ANOVA 表Sum of Mean Response:Y DF F value squares square X1 1 590.21 590.21 127.782 X2| X1 1 224.35 224.35 48.572 Error 52 240.18 4.62
(一)假設該分析師採用模型 1。在顯著水準 α=0.05 之下,請檢定 X3 和 X4 兩個解釋變數是否0 β3 = β 4 = 0可以從給定模型 1 中刪除。也就是用 α=0.05 檢定 Η: ,並試述對立假設,檢定統計量之值、決策法則和結論。並請計算偏相關係數 R Y,2 X 3 , X 4 | X 1 , X 2 (partial R2)。
(二)假設該分析師採用模型 2。也就是在模型中僅考慮了兩個解釋變數,這兩個解釋變數是學生的左前臂長度(X1)和左腳長度(X2)。該分析師想知道這兩個解釋變數0 β1 = β 2 = 0是否與身高(Y)有線性關係。在顯著水準 α=0.05 之下,請檢定 Η: 。並請試述檢定統計量之值、決策法則和結論。另請計算模型 2 的調整的複判定係數 R2(adj R2,the adjusted R-squared)並試述其意義。又該分析師要把身高的單位英吋轉公分(英吋乘以 2.54) ,試述模型 2 的 adj R2 是否改變?
(三)假設該分析師採用模型 3。只考慮模型中具有一個解釋變數,為學生的左前臂長度(X1)。在顯著水準 α=0.05 下,該分析師想知道一個額外的解釋變數 X2 是否在解釋身高上具有顯著的貢獻。也就是說,該分析師想知道 X2 對模型 3 的貢獻。請協助回答此問題並說明對立假設、檢定統計量之值、決策法則和結論。在表 1 和表 2的 F 檢定中,請試述需要做何假設,才能執行這些 F 檢定。(請接第三頁)全四頁第三頁
(30 分)
本題含圖表或公式,請對照原卷 PDF。
- 3
(一)在作迴歸分析時,經常會遇到離群值和有影響力觀察值(influential data point)的問題。請試述何謂離群值和有影響力觀察值。並請分別試述兩種判斷準則偵測迴歸分析中的離群值和有影響力觀察值。(12 分)
(二)圖 2A 是一組數據的散佈圖,圖 2B 提供兩條估計線,實線估計式 Yˆi = 2.8 + 4.97 X i 包括第 51 點觀察值 (( X 51 , Y51 ) = (4,50)) ,虛線估計式 Yˆi = 3.68 + 4.98 X i 不包括第 51點觀察值。請試述這組數據集是否包含任何離群值?並請試述這組數據是否包含任何有影響力觀察值?另請說明理由。(4 分)圖 2A 圖 2B
(三) 圖 3A 是 另 一 組 數 據 的 散 佈 圖 , 圖 3B 提 供 兩 條 估 計 線 , 實 線 估 計 式Yˆi = 6.95 + 4.08 X i 包 括 第 41 點 觀 察 值 (( X 41 , Y41 ) = (10,16)) , 虛 線 估 計 式Yˆi = 1.93 + 5.21X i 不包括第 41 點觀察值。請試述這組數據集是否包含任何離群值?並請試述這組數據集是否包含任何有影響力觀察值?另請說明理由。(4 分)圖 3A 圖 3B(請接第四頁)全四頁第四頁
(20 分)
本題含圖表或公式,請對照原卷 PDF。
- 4
一位數據分析師受冰飲企業老闆的委託,欲知道每日最高溫和該公司冰品銷售是否有線性關係,以作為未來商品促銷的依據。他蒐集了每日最高溫(X,以攝氏為單位)和冰品銷售(Y),共 30 個樣本點。下列是這些數據的統計量:n n = 30 , X = 28.9892 , Y = 34.7065 , SXY = ∑ ( X i − X )(Yi − Y ) = 360.2128 i =1 n n SXX = ∑ ( X i − X ) 2 = 556.0186 , SYY = ∑ (Yi − Y ) 2 = 353.0085 i =1 i =1
(一)在配適 E (Y | X = x) = α + β1 ( x − X ) 的簡單線性迴歸方程式下,請利用最小平方法計算參數估計值(α̂ 和 βˆ1 )與分別之標準誤。並請試述α̂ 和 βˆ1 的共變異數,也就是 Cov(α̂ , βˆ1 )。(15 分)0 β1 = 0
(二)請在試卷上,完成下列變異數分析表。在顯著水準 α=0.05,請協助檢定 Η: 。並請試述檢定統計量之值、決策法則、結論和所需要之假設。 (10 分)Sum of Source DF Mean square F value Squares Regression (1) (4)Error (2) (5) (6)Total (3)~ 1 n ⎡ Yi − Yi−1 ⎤
(25 分)
本題含圖表或公式,請對照原卷 PDF。
- 5
一位分析師擬以β1 = ∑ 估計簡單線性迴歸模型Yi = β 0 + β1 X i + ε i ,i = 1,..., n 之n − 1 i=2 ⎢⎣ X i − X i−1 ⎥⎦ ~ ~斜率β1 。他可以證明β1 是一個不偏估計式。請寫出β1 的最小平方估計式βˆ1 。在無須推導β1 的變異 ~數下,試述相較於最小平方估計式 βˆ1 , β1 和 βˆ1 何者為最佳之估計式?請詳細敘述所依據的理由或定理。(10 分)
(10 分)
參考架構・破題
題目中的估計式應為 β̃1 =(1/(n−1))Σ_{i=2}^{n} (Y_i − Y_{i−1})/(X_i − X_{i−1}),也就是相鄰兩點斜率的平均。本題考的是 Gauss-Markov 定理:β̃1 是 Y 的線性不偏估計式,因此變異數不會小於最小平方估計式。
完整答題架構與關鍵字:到站內看全文
105 年(考試時間 120 分鐘) 原卷 PDF
- 1
迴歸分析中分別對下列陳述做一評述:
(一)如 R2(coefficient of determination 判定係數)大(譬如 0.95),則此模型良好,應採用。(6 分)
(二)如 R2(coefficient of determination 判定係數)小(譬如 0.35),則此模型不佳,不應採用。(6 分)
(12 分)
參考架構・破題
兩個陳述都把 R² 當成模型好壞的唯一標準,都是錯的。R² 只衡量樣本中 Y 的變異被模型解釋的比例,不代表模型設定正確、假設成立,也不代表沒有用處;評價模型要看研究目的、係數檢定、殘差診斷與預測能力。
完整答題架構與關鍵字:到站內看全文
- 2
某公司兩業務單位(A, B)之員工業績(Y)及年齡(X)散佈圖如下,數列 1 為單位 A,數列 2 為單位 B。欲觀察年齡與所屬業務單位如何影響員工業績,請以員工業績(Y)為應變數設一個複迴歸模式,並解釋模式中每個迴歸係數之涵意。(24 分)數列1 20 數列2 0 10 20 30 40 50 60
(24 分)
- 3
在複迴歸模型診斷中,
(一)「某人對應變數(Y)做常態假設之檢定,發現非常態,故採 Y 之變數變換處理」,評論之。(3 分)
(二)如何觀察各解釋變數與應變數之線性假設是否成立?(3 分)
(三) VIF(變異數膨脹係數)值過大,表示為何?(3 分)
(四)某 hii = 0.7,表示為何?(3 分)全一張(背面)
(12 分)
- 4
針對某公司員工,得一迴歸分析如下:模型Y = β 0 + β1X1 + β 2 X2 + β3X3 + β M M + β R R + ε 。Y = 量化工作績效, X1 = 年資(以年為單位), X2 = 薪資(以萬元為單位), X3 = 所屬小組之人數,(M, R) = (1, 0)為行銷部門,(M, R) = (0, 1)為研發部門,(M, R) = (0, 0)為行政部門。應變數:Y使用的觀測值數目:70 SSTO = 36.304 SSR(X1) = 14.288, SSR(X2 | X1) = 0.676, SSR(X3 | X1, X2) = 5.766, SSR(M | X1, X2, X3) = 1.212, SSR(R | X1, X2, X3, M) = 0.357參數估計值變數 參 數 標準 t值 Pr > |t|估計值 誤差Intercept 0.535 0.491 1.09 0.2793 X1 0.029 0.006 4.84 <.0001 X2 -0.180 0.107 -1.68 0.0951 X3 0.044 0.011 4.00 0.0001 M 0.433 0.163 2.66 0.0099 R 0.175 0.137 1.28 0.2061
(一)如薪資(X2)之單位由萬元改為千元,上述提供之資料有那些不會改變?有那些會改變?變化為何?(8 分)
(二)在其他變數固定下,檢定薪資(X2)對 Y 之效果是否顯著為負?( α = 0.05 )(8 分)
(三) H0:β 0 = 0 vs. H1:β0 ≠ 0 之檢定( α = 0.05 ),有何結論?又,是否要去除截距項?(敘明理由)(8 分)
(四)就檢定 H0:β M = β R = 0 vs. H1:not H0,請算出 F 檢定統計量之值及寫出決策法則。( α = 0.05 )(12 分)
(五)求 R2(coefficient of determination 判定係數),並解釋其涵意。(8 分)
(六)經變數選取後,得估計迴歸式為 Ŷ = 0.01 + 0.025X1 + 0.045X3 + 0.342M,請分別解釋 X3 及 M 的係數估計值之涵意。(8 分)
(52 分)
本題含圖表或公式,請對照原卷 PDF。
104 年(考試時間 120 分鐘) 原卷 PDF
- 1
若考慮配適一簡單線性迴歸模型 y = α + βx + ε,其中 α、β 為參數,ε 為隨機誤差,且假設其為具均數 0,標準差σ之常態分配。今於配適模型後,繪出殘差對自變數 x的分析圖。請分別針對圖(a)-(c)的結果,說明迴歸模型是否恰當?若模型不恰當時,請指出對於參數估計值是否會有偏差(bias)之影響,對於有關參數的假設檢定是否正確,另外也請提出修正的方法。(18 分)(a) (a) (b) (b) (c) (c) 3 100 20 0 Residual Residual Residual 0 0 -100 -1 -20 -2 -200 20 40 60 80 100 120 20 40 60 80 100 120 20 40 60 80 100 120 xx x x x x
(18 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
根據下列 3 變數,6 個觀察值的資料Y 1 0 1 1 0 0 X1 1 -2 1 0 0 0 X2 0 1 2 2 1 0
(一)令 Y、X1、X2 分表各變數觀察值所形成的向量,另定義 X0 為長度等於 6 且元素均等於 1 的向量。在以向量表示法的迴歸模型 M:Y = β0X0 + β1X1+β2X2 + ε 中,如何將 β0X0 + β1X1 + β2X2 更精簡的以矩陣與參數向量表示?另外,在一般情形下,此時 ε 之機率分佈為何?(4 分)
(二)計算迴歸模型 M 中之參數向量的最小平方估計量及估計其變異數共變異數矩陣(variance-covariance matrix)。(8 分)
(三)令 Yˆ 為長度等於 6 的向量,其元素為迴歸模型 M 對 Y 的配適值(fitted values),則存在一矩陣 H 使得 Yˆ = HY,計算此矩陣 H。(4 分)
(四)計算迴歸模型 M 中的變異數膨脹因子(variance inflation factor, vif)vif(X1)與vif(X2)。(4 分)(請接第二頁)全三頁第二頁
(20 分)
本題含圖表或公式,請對照原卷 PDF。
- 3
三高(高血壓、高血糖、高血脂)與許多重大慢性病皆有重要關係。為了解個人體質、生活習慣等對於三高的影響因子,並對社會大眾提出建議與注意事項。因此,研究人員由臺灣數個醫學中心,採用隨機抽樣法蒐集了 10000 個就診慢性病者的資料進行調查分析。該資料測量每個人的血壓(以收縮壓為例,單位為 mmHg)及其他相關變數如下:性別(男性為 1,女性為 0),年齡(25-85 歲),身體質量指數 BMI(定義為身高/體重2,單位為 m/kg2),量血壓習慣(有量血壓習慣者為 1,反之為 0),量血糖習慣(有量血糖習慣者為 1,反之為 0),量血脂習慣(有量血脂習慣者為 1,反之為 0),喝酒習慣(平均每天喝 1 瓶 600c.c.啤酒或相當之酒類以上者為 1,反之為 0),抽煙習慣(有抽煙習慣者為 1,反之為 0),外食頻率(每週外食次數),運動習慣(有運動習慣者為 1,反之為 0),睡眠品質(睡眠品質佳者為 1,反之為 0)。研究者建立血壓(y)對所有解釋變數的迴歸模型,得到如下表(LM1)之結果,其殘差分析也無明顯瑕疵。
(一)模型 LM1 之所有變數的解釋力為多少?一般來說,此解釋力算是高、中或低?並解釋表中「F-statistic:4961 on 11 and 9988 DF, p-value:< 2.2e-16」之意義。(4 分)
(二)在模型 LM1 下,以兩人之不同的性別、年齡及 BMI 解釋參數估計值所代表之意義。(6 分)
(三)為了去蕪存菁,研究人員去除兩個非常不顯著的變數並得到下表模型 LM2 之結果。根據 LM1 及 LM2,請就下面 1.或 2.擇一回答(兩項均答者不予評分)。(10 分)
1. 說明 LM1 與 LM2 何者較佳或差不多,並建議大眾那些變數為三高影響因子應儘量避免或注意?
2. 此分析結果不適合用來推薦三高影響因子(說明原因及提出改進方法,此結論是否與題(一)結論矛盾?)。模型 LM1 Estimate Std. Error t value Pr(>|t|) 模型 LM2 Estimate Std. Error t value Pr(>|t|)(Intercept) 97.487 0.627 155.365 0.0000 (Intercept) 97.551 0.624 156.414 0.0000性別 19.564 0.113 173.786 0.0000 性別 19.570 0.111 176.780 0.0000年齡 0.452 0.005 86.894 0.0000 年齡 0.452 0.005 86.912 0.0000身體質量指數 BMI 1.249 0.458 2.729 0.0064 身體質量指數 BMI 1.247 0.457 2.726 0.0064量血壓習慣 2.070 0.108 19.084 0.0000 量血壓習慣 2.070 0.108 19.081 0.0000量血糖習慣 0.557 0.100 5.545 0.0000 量血糖習慣 0.556 0.100 5.532 0.0000量血脂習慣 3.012 0.311 9.697 0.0000 量血脂習慣 3.013 0.311 9.702 0.0000喝酒習慣 -0.741 0.294 -2.522 0.0117 喝酒習慣 -0.746 0.294 -2.539 0.0111抽煙習慣 0.046 0.049 0.936 0.3494 外食頻率 -1.836 0.979 -1.876 0.0607外食頻率 -1.827 0.979 -1.866 0.0621 運動習慣 2.934 0.858 3.420 0.0006運動習慣 2.933 0.858 3.418 0.0006 Residual standard error:4.923 on 9990 degrees of freedom睡眠品質 -0.005 0.019 -0.284 0.7764 Multiple R-squared:0.8453, Adjusted R-squared:0.8451 Residual standard error:4.923 on 9988 degrees of freedom F-statistic:6064 on 9 and 9990 DF, p-value:< 2.2e-16 Multiple R-squared:0.8453, Adjusted R-squared:0.8451 F-statistic:4961 on 11 and 9988 DF, p-value:< 2.2e-16(請接第三頁)全三頁第三頁
(20 分)
本題含圖表或公式,請對照原卷 PDF。
- 4
一個學習效果評量相關分析的報告裏,資料內容由 20 人(男女各半)的 4 個變數(y,x1,x2,x3)所構成。其中 y 為學習效果(其平均值 96.2 且標準差為 24.47),x1 = 1或 0 表男性及女性,x2(其平均值 83.6 且標準差為 5.9)與 x3(其平均值 65 且標準差為 10.3)分別表某性向測驗的兩種分數。下圖為資料之 4 個變數間的散佈圖;此外,下表也列出配適學習效果 y 與不同解釋變數之迴歸模型的 R2。0.0 0.2 0.4 0.6 0.8 1.0 50 60 70 80 yy 100 Variables 80 Model R2 in model M1 x1 0.397 0.0 0.2 0.4 0.6 0.8 1.0 M2 x2 0.413 x1 x1 M3 x3 0.487 M4 x2, x3 0.504 M5 x1, x2 0.676 85 M6 x1, x3 0.697 x2 x2 80 M7 x1,x2, x3 0.697 x3 x3 60 80 100 120 75 80 85 90
(一)考慮模型 M1,完成下面的分析表,說明填入之 F value 及 t value 的值所代表意義。(12 分)Analysis of Variance Table:Response:y Df Sum Sq Mean Sq F value x1 Residuals Total Coefficients:Estimate Std. Error t value Intercept x1
(二)考慮模型 M1,計算 y 在 x1 = 1 之信心水準為 90%的預測區間。(5 分)
(三)在 M1-M7 模式中,給定進入模式水準(entry level)α = 0.1,採用 F 檢定法,列出前進選取(forward selection)程序與其最終選定之模式。(10 分)
(四)根據準則 Akaike Information Criterion(AIC),依序列出 M1-M7 模式中的最佳 3個模型。(10 分)
(五)針對 M7 模式,在顯著水準 α = 0.1 下,檢定 x2 與 x3 之係數是否同時等於 0。(5 分)
(42 分)
本題含圖表或公式,請對照原卷 PDF。
103 年(考試時間 120 分鐘) 原卷 PDF
- 1
在一般迴歸模型及常態誤差假設下,25 筆獨立資料所得之配適模型(fitted model)為yˆ 2.341 1.616 x1 0.014 x2,及變異數分析(ANOVA)表Source Sum of Squares df F PR>F Model 5550.8 (A) (D) 0.000 Error (B) (C) Corrected Total 5784.5試填入 ANOVA 表中(A)、(B)、(C)和(D)內之數字。(5 分)試問上述迴歸模型是否顯著(α = 5%)?(5 分)若 X 為資料中之設計矩陣(design matrix),且 0.1132 - 0.00445 - 0.00008 ( X X ) 1 - 0.00445 0.0027 - 0.00004 - 0.00008 - 0.00004 0.000001 試檢定 H 0 : 0 1 2 vs. H1 : i j ,任意 i , j 0 ,1, 2 ;i 不等於 j。請寫出檢定統計量之分布和自由度(α = 5%)。(臨界值(critical value)= 3.44。)(15 分)
(25 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
迴歸模型中解釋變數間若存在共線性(multicollinearity)對估計結果影響甚鉅。變異數膨脹因子(variance inflation factor, VIF)是判斷共線性的一個指標。VIF 之意涵為何?試說明 VIF 和共線性的關係。(10 分)某組資料有 5 個解釋變數 x1, x2, x3, x4, x5 所得迴歸係數估計結果如下:Variable bj se VIF Intercept 0.830 0.318 x1 -0.012 0.647 (0.002)-1 x2 0.199 0.483 (0.001)-1 x3 -0.117 0.178 (0.010)-1 x4 -0.367 0.294 (0.008)-1 x5 0.186 0.147 (0.009)-1其中 b j 為迴歸係數 j 之估計值,se 為其標準誤。試評估解釋變數中是否存在共線性?(5 分)(背面)
(15 分)
本題含圖表或公式,請對照原卷 PDF。
- 3
在有三個解釋變數之一組資料配適迴歸模型後,得到所有部分集合之變數選擇(all possible subsets selection)結果如下( b j 為迴歸係數 j 之估計值):p-1 R2 Cp b0 b1 b2 b3 1 0.032 75.45 0.77 0.325 1 0.705 11.85 0.27 1.361 1 0.707 11.67 -0.36 1.103 2 0.759 8.79 -0.29 -0.463 1.255 2 0.808 3.12 -0.19 0.781 0.633 2 0.830 2.03 -0.93 0.655 1.487 3 0.831 4.00 -0.12 0.737 1.589 -0.094何謂 Cp,試說明其意義。(10 分)由表中結果來看,最佳模型為何?為什麼?(10 分)
(20 分)
本題含圖表或公式,請對照原卷 PDF。
- 4
下述資料為某幼稚園自 80 年後至 90 年之幼童入學學費。年 81 82 83 84 85 86 87 88 89 90 80 年後之年分, x 1 2 3 4 5 6 7 8 9 10學費(千元), y 6.1 6.8 7.5 8.5 9.3 10.5 11.5 12.625 13.975 14.975由( y , x )之散布圖(scatter plot)發現 y 和 x 的關係較接近 y e x 。欲得一線性模型,須將 y 作何轉換(transformation)?試寫出轉換後的模型。(10 分)令 zi 為反應變數 yi 轉換後的值,且 10 i 1 zi 22.783,i 1 xi zi 133.686 。試求 α 和β 的最小平方估計量(least square estimate)。(10 分)根據 之結果,預測 100 年時該幼稚園之幼童入學學費。(10 分)
(30 分)
本題含圖表或公式,請對照原卷 PDF。
- 5
假設( yi , x i )滿足 yi 0 1 xi1 p xip εi,i 1,..., n 。令 b j 為迴歸係數 j 之最小 平 方 估 計 量 , j 0,1,..., p 。 著 名 的 高 斯 - 馬 可 夫 ( Gauss-Markov ) 定 理 是 對 pj0 l j j 之估計有興趣,其中 l0 , ..., l p 是已知的實數。試敘述Gauss-Markov定理及其假設條件。(10分)
(10 分)
102 年(考試時間 120 分鐘) 原卷 PDF
- 1
抽樣某公司業務員之週業績(sales)與其每週工作時數(work)和年資(experience,以年計),做兩個迴歸分析如下:分析一:Dependent Variable: sales Analysis of Variance Sum of Mean Source DF Squares Square F Value Pr > F Model 1 95.23381 95.23381 0.91 0.3473 Error 31 3241.31165 104.55844 Corrected Total 32 3336.54545 Parameter Estimates Parameter Standard Variable DF Estimate Error t Value Pr >|t|Intercept 1 144.77530 8.52019 16.99 <.0001 work 1 0.17402 0.18234 0.95 0.3473分析二:Dependent Variable: sales Analysis of Variance Sum of Mean Source DF Squares Square F Value Pr > F Model 2 2186.59454 1093.29727 28.52 <.0001 Error 30 1149.95092 38.33170 Corrected Total 32 3336.54545 Parameter Estimates Parameter Standard Variable DF Estimate Error t Value Pr >|t|Intercept 1 104.05180 7.55046 13.78 <.0001 work 1 0.43469 0.11590 3.75 0.0008 experience 1 1.57153 0.21276 7.39 <.0001
(一)就分析一,當每週工作時數為 45 小時,估計週業績之平均數及變異數。(10 分)
(二)比較分析一與分析二,每週工作時數與業績之關係有何差異?你會採用那個模式?為什麼?(α=0.05)(15 分)
(三)就分析二,在固定年資水準下,如工作時數增加一小時,檢定平均業績之增加量是否低於 0.5?列出 H0 及 H1,並檢定之。(α=0.025)(10 分)
(四)就分析二,如年資的單位由年改為月,那些數值會改變?並求改變後之值。(10 分)(背面)類 科: 統計
(45 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
自四所高中隨機抽樣學生參加英文檢定考試,令 Y=成績,X1=在校英文成績,X2=每週讀英文之時數,(X3,X4,X5)=(1,0,0)為甲校學生,(X3,X4,X5)=(0,1,0)為乙校學生,(X3,X4,X5)=(0,0,1)為丙校學生,(X3,X4,X5)=(0,0,0)為丁校學生,得以下迴歸分析資訊。模式:Y = β0 +β1X1 +β2X2 +β3X3 +β4X4 +β5X5 +ε Analysis of Variance Sum of Mean Source DF Squares Square F Value Pr > F Model 5 6368.47 1273.69 72.99 <.0001 X1 2768.78 X2|X1 1.88 X3|X1,X2 18.35 X4|X1,X2,X3 3126.22 X5|X1,X2,X3,X4 453.24 Error 74 1291.33 17.45 Corrected Total 79 7659.80 Parameter Estimates Parameter Standard Variable DF Estimate Error t Value Pr >|t|Intercept 1 42.680 6.530 6.54 <.0001 X1 1 0.504 0.071 7.10 <.0001 X2 1 0.059 0.310 0.19 0.8509 X3 1 -0.610 1.323 -0.46 0.6459 X4 1 -12.291 1.338 -9.19 <.0001 X5 1 6.827 1.340 5.10 <.0001
(一)就上述資訊:寫出對 Y 影響最大及次大之解釋變數,並請述明理由。(5 分)某一甲校學生,在校英文成績為 75,每週讀英文之時間為 5 小時,請預測其英文檢定成績。(5 分)檢定 H0:β3=β4 =β5 = 0 vs. H1:非 H0。(α=0.05)(12 分)
(二)經由模式選取過程,得估計之模型為 Ŷ = 43.36+0.49X1-11.97X4+7.16X5 及MSR=2121.42。求此模型之修正後判定係數(adjusted coefficient of determination)。(10 分)請解釋 X5 的係數 7.16 之涵義。(8 分)
(40 分)
本題含圖表或公式,請對照原卷 PDF。
- 3
迴歸分析中:
(一)如應變數 Y 不服從常態分配,該如何處置?(5 分)
(二)如槓桿值(leverage, h)過大時,表示為何?(5 分)
(三)修正後判定係數(adjusted coefficient of determination)有何用處?(5 分)
(15 分)
參考架構・破題
三小題分別考常態假設不成立的處理、槓桿值的意義、修正後判定係數的用途。作答要先釐清概念(常態指誤差、槓桿看 X 空間、修正 R² 懲罰變數個數),再列處理方法。
完整答題架構與關鍵字:到站內看全文
其他等別的「迴歸分析」
- 迴歸分析(地方特考三等)(40 題)
題目來源:考選部考畢試題查詢平臺(政府資訊公開資料);參考架構為本站自撰,僅供準備方向參考,非官方標準答案。最後更新:。