抽樣方法 申論題歷屆試題與參考架構

地方特考三等,民國 102~111 年共 9 份試卷、39 題,其中 31 題附參考答題架構。考這一科的類科:統計。本頁列出歷年全部題目,參考架構只列開頭的「破題」,完整的答題架構、關鍵字與作答提醒請到站內查看。

▶ 看完整參考架構(抽樣方法)

111 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    欲針對園區內 5,000 個租屋的上班族進行抽樣調查,以了解其租屋支出及社會住宅需求。根據過去幾年的研究報告,月租屋支出之標準差為S=30(千元) ,社會住宅需求比例(P)介於 35%到 45%之間。若採用簡單隨機抽樣方式,欲在 95%的信賴水準下估計月平均租屋支出( Y )及社會住宅需求比例(P) ,同時達到下列估計精確度的要求,則需多少樣本數?(10 分)P  p  P  0.05   0.95, P (| y  Y |  3)  0.95式中 p 及 y 分別為 P 及 Y 的估計量。

    (10 分)

    參考架構・破題

    本題要同時滿足「均數」與「比例」兩個精確度要求,分別求樣本數後取較大者;母體 N=5,000 有限,必須做有限母體校正(fpc)。題意為 P(|p−P|≤0.05)=0.95、P(|ȳ−Ȳ|≤3)=0.95。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    欲了解醫院的醫療採購情形,由 120 家醫院抽樣調查 30 家醫院,取得下列(x, y)的樣本統計資訊。x:登記的病床數為輔助變數(單位:床),y:醫療採購金額為興趣變數(單位:萬元) :30 30  x  22,500 ,  y  19,500 , s x2  360,000, s 2y  250,000, s xy  240,000 ,1 1已知 120 家醫院登記的總病床數為 96,000。

    (一)用比率估計量(ratio estimator, yR )及迴歸估計量(regression estimator, ylr )估計平均一家醫院之醫療採購金額( Y ) 。(10 分)

    (二)求算前述兩個估計量相對於單位均數估計量(mean per unit estimator, y )的相對效率(relative efficiency)並比較分析其精確度(precision) 。(10 分)(註:答案如有小數,請計算至第二位)

    (20 分)

    參考架構・破題

    本題考輔助變數估計:利用已知母體病床總數,以比率估計與迴歸估計改善單位均數估計,並以近似變異數比較相對效率。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    稽核單位欲了解申報資料的正確性,將申報資料共 10,000 件依其營業特性別分成四層,每層的案件數分別為 N1  1,000; N 2  3,000; N 3  4,000; N 4  2,000 ,再 由 每 層 抽 取 一 簡 單 隨 機 樣 本 n1  10; n2  30; n3  40; n4  20 進行查核。查核結果彙整如下表:層別 1 2 3 4短漏報件數 5 6 8 2平均短漏報金額(萬元) 15 10 8 4短漏報金額標準差(萬元) 40 30 50 10

    (一)配合前述抽樣設計,回答以下問題:(20 分)估計平均短漏報金額( Y )及該估計量之標準誤。估計短漏報比例(P)及該估計量之標準誤。

    (二)假設前述資訊已知,原樣本配置方式改為何種配置方式將可提高估計精確度?(5 分)

    (三)依(二)所建議之配置方式回答以下問題:(10 分)若針對估計均數 Y ,如何配置樣本 n=100 到各層?若針對估計比例 P,如何配置樣本 n=100 到各層?(註:答案如有小數,請計算至第二位)

    (35 分)

    參考架構・破題

    本題為分層隨機抽樣的估計與配置:原設計 nₕ∝Nₕ 是比例配置;在已知各層標準差下改用 Neyman 最適配置可提高精確度,並分別對均數與比例配置 n=100。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    欲調查某國家公園內的樹感染病蟲害的情況,該國家公園內共分成 10 個區域,首先由 10 個區域隨機抽出 4 個區域,再就被抽出的區域隨機抽出 5%的樹進行調查,調查結果如下表:區域 樹種植 樹抽出 樹感染病蟲害i 數量 M i 數量 mi 數量 ai 1 200 10 1 2 300 15 5 3 300 15 5 4 400 20 4

    (一)說明此抽樣設計的名稱及兩階段的抽樣單位(Primary Sampling Units及 Secondary Sampling Units)。(15 分)

    (二)試估計該國家公園內的樹感染病蟲害的比例(P) ,並提供 95%信賴區間。(20 分)(註:答案如有小數,請計算至第二位)

    (35 分)

    參考架構・破題

    本題為兩階段集群抽樣(集群大小不等):先抽區域、再於區域內抽樹,以比率型估計量估計感染比例並建構信賴區間。

    完整答題架構與關鍵字:到站內看全文

110 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    何謂抽樣誤差?那種樣本可以測量抽樣誤差?有那些方法可以降低抽樣誤差?(10 分)

    (10 分)

    參考架構・破題

    抽樣誤差是「只觀察部分母體而非全部」所造成的估計量與母體參數之間的差異,屬於隨機性的誤差。本題要先定義,再說明只有機率樣本才能衡量,最後列出降低誤差的設計與估計手段。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    (一)何謂簡單隨機樣本?(5 分)

    (二)考慮簡單隨機抽樣,請證明任一母體元素 ui , i=1,…, N 被選入樣本的機率為 n/N。(5 分)

    (三)請問下列敘述是否正確?「若任一母體元素 ui ,i=1,…, N 被選入樣本的機率皆相等,則此樣本稱為簡單隨機樣本」 ,若不正確,請舉一反例說明。(10 分)

    (20 分)

    參考架構・破題

    本題考簡單隨機抽樣的定義與基本性質。核心觀念是:簡單隨機樣本要求「每一個大小為 n 的子集合被抽中的機率都相等」,這比「每個單位入樣機率相等」更強,第(三)小題即要考生舉出反例說明兩者並不等價。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    (一)抽樣時,採分層隨機抽樣方法而不採用簡單隨機抽樣方法的原因有那些?(10 分)

    (二)考慮分層隨機抽樣,證明在抽樣總成本固定之下,使樣本平均之變異N  / ci數最小的各層樣本數最佳配置為 ni  n( L i i ) ,其中 Ni 是第 i 分層N  / c k 1 k k k的大小, i2 是第 i 分層的變異數, ci 是由第 i 分層獲得一觀察值的成本。(15 分)

    (三)考慮分層隨機抽樣,請問在那一種樣本配置下,母體平均估計量與簡單隨機抽樣時的母體平均估計量相同,試證明之。(10 分)(k  1)nMSB  SST

    (35 分)

    參考架構・破題

    本題考分層隨機抽樣的三大基本觀念:為何分層、成本固定下的最適配置推導、以及比例配置的自加權性質。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    考慮系統抽樣,請導出   ,(n  1) SST n k  k  1 i 1 MSB  ( yi  y )2 k n其中N=nk, 是系統樣本 內任2元素的相關係數,MSW  1  ( yij  yi )2(集群)k (n  1) i 1 j 1 k n SST   ( yij  y ) 2 i 1 j 1(10 分)

    (10 分)

    參考架構・破題

    本題要求由系統抽樣的變異數分解,導出系統樣本內任兩元素相關係數 ρ 與 ANOVA 量的關係:ρ=[(k−1)n·MSB−SST]/[(n−1)SST],其中 N=nk。

    完整答題架構與關鍵字:到站內看全文

  5. 5

    (一)考慮集群抽樣,若母體總數 M 已知,請問母體總和的估計量為何?若不知母體總數 M,但知道集群總數 N 時,請問母體總和的估計量為何?(5 分)n 1  M i yi

    (二)考慮兩階段集群抽樣,證明母體平均估計量   i 1是母體平M n均  的不偏估計量。其中 M =M/N。提示: E (  )  E1 E2|1 (  ) (10 分)

    (三)考慮兩階段集群抽樣,由相等大小集群 M 抽取相等大小樣本 m,且當1 2  w2 N 很大時,證明在固定抽樣成本下,使V (  )  ( b  ) 值最小的 m n m  w2 c1為m  ,其中 c1 是第一階段每一觀察值的成本,c2 是第二階段每 b2 c2一觀察值的成本, b2 是集群平均間的變異數, w2 是集群內元素間的變異數。(10 分)

    (25 分)

    參考架構・破題

    本題考集群抽樣與兩階段集群抽樣的估計量:總和估計量的兩種寫法、兩階段平均估計量的不偏性(條件期望),以及固定成本下第二階段最適樣本數。

    完整答題架構與關鍵字:到站內看全文

109 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    光明社區管理委員會主任委員希望能調查住戶對禁止住戶在社區中庭花園抽菸以免影響其他住戶的意見,因為該社區住戶高達700戶,分別分布在 A、B、C、D 四棟大樓,因此主任委員在各棟大樓各用簡單隨機抽樣取出不放回的方式選擇了50戶住戶加以調查其意向。各棟大樓戶數及贊成社區中庭花園禁菸之樣本比例如下:大樓編號 戶數 贊成比例A 100 0.8 B 300 0.4 C 200 0.5 D 100 0.7請回答下列問題:

    (一)請問光明社區住戶贊成禁止住戶在社區中庭花園抽菸比例之不偏估計推估值。 (5分)

    (二)請問以上推估值在95%信心水準下的最大估計誤差。(10分)

    (三)在試行此一規定三個月後,主任委員想再做一次同樣的調查,請問在抽樣設計及總抽樣數均維持不變的情況下,可以如何來改進推估的精確程度?(10分)

    (25 分)

    參考架構・破題

    本題為分層隨機抽樣(各層簡單隨機抽樣、不放回)估計母體比例,關鍵在以各層戶數占比 W_h=N_h/N 加權,而非直接平均四層樣本比例;第三小題考樣本配置(比例配置與 Neyman 最適配置)。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    某鎮農會欲估算該鎮豬農養豬飼料之花費,以簡單隨機抽樣取出不放回的方式於該鎮的10戶豬農選擇了5戶,詢問其過去一季平均養豬隻頭數及飼料花費。調查所得資料如下:豬農編號 平均養豬隻頭數 飼料花費(仟元)1 200 850 2 400 1600 5 100 450 8 50 300 10 250 800根據此一調查結果,請問你會如何估算該鎮豬農平均每隻豬隻每季飼料花費?請解釋你的想法(可由估計及/或抽樣設計的觀點) ,並提出推估結果在95%信心水準下的最大估計誤差。(15分)

    (15 分)

    參考架構・破題

    飼料花費與養豬頭數高度成正比,而題目要的是「每隻豬每季飼料花費」,屬比率估計;應以比率估計式 r=Σy/Σx,而非各戶 y/x 的簡單平均。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    簡單隨機抽樣可分為取出不放回及取出放回兩大類,樣本觀察值之平均在兩種設計中均為母體平均 µ 之不偏估計,若樣本數為 n,so 為樣本集合,該不偏估計為y  yi n iS O請回答下列問題:

    (一)如果均以 作為 µ 之估計量,雖然均為樣本中觀察值之平均,但在相同的樣本數下,取出不放回的設計會比取出放回相對較有效(more efficient),請闡述其原因,並討論其相對有效性與樣本數及母體數之關係。(10分)

    (二)在取出放回的設計中有另外一個母體平均 µ 之不偏估計,該估計為樣本中不同單元觀察值之平均,亦即若有重複出現之單元,其觀察值只會被計入一次,該不偏估計量為yv   yi v iS其中 s 為 so 中不同單元所構成之集合,ν 為 s 中之單元數目,且 ν ≤ n。抽樣理論中之一基本結果為在簡單隨機抽樣取出放回設計中, 亦較相對較有效,請說明其理由。(5分)

    (15 分)

  4. 4

    欣民里里長希望能將里內獲得整建該里休閒公園之經費用於該公園內規劃一狗公園,作為里民飼養家犬之活動空間,藉以減少里民於公園遛狗時可能造成之環境污染及人犬衝突,因此里長希望能先進行可行性評估,其中包括對里民的問卷抽樣調查,問卷內容包括:家中是否養狗。若有養狗,請問飼養隻數。是否贊成狗公園之規劃。在該里的500戶中,里長以簡單隨機抽樣取出不放回的方式選擇了 50戶作為樣本,調查資料顯示其中有 10 戶養狗。10 戶有養狗的樣本戶對另外兩題之答案彙整如下:家戶編號 68 124 136 158 248 314 379 401 452 479家犬隻數 1 1 1 3 1 1 4 1 1 1是否贊成 是 是 是 否 是 否 是 否 是 否

    (一)該里家戶養狗比例之不偏估計推估值為何?及此一比例之95%信賴區間?(5分)

    (二)請問該里養狗之家戶平均養狗隻數之不偏估計,以及其95%信賴區間?(10分)

    (三)請問該里養狗總隻數之不偏估計,以及其95%信賴區間?(10分)

    (四)調查資料中沒有養狗的家戶贊成設置狗公園的戶數是16戶,但是有人質疑此一抽樣設計或許沒有考慮家戶年齡結構,因為有高齡長者的家戶可能希望規劃友善樂齡運動空間,經重新審視資料,樣本中有20戶為家中有65歲以上高齡里民,而其中有2戶贊成,而戶籍資料顯示欣民里中有350戶家中有65歲以上長者,請問根據此一資料,在考量家戶年齡結構之要求下,贊成設置狗公園之比例不偏估計為何?你是否認為此一估計量較為恰當?請說明理由。 (10分)

    (五)若有里民質疑樣本數過少以至於養狗戶數之推估精確度不足,若欲重新以相同抽樣設計執行此一調查,但要將推估養狗戶數比例控制在95%信心水準下不超過正負5%,請問樣本戶數至少需要多少?(10分)

    (45 分)

108 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    將 5 個大小質量皆相同的球,分別編號為 1, 2, 3, 4, 5,且將其放入袋中。現以簡單隨機抽樣法一次抽取 2 個球。X + X2設 X i 為第 i 個球之編號, i = 1, 2 , X = 1 。

    (一)求 X 之抽樣分配。(10 分)

    (二)驗證 X 是否為母體平均數 µ 的不偏估計式。(5 分)

    (三)說明 X 的變異數與母體變異數σ 2 之間的關係。 (10 分)

    (25 分)

    參考架構・破題

    N=5、n=2 的不放回簡單隨機抽樣,共 C(5,2)=10 組等機率樣本;列舉全部樣本即可得出樣本平均數的抽樣分配,再驗證不偏性與變異數公式。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    為了解學生平時打工情形,A 大學特地進行下列調查計畫。已知 A 大學共有 100 個班級,現自 100 個班級中隨機抽出 5 個班級,再由這 5 個班級中隨機抽出部分學生,調查每位學生每星期打工時數( yij ),得到如下資料:∑ j =i 1 yij 2 ∑ j =i 1 ( yij − yi ) m m 2班級學生人數 抽樣學生數yi = si = Mi mi mi mi − 1 50 5 29 15 78 8 15 9 62 6 20 22 71 7 35 20 39 4 45 18

    (一)請問這是何種抽樣方法?(5 分)

    (二)請估計每位學生每星期的平均打工時數,並求算其 95%誤差界限。(10 分)

    (三)若已知 A 大學學生總人數為 5880 人,請估計每位學生每星期的平均打工時數,並求算其 95%信賴區間。 (10 分)

    (25 分)

    本題含圖表或公式,請對照原卷 PDF。

  3. 3

    甲社團的團長欲了解該團團員每月花費多少的交通費用,已知甲社團共有團員 205 位,利用團員通訊錄的資料,採 10 取 1 的系統抽樣法,調查得 21 位團員每月的交通費用(yi, i=1, …, 21)如下:(每小題 10 分,共 20 分)2030, 1720, 1850, 2210, 2150, 2370, 2000, 1930, 1570, 1910, 2380, 2540, 1720, 1900, 2200, 2100, 1860, 1800, 2050, 2420, 2090

    (一)估計甲社團團員每月的平均交通費用,且求算此平均交通費用的 95%信賴區間。

    (二)採用連續的差數(successive differences) ,di= yi +1 - y i (i=1, …, 21),估計甲社團團員每月的平均交通費用的變異數。同時比較(一)、(二)這兩種估計變異數方法的準確度,說明何種估計方法較合適。

    (20 分)

    參考架構・破題

    系統抽樣只有一個隨機起點,沒有不偏的變異數估計式;常見作法是視同簡單隨機抽樣估計,或在母體有趨勢/順序時改用連續差數法,本題要求兩者都算並比較。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    社會學者欲研究甲城市年齡 65 歲以上的老年人口狀況。現依地理位置將甲城市劃分為 80 個區域,自此 80 個區域中,以簡單隨機抽樣法,抽出 6 個區域,調查每個區域的居民人數及年齡 65 歲以上的老年人口數。得調查資料如下:(每小題 10 分,共 30 分)區域 1 2 3 4 5 6居民人數 85 37 49 50 34 45 65 歲以上的老年人口數 15 8 12 11 8 12

    (一)估計甲城市年齡 65 歲以上的老年人口比例,且計算此比例的 95%誤差界限。

    (二)估計甲城市年齡 65 歲以上的老年人口總數,且求算此總數的 95%信賴區間。

    (三)現透過戶政資料,得知甲城市居民總數為 4250 人,試利用此資料估計甲城市年齡 65 歲以上的老年人口總數,並比較(二)、(三)這兩種估計方法那一種較適合。

    (30 分)

    參考架構・破題

    區域為初級抽樣單位,屬單段集群抽樣;比例須用比率估計,總數則可分「不使用 M」的不偏估計與「使用 M=4250」的比率估計兩種,最後比較效率。

    完整答題架構與關鍵字:到站內看全文

107 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    某一種分層抽樣設計將母體分成三層,並且取得以下關於母體與樣本的相關資訊:z 第一層有 100 個抽樣單元、樣本數是 50、樣本平均是 10、樣本變異數是 800;z 第二層有 100 個抽樣單元、樣本數是 50、樣本平均是 20、樣本變異數是 700;z 第三層有 100 個抽樣單元、樣本數是 50、樣本平均是 30、樣本變異數是 600;請回答:(t0.025(147) = 1.976233)

    (一)估計母體平均數。 (5 分)

    (二)請提供信賴區間所需 t 分配的自由度。(10 分)

    (三)承上小題,提供母體平均數的 95%信賴區間(答案請四捨五入到第二位小數) 。(10 分)

    (25 分)

    參考架構・破題

    三層層大小相同的分層隨機抽樣,求分層平均數、其變異數,以及信賴區間所用自由度;自由度可寫 n-L,也可說明 Satterthwaite 有效自由度。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    承上題。假設研究者想試算簡單隨機抽樣的結果。(t0.025(49) = 2.009575)

    (一)請單獨根據第一層的資訊估計母體平均數及提供母體平均數的 95%信賴區間(答案請四捨五入到第二位小數)。(10 分)

    (二)請單獨根據第二層的資訊估計母體平均數及提供母體平均數的 95%信賴區間(答案請四捨五入到第二位小數)。(10 分)

    (三)請單獨根據第三層的資訊估計母體平均數及提供母體平均數的 95%信賴區間(答案請四捨五入到第二位小數)。(10 分)

    (30 分)

    參考架構・破題

    把單一層的 50 筆資料當成簡單隨機樣本來估計母體平均數,目的是對照前題的分層結果,凸顯分層抽樣可消除層間差異、提高精確度。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    假設總樣本數是 150。再假設研究者把母體分成三層並且取得以下相關資訊:z 第一層有 100 個抽樣單元、母體變異數 16;z 第二層有 200 個抽樣單元、母體變異數 25;z 第三層有 300 個抽樣單元、母體變異數 36;請回答:假設抽樣成本是一致的,請問根據最佳分配原則,

    (一)第一層分配到樣本數是多少(答案請四捨五入到個位數)?(5 分)

    (二)第二層分配到樣本數是多少(答案請四捨五入到個位數)?(5 分)

    (三)第三層分配到樣本數是多少(答案請四捨五入到個位數)?(5 分)

    (15 分)

    參考架構・破題

    成本一致下的最佳分配即 Neyman 配置:n_h=n·N_hσ_h/Σ N_hσ_h,層越大、層內變異越大的層分配越多樣本。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    某大學某系所 60 位學生針對 107 年公投議題進行假投票,他們的座號從「01」開始一直編到「60」。抽樣方法課的授課師長為了示範系統抽樣,私底下先詢問了全班每一位同學對「議題甲」的個人意見。發現座號「04, 05, 07, 10, 15, 17, 19, 25, 27, 28, 29, 30, 31, 32, 37, 39, 45, 46, 50, 53, 58, 60」的這幾位同學表示支持議題甲。現在引用「每 5 個取 1 個」的系統抽樣估計支持者的比例。請回答:如果系統抽樣的起始座號是 03,

    (一)支持議題甲的樣本比例等於多少(答案請用分數表達)?(15 分)

    (二)估計上述樣本比例的變異數(答案請四捨五入到第四位小數) 。(10 分)

    (三)假設估計誤差被定義為上述變異數放大 4 倍後的正方根,請問第一小題樣本比例的估計誤差等於多少(答案請四捨五入到第四位小數)?(5 分)

    (30 分)

    參考架構・破題

    N=60、k=5 的 1-in-k 系統抽樣,起點 03 得 12 個樣本;先找出樣本中支持者算比例,再以簡單隨機抽樣近似估計變異數。

    完整答題架構與關鍵字:到站內看全文

106 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    請敘述問卷設計之原則。(15 分)

    (15 分)

    參考架構・破題

    問卷是調查資料品質的源頭,設計原則可從「整體規劃、題目措辭、選項設計、題目排序、版面與預試」五個層次說明,目的在降低測量誤差與無回應。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    (一)何謂簡單隨機抽樣法?(5 分)

    (二)設一有限母體中有 N 個元素,若自母體中以抽出不放回的抽樣方式,抽出 n 個簡∑ n y單隨機樣本, y1 , y 2 , ... , y n ,請證明樣本平均數 y = =1 i 的變異數i n N −n σ2 Var ( ) = y ⋅ (σ 2 為母體變異數) 。(10 分)N −1 n

    (15 分)

    參考架構・破題

    先定義簡單隨機抽樣,再利用指標變數或共變異數法證明不放回抽樣下樣本平均數的變異數,關鍵步驟是兩個不同樣本單位的共變異數為 -σ²/(N-1)。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    (一)臺灣自來水公司為了研究家戶用水行為,欲從家庭用水的水表資料檔中以抽樣方式抽出 1,000 戶來做家戶用水行為研究。在自來水公司的家庭水表資料檔中,各戶都有一個專門的水表號碼,也有每個月的用水度數。為了減低用水量多寡的用水行為差異,欲用用水度數分層,請敘述如何執行分層隨機抽樣。(5 分)

    (二)分層隨機抽樣之每一層樣本大小的配置(Allocation) ,應注意那三項事情?(5 分)

    (三)什麼時候需要採用雙重抽樣方法(Double Sampling)?(5 分)

    (15 分)

    參考架構・破題

    本題三小題分別考分層隨機抽樣的實作步驟、樣本配置的考量因素,以及雙重抽樣的適用時機(分層或比率估計所需輔助資訊未知時)。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    (一)若採用重複系統抽樣法(Repeated Systematic Sampling),在母體大小為 N 中抽出N ns 個“k'取 1”的系統樣本,可得 ns 個樣本大小為 n( n = )的系統樣本。若第 i k' ∑ nj =1 yij個系統樣本為 y i , y i + k ′ , ... , y i + ( n −1) k ′ ,令 yi = ,(i = 1, 2, … , ns)為第 i 個系n統樣本的平均數,請寫出母體平均數 ̂ 的估計公式?及母體平均數估計式的估計變異數Var( ̂ )?(10 分)

    (二) 若 採 用 群 集 隨 機 抽 樣 法 ( Cluster Sampling ), 在 母 體 大 小 為 M 中 先 分 成N 個群集(cluster) (每一個群集之個數為 m1, m2, … , mN, M = ∑iN=1 mi ) ,再以群集為抽樣單位,以簡單隨機抽樣法抽出 n 個群集為一群集樣本,稱為群集隨機樣本。若 yi 表示第 i 個群集中變數值的總和,請寫出母體平均數 ̂ 的估計公式?及母體平均數估計式的估計變異數Var( ̂ )?(10 分)

    (三)在何種條件下,題(一)及(二)所述兩種抽樣法之母體平均數的估計值公式會相同?(5 分)全一張(背面)等 別:三等考試

    (25 分)

    參考架構・破題

    本題考重複系統抽樣與不等大小群集抽樣的估計式,關鍵在看出「每一個系統樣本其實就是一個群集」,兩者可以用同一套群集抽樣的邏輯處理。

    完整答題架構與關鍵字:到站內看全文

  5. 5

    在兩階段抽樣法中,第一階段先將母體分成 N 個抽樣單位,以簡單隨機抽樣法抽出 n個抽樣單位,稱為第一抽樣單位。其次,將第一階段中的每一個抽樣單位分割成Mi (i = 1, 2 , … , N)個抽樣單位,並從 n 個第一抽樣單位以簡單隨機抽樣法各抽出mi (i = 1, 2, … , n)個抽樣單位( yi1 , yi 2 , ... , yimi , i = 1, 2, … , n),稱為第二抽樣單位,M 1 mi M = ∑iN=1 M i , M =, yi = ∑ j =1 yij 。N mi

    (一)在什麼情況下,兩階段抽樣法即為分層隨機抽樣法?(5 分)

    (二)在什麼情況下,兩階段抽樣法即為群集隨機抽樣法?(5 分)

    (三)若 M 未知,請寫出母體平均數 ̂ 的估計公式及Var( ̂ )的估計公式。(10 分)

    (四)若在第一階段中不以簡單隨機抽樣法抽出 n 個抽樣單位,改以第 i(i = 1, 2, … , N)M個被抽中的機率為 i(Two-Stage Cluster Sampling with Probabilities Proportional to M Size, pps),請寫出母體平均數 ̂ 的估計公式及Var( ̂ )的估計公式。 (10 分)

    (30 分)

    參考架構・破題

    兩階段抽樣是介於分層抽樣與群集抽樣之間的一般化設計:第一階段全抽就是分層,第二階段全抽就是群集;估計式則依第一階段抽樣方式(SRS 或 pps)而不同。

    完整答題架構與關鍵字:到站內看全文

104 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    假 設 F = {u1 , u 2 , u3 , u 4 } 是 一 個 僅 僅 包 含 四 個 元 素 的 小 規 模 有 限 母 體 ( finite,而我們採用簡單隨機抽樣(simple random sampling)從母體 F 之中抽出population)樣本大小(sample size)為 n = 2 的樣本組合,那麼總共會有多少種不同的樣本組合?如果我們改用機率均等的隨機置回抽樣(sampling with replacement),那麼總共會有多少種不同的樣本組合?如果母體 F 之中四個元素的研究變數(study variable)值分別為 y1 = 1、 y2 = 3、 y3 = 3、以及 y4 = 9,那麼母體 F 的母體平均數(population mean)是多少?母體變異數(population variance)是多少?(5 分)

    (5 分)

    參考架構・破題

    本題是基本計算題,考簡單隨機抽樣(不置回)與置回抽樣的樣本數,以及有限母體的平均數與變異數,注意母體變異數的兩種定義。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    假設第一題之中從母體 F 抽出簡單隨機樣本的樣本數據為 Y1 與 Y2 (註:採用大寫英文字母 Y ,表示樣本數據皆為隨機變數)。我們分別使用下列三種不同的點估計量(point estimator)來估計母體變異數σ 2 :෢ 1 n ෢ 1 n ෢ N −1 n σ (1) = ∑ (Yi − Y ) ,σ (2) = 2 2 2 ∑ (Yi − Y ) ,σ (3) = 2 2 ∑ (Yi − Y )2 ,n i =1 n − 1 i =1 N (n − 1) i =1其中 Y 為樣本平均數(sample mean)、N 為母體大小(population size)。

    (一)試計算以上三種估計量的抽樣分布(sampling distribution)與均方誤差(mean square error),並判別它們是否為不偏估計量(unbiased estimator)。(20 分)

    (二)假設我們改用機率均等的隨機置回抽樣,請重新判別三種估計量是否為不偏估計量。簡答即可,無需計算或證明。 (3 分)

    (23 分)

    本題含圖表或公式,請對照原卷 PDF。

  3. 3

    假設某一間大學共有 8000 位學生,其中 2000 人為男生,6000 人為女生。同時,8000位學生之中有 7000 人屬於日間部,1000 人屬於夜間部。

    (一)我們打算採用分層隨機抽樣(stratified random sampling)之方法從 8000 位學生之中抽出 n = 16 位學生,來估計 8000 位學生的平均身高。那麼應當依照男女性別來分層,抑或依照日間、夜間部別來分層較為恰當?如果依據比例配置(proportional allocation)來進行抽樣,須要分別從各層抽出多少人?抽出樣本並取得樣本觀測值之後,應如何估計 8000 位學生的平均身高?另外,如果我們想要採用分層隨機抽樣來調查 8000 位學生的月平均收入(例如校外打工或兼差之收入) ,那麼應當依照男女性別來分層,抑或依照日間、夜間部別來分層較為恰當?(8 分)

    (二)先前採用分層隨機抽樣來估計 8000 位學生之平均身高的問題,如果依據尼門配置(Neyman allocation)來進行抽樣,須要分別從各層抽出多少人?假設母體之中男生層之身高的變異數為女生層之身高變異數的 1.96 倍,日間部與夜間部學生身高的變異數比例數為 1.1。(8 分)

    (三)先前估計 8000 位學生之平均身高的問題,如果我們改用事後分層(post-stratification)之方法來抽樣與推估,那麼整個調查過程應該如何進行?從樣本配置的觀點來看,事後分層可以被視為何種類型之配置?由於 n = 16 屬中小樣本,萬一發生空事後層(empty post-stratum)之情形,應當如何處理或補救?(12 分)全一張(背面)等 別:三等考試

    (28 分)

    參考架構・破題

    分層的原則是「層內同質、層間異質」,要依研究變數選分層變數;接著考比例配置、尼門配置的計算,以及事後分層的程序與空層處理。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    何謂雙重抽樣(double sampling)?試就分層隨機抽樣以及比值估計兩種情況分別說明之,並寫出點估計量的數學式。 (22 分)

    (22 分)

    參考架構・破題

    雙重抽樣(又稱二相抽樣)是在缺乏輔助變數母體資訊時,先用大樣本取得便宜的輔助資訊,再從中抽小樣本調查昂貴的研究變數;應用在分層時用來估層權,用在比值估計時用來估輔助變數的母體平均。

    完整答題架構與關鍵字:到站內看全文

  5. 5

    集群抽樣(cluster sampling)以及二階段集群抽樣(two-stage cluster sampling)與比值估計有何關聯性?試就估計母體平均數之情況予以分別說明並寫出點估計量的數學式。(22 分)

    (22 分)

    參考架構・破題

    群集大小不等時,以「群集總和 yi」為 y、「群集大小 mi」為輔助變數 x,估計每一元素的母體平均數本質上就是比值估計;二階段集群抽樣的估計式也同樣可寫成比值形式。

    完整答題架構與關鍵字:到站內看全文

103 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    美麗市共有 20 個里,75000 位居民。為了解美麗市居民的健康情形,衛生單位分別自各里中隨機抽出 30 位居民進行檢查。試問:(每小題 5 分,共 25 分)這是何種抽樣方法?抽樣母體是什麼?母體大小為多少?抽樣單位是什麼?樣本大小為多少?

    (25 分)

    參考架構・破題

    本題考抽樣基本名詞:依「先把母體分成 20 個里、各里都抽」的設計判斷抽樣方法,再逐一說出母體、母體大小、抽樣單位與樣本大小。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    聯合便利超商共有 40 家門市(編號 1~40)。其中編號 1, 2, 8, 9, 12, 13, 19, 20, 21, 22, 23, 24, 29, 30, 31, 37 的門市設有生鮮部。現欲利用系統抽樣來估計設有生鮮部的門市占所有門市的比例 p。請列出所有可能的「從 5 取 1」系統抽樣樣本。(10 分)請根據題 計算樣本比例 p̂ 的期望值及真實變異數,並且證明 p̂ 為 p 之不偏估計式。(10 分)若「從 5 取 1」系統抽樣的起始值為 3,試估計設有生鮮部的門市占所有門市的比例 p 之 95%信賴區間。(5 分)

    (25 分)

    參考架構・破題

    本題要把 40 家門市列出 5 組「5 取 1」系統樣本,逐組算樣本比例,再由這 5 組的分布求期望值與真實變異數,證明不偏;最後以單一系統樣本近似 SRS 建信賴區間。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    國家公園內有塊占地 1000 公頃的林地,因遭蟲害導致部分樹木枯死。現公園管理處欲利用空中照相技術及部分實地勘察來估計遭蟲害而死亡之樹木的總數。管理處利用空拍圖將林地以每單位 5 公頃劃分,設 x 表示利用空拍圖計算所得之每單位區域死亡樹木的數量,y 表示實地勘察計算所得之每單位區域死亡樹木的數量。從空拍圖計算所得之死亡樹木的總量 x =4200,實地勘察 10 個單位區域,計算得下列的資料:10 10 10 10 10  x i =234,  y i =306,  x i y i =8652,  xi2 =6660,  y i2 =11348。i 1 i 1 i 1 i 1 i 1請利用迴歸估計式(regression estimator)估計這 1000 公頃林地因蟲害死亡的樹木總數,並求算其變異數。(10 分)請利用差量估計式(difference estimator)估計這 1000 公頃林地因蟲害死亡的樹木總數,並求算其變異數。(10 分)請計算迴歸估計式對差量估計式的相對效率(relative efficiency)且評估那種估計式較適合本個案。(5 分)全一張(背面)等 別: 三等考試

    (25 分)

    本題含圖表或公式,請對照原卷 PDF。

  4. 4

    文化部想了解幸福社區居民每年在娛樂方面的消費支出情形。今將幸福社區依地理位置劃分為 200 個區集,現自 200 個區集中隨機抽出 8 個區集,調查每區集的居民人數及每年在娛樂方面的消費金額。調查資料如下:區集 居民人數 消費金額(單位:萬元)1 12 35 2 14 34 3 3 7 4 20 47 5 12 32 6 8 28 7 10 36 8 6 9請估計每位居民每年的平均娛樂消費金額。(5 分)請估計全社區每年的總娛樂消費金額及其 95%信賴區間。(10 分)若經調查得知全社區共有 2500 位居民,請利用此資料估計全社區每年的總娛樂消費金額。(5 分)請依據估計的準確度,比較題 及題 這兩種估計方法,並說明何種估計方法較適合本個案。(5 分)

    (25 分)

    參考架構・破題

    這是以區集為群集的單階段群集抽樣:每人平均用比值估計(總消費/總人數),總額可用不偏的「群集總和展開」估計,也可在已知總人數時用比值估計,再比較兩者精確度。

    完整答題架構與關鍵字:到站內看全文

102 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    某企業想要了解員工對福利政策的滿意度,採用分層抽樣,進行員工抽查。此企業依薪資分成三層(I、II、III),各層員工總人數分別為 3000、1500、500 人。各層依簡單隨機抽樣取 300、150、50 人,其中一題,Q:員工對公司的福利滿意度,1.非常滿意 2.滿意 3.不滿意 4.非常不滿意 5.不知道調查結果整理如下表所示:註:z0.025 = 1.96層別回答 I II III 總和1 50 40 30 120 2 160 75 15 250 3 60 10 2 72 4 10 5 1 16 5 20 20 2 42總和 300 150 50 500

    (一)估計員工對福利政策滿意或非常滿意的比例 p,並求算此比例 p 的 95%信賴區間。(10 分)

    (二)估計 II、III 層員工滿意度(含滿意及非常滿意)比例差,在 95%的信賴水準下,此差異是否顯著?(10 分)

    (20 分)

    本題含圖表或公式,請對照原卷 PDF。

  2. 2

    敘述群集抽樣(cluster sampling)與分層抽樣的優缺點。(15 分)

    (15 分)

    參考架構・破題

    群集抽樣與分層抽樣都先把母體分組,但用法相反:分層是「每一組都抽、組內抽部分」,追求精確度;群集是「抽部分組、組內全查」,追求成本與執行便利。先比較設計原理,再分述優缺點。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    某一經濟學者想要了解臺北市某區的家戶電力使用量的費用狀況,在沒有全區戶數名單及經濟成本考量下,採用群集抽樣(cluster sampling)。總共有 200 鄰,簡單隨機抽取 20 鄰,所得資料如下表:(單位:千元)抽樣鄰戶 抽樣鄰戶抽樣鄰號 戶數 總電費 抽樣鄰號 戶數 總電費1 150 524.4 11 81 282.9 2 69 239.1 12 50 207.3 3 125 361.6 13 117 417.5 4 72 230.4 14 64 227.6 5 93 303.7 15 73 240.9 6 79 274.0 16 47 156.5 7 90 315.5 17 82 293.6 8 84 298.6 18 176 630.2 9 80 266.3 19 122 432.5 10 101 347.8 20 60 214.8

    (一)估計此區一戶的平均月支電費及其估計標準誤(the error of estimation)。(10 分)

    (二)估計此區居民的總電費及其估計標準誤。(10 分)

    (三)假設鄰近行政區的居民結構與此區相似,欲估計鄰近行政區總電費,在估計標準誤為 5000 千元情況下,請估算須抽取多少群集?(10 分)全一張(背面)等 別: 三等考試類 科: 統計

    (30 分)

    本題含圖表或公式,請對照原卷 PDF。

  4. 4

    某手機公司欲估計某款手機三個月(一季)的總營收,已知去年同季的各分店營收(xi),公司根據 246 家分店,採簡單隨機抽樣抽取 20 家分店,資料如下表:(單位:千元)上一年同季營收 本年本季營收 上一年同季營收 本年本季營收分店 分店(xi) ( yi) (xi) ( yi) 1 1500 1600 11 1350 1570 2 928 977 12 720 780 3 620 600 13 670 980 4 550 610 14 957 1020 5 1750 2210 15 610 710 6 1530 1710 16 1100 1450 7 1200 1440 17 1450 1560 8 729 865 18 800 920 9 1020 1030 19 780 850 10 980 1050 20 1300 1450

    (一)利用比例估計式及去年同季總營收(τx) = 256400 千元,估算今年本季總營收(τy)和其估計標準誤。(10 分)

    (二)利用比例估計式,估算分店的平均本季營收及估計標準誤。(10 分)

    (三)利用迴歸估計式,估算分店的平均本季營收及估計標準誤。(15 分)

    (35 分)

    本題含圖表或公式,請對照原卷 PDF。

其他等別的「抽樣方法」

題目來源:考選部考畢試題查詢平臺(政府資訊公開資料);參考架構為本站自撰,僅供準備方向參考,非官方標準答案。最後更新:。