抽樣方法 申論題歷屆試題與參考架構
高考三級,民國 102~112 年共 11 份試卷、49 題,其中 37 題附參考答題架構。考這一科的類科:統計。本頁列出歷年全部題目,參考架構只列開頭的「破題」,完整的答題架構、關鍵字與作答提醒請到站內查看。
112 年(考試時間 120 分鐘) 原卷 PDF
- 1
欲了解某一工業園區N家製造業者AI人才的需求狀況,下述三種抽樣設計可用以推估該工業園區有AI人才需求的業者家數比例及總需求人數:
⑴ 如果園區各業者的營業規模已知,首先將業者依其營業規模分成L層(1, , L ),每層家數分別為 N1 , , N L ,再由每層抽取一簡單隨機樣本,分別為 n1 , , nL ,以調查業者的AI人才需求狀況。
⑵如果園區各業者的營業規模未知,但已知園區業者營業規模的比例分別為W1 , , WL ,首先由N家業者抽取一簡單隨機樣本(n)調查業者規模及AI人才需求狀況後,再根據調查結果依其規模分成L層進行推估。
⑶如果沒有園區業者營業規模的資訊,首先由N家業者抽取一簡單隨機樣本 n ,取得營業規模資訊,而後根據營業規模資訊將 n 家業者依其營業規模分成L層( n1, , nL ),再由每層抽取一簡單隨機樣本,分別為n1 , , nL ,調查業者的AI人才需求狀況。
(一)說明前述三種抽樣設計的抽樣方法為何?(10分)
(二)若欲估計園區AI總需求人數( Y ),分別列出對應前述三種抽樣方法的估計量(estimator)及該估計量之變異數的估計量。(15分)
(25 分)
參考架構・破題
三種設計的差別在「分層資訊何時取得」:⑴事前已知各業者規模=分層隨機抽樣;⑵只知各層權重W_h、樣本抽完才分層=事後分層(post-stratification);⑶什麼都不知道、先抽大樣本取得分層資訊再分層抽子樣本=分層二重抽樣(double sampling for stratification,二相抽樣)。(二)要寫出母體總數Y的估計量與變異數估計量,記得乘上N或N_h。
完整答題架構與關鍵字:到站內看全文
- 2
某一縣市共4000家養雞戶分散在20個村里(cluster),欲透過調查了解該縣市養雞戶的所得狀況,抽樣方法可採用一階段集體抽樣(single-stage cluster sampling)或二階段集體抽樣(two-stage cluster sampling)。
(一)若抽樣方法採一階段集體抽樣,首先由20個村里以簡單隨機抽樣(SRS)抽出3個村里,就抽得的3個村里之養雞戶全數調查,調查結果村里內養雞戶數及平均年所得列於下表:村里 村里內養雞戶養雞戶數(cluster) 平均每戶年所得(百萬元)( Mi )i ( yi )1 150 4 2 200 8 3 250 5.6採用集體大小比率估計量(ratio-to-size estimator, y R )估計該縣市養雞戶平均每戶年所得(以百萬元為單位)及該估計量之標準誤。(10分)
(二)若抽樣方法採二階段集體抽樣,首先由20個村里以簡單隨機抽樣抽出3個村里,再就抽得的3個村里之養雞戶以簡單隨機抽樣分別抽出1/10養雞戶進行調查,調查結果養雞戶之平均所得列於下表:村里內抽得之養雞戶平均村里 每戶年所得及標準差農戶數 抽出養雞戶數(cluster) (百萬元)( Mi ) ( mi )i ( yi , si )yi si 1 150 15 4 1 2 200 20 7 3 3 250 25 6 2試問:(15分)
⑴本抽樣設計第一階段的抽樣單位(primary sampling unit, PSU)及第二階段的抽樣單位(secondary sampling unit, SSU)分別為何?
⑵採用不偏估計量(unbiased estimator, y )估計該縣市養雞戶平均每戶年所得(以百萬元為單位)及該估計量之標準誤。
(25 分)
參考架構・破題
第(一)小題是一階段集體抽樣的比率估計(以集體大小M_i為輔助變數),第(二)小題是二階段集體抽樣的不偏估計,變異數要寫成「村里間+村里內」兩項。已知N=20、M0=4000,M̄=200。
完整答題架構與關鍵字:到站內看全文
- 3
欲了解某區域養殖漁戶營運狀況,該區域共有800家養殖漁戶,首先由該區域抽得一個包含500戶(第一重樣本 n 500 )的簡單隨機樣本以取得養殖型態(是否為漁電共生的層別資訊),調查得知其中100戶為漁電共生戶,進而以簡單隨機抽樣由漁電共生及非漁電共生的養殖漁戶分別抽20%以調查其營運成本資訊,調查結果整理如下表:第一重樣本 第二重樣本 養殖漁戶年營運成本養殖型態(層別) (戶) (戶) 平均年營運成本 標準差nh nh yi (十萬元) si (十萬元)漁電共生(I) 100 20 120 100非漁電共生(II) 400 80 50 60合計 500( n ) 100( n ) 75(s)
(一)估計該區域養殖漁戶平均年營運成本(Y ) (以十萬元為單位)及該估計量的標準誤。 (10分)
(二)如果此調查總預算為44,500元,取得養殖型態的單位成本為9元,調查營運成本的單位成本為400元( c 9, ch 400 ),有關標準差、各層權重、各層平均年營運成本及標準差之母體資訊分別以前述樣本資料(s, n wi i , yi , si )取代。試求:(15分)n
⑴決定分層雙重抽樣的最佳抽樣設計(Optimum double sample plan),亦即求算 n、nh 。
⑵就⑴的抽樣設計求算平均年營運成本估計量(以十萬元為單位)的變異數。
(25 分)
參考架構・破題
本題是分層二重抽樣(double sampling for stratification):第一重n′=500取得層別權重w_h=n′_h/n′,第二重各層抽20%調查成本。(一)求ȳ_st與標準誤,(二)在成本函數C=c′n′+Σc_h n_h下求最適n′與n_h(Cochran最佳二重抽樣)。
完整答題架構與關鍵字:到站內看全文
- 4
欲了解2022年國內汽車銷售概況,就2000家汽車銷售業者進行調查,汽車銷售業者分為兩大類:國產型(I)及進口型(II) ,業者家數分別為 N1 =1500及 N 2 =500。抽樣方法採用分層隨機抽樣,依類別分層,從每一層分別隨機抽出10家業者進行調查。假設2021年(x)各類業者的年平均銷售量已知為: X 1 =220(輛); X 2 =140(輛)。調查結果20家業者在2021年(x)及2022年(y)的銷售量統計如下:樣本均數層別 比率 樣本共變異數 樣本標準差變數 yi , xi(h) ( Rˆh ) sxyh sh(輛)y 240 100 I 1.2 7200 x 200 80 y 180 60 II 1.8 2200 x 100 40合計 sy =110, sx =90, sxy =9000
(一)利用下列估計量估計年平均銷售量( Y )及該估計量的變異數: (15分)
⑴ y st ,分層隨機抽樣結合簡單均數估計量(mean per unit estimator)。
⑵ yRs ,分層隨機抽樣結合分開比率估計量(separate ratio estimator)。
⑶ y Rc ,分層隨機抽樣結合混合比率估計量(combined ratio estimator)。
(二)求算估計量 y st 、 yRs 、 y Rc 對單位均數估計量( y )之相對效率(relative efficiency),並說明那個估計量具有較佳精確度。(10分)
(25 分)
參考架構・破題
本題是分層隨機抽樣下,比較簡單均數、分開比率、混合比率三種估計量的精確度。作答重點是先算出各層權數與輔助變數已知的母體均數,再依公式逐一代入,最後用變異數比較相對效率。
完整答題架構與關鍵字:到站內看全文
111 年(考試時間 120 分鐘) 原卷 PDF
- 1
南興社區疑似爆發某流行病之群聚感染,為規劃後續防疫措施,亟需先行瞭解該社區染病人數。現有兩種檢測方法可用於檢測是否染病,檢測方法 A 可迅速得到結果,但其精確程度較不理想,而檢測方法 B 雖可提供相當精確之結果,但其所需檢驗程序繁複,若要爭取時效,僅能施測30 位。今先以方法 A 對該社區所有之 500 位居民進行檢測,驗得其陽性比例為 0.6,再以簡單隨機抽樣取出不放回之方式,由全社區之居民中選擇 30 位以方法 B 進行施測,驗得其陽性為 15 人,而這 30 位受測者以方法 A 施測之陽性人數為 13 人,且 30 人中有 26 位以方法 A 及方法B 檢驗之結果相同。請回答下列問題:
(一)若僅以方法 B 施測所得之結果推估本社區染病人數,請問其估計值及95%信賴區間為何?(5 分)
(二)是否可以整合兩種方法推估本社區染病人數?若您認為可以,請敘述您採用的推估方式、本社區染病人數推估值及其 95%信賴區間,同時請問在上述兩種推估方式中,您會採取那一種及您的理由。 (15 分)
(20 分)
參考架構・破題
本題是以便宜但不精確的方法 A(全體皆測)當輔助變數,搭配昂貴但精確的方法 B(只測 30 人),考雙重抽樣或比率、迴歸估計。先算只用 B 的簡單估計,再整合 A 的資訊,比較誰的信賴區間較窄。
完整答題架構與關鍵字:到站內看全文
- 2
在某大學所進行的某滿意度調查中,樣本為以簡單隨機抽樣取出不放回所選擇出的 n = 400 位大學部學生,該校大學部學生共 5000 名,400 位學生依其年級分類及各年級滿意樣本比例整理如下表:大一 大二 大三 大四樣本數( xi ) 200 100 50 50滿意比例( pi ) 0.4 0.8 0.8 0.8則全體學生滿意比例之不偏估計為 200 0.4 100 0.8 50 0.8 50 0.8 0.6
(一)根據註冊組提供之資料,該校大學部學生之各年級比例如下:大一 大二 大三 大四母體比例( Qi ) 0.3 0.3 0.2 0.2請檢定在 α = 0.05 之水準下樣本比例與母體比例是否相符(請參考下表之卡方分配 95%百分位數) 。(5 分)自由度 1 5 10 20 0.95 3.84 11.07 18.31 31.41
(二)根據子題(一)之結論,請問滿意度 0.6 的結果是否應加以修正?請敘明理由,若您認為需要修正,請提供修正後之母體比例。(10 分)
(15 分)
參考架構・破題
(一)是適合度卡方檢定:樣本年級結構與註冊組母體比例是否相符;(二)既然結構顯著不符(大一被過度代表、且大一滿意度最低),應以已知母體比例做事後分層加權修正滿意度。
完整答題架構與關鍵字:到站內看全文
- 3
金芒鄉是主要的芒果產區,鄉內農戶有專門種植芒果之專業果農,也有混種其他作物而僅部分種植芒果之農戶,專業芒果之農戶名冊可由農林漁牧業普查資料中獲得,但兼種芒果之農戶時有變動,無法經由普查資料中確認,惟為求精準推估金芒鄉本年度芒果產值,亦須將兼種芒果之農戶之芒果產值列入。在本鄉一共 500 戶農戶中,有 100 戶為專業種植芒果的農戶,而此 100 戶中,有 5 戶為大型農戶,95 戶為中小型農戶。本調查以下列方式選擇樣本農戶進行金芒鄉本年度之調查:5 戶大型專業芒果農戶全數加以調查。接下來在全金芒鄉之 11 個村中,以簡單隨機抽樣取出不放回之方式選擇其中 6 個村,每個樣本村中再以簡單隨機抽樣取出不放回之方式選擇 5 戶中小型專業芒果農戶,若該村中小型專業芒果農戶數不足或等於 5 戶,則該村中所有中小型專業芒果農戶全數加以調查。另外以簡單隨機抽樣取出不放回之方式在其餘農戶中選擇其中50 戶作為樣本戶。本調查各類農戶所得資料綜整如下:
⑴大型專業芒果農戶:平均值為 125 萬元,標準差為 20 萬元。
⑵中小型專業芒果農戶:6 個樣本村之資料如下:村別 文新村 文景村 文佑村 金河村 同億村 同欣村總戶數 16 4 3 12 2 13平均值(萬元) 30 25 30 25 20 30標準差(萬元) 5 10 6 5 8 8
⑶其餘農戶:50 戶樣本戶中,有 10 戶種植芒果,而這 10 戶之平均芒果產值為 12 萬元,標準差為 8 萬元。請回答下列問題(請以萬元為單位作答) :
(一)請提出兩種不同估計方式,推估金芒鄉中小型專業芒果農戶之年度芒果總產值,以及其相對應之變異數估計,並比較您提出之方法於本調查之適用性。(20 分)
(二)若以其他農戶之 50 戶樣本戶中,10 戶有兼種芒果之農戶的平均芒果產值 12 萬元,做為全體兼種芒果農戶之平均芒果產值推估值,請問其變異數估計值為何?(5 分)
(三)請推估金芒鄉兼種芒果農戶之年度芒果總產值,並提出其變異數估計值。(10 分)
(35 分)
參考架構・破題
中小型專業農戶是二階段集體抽樣(11村抽6村、村內抽≤5戶),可用「不偏估計」與「比率估計(以村內戶數M_i為輔助)」兩種方式;兼種農戶則是從其餘400戶SRS抽50戶,屬子母體(domain)估計,總產值要把未種芒果者視為0。
完整答題架構與關鍵字:到站內看全文
- 4
今有一母體,其中有三個單元,各單元編號 及其主要母體變量值如下表:1 2 3 7 5 3若要從該母體中選擇 2 個單元作為樣本,在不考慮抽樣順序及可重複選擇之情形下,共有 6 種可能之樣本組合,考慮一抽樣設計為每組樣本組合s i, j ,被選擇到之選擇機率為 p s i j / 24 ,例如樣本組合(2,3)之選擇機率為 5/24,(1,1)被選擇之機率為 2/24……等。請回答下列問題(建議以分數計算及作答):
(一) 請問 在本 抽樣 設計 下, 第 個 單 元被選 到之 包含 機率 ( Inclusion Probability)若為 i ,則 2 為何?(5 分)
(二)請問若以樣本平均 y y is i y作為母體平均 i 1 i 之估計量,則 y 在2 3本設計下推估 之偏誤(Bias)為何?(5 分)
(三) y 在本設計下之均方誤差(Mean square error;MSE)為何?(5 分)
(四)請就本設計提出一不偏估計量,請問您提出之估計量在樣本組合分別為(2,3)及(3,3)的情況下之估計值為何?並證明或以本母體為例驗證該估計量為不偏。(10 分)
(五)請試述您要如何評估您所提出之不偏估計與 y 在本設計下孰優孰劣?(不須計算實際數值)(5 分)
(30 分)
參考架構・破題
非等機率、可重複的抽樣設計:先列出六種樣本、選擇機率、各樣本的ȳ,即可算包含機率、偏誤與MSE;不偏估計量用Horvitz-Thompson(以包含機率π_i加權)。
完整答題架構與關鍵字:到站內看全文
110 年(考試時間 120 分鐘) 原卷 PDF
- 1
某人欲研析某地區街貓數目,將該地區劃分為四等份並編號 i=1, 2, 3, 4如下:1 2 3 4而其所採之抽樣設計分兩階段進行如下:
⑴首先隨機選擇一個區域並觀察該區域街貓數目(y )。
⑵若y > 10,則繼續觀察其相鄰之兩個區域作為樣本區域,否則若 y ≤ 10,則隨機選擇剩下未觀察之三個區域中的其中一個區域作為樣本區域。例如若第 1 個區域在第⑴階段被選,且y ≤ 10,則在其他第 2, 3, 4 等三個區域中再隨機選擇一個區域觀察,若y > 10,則繼續觀察第 2 及 3 個區域。注意:第 1 及第 4 個區域不相鄰,同理第 2 及第 3 個區域不相鄰。今假設該地區街貓實際分布如下:y =7 y = 13 y = 19 y =1請根據此抽樣設計及母體,回答下列問題: (每小題 5 分,共 20 分)
(一)若不考慮樣本出現順序,樣本組合為s = (2, 3)之機率為何?
(二)第 4 個區域之抽樣包含機率(inclusion probability)?
(三)若以觀察值之平均值,記為 y ,為母體平均之估計量,請問 y 之偏誤(bias)為何?
(四)請問 y 之均方誤差(mean square error)為何?
(20 分)
參考架構・破題
本題是適應性(adaptive)抽樣設計下的機率計算,不是一般簡單隨機抽樣。作答方式是把所有可能的樣本組合與出現機率列表,再由此推算包含機率、期望值與均方誤差。
完整答題架構與關鍵字:到站內看全文
- 2
某人於康寧鄉進行一項有關 110 年 6 月農牧業從業戶之生產成本及收入調查,該鄉共有 3 戶養豬場,10 戶養雞場,農業從業戶之戶數不詳,但由航空測量之空照圖可判明康寧鄉之農地面積為 300 公頃,而根據公務資料,康寧鄉 6 月之雞隻在養隻數為 10,000 隻。其抽樣設計如下:養豬場全選,養雞場及農業戶則分別以簡單隨機抽樣取出不放回之方式各選擇 4 戶養雞場及 10 戶農業戶,調查所得資料如下:養豬場:6 月平均在養豬頭數 500 750 200 6 月生產成本(萬元) 300 450 150養雞場:6 月平均在養雞隻數 500 1500 300 200 6 月生產成本(萬元) 35 120 15 30農業戶:耕地面積(公頃) 2 0.5 5 1 0.3 2 1.2 3 1 4 6 月生產成本(萬元) 2 6 6 1 5 5 2 3 5 5請回答下列問題:
(一)請以您認為合適的估計量推估康寧鄉養雞場平均 6 月每場之生產成本以及其 95%信賴區間,並說明使用該估計量之理由,並據以計算如果下年度想針對康寧鄉的養雞場再執行一次生產成本調查以推估該年度 6 月平均每場生產成本,並希望能將 95%最大抽樣誤差控制在 6 萬元以內,請問所需最小樣本數為何?(15 分)
(二)請問康寧鄉畜牧戶從業戶 6 月平均每場之生產成本以及其 95%信賴區間為何?(10 分)
(三)請以您認為合適的估計量推估康寧鄉 6 月總生產成本以及其 95%信賴區間,並說明使用該估計量之理由。 (10 分)
(四)請問康寧鄉 6 月農牧業總生產成本以及其 95%信賴區間為何?(5 分)
(40 分)
參考架構・破題
三類農牧戶分別處理:養豬場全查(無抽樣誤差)、養雞場已知全鄉雞隻總數10000可用比率估計、農業戶戶數未知但已知耕地300公頃,只能用比率估計推總數。各層獨立,總數與變異數相加即可。
完整答題架構與關鍵字:到站內看全文
- 3
龍江大學企業管理學系規劃於系館增設一性別友善廁所,事前先行對全系學生進行意願調查,調查方式是以簡單隨機抽樣取出不放回的方式於全系 240 位學生(其中有 200 位女學生及 40 位男學生)中,選擇 60 位學生作為調查樣本,並詢問其對增設性別友善廁所之意見。於 60 位樣本學生中,共有 24 位學生表示贊成。而 60 位樣本學生中有30 位男同學,30 位女同學,男同學中有 6 位表示贊成,女同學中則有18 位表示贊成。 (每小題 10 分,共 20 分)
(一)請以您認為合適的估計量推估龍江大學企業管理學系學生贊成增設性別友善廁所之比例及其 95%信賴區間,並說明採用此一估計量之理由。
(二)會計學系也想參考企業管理學系的經驗,規劃設立性別友善廁所並先對學生意見進行調查。系主任計劃分別由女同學及男同學中各以簡單隨機抽樣取出不放回的方式選擇若干同學,總計希望能由會計學系的250 位學生中選擇 100 位學生作為調查樣本。因為會計學系男女生比例為 4:6,因此系主任規劃男學生之樣本數為 40,而女學生之樣本數為 60。請問您是否認同此一樣本數配置,請說明您的理由,同時如果您不認同,請提出您認為較適當的樣本數配置。
(20 分)
參考架構・破題
本題的核心是:樣本中男女各 30 人,但母體男女為 40 比 200,樣本性別組成與母體不同,直接用樣本比例 24/60 會有偏。第(一)小題要用事後分層估計;第(二)小題是分層樣本數配置,比較比例配置與 Neyman 配置。
完整答題架構與關鍵字:到站內看全文
- 4
為推估三民市內之便利商店每日營業額以作為評估是否應該投入經營便利商店之參考,某人在三民市內總數為 50 間的便利商店中,以簡單隨機抽樣取出不放回的方式選擇了 10 間便利商店,並詢問其店長當日該店預估之營業額,同時並提供 200 元之禮券以答謝店長之合作。調查所得資料中,10 間樣本便利商店之日營業額資料如下: (樣本平均為 6 萬元,樣本變異數為 2.67(萬元) )商店編號 1 5 6 14 17 21 32 42 43 45日營業額5 3 6 6 6 7 8 4 7 8(萬元)某人又由上表的 10 間商店中,以簡單隨機抽樣取出不放回的方式選擇其中 5 間,請店長提供其當日營業報表之總結摘要,以記錄其實際日營業額,同時又額外提供 1000 元禮券給這 5 位店長作為答謝。其資料如下:商店編號 5 17 21 32 42報表摘要日營業額5 9 9 11 8(萬元)請回答下列問題:(每小題 10 分,共 20 分)
(一)請以適當之方式推估三民市之便利商店之平均日營業額及其 95%信賴區間。
(二)在這次調查中總共花費了 7,000 元購買禮券,請問若想再執行一次抽樣設計相同之調查,但將購買禮券之預算增加為 8,000 元,請問直接詢問店長日營業額及查閱營業報表之樣本數應如何配置為宜?
(20 分)
參考架構・破題
這是二重抽樣(double sampling)搭配比率(或迴歸)估計:第一重10店問店長「預估營業額」x(便宜),第二重從中抽5店查「報表實際營業額」y(昂貴),用x̄′校正ȳ;(二)則是在預算下求兩重樣本的最適配置。
完整答題架構與關鍵字:到站內看全文
109 年(考試時間 120 分鐘) 原卷 PDF
- 1
A渡假村管理高層想了解會員在渡假村的消費金額及對渡假村服務的滿意程度。已知A渡假村的會員人數為15000人,以重複系統抽樣法,自會員名冊中抽出10組「300取1」的系統樣本進行調查,得每位會員在渡假村的平均消費金額(以萬元計) ,及不滿意渡假村服務的人數資料如下表:組別 1 2 3 4 5 6 7 8 9 10平均消費金額 1.85 3.50 2.75 3.50 3.38 2.38 3.12 3.62 3.25 4.25不滿意人數 10 8 9 12 11 7 6 11 5 6
(一)估計每位會員到A渡假村的平均消費金額,並求算此平均消費金額的95%信賴區間。同時,利用此區間,判斷每位會員到A渡假村的平均消費金額是否顯著大於3萬元?(15分)
(二)估計不滿意A渡假村服務的會員總數及其95%誤差界限。(10分)
(25 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
衛生單位自甲城市12000位居民中,以簡單隨機抽樣法,抽出600位居民檢查其身高與體重,以了解甲城市居民的健康狀況。檢查結果顯示居民的平均體重為65公斤,標準差為9公斤;同時,根據身體質量指數BMI(Body Mass Index),判定其中210位的居民體重過重,174位的居民體重過輕。
(一)計算甲城市每位居民平均體重的95%誤差界限。(5分)
(二)求算甲城市居民體重過重比例與體重過輕比例之差的95%信賴區間,且依此區間判斷居民體重過重的比例是否高於體重過輕的比例。(10分)
(三)現衛生單位主管希望估計每位居民平均體重 的信賴度為95%且誤差界限為1公斤;同時,估計居民體重過重的比例p的信賴度為95%且誤差界限為0.03,請問目前調查600位足夠嗎?若不夠,需再增加多少位?(10分)
(25 分)
- 3
已知工廠有600位男性操作員及1400位女性操作員。為了解操作員的年齡結構,決定以性別為分層變數,利用分層隨機抽樣法自男、女操作員中共抽出200位調查,且各層樣本數使用比例配置法。調查結果為男操作員平均年齡40.5歲,標準差12.1歲;女操作員平均年齡32.2歲,標準差10.2歲。
(一)估計該工廠操作員的平均年齡 ,並求算此平均年齡的95%信賴區間。(10分)
(二)男性操作員的年齡差異是否比女性操作員的年齡差異大?(5分)
(三)估計男性操作員與女性操作員之平均年齡差,並求算此平均年齡差的95%信賴區間;且判別男、女操作員的平均年齡差是否有顯著大於6歲?(10分)
(25 分)
- 4
某大型連鎖超商共有100家分店。管理當局想了解員工對目前採行輪休制度的支持度,從100家分店中以簡單隨機抽樣法抽出15家分店,且對抽出之15家分店的所有員工進行調查,得資料如下表:分店 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15員工人數 55 62 60 95 65 70 80 105 45 88 76 40 85 64 60支持人數 25 30 50 65 42 50 48 50 30 55 60 25 63 46 54
(一)估計該連鎖超商員工支持目前輪休制度的總人數。 (5分)
(二)估計該連鎖超商員工支持目前輪休制度的比例,並求算此比例的95%信賴區間。依調查結果,該連鎖超商人資長宣稱,員工支持目前輪休制度的比例超過65%,請判斷人資長的宣稱是否正確。(15分)
(三)該連鎖超商的員工福利委員會認為目前的輪休制度對員工不公平,遂提出了修正版本。現欲估計員工支持此修正版的輪休制度的比例,應該抽取多少家分店進行調查,才能達到95%誤差界限為0.05的要求?(5分)
(25 分)
本題含圖表或公式,請對照原卷 PDF。
108 年(考試時間 120 分鐘) 原卷 PDF
- 1
臺灣地區有 525 家 IC 設計公司,其中有 5 家公司規模特大。為了估計臺灣地區 IC 設計產業的總員工人數 Y,除了將 5 家特大 IC 設計公司調查其員工人數得 y1 , y 2 ,…, y5 以外,另以簡單隨機抽樣法(不歸還)從剩餘的 520 家 IC 設計公司中抽出 20 家公司為樣本,調查其員工人數得y 6 , ..., y 25 。現欲採用下列兩種估計式以估計臺灣地區 IC 設計公司之總員工人數 Y:525 25 5 520 25 Yˆ1 = ∑ i y , Yˆ2 = ∑ i y + ∑ yi 25 i = 1 i =1 20 i = 6
(一)試證 Yˆ1 及 Yˆ2 是否皆為 Y 之不偏估計式。(6 分)
(二)請分別寫出 Yˆ1 及 Yˆ2 之均方誤差(Mean Square Error;MSE)的定義。(4 分)
(三)又已知 5 家特大 IC 設計公司員工總人數為 5,062,而其他 520 家 IC設計公司員工總人數為 60,320;其他 520 家 IC 設計公司之員工人數的平方和為 11,842,980。試利用上列資料求估計式 Yˆ1 及 Yˆ2 的均方誤差之值,並請說明估計 Y 時,那一個估計式較好?(4 分)
(14 分)
參考架構・破題
本題是「確定層(take-all stratum)+簡單隨機抽樣層」的總數估計。關鍵在於 Ŷ1 把 5 家特大公司當成一般樣本一起膨脹,會產生偏誤;Ŷ2 才是正確的分層估計式。用「不偏性+均方誤差=變異數+偏誤平方」比較兩者。
完整答題架構與關鍵字:到站內看全文
- 2
自來水公司想調查臺中市某區住戶在 108 年 1~3 月的用水情況,該區共有 N=20,000 戶,今以簡單隨機抽樣法調查了 n=800 戶,得到下列統計資料:y = 22.5 噸,s = 36 噸,有 320 戶用水總量超過了規定的用量標準。
(一)請估計該區住戶在 108 年 1~3 月的總用水量 Y 及其該估計之 95%的信賴區間。(6 分)
(二)請估計該區在 108 年 1~3 月的總用水量超過了規定的用量標準的住戶數 T。(6 分)
(三)又自來水公司想在 6 月份再做一次該區住戶用水總量的抽樣調查,若要求在 95%水準下估計的相對誤差不超過 10%,則應該抽多少樣本(戶)才能達到上述之要求?(6 分)
(18 分)
- 3
若一母體共分為三層,其中各層母體大小分別為 N1 =300, N 2 =600 與N 3 =100。根據過去的調查結果知道這三層的母體標準差分別為σ 1 =150,σ 2 =75 與σ 3 =100。
(一)若調查總預算(C)只有 20,000 元,又固定成本(c 0 )為 2,000 元,每一層調查單位成本均相同為 50 元,即c1 = c2 = c3 = 50 元,我們想以分層隨機抽樣法估計式 y st 估計母體平均數 μ ,試依紐曼配置(Neyman Allocation)法,求滿足要求之總樣本大小 n 及各層所需之樣本大小 ni (i = 1,2,3)分別為若干?(10 分)
(二)若我們想以分層隨機抽樣法估計式 y st 估計母體平均數 μ 的 95%的誤差界限不超過 B=20,試依紐曼配置法,求滿足要求之總樣本大小 n 及各層所需之樣本大小 ni (i = 1,2,3)分別為若干?(10 分)
(20 分)
- 4
某市轄區有 N = 250 個里,共有 M = 16,800 戶。今電力公司營業處想估計該市每戶裝置冷氣機之平均台數 μY,以簡單集體抽樣法自該市隨機抽出 10 個里進行調查,得如下調查資料:該里住戶裝 該里住戶裝里 戶數 里 戶數置冷氣機之 置冷氣機之(集體) ( M i ) (集體) (Mi)總台數(yi) 總台數(yi)1 150 480 6 120 216 2 72 252 7 50 240 3 80 440 8 100 230 4 90 162 9 71 213 5 125 200 10 42 252 10 10 10註 : 上 述 調 查 資 料 經 計 算 得 ∑Mi = 900 , ∑ M i2 = 91,514 , ∑ yi = 2,685 ,i =1 i =1 i =1 10 10 ∑ yi2 = 819,777 ,∑ M i y i = 251,551,在簡單集體抽樣法下,電力公司營i =1 i =1 ∑ yi業處利用 yC1 = 10i =1 , yC2 = N 1 ∑ yi , yC3 = 1 ∑ yi 等 3 個估計式10 10 ∑ Mi M n i =1 n i =1 i =1 yi(其中 yi = )來估計該市每戶裝置冷氣機之平均台數 μ Y 。則:Mi
(一)試以 yC1、 yC2 、 yC3 來估計該市每戶裝置冷氣機之平均台數 μ Y ,則 μY 估計值分別為何?(9 分)
(二)若以估計式 yC1估計 μ Y , 則該估計在 95%的信賴度下,其最大可能估計誤差界限 B 為何?(9 分)
(三)請根據上述調查資料,試分別求 yC1、 yC2 、 yC3 等 3 個估計式的估計變異數 V̂ ( y ci ), i = 1, 2,3 之值為何 ? 並請說明哪一個估計式在估計 μY 時有較好的估計效率?(6 分)
(24 分)
本題含圖表或公式,請對照原卷 PDF。
- 5
某市政府之行政區按區域別分為南區與北區,該市人事長想了解該市職工去年上半年(1~6 月份)與今年上半年(1~6 月份)因生病請假時數之變動比率,分別自南、北兩區各以簡單隨機抽樣抽出 100 名職工進行調查,得相關統計資料如下:職工總數 樣本數 去年上半 今年上半 去年上半 今年上半 去年與今年上區域別 ( N i )(人) ( ni )(人) 年樣本平 年樣本平 年樣本標 年樣本標 半年樣本相關均數( X i ) 均數( Yi ) 準差( S X i ) 準差( S Y i ) 係數 ( ρ̂ XY i ) 1(南區) 1,000 100 18.0 18.9 10.0 10.36 0.9841 2(北區) 1,500 100 7.5 4.8 5.45 3.50 0.5576其中:設 X i :去年上半年第 i 位職工因生病請假的時數;Yi :今年上半年第 i 位職工因生病請假的時數;X i :去年上半年因生病請假的樣本平均時數;Yi :今年上半年因生病請假的樣本平均時數;S Xi :去年上半年因生病請假時數的樣本標準差;SYi :今年上半年因生病請假時數的樣本標準差;ρ̂ XY i :去年與今年上半年因生病請假的時數的樣本相關係數。又已知去年上半年(1~6 月份)南區職工因生病請假的總時數τ X 1 = 16,300小時,北區職工因生病請假的總時數τ X 2 = 13,800 小時。根據上述資料:
(一)試估計該市南區職工去年上半年(1~6 月份)至今年上半年(1~6 月份)因生病請假的時數之變動比率 R 為何?又在 95%的信賴度下,其最大可能估計誤差界限 B 為何?(6 分)
(二)對於(一)之估計問題,若要求在 95%的信賴度下,其最大可能估計誤差界限 B 不超過 0.02,試問應抽出多少樣本才足夠?(6 分)
(三)試以比率估計(ratio estimation)估計該市南區職工今年上半年(1~6月份)因生病請假的平均時數 μY 1 及該市北區職工今年上半年(1~6 月份)因生病請假的平均時數 μ Y 2 。(6 分)
(四)若視上述調查資料為分兩層(南區及北區),利用分層隨機抽樣法調查所得,請你幫忙該市人事長用層別比率估計式( separate ratio estimator)估計該市 2,500 位職工今年上半年(1~6 月份)因生病請假的平均時數 μY 。又其在 95%的信賴度下,其最大可能估計誤差界限 B為何?(6 分)
(24 分)
本題含圖表或公式,請對照原卷 PDF。
107 年(考試時間 120 分鐘) 原卷 PDF
- 1
(一) 假 設 F = {u1 , u 2 , u3 , u 4 } 是 一 個 僅 僅 包 含 四 個 元 素 的 小 規 模 有 限 母 體 ( finite population),而四個元素的研究變數(study variable)值分別為 y1=1、y2=3、y3=3以及 y4=9。我們採用不置回的簡單隨機抽樣(simple random sampling without replacement)從母體 F 之中抽出樣本大小(sample size)為 n=2 的樣本組合,並以Y1, Y2 來表示此樣本組合中的兩個樣本數據(註:採用大寫英文字母 Y,表示樣本數據皆為隨機變數) 。試求 Y1 與 Y2 的聯合機率分佈(joint probability distribution)以及 Y1 與 Y2 的共變異數(covariance) 。(15 分)
(二)假設前一小題之中抽出樣本大小為 n=3 的樣本組合,並以 Y1 ,Y2,Y3 來表示此樣本組合中的三個樣本數據。試求 Y1 與 Y3 的共變異數。(5 分)
(20 分)
- 2
(一)假設某一個有限母體可被完整地切割為L個互不相交的層別(strata),其中第 h層之層大小(stratum size)為Nh,第 h層之第j個元素的研究變數值為yhj,h=1,…,L,j=1,2,…,Nh。母體大小(population size)、母體平均數(population mean)以及母體變異數(population variance)的數學式分別為母體大小: N = N1 + N2 + L + NL ;1 L Nh母體平均數: μ = ∑∑ yhj ;N h =1 j =1 1 L Nh母體變異數: σ = ∑∑ ( yhj − μ ) 。2 2 N h =1 j =1其次,母體中第 h 層之層平均數(stratum mean)以及層變異數(stratum variance)的數學式分別為1 Nh第 h 層之層平均數: μh = ∑ yhj ;Nh j =1 1 Nh第 h 層之層變異數: σ h2 = ∑ N h j =1 ( yhj − μh )2 。試證明下列等式:L L σ = ∑Whσ + ∑Wh ( μ h − μ )2 ,2 2 h h =1 h =1 Nh其中 Wh = 為第 h 層的層比重(stratum weight), h = 1,L , L 。(10 分)N
(二)使用分層隨機抽樣(stratified random sampling)之後,抽樣者應如何推估(未知其值的)母體平均數?需要什麼假設條件?請詳細說明。 (4 分)
(三)在使用分層隨機抽樣之前,抽樣者必須事先決定將要採用何種較為適當的配置,例如比例配置(proportional allocation)、尼門配置(Neyman allocation)。請詳細說明在使用事後分層(post-stratification)的方法之前,抽樣者是否也必須事先決定採用何種配置?(5 分)
(四)請詳細說明在什麼情況之下,抽樣者需要借助於雙重抽樣(double sampling)之方法,來進行分層隨機抽樣並推估母體的平均數(或是推估母體的其他參數)。(5 分)全一張(背面)
(24 分)
- 3
某水果商訂購了一卡車的椰子,並打算採用比值估計(ratio estimation)之方法來推估整輛卡車裝載所有的椰子如果全數被剖開之後的椰子汁總重量。該水果商採用不置回的簡單隨機抽樣之方法從整輛卡車的椰子之中抽出了 10 顆椰子。試說明該水果商應該如何利用被抽出的 10 顆椰子來取得樣本數據以及如何進行比值估計,並寫出點估計量的數學式。(15 分)
(15 分)
- 4
迴歸分析(regression analysis)課程中的最小平方估計量(least squares estimator),在抽 樣 方 法 的 理 論 中 有 何 可 用 之 處 ? 請詳細說明並寫 出 相 關 的 估 計 量 數 學 式 。(10 分)
(10 分)
參考架構・破題
最小平方法在抽樣理論中最主要的用途是「迴歸估計」:利用輔助變數與研究變數的線性關係,以樣本最小平方斜率調整樣本平均數,提升估計精確度;並可延伸到模型輔助估計與校準。
完整答題架構與關鍵字:到站內看全文
- 5
(一)某一間大學的學術部門打算採用二階段集群抽樣(two-stage cluster sampling)之方法來推估校內全體專任教師在前一個學年度的學術論文平均產量(亦即,推估任何一位專任教師在前一個學年度的學術論文平均發表篇數) ,並且將校內的每一個科系視為一個集群。試就比值估計(ratio estimation)以及不偏估計(unbiased estimation)兩種情況分別說明如何進行二階段集群抽樣以及如何推估,並寫出點估計量的數學式。(13 分)
(二)假設前一小題之中的學術部門打算改變為採用集群抽樣(cluster sampling)之方法來推估校內全體專任教師在前一個學年度的學術論文平均產量,並且依舊將校內的每一個科系視為一個集群。試就比值估計(ratio estimation)以及不偏估計(unbiased estimation)兩種情況分別說明如何進行集群抽樣以及如何推估,並寫出點估計量的數學式。 (13 分)[註] 集群抽樣又稱之為單階段集群抽樣(single-stage cluster sampling)
(26 分)
- 6
在什麼情況之下,使用系統抽樣(systematic sampling)之方法來推估母體的平均數,其推估之效果會優於使用簡單隨機抽樣的推估效果?請詳細說明。 (5 分)
(5 分)
106 年(考試時間 120 分鐘) 原卷 PDF
- 1
市政府為了解市民對於在市內開設新的公立托兒所的看法,以簡單隨機抽樣法抽出500位市民進行調查。根據調查結果得知:有260位反對在市內設立新的公立托兒所,有230位贊成在市內設立新的公立托兒所,其餘沒意見。根據調查結果,市政府宣稱超過半數的市民反對在市內開設新的公立托兒所。
(一)試估計市民反對在市內設立新的公立托兒所的比例;且在95%的信賴水準下,估計此次調查的誤差界限及說明是否同意市政府的宣稱。(15分)
(二)在95%的信賴水準下,說明反對在市內設立新的公立托兒所的比例是否顯著高於贊成在市內設立新的公立托兒所的比例?(10分)
(25 分)
- 2
大方文創商品公司共有 50 家分店,去年第 1 季的營業額為 3,950 萬元,為了解今年第 1 季的營運狀況,自 50 家分店中抽出 6 家分店調查,得各分店去年第 1 季的營業額( xi )及今年第 1 季的營業額( yi )如下:(單位:萬元)分店 1 2 3 4 5 6 xi 41 83 101 80 85 70 yi 63 121 97 110 83 101
(一)試估計大方文創商品公司今年的營業成長率。利用比率估計式(ratio estimator)估計公司今年第 1 季的營業額,並求算其標準誤。(10 分)
(二)試利用迴歸估計式(regression estimator)估計公司今年第 1 季的營業額,並求算其標準誤。(10 分)
(三)試說明並評估那種估計式較佳。 (5 分)全一張(背面)
(25 分)
本題含圖表或公式,請對照原卷 PDF。
- 3
甲工廠共有 15 部機器專門生產A產品,每部機器每天生產A產品的數量分別如下:120、90、270、300、450、150、180、100、310、260、220、190、160、250、140。品管部經理想要了解工廠每天生產出多少不良的A產品,欲自 15 部機器中抽出 3 部機器,再進行全面檢查。由於每部機器生產不良品的數量與每部機器的產能有高度的相關。因此,品管人員依照各機器的產能,採用依大小成比例的機率抽樣法(sampling with probabilities proportional to size, PPS)抽樣。
(一)請在使用亂數表隨機取得的數字為 2981、0607 及 2215 的情況下,詳細說明如何運用 PPS 抽樣法抽出 3 部機器為集群樣本。 (10 分)
(二)若抽出的機器分別為第 6、7 及 11 部,全面檢查後得知,其中不良品的個數分別如下:6、9 及 18。請估計工廠每天產出不良A產品的總數,並求其變異數。 (8 分)
(三)如(二)所述,請估計工廠每天產出不良 A 產品的比例,並求其 95%的誤差界限。 (7 分)
(25 分)
- 4
某休閒度假村有3處住宿區,分別是靠海岸的海景小屋、沿山坡的豪華小木屋及溫馨舒適大樓的精緻客房。其中海景小屋80間,豪華小木屋60間,以及精緻客房260間。現度假村經理想了解住宿客人對度假村提供的服務是否滿意,擬進行一項調查計畫。由於3處住宿區的位置及房價均有所差異,決定分區進行調查,調查費用因住宿區房間的距離不同而不同,豪華小木屋分布範圍最大,所以調查費用最高。已知每間海景小屋的調查費用為64元,每間豪華小木屋的調查費用為100元,而每間精緻客房的調查費用為36元。根據去年調查的結果得知,豪華小木屋區有60%的客人表示滿意,精緻客房區有80%的客人表示滿意,海景小屋今年才開始提供住宿服務,所以沒有資料可參考。
(一)若希望估計住宿客人滿意比例的信賴度為95%且誤差界限為0.05,則須調查多少間海景小屋、豪華小木屋及精緻客房?此時調查總費用為何?(15分)
(二)若調查總費用的預算為5,000元,則調查多少間海景小屋、豪華小木屋及精緻客房才能使住宿客人滿意比例之估計式的變異數最小。(10分)
(25 分)
參考架構・破題
本題是分層抽樣估計比例下的最適配置,考慮各層調查成本不同,配置 nh ∝ Nh√(phqh)/√ch;第一小題固定誤差界限求 n 與費用,第二小題固定預算求最小變異。
完整答題架構與關鍵字:到站內看全文
105 年(考試時間 120 分鐘) 原卷 PDF
- 1
解釋下列名詞:(每小題 5 分,共 10 分)
(一)抽樣誤差(Sampling Error)
(二)非抽樣誤差(Nonsampling Error)
(10 分)
- 2
請敘述簡單隨機抽樣與事後分層隨機抽樣的異同處。(10 分)
(10 分)
參考架構・破題
事後分層是先用簡單隨機抽樣抽出樣本,資料收集後才依輔助變數把樣本分層,再用已知的母體層權重加權估計。作答要先分別定義,再從「抽樣程序、各層樣本數、估計式、效率」列出相同與相異。
完整答題架構與關鍵字:到站內看全文
- 3
何謂隨機性母體(Random Population) 、順序性母體(Ordered Population)、週期性母體(Periodic Population)?(15 分)
(15 分)
- 4
依 105 年 6 月臺北市政府網站的最新戶口資料,臺北市共有 12 個行政區、456 個里,總計有 1,044,441 戶。一項主計處的研究是以住戶為抽樣單位的抽樣調查,預計抽出1,068 戶組成樣本。請設計三種合理的抽樣方式(簡單隨機抽樣、分層隨機抽樣、二階段抽樣),可使每戶有相同被抽出的機率。(30 分)
(30 分)
參考架構・破題
題目要求三種設計都滿足「每戶被抽中機率相同」,也就是自加權樣本,入選機率皆為 1,068/1,044,441。作答重點是寫清楚每種設計的抽樣底冊、步驟,以及證明入選機率相等。
完整答題架構與關鍵字:到站內看全文
- 5
某一廣告公司欲調查三個區域(N1 = 2,500 戶,N2 = 5,000 戶,N3 = 15,000 戶)住戶的薪資狀況。假設此一廣告公司想要估計這 22,500 戶每戶平均薪資的 95%信賴區間,且要求誤差的界限為 B = 300,Z = 2。又由過去的研究得知各區的母體住戶薪資的標準差為 σ1 = 4,500,σ2 = 6,000,σ3 = 9,000。若此一廣告公司是採取分層比例隨機抽樣法。
(一)請問此廣告公司應該抽取多少樣本?(5 分)
(二)這些樣本如何配置到這三個區域?(5 分)
(三)你覺得以分層比例隨機抽樣法抽樣是否合適?如果不合適,你會採取何種配置法?應該抽取多大之樣本?又如何將這些樣本配置到這三個區域?(10 分)
(20 分)
參考架構・破題
本題為分層抽樣估計母體平均數時的樣本數決定與配置,先用比例配置算 n,再判斷各層標準差差異大時應改用 Neyman 配置(最適配置,各層成本相同)。以 Scheaffer 教材公式、D=B²/4 計算。
完整答題架構與關鍵字:到站內看全文
- 6
某一個公司共有員工人數 300(M = 300)位,分佈在 30(N = 30)個部門,若想估計全公司員工請假天數的總和,先以簡單隨機抽樣法自此公司抽出 3(n = 3)個部門,之後又從此三個部門抽出一半員工做為樣本。若抽出的 3 個部門的每一個部門的人數分別為 M1 = 18、M2 = 36、M3 = 20,又各抽出一半員工,故 m1 = 9、m2 = 18、m3 = 10,其三個抽出部門樣本的平均請假天數為 y1 = 10 , y 2 = 15 , y3 = 12 ,及其樣本變異數為 s12 = 27 , s 22 = 24 , s32 = 20 。
(一)試求全公司員工請假天數總和的兩階段估計值。(5 分)
(二)試求全公司員工請假天數總和兩階段估計值標準誤的估計值。(10 分)
(15 分)
參考架構・破題
第一階段以 SRS 抽部門(群),第二階段在中選部門內以 SRS 抽一半員工,屬二階段集群抽樣。總和用不偏估計式 τ̂=(N/n)ΣMiȳi,變異數由「群間」與「群內」兩項組成。
完整答題架構與關鍵字:到站內看全文
104 年(考試時間 120 分鐘) 原卷 PDF
- 1
某消防局為了瞭解平均每天多少人打電話進來報案,於是隨機抽樣 30 天的電話紀錄並且得到下表:次數 0 1 2 3 4天數 15 10 4 0 1假設這是一個無限母體的問題,並且請根據上述表格回答以下的問題。
(一)如果該消防局想估計一年 365 天下來的總報案次數,請協助消防局提供這一項估計值。(5 分)
(二)請提供上述總報案次數之變異數的不偏估計值。(10 分)
(三)請提供總報案次數之近似的 95%信賴區間。(10 分)
(25 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
某校有 45 棵樹,為了方便管理,每一棵樹上都被貼上了一個編號,從「00」開始一直編到「44」。該校有一條榕樹大道,大道上的榕樹排列及它們的編號分別是04, 05, 07, 10, 15, 17, 19, 25, 27, 28, 29, 30, 31, 32, 37, 39。現在該校某一位求知若渴的學生希望引用「每 5 個取 1 個」的系統抽樣估計榕樹的比例。
(一)請提供所有「每 5 個取 1 個」之系統抽樣的樣本編號。(5 分)
(二)請提供題(一)所抽中之樣本榕樹比例的抽樣分配。(10 分)
(三)請證明樣本榕樹比例確實是真實榕樹比例的不偏估計量。(10 分)全一張(背面)
(25 分)
參考架構・破題
N=45、k=5,共有 5 組可能的系統樣本,每組 9 棵、被選中機率各 1/5。列出 5 組樣本、算出各組榕樹比例,就得到抽樣分配,再算期望值證明不偏。
完整答題架構與關鍵字:到站內看全文
- 3
以下資料為紐約與倫敦兩城市的日均溫紀錄(以華氏計):都市 紐約 倫敦 紐約 紐約 倫敦 紐約 紐約氣溫 48 54 52 47 57 54 49都市 倫敦 紐約 紐約 紐約 紐約 倫敦 紐約氣溫 59 53 50 52 57 55 54都市 倫敦 紐約 紐約 倫敦 紐約 紐約 倫敦氣溫 68 49 51 61 55 53 50請根據上述表格回答以下的問題。
(一)如果挑選一組「4 個單元」的「取後不放回」隨機樣本「48, 47, 57, 52」,請提供這一項抽樣設計之母體平均數的 95%信賴區間。(10 分)
(二)如果用地理位置把題意的母體切成「兩層」,然後每一層挑選一組「2 個單元」的「取後不放回」隨機樣本,「52, 57」來自紐約,以及「57, 55」來自倫敦,請提供這一項抽樣設計之母體平均數的 95%信賴區間。(10 分)
(三)計算「題(二)的抽樣設計」比上「題(一)的抽樣設計」的相對有效性。(5 分)
(25 分)
本題含圖表或公式,請對照原卷 PDF。
- 4
假設樣本來自某一個簡單隨機抽樣設計,而且樣本數與母體都夠大。已知以下三種母體平均數之估計量的變異數:1 N −n 2 (E1) Var (Y ) = σy n N −1 (E2) Var (Yratio ) = 1 N −n 2 n N −1 [ σ y + μ r2σ x2 − 2 μ r ρ xyσ xσ y ] (E3) Var (Yregression ) = 1 N −n n N −1 [ 1 − ρ xy ] σ y2其中 N 是母體規模(population size),n 是樣本規模(sample size),σ y2 是母體 Y的變異數, σ x2 是母體 X 的變異數, ρ xy 是母體 X 跟母體 Y 之間的相關係數,μ r = μ y / μ x 是母體 Y 的母體平均數除以母體 X 的母體平均數。請證明以下比例的正確性並且下結論:
(一)(E1) / (E3) ≥ 1。(10 分)
(二)(E2) / (E3) ≥ 1。(10 分)
(三)根據上述兩項結果,請問(E1),(E2)及(E3)那一種估計量可以被認為「比較好」。(5 分)
(25 分)
參考架構・破題
本題是大樣本下 SRS 平均數、比率估計與迴歸估計三者的效率比較。三個變異數都有共同因子 (1/n)(N−n)/(N−1),約掉後比較中括號內的式子,以代數證明 V(迴歸)為最小。
完整答題架構與關鍵字:到站內看全文
103 年(考試時間 120 分鐘) 原卷 PDF
- 1
假 定 有一 母體中 共有 N=3 個單 元 ,各 單元編 號 i 及 其母體 變 數值 (value of population variable of interest)yi 如下:i 1 2 3 yi 5 7 15今 以 一 取 出 放 回 之 設 計 D , 每 次 以 下 表 之 選 擇 機 率 ( draw-by-draw selection probability)選擇一個單元觀察後放回,再以同樣的選擇機率選擇下一個單元,共選擇 n=2 個樣本單元,選擇機率如下:i 1 2 3 P(i) 1/6 1/3 1/2試求設計 D 下第一個單元(i=1)之包含機率(inclusion probability),亦即以本設計選擇之一組樣本,其中包含第一個單元之機率。(5 分)若以觀察值樣本平均,記為 yn ,推估本母體平均 μ ,請問 yn 在設計 D 下是否為不偏估計?(5 分)請提出一個在設計 D 下, μ 的不偏估計量,請說明其何以不偏,並計算您提出的不偏估計在樣本 s=(1,3)時 μ 之估計值。(10 分)
(20 分)
本題含圖表或公式,請對照原卷 PDF。
- 2
在某鎮所進行的年度家庭醫療支出調查中,調查戶為以簡單隨機抽樣取出不放回(simple random sampling without replacement)在全鎮 10,000 戶中所選取之 1,000 戶樣本戶。調查結束後所得之家戶醫療支出樣本平均為 150 仟元。今欲進一步探討家戶收入在 50 仟元/月以下之低收入戶醫療支出概況,因無財稅資料可供查考,故僅能由樣本資料判定受訪戶是否為符合前述定義之低收入戶,但無法得知本鎮符合定義之低收入戶總戶數。檢視樣本資料後,符合此一定義之受訪戶共有 100 戶,而該 100 戶之年醫療支出總和為 8,000 仟元,另該 100 戶之年醫療支出平方和為 2×1012。(亦即若令 yi 為第 i 戶之 年 醫 療 支 出 , sd 為 樣 本 戶 中 之 低 收 入 戶 集 合 , 則 isd yi 8106 以 及isd yi2 21012 。)若以 80 仟元作為該鎮低收入戶之平均年醫療支出之估計量,請問該估計量是否為一不偏估計?並請說明理由或證明。(8 分)請估計 中估計量之 95%信賴區間,請以仟元為單位,並請四捨五入至小數點下第二位。(8 分)請問該鎮所有低收入戶之醫療總支出之不偏估計量為何?請以仟元為單位,並說明或證明該估計量之不偏性。(10 分)請估計 中估計量之 95%信賴區間,請以仟元為單位,並請四捨五入至整數位。(10 分)全一張(背面)
(36 分)
- 3
在某鎮所進行的家庭月支出調查中其主抽樣設計如下:依家戶所得將全鎮家戶分為高收入戶(家戶月收入 300 仟元以上之 100 戶),一般收入戶(家戶月收入 50 仟元至 299,999 元之 5,400 戶)及低收入戶(家戶月收入 49,999 元以下共 500 戶),然後在各類收入家戶中選擇欲觀察之樣本。在各類收入戶中再視需要以不同之抽樣設計選擇該類收入戶樣本戶,在各類家戶中之次抽樣設計及調查方法如下:高收入戶採全查面訪;月支出平均值為 200 仟元,月支出標準差為 30 仟元。一般收入戶中,因其戶數眾多,故先在全鎮 40 個里中隨機選擇 5 個里,而在各選擇的里中,再以簡單隨機抽樣取出不放回選擇若干里內樣本戶。低收入戶中以簡單隨機抽樣取出不放回選擇 200 戶面訪調查;另因低收入戶之支出狀況為調查重點之一,為求慎重起見,再由該 200 樣本戶中以簡單隨機抽樣取出不放回選擇其中 50 戶,而該 50 戶另加以記帳調查蒐集其當月支出資料。請問本調查中之主抽樣設計為何?同時請說明本調查採本設計之可能原因及優點。(8 分)在一般收入戶中調查資料如下:里內月支出樣本里編號 里內總戶數 里內樣本戶數平均(仟) 2 100 25 80 18 400 50 75 19 120 30 60 30 200 40 90 38 800 100 65請以比例估計(ratio estimation)推估一般收入戶之平均月支出,並請說明在此採比例估計之可能優點及其原因。(8 分)在低收入戶中若面訪戶之樣本為 s,其中記帳戶樣本為 s’ (s’為 s 之子集合),以下為樣本統計量(均以仟元為觀察單位):統計量 s s’面訪樣本平均 28 25記帳樣本平均 NA 30面訪樣本變異數 25 4記帳樣本變異數 NA 9另在 s’中記帳與面訪所得之月支出相關係數為 0.68,請問本類家戶中所使用的抽樣設計為何?並請以適當的方式推估低收入戶之家庭月支出平均。(8 分)請推估本鎮家戶月支出平均,並說明(不須計算)其估計量之變異數估計程序。(10 分)明年度的調查仍欲採類似方式進行,然而因經費所限,故高收入戶將改採簡單隨機抽樣取出不放回之抽樣調查以取代全查,但仍欲將該類母體平均之最大推估誤差在 95%之信心水準下,控制為 10 仟元以下,請問欲達此一精確度要求之所需最小樣本數。(10 分)
(44 分)
本題含圖表或公式,請對照原卷 PDF。
102 年(考試時間 120 分鐘) 原卷 PDF
- 1
某母體含有 5 個抽樣單位,單位編號分別為 A、B、C、D、E,其觀測值分別為0、3、3、9、12。若使用抽出不放回方式(without replacement)抽出 3 個抽樣單位。
(一)試求母體之 μ(population mean)及中位數 M(population median)。(5 分)
(二)對所有可能抽出之樣本組合,計算其 −y (sample mean)。− y (sample mean)是否為 μ(population mean)的不偏估計量?(10 分)
(三)對所有可能抽出之樣本組合,計算其 m(sample median)。m(sample median)是否為 M(population median)的不偏估計量?(10 分)
(25 分)
- 2
某電信公司為了解大學生使用智慧型手機狀況,特地調查某一大學學生使用智慧型手機比例,此一大學學生有 10,000 人。
(一)欲了解此一大學學生使用智慧型手機比例,在 95%的信賴水準下,誤差不出±3%的範圍,至少需隨機調查多少位學生?(5 分)
(二)使用簡單隨機抽樣法抽出 1,000 位學生,結果發現有 450 位有使用智慧型手機,試估計此一大學學生擁有智慧型手機人數的比例及其變異數?(10 分)
(三)如果事先知道此一大學各學院學生使用智慧型手機的比例不一樣,則可使用分層隨機抽樣法。設此一大學一共有三大學院,商學院占 30%,社會學院占 40%,其它學院占 30%。由其它大學調查經驗得知,約有 50%商學院學生使用智慧型手機,有 35%社會學院學生使用智慧型手機,其它學院學生則有 30%使用智慧型手機。設抽樣調查費用在三學院均相同。如欲調查此一大學學生使用智慧型手機比例,在95%信賴水準下,誤差不出±3%的範圍,至少須調查此一大學各學院多少位學生?(15 分)
(30 分)
參考架構・破題
本題涵蓋比例估計的三個典型問題:SRS 決定樣本數、SRS 估計比例與變異數、分層抽樣在成本相同時的 Neyman 配置。各小題先寫公式再代入,並說明採用的 z 值與有限母體校正。
完整答題架構與關鍵字:到站內看全文
- 3
甲百貨公司擬估計顧客在甲百貨公司中的平均購買金額。依據甲百貨公司過去的經驗,差不多平均每天有 10,000 個顧客會到甲百貨公司光顧。使用重複系統抽樣,抽出 10 個「500 取 1」的系統樣本。得到下列 10 個系統樣本的平均購買金額為 3,750、4,380、4,880、4,620、4,500、5,250、4,500、4,120、4,250、4,750(元)。試估計甲百貨公司顧客平均購買金額及其變異數?(10 分)
(10 分)
參考架構・破題
重複系統抽樣是以多個隨機起點抽出數組系統樣本,把每組平均數當成一個觀測值,就能用 SRS 的公式估計平均數與變異數,解決單一系統樣本無法估計變異數的問題。
完整答題架構與關鍵字:到站內看全文
- 4
工廠的品管人員想估計主機板上的零件不良品之平均個數。由於主機板上的零件數目不一,且零件不良品的個數與主機板上的零件數目有很大的正相關,故採用比例機率集體抽樣法。由 N = 10 的主機板群體中抽出 n = 4 的主機板樣本。這 10 個主機板(代號依序為 1 至 10)的零件數目分別是 10、12、22、8、16、24、9、10、8、31。然後使用隨機數字表,抽出的主機板號碼代號分別是 2、3、5 和 7,且發現他們的零件不良品的個數分別是 1、3、2、1。試估計平均一個主機板的零件不良品的個數及其變異數。(15 分)全一張(背面)類 科: 統計
(15 分)
參考架構・破題
以零件數 Mi 作為大小量度,採機率與大小成比例(PPS、抽出放回)的集群抽樣,用 Hansen–Hurwitz 估計式先估總不良數,再除以主機板數 N 得到每片平均不良數。
完整答題架構與關鍵字:到站內看全文
- 5
公司主管欲估計新進秘書打字的正確率。今交代此位秘書打一份報告,一共有 100 頁一般 A4 大小。
(一)如果以「頁」為抽樣單位(考慮一頁中可能全頁均有打字或沒有打滿整頁的情形),請問你會用何種抽樣方式來估計?(10 分)
(二)如果以「行」為抽樣單位,請問你會用何種抽樣方式來估計?(10 分)
(20 分)
參考架構・破題
打字正確率是「正確字數/總字數」的比率型母體參數。以頁為單位時,每頁字數不等,屬於「大小不等的群集」,要用群集抽樣搭配比率估計或 PPS;以行為單位時,行數多且容易編號,可直接用簡單隨機、系統或分層抽樣估計比例。作答時要寫清楚估計式、變異數估計與選擇的理由。
完整答題架構與關鍵字:到站內看全文
其他等別的「抽樣方法」
- 抽樣方法(地方特考三等)(39 題)
題目來源:考選部考畢試題查詢平臺(政府資訊公開資料);參考架構為本站自撰,僅供準備方向參考,非官方標準答案。最後更新:。