資訊系統與資訊檢索概要 申論題歷屆試題與參考架構
地方特考四等,民國 102~114 年共 12 份試卷、48 題,其中 48 題附參考答題架構。考這一科的類科:圖書資訊管理。本頁列出歷年全部題目,參考架構只列開頭的「破題」,完整的答題架構、關鍵字與作答提醒請到站內查看。
114 年(考試時間 90 分鐘) 原卷 PDF
- 1
Metadata 的 建 置 有 助 於 提 升 資 訊 檢 索 的 精 確 率 , 試 說 明 國 際 通 用Metadata 格式 Dublin Core 的 15 項核心元素和簡要著錄原則。 (25 分)
(25 分)
參考架構・破題
Metadata 是描述資源的結構化資料,Dublin Core(DC)以精簡、通用的 15 個核心元素描述各類數位資源,讓不同系統間能一致著錄、交換與檢索;欄位標準化、詞彙受控,可使檢索點明確而提升精確率。作答方向:先說明 DC 的定位,再逐一列出 15 項元素,最後說明簡要著錄原則。
完整答題架構與關鍵字:到站內看全文
- 2
試從使用者的角度,闡述您認為生成式 AI 的發展,將對資訊檢索技術及使用者行為造成何種影響?(25 分)
(25 分)
參考架構・破題
生成式 AI(如大型語言模型、對話式搜尋)讓檢索由「關鍵字找文件」走向「以自然語言直接得到答案」,使用者行為也從逐頁瀏覽轉為對話與追問。作答從使用者角度切入,正反並陳,並提出因應。
完整答題架構與關鍵字:到站內看全文
- 3
以下是一個典型的混淆矩陣(Confusion Matrix)判定為正類 P 判定為負類 N實際為正類 P TP(正確判定為正類) FN(誤判正類為負類)實際為負類 N FP(誤判負類為正類) TN(正確判定為負類)
(一)若將其應用於資訊檢索系統之成效評估時,試闡述其中的 TP、FP、FN、TN 所代表之意涵。(20 分)
(二) 假 設 TP=40 、 FP=10 、 FN=15 、 TN=35 , 試 問 資 訊 檢 索 之 查 準 率(Precision,又稱精確率)與查全率(Recall,又稱回收率)分別為多少?(5 分)
(25 分)
- 4
布林邏輯(Boolean Logic)常見的運算符號有 AND、OR、NOT,試說明此三者之意涵及其在資訊檢索上的應用為何?(25 分)
(25 分)
113 年(考試時間 90 分鐘) 原卷 PDF
- 1
圖書館常見的門禁認證系統有那些種類?每類系統的優點和缺點為何?(25 分)
(25 分)
參考架構・破題
圖書館門禁認證是辨識讀者身分、控管進出與使用權限的機制,依驗證因子可分為「所持之物」「所知之事」「本人特徵」等類型。作答逐類說明原理、優點、缺點,最後可提出多因子驗證的建議。
完整答題架構與關鍵字:到站內看全文
- 2
自然語言處理(Natural Language Processing, NLP)是資訊檢索系統中的應用之一。請說明 NLP 如何提高檢索準確率,並舉出兩個應用實例。(25 分)
(25 分)
參考架構・破題
自然語言處理(NLP)讓系統理解人類語言的詞彙、句法與語意,使檢索從字串比對走向語意理解,進而縮小使用者用語與文獻用語之間的落差,提高檢索準確率。作答說明技術機制,並舉兩個實例。
完整答題架構與關鍵字:到站內看全文
- 3
圖書館自動化管理可應用 RFID(Radio Frequency Identification)技術,何謂 RFID?RFID 的主要組成有那些部分?(25 分)
(25 分)
參考架構・破題
RFID 是利用無線電波自動辨識物件的技術,透過讀取標籤內的識別資料完成非接觸式辨識;在圖書館可用於自助借還、館藏盤點、防盜與排架。作答先定義,再說明組成,並補充圖書館應用。
完整答題架構與關鍵字:到站內看全文
- 4
請說明資訊安全的基本需求有那些?並說明資訊安全在圖書館有那些應用?(25 分)
(25 分)
112 年(考試時間 90 分鐘) 原卷 PDF
- 1
試說明主題分析及其重要性,以及進行主題分析時應注意的事項。(25 分)
(25 分)
參考架構・破題
主題分析(subject analysis)是圖書資訊組織的核心步驟,指檢視文獻內容,判斷其「談論什麼」,再將其轉換為索引或分類用的語詞與號碼,作為日後檢索的依據。作答宜先定義,再說明重要性,最後條列實務注意事項。
完整答題架構與關鍵字:到站內看全文
- 2
試說明布林邏輯(Boolean logic)檢索技巧及其缺點,以及如何使用權重(weight)來解決布林邏輯檢索結果沒有排序的缺點。 (25 分)
(25 分)
參考架構・破題
布林邏輯檢索以 AND、OR、NOT 組合檢索詞,判斷方式是「符合或不符合」,缺乏相關度概念。權重(weight)可為檢索詞或文件賦予重要性,使結果得以排序。作答依序說明技巧、缺點與權重的改善方式。
完整答題架構與關鍵字:到站內看全文
- 3
傳統上,進行文件檢索的評分時,採用的是 recall(查全率)與 precision(查準率),這是一種適用於無排序之檢索結果(non-ranked retrieved list)的評量尺度。然而,多數的資訊檢索系統的檢索結果都是排序的,這也符合使用者的期待,畢竟第 1 篇文件就是相關文件,與第 20 篇文件才是相關文件,對使用者而言,感覺是截然不同的。試說明並舉例資訊檢索的評價指標 MRR、MAP 和 NDCG。(25 分)
(25 分)
參考架構・破題
查全率與查準率適用於無排序的集合,但排序結果需要考慮相關文件出現的位置。MRR、MAP 與 NDCG 分別從第一個相關文件的位置、整體排序的平均精確度,以及分級相關度與位置折減三個角度評價排序品質。作答逐一定義、公式概念並舉例。
完整答題架構與關鍵字:到站內看全文
- 4
試說明人工智慧的研究領域及應用人工智慧於圖書館實務工作的資訊系統。(25 分)
(25 分)
參考架構・破題
人工智慧(AI)研究讓機器模擬人類的學習、推理、感知與語言等智慧行為;圖書館可在資訊組織、讀者服務與館務管理導入 AI。作答先列研究領域,再說明圖書館實務上的資訊系統與應用。
完整答題架構與關鍵字:到站內看全文
111 年(考試時間 90 分鐘) 原卷 PDF
- 1
檢索相關文件的指標,包括精確率(Precision rate)、回現率(Recall rate)與正確率(Accuracy rate)。請說明各指標的意義、計算方式與實務上判定可能的問題。(25 分)
(25 分)
參考架構・破題
檢索效能評估以「取回的結果是否相關」為核心。精確率衡量取回的文件中有多少是相關的,回現率(查全率)衡量相關文件中有多少被取回,正確率則是全體判斷中判對的比例。作答宜先建立四格分類(混淆矩陣),再逐一說明。
完整答題架構與關鍵字:到站內看全文
- 2
資料庫的鍵(key)是表格(table)中一個或一組欄位的集合,主要目的是區隔紀錄(record)的唯一性,或是作為表格關聯的依據。評估作為主鍵(Primary key)的評估原則為何?除了主鍵之外,還有那些鍵的類型?其意義為何?(25 分)
(25 分)
- 3
網頁使用者經驗(User eXperience, UX)應該進行那些層面的操作和執行設計?(25 分)
(25 分)
參考架構・破題
使用者經驗(UX)不只是介面外觀,而是使用者在使用網站前、中、後的整體感受。實務上最常被引用的是 Garrett 提出的「使用者經驗的要素」五個層面,由抽象到具體,作答可以此為骨架,再結合圖書館網站的例子。
完整答題架構與關鍵字:到站內看全文
- 4
機器學習(Marchine learning)可以提供推薦及資訊檢索的相關應用。機器學習的規則主要包含那三種方法(Learning methods),請分別說明之。(25 分)
(25 分)
參考架構・破題
機器學習依「是否有標準答案(標籤)可供學習」分成三大類:監督式學習、非監督式學習與強化學習。作答宜逐類說明定義、運作方式、常見演算法,並連結到推薦系統與資訊檢索的應用。
完整答題架構與關鍵字:到站內看全文
109 年(考試時間 90 分鐘) 原卷 PDF
- 1
請問在商業上常用的資料探勘與目前相當熱門的文字探勘應用,兩者有何異同之處?(25分)
(25 分)
參考架構・破題
資料探勘與文字探勘都屬於知識發現(KDD)的一環,目標都是從大量資料中找出隱含、有用的樣式;兩者最大的差別在處理的資料型態:前者以結構化資料為主,後者處理非結構化的自然語言文本,因此文字探勘多了一道「把文字轉成可計算特徵」的前處理。作答宜先定義、再分「相同」「相異」兩段比較,最後補應用實例。
完整答題架構與關鍵字:到站內看全文
- 2
試從檢索效益評估的角度分析資源與服務的取用性(accessibility,亦可翻為可及性)及使用性(usability)有何不同?(25分)
(25 分)
參考架構・破題
取用性(可及性)問的是「使用者能不能接觸到、取得到這項資源或服務」,使用性問的是「取得之後能不能有效、有效率、滿意地用它完成任務」。前者是使用的前提,後者是使用的品質;從檢索效益評估來看,兩者對應不同的評估面向與指標。
完整答題架構與關鍵字:到站內看全文
- 3
大數據分析為目前各行各業均視為極重要的技術,請問就你所知圖書館有那些大數據可以進行分析,你預期能做出何種分析結論作為決策依據。(25分)
(25 分)
參考架構・破題
圖書館本身就是資料密集的機構,流通、檢索、門禁、網站與電子資源使用都留下大量紀錄;本題要「列出資料來源」並「對應可得的分析結論與決策用途」,最好用「資料—分析方法—結論—決策」的對應方式作答,並交代隱私保護。
完整答題架構與關鍵字:到站內看全文
- 4
目前圖書館書籍編目是採中國圖書分類法,而博碩士論文是以院、系、所別進行歸類,請問這兩種分類方式有何差異?碩博士論文如果也比照書籍分類方式,試說明應如何實現。(25分)
(25 分)
參考架構・破題
中國圖書分類法是依「知識主題」把資源歸入一套層級化的學科分類體系;博碩士論文依院、系、所歸類,則是依「產出單位(行政組織)」歸類。前者利於跨單位的主題聚集,後者利於機構管理與成果展示。作答先比較差異,再提出讓論文也具主題分類的實作方案。
完整答題架構與關鍵字:到站內看全文
108 年(考試時間 90 分鐘) 原卷 PDF
- 1
請以資料、用戶、服務三個面向,說明數位圖書館(Digital Library)與網頁搜尋引擎(Web Search Engine)之差異。(25 分)
(25 分)
參考架構・破題
數位圖書館是有明確館藏政策、經組織整理並提供長期服務的數位資源集合;網頁搜尋引擎則是以爬蟲自動蒐集公開網頁、以排序演算法提供即時查找的工具。題目指定資料、用戶、服務三面向,照三大段比較,最後收斂兩者的互補關係。
完整答題架構與關鍵字:到站內看全文
- 2
當系統沒有要求使用者登入時,如何取得使用者查詢紀錄;若系統有要求使用者登入時,如何得知其之前的查詢條件?(25 分)
(25 分)
參考架構・破題
本題分兩種情境:未登入時只能靠伺服器端紀錄與瀏覽器端識別技術,追蹤到的是「工作階段或裝置」而非確定的「人」;登入後則可將查詢與帳號綁定,跨裝置、跨時間保存查詢歷史。作答依兩情境分段,最後補隱私與應用。
完整答題架構與關鍵字:到站內看全文
- 3
假設某機構有一萬筆文件資料,擬採購檢索系統,針對 A、B 兩套系統做成效評估的比較:針對查詢詞 T,已知有 5 筆相關文件,其中 A 系統回應有 10 筆資料,其第 1、3、9、10 筆為相關文件,而 B 系統回應有 6筆資料,其第 2、3、5 筆為相關文件。就查詢詞 T 而言,計算並比較說明其檢索成效。(25 分)
(25 分)
參考架構・破題
本題要計算精確率、回現率,並因為題目給了相關文件的名次,應加算考慮排序的指標(如平均精確率、R-精確率),再綜合判斷。結論是:只看集合指標兩套互有勝負,納入排序後 A 較能把相關文件排在前面但後段混雜,需依使用目的選擇。
完整答題架構與關鍵字:到站內看全文
- 4
在有 N 篇文長近似的文件(如 N 篇摘要,都約 300 詞)的全文檢索系統中,索引詞彙 T 在每一篇文件都有其權重。最簡單的詞彙權重設定方式是布林(Boolean)邏輯方式,亦即詞彙 T 出現在文件 D,則其權重為 1,若沒出現在文件 D 則其權重為 0。另一種詞彙權重設定方式為 TF x IDF,亦即:T 出現在 D 的次數(或是正規化後之詞頻,TF)「乘以」T 在 N篇文件中出現篇數的倒數(或是正規化後之文件篇數倒數,IDF) 。請說明並比較布林權重、TF、IDF 及 TF x IDF 等四種權重方式,對相關文件排序的影響。(25 分)
(25 分)
參考架構・破題
詞彙權重決定文件與查詢的相似度,進而決定排序。布林只看「有無」無法排序;TF 反映詞在單篇文件的重要性;IDF 反映詞在整個文件集的鑑別力;TF×IDF 兼顧兩者,是向量空間模型最常用的權重。作答逐一說明再做比較,並可用簡例說明。
完整答題架構與關鍵字:到站內看全文
107 年(考試時間 90 分鐘) 原卷 PDF
- 1
對於使用者而言,經常會以自己的方式,輸入查詢問句(Queries),例如,輸入「台灣傳奇」,卻希望能夠不管是簡寫「台」或是正體「臺」的相關資料都能夠檢索出來。請說明資訊檢索系統可如何滿足這樣的需求?(25 分)
(25 分)
參考架構・破題
使用者輸入的字形與資料庫中的字形不一致(台/臺、異體字、簡繁),會造成漏檢、回現率下降。系統可在建索引端與查詢端做字詞正規化與擴展,讓同義的不同寫法視為同一個檢索點,並兼顧精確率。
完整答題架構與關鍵字:到站內看全文
- 2
過去圖書館典藏實體資源,為提供使用者有效檢索,圖書館資訊系統索引大量的書目資料。隨著電子資源的快速增加,圖書館亦開始建構自有的數位化資源。請以服務提供者的角度,說明書目資料的檢索與全文資料的檢索在檢索功能的開發上可考量的因素為何?(25 分)
(25 分)
參考架構・破題
書目檢索處理的是結構化、精簡的詮釋資料,重點在欄位精確比對與權威控制;全文檢索處理的是大量、非結構化的內文,重點在全文索引、相關性排序與內文呈現。從服務提供者角度,要從資料特性、索引、檢索功能、結果呈現、系統效能與權利管理幾面比較開發考量。
完整答題架構與關鍵字:到站內看全文
- 3
大數據(Big Data)已經在眾多領域造成廣泛的影響,一些圖書館亦開始設置資料館員(Data Librarian)。對於圖書館而言,長期以來,除了書目資料,亦逐漸擴展服務範圍,因此資料的類型亦愈趨多元。請舉出書目資料之外的二種類型的資料,並說明應用這些資料,可能產生的影響。 (25 分)
(25 分)
參考架構・破題
大數據時代圖書館的角色從管理書目擴展到管理與服務各類資料,資料館員因此出現。本題要「舉兩種書目以外的資料」並「說明應用的影響」,建議選兩種性質不同的資料(例如研究資料、讀者使用資料),各自寫內容、應用方式與正負面影響。
完整答題架構與關鍵字:到站內看全文
- 4
資訊檢索的績效評估可以採用質性的評估與量化的評估,請分別各舉一例說明其評估方式。(25 分)
(25 分)
參考架構・破題
資訊檢索評估可分量化與質性兩種取向:量化以可計算的指標衡量系統表現(如精確率、回現率),質性則深入了解使用者的檢索過程、認知與感受。題目要求「各舉一例說明評估方式」,每例要寫清楚評估目的、步驟、資料蒐集與分析方法、優缺點。
完整答題架構與關鍵字:到站內看全文
106 年(考試時間 120 分鐘) 原卷 PDF
- 1
圖書資訊系統的互通性(interoperability)是達成整合檢索的重要機制。「開放檔案詮釋資料擷取協定(OAI-PMH)」是在圖書館界常運用的互通性方法之一。試論述OAI-PMH 的運作方式及其可能的應用。(25 分)
(25 分)
參考架構・破題
先說互通性是讓分散、異質的系統能交換與整合資料的能力。OAI-PMH 的做法是「詮釋資料擷取(harvesting)」,不是即時的分散式檢索:由服務提供者定期把各機構的詮釋資料收集回來,集中建索引後提供整合檢索。
完整答題架構與關鍵字:到站內看全文
- 2
請闡述「自動問答系統(Automatic Question-Answering System)」的功能與運作方式,其與一般「檢索引擎(Search Engine)」有何異同之處,並說明自動問答系統在圖書館服務上的應用。(25 分)
(25 分)
參考架構・破題
自動問答系統讓使用者用自然語言提問,系統直接回傳精確答案(或一小段答案),不是一串相關文件清單。本題要依序寫三件事:功能與運作流程、與搜尋引擎的異同、在圖書館的應用。
完整答題架構與關鍵字:到站內看全文
- 3
請以高級中學為場域,選定一小論文研究主題,說明在該主題下,如何運用資訊大六技能或稱六大教學法(Big Six),培養高中生資訊素養。(25 分)
(25 分)
參考架構・破題
Big6 是 Eisenberg 與 Berkowitz 提出的資訊問題解決模式,共六大步驟,各步驟再細分成兩個子項目。本題要先選定一個高中小論文的題目,再把六個步驟逐一對應到學生的實際操作與老師的教學設計。
完整答題架構與關鍵字:到站內看全文
- 4
請闡述大數據(Big Data)的四項特性(4V),並說明大數據在圖書館的應用。(25 分)
(25 分)
參考架構・破題
大數據是傳統工具難以處理的大量、快速、多樣的資料。題目要求的 4V 通常指 Volume、Velocity、Variety、Veracity(也有文獻把 Value 列入)。答題時先逐項解釋,再寫圖書館怎麼應用。
完整答題架構與關鍵字:到站內看全文
105 年(考試時間 120 分鐘) 原卷 PDF
- 1
在使用控制辭彙進行人工索引的書目資料庫(如 Medline)常有「延展查詢」(Explode)及「精準查詢」(Focus/Major)兩種進階檢索功能,試解釋這兩種功能的作用及其對查準率及查全率的影響。(25 分)
(25 分)
參考架構・破題
延展查詢與精準查詢都是控制詞彙(例如 MeSH)進階檢索的功能:前者沿著詞彙階層往下擴大查詢範圍,後者限定該主題必須是文獻的主要主題。兩者對查全率與查準率的影響方向剛好相反。
完整答題架構與關鍵字:到站內看全文
- 2
試詳述 R.S. Taylor 的資訊需求階段理論。(25 分)
(25 分)
參考架構・破題
Taylor 在 1960 年代研究圖書館的參考晤談(問題協商)時提出,資訊需求會從內心模糊的感覺,逐步發展成向系統提出的問題,共分四個層次。答題時要寫出四個層次的內涵,以及它們對參考服務與檢索系統的意義。
完整答題架構與關鍵字:到站內看全文
- 3
試從使用者、文件屬性、索引方法及排序方式等四個面向比較書目資料庫和網路搜尋引擎的異同。(25 分)
(25 分)
參考架構・破題
書目資料庫是收錄經過篩選、人工著錄的結構化書目紀錄,給特定學科的使用者使用;網路搜尋引擎則是自動爬取、全文索引的大量異質網頁,面向一般大眾。本題照題目指定的四個面向逐一比較,最後歸納異同。
完整答題架構與關鍵字:到站內看全文
- 4
試解釋互動式檢索(Interactive Information Retrieval)評估與傳統資訊檢索評估方式有何不同?(25 分)
(25 分)
參考架構・破題
傳統資訊檢索評估以 Cranfield 實驗典範為代表:用固定的測試集、查詢與相關判斷,計算查全率與查準率,評的是系統。互動式檢索評估則把使用者放進評估裡,看的是人與系統互動的整個過程與結果。答題時要從評估典範、相關判斷、指標、方法四方面對照。
完整答題架構與關鍵字:到站內看全文
104 年(考試時間 90 分鐘) 原卷 PDF
- 1
依據向量空間模式(Vector-Space Model)建構的資訊檢索系統,是將每一份文件表達為對應的文件向量,請說明如何建構文件的向量,解釋文件向量分量(Component of Vector)的意義,並討論如何產生每一個分量的數值。 (25 分)
(25 分)
參考架構・破題
向量空間模式把文件與查詢都表示成「索引詞空間」裡的向量,用向量之間的相似度(常用餘弦值)來排序。本題依序寫三件事:怎麼建構文件向量、分量代表什麼、分量的數值怎麼算出來。
完整答題架構與關鍵字:到站內看全文
- 2
許多資訊檢索系統在建構索引時,排除了停用詞(Stop Words),但是某些資訊檢索系統,並不排除停用詞。請先說明何謂停用詞,繼之討論排除停用詞與不排除停用詞的利弊得失。(25 分)
(25 分)
參考架構・破題
停用詞是出現頻率極高、但本身鑑別力很低的功能性詞彙。排除停用詞能節省空間、提高效率,但會犧牲片語與特定查詢的檢索能力。答題時要先定義,再雙向分析利弊,最後提出折衷做法。
完整答題架構與關鍵字:到站內看全文
- 3
在大數據(Big Data,亦稱為巨量資料)的風潮下,圖書館界亦關心研究資料的典藏、管理及使用,也就是近年備受關注的資料庋用(Data Curation)議題。圖書館若是提供資料庋用的服務,則必須建構資料庋用系統,並提供檢索功能,請討論研究資料的檢索與文件的檢索,在功能開發上,有何不同的考量。(25 分)
(25 分)
參考架構・破題
研究資料與文件在形式、詮釋需求、使用目的上都不同。文件檢索主要靠全文與主題比對;研究資料的檢索則必須依賴豐富的詮釋資料、資料格式與情境資訊,才能被找到、被理解、被重複使用。答題時先說明資料庋用與 FAIR 原則,再逐項比較功能開發的考量。
完整答題架構與關鍵字:到站內看全文
- 4
有一些資訊檢索系統提供同義處理、同音處理、近似處理或是詞幹處理(Stemming)後的檢索等,我們可以將前述的處理都視為是建構等價群集(Equivalence Class),例如相同意義的詞彙形成一個等價群集;發音相同的詞彙形成一個等價群集。請討論提供前述處理功能的檢索系統,對於檢索績效(Performance)的正面與負面的影響。(25 分)
(25 分)
參考架構・破題
把同義、同音、近似、詞幹處理都看成「等價群集」,意思是系統把群集裡的詞視為同一個檢索詞,等於自動擴展查詢。效果通常是查全率上升、查準率可能下降,實際影響要看群集建得準不準、以及使用者的需求。
完整答題架構與關鍵字:到站內看全文
103 年(考試時間 90 分鐘) 原卷 PDF
- 1
試說明搜尋引擎中採用的 Pagerank 排序的原理為何?相較於相關排序(relevance ranking),採用 Pagerank 排序的優點及缺點為何?(25 分)
(25 分)
參考架構・破題
PageRank 是依網頁間超連結結構計算網頁「權威性」的排序方法,與依查詢詞和文件內容相似度計分的相關排序(relevance ranking)屬於不同依據;作答先講原理,再從查詢相依與否、抗操弄性、時效性等面向比較優缺點。
完整答題架構與關鍵字:到站內看全文
- 2
請論述如何利用蒐集使用者的點擊行為(click behavior)來優化包括相關排序、索引系統及緩衝儲存等搜尋引擎的效能?(25 分)
(25 分)
參考架構・破題
點擊行為是使用者對搜尋結果的隱性回饋(implicit feedback),搜尋引擎可從查詢紀錄(query log)與點擊紀錄中,推知哪些文件相關、哪些查詢與文件常被存取,分別用於調整排序、索引設計與快取策略。
完整答題架構與關鍵字:到站內看全文
- 3
何謂分區組合檢索法(building block)?試說明若採用此一檢索法所獲得的資料量太多不夠準確,可以分別採取那些方法提升此一檢索法的資料檢索準確率(precision rate)?(25 分)
(25 分)
參考架構・破題
分區組合檢索法(building block)是將檢索主題拆成數個概念區塊,各區塊內同義詞以 OR 擴大,區塊之間以 AND 交集的檢索策略;結果太多不精確時,可從增加限制、縮小詞彙、改用欄位與位置運算等方式提高準確率。
完整答題架構與關鍵字:到站內看全文
- 4
試說明文件索引(document indexing)採用字元(character)、字(word)、片語(phrase)及概念(concept)等不同層次語彙進行索引(index),對於資訊檢索的準確率(precision rate)與召回率(recall rate)的影響為何?怎麼從文件中萃取出重要且能代表該文件的關鍵字,作為該文件的索引詞(index term)?(25 分)
(25 分)
參考架構・破題
索引語彙層次愈細(字元)愈能提高召回率但準確率低,層次愈高(片語、概念)愈能精確表達語意而提升準確率,但可能犧牲召回率;索引詞萃取則透過斷詞、停用詞處理、詞頻與權重計算等步驟選出代表性詞彙。
完整答題架構與關鍵字:到站內看全文
102 年(考試時間 90 分鐘) 原卷 PDF
- 1
近年來,網際網路搜尋引擎(Search Engine)紛紛提供影像或圖片的檢索,請討論影像檢索服務系統使用者介面的模式,亦即使用者可以用那些模式提出其檢索需求。(25 分)
(25 分)
參考架構・破題
影像檢索的使用者介面要讓使用者以各種方式表達視覺需求,大致可分為以文字描述的查詢、以影像內容特徵的查詢,以及以瀏覽互動逐步找尋的模式;作答宜依「文字式、內容式、瀏覽/互動式、混合式」分類說明,並評析各模式優缺點。
完整答題架構與關鍵字:到站內看全文
- 2
資訊檢索系統的索引檔案結構多使用倒置檔(Inverted File),請詳細說明倒置檔,並討論以倒置檔型式製作索引檔的優缺點。(25 分)
(25 分)
- 3
請比較文件檢索服務(Document Retrieval Service,例如 Google Search)與文件過濾服務(Document Filtering Service,例如 Google Alert)的異同。(25 分)
(25 分)
參考架構・破題
文件檢索與文件過濾都在比對使用者需求與文件,但檢索是「文件集相對固定、需求即時變動」的一次性查詢,過濾則是「需求長期固定、文件持續流入」的主動推送;作答應先界定兩者,再從多個面向列表比較異同。
完整答題架構與關鍵字:到站內看全文
- 4
一般而言,基於布林模式(Boolean Model)的資訊檢索系統無法提供排序的查詢結果(Ranked Search Result),但如果提供多欄位的布林查詢介面,而且賦予每個欄位不同的權重(Weight),則可以提供排序的查詢結果。請詳細討論賦予欄位權重的方式。(25 分)
(25 分)
參考架構・破題
傳統布林模式只判斷文件「符合或不符合」,無法排序;若將查詢拆成多個欄位並賦予權重,文件在越重要的欄位命中,得分越高,即可轉為排序結果。作答先說明原理與計分公式,再分述欄位權重的決定方式。
完整答題架構與關鍵字:到站內看全文
其他等別的「資訊系統與資訊檢索概要」
- 資訊系統與資訊檢索概要(普通考試)(56 題)
題目來源:考選部考畢試題查詢平臺(政府資訊公開資料);參考架構為本站自撰,僅供準備方向參考,非官方標準答案。最後更新:。