資訊系統與資訊檢索 申論題歷屆試題與參考架構

地方特考三等,民國 102~114 年共 9 份試卷、36 題,其中 35 題附參考答題架構。考這一科的類科:圖書資訊管理。本頁列出歷年全部題目,參考架構只列開頭的「破題」,完整的答題架構、關鍵字與作答提醒請到站內查看。

▶ 看完整參考架構(資訊系統與資訊檢索)

114 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    資訊檢索(Information Retrieval, IR)系統的評估有許多指標,例如求準率(Precision rate)、求全率(Recall rate)、F-Measure。請列舉除了上述三項指標之外的五項資訊檢索系統評估指標,並申論之。(25 分)

    (25 分)

    參考架構・破題

    求準率、求全率與F值只反映相關與否的二元判斷。完整的評估還要看排序品質、使用者滿意度與效率,作答時挑五項並各說明定義、算法與適用情境。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    許多大學要求研究生在畢業之前必須將其學位論文上傳至論文比對系統進行比對,以避免有抄襲或剽竊的情況發生。請申論論文比對系統用了那些資訊檢索系統的概念,並闡述論文比對的相似性高是否就代表抄襲或剽竊。(25 分)

    (25 分)

    參考架構・破題

    論文比對系統本質上是文件相似度計算與檢索,可視為資訊檢索技術的應用;相似度高只是提醒人工查核的線索,不能直接等同抄襲。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    請申論資料視覺化(Data Visualization)在資訊計量(Infometrics)分析中所扮演的角色。(25 分)

    (25 分)

    參考架構・破題

    資訊計量學以量化方式分析文獻與資訊的產出、傳播與利用,資料視覺化把大量計量結果轉成圖形,讓研究結構與趨勢一目了然。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    請從「圖書分類」、「介面設計」、「搜尋輔助」 、「可及性與無障礙」、「館藏導引」等面向闡述目前圖書館館藏查詢系統在協助兒童讀者使用上常見的問題,並提出具體改善建議。(25 分)

    (25 分)

    參考架構・破題

    兒童在認知、閱讀能力與操作習慣上與成人不同,成人導向的館藏查詢系統(OPAC)往往讓兒童找不到書,答題時逐一就五個面向指出問題並提出改善建議。

    完整答題架構與關鍵字:到站內看全文

111 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    若要永久禁止您的網頁出現在 Google 搜尋結果中,有那些做法可以達成(至少列舉三種)?(20 分)

    (20 分)

    參考架構・破題

    要讓網頁永久不出現在Google搜尋結果,可從阻止收錄與要求移除兩個方向著手;不同做法對已收錄與未收錄頁面的效果不同,需並用。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    何謂敏捷軟體開發(agile software development)?試說明六類主要資訊系統及其應用。(30 分)

    (30 分)

    參考架構・破題

    敏捷開發是強調迭代、快速回饋與彈性應變的軟體開發方式;六類資訊系統則對應組織不同管理層級與功能的資訊需求。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    在資訊檢索評量中常用的求全率(recall rate)與求準率(precision rate)何者重要?試舉例說明。(20 分)

    (20 分)

    參考架構・破題

    求全率重在找得多,求準率重在找得準,兩者常呈反向關係;何者重要取決於使用者需求與檢索情境,沒有絕對答案。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    在求準率的重要性是求全率 2 倍的前提下,若以同一組多筆查詢資料測試,得到以下兩搜尋引擎的平均求全率與求準率資料,試說明應該選擇那一搜尋引擎?(未說明者不予計分)(30 分)搜尋引擎 A B求全率 0.4 0.9求準率 0.6 0.5

    (30 分)

110 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    國家發展委員會於 2017 年起推動政府網站導入 HTTPS 傳輸協定。

    (一)相較於 HTTP,請敘述 HTTPS 的三種優點。(15 分)

    (二)做為網站資訊系統的管理者,網站安裝好 SSL 憑證,從 HTTP 轉成HTTPS 傳輸協定後,還可以做那些動作,以提升被搜尋到、排序高的機會?(10 分)

    (25 分)

    參考架構・破題

    HTTPS是在HTTP之上加上TLS(早期稱SSL)加密的傳輸協定;安裝憑證後還須完成網站設定與搜尋引擎最佳化,才能提升被搜尋到與排序的機會。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    許多內容網站如 Youtube、Amazon、Facebook 等,都有自動推薦功能。

    (一)與資訊檢索方式比較,試述這些自動推薦功能對那一類型使用者,較有助益?(10 分)

    (二)自動推薦功能,可以依據那三種資訊,進行推薦服務?(15 分)

    (25 分)

    參考架構・破題

    推薦系統是主動推送資訊,與使用者主動下查詢式的檢索不同;作答時先比較兩者,再說明推薦所依據的資訊來源。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    某機關 A 為瞭解網路上使用者的評價,委託開發社交平台訊息意見分析系統 S。此系統 S 針對該機關 A 的訊息,從網路爬取下來後,對每則訊息做出正向、負向、中立意見的預測。為評估系統 S 的成效,機關 A 對S 產生的結果,由一位承辦人進行判斷,結果 100 則訊息中,該承辦人認為系統 S 預測正確的有 75 則。由於未達理想,系統 S 改進 3 個月後,再重新爬取網路訊息 100 則做預測,再交由同一名承辦人員判斷,這次該承辦人認為系統 S 預測正確的有 90 則。請問:

    (一)這樣評估系統成效的方式,有何重大缺點?(10 分)

    (二)從那些方面可以改進此種評價方式?(15 分)

    (25 分)

    參考架構・破題

    此評估方式只由單一人員判斷、且兩次樣本不同,缺乏客觀性與可比性,無法確認改善是否來自系統本身。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    何謂主題相關(topical relevance)?何謂使用者相關(user relevance)?請舉實例說明;並試述搜尋引擎為提升系統符合這兩種相關,其所可以採用的措施。(25 分)

    (25 分)

    參考架構・破題

    主題相關指文件內容與查詢主題相符,是客觀的系統相關;使用者相關則由使用者依自身需求、情境與知識判斷是否有用,兩者不一定一致。

    完整答題架構與關鍵字:到站內看全文

109 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    向量空間模型(Vector Space Model)使用特徵向量表達文件,從而將資訊檢索轉換為向量相似性比對。相似性的計算有許多可能的方案與考慮的面向,其中之一是採用原始向量內積(inner product) ,或是採用單位向量內積。請說明前述兩種計算相似性作法的優缺點。(25分)

    (25 分)

    參考架構・破題

    向量空間模型把查詢與文件都表示成詞項權重向量,相似度計算方式決定排序結果。原始內積直接累加對應維度權重乘積;單位向量內積先把向量長度正規化為 1,等同餘弦相似度(cosine similarity)。作答重點在「文件長度」對兩者的影響。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    近年來,數位人文(Digital Humanities)與數位學術(Digital Scholarship)逐漸影響學術圖書館的資訊服務,試說明數位人文與數位學術的異同,並說明可以開發(develop)或是部署(deploy)何種資訊系統,以支持數位人文或是數位學術服務。(25分)

    (25 分)

    參考架構・破題

    數位人文是運用數位工具與方法研究人文學問題的跨領域學門;數位學術則是更廣泛的概念,泛指以數位資源、工具與傳播方式進行的各學科學術活動。學術圖書館的角色是提供資料、工具、平台與專業支援。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    近年來越來越多的網站允許使用者使用於第三方註冊的 ID 登入,例如於 https://example.com/網站,使用 Google 的帳號或是 Facebook 的帳號登入。請分別由服務提供者(Service Provider)以及服務使用者(Service User)的角度說明採用這種第三方註冊 ID 登入方式的優缺點。(25分)

    (25 分)

    參考架構・破題

    第三方註冊 ID 登入即「社群登入/聯合身分認證」,由身分提供者(Identity Provider,如 Google、Facebook)驗證使用者,再把身分資訊傳給網站;技術上多採 OAuth 2.0 授權框架與 OpenID Connect 身分層。題目要求分兩個角度說明優缺點。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    互動式資訊檢索(Interactive Information Retrieval)行為可能會造成主題漂移(Topic Drift)的現象,請說明何謂主題漂移及造成主題漂移現象的原因。(25分)

    (25 分)

    參考架構・破題

    主題漂移是指檢索過程中,查詢或結果集的主題逐漸偏離使用者原始資訊需求的現象。互動式資訊檢索經多輪查詢修改、相關回饋與瀏覽,每一輪都可能把焦點帶往別處。作答要先定義,再從系統面與使用者面分析原因。

    完整答題架構與關鍵字:到站內看全文

108 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    何謂數位人文研究平台(Digital Humanities Research Platform)?資訊檢索功能如何輔助其使用者進行數位研究?(25 分)

    (25 分)

    參考架構・破題

    數位人文研究平台是整合數位化人文資料、分析工具與協作環境的線上系統,讓研究者能在同一平台上蒐集、檢索、分析、視覺化與分享研究成果。資訊檢索功能是平台的入口與基礎,決定研究者能否從大量文本中找到並組織研究材料。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    請說明基於文本的圖像檢索(Text-based Image Retrieval, TBIR)及基於內容的圖像檢索(Content-based Image Retrieval, CBIR),在技術原理上的差異為何?提供的影像查詢方法分別有那些不同型式?(25 分)

    (25 分)

    參考架構・破題

    圖像檢索有兩條路線:TBIR 依靠圖像周邊的文字(人工標引、檔名、說明文字)以文字比對檢索;CBIR 直接分析影像本身的視覺特徵(色彩、紋理、形狀)計算相似度。兩者差別在「用什麼代表圖像」以及「使用者用什麼提問」。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    何謂搜尋引擎優化(Search Engine Optimization, SEO)?圖書館網站如何藉此提升網站的自然搜尋結果排序?(25 分)

    (25 分)

    參考架構・破題

    SEO 是透過調整網站內容、結構與外部連結,讓網頁在搜尋引擎的自然(非付費)結果中排名更前面的作法。圖書館網站與館藏多藏在資料庫或動態頁面中,搜尋引擎不易收錄,做好 SEO 能讓使用者從 Google 直接找到館藏與服務。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    何謂索引典?建立索引典的方法為何?請舉例說明其建立步驟。(25 分)

    (25 分)

    參考架構・破題

    索引典(thesaurus)是一種控制詞彙工具,把某領域的概念以優選詞表示,並標出詞與詞之間的等同、階層與聯想關係,用來統一標引與檢索用語、提升查全率與查準率。作答需說明定義、建立方法,並以實例走一遍步驟。

    完整答題架構與關鍵字:到站內看全文

105 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    除了傳統的 Precision 及 Recall 之外,試舉出兩個適用於評估系統排序(Ranking)效能的新評估指標。(25 分)

    (25 分)

    參考架構・破題

    精確率與回收率以集合為基礎,不考慮結果的先後順序;但使用者多半只看前幾筆,因此需要能反映「相關文件是否排在前面」的排序評估指標。題目要求至少舉兩個,建議寫 MAP 與 nDCG,再補 MRR、P@k 作為延伸。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    Gerard Salton 提出以“Discrimination Value”來決定一個索引詞的重要性,並以TF(Term Frequency)* IDF(Inverse Document Frequency)來計算詞的權重。試解釋“Discrimination Value”的意義及 TF * IDF 的計算方式。(25 分)

    (25 分)

    參考架構・破題

    Salton 在向量空間模型研究中提出詞的「鑑別值」概念:一個好的索引詞應能把文件彼此區分開來。TF×IDF 則從詞在單篇文件中的頻率與在整個文件集中的分布兩方面計算權重,是鑑別概念的實用化。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    相較於資訊檢索系統,推薦系統更適用於何種資訊取用(Information Access)情境?請從資訊需求及文件的特性進行申論之。(25 分)

    (25 分)

    參考架構・破題

    資訊檢索系統屬「拉取式」(pull),使用者主動以查詢表達明確需求;推薦系統屬「推送式」(push),系統依使用者偏好與行為主動提供可能感興趣的項目。題目要從資訊需求與文件特性兩個面向比較,說明推薦系統更適合的情境。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    試解釋相關反饋的原理,並說明準相關反饋(Pseudo Relevance Feedback)及隱式相關反饋(Implicit Relevance Feedback)兩種取徑的不同。(25 分)

    (25 分)

    參考架構・破題

    相關回饋是讓使用者或系統針對初次檢索結果判斷相關與否,再據以修改查詢、重新檢索,以逼近真正需求的技術。依回饋來源可分明確(explicit)、擬相關(pseudo/blind)與隱式(implicit)三種。題目要求說明原理並比較後兩種取徑。

    完整答題架構與關鍵字:到站內看全文

104 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    早期稱為圖書館自動化系統的資訊系統,近年來已逐漸改稱為整合式圖書館管理系統(Integrated Library Management System, ILMS)。最近數年,雲端圖書館管理系統(Cloud Library Management System, CLMS)亦受到大眾的矚目,部分雲端圖書館管理系統供應商允許圖書館採購個別的功能模組(例如僅購買編目功能模組) ,因此便可能形成某些功能模組的分散運轉情形。請討論整合式圖書館管理系統與功能模組分散運轉模式的優缺點。(25 分)

    (25 分)

    參考架構・破題

    本題要比較「單一廠商、共用資料庫的整合式系統(ILMS)」與「雲端時代按模組採購、各模組分散在不同平台運轉」兩種模式。作答主軸是資料整合度、系統彈性、成本與維運責任的取捨,最後提出圖書館的選擇原則。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    一般而言,全文檢索系統會以全文內容,讓使用者進行檢索。然而,文件通常會分為數個區塊(Zone),以學術文件為例,可以區分為:題名、作者、單位、聯絡資訊、摘要、內文、參考文獻等部分。請討論一個不分區塊的檢索系統,以及一個分區塊的檢索系統,對於系統建置者與使用者而言,分別有何利弊得失,可以由成本面向與功能面向討論。(25 分)

    (25 分)

    參考架構・破題

    分區塊(zone/field)索引是在倒排索引中記錄詞彙出現在哪一區塊,使系統能做欄位限定檢索與區塊加權排序。作答要分「建置者」與「使用者」兩方,各從成本面與功能面比較不分區塊與分區塊系統。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    近年來,圖書館的編目實務漸漸引入 FRBR(Functional Requirements for Bibliographic Records)相關的精神,企圖建構圖書館館藏資源之間的關係,例如莎士比亞的馬克白劇本(實體書)與莎士比亞的馬克白舞台劇(DVD) 。請討論對於圖書館的 OPAC(Online Public Access Catalogue)模組或是最近備受重視的資源探索服務(Discovery Service)而言,如何將這樣的關係引入檢索系統,讓使用者在進行資訊檢索時,可以得到提供這種關係的好處。(25 分)

    (25 分)

    參考架構・破題

    FRBR 把書目世界分為作品、表現形、具體呈現、單件等實體並建立關係;檢索系統要把這些關係「做進索引與介面」,才能讓使用者一次看到同一作品的各種版本與相關作品。作答由概念、資料面、檢索與呈現面、效益與限制四層展開。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    資訊檢索的評估可由質性的面向切入,亦可由量化的面向切入。1960 年代的 Cranfield計畫開創量化的資訊檢索評估模式,1992 年啟動的 TREC(Text Retrieval Conference)基於 Cranfield 計畫,建構了現今大規模量化資訊檢索評估的模式,請說明並比較Cranfield 的資訊檢索評估模式與 TREC 的資訊檢索評估模式。(25 分)

    (25 分)

    參考架構・破題

    Cranfield 計畫建立了「測試集+相關判斷+評估指標」的實驗室評估典範;TREC 承襲此典範,但面對大規模文件改以 pooling 判斷相關、建立多項任務與社群共同評比。作答先分述兩者,再以表格比較。

    完整答題架構與關鍵字:到站內看全文

103 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    何謂隱含語義索引(latent semantic indexing, LSI)?相較於向量空間模型(vector space model),採用 LSI 進行資訊檢索的主要優點及缺點分別為何?(25 分)

    (25 分)

    參考架構・破題

    LSI 以奇異值分解(SVD)將詞—文件矩陣降維到潛在語意空間,讓同義詞與相關概念能互相匹配。作答先講原理,再對照向量空間模型說明它解決了什麼、又付出了什麼代價。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    網路檢索系統主要是由網頁搜爬(crawling)、網頁索引(indexing)、網頁檢索(querying),以及網頁排序(ranking)等四個子系統所組成,請說明這四個子系統分別負責那些功能?相較於傳統資訊檢索系統,網路檢索系統主要的挑戰為何?(25 分)

    (25 分)

    參考架構・破題

    網路搜尋引擎可拆為搜爬、索引、查詢處理、排序四個子系統;與傳統封閉文件集的檢索系統相比,網路的規模、動態性、異質性與惡意操弄帶來全新挑戰。作答先依序說明四個子系統,再列舉挑戰。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    試說明 TREC(Text REtrieval Conference)發展標準資訊檢索測試集的目的為何?TREC 中採用 Pooling Method 作為檢索結果「相關」判斷方法的原理與目的為何?(25 分)

    (25 分)

    參考架構・破題

    TREC 建立標準測試集,是為了讓不同系統能在相同文件、主題與相關判斷下公平比較;面對巨量文件無法逐篇判斷,便採 pooling 以有限人力取得近似完整的相關判斷。作答分兩部分:目的、pooling 的原理與目的。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    何謂情境資訊檢索(context information retrieval)?請舉三個考量的情境因素(context factor),並說明考量這些情境因素對於資訊檢索的意義為何?(25 分)

    (25 分)

    參考架構・破題

    情境資訊檢索強調檢索結果的相關性不只取決於查詢與文件的匹配,也取決於使用者是誰、在何時何地、為何而找。作答先界定概念,再舉三個情境因素並說明它們如何改變檢索。

    完整答題架構與關鍵字:到站內看全文

102 年(考試時間 120 分鐘) 原卷 PDF

  1. 1

    資訊檢索系統的績效(Performance)是研究者與使用者長期關注的議題,為了進行資訊檢索績效的量化評估(Quantitative Performance Evaluation),通常會使用標準測試集(Benchmarks 或是 Standard Test Collections),請詳細說明何謂標準測試集,並分別說明構成標準測試集的各個組成成分(Components)。(25 分)

    (25 分)

    參考架構・破題

    標準測試集是讓不同檢索系統在相同條件下量化比較的實驗基礎,源自 Cranfield 典範。作答先定義並說明其用途,再逐一說明構成要素,最後補充常見測試集與限制。

    完整答題架構與關鍵字:到站內看全文

  2. 2

    為了讓使用者可以在一個檢索介面,同時查詢不同來源的學術資源,過去圖書館多使用整合查詢(Federated Search)服務系統(例如 MetaLib、Muse);近年來圖書館則陸續啟用探索工具(Discovery Tools)服務系統(例如 Summon、Primo、EDS)。請由資訊檢索技術的觀點,討論前述二種資訊檢索服務系統的異同。(25 分)

    (25 分)

    參考架構・破題

    整合查詢與探索工具都提供「單一檢索框查多種資源」,但技術路線不同:前者是即時把查詢轉送到各資料庫再合併結果,後者是預先收割資料建成中央索引。作答從資訊檢索技術觀點比較架構、索引、排序、效能等面向。

    完整答題架構與關鍵字:到站內看全文

  3. 3

    英文資訊檢索系統是典型的以詞為索引單位(Word-based Indexing)的檢索系統,因為英文文件的詞彙之間有詞間標記(也就是空格)。然而,中文文件的詞彙之間並沒有詞間標記,因此就有不同於英文資訊檢索的考量,請說明中文資訊檢索系統可能的索引單位有那幾種?並討論使用不同類型索引單位的優缺點。(25 分)

    (25 分)

    參考架構・破題

    中文沒有詞間空格,索引單位只能在「字」「n 元字串」與「詞(需斷詞)」之間選擇,各自在回收率、精確率、索引大小與處理成本上有不同取捨。作答先列出索引單位,再逐一比較優缺點,最後提出混合策略。

    完整答題架構與關鍵字:到站內看全文

  4. 4

    Linked Open Data 的倡議,讓資訊系統可由檢索資料,進一步可理解資料。然而,Linked Open Data 是由 Open Data 而逐步成形的,Tim Berners-Lee 在 2010 年首先提出五星評等模式(Five Stars Model),請論述 Linked Open Data,再說明五星評等模式。(25 分)

    (25 分)

    參考架構・破題

    鏈結開放資料結合「開放授權」與「鏈結資料」技術,讓資料以 URI 識別、以 RDF 描述並彼此連結,機器得以理解與整合資料;Tim Berners-Lee 的五星評等則說明開放資料逐步走向鏈結資料的層級。作答分兩部分:先論述 LOD,再說明五星模式。

    完整答題架構與關鍵字:到站內看全文

其他等別的「資訊系統與資訊檢索」

題目來源:考選部考畢試題查詢平臺(政府資訊公開資料);參考架構為本站自撰,僅供準備方向參考,非官方標準答案。最後更新:。