重點摘要

多數消費級 AI 助理以檢索增強生成作答:搜尋或檢索步驟先找到候選來源,模型再基於檢索到的內容撰寫答案,引述其中一部分來源。檢索偏好具體、結構良好、且在多個獨立來源中互相印證的內容——而非只是自稱有權威的內容。

生成答案背後的兩步過程

當 ChatGPT、Gemini 或 Perplexity 以即時資訊回答問題時,通常並非憶起訓練時記住的內容。它執行一個檢索步驟——網絡搜尋或對索引的查詢——取出一組候選文件,再基於檢索到的內容生成回應。這在文獻中被稱為檢索增強生成(retrieval-augmented generation,簡稱 RAG)(Lewis 等人,2020)。1 檢索到的文件決定最終答案中出現哪些事實與名字;生成步驟則決定如何措辭,以及引述檢索來源中的哪一部分。

檢索傾向於什麼

為何第三方來源的權重不成比例地高

從檢索系統的角度,機構自身的網站是利益相關方——它有明顯誘因把自己描述得好。目錄收錄、評論平台或獨立新聞報導沒有同樣的誘因,這是它們在 AI 助理實際回傳的引用清單中不成比例地出現的部分原因。在我們自己的香港診所與律師行研究中,目錄與收錄網站佔了引用的很大部分——整體而言,多於大多數單一機構網站。

實際的含意

以上任何一點都不能靠單一技巧利用。它意味著一組具體、並不花巧的優先事項:讓事實資訊(價格、地址、服務)在其出現的所有地方保持準確一致;確保機構出現在其類別與語言相關的目錄上,並正確收錄;把自有內容結構化,令檢索系統能擷取乾淨、具體的答案,而非要求它從市場營銷文字中推斷。

引用本頁

SimplyAI (2026). AI 如何選擇引用什麼來源. https://simplyai.work/zh-Hant/learn/how-llms-choose-citations/