頁面被找到、被擷取,亦被切成內容片段之後,仲唔代表 AI 會引用佢。以 OpenWebUI 嘅 RAG 流程嚟睇,系統會透過語意檢索取回少量相關片段,模型實際見到嘅係呢啲片段,而唔係完整頁面。即使某個頁面多次成為 reference,最後答案是否引用佢,仍然會受到模型生成結果影響。
AI SEO 唔可以只問「我嘅頁面有冇相關內容」。頁面被搜尋到、被擷取,亦被切成內容片段之後,系統仲要再做一次選擇:邊啲片段最接近今次查詢,值得放入模型上下文。
呢篇係 OpenWebUI 系列嘅第五篇。前一篇〈OpenWebUI 點樣切分內容:AI SEO 點解要理解字元密度〉分析內容點樣被切成片段。本文接住分析呢啲片段點樣被語意檢索選中,以及點解「成為 reference」唔等於「最後被引用」。
本文唔會深入拆解 embedding model、向量資料庫或 top-k 參數。呢篇嘅重點比較窄:喺 RAG 流程入面,模型最後見到嘅通常唔係完整頁面,而係被取回嘅內容片段。
語意檢索發生喺內容切分之後
內容被切成片段後,系統仲要判斷邊啲片段同查詢最接近。呢一步就係語意檢索。佢唔係返去完整網頁入面重新閱讀成篇文章,而係喺已經切分同儲存嘅內容片段中搵出相關結果。
喺 OpenWebUI 呢類 RAG 流程中,頁面內容會先被處理成可檢索嘅內容片段。當系統要回答問題時,會根據查詢取回相關片段,再將呢啲片段放入模型上下文。
因此,AI SEO 嘅 Relevance 階段唔係單純問「文章有冇答案」。更精準嘅問題係:真正能夠回答問題嘅內容片段,有冇被語意檢索選中?
如果答案喺完整文章入面存在,但冇進入被取回嘅片段集合,對模型嚟講,佢就等於冇出現喺今次回答嘅可用上下文入面。
AI 見到嘅係內容片段,唔係完整頁面
喺傳統 SEO 入面,內容團隊常用完整頁面嚟思考可見度:呢個 URL 有冇排名、呢篇文章有冇覆蓋主題、呢個頁面是否足夠完整。
但喺 RAG 流程入面,模型最後見到嘅通常唔係整篇文章,而係語意檢索選出嘅內容片段。呢啲片段可能嚟自同一頁,亦可能嚟自唔同頁面。模型生成答案時,係根據呢啲被放入上下文嘅片段,而唔係根據完整網站或完整文章。
呢點解釋咗點解「頁面有相關資訊」唔代表 AI 一定會使用佢。相關資訊必須被切成可用片段,並且喺語意檢索中被選中,先有機會進入模型上下文。
呢亦解釋咗點解同一個頁面可能喺某啲問題入面表現好,喺另一啲問題入面完全冇出現。因為每次查詢取回嘅內容片段可能唔同,進入上下文嘅材料亦唔同。
Reference 唔等於 Citation
分析 AI SEO 時,要分清楚 reference 同 citation。Reference 可以理解為進入模型上下文、可被模型使用嘅來源或片段。Citation 則係最後答案中顯示出嚟嘅可見引用。
兩者唔係同一件事。一個頁面可能因為其中某個內容片段被取回而成為 reference,但最後答案唔一定會顯示該頁面為 citation。模型可能使用咗片段入面嘅資訊但冇顯示引用,亦可能選擇引用其他更直接、更完整或更容易支撐答案嘅來源。
呢點對 AI SEO 診斷好重要。如果某個頁面成為 reference,但冇被引用,問題唔一定喺 Discovery,亦唔一定喺內容擷取或切分。佢可能已經通過前面嘅流程,只係喺最後 Citation 階段冇被選成可見來源。
所以,見到頁面冇出現喺 AI 答案嘅引用入面,唔應該即刻判斷佢完全冇被找到。更合理嘅拆解係:佢是否被搜尋到?是否被擷取?是否被切成內容片段?是否被語意檢索取回?最後是否被答案顯示為 citation?
點解同一頁面有時被引用,有時冇
AI 生成答案唔係固定模板。即使相同頁面多次進入上下文,模型每次生成答案時嘅措辭、重點同引用選擇都可能不同。
呢代表同一頁面即使多次成為 reference,亦未必每次都變成 visible citation。某次回答可能引用佢,另一次回答可能改引用其他來源,或者只使用片段資訊但冇將佢顯示成引用。
呢唔代表 reference 冇價值。能夠進入上下文,已經代表內容通過咗前面嘅搜尋、擷取、切分同語意檢索。但 citation 係後面嘅選擇,會受到答案生成、來源競爭、片段完整度同可驗證性影響。
呢類 citation failure 可以用其他方法改善,例如令片段更直接支撐答案、提高可驗證性、補足上下文或改善來源呈現。不過,呢已經係 Citation stage 嘅問題,唔係本文呢篇語意檢索分析嘅範圍。
結論:AI SEO 要區分 retrieved reference 同 visible citation
本系列前幾篇拆解嘅係 citation 發生前嘅中間流程。由查詢生成、頁面擷取、內容切分,到語意檢索,每一步都會決定邊啲內容有機會進入答案。
呢篇文章嘅重點係:進入上下文只係 citation 嘅前提,唔係 citation 嘅保證。模型實際見到嘅係被語意檢索取回嘅內容片段,而唔係完整頁面。即使頁面成為 reference,最後答案是否顯示 citation,仍然取決於生成結果同來源選擇。
因此,AI SEO 診斷要將 retrieved reference 同 visible citation 分開睇。前者說明內容有冇進入模型可用上下文。後者說明內容有冇成為最後答案中嘅可見來源。呢兩者之間嘅落差,正係後續 Citation stage 需要分析嘅問題。
References
- Open WebUI official website
- Open WebUI GitHub repository
- Open WebUI Environment Variable Configuration
- Open WebUI RAG documentation
常見問題
AI 引用時會讀完整頁面嗎?
通常唔係。以 OpenWebUI 嘅 RAG 流程嚟睇,模型最後見到嘅係被語意檢索選中嘅內容片段,而唔係完整頁面。
頁面成為 reference,點解唔一定被引用?
因為 reference 代表頁面或片段進入咗模型可用嘅上下文,但最後答案是否顯示引用,仍然取決於模型點樣生成答案,以及該片段是否足夠支撐輸出內容。