同樣係 1000 個字元,中文同英文代表嘅內容量唔一樣。例如 Artificial Intelligence 有 23 個 characters,人工智能只有 4 個字元。以 OpenWebUI 嘅預設 RAG 行為嚟睇,內容會先被切成片段,再進入後續語意檢索;如果一篇文章混合太多主題,被切出嘅片段亦可能帶入過多語意雜訊。

AI SEO 唔可以只睇整篇文章。頁面被搜尋到,亦成功被擷取成文字之後,系統通常仲要將內容切成較小嘅片段,再將呢啲片段交俾後續語意檢索。

呢篇係 OpenWebUI 系列嘅第四篇。上一篇〈AI SEO 點解唔只睇搜尋排名:從 OpenWebUI 睇網頁擷取與可存取性〉分析嘅係頁面能否被成功擷取;本文接住分析擷取成功之後,文字點樣被切成可檢索嘅內容片段。

本文嘅重點唔係提供段落寫作 checklist,亦唔係話所有 AI 搜尋平台都用同一種切分規則。真正要觀察嘅係:當一個系統用字元上限嚟切分內容時,不同語言會因為字元密度不同,產生不同嘅片段結果。

內容被擷取後,仲要被切成片段

內容切分發生喺頁面擷取之後。當網頁被轉成可處理文字,系統通常唔會直接將整篇文章原封不動交俾模型,而係先將文字拆成較小嘅內容片段。

呢會改變 AI SEO 嘅分析方式。傳統 SEO 常用整篇文章、整個 URL 或頁面主題嚟思考可見度;但喺 RAG 流程中,後續比較嘅通常唔係完整頁面,而係一段段被切出嚟嘅內容。

因此,內容切分唔係純粹嘅技術背景。佢會影響後面邊啲文字有機會被檢索、比較,最後被放入模型上下文。如果某段資訊被切散,或者同太多不相關內容合喺同一片段入面,後續 Relevance 判斷就可能受到影響。

呢唔係所有 RAG 系統嘅通用切分方式

OpenWebUI 嘅預設設定提供嘅係一個可觀察嘅切分樣本,唔係所有 RAG 系統嘅標準答案。不同 AI 搜尋平台、RAG 系統或文件處理流程,可能會用不同方式切分內容。

有啲系統會用 token-based chunking,即係用模型處理單位作為上限。有啲會用 semantic chunking,嘗試按語意邊界切分。亦有系統會考慮 Markdown、HTML heading、段落或文件結構,令切分結果更接近原本內容層次。

呢啲方法可能比單純 character-based chunking 更能保留完整語意。因此,本文唔會將 OpenWebUI 嘅字元切分方式寫成所有 AI 搜尋平台嘅通用規則。更準確嘅讀法係:佢係一個開源、可觀察嘅 character-based chunking 例子。

1000 characters 喺中文同英文入面唔係同一件事

OpenWebUI 嘅預設 CHUNK_SIZE=1000 計算嘅係 characters,即係字元。呢唔係 1000 個英文單字,亦唔係 1000 個 token。

對英文內容嚟講,1000 characters 通常大約係 150–180 words。呢個範圍大概只夠容納兩到三個短段落,或者一小段定義加上部分解釋。

對中文內容嚟講,1000 characters 就係約 1000 個中文字。中文常常可以用較少字元表達同一個概念。例如:

Artificial Intelligence = 23 characters
人工智能 = 4 characters

呢個差異會令同樣 1000 個字元,喺中文同英文入面代表不同內容量。英文可能只放得下一段簡短說明;中文則可能放入更多概念、條件、例子同轉折。

呢唔係話中文一定比較適合 AI SEO,而係話 character-based chunking 會放大語言之間嘅字元密度差異。當系統用字元作為切分上限時,中文內容片段可能比英文片段承載更多資訊,亦可能喺主題混雜時承載更多雜訊。

點解同一篇文章最好維持同一主題

字元密度真正帶嚟嘅問題,唔只係每個內容片段有幾大,而係片段入面可能混入幾多不同方向嘅資訊。當一篇文章只圍繞同一主題展開,即使被切成多個片段,每個片段亦比較容易保留相近嘅語意方向。

相反,如果同一篇文章同時處理多個不相關主題,內容片段就可能混合不同問題。呢種情況喺中文內容中特別值得注意,因為同樣字元數可以承載更多資訊,亦代表混合主題時可能帶入更多無關內容。

呢唔係話每篇文章只能回答一個狹窄問題,而係文章應該有清楚嘅主題邊界。同一篇文章可以有多個子題,但呢啲子題應該服務同一個核心問題。否則,切分後嘅內容片段可能難以對齊單一查詢意圖。

呢亦解釋咗點解 AI SEO 唔可以只睇頁面長度。長文章唔一定比較有利;如果長文章只係將多個不同主題放喺同一頁,切分後嘅內容片段反而可能更難被判斷為相關。

內容切分點樣影響 AI 引用漏斗

內容切分主要影響 Relevance。佢發生喺頁面被找到、成功擷取並轉成可處理文字之後。如果頁面冇被搜尋到,或者內容無法被擷取,問題仍然喺前面嘅 Discovery 階段。

當內容被切成片段後,後續語意檢索會判斷邊啲片段最接近查詢。如果片段本身聚焦、完整、語意方向清楚,就比較容易進入後續比較。如果片段混合太多主題,或者同時處理多個問題,就可能喺相關性判斷中變弱。

Citation 則發生喺更後面。即使一個片段被檢索出嚟,最後答案是否引用佢,仲要睇佢能否支撐答案入面嘅具體主張。因此,chunking 唔係 citation 嘅全部原因,但佢會影響邊啲內容有機會進入後面嘅 citation 選擇。

結論:重點唔係字數規則,而係語言密度同主題一致性

OpenWebUI 嘅內容切分流程,令我哋見到 AI SEO 嘅另一個中間層問題:內容被擷取之後,仲會被切成較小片段,再進入語意檢索。呢一步唔等於所有 AI 系統都相同,但佢提供咗一個清楚嘅 character-based chunking 樣本。

喺呢個樣本入面,1000 characters 對英文同中文代表不同內容量。Artificial Intelligence 有 23 個 characters,人工智能 只有 4 個字元。呢類差異累積起嚟,就會影響一個內容片段能夠放入幾多資訊。

因此,AI SEO 唔應該將內容切分理解成固定字數規則。更重要嘅係語言密度同主題一致性:同一篇文章最好圍繞同一個核心主題,令被切出嘅內容片段仍然能夠維持清楚方向。

下一篇會進入語意檢索。內容被切成片段後,系統仲要判斷邊啲片段同查詢最接近。嗰一步先會涉及 embedding model、語意相似度同 top-k 門檻。

References

常見問題

所有 AI 搜尋系統都用 character-based chunking 嗎?

唔係。OpenWebUI 嘅預設設定提供一個 character-based chunking 例子,但其他 RAG 系統可能使用 token-based、semantic-based 或 heading-aware chunking。不同切分方法會產生不同內容片段。

點解中文 AI SEO 要注意主題一致性?

中文通常可以用較少字元表達同一個概念。例如 Artificial Intelligence 有 23 個 characters,人工智能只有 4 個字元。如果文章同時混合太多主題,同一個內容片段亦可能包含更多不相關資訊,影響後續檢索同引用判斷。

下一篇

AI SEO 點解唔可以只睇關鍵字:從 OpenWebUI 睇查詢生成

繼續閱讀