NOTE
作者資訊 (Author Info)
在傳統的電腦搜尋中,如果文章裡寫的是「小明正在駕車」,而你在搜尋框輸入「開車」,傳統搜尋引擎因為死板的字面匹配,很可能會告訴你「找不到相關結果」。
然而,現代的大語言模型與 AI 搜尋,卻能瞬間明白「開車」、「駕車」、「駕駛汽車」甚至「運轉方向盤」講的是同一件事!
AI 到底是如何跨越字面的限制,真正理解文字背後的意思(語意)?這背後的秘密武器,就是 Embedding(向量嵌入) 與 高維語意空間地圖!
文字本身是人類的符號,電腦並不真正懂「蘋果」或「開心」是什麼感覺。電腦唯一能處理的,是數字。
Embedding(向量嵌入),就是一種將任何文字(一個字、一個詞、甚至整段文章),轉化為一長串數字座標(向量 Vector)的技術。
[0.82, 0.15, -0.44, ...][0.85, 0.18, -0.40, ...][-0.12, 0.95, 0.77, ...]你會發現,「蘋果」與「香蕉」的 GPS 座標非常接近!因為在 AI 的語意地圖中,它們都被劃分在「水果區」。
當你在 RAG(檢索增強生成)或知識庫中搜尋時,AI 會先把你的問題轉為 GPS 座標,然後在資料庫中尋找距離最近(幾何角度最接近)的段落。
強大的 Embedding 模型不僅能放繁體中文,還能把英文、日文、點字輸入放置在同一個空間中:
Embedding 空間具備極為驚人的數學結構。最著名的經典範例:
$$\text{向量("國王")} - \text{向量("男性")} + \text{向量("女性")} = \text{向量("女王")}$$
這證明了 AI 在向量空間中,確實掌握了概念與概念之間的抽象邏輯關係!
為了讓非理工背景的學員更容易理解,我們可以用「圖書館自動排序書架」來比喻 Embedding 在專案中的作用:
掌握了 Embedding 的概念,你就會明白:
👉 下一堂課:Lecture 03.7 模型註冊表與動態賽車引擎切換
在文本 Embedding 中,文章長度或詞頻會顯著拉長向量的模長(Length)。如果兩篇文章討論完全相同的無障礙主題,但一篇是 50 字短文,另一篇是 5000 字長文,它們的向量方向一致,但直線歐氏距離會非常遙遠。餘弦相似度只衡量兩個向量在空間中的方向夾角($\cos heta$),徹底排除了文章長度帶來的量值干擾。若將所有向量提前進行 $L_2$ 歸一化,餘弦相似度與歐氏距離在數學上將等價。
TreeInterceptor)時,為什麼跨語言向量空間常常出現對齊失效?跨語言向量對齊仰賴預訓練時在平行語料(Parallel Corpora,如中英雙語新聞)中的頻繁上下文共現。通用詞彙(如狗/Dog)有數百萬筆對照資料,空間對齊極度精確。但對於專業 NVDA API 或特定領域程式碼,繁體中文社群的討論資料極少,模型在訓練時無法建立足夠的映射橋樑,導致繁體中文「樹狀攔截器」與英文「TreeInterceptor」在向量空間中被扔到了遙遠的區域。這就是為什麼在專業 RAG 系統中,必須進行 Domain-specific Fine-tuning 或併用混合搜尋 (Hybrid Search = 向量 + 關鍵字 BM25)。