📜 古代大藏經與開卷考試:解密 RAG 向量檢索與工作區規則

NOTE作者資訊 (Author Info)

走進古代大藏經閣,密密麻麻的經書聖卷高聳入雲,儲存著數千年來的無上智慧。

如果今天有一位狀元郎要參加朝廷的終極大考,考題是「請問大藏經第三千七百卷第十二頁寫了哪三條律法?」 如果強迫狀元郎閉卷應試,只憑他腦中的記憶硬背,狀元郎為了不交白卷,極可能在考卷上洋洋灑灑編造出聽起來頭頭是道、實則完全不存在的虛假律法。

這正是一切人工智慧盲點的縮影——機率幻覺(Hallucination)

今天,我們就從史詩級的 AI 翻車現場出發,深入大藏經閣的向量空間,解密 RAG(檢索增強生成 / Retrieval-Augmented Generation) 開卷考試機制與工作區家規標籤!


⚠️ 藏經閣翻車史冊:加拿大航空、紐約律師與海灘幻覺三案

為了讓大家徹底意識到 AI 幻覺的恐怖破壞力,我們先來審視載入史冊的三大史詩級 AI 烏龍翻車現場:


🔮 大腦迷幻與真理錨定:為什麼單靠對齊無法消除機率幻覺

為什麼強大的 AI 會如此一本正經地胡說八道?

這背後的數學真相是:大語言模型的大腦內,根本沒有「真實」與「謊言」的概念! 大腦本質上是一個根據上下文概率計算「下一個 Token 最佳選擇」的統計機器。當使用者詢問一個大腦記憶庫中沒有精確記載的問題時,為了維持語句的流暢度與完整性,自注意力機制會挑選機率最高、聽起來最像標準答案的詞彙進行接龍。

我們來看看,黃金鄉馬哈特比喻: 這就像是故事中黃金鄉的七崩賢魔族賢者馬哈特。馬哈特戴上了「誓約手環」,只要對人類起「惡意」就會當場死亡。然而馬哈特卻親手將整座城市與無數人類變成了黃金雕像,手環卻完全沒有發動警報。因為在魔族的認知結構中,根本就沒有人類所謂「惡意」與「慈悲」的概念! 同理,大語言模型的機率矩陣中也沒有「客觀事實」的概念。因此,光靠道德對齊(系統提示詞),是無法完全杜絕幻覺的。我們必須使用 RAG(檢索增強生成),在 AI 答題前硬生生把真實的參考文獻呈現在它面前,將其強行錨定在事實之上!


🔍 到底什麼是 RAG (檢索增強生成)?

為了讓大家徹底理解,我們來看看以下兩個有趣的雙軌比喻:

🍱 雙軌比喻一:生活版 ——「金牌大廚的客製化新食譜」

想像你是一位在米其林餐廳工作的金牌大廚(大語言模型): * 閉卷考試(沒有 RAG):一位客人突然點了一道「昨天剛在網路上流行起來的威靈頓舒芙蕾」。你雖然廚藝精湛,但大腦的記憶體(Pre-trained weights)裡根本沒有這道新菜的食譜。為了不砸招牌,你只能憑著以前做舒芙蕾的經驗「憑空捏造」一個做法(幻覺),結果做出來完全不是客人要的東西。 * RAG 架構(開卷考試):當客人點了這道新菜,你的二廚(檢索系統)立刻用 iPad 上網搜尋,在 1 秒內印出這道新菜的精確食譜,翻到食材配方那一頁,用磁鐵貼在你的爐灶正前方(增強)。你這位金牌大廚低頭看著這張食譜小抄,用你爐火純青的刀工與火候掌控(生成能力),完美端出這道客製化料理。你不需要重新去廚藝學校進修(Fine-Tuning),二廚貼的小抄就解決了問題!

🎮 雙軌比喻二:動漫版 ——「寶可夢訓練家與精靈圖鑑」

想像你是一位正在草叢裡冒險的寶可夢訓練家(大語言模型): * 傳統模型(沒有 RAG):你雖然在學校學過很多寶可夢知識,但世界上的寶可夢品種成千上萬,而且還在不斷更新。一隻從未見過的神祕寶可夢突然跳出來擋路,你只能憑感覺猜測:「這隻紅色的看起來會噴火,應該是火屬性吧!」(這就是幻覺,可能牠其實是超能力屬性),結果派錯寶可夢導致慘敗。 * RAG 架構:當神祕寶可夢出現時,你立刻拿起手邊的「精靈圖鑑」(RAG 檢索器)對準牠。圖鑑的鏡頭捕捉到畫面,並快速在資料庫中比對(檢索),發出嗶嗶聲顯示:「這是新發現的鋼屬性寶可夢,弱點是火」(增強)。你看了看圖鑑的即時回饋,大喊:「去吧!噴火龍,使用噴射火焰!」(生成)。圖鑑這部小抄,讓你在戰鬥中立於不敗之地!


📐 幾何向量天秤:歐氏距離、Cosine 夾角餘弦與點積運算

RAG 的核心靈魂,是將文字轉化為高維幾何空間中的數學向量(Vector Embeddings)。在 agy 中,RAG 的運作包含三大步驟:

  1. 切塊與向量化 (Chunking & Embedding): 系統將你的長篇開發說明書或原始碼切成一小段一小段的文字塊(Chunks),並透過 Embedding 模型(如 text-embedding-3),將文字轉化為包含 1536 個浮點數的高維幾何向量。在這個高維空間中,語意相近的段落(如「資料庫連線逾時」與「DB Connection Timeout」)會被分配在極為接近的幾何座標上。
  2. 語意相似度檢索 (Vector Retrieval): 當你向大副提問:「如何設定 SQL 密碼?」時,大副會將你的提問也轉化為 1536 維的向量,並在大藏經空間中進行幾何距離比對,秒速找出關聯度最高的文字塊。
  3. 增強生成 (Augmented Generation): 大副把檢索出來的真實資料段落,作為「考試便條紙」直接貼進 Prompt 中對大腦說:「請嚴格根據以下參考資料回答問題。」大腦看著證據說話,幻覺機率瞬間歸零!

電腦是如何計算兩句話「意思很接近」的呢?這牽涉到高維空間的三大幾何算法:


📖 藏書閣小抄 vs 洗腦手術:RAG 開卷考試對決模型 Fine-Tuning

許多開發者常問:「老師,如果我想讓 AI 學會我們公司的私有業務知識,我到底該用 RAG(檢索增強生成),還是該做 Fine-Tuning(模型微調)?」

我們透過「開卷考試」與「大腦手術」來做深度對比:

結論:對於絕大多數專案開發與知識庫檢索,RAG 是最實用、最便宜且效果最立竿見影的黃金方案!


🏷️ 聖旨便條紙與樂高重構:.agents/ 目錄、AGENTS.md 家規與跨目錄掃描

agy 的世界中,為了讓大副在進入你的專案時自動遵守專案規範,系統提供了強大的工作區專屬客製化機制(Workspace Customizations)


藏經閣歸位與下一站預告

現在,我們的大副已經裝備了 RAG 向量雷達與工作區聖旨便條紙。它不再是一個會閉眼胡扯的聊天機器人,而是一位手握實體文獻、看著證據說話的頂尖工程師!

但是,身為最高指揮官,我們該如何撰寫出最精準的指令派工單?如何利用論文證實的「情緒勒索法」與「無禮貌原則」讓大腦的智力暴增?

下一堂課,我們將踏入總裁辦公室,解密 Prompt Engineering 的終極派工心法!


👉 下一堂課:Lecture 06.5 總裁派工心法與指揮藝術:提示詞工程(Prompt Engineering)終極指南 👉 回課程大綱:學習地圖

🔥 專家級深度思考與實戰挑戰 (Expert Challenge)

以下題目專為尋求真正硬核觀念與專家級實戰能力的學員設計。題目無法從講義表面抄寫解答,請嘗試獨立思考後再點擊展開解析。

❓ 挑戰 1:RAG(檢索增強生成)三步驟中的 Chunking(切片)策略死穴 👉 點擊展開專家解析答案

【實戰情境問題】:在對講義進行 RAG 向量化時,如果切片長度(Chunk Size)設得太小(如 50 字),或設得太大(如 5000 字),會分別引發什麼「檢索斷章取義」與「注意力雜訊過載」問題?

【鑑別點說明】:考驗學員對 RAG 前處理(Document Chunking Strategy)與語意完整性的實戰調優經驗。

【專家級解答與深度剖析】: * **Chunk Size 太小 (50字)**:句子會被硬生生切斷,遺失完整的上下文語意(例如將條件句「如果...則...」切在兩半),導致向量檢索時抓到的卡片資訊不完整,引發斷章取義。 * **Chunk Size 太大 (5000字)**:單個 Chunk 包含過多無關話題,稀釋了核心關鍵字的向量特徵,且會將大量無關雜訊塞進 LLM 的 Context Window,誘發 Lost in the Middle 遺忘現象。 最佳實踐:採用 Overlapping Chunking(如 500 字 Chunk + 100 字重疊),或 Parent-Document Retriever 架構。

❓ 挑戰 2:向量搜尋 (Dense) vs 關鍵字搜尋 (Sparse) 的 Hybrid Search 混合檢索 👉 點擊展開專家解析答案

【實戰情境問題】:為什麼在搜尋精確的程式碼函數名稱(如 `wx.CallAfter`)或特定專案 ID 時,單靠向量搜尋(Vector Search)常常找不到,必須併用傳統的 BM25 關鍵字搜尋?

【鑑別點說明】:深剖密集向量 (Dense Vector) 與稀疏向量 (Sparse BM25) 在語意 vs 精確匹配上的互補性。

【專家級解答與深度剖析】: 向量搜尋(Dense Retrieval)擅長捕捉抽象的「語意相似度」(如搜尋「開車」找到「駕車」),但對於隨機字元組成的精確字串(如函數名 `wx.CallAfter` 或 Hash 碼),Embedding 模型無法將其轉化為獨特的幾何方向,容易算成普通語意的模糊向量。而傳統 BM25(Sparse Retrieval)則是嚴格的字面匹配。混合檢索(Hybrid Search + RRF 重新排序)結合了二者長處:既懂模糊意思,又能精確捕捉代碼字串。