strawberry,是一串連續的英文字母:s-t-r-a-w-b-e-r-r-y,我們的視覺皮質會自動一個字元一個字元去掃描。但當這串字進入 AI 大腦前,會先經過一道叫做『分詞器(Tokenizer)』的文字裁切機!」strawberry 會被瞬間切成兩塊彩豆積木:["straw", "berry"]!」"straw" 可能對應到 Token ID 39201,而 "berry" 對應到 Token ID 48102。AI 的神經網絡接收到的輸入就只有 [39201, 48102] 這兩個數字!這就像你遞給一個還不認識字母的小朋友兩塊木製積木:一塊叫『草』,一塊叫『莓』。然後你問他:『請問這兩塊積木內部印了幾個小字母 r?』小朋友根本看不見積木內部的微小塗料,他只能憑藉著記憶裡讀過幾億本書的機率聯想去猜。在他的統計記憶中,berry 這個音節常常跟 double r(兩個 r)產生超高關聯,於是他就脫口而出『2 個』!」strawberry 有幾個 r,在工程上有什麼破解招式?」agy 在背景跑一段 Python 腳本:"strawberry".count("r")。真實電腦的 Python 執行器會老老實實地數出 3,絕對不可能出錯!apple 通常只佔用 1 個 Token。但是在早期分詞器(如 GPT-2/3)的字典裡,中文沒有足夠的獨立 Token 槽位,一個中文字『蘋』會被拆解成 3 個 UTF-8 位元組(Byte Fallback)!這代表什麼?同樣一段意思,用中文發送給 AI,消耗的 Token 數量可能是英文的 2 到 4 倍! 這是我們華語開發者在算 API 燃料費用與 Context Window 空間時必須掌握的隱形成本!」AGENTS.md 或幾萬字的法規文檔)寫在 Prompt 前端時,雲端伺服器會將這段固定文檔的神經網絡鍵值快取(KV Cache)保留在顯存中。下次你再提問時,伺服器直接命中快取(Cache Hit),輸入 Token 費用高達 75% 到 90% 的折扣!」箱子總重量 y = \sigma(蘋果顆數 x * 每顆蘋果平均重量 w + 鐵箱本身的重量 b)。」/clear 黑板就被擦掉了,70 億個旋鈕物理角度毫無改變;而 微調(Fine-tuning / LoRA) 是拿著扳手實實在在改變了參數的數值或外掛矩陣,知識被永久刻進了神經網絡的硬體結構中!」strawberry 被切成 ["straw", "berry"])。s-t-r-a-w-b-e-r-r-y;(2) Tool Calling 執行 Python "strawberry".count("r")。5. LoRA 與 QLoRA 輕量微調:
小咪:「太棒了!下一集我們要聊什麼呢 Ray?」
👉 下一堂課:Lecture 03.3 賭場算命師連鎖骰子:解密文字生成條件機率與自迴歸演進史
👉 下一堂課:Lecture 03.5 熱血動漫修練:解密 Transformer、QKV 注意力名牌與 FlashAttention
👉 回課程大綱:學習地圖
以下題目專為尋求真正硬核觀念與專家級實戰能力的學員設計。題目無法從講義表面抄寫解答,請嘗試獨立思考後再點擊展開解析。
【實戰情境問題】:為什麼用英文寫一段 100 字的程式碼說明可能只消耗 120 個 Token,而用繁體中文寫相同意思的說明卻可能消耗 350 個 Token?BPE (Byte Pair Encoding) 詞元化演算法在語料庫權重上造成了什麼經濟學與計算不公?
【鑑別點說明】:深剖 Tokenizer 詞表(Vocabulary Size)構造與多語言字元切分的物理真相。
【專家級解答與深度剖析】: 大部分主流大模型(如 GPT-4)的 Tokenizer 訓練語料庫中,英文資料佔了 80% 以上。BPE 演算法會將頻率極高的英文單詞(如 `function`, `accessibility`)直接切成 1 個 Token。而繁體中文在詞表中覆蓋率較低,許多罕見漢字甚至 UTF-8 繁體編碼會被切分成 2~3 個 Byte Token。這意味著繁體中文使用者在調用 API 時,不僅支付了 2~3 倍的 Token 費用,也浪費了 2~3 倍的 Context Window 空間與推論時間。
【實戰情境問題】:將模型的權重參數從 16 位元浮點數(FP16)量化(Quantization)為 4 位元整數(INT4)時,為什麼模型在一般對話上感覺不出差異,但在執行高難度程式碼邏輯或 NVDA 複合事件調度時會突然出現「邏輯斷崖式下降」?
【鑑別點說明】:測試學員是否真正明白模型量化中的 Outlier Features(異常值特徵)對高階推理能力的作用。
【專家級解答與深度剖析】: 研究表明,在大模型的隱藏層中,有不到 0.1% 的關鍵神經元擁有極大的權重數值(Outlier Features),這些少數特徵掌控了模型的高階邏輯推理與嚴謹語法約束。傳統 INT4 均勻量化會將這些巨大數值強制壓縮截斷,導致精度嚴重損失。一般聊天對話仰賴語意流暢度,對精度不敏感;但寫程式與硬核邏輯推論要求 100% 符號精確,少了一位精度就會導致變數指標錯位。現代先進量化(如 AWQ / SmoothQuant)即是透過保護這些 Outlier 特徵來維持邏輯智商。