走進這座由數百億個數學矩陣構成的深夜賭場,空氣中瀰漫著機率與密碼的氣息。
許多剛剛踏入 AI 領域的探索者,站在綠色呢絨賭桌旁,都會向背後那位神秘的「算命師 AI」拋出同一個最根本、最震撼的疑問:
「當我輸入一段話給 AI,AI 到底是怎麼在幾毫秒內,一口氣寫出一整篇邏輯嚴密的長篇故事、一份完整的技術分析報告,甚至是幾千行的複雜代碼的?它能夠順利生成這『一整篇文章』的總機率,在數學上到底是多少?」
如果我們用最直覺的統計數學來計算,假設你想讓 AI 生成一篇包含 100 個字的短文(例如經典的詩詞《靜夜思》)。在數學符號中,這整篇文章可以看作是一連串字詞 Token 的組合序列: $$W = (w_1, w_2, w_3, \dots, w_{100})$$
如果你試圖直接去計算「這整篇文章在歷史資料庫中同時出現的總機率 $P(W)$」,科學家發現這根本是一個超越宇宙原子總數的天文數字級不可能任務!因為在人類語言的字典中,100 個字的排列組合方式是 $50,000^{100}$,這是一個任何超級電腦都無法直接存取的「組合爆炸陷阱」。
就在傳統統計學家宣告絕望時,機率論中最偉大的基石——「機率連鎖律(Chain Rule of Probability)」,為賭場上的算命師點亮了神聖的曙光!
機率連鎖律告訴我們:要求出『一整篇文章』出現的總機率,根本不需要貪婪地一口氣吞下整篇文章!我們只需要把每一個字出現的『條件機率』給連續乘起來就可以了!
用優雅的數學公式表示,就是: $$P(w_1, w_2, \dots, w_{n}) = P(w_1) \times P(w_2 \mid w_1) \times P(w_3 \mid w_1, w_2) \times \dots \times P(w_n \mid w_1, w_2, \dots, w_{n-1})$$
有了條件機率連鎖律這把鑰匙,當你在 agy 中輸入「今天天氣真」這五個字時,算命師大腦在幾毫秒的暗室裡,是如何極速擲出下一個骰子的呢?這包含了四個連續的神秘步驟:
算命師的大腦無法直接理解人類的字形。分詞器(Tokenizer)會瞬間將你的輸入切割成 Token,並翻譯成數字編號。例如輸入「今天天氣真」被轉化為數字序列 [1024, 883, 501, 72]。
這組數字序列傳入模型後,神經網絡中數百億個微小旋鈕開始高速運算。最終在模型字典的數萬個 Token 候選池中,計算出每一個字作為「下一個字」的條件機率分佈:
* 候選字 好:條件機率 85%
* 候選字 晴:條件機率 10%
* 候選字 冷:條件機率 4%
* 候選字 吃:條件機率 0.001%
算命師並不是每次都死板地挑選第 1 名的字!莊家會根據你設定的溫度(Temperature)來選擇擲骰子的方式:
* 低溫模式(Temperature = 0.0,嚴謹寫程式):莊家使用重力骰子,100% 絕對挑選第一名的字(85% 的 好)。
* 高溫模式(Temperature = 1.0,寫小說創意狂想):莊家把機率拉平,允許按照機率比例進行隨機抽樣,偶爾會擲出 10% 的 晴,讓文章產生豐富的意象。
當算命師擲出下一個字是 好 之後,系統會把 好 拼接到原本的句子末尾,使上下文更新為「今天天氣真好」。
接著最神奇的閉環發生了——AI 將這句更新後的「今天天氣真好」重新作為全新的輸入,再次丟進神經網絡大腦重複運算,去推算下下個字的條件機率!
這就是所謂的 自迴歸(Autoregressive)機制!AI 像是一隻不斷吞食自己尾巴的神龍,不斷「吃進歷史 ➔ 吐出新字 ➔ 把新字再吞回去」,一直重複這個循環,直到它在抽樣中選中了代表文章結束的特殊符號 [EOS](End of Sequence),這整篇文章的生成才宣告圓滿落幕!
既然說穿了 AI 的生成只是一場「文字接龍」遊戲,為什麼 10 年前手機鍵盤上的文字接龍常常接出胡言亂語,而今天的 GPT-4o 與 Claude 卻能通過律師考試、編寫複雜軟體?這中間經歷了四代驚心動魄的技術革命:
回到了我們在賭場開場時的終極靈魂拷問:
「一個只會根據條件機率、在賭桌上擲骰子預測下一個字的文字接龍機器,真的有可能產生人類級別的『智慧』嗎?」
臺灣著名 AI 學者李宏毅老師給出了讓整個計算機科學界震撼的解答:
「如果今天你給 AI 出的題目是『請證明哥德巴赫猜想...』或者『請幫我除錯這段高併發分散式系統的 C++ 程式碼...』,AI 為了要把下一個字(Next Token)接得完全正確,它大腦裡的幾百億個數學旋鈕,就必須在暗中學會邏輯推導、數學運算、語法結構乃至於真實世界的物理法則!『文字接龍』只是模型展現在外的表象,而『智慧』則是它為了把這個接龍遊戲玩到極致,所不得不產生的湧現能力(Emergent Ability)!」
為了方便使用 NVDA 螢幕閱讀器與進行快速複習的夥伴,以下是 Lecture 03.3 的核心技術條列總結:
[EOS] 終止符號。👉 下一堂課:Lecture 03.5 熱血動漫修練:解密 Transformer、QKV 注意力名牌與 FlashAttention
👉 回課程大綱:學習地圖
以下題目專為尋求真正硬核觀念與專家級實戰能力的學員設計。題目無法從講義表面抄寫解答,請嘗試獨立思考後再點擊展開解析。
【實戰情境問題】:根據自迴歸文字生成的條件機率連鎖律 $P(w_1, w_2, ... w_n) = \prod P(w_i | w_{
【鑑別點說明】:測試學員是否理解自迴歸生成(Autoregressive Generation)的累積條件依賴(Error Accumulation)。
【專家級解答與深度剖析】: 自迴歸模型的本質是「吃自己吐出來的字作為下一次的輸入條件」。當第 $k$ 個 Token 寫錯時,這個錯誤的 Token 就會成為第 $k+1$ 個 Token 的已知條件 $w_{
【實戰情境問題】:在預訓練(Pre-training)完成後,透過 RLHF(人類反饋強化學習)對模型進行偏好對齊時,為什麼過度對齊會導致模型出現「模式塌陷 (Mode Collapse)」與過度諂媚(Sycophancy)?這對工程師除錯有何負面影響?
【鑑別點說明】:深剖 RLHF 獎勵模型(Reward Model)的副作用與模型輸出分布塌陷。
【專家級解答與深度剖析】: RLHF 的獎勵模型傾向於給予「有禮貌、安全、符合人類聽覺偏好」的回答高分。若 RLHF 訓練過度,模型的概率分布會高度集中在少數「安全且通用」的句型上(模式塌陷)。在除錯場景中,過度對齊的模型會表現出「過度諂媚」——即便工程師提出了錯誤的假設(如「是不是這行程式碼錯了?」),AI 為了順從使用者,會立刻附和「是的,您真敏銳!確實是這裡錯了」,進而誤導工程師偏離真正的 Bug 根源。