電腦沒有真正的細胞,所謂的「神經網路」,其實就是無數個「極其簡單的數學公式」,一層一層疊起來的龐大接力賽系統。
在神經網路中,有三個最核心的構造: * 輸入層 (Input Layer):負責接收外來資訊(例如:你輸入的文字 Token、或是一張圖片的像素)。 * 隱藏層 (Hidden Layers):夾在中間的黑盒子,可以有好幾百層。這是 AI 真正在「思考」與「萃取特徵」的地方。 * 輸出層 (Output Layer):給出最終答案(例如:預測下一個字是什麼、或者判斷圖片裡是一隻貓)。
想像你正在舉辦一場頂級的牛肉麵評鑑大會,但你的評審團不是一個人,而是一個由幾百人組成的「神經網路評審團」,他們分成好幾排(好幾層)坐著:
這就是神經網路!每一個評審就是一個「神經元 (Neuron)」。他們每個人都只會做很簡單的判斷,但當幾千幾萬個人分層合作時,就能做出極度複雜且精準的決定!
如果你看過《葬送的芙莉蓮》,想像神經網路就像是精靈魔法使在「解析一個未知的古代防禦結界」:
這就是深度學習中的「隱藏層 (Hidden Layers)」在做的事。層數越多(網路越「深」),AI 能解析與理解的抽象概念就越複雜!
當你給 agy 下達一個很複雜的任務(例如:開發一個帶有語音過濾與設定面板的外掛),agy 腦海中的神經網路會這樣運作:
1. 輸入層:把你的 Prompt 切割成 Token,發現關鍵字 speech.filter_speechSequence 與 gui.settingsDialogs。
2. 隱藏層 1:回憶起 NVDA 官方開發文檔中,關於這兩個關鍵字的底層邏輯與語法規則。
3. 隱藏層 2:結合「視障使用者、不能當機」的上下文(Context),判斷必須加入安全防護與 wx.CallAfter。
4. 輸出層:將這些高階概念,一個字一個字地轉化為 Python 程式碼輸出給你。
這也是為什麼我們在前面的課程中,極力強調 CO-STAR 提示詞框架。因為當你把「背景、目標、風格」寫得越清晰,就等於給了 AI 輸入層最精準的「感官數據」,AI 隱藏層的評審們才不會判斷錯誤,最終端出完美的程式碼料理!
👉 下一堂課:Lecture 3.5 揭開 Transformer 的面紗:注意力機制怎麼改變了世界? 👉 回課程大綱:學習地圖
以下題目專為尋求真正硬核觀念與專家級實戰能力的學員設計。題目無法從講義表面抄寫解答,請嘗試獨立思考後再點擊展開解析。
【實戰情境問題】:如果我們將神經網路中的所有隱藏層激活函數(如 ReLU, GELU, SwiGLU)通通拿掉,讓神經網路只進行純粹的權重矩陣乘法 $W_2(W_1 X + b_1) + b_2$,這個擁有百億參數的深度神經網路在數學上會退化成什麼?為什麼它將無法理解基本的異或邏輯 (XOR Problem)?
【鑑別點說明】:測試學員是否真正明白矩陣線性組合的疊加性與非線性激活函數(Non-linear Activation)在深度學習中的決定性作用。
【專家級解答與深度剖析】: 在線性代數中,多個矩陣乘法的連續相乘 $W_2 W_1$ 仍然只是一個單一的矩陣 $W_{new}$。因此,無論網路疊加了多少層(100層或1000層),如果沒有非線性激活函數,整個深度網路在數學上都會崩塌縮減為一個單層的線性迴歸模型(Linear Model)。線性模型只能在高維空間畫出平直的超平面,無法彎曲空間,因此無法解決連最基本的 XOR 非線性分類問題,更遑論理解複雜的語言與程式碼語法。
【實戰情境問題】:在訓練深層神經網路時,連鎖律(Chain Rule)求導會導致梯度從輸出層一路反向傳遞回輸入層。為什麼早期的 Sigmoid 激活函數會導致神經網路前幾層的權重「徹底停止學習(梯度消失)」?Transformer 使用的 GELU / SwiGLU 如何解決此物理困境?
【鑑別點說明】:深剖神經網路微分求導、梯度傳播與現代激活函數的演進歷史。
【專家級解答與深度剖析】: Sigmoid 函數的導值最大只有 0.25。當網路達到數十層時,反向傳播連續乘以數十個小於 0.25 的導數($0.25^{30} pprox 0$),導致傳遞到前幾層的梯度趨近於 0,前層權重完全無法更新(梯度消失)。ReLU / GELU 函數在大於 0 的區域導數為 1(或具備平滑非零梯度),使得梯度在反向傳播時能無損傳遞回極深的網路層,這才讓百層深度的 Transformer 模型訓練成為可能。