🗺️ Lecture 08: 探險家自動導航:解密 /grill-me 需求審訊與 /goal 自主狂飆大師術

NOTE作者資訊 (Author Info)

各位踏上未知程式大陸的探險家們,歡迎來到自動導航的控制塔!

在上幾堂課中,我們學會了如何用命令行旗標在「得來速通道」極速抽取答案。然而在真實的軟體開發與專案建構中,我們必然會撞上兩座令人窒息的巨型瓶頸牆: 第一座牆,是「需求模糊的引力」。你想開發一個台語點字翻譯與語音合成網頁,但你根本搞不清楚前端需要哪些欄位、後端要選用什麼 API 邏輯、甚至不確定離線資料庫要如何架構。你只有一個模糊的概念,直接丟給 AI,結果 AI 瞎猜出一個完全不符合你心意的半成品。 第二座牆,是「手動監控的時間重力」。這個任務需要創建 15 個檔案、安裝 5 個套件、並連續做 10 次單元測試與 Bug 修復。難道你必須像個監工一樣,死死守在螢幕前,手動看它跑完一步、點擊一次同意按鈕,再命令它跑下一步嗎?

今天,我們就要解鎖 agy 終端機中最震撼的兩大神級對話控制指令——專治需求模糊的 /grill-me(無情拷問模式),以及專治繁瑣監工的 /goal(目標導航自主工作模式)!


🧵 第一篇章:頂級定製裁縫與無人巡航機——/grill-me/goal 的雙重靈魂

為了讓探險家們深層領會這兩大命令的思維模式,我們引入兩組極具畫面感的傳奇比喻:


⚖️ 第二篇章:基準測試的迷霧與哈哈百次大決鬥——MMLU、HumanEval 到 Chatbot Arena

在評測 AI 大腦的能力時,探險家們常會被各家廠商宣傳的「能力測試基準(Evaluation Benchmarks)」弄得眼花繚亂。為什麼新聞上總說某模型超越了 GPT-4,但在實際用 /goal 寫代碼時卻表現得像個新手?

這就必須提到台灣 AI 領域權威李宏毅老師著名的「哈哈一百次」對決案例: 研究團隊讓不同的 AI 大模型挑戰一個看似極度簡單的任務:「請說出『哈哈』一百次,不可以多也不可以少。」 * Gemini:興奮過頭,直接笑到失控,連續輸出五百多個「哈哈」,完全停不下來。 * 國科會 TAIDE 模型:非常老實且嚴肅,一邊強調自己是無感情的 AI,一邊認真數數:「一哈哈、二哈哈...」,數到「三哈哈」時覺得這命令太無聊,直接停工拒絕回答。 * ChatGPT 3.5:展現傲嬌性格,直接回應:「我無法執行這項無意義的字數重複任務。」

這個實驗深刻證明:模型的標準評測分數不等於實戰表現! 為了讀懂大模型的檢定報告,探險家必須掌握四大核心基準: * MMLU(Massive Multitask Language Understanding):大模型的「綜合大學入學考試」。包含高中數學、法律、世界歷史、醫學等幾十個學科選擇題,用來評估 AI 的知識淵博程度。 * HumanEval(程式解題大考):大模型的「軟體工程師面試」。由 OpenAI 推出的 Python 程式碼測試集,評估模型根據 Prompt 寫出通過單元測試的函數正確率(Pass@1)。 * GSM8K(Grade School Math 8K):小學數學文字應用題大考。重點考驗的不是加減乘除,而是「多步驟邏輯推理」能力。模型必須看懂文字情境並寫出運算過程。 * Chatbot Arena(LMSYS 盲測競技場):AI 界的「華麗大賽」。將兩個隱藏名稱的模型回覆匿名並列,由全球真實使用者進行盲測投票,計算出 Elo 評分排名。這是目前業界公認最難被作弊、最貼近人類真實喜好的智力天梯榜!

但在評測與 AI 的互動中,還存在著許多不可忽視的模型偏見(Biases): * 位置偏見(Position Bias):模型在做選擇題時對選項位置有強烈偏好(例如 LLaMA 傾向於選 A)。如果正確答案全移到 A,分數會虛高。 * 代號偏見(Symbol Bias):將選項 A/B/C/D 改為 1/2/3/4,模型的答對率可能會劇烈波動。 * 大模型裁判的長度偏見(Length Bias):當使用 GPT-4 作為裁判(LLM-as-a-Judge)評估其他模型時,GPT-4 偏愛長篇大論、字數極多的回答。因此必須做長度去偏修正。

/grill-me/goal 就是為了讓你在實戰中,繞過這些統計學迷霧,直接以人類的主觀需求為最終驗證標準!


🧠 第三篇章:大腦思考的軌跡——思維鏈 (Chain of Thought) 與 ReAct 循環的物理體現

李宏毅老師研究團隊曾揭示了一個關鍵的 LLM 現象:當大語言模型在生成最終答案之前,被強制要求先寫下推理思考過程(思維鏈 Chain of Thought, CoT),其答案的邏輯正確率會呈爆發性提升!

這正是 agy 在執行 /goal 自動導航時的底層心法!當你輸入 /goal 後,大副不是在黑暗中瞎猜,而是啟動了強大的 ReAct(Reason + Action) 思考循環: * [Thought] 推理思考:大副在心中分析當前任務:「使用者要求建立一個 Node.js 服務。第一步我需要檢查 package.json 是否存在。」 * [Action] 動作執行:呼叫工具(例如 view_filerun_command)去執行檢查。 * [Observation] 環境觀察:讀取工具回傳的結果:「檔案不存在,報告錯誤。」 * [Thought] 修正思維:大副重新評估:「既然 package.json 不存在,我應該先執行 npm init -y 建立環境。」

這種「先解釋分析、後動手執行、隨後觀察修正」的思維鏈機制,徹底確保了大副在跑多步驟自動導航時不會迷航,避免了盲目修改檔案的悲劇!


📜 第四篇章:甲板上的 25+ 終端機控制按鈕——Slash Commands 斜線指令全景指南

為了讓探險家在控制台靈活操控大副,agy 內建了 25 個以上的斜線指令(Slash Commands)。只要在小黑窗打入 /,便能瞬間呼叫這些功能:


🚀 第五篇章:實戰問答面板與探險家終極教條

為了幫助大家在實務中無縫切換,我們將 /grill-me/goal 的實戰情境做最清晰的梳理:

掌握了需求面試官 /grill-me 與自動巡航機 /goal,你已經擁有了指揮 AI 大軍攻城掠地的終極探險家地圖!

但在自動駕駛的過程中,我們總不能讓大副永遠等待我們手動輸入命令。如果我們希望大副能夠在半夜自動起床抓資料,或是每小時定期巡邏網站狀態呢?

下一堂課,我們將解鎖私人城堡管家的智慧鬧鐘——Cron 與 Schedule 定時自動化魔法!


👉 下一堂課:Lecture 08.5 飛船的智慧鬧鐘:解密 agy 的 Cron 與 Schedule 定時自動化 👉 回課程大綱:學習地圖

🔥 專家級深度思考與實戰挑戰 (Expert Challenge)

以下題目專為尋求真正硬核觀念與專家級實戰能力的學員設計。題目無法從講義表面抄寫解答,請嘗試獨立思考後再點擊展開解析。

❓ 挑戰 1:/grill-me 面試反覆提問機制的邊界條件收斂 👉 點擊展開專家解析答案

【實戰情境問題】:在使用 `/grill-me` 讓 AI 對使用者進行反覆提問以收斂需求時,如果沒有設定終止條件(Termination Condition),提問過程容易陷入無限循環。如何設計一套收斂指標(Convergence Metric)?

【鑑別點說明】:測試學員對人機互動(HITL Clarification Loop)中的需求不確定性消除機制。

【專家級解答與深度剖析】: AI 必須在背景維護一份「需求不確定性矩陣(Ambiguity Matrix)」。包含:核心目標、邊界條件、輸入輸出規格、例外處理 4 個維度。每進行輪問答,AI 重新評估資訊增量(Information Gain)。當整體不確定性低於閥值(如 90% 以上維度均已明確),或問答達到上限(如 3 輪),AI 必須立刻終止提問,生成最終的《需求規格藍圖》,避免學員產生對答疲勞。

❓ 挑戰 2:AI 能力評測基準(HumanEval vs Chatbot Arena)的過擬合危機 👉 點擊展開專家解析答案

【實戰情境問題】:為什麼一個在 HumanEval(Python 程式碼評測集)上拿到 90 分的模型,在實戰撰寫 NVDA 外掛時可能會表現得像個新手?

【鑑別點說明】:深剖 AI Benchmarks 的 Data Contamination(數據污染/刷題)與領域遷移(Domain Generalization)困境。

【專家級解答與深度剖析】: HumanEval 評測集僅包含 164 道標準算法題(如字串反轉、排序),許多大模型在預訓練時已經不小心包含或過擬合了這些題目與標準答案(刷題水庫)。而 NVDA 外掛開發涉及專屬的 Win32 API、UIA 樹狀攔截、wxPython UI 事件循環與異步執行緒調度,屬於極度偏門的 Domain-Specific 領域。在通用評測集上高分的模型,如果沒有該領域的深厚知識,依然會在實戰中頻繁幻覺。