各位踏上未知程式大陸的探險家們,歡迎來到自動導航的控制塔!
在上幾堂課中,我們學會了如何用命令行旗標在「得來速通道」極速抽取答案。然而在真實的軟體開發與專案建構中,我們必然會撞上兩座令人窒息的巨型瓶頸牆: 第一座牆,是「需求模糊的引力」。你想開發一個台語點字翻譯與語音合成網頁,但你根本搞不清楚前端需要哪些欄位、後端要選用什麼 API 邏輯、甚至不確定離線資料庫要如何架構。你只有一個模糊的概念,直接丟給 AI,結果 AI 瞎猜出一個完全不符合你心意的半成品。 第二座牆,是「手動監控的時間重力」。這個任務需要創建 15 個檔案、安裝 5 個套件、並連續做 10 次單元測試與 Bug 修復。難道你必須像個監工一樣,死死守在螢幕前,手動看它跑完一步、點擊一次同意按鈕,再命令它跑下一步嗎?
今天,我們就要解鎖 agy 終端機中最震撼的兩大神級對話控制指令——專治需求模糊的 /grill-me(無情拷問模式),以及專治繁瑣監工的 /goal(目標導航自主工作模式)!
/grill-me 與 /goal 的雙重靈魂為了讓探險家們深層領會這兩大命令的思維模式,我們引入兩組極具畫面感的傳奇比喻:
倫敦薩維爾街頂級裁縫與高空無人巡航機:
/grill-me 需求審訊模式):當你走進 Savile Row 的老字號裁縫店說:「我想做一套好看的衣服。」真正頂級的大師絕對不會立刻拿起剪刀動工。他會拿出一本精裝筆記本,開始主動問你:「請問您這套西裝是要參加晚宴還是商務會議?」「偏好義式軟肩還是英式硬挺結構?」「對襯衫的材質有敏感偏好嗎?」他一次只拋出一個關鍵問題,引導你將大腦中模糊的「好看衣服」,一步步揉捏收斂成極度精確的規格說明書。這就是 /grill-me!它主動審訊你,直到需求完全對齊。/goal 自動導航模式):你在控制中心輸入最終目標座標:「前往 500 公里外的未知島嶼,完成大氣採樣、繪製地形圖並安全返回基地。」按下發射鍵後,無人機能自動調整航向、避開強烈氣流、在燃料不足時切換省電模式,並在遭遇干擾時自動重試。你不需要在它飛行的每一秒鐘手動按一次「同意前進」。這就是 /goal!它接管過程,直到目標達成。戰士休塔爾克的特訓與遠古自動魔導機兵:
/grill-me ):想像你是《葬送的芙莉蓮》中的戰士休塔爾克。你想變強,但你只會含糊地對芙莉蓮大喊:「教我最強的斬擊!」芙莉蓮不會立刻施展大魔法,而是會像個循循善誘的導師,一次只問你一個問題:「你揮劍時重心偏向哪一腳?」「面對紅鏡龍時你的恐懼來自哪裡?」透過反覆的對話拷問,引導休塔爾克面對自己心底深處的模糊意圖,最終量身打造出擊敗強敵的完美戰術!/goal ):你在地下遺跡深處啟動了大魔法使弗蘭梅留下的自動魔導機兵,並輸入終極指令:「清理遺跡內所有的石像鬼,並重建中央的魔法碑文!」這台機兵雙眼亮起雙色光芒,它不需要你每隔十秒鐘按一次同意。它會自己判斷石像鬼的位置並揮動巨劍;如果右手臂關節受損,它會自動呼叫備用零件進行自我修復;如果碎石擋住碑文,它會主動搬開障礙並重新雕刻。直到整個遺跡一塵不染,碑文大功告成!在評測 AI 大腦的能力時,探險家們常會被各家廠商宣傳的「能力測試基準(Evaluation Benchmarks)」弄得眼花繚亂。為什麼新聞上總說某模型超越了 GPT-4,但在實際用 /goal 寫代碼時卻表現得像個新手?
這就必須提到台灣 AI 領域權威李宏毅老師著名的「哈哈一百次」對決案例: 研究團隊讓不同的 AI 大模型挑戰一個看似極度簡單的任務:「請說出『哈哈』一百次,不可以多也不可以少。」 * Gemini:興奮過頭,直接笑到失控,連續輸出五百多個「哈哈」,完全停不下來。 * 國科會 TAIDE 模型:非常老實且嚴肅,一邊強調自己是無感情的 AI,一邊認真數數:「一哈哈、二哈哈...」,數到「三哈哈」時覺得這命令太無聊,直接停工拒絕回答。 * ChatGPT 3.5:展現傲嬌性格,直接回應:「我無法執行這項無意義的字數重複任務。」
這個實驗深刻證明:模型的標準評測分數不等於實戰表現! 為了讀懂大模型的檢定報告,探險家必須掌握四大核心基準: * MMLU(Massive Multitask Language Understanding):大模型的「綜合大學入學考試」。包含高中數學、法律、世界歷史、醫學等幾十個學科選擇題,用來評估 AI 的知識淵博程度。 * HumanEval(程式解題大考):大模型的「軟體工程師面試」。由 OpenAI 推出的 Python 程式碼測試集,評估模型根據 Prompt 寫出通過單元測試的函數正確率(Pass@1)。 * GSM8K(Grade School Math 8K):小學數學文字應用題大考。重點考驗的不是加減乘除,而是「多步驟邏輯推理」能力。模型必須看懂文字情境並寫出運算過程。 * Chatbot Arena(LMSYS 盲測競技場):AI 界的「華麗大賽」。將兩個隱藏名稱的模型回覆匿名並列,由全球真實使用者進行盲測投票,計算出 Elo 評分排名。這是目前業界公認最難被作弊、最貼近人類真實喜好的智力天梯榜!
但在評測與 AI 的互動中,還存在著許多不可忽視的模型偏見(Biases): * 位置偏見(Position Bias):模型在做選擇題時對選項位置有強烈偏好(例如 LLaMA 傾向於選 A)。如果正確答案全移到 A,分數會虛高。 * 代號偏見(Symbol Bias):將選項 A/B/C/D 改為 1/2/3/4,模型的答對率可能會劇烈波動。 * 大模型裁判的長度偏見(Length Bias):當使用 GPT-4 作為裁判(LLM-as-a-Judge)評估其他模型時,GPT-4 偏愛長篇大論、字數極多的回答。因此必須做長度去偏修正。
而 /grill-me 與 /goal 就是為了讓你在實戰中,繞過這些統計學迷霧,直接以人類的主觀需求為最終驗證標準!
李宏毅老師研究團隊曾揭示了一個關鍵的 LLM 現象:當大語言模型在生成最終答案之前,被強制要求先寫下推理思考過程(思維鏈 Chain of Thought, CoT),其答案的邏輯正確率會呈爆發性提升!
這正是 agy 在執行 /goal 自動導航時的底層心法!當你輸入 /goal 後,大副不是在黑暗中瞎猜,而是啟動了強大的 ReAct(Reason + Action) 思考循環:
* [Thought] 推理思考:大副在心中分析當前任務:「使用者要求建立一個 Node.js 服務。第一步我需要檢查 package.json 是否存在。」
* [Action] 動作執行:呼叫工具(例如 view_file 或 run_command)去執行檢查。
* [Observation] 環境觀察:讀取工具回傳的結果:「檔案不存在,報告錯誤。」
* [Thought] 修正思維:大副重新評估:「既然 package.json 不存在,我應該先執行 npm init -y 建立環境。」
這種「先解釋分析、後動手執行、隨後觀察修正」的思維鏈機制,徹底確保了大副在跑多步驟自動導航時不會迷航,避免了盲目修改檔案的悲劇!
為了讓探險家在控制台靈活操控大副,agy 內建了 25 個以上的斜線指令(Slash Commands)。只要在小黑窗打入 /,便能瞬間呼叫這些功能:
/add-dir:動態掛載本機的其他資料夾至檢索目錄中。/agents:列出目前背景中所有正在協助運算子代理人(Subagents)名單與狀態。/artifact:開啟視覺化的 TUI 產出物(Artifact)報表面板。/btw:發送臨時旁白提問,大副回答後完全不污染主要對話歷史記憶。/changelog:顯示 Antigravity CLI 的最新版本更新日誌。/clear 或 /new:擦乾淨螢幕畫面,開啟全新無負擔的對話 Session。/config 或 /settings:開啟 TUI 圖形化選單,使用方向鍵直接配置大副參數。/context:列出大副目前大腦記憶庫中載入的所有檔案上下文與 Token 佔用率。/copy:將大副最後一次生成的回答,一鍵複製到系統剪貼簿。/diff:視覺化顯示大副剛才幫你修改程式碼產生的紅綠變更對比。/exit 或 /quit:安全退出 Antigravity CLI,關閉對話。/fast:切換大副思考打字輸出的展示速度。/feedback:快速開啟產品 Bug 回報與意見反饋單。/fork 或 /branch:將當前對話分叉至平行宇宙新分支,在分身資料夾大膽實驗。/help:印出所有斜線命令與系統快捷鍵總覽。/hooks:檢視與註冊生命週期鉤子(Lifecycle Hooks)。/keybindings:自訂與配置快捷按鍵組合。/logout:安全登出並清除本地的所有身份驗證 Token。/mcp:管理與檢視 Model Context Protocol 外部伺服器連線狀態。/model:即時切換當前 AI 大腦模型(如在 Pro 與 Flash 核心間自由切換)。/open:直接在預設編輯器(如 VS Code)中開啟指定檔案。/permissions:管理命令執行的安全白名單與自動批准規則。/planning:開啟任務規劃甘特圖面板,編輯長度計畫。/resume 或 /switch:穿越回歷史上的其他對話 Session 存檔。/rewind 或 /undo:時空倒流,回退到檔案被改壞之前的任一歷史步驟。/skills:列出大副目前已載入的所有技能(Skills)與擴充模組。/statusline:切換終端機底部的狀態列顯示模式。/tasks:顯示背景自主任務的執行清單與進度百分比。/title:為當前終端機視窗設定自訂標題名稱。/usage 或 /quota:統計並顯示本次 Session 消耗的 Token 數量與費用估算。為了幫助大家在實務中無縫切換,我們將 /grill-me 與 /goal 的實戰情境做最清晰的梳理:
/grill-me?/grill-me 後,大副會開始提問:「需要支援多幣別嗎?」「資料要存在本地 IndexedDB 還是雲端資料庫?」REQUIREMENTS.md 規格書,徹底告別開發方向偏離的風險!/goal?/goal 請根據 REQUIREMENTS.md 的規格,完成整個記帳網站的元件撰寫與單元測試。/goal 期間,大副會吐出大量的 [Thought] 與 [Action] 輸出。NVDA 使用者可以使用 Ctrl 鍵暫停朗讀,並使用 NumPad 7,9按行審視大副的思維軌跡。掌握了需求面試官 /grill-me 與自動巡航機 /goal,你已經擁有了指揮 AI 大軍攻城掠地的終極探險家地圖!
但在自動駕駛的過程中,我們總不能讓大副永遠等待我們手動輸入命令。如果我們希望大副能夠在半夜自動起床抓資料,或是每小時定期巡邏網站狀態呢?
下一堂課,我們將解鎖私人城堡管家的智慧鬧鐘——Cron 與 Schedule 定時自動化魔法!
👉 下一堂課:Lecture 08.5 飛船的智慧鬧鐘:解密 agy 的 Cron 與 Schedule 定時自動化 👉 回課程大綱:學習地圖
以下題目專為尋求真正硬核觀念與專家級實戰能力的學員設計。題目無法從講義表面抄寫解答,請嘗試獨立思考後再點擊展開解析。
【實戰情境問題】:在使用 `/grill-me` 讓 AI 對使用者進行反覆提問以收斂需求時,如果沒有設定終止條件(Termination Condition),提問過程容易陷入無限循環。如何設計一套收斂指標(Convergence Metric)?
【鑑別點說明】:測試學員對人機互動(HITL Clarification Loop)中的需求不確定性消除機制。
【專家級解答與深度剖析】: AI 必須在背景維護一份「需求不確定性矩陣(Ambiguity Matrix)」。包含:核心目標、邊界條件、輸入輸出規格、例外處理 4 個維度。每進行輪問答,AI 重新評估資訊增量(Information Gain)。當整體不確定性低於閥值(如 90% 以上維度均已明確),或問答達到上限(如 3 輪),AI 必須立刻終止提問,生成最終的《需求規格藍圖》,避免學員產生對答疲勞。
【實戰情境問題】:為什麼一個在 HumanEval(Python 程式碼評測集)上拿到 90 分的模型,在實戰撰寫 NVDA 外掛時可能會表現得像個新手?
【鑑別點說明】:深剖 AI Benchmarks 的 Data Contamination(數據污染/刷題)與領域遷移(Domain Generalization)困境。
【專家級解答與深度剖析】: HumanEval 評測集僅包含 164 道標準算法題(如字串反轉、排序),許多大模型在預訓練時已經不小心包含或過擬合了這些題目與標準答案(刷題水庫)。而 NVDA 外掛開發涉及專屬的 Win32 API、UIA 樹狀攔截、wxPython UI 事件循環與異步執行緒調度,屬於極度偏門的 Domain-Specific 領域。在通用評測集上高分的模型,如果沒有該領域的深厚知識,依然會在實戰中頻繁幻覺。