吳恩達 Agentic AI 工作流(產出:2026-08-18)

核心判斷

Agentic AI 不是「會不會完全自主」的二元分類,而是讓模型在多步工作流中反覆生成、使用工具、接受回饋、規劃與分工的設計光譜。商業落地不必從最高自主程度開始;真正的分界是任務能否拆解、每一步能否驗證,以及錯誤能否被追蹤與改進。^[raw/transcripts/youtube/youtube-GvB0zj6wTYE.md] ^[raw/transcripts/youtube/youtube-yr78nQ56h-c.md]

自主程度:光譜,不是開關

低自主系統由工程師預先決定步驟;中間型態允許模型在既定工具與邊界內選擇下一步;高自主系統則讓模型決定步驟、規劃甚至建立新工具。吳恩達明確指出,今天大量有價值的企業應用仍在較低自主、較可控的一端;高自主系統更難預測,也更接近研究前沿。

因此,判斷一個系統是否「真的算 Agent」的價值不高。更實用的問題是:它在哪些步驟擁有決策權、能呼叫哪些工具、失敗時由誰接手,以及哪一層輸出必須經人類核准。

效益:流程設計可能比換模型更重要

吳恩達將效益分成三層:完成過去做不到的任務、平行執行以縮短整體時間,以及以模組化方式替換每一步的最佳元件。他以 HumanEval 示範單次生成的 GPT-3.5 約 48%、GPT-4 約 67%,並主張在舊模型上加入反思等 agentic 流程,增益可能超過單純換代;但這是特定程式評測,不應外推為所有任務的固定結論。

對企業而言,可複用的結論不是「舊模型一定勝過新模型」,而是先檢查流程:能否加入檢索、平行查找、反思、工具呼叫與驗收,再決定是否需要更昂貴的模型。

應用與難度

影片案例涵蓋客服、深度研究、法律文件、醫療建議、發票處理、訂單查詢、一般客服與瀏覽器操作。越能寫成明確 SOP、越以文字為主、越能把敏感動作放入人類審核佇列,越容易可靠落地;需要臨場規劃、多模態理解或操作變動網頁的任務,可靠性較低。^[raw/transcripts/youtube/youtube-XD9DbNrrggw.md]

這也提供一個導入順序:先做可逆、可檢查、步驟清楚的任務;再逐步放寬模型的工具選擇與規劃權限。退費、客訴、法務、金流與公開發布等高風險動作,應保留明確的人類關卡。

任務拆解:Agent 能否落地的起點

任務拆解的判斷句是:「這一步能否由 LLM、一小段程式碼或一次工具呼叫完成?」若不能,就繼續拆。研究寫作可拆成大綱、搜尋詞、檢索、初稿、批判與修訂;客服可拆成抽取資訊、查資料庫、草擬回覆與人類核准;發票可拆成文件轉文字、欄位抽取與寫入系統。

拆解不是一次性設計。當中間輸出出現前後不一致、漏資料或語氣錯誤時,要把該步再拆細,或加入專用工具與檢查。

評估:先看錯誤,再決定要量什麼

吳恩達把紀律化 eval 與 error analysis 視為高手與低效率團隊的主要差異。實務順序不是先想完所有錯誤,而是先建立系統、人工閱讀輸出與中間 trace、找出實際不滿意之處,再把客觀問題寫成程式檢查,主觀問題交由 LLM judge 搭配人工抽驗。端到端 eval 看整體成果,元件級 eval 找出是哪一步失效。

限制也要保留:LLM 對一到五分量表未必穩定;評估設計本身需要校準,不能把「用了另一個 LLM 評分」當成客觀真相。

四種設計模式

  1. 反思(Reflection):把輸出與批判送回模型修訂;可由同一模型自評,也可使用獨立 critic。
  2. 工具使用(Tool use):讓模型選擇並呼叫搜尋、資料庫、API、程式執行等工具,從「會說」變成「能做」。
  3. 規劃(Planning):讓模型決定步驟與工具順序;彈性較高,但可控性下降。
  4. 多代理協作(Multi-agent collaboration):以研究員、編輯、測試員等角色分工;適合確實可分工的複雜任務,不應把更多 agent 當成更高品質的保證。

這四種模式是工具箱,不是成熟度階梯,也不是每個系統都要全部採用。設計順序仍應回到任務、風險與評估。

對免費講座與付費 Workshop 的意義

免費講座

目標應是建立正確認知,而不是堆疊工具名詞:

  • 用「自主程度光譜」拆除 Agent 等於全自動的誤解。
  • 用一個 coach-meeting 工作流示範輸入、分工、工具與人類關卡。
  • 讓學員帶走一張任務拆解表,能判斷自己工作中哪一段適合先自動化。
  • 明說 demo 能跑不等於可以上線,評估與責任邊界才是專業分界。

付費 Workshop

付費價值不應只是再看更多 demo,而是讓學員在受控環境中完成並驗收一個可重複工作流:

  • 以單一 coach-meeting 為主線,由三人小組分工蒐集、判讀與輸出。
  • 先做低自主流程,再讓模型在限定工具內做選擇。
  • 設計一個講師關卡與一組可重跑的 eval;保留失敗案例並做 error analysis。
  • 完成後能說清楚每一步的輸入、工具、責任人、驗收標準與失敗回復,而不以安裝框架或多代理數量作成果。

以上是根據 Andrew Ng 內容對顧哥課程的策略轉譯,不是 Andrew Ng 對顧哥產品的直接建議,也尚未視為顧哥正式核准的品牌立場。

證據地圖與限制

  • 七支成功逐字稿來自「扣子說AI」轉載的英文自動字幕,能支持課程片段內的講法,但不是官方上傳,專有名詞與數字可能有辨識誤差。
  • l2PtFPAbrV8 三次取得失敗,worker 回報字幕停用;本概念不使用該片標題推論內容。
  • 官方資源地圖補充 DeepLearning.AI 課程與 The Batch 文章的第一方脈絡;影片片段與官方文章互相印證時,仍須區分發布時間與證據層級。
  • HumanEval 數字、企業應用數量與多代理效果屬講者案例或單一研究脈絡,不能直接當成所有企業流程的保證。

相關頁面