Agent 技術到底成熟了沒?

當所有人都在喊「Agent 要落地了」,為什麼 Andrej Karpathy 卻認為,我們可能還需要十年?

當世界都高喊「2025 將是 Agent 落地之年」,OpenAI 早期核心成員暨前 Tesla AI 總監 Andrej Karpathy,卻提出另一個時間軸:「2025~2035,會是 Agent 的十年。」

這並不是看衰 Agent,而是提醒我們:今天的 AI Agent 雖然已經很會完成任務,卻還不等於真正具備「自主學習」能力。

目前的模型更像是從大量網路文本中蒸餾出的語言模型,反應快、記得多,卻還缺少一個關鍵機制:把一次次任務經驗沉澱成下一次會自然遵循的策略與直覺。

核心問題

Karpathy 對目前強化學習的其中一個質疑,是複雜任務中的學習訊號往往「太少,也太模糊」,就像**「透過吸管吸取監督訊號」**。

例如,Agent 規劃一趟長途旅行,可能經過搜尋航班、比較飯店、安排交通、計算預算等大量步驟,最後卻只得到 7 / 10 分

這個分數無法清楚告訴 AI:到底哪一步做對、哪一步做錯。甚至當 Agent 中途犯了不少錯,最後卻碰巧得到正確結果時,強化學習也可能把錯誤路徑一起強化。

人類的學習方式不同。我們會回顧過程、找出關鍵節點,再問自己:哪裡做對了?哪裡做錯了?下一次應該改變什麼? 最後把經驗整理成可以重複使用的方法。

關鍵洞察

那麼,Agent 要怎麼才能真正「學會」?Karpathy 用剛出生的斑馬說明「強初始化(Strong Initialization)」的重要性。

斑馬寶寶出生沒多久就能站立奔跑,不是因為牠從零開始靠獎勵慢慢摸索,而是演化早已把大量感知與動作能力寫進 DNA。否則,牠可能還沒學會跑,就先被掠食者淘汰。

放到 AI 上,大規模預訓練就有點像一種「演化」:先提供強大的語言、知識與表徵能力,再以此為基礎發展 Agent 與小範圍強化學習。

但 Karpathy 認為,這仍是一種相對「蹩腳的演化」。模型很會記憶,卻還不擅長把真實任務中的經驗持續轉化成自己的策略。

反過來說,人類記性不好,可能是一種 feature,而不是 bug。 因為我們無法記住所有事情,所以被迫學會泛化、提煉規則,並使用筆記、書籍、搜尋引擎等外部工具。

換句話說,人類不是靠記住所有答案變聰明,而是靠提煉規則與使用工具,處理沒有遇過的問題。

Agent 需要的,可能不是更多獎勵,而是學會反思

如果 AI 不能只靠記憶,那麼它如何把經驗變成下一次可以使用的策略?Karpathy 提出一個值得關注的方向:System Prompt Learning(系統提示學習)

可以把它想像成給 Agent 一本能自己修改的**「策略筆記本」**:每完成一次任務,不只看最後得分,也回頭檢查整段過程,找出值得留下來的經驗。

這個流程大致可以分成五個步驟:

1. 執行任務並取得真實回饋

讓 AI 在環境中真正執行任務、嘗試與失敗,並取得實際結果或獎勵訊號。

2. 啟動元反思

Agent 透過 meta-prompt 回顧自己的行動歷程,例如:「哪裡做得好?哪裡做錯?失敗的原因是什麼?」

3. 自主生成可重複使用的教訓

Agent 把失敗抽象成下一次可以使用的策略。例如文字計數失敗後,整理出:「不要直接目測計數,應先將文字拆分後逐一計算。」

4. 自動更新 System Prompt

Agent 把新策略寫回 System Prompt,讓下一次遇到類似問題時,可以直接利用過去累積的「策略筆記」。

5. 最後再把策略蒸餾回模型

當策略累積到一定程度後,再把穩定、有效的模式蒸餾回模型權重。Karpathy 將它類比成人類的睡眠:把白天累積的經驗整理、內化,逐漸變成「直覺」。

所以,Agent 技術到底成熟了沒?

如果我們對 Agent 的期待是使用工具、完成多步驟任務、串接 API、自動操作軟體,今天的 Agent 已經具有相當的實用價值。

但如果期待它能在長期工作中持續從成功與失敗中學習、自主修正策略,而且下一次真的變得更好,那可能還在相對早期的階段。

這也是為什麼 Karpathy 把 2025~2035 看作 Agent 逐步發展的十年。現在的 Agent 已經開始「會做事」,下一個重要突破則可能是:讓它記得自己為什麼做錯,並把這次經驗變成下一次的能力。

金句啟發

「Agent 的未來,不是靠獎勵訊號盲目摸索,而是靠自我反思來編輯自己的策略筆記。」

延伸閱讀

[1] 我們正在召喚幽靈,而非建造動物|We’re summoning ghosts, not building animals(Karpathy, 2025)

[2] 苦澀的教訓|The Bitter Lesson(Sutton, 2019)

以上文章為數創電子報 Vol.13】 Agent 成熟還要十年?OpenAI 聯合創始人:強化學習是瓶頸


重點整理

Agent 技術現在成熟了嗎?

如果 Agent 指的是使用工具、呼叫 API、操作軟體與完成多步驟任務,目前已經具有實際應用價值。但如果期待 Agent 能長期從自己的經驗中自主學習、修正策略並持續進步,目前仍處於相對早期的階段。

Karpathy 為什麼認為目前的強化學習還不夠?

因為複雜任務可能包含數百甚至數千個步驟,最後卻只得到少量、模糊的獎勵訊號。模型很難從單一結果判斷哪些步驟值得保留、哪些步驟造成錯誤,甚至可能把偶然成功過程中的錯誤行為一起強化。

什麼是 System Prompt Learning?

System Prompt Learning 可以理解為讓 Agent 擁有一本能自行更新的「策略筆記本」。Agent 完成任務後先反思成功與失敗原因,再把可重複使用的教訓寫入 System Prompt,讓下一次執行類似任務時能直接利用過去經驗。

Agent 下一階段真正需要解決的是什麼?

關鍵可能不只是讓模型能執行更多工具或更長的任務,而是建立一套能從經驗中反思、提煉策略、保存策略,甚至最終將策略重新蒸餾回模型權重的學習機制。只有如此,Agent 才可能從「會完成任務」進一步走向「做過之後真的會變得更好」。

分享此內容:
icon
或使用社群帳號登入
或使用社群帳號註冊