Agents' Last Exam 是什麼?GPT 5.5 為何在真實任務勝過 Claude Fable 5
2026 年 6 月 12 日,UC Berkeley 發布 ALE(Agents' Last Exam)基準,要求 AI agent 在 Siemens NX、Unreal Engine、Adobe After Effects 等真實軟體裡複製人類領域專家已完成的任務;冠軍 GPT-5.5 + Codex 通過率 24%,在多數靜態基準上壓倒 GPT-5.5 的 Fable 5 僅拿到 22%,排第三。
目錄
重點摘要
- 2026 年 6 月 12 日,UC Berkeley 發布 ALE(Agents' Last Exam)基準,要求 AI agent 在 Siemens NX、Unreal Engine、Adobe After Effects 等真實軟體裡複製人類領域專家已完成的任務;冠軍 GPT-5.5 + Codex 通過率 24%,在多數靜態基準上壓倒 GPT-5.5 的 Fable 5 僅拿到 22%,排第三。
- 最難的 Last-Exam 難度檔,幾乎所有主流模型組合通過率為零,全體平均僅 2.6%。
- Fable 5 完成全部任務耗費 2,315 美元,是冠軍組合 GPT-5.5 + Codex(566 美元)的四倍以上,成績卻低兩個百分點。
2026 年 6 月 12 日,UC Berkeley 研究團隊發布了一份讓業界難以忽視的基準報告。這份名為 ALE(Agents' Last Exam,智能體最後的考試)的測試,把當前最強的 AI agent 拉進 Siemens NX、Unreal Engine、Adobe After Effects 等真實商業軟體環境,要求它們複製人類領域專家已完成的實際任務。結果出人意料:在 SWE-Bench Pro 上以 80.3% 對 58.6%、在 HLE(Humanity's Last Exam)上以 64.5% 對 52.2% 大幅領先 GPT-5.5 的 Claude Fable 5,在這場「幹活考試」裡卻以 22% 的通過率排在第三,輸給了 GPT-5.5 + Codex 組合的 24%。
ALE 和過去的基準有什麼根本差異?
這份基準的背後團隊並不陌生,MMLU、MATH、CyberGym、ExploitGym 都出自同一批人。ALE 的命名致敬了 2025 年初 Scale AI 與 Dan Hendrycks 主導的 HLE,但考核對象從人類知識邊界轉移到了 agent 的工作能力邊界。
核心差異在於:HLE 是靜態的閉卷答題,給一個問題、收一個答案;ALE 要求 agent 直接操作電腦,在真實軟體介面裡完成從無到有的任務。每道題都來自人類專家已完成的真實專案,涵蓋 55 個行業子領域,從量化交易、基因組分析,到航太工程、腦部影像、動畫特效。整個題庫對齊的是美國聯邦職業分類標準 ONET(Occupational Information Network),也就是按「真實勞動力市場的工作項目」來出題。
出題陣容方面,300 多位領域專家來自 100 多家機構:學術側包含 MIT、Harvard、Stanford、Oxford、Caltech、ETH Zurich,產業側涵蓋 Goldman Sachs、JPMorgan、Meta、Amazon、Adobe、Oracle,由 Snorkel AI 透過 Open Benchmarks Grants 計畫提供資助。規模本身就是一個訊號,這不是另一份週末做出來的基準。
為什麼 Fable 5 在靜態基準贏、在 ALE 卻輸?
這個問題的確定答案目前還沒有,但幾組數字值得拆開看。
ALE 設了三個難度檔:Near-Term(近期可解)、Full-Spectrum(全面覆蓋)、Last-Exam(終極難題)。在最難的 Last-Exam 檔,幾乎所有主流配置通過率為零,全體平均只有 2.6%。而這些題目的理論完成率是 100%,因為每道題都源自人類專家已完成的真實專案。換言之,目前最強的 agent 面對真正複雜的跨工具、多步驟專業任務,仍幾乎全面失守。
較低難度的成績雖然有分,但反差依然清晰。GPT-5.5 在前十名中出現五次,搭配不同框架(Codex、ALE Claw、Cursor CLI 等)拿下第 1、2、4、5、8 名;再加上 GPT-5.4 的一席,OpenAI 家族在前十佔了六位。Claude 系列則是 Fable 5 第三(22%)、Opus 4.7 第九(18.4%)、Opus 4.8 墊底第十(15.8%)。
這背後看起來的關鍵在於:ALE 測試的是長程、多工具的操作鏈,而非單一知識問答。靜態基準的優勢能否轉移到真實任務執行,理論上取決於 agent 架構與工具調用策略,而非純粹的模型知識容量。Fable 5 在知識密集型基準上的壓倒性領先,在這裡幾乎沒有顯現。
成本與效率的代價,數字有多難看?
成績之外,這份報告新增了一欄「Estimated Total Cost(預估總費用)」,讓另一層差距浮上檯面。
Fable 5 跑完全部任務花費 2,315 美元,Opus 4.8 為 1,838 美元,Opus 4.7 也要 1,144 美元。相比之下,GPT-5.5 + Codex 566 美元,Cursor CLI 則只要 174 美元。以通過率換算,Fable 5 花了 Codex 四倍以上的預算,成績卻低了兩個百分點,Opus 4.8 更是支出第二高、得分最低。
時間成本同樣觸目。ALE Claw 跑完全部任務花了約 47 小時,Cursor CLI 約 67 小時,而 Opus 4.8 則耗掉 451 小時,接近 19 天。即使按最寬鬆的部分得分計算,目前綜合得分最高也不過 45.8%,意思是最強的 agent 組合也只拿到不到一半的成績。
對工程團隊而言,這組數字的實際意涵是:如果你正在評估用哪個 agent 跑長週期自動化任務,成本與效率的差距已大到不能只靠靜態排行榜來選型。174 美元的 Cursor CLI 組合,在這份報告裡的表現,比 1,800 美元以上的多個 Claude 組合都更有效率。
ALE 核心作者 Yiyou Sun 在描述這份基準時點出:關於 AI agent 將在 2026 至 2027 年超越人類完成幾乎所有工作的預測到處都是,ALE 就是為了驗證這個說法而設計的。從現在的成績看,最難那一檔的平均 2.6% 給出了一個清晰的現實座標。Fable 5 在靜態基準上的領先是真實的,ALE 的結果也是真實的,兩者並不矛盾,它們衡量的根本不是同一件事。靜態基準測的是模型在已知格式下的推理與知識檢索;ALE 測的是 agent 在開放環境裡完成真實任務的能力,包括工具操作、狀態追蹤與錯誤恢復。而當高自主模型的成本開始以千為單位計算,這個能力缺口的代價就不再只是學術討論。
標籤


