行情

dair_ai 與 rishi_desai2 用 ALE、SWE-Marathon 重設 agent 評測門檻,最難任務通過率僅 2.6%

衡量 agent「能不能用」的標準正在發生結構性轉移:從刷 SWE-bench 式的短切片高分,移向能否在真實職業情境下完成有經濟價值的長程工作。

dair_ai 與 rishi_desai2 用 ALE、SWE-Marathon 重設 agent 評測門檻,最難任務通過率僅 2.6%

dair_ai 與 rishi_desai2 用 ALE、SWE-Marathon 重設 agent 評測門檻,最難任務通過率僅 2.6%

衡量 agent「能不能用」的標準正在發生結構性轉移:從刷 SWE-bench 式的短切片高分,移向能否在真實職業情境下完成有經濟價值的長程工作。多組新評測在同期集中浮現,共同指向這個方向,而在最難一檔任務上,目前 agent 的平均全通過率僅 2.6%。

dair_ai 推出 Agents' Last Exam(ALE),收錄 1,000 筆以上任務,依美國職業分類系統對映到具體崗位工作,最高難度層平均全通過率 2.6%。rishi_desai2 同期發布 SWE-Marathon,測試 coding agent 能否在 1B token 預算內保持連貫,任務包括建構 Slack clone、將 JAX 改寫為 PyTorch、從頭實作 C 編譯器。omarsar0 另點名 Meta-Agent Challenge,讓 agent 嘗試自我改進。

三組評測串起一個訊號:SWE-bench 切片式的高分越來越難直接對映到商業可用性,真正的門檻是長程預算下的指令連貫與職業級完整工作。對 agent 開發團隊而言,這意味著評測策略可能需要跟著調整;而 2.6% 的通過率,看起來說明目前大多數 agent 離被企業真正託付,仍有不小距離。

繼續閱讀

查看全部 →
NewsAI 快訊

什麼是 Looped Transformer?GPT-6 Astra 的循環深度與隱藏思維鏈解析

上週,OpenAI 發布 GPT-6 Astra,ARC-AGI-3 得分達 99.9%,前代 GPT-5.6 Sol 同基準測試集只有 7.8%;3D 算圖、數學與程式碼任務的進步幅度格外突出

DeltaMedia 編輯部8 分鐘
NewsAI 快訊

Omen Alpha 是什麼模型?价格、速度實測與 flash 級編碼模型對比

匿名模型 Omen Alpha 5 天登上 OpenCode 呼叫榜第七,flash 定價下速度換智力的取捨浮上檯面

DeltaMedia 編輯部2 分鐘
NewsAI 快訊

GPT-6 Astra 需求塞爆!OpenAI 主管示警:Pro 訂閱恐被迫喊卡

OpenAI 核心產品負責人 Thibault Sottiaux 於 2026 年 9 月 9 日在 X 平台發文明示警,GPT-6 Astra 的使用者需求已超出公司歷史部署經驗,若情況持續,可能不得不暫時暫停新的 Pro 訂閱。

DeltaMedia 編輯部7 分鐘
NewsAI 快訊

神秘模型 Omen Alpha 憑極速低價橫掃榜單,實測卻爆邏輯短板引發效能爭議

Omen Alpha 上線 5 天後仍居 OpenCode 呼叫量榜單第七,在免費模型 Muse Spark 1.3 Contributor 的競爭下展現強大吸引力,其身分成謎引發社群熱議。

DeltaMedia 編輯部5 分鐘