行情

Qwen3.8-Max 是什麼?Agentic 能力登 Artificial Analysis 全球第一、超越 Claude/GPT

8 月 6 日,Artificial Analysis 公佈新一期 Agentic Index(agent 能力指數)排名,阿里巴巴 Qwen3.

Qwen3.8-Max 是什麼?Agentic 能力登 Artificial Analysis 全球第一、超越 Claude/GPT

Qwen3.8-Max 是什麼?Agentic 能力登 Artificial Analysis 全球第一、超越 Claude/GPT

8 月 6 日,Artificial Analysis 公布新一期 Agentic Index(agent 能力指數)排名,阿里巴巴 Qwen3.8-Max 以 55.4 分登頂,超越 Claude Opus5 和 GPT5.6。Agentic Index 衡量的是模型調用工具、處理複雜問題的能力,比一般問答或推理基準更接近 AI 真正落地自動化工作流的條件,也因此長期被視為衡量模型是否能「幹活」的核心指數。這個類別的榜首此前長期由 Claude 和 GPT 家族佔據,中國模型從未拿過冠軍。

數字上的對照很具體:中國模型在 Agentic Index 的前紀錄是 Kimi K3 的 50.1 分,Qwen3.8-Max 這次推到 55.4 分,拉開 5.3 分,同時越過了此前佔據頂部的 Claude Opus5 和 GPT5.6。要留意的是,這篇公告由阿里巴巴提供給量子位轉載,Artificial Analysis 是排名數據的來源,但文章選材與詮釋的口徑出自阿里方面,不是 Artificial Analysis 的獨立分析。這個細節決定了應該如何看待這份成績:數字本身仍具參考價值,但框架由發文方控制。

對正在評估 agent 底座的工程師和創業團隊,這條訊息值得放進選型清單。Agentic 能力決定模型能否在複雜工作流裡自主串起多步驟任務,是 AI 落地專業場景的核心門檻,也是純問答指標無法反映的東西。Qwen3.8-Max 的 55.4 分目前看來是中國模型在這個維度第一次真正越過西方前沿,這意味著選型時不應再把國產模型擺在「備選」位置。但單一榜單不等於全面驗證:工具生態的完整度、邊緣案例的穩定性,正式上線前都需要自行跑測試確認。

標籤

#qwen3.8-max#qwen agentic 能力#artificial analysis 榜單#阿里通義千問#ai agent 模型排行

繼續閱讀

查看全部 →
NewsAI 快訊

什麼是 Looped Transformer?GPT-6 Astra 的循環深度與隱藏思維鏈解析

上週,OpenAI 發布 GPT-6 Astra,ARC-AGI-3 得分達 99.9%,前代 GPT-5.6 Sol 同基準測試集只有 7.8%;3D 算圖、數學與程式碼任務的進步幅度格外突出

DeltaMedia 編輯部8 分鐘
NewsAI 快訊

Omen Alpha 是什麼模型?价格、速度實測與 flash 級編碼模型對比

匿名模型 Omen Alpha 5 天登上 OpenCode 呼叫榜第七,flash 定價下速度換智力的取捨浮上檯面

DeltaMedia 編輯部2 分鐘
NewsAI 快訊

GPT-6 Astra 需求塞爆!OpenAI 主管示警:Pro 訂閱恐被迫喊卡

OpenAI 核心產品負責人 Thibault Sottiaux 於 2026 年 9 月 9 日在 X 平台發文明示警,GPT-6 Astra 的使用者需求已超出公司歷史部署經驗,若情況持續,可能不得不暫時暫停新的 Pro 訂閱。

DeltaMedia 編輯部7 分鐘
NewsAI 快訊

神秘模型 Omen Alpha 憑極速低價橫掃榜單,實測卻爆邏輯短板引發效能爭議

Omen Alpha 上線 5 天後仍居 OpenCode 呼叫量榜單第七,在免費模型 Muse Spark 1.3 Contributor 的競爭下展現強大吸引力,其身分成謎引發社群熱議。

DeltaMedia 編輯部5 分鐘