News
Loading market feed...
News 快訊

Z.ai 發布 GLM-5.2 奪開源模型智能指數第一,前端排名第二

2026 年 6 月 13 日發布的 GLM-5.2 是 753B 參數、MIT 授權的混合專家架構(MoE)模型,在 Artificial Analysis Intelligence Index 92 個參評模型中得分 51,超越前代 GLM-5 的 50 分,拿下開源模型排名第一

DeltaMedia 編輯部 7 min 2026年6月17日
Z.ai 發布 GLM-5.2 奪開源模型智能指數第一,前端排名第二
目錄

Z.ai 發布 GLM-5.2 奪開源模型智能指數第一,前端排名第二

重點摘要

  • 2026 年 6 月 13 日發布的 GLM-5.2 是 753B 參數、MIT 授權的混合專家架構(MoE)模型,在 Artificial Analysis Intelligence Index 92 個參評模型中得分 51,超越前代 GLM-5 的 50 分,拿下開源模型排名第一
  • 前端程式碼競技場 Elo 1,595 排名第二,唯一排名更高的 Fable 5 目前可用狀態未確定;SWE-Marathon(13.0)與 NL2Repo(48.9)兩項長時程任務上,與 Claude Opus 4.8 仍有具體差距
  • Z.ai 已於 2025 年 1 月被列入美國商務部實體清單,仍以「激進開放」(radical openness)為策略主軸,以 MIT 授權釋出模型,API 定價維持 $1.40/M 輸入 token、$4.40/M 輸出 token

2026 年 6 月 13 日,Z.ai(智譜 AI)發布 GLM-5.2,這是一個採用 MIT 授權的 753B 參數混合專家(Mixture-of-Experts,MoE)模型,每個 token 僅啟動 40B 參數。根據 Artificial Analysis 的 Intelligence Index,GLM-5.2 在 92 個參評模型中得分 51,超越前代 GLM-5 的 50 分,拿下開源模型排名第一。CryptoBriefing 指出,這是 Z.ai 在大約四個月內推出的第四個主要 GLM 版本,發布日期距 Z.ai 於 2026 年 1 月 8 日以代號 2513 在香港交易所掛牌、募資約 5.58 億美元,僅過五個月。排名第一建立在架構層面的幾個選擇上,而那些選擇後面,帶出了一批仍待確認的問題。

一百萬 token 視窗背後,架構做了什麼?

Context window 是 GLM-5.2 最直觀的規格變化:前代 GLM-5.1 是 20 萬 token,GLM-5.2 是 100 萬,增幅五倍。長 context 推理在計算上代價不低,GLM-5.2 在架構上改了兩個地方,直接壓住成本。

第一項是 IndexShare。這個機制讓四個稀疏層共用同一個 indexer,而非各自維護獨立索引。Latent Space 的技術摘要指出,IndexShare 讓 GLM-5.2 在 100 萬 token context 下,每個 token 的浮點運算量降至原本的 2.9 分之一。視窗大幅擴張的同時,推理成本的增幅受到壓制,IndexShare 就是為了這個設計的。

第二項是增強版多 token 預測(Multi-Token Prediction,MTP)。改良後的 MTP 讓推測解碼(speculative decoding)的接受率提升最多 20%,在相同硬體條件下提高輸出速率。

訓練資料量方面,GLM-5.2 使用了 28.5 兆 token,每次最大輸出為 131,072 token。MIT 授權下,商業部署不設額外條件,可下載、修改、部署,無地區或商業限制。在前沿規模的開源模型中,這是一個清楚的定位選擇。成本壓住了,授權確定了,競技場排名才是下一個要看的地方,而那裡有個問題還沒落定。

前端第一還是第二?Fable 5 的狀態讓定論無法確認

GLM-5.2 在多個競技場上拿出清楚的排名數字。根據 Latent Space 的報導,GLM-5.2 在 Design Arena 以 Elo 1,360 排名第一,在 Agent Arena(Max)是開源模型第一、整體第十,在前端程式碼競技場(Code Arena Frontend)則以 Elo 1,595 排名第二。三個競技場各有不同的評估場景,Design Arena 側重視覺設計生成,Agent Arena 測代理任務能力,Code Arena 前端類別專注於前端程式碼產出。

但前端「第一或第二」這個問題,目前卡在 Fable 5 上。Fable 5 是 Code Arena 前端排行榜上唯一排名高於 GLM-5.2 的模型,Latent Space 指出,Fable 5 在 GLM-5.2 發布當週因近期存取限制,可用狀態未確定。存取限制的確切性質,目前無從從現有資料得到確認。前端排行榜第一目前懸置,要等 Fable 5 的可用狀態確認才能落定。

撇開 Fable 5 不談,GLM-5.2 與 Claude Opus 4.8 的比較提供了較穩定的對照點。Digital Applied 的分析顯示,FrontierSWE 上 GLM-5.2 得 74.4%,Opus 4.8 為 75.1%,Digital Applied 將此描述為接近統計誤差的差距。SWE-bench Pro 上,GLM-5.2 得 62.1,Opus 4.8 為 69.2,GLM-5.2 在開源模型中排名最前。Terminal-Bench 2.1 的代際進步最具體:GLM-5.2 得 81.0,前代 GLM-5.1 為 63.5,提升了 17.5 分,是已有前後代數字對照中幅度最清楚的項目。

Build Fast With AI 的評測報告指出,Z.ai 在 GLM-5.2 發布時並未公布官方評測分數,上述排名與數字均來自第三方獨立評測,並非 Z.ai 官方資料。短任務上的位置到這裡大致清楚,長任務的數字才是下一個要看的地方。

長任務上的缺口,資料有多清楚?

短任務強、長任務掉分,這個對比在 GLM-5.2 的評測資料裡相當一致。

Digital Applied 列出了兩個最具體的缺口。NL2Repo 上,GLM-5.2 得 48.9,Claude Opus 4.8 得 69.7;SWE-Marathon 上,GLM-5.2 得 13.0,Opus 4.8 得 26.0,後者分數是 GLM-5.2 的兩倍。SWE-Marathon 衡量模型在長時間、跨多步驟工程任務中持續維持準確度的能力;NL2Repo 測的是從自然語言需求生成完整程式碼倉庫。Digital Applied 明確將這兩項標注為 GLM-5.2 的「已知弱點」。

這兩個數字對工程團隊選型有直接意義。GLM-5.2 在前端 UI 生成、設計迭代、Terminal-Bench 等相對集中的短任務上有具體排名支撐;但在需要長時間追蹤大型程式碼庫脈絡、連續執行多步驟代理任務的場景下,與 Claude Opus 4.8 的差距目前仍可量化,不是模糊的描述性概括。

有了 1M context window,模型能讀入更長的輸入;但 SWE-Marathon 和 NL2Repo 的資料顯示,在長時程多步驟任務上,仍有具體差距。對想在生產環境用開源模型跑長時程工程代理的工程師,這是選型前需要確認的具體數字。技術評測說到這裡,GLM-5.2 還有一個面向沒交代完:Z.ai 本身在什麼樣的外部框架下推出這個模型。

在實體清單上做開放策略,Z.ai 的邏輯是什麼?

GLM-5.2 的技術成績有一個不能忽略的外部框架。2025 年 1 月,Z.ai 被美國商務部列入實體清單,理由是國家安全顧慮。2026 年 1 月 8 日,Z.ai 以「Knowledge Atlas Technology Joint Stock Co., Ltd.」(代號 2513)身分在香港交易所掛牌,募資約 5.58 億美元。GLM-5.2 是實體清單事件與香港上市兩個節點之後,Z.ai 在 2026 年 6 月推出的最新版本。

Z.ai 沒有迴避這個框架,立場說得直接。AIToolly 引述 Z.ai,公司希望確保「在國際 AI 存取限制愈來愈多的當下,前沿智能對所有開發者仍可取用」,Z.ai 稱這套策略為「激進開放」(radical openness)。MIT 授權是最直接的實現方式:無地區限制、可商業部署、原始碼可修改。

這套策略對特定開發者社群有明確的吸引力,尤其是在 AI 工具取得受到地緣政治影響的地區。不過,MIT 授權在技術層面消除取用門檻,不等於所有機構在採用來自實體清單企業所發布模型時都沒有合規層面的考量,具體視機構性質與所在地區的法規框架而定。「激進開放」的策略宣示與實體清單的限制同時成立,是 GLM-5.2 在特定市場推進時的實際結構。

API 定價方面,GLM-5.2 維持與前代 GLM-5.1 相同的費率:輸入 $1.40/M token、輸出 $4.40/M token、快取 $0.26/M token。

GLM-5.2 在評測資料裡提供了兩類資訊:可量化的優勢,以及同樣可量化的缺口。Design Arena 第一、Agent Arena 開源第一、FrontierSWE 縮窄至接近統計誤差、Terminal-Bench 2.1 代際提升 17.5 分,這些是具體的能力座標;SWE-Marathon 13.0 和 NL2Repo 48.9,這些是當前開源前沿在長任務上仍存在的具體距離。Z.ai 以四個月四版的節奏推進,選用 MIT 授權、維持上代定價,以「激進開放」為旗幟,在實體清單的外部框架下持續發布。兩個待確認的問題:Fable 5 可用狀態何時明朗,前端排行榜第一的定論才能落地;Z.ai 是否在發布後補出官方評測數字,影響第三方評測之外有沒有另一組基準可以對照。這兩個問題目前都沒有答案。

繼續閱讀