Anthropic 與白宮共建越獄評估框架,GLM-5.2 以開源之姿逼近封閉模型頂點
Anthropic 的 Claude Fable 模型至 2026 年 6 月 25 日仍處於無法存取狀態,Polymarket 預測其在 6 月 26 日前恢復的機率為 45%,7 月 1 日前恢復的機率為 69%。
目錄

重點摘要
- Anthropic 的 Claude Fable 模型至 2026 年 6 月 25 日仍處於無法存取狀態,Polymarket 預測其在 6 月 26 日前恢復的機率為 45%,7 月 1 日前恢復的機率為 69%。
- Zhipu AI 於 6 月 13 日發布的 GLM-5.2 採用 7440 億引數稀疏混合專家架構,在 SWE-bench Pro 獲得 62.1 分,超越 GPT-5.5 的 58.6 分,但低於 Claude Opus 4.8 的 69.2 分。
- OpenAI 任命 Dean Ball 為戰略未來團隊負責人,同時 Anthropic 推出 Slack 整合工具 Claude Tag,內部產品團隊 65% 的程式碼由其生成。
2026 年 6 月 25 日,Anthropic 的 Claude Fable 模型依然無法存取。儘管市場對其解封抱有期待,Polymarket 上的預測資料顯示,該模型在 6 月 26 日前恢復服務的機率僅為 45%,而在 7 月 1 日前恢復的機率則上升至 69%。這種不確定性背後,是監管與技術安全之間的拉鋸。客戶 Legion 提起了首起針對 Fable 存取權的訴訟,主張商務部未遵循正當程式,且模型輸出出口不應被視為軟體出口,相關管制在《國際緊急經濟權力法》下無效,並援引重大問題原則進行抗辯。LessWrong 電子報作者評估,Legion 的訴訟「大致上是五五波,有機會獲得某種程度的救濟」。
與此同時,白宮與 Anthropic 正共同開發一套正式的技術評估框架,旨在量化 Fable 的越獄嚴重程度。這意味著,模型的解封不再單純取決於商業決策,而是繫結在一個尚未公開具體細節的安全評估標準上。這種將技術風險量化並納入政策考量的做法,標誌著 AI 監管進入了一個更精細、也更複雜的階段。
開源模型能否在效能上挑戰封閉巨頭?
在 Fable 陷入僵局之際,開源領域出現了新的變數。Zhipu AI 於 2026 年 6 月 13 日發布的 GLM-5.2,被視為全新的最佳開權重模型。該模型採用稀疏混合專家架構,總引數約為 7440 億,每個 token 活躍引數約 400 億,並支援 100 萬 token 的上下文視窗,且以 MIT 授權發布。在效能基準測試中,GLM-5.2 展現出強大的競爭力。在 SWE-bench Pro 上,GLM-5.2 獲得 62.1 分,高於 GPT-5.5 的 58.6 分,但低於 Claude Opus 4.8 的 69.2 分。在 Terminal-Bench 2.1 上,GLM-5.2 獲得 81.0 分,低於 Opus 4.8 的 85.0 分。此外,GLM-5.2 在 AIME 2026 數學基準測試中獲得 99.2% 的得分。
這些數字顯示,GLM-5.2 在程式碼生成與數學推理上已接近甚至部分超越主流封閉模型。《Interconnects》電子報作者 Nathan Lambert 指出,GLM-5.2「應該是代理模型的 DeepSeek 時刻」。這句話暗示了開源模型可能在特定應用場景中,複製 DeepSeek 曾經帶來的市場衝擊。然而,GLM-5.2 的訓練過程並非毫無爭議。Patrick Toulme 指控 GLM-5.2 蒸餾了 Claude 和 GPT-5.5,但僅是為瞭解決強化學習的冷啟動問題,而非用於整個模型。這種指控揭示了開源與封閉模型之間日益模糊的界線,以及技術倫理上的灰色地帶。
代理模型與使用者體驗的重構
除了模型效能的競爭,使用者體驗的重構也在悄然進行。Anthropic 推出了 Claude Tag,這是一個新的 Slack 整合工具,允許使用者在提及 @Claude 時啟動自主的 Claude 例項。該工具以非同步方式運作,並能隨著時間學習上下文。目前,Claude Tag 僅向企業和團隊客戶提供測試版。Anthropic 報告稱,其內部產品團隊 65% 的程式碼是由內部版本的 Claude Tag 建立的。這顯示了代理模型在實際開發流程中的滲透率。
OpenAI 創始成員 Andrej Karpathy 將 Claude Tag 描述為「大型語言模型使用者體驗的第三次重大重新設計」。這一評價突出了代理模型在改變人機互動方式上的潛力。從早期的對話式介面,到指令式工具,再到現在的自主代理,使用者體驗的演進正在加速。對於技術背景的創業者與工程師而言,這意味著開發流程將更加依賴於能夠理解上下文並主動執行的代理模型,而非單純的輔助工具。
政策人才流動與選舉中的 AI 議題
在企業與技術層面之外,政策人才的流動也引發關注。Dean Ball 將於 2026 年 7 月 6 日加入 OpenAI,擔任戰略未來團隊負責人,直接向首席戰略官 Jason Kwon 匯報,同時保留其獨立出版物《Hyperdimensional》。評論員 Nathan Calvin 對此表示樂觀,認為這項任命將實質改善 OpenAI 的政策立場。Dean Ball 曾任白宮科技政策辦公室 AI 政策顧問,其加入 OpenAI 可能標誌著該公司在政策溝通上的策略調整。
另一方面,美國政治選舉中的 AI 議題也日益顯性。Alex Bores 在 NY-12 民主黨初選中以 4 個百分點的差距敗給 Micah Lasher,兩方競選活動的總政治行動委員會支出超過 2000 萬美元。值得注意的是,擊敗 Bores 的 Micah Lasher 共同贊助了《RAISE 法案》,這是一項支援 AI 管制的法案。Joshua Achiam 認為,LTF「應該將重量級支援放在 Bores 身上」,因為他在 AI 政策上更為中間派。這場選舉結果顯示,AI 政策立場正在成為政治競選中的關鍵變數,且支援管制的聲音可能在某些選區佔據優勢。
技術爭議與教育體系的衝擊
在技術應用層面,MidJourney 的掃描工具引發了關於醫療實用性的爭議。Scott Alexander 對該工具的醫療效用表示懷疑,並擔心假陽性問題。Matthew Zirwas 最初基於篩選偏見問題駁斥了該掃描工具,但後來改變了立場。Andrew Rkett 則認為,即使該掃描工具僅能為個人提供誤差範圍為 1% 的體脂率資料,也足以證明其產品價值。這些觀點的分歧反映了 AI 在醫療領域應用時的複雜性,以及不同專家對風險與效益的權衡差異。
此外,Taste Labs 獲得了 1850 萬美元融資,旨在構建資料與基礎設施層,為 AI 模型和代理賦予審美品味。這顯示了資本市場對 AI 在創意與審美領域應用的關注。LessWrong 作者 Zvi 則澄清,Anthropic 的 Claude Opus 4.7 和 Opus 4.8 並非模型蒸餾,回應了合作對齊討論中的猜測。
在更宏觀的安全層面,五眼聯盟情報夥伴警告,組織只有「幾個月,而不是幾年」的時間來保護系統免受被歸類為 Mythos 級別的威脅,且這些威脅不涉及人類操作者。這一警告突顯了 AI 安全威脅的緊迫性與自動化特徵。
教育體系也受到了 AI 的衝擊。加州大學柏克萊分校電腦科學課程的 F 級成績在 2025 年至 2026 年間增加了 3 倍至 11 倍,被歸因於 AI 輔助的學術作弊。這不僅是教育誠信問題,更反映了現有評估體系在 AI 時代的失效。當 AI 能夠輕易完成作業與考試時,教育機構必須重新思考如何評估學生的真實能力。
這些事件共同勾勒出一個快速演進的 AI 生態系。從模型效能的競爭到使用者體驗的重構,從政策人才的流動到選舉中的議題博弈,再到技術爭議與教育衝擊,AI 正在深刻影響各個層面。對於技術背景的創業者與工程師而言,理解這些趨勢與衝突,將有助於在未來的競爭中找到定位。GLM-5.2 的崛起顯示開源模型仍具競爭力,而 Claude Tag 的推出則預示了代理模型在開發流程中的主導地位。同時,政策與監管的不確定性,以及安全威脅的緊迫性,要求企業與開發者必須在創新與合規之間找到平衡。


