阿里 Qwen3.7-Plus 打入 Vision Arena 全球前五,多模態閉環 Agent 工作流開放 API
6月2日,阿里巴巴發布 Qwen3.
6月2日,阿里巴巴發布 Qwen3.7-Plus,在全球視覺大模型榜單 Vision Arena 列全球前五、中國第一(廠商自報)。真正的訊號不是「一鍵複刻桌面軟體」的行銷說法,而是模型首次把視覺理解、深度推理、自我編程、工具調用、自驗證迭代整進同一個 agent 迴圈;目前已上線阿里云百炼,開放 API 服務。
能力分五條線:Multimodal Agent 統一處理圖像、視頻、螢幕與文字輸入,並跨 GUI/CLI/工具環境執行任務;Visual Agent 結合程式碼解譯器與搜尋增強處理複雜視覺推理;Visual Coding 從圖像或視頻端到端生成 SVG、網頁與互動前端;GUI Agent 負責移動端與桌面端多步介面操控與任務規劃;Real-world Perception & Reasoning 涵蓋 OCR、文件圖表、視頻及駕駛場景。
多模態模型正沿「統一 agent 工作流」路線收斂,Vision Arena 排名是基礎門票,真正的競爭在「看→想→寫→做→驗」閉環的實際深度。對開發多模態應用的團隊,評估重點應是 Visual Coding 與 GUI Agent 的自驗證迭代品質,這才是 Qwen 切入這條賽道的實質賭注,而非廠商一鍵 demo 的行銷效果。


