行情

小米 MiMo 宣稱標準 8-GPU 節點突破 1,000 tokens/s,商用硬體能否繞過 Groq 與 Cerebras 專用路線

小米 MiMo 宣稱旗下 MiMo-V2.

小米 MiMo 宣稱標準 8-GPU 節點突破 1,000 tokens/s,商用硬體能否繞過 Groq 與 Cerebras 專用路線

小米 MiMo 宣稱標準 8-GPU 節點突破 1,000 tokens/s,商用硬體能否繞過 Groq 與 Cerebras 專用路線

小米 MiMo 宣稱旗下 MiMo-V2.5-Pro UltraSpeed 在單台標準 8-GPU 節點上,對 1 兆參數 MoE 模型達到超過 1,000 tokens/s 的輸出速度。關鍵不在數字本身,而在路線選擇:不靠 Cerebras 的晶圓級整合壓縮頻寬瓶頸,也不靠 Groq 的 SRAM 密集架構換取延遲優勢,純用商用 GPU 達成。此為廠商宣稱,尚待第三方覆現。

MiMo-V2.5-Pro UltraSpeed 是 MiMo 系列最新推理優化版本,消息首現於 Reddit r/LocalLLaMA。發文者指出,該 8-GPU 伺服器定位是標準商用規格,非客製化加速器。1 兆參數 MoE 架構因路由機制分流運算,有效運算密度低於全稠密模型,但在商用 GPU 上維持超過千 token/s 仍屬高水準宣稱。

推論上,若數字能被獨立覆現,超高吞吐推理不再強制綁定專用晶片,自建推理棧的工程師在硬體選型上多出一條商用路線,Groq 與 Cerebras 的定價空間也可能承壓。目前這仍是廠商單方宣稱,在第三方基準出爐之前,只宜當成值得追蹤的方向訊號,不宜直接納入技術選型。

繼續閱讀

查看全部 →
NewsAI 快訊

什麼是 Looped Transformer?GPT-6 Astra 的循環深度與隱藏思維鏈解析

上週,OpenAI 發布 GPT-6 Astra,ARC-AGI-3 得分達 99.9%,前代 GPT-5.6 Sol 同基準測試集只有 7.8%;3D 算圖、數學與程式碼任務的進步幅度格外突出

DeltaMedia 編輯部8 分鐘
NewsAI 快訊

Omen Alpha 是什麼模型?价格、速度實測與 flash 級編碼模型對比

匿名模型 Omen Alpha 5 天登上 OpenCode 呼叫榜第七,flash 定價下速度換智力的取捨浮上檯面

DeltaMedia 編輯部2 分鐘
NewsAI 快訊

GPT-6 Astra 需求塞爆!OpenAI 主管示警:Pro 訂閱恐被迫喊卡

OpenAI 核心產品負責人 Thibault Sottiaux 於 2026 年 9 月 9 日在 X 平台發文明示警,GPT-6 Astra 的使用者需求已超出公司歷史部署經驗,若情況持續,可能不得不暫時暫停新的 Pro 訂閱。

DeltaMedia 編輯部7 分鐘
NewsAI 快訊

神秘模型 Omen Alpha 憑極速低價橫掃榜單,實測卻爆邏輯短板引發效能爭議

Omen Alpha 上線 5 天後仍居 OpenCode 呼叫量榜單第七,在免費模型 Muse Spark 1.3 Contributor 的競爭下展現強大吸引力,其身分成謎引發社群熱議。

DeltaMedia 編輯部5 分鐘