银河通用 WAM-TTT 是什么?具身智能测试时训练,用人类视频替代机器人数据
2026 年 7 月 16 日,銀河通用發布 WAM-TTT(World-Action Model Test-Time Training)框架,聲稱首次將 Test-Time Training 模式從 LLM 移植到物理世界的機器人控制。
目錄

重點摘要
- 2026 年 7 月 16 日,銀河通用發布 WAM-TTT(World-Action Model Test-Time Training)框架,聲稱首次將 Test-Time Training 模式從 LLM 移植到物理世界的機器人控制。
- 100 條機器人遙操作軌跡加上 100 段人類影片的混合訓練,官方自報平均任務成功率達 74.1%,與全用遙操作資料訓練的效果基本相當。
- 主模型(WAM)權重全程凍結,場景適配只更新獨立的快速權重記憶(fast-weight memory)模組,採純自監督學習,不需手部姿態標注。
2026 年 7 月 16 日,銀河通用正式發布 WAM-TTT 框架,聲稱這是業界首次把 Test-Time Training(測試時訓練)從語言模型遷移到物理世界機器人控制的系統性嘗試。這套框架主打:機器人不用重新預訓練,也不依賴大量人工遙操作資料,只要看一段未標注的普通人類 RGB 影片,就能在部署端快速適應新環境、新任務。文中引用的成功率數字均為銀河通用官方自報,第三方驗證尚未公開。
具身智能的場景泛化問題,到底卡在哪?
具身智能業界的核心痛點並不複雜:機器人在訓練場景裡精準流暢,但換個地點或換批物件,成功率就大幅下滑。學術上叫泛化衰減,工程上等於每換一個新的部署點位,就要重新採集資料、重新適配模型,整套流程既貴又慢,卡死了規模化部署的可能。
現有主流解法幾乎只指向一個方向:更多遙操作資料。特斯拉 Optimus 的做法是個典型參照,根據銀河通用援引的資訊,特斯拉在加州弗里蒙特工廠維持著上百人的資料採集團隊,每人每天重複同一組動作長達 8 小時。這套方式保證了資料品質,但讓部署成本幾乎沒有壓縮空間。WAM-TTT 試圖打破的就是這條採集鏈。
WAM-TTT 的快速權重記憶,怎麼讓主模型凍結還能現場學習?
WAM-TTT 的底座是一個預訓練完畢的世界動作模型(World-Action Model,WAM),內部由影片專家和動作專家兩個子模組構成,前者負責理解當前畫面,後者負責生成機器人動作,兩者透過聯合注意力(joint attention)機制協調。
整套框架的關鍵設計在於:WAM 主體權重在部署全程凍結,所有學習只發生在一個獨立的輕量化模組,快速權重記憶(fast-weight memory)。這個模組在離線的元訓練(Meta-Training)階段,用成對的人類和機器人示範資料訓練鍵值向量對,讓模型學會把人類影片裡的視覺線索對應到機器人動作邏輯。到了部署端的 Test-Time 階段,系統收到一段未標注的普通人類影片,只更新這個記憶模組,主 WAM 不動。
這個設計和 LLM Test-Time Compute 的路線在邏輯上有些相似:不改底層,把學習空間壓在一個輕量介面上。但從文字換成物理場景的連續視覺訊號,技術難度明顯不同。有個反直覺的消融結果值得注意:在管線裡加入手部姿態估計和動作重定向步驟後,四個任務的平均成功率只剩 28.9%,比原始 WAM-TTT 少了 43.4 個百分點,Table Bussing 任務更從 100% 直接跌至 33.3%。額外的監督信號在這個框架裡反而成了雜訊;純自監督的設計反而效果更好。
人類影片到底能替代多少遙操作資料?
銀河通用的消融實驗提供了一個具體對照基準:訓練資料組合為 100 條機器人軌跡加上 100 段人類影片時,多任務平均成功率達 74.1%,官方描述與全用遙操作軌跡訓練的效果「基本相當」。這意味著,在特定條件下,一段普通人類影片的資料貢獻可以接近一條昂貴遙操作軌跡,如果這個比例能維持,採集成本的結構會發生實質改變。
對照組的表現讓差異更清楚。WAM-COTRAIN 直接把人類示範資料混入聯合訓練,成功率只有 29.8%,甚至低於完全不用人類資料的基線,說明人類影片不是丟進訓練管線就有用。WAM-LoRA 採用 LoRA 參數高效微調方案,在 Table Bussing 和 Swap Place 兩個任務上分別只拿到 30% 和 0%,而 WAM-TTT 在 Table Bussing 任務上達到 100%。三組對照加在一起指向同一個結論:人類影片要發揮效用,關鍵在於框架怎麼設計,單純增加資料量或換個微調策略都不夠。
WAM-TTT 試圖重寫的,是具身智能的訓練成本結構,從「部署前一次性大量採集」轉向「部署後輕量即時適配」。如果這條路線能在更多機器人平台和更多元任務類型上得到驗證,具身智能的瓶頸就不再只是「有沒有資料」,而是「部署後能不能持續進化」。對今天在具身領域發展的工程師和新創來說,這個轉移不只影響訓練管線設計,更動搖了整個規模化商業模式的成本假設。現階段技術還在早期,跨平台可靠性和更大規模的任務驗證都需要第三方確認;但銀河通用這次提出的問題本身,比成功率數字更值得業界認真對待。
標籤


