從影片學結構動力學:SDM 如何以凍結特徵解耦運動
SDM 將影片運動拆解為主運動與殘差運動,在凍結的影像視覺變壓器特徵上訓練,避免端到端重訓。
目錄

重點摘要
- SDM 將影片運動拆解為主運動與殘差運動,在凍結的影像視覺變壓器特徵上訓練,避免端到端重訓。
- 在 ProbeMotion 基準測試中,SDM 於 7 項任務裡擊敗 DeltaTok 基準 5 項,並在 SSv2-110k 動作分類上超越平均池化 DINOv2 特徵 20.8 個百分點。
- 作者指出目前的弱合成監督未來可被完全自監督約束取代,但靜態相機基準依賴 VGGT 估計可能引入過濾雜訊。
2026 年 7 月 22 日,Hugging Face Daily Papers 刊登了由 Lukas Knobel、Yuki M. Asano 與 Andrew Zisserman 共同發表的研究論文 Self-Supervised Learning of Structured Dynamics from Videos。這項研究提出名為 SDM 的結構動力學模型,不用重訓底層視覺模型,就能從無標籤影片學到結構化的運動表示。傳統方法往往將影片變化編碼為單一糾纏的潛變數,而 SDM 選擇了一條不同的路徑:它明確將運動分解為主運動與殘差運動兩個元件。這種設計讓模型能更精確地捕捉場景中的主導變化,例如相機移動,同時保留物件自身的動態細節。
SDM 透過在凍結的視覺特徵上解耦主運動與殘差運動,無需重訓底層模型即可實現高效的結構化運動表示,為影片理解與世界模型提供了一條低成本、高可解釋性的自監督演進路徑。
為什麼要解耦主運動與殘差運動?
在處理影片資料時,最大的挑戰之一是區分「相機在動」與「物體在動」。如果兩者混在一起,模型很難理解場景中真正的物理規律。SDM 最核心的創新是它的兩階段架構。第一階段提取一個遞迴運動標記,用來補償場景中的主導變化,這通常對應於相機的移動。第二階段則捕捉經過主運動補償後剩餘的動態,也就是物件自身的運動。這種解耦讓模型能夠更清晰地分離環境變化與物件行為。
研究團隊並未採用端到端的影片模型訓練方式,而是直接在預訓練影像視覺變壓器的凍結特徵上操作。Lukas Knobel 與 Yuki M. Asano 來自 Fundamental AI Lab, UTN,Andrew Zisserman 則來自 University of Oxford 的 VGG 實驗室。他們在論文中提出了一個關鍵問題:「我們研究這種結構化的運動表示是否能從預訓練影像視覺變壓器的凍結特徵中恢復。」這種做法不僅節省了算力,也利用了現有大型視覺模型已經學會的豐富特徵。
這種架構與潛在動作模型形成鮮明對比。潛在動作模型傾向於將影片變化表示為單一糾纏的潛變數,或者使用未結構化的空間密集轉換標記。SDM 則堅持結構化,將時間變化明確分為主要與殘差元件。這種設計讓模型處理複雜場景時更有可解釋性,後續也更容易模組化複用。
弱監督與自監督的訓練策略
SDM 的訓練過程結合了弱合成監督與自監督學習。研究團隊使用來自 Kubric 資料的場景與相機標籤作為弱合成監督,這提供了一種輕量的指導訊號。同時,他們在 Something-Something v2 與 DL3DV 等無標籤真實影片上進行自監督學習。這種混合策略讓模型既能利用合成資料的精確標籤,又能從大量真實資料中學習到泛化能力。
作者也坦承,這種弱場景級的合成監督,理論上完全可以用自監督約束取代。這意味著 SDM 的架構本身具有向完全無監督方向演進的潛力。目前使用合成標籤僅是為了加速訓練過程或提供初始引導,而非模型運作的必要條件。這種設計彈性對未來大規模部署非常關鍵,因為完全自監督的方法不需要人工標註,可以無限制擴充套件到網路上的海量影片資料。
這種訓練策略與近期其他研究形成了有趣的呼應。例如,2026 年 6 月 Wayve 與 Simon Fraser University 發表的 LA-Pose 研究,同樣透過自監督從大量無標籤駕駛影片中學習隱式運動特徵,然後以極少的 3D 標註適應相機位姿估計任務。LA-Pose 在 Waymo 與 PandaSet 基準測試上超越了頂級前饋相機位姿方法超過 10%,同時將標註需求降低了一到兩個數量級。這顯示出自監督學習運動特徵的趨勢正在多個領域發酵,從一般影片理解到自駕車感知,研究者都開始重視從無標籤資料中挖掘結構化資訊。
基準測試表現與潛在限制
為了評估 SDM 的能力,研究團隊構建了 ProbeMotion 基準測試套件,涵蓋七項任務:Kubric、DL3DV、CameraBench、Static DAVIS2017、YouTubeVOS 以及 SSv2-110k 動作識別。在這些任務中,SDM 於 7 項基準測試裡的 5 項上擊敗了 DeltaTok 基準線。這顯示結構化運動表示在多種下游任務中明顯更具優勢。
特別值得注意的是在 SSv2-110k 動作分類任務上的表現。SDM 比起平均池化的 DINOv2 特徵,足足進步了 20.8 個百分點。這是一個顯著的差距,表明單純對影像特徵進行平均池化會遺失大量關鍵的動態資訊,而 SDM 的結構化運動標記能有效捕捉這些資訊。此外,儘管 SDM 使用的監督訊號遠弱於 3D 重建模型,它在多項任務上仍能匹配或超越 VGGT、Depth Anything 3 與 Pi3X 等強監督基準模型。這進一步證明結構化運動表示既有效率又有效果。
然而,研究也存在已知限制。ProbeMotion 中的靜態相機基準測試依賴於 VGGT 估計的相機運動,這可能引入過濾雜訊。如果相機運動估計不準確,可能會影響殘差運動的提取質量。
從結構動力學到世界模型的未來
SDM 的出現不僅僅是一個新的影片理解模型,它指向了世界模型訓練的一個核心瓶頸:合成資料必須物理可信且能驅動真實策略迭代,而非只是效果出色的展示影片。
SDM 透過結構化運動表示,讓模型不僅看到畫面變化,更理解變化的來源與結構。這種理解對於後續的模型微調或訓練資料整理至關重要。
對於技術背景的創業者與工程師而言,SDM 提供了一條低成本提升影片理解能力的路徑。無需重新訓練龐大的底層模型,僅在凍結特徵上新增輕量級的運動解耦模組,就能獲得顯著的效能提升。這種架構也為未來的完全自監督學習奠定了基礎,隨著弱合成監督被完全自監督約束取代,模型將能從無限的網路影片資料中持續學習。
目前看來,結構化運動表示可能成為連結影像理解與世界模型的重要橋樑。它不僅解決了當前影片模型中運動資訊糾纏的問題,也為環境持久化與模組化複用提供了技術基礎。隨著 LA-Pose 等相關研究的推進,自監督學習運動特徵的趨勢勢必影響更多領域。對於正在構建 VLA 或世界模型的團隊來說,關注這類結構化表示方法,或許比單純堆疊引數更具戰略意義。
SDM 的發表標誌著影片理解從黑盒潛變數向可解釋結構表示的轉變。雖然目前還有完全自監督約束如何具體實現、以及靜態相機基準測試中的雜訊等技術細節待釐清,但它的核心思路顯然極具潛力。在算力日益昂貴的今天,這種高效、結構化且可擴充套件的方法,無疑為業界提供了一個值得深入探索的方向。


