News
Loading market feed...
News 快訊

點雲押注:FP3 的 3D 賭注,與中國具身基座白熱化

機器人基座模型大多吃的是 2D 圖像,這本身是一個先天妥協。

DeltaMedia 編輯部 2 min 2026年6月8日
點雲押注:FP3 的 3D 賭注,與中國具身基座白熱化

點雲押注:FP3 的 3D 賭注,與中國具身基座白熱化

機器人基座模型大多吃的是 2D 圖像,這本身是一個先天妥協。現實空間是三維的,圖像壓縮掉深度資訊,模型靠統計猜物件位置。ICRA 2026 最佳論文提名的 FP3,賭的就是這條縫:用點雲取代圖像,直接輸入 3D 幾何。

FP3 的架構是編解碼器型擴散 Transformer,1.3B 參數,在 6 萬條含點雲觀測的操作軌跡上預訓練。邏輯直接:把語言指令、3D 點雲與機器人本體感測一起編碼,去雜訊出動作序列。實測數字:陌生場景零樣本測試平均成功率超 80%,同場景微調(單卡兩小時、80 組示教)相較主流基線平均提升 60%。相比之下,DP 與 DP3 在多數場景成功率低於 50%,OpenVLA 因缺乏連續動作塊預測整體更差。

論文作者也坦承三個弱點:基座原生零樣本能力偏弱(推測是 DROID 預訓練資料規模不及主流 2D 資料集)、語言端只用 CLIP 嵌入、尚未融合 DINOv2 等成熟 2D 視覺編碼器。這三個缺口都是明確的後續方向。

FP3 論文導師之一、清華 IIIS 助理教授高陽,同時也是千尋智能的聯創兼首席科學家。就在論文入圍同一天,千尋智能宣布 Spirit v1.6 在 RoboArena 登頂,超越 Nvidia Cosmos3 與 Physical Intelligence Pi0.5,成為目前首個登頂該排行榜的中國具身模型,並完成 15 億元 A+ 融資、今年累計近 50 億。另一份 RoboChallenge Table30 榜單排第一的是星動紀元 Era0,千尋智能 Spirit v1.5 排第四,名次流動速度顯示競爭節奏快到幾乎以週計。

幾個對從業者比較直接的觀察:

資料路線分岐正在加速。 點雲資料採集比 2D 圖像麻煩,但 FP3 的結果暗示,若規模跟得上,3D 預訓練資料每條的資訊密度可能高出不少。誰先把點雲資料集做起來,這條路線就有先行優勢。

80 組示教的意義在於落地成本。 下游客戶不需要大量標注資源就能部署新任務,這理論上壓縮了系統整合的邊際成本,對小量多樣的工廠場景尤其關鍵。

學術與商業的距離正在收縮。 FP3 是學術論文,Spirit v1.6 是商業產品,背後是同一個核心研究團隊。這種節奏讓技術驗證和市場反應幾乎同步進行,也意味著論文裡列出的三個弱點,很可能直接成為下一個產品版本的開發清單。

2D 還是 3D、圖像還是點雲,目前沒有定論。但千尋智能用一篇 ICRA 提名論文加一個排行榜登頂,清楚表明他們押的是哪條線。

繼續閱讀