Looped Transformers 是什麼?不微調就提升凍結模型推理能力的方法
2026 年 6 月 13 日,論文「Training-Free Looped Transformers via Numerical ODE Integration」提出免 fine-tune 方案,讓凍結的語言模型在推理期間多走幾輪計算。
目錄
重點摘要
- 2026 年 6 月 13 日,論文「Training-Free Looped Transformers via Numerical ODE Integration」提出免 fine-tune 方案,讓凍結的語言模型在推理期間多走幾輪計算。
- 在 87% 的測試組合中觀察到正向增益,MMLU-Pro 提升 +2.64 分、GPQA 提升 +2.01 分,硬知識題型效果最明顯。
- 此為單篇論文自述,尚無第三方覆核;增益幅度溫和,但無需修改現有 checkpoint 的特性讓它值得追蹤。
大型語言模型(Large Language Model,LLM)的標準執行路徑只走一次:輸入進去、每層跑一輪、輸出出來。2026 年 6 月 13 日,一篇題為「Training-Free Looped Transformers via Numerical ODE Integration(免訓練迴圈轉換器)」的論文拋出一個問題:訓練完的凍結模型裡,是否還藏著未被用完的推理容量?論文給出的答案是可以透過推理時算力(inference-time compute)的方式去榨,而且不用動一個權重。
直接重複層數為何會壞掉?
第一個反應可能是:重複跑幾次不就好了?問題出在 Transformer 的層之間有隱性的格式契約。第 N 層的輸出,是專門設計來餵給第 N+1 層的;把它迴圈回第 N 層自己,等於用分佈不對的輸入去餵一個對輸入非常敏感的函數。結果不是效果打折,而是輸出直接崩壞。
這道牆,讓「直接在推理時加層數」的想法幾乎沒有人認真做過。推理時算力的研究過去大多繞道走:讓模型多生幾個 token 來「想久一點」,而非讓同一層的計算本身變深。這篇論文試圖正面突破這個限制。
ODE 積分怎麼讓迴圈變得可行?
論文的核心洞察是把 Transformer 的每一層類比成常微分方程(Ordinary Differential Equation,ODE)求解過程裡的一個步長。標準前向傳播等同於用一個「大步長」一步到位解 ODE。
ODE 數值積分有個經典技巧:用多個帶阻尼的小步長取代一個大步長,在數值穩定性和精度之間取得平衡。論文把這個邏輯搬進 Transformer,把一次大步的層計算,拆成多個阻尼小步的迴圈。每一小步輸出都帶有阻尼係數修正,讓下一步的輸入保持在合理分佈範圍內,理論上可以繞開「格式契約不相容」的問題。
效果等同於讓凍結的模型在同一層多停幾輪,也就是在推理期間多花了計算預算。整個過程不動原始權重、不需要 fine-tuning、直接套在既有的 checkpoint 上,這讓它比需要重新訓練的改良方案門檻低很多。
數字說明了什麼,又有哪些保留?
論文在 MMLU-Pro 觀察到 +2.64 分的提升,在 GPQA(衡量研究生等級硬知識推理的 benchmark)上提升 +2.01 分,在 87% 的測試組合中維持正向增益。這三個數字放在一起,傳遞的方向一致:方法在硬知識型題目上最有感,且大多數情況下不會讓模型變差,這在改動推理架構的實驗裡算是相對乾淨的結果。
不過有幾點需要保持保留。增益幅度屬於溫和等級,在競爭激烈的 benchmark 排行榜上不算顯著的跳升。更重要的是,這是論文自述的數字,截至發布時沒有獨立第三方覆核。MMLU-Pro 和 GPQA 雖然是相對嚴格的評測工具,但 benchmark 表現與實際部署場景之間仍有落差。硬知識題型以外的效果,論文也沒有提供足夠系統性的分析,那剩下的 13% 失效案例是隨機雜訊還是有規律,目前也不清楚。
對工程師和開發者的具體意涵是什麼?
這篇論文最值得追的地方,不只是那幾個分數,而是它暗示的方向:訓練完的模型,在已凍結的權重裡可能還有我們尚未充分動用的推理容量。
對正在評估「要不要 fine-tune 現有模型」的團隊,這個方向提供了另一個問法。與其問如何改模型,或許也可以問:推理時的計算預算是否真的被充分使用了?如果免微調的迴圈機制最終能在更廣泛的場景下穩定運作,部署端的算力分配策略就需要重新盤算。特別是硬知識密集的垂直應用,+2 分的 benchmark 提升在實際輸出品質上可能對應到有感的差異。
從工程實驗的角度看,不需要新資料集、不需要 GPU 密集的訓練循環,只在推理層加上這套積分邏輯就能測試效果,讓驗證成本遠低於多數模型改良方案。
推理時算力這條路線,過去主要集中在「讓模型生更多 token 來想更久」。這篇論文的切入點不同:讓同樣的 token 預算,在架構層面走得更深。如果舊權重真的藏著這麼多尚未榨乾的容量,那下一個值得問的問題是:除了層迴圈,還有哪些架構維度可以被數值積分的視角重新打開?這個問題目前沒有答案,但它的尺度,看起來比這篇論文本身更大。
標籤


