News 快訊
RoPE 的位置增量不必固定為 +1,而這件事讓模型開口說話了
1/ RoPE 的標準假設:每個 token,位置計數器 +1,固定不變。
DeltaMedia 編輯部 1 min 2026年6月8日
1/ RoPE 的標準假設:每個 token,位置計數器 +1,固定不變。有人問:如果讓模型自己學每個 token、每一層各自的位置增量呢?實驗結果讓人意外,效能完全偵測不到差異。但學出來的增量,開始洩漏一件事:模型認為 token 之間的距離是多少。
2/ 在 6 層、byte-level 的小模型上,觀察到的現象是:L0 的增量與標點符號邊界高度對齊;L3 看起來更像是概念層次的分群。不同層,模型對「距離感」的定義不同,這不是人為設計的,是從資料裡學出來的結果。
3/ 可解釋性的角度:這可以當作 attention map 之外的第二個探針。attention 告訴你模型「在看哪個 token」,位置增量告訴你模型「認為這些 token 有多遠」。兩者量的是不同維度,理論上能互補而非替代。
4/ 作者沒有過度宣稱:他明確說這仍是「找問題的解法」,目的是多增加幾盞路燈,而非提出定論。可解釋性研究最常見的陷阱,就是把燈光誤認成答案,這篇選擇誠實說出邊界,反而是它值得關注的理由。


