一個空間塞進比維度更多的概念

2025 年,MIT 的 Yizhou Liu、Ziming Liu 與 Jeff Gore 發表〈Superposition Yields Robust Neural Scaling〉,從模型的表示空間解釋 neural scaling law:為什麼模型變大時,損失往往會沿著可預測的冪次曲線下降。論文後來獲得 NeurIPS 2025 最佳論文亞軍。

大型語言模型要處理的 token 與抽象特徵,遠多於隱藏空間能提供的獨立維度。Anthropic 在 2022 年的 toy model 研究把這種作法稱為 superposition;簡單說,就是讓多個特徵共用、甚至重疊在同一片空間裡。好處是有限維度能容納更多特徵,代價是不同表示之間會互相干擾。

加寬模型減少的是其中一種損失

MIT 團隊用 toy model 控制特徵重疊程度,再檢查不同寬度下的損失變化。在強特徵重疊的情況下,表示向量的幾何重疊會造成干擾,這一部分的損失大致與模型寬度成反比。換句話說,寬度加倍時,因表示干擾造成的損失約可減半。團隊也檢查多個開源 LLM 的 language model head,並指出結果與 Chinchilla scaling laws 相符。

不過,這裡減半的是「受寬度限制的表示損失」,不是模型犯下的所有錯誤。論文另外區分 transformer 層解析與處理資訊造成的損失,也保留語言本身沒有唯一答案所形成的不可消除部分。把公式直接翻成「模型寬度加倍,所有錯誤都減半」,會把研究範圍說得太大。

四格研究圖比較沒有、較弱與較強的特徵重疊,並顯示強特徵重疊時損失會隨模型維度增加而接近一除以寬度的下降曲線。