W 亂報 Re:Post · w.repost.tw · 自家機房排版印行
相關收藏 · 編輯順手多剪的

網站 · 科技
排版中
W 亂報 Re:Post · w.repost.tw · 自家機房排版印行

網站 · 科技
來源:Yizhou Liu、Ziming Liu、Jeff Gore / arXiv,CC BY 4.0
影片用一串木塊與美元數字,把模型寬度每加倍、訓練成本約增加六倍的推算做成視覺階梯,從 3 億美元一路算到 3,900 億美元。影片裡的成本階梯是推算,不是論文實測價格。另一份 2024 年的前沿 AI 成本研究估計,2016 年以來最耗運算的模型訓練成本平均每年增加 2.4 倍;如果趨勢延續,最大型的訓練工作可能在 2027 年超過 10 億美元。這能說明經濟壓力,卻不能單獨證明模型能力的終點。
成本階梯是影片依假設做的視覺推演。
它不是 MIT 論文直接量到的訓練價格。
論文談的數學限制,是幾何關係決定了受寬度限制的損失大致只能按「一除以寬度」的速度下降。作者認為,在自然語言上很難只靠改變特徵頻率,讓這條曲線變得更快;但在頻率分布非常偏斜的特定領域,仍可能不同。
論文對「何時停止」的回答本身很保守:若模型維度追上需要獨立表示的特徵數量,superposition 消失,繼續加寬就不再減少這一類干擾。但作者也明說,把特徵數量直接連到詞彙量只是一個初步近似;詞彙量可能只是語言中獨立事物數量的下界,因此這條冪次曲線可能延續得更久。
研究也有清楚邊界:核心證據來自簡化的 toy model,它省略 transformer 層;論文沒有研究資料量與訓練步數的 scaling,也沒有證明其他架構、工具使用或推論時運算無法繼續改善模型。研究的是寬度限制,不是 AI 進步的總上限。
研究範圍是特定的寬度擴展機制。
資料量、訓練步數與其他改善路線不在同一個結論裡。
影片上線後,一則高互動留言正是質疑它把「scaling alone has limits」說成「AI progress is over」。Dan Grib 隨後置頂更正,承認舊標題會讓人誤解,並改成目前的「LLM scaling 有硬上限」。不過縮圖與部分旁白仍留著更強的說法。這項研究真正收窄的是「持續加寬就能照同一條曲線改善」的假設,而不是替所有 AI 路線畫上句點。
論文沒有替整個 AI 發展畫上句點。
作者更正影片標題後,界線也更清楚。
原文出處(4)
MIT Just Found a Hard Limit in LLM Scaling, and Money Won't Fix It
影片 · Dan Grib · youtube.com
使用者提交的主要來源
Superposition Yields Robust Neural Scaling
文章 · Yizhou Liu、Ziming Liu、Jeff Gore · arxiv.org
MIT 團隊研究論文
Toy Models of Superposition
文章 · Anthropic · transformer-circuits.pub
superposition 的 toy model 研究
The rising costs of training frontier AI models
文章 · Epoch AI · arxiv.org
前沿模型訓練成本研究

社群貼文 · Reddit