Multilingual Model Scaling Laws

Multilingual model scaling laws 是把模型大小、訓練資料量、語言數量與語料混合一起建模的訓練決策框架。google-research-blog 的 ATLAS 研究指出,非英語與多語模型不能直接沿用英語中心 scaling law,因為新增語言會帶來 capacity tax,但相近語系與文字系統也會產生 positive transfer。

ATLAS 的方法

ATLAS(Adaptive Transfer Scaling Laws)用 774 次訓練實驗建立多語言 pre-training / fine-tuning 判準,模型規模從 10M 到 8B 參數,資料涵蓋 400+ 語言,並在 48 種語言上評估。它把資料來源拆成三類:目標語言、經驗上有幫助的 transfer languages、其他語言,藉此估算哪些語言混訓會幫助或干擾目標語言。

核心輸出有三個:

  • Cross-lingual transfer matrix:量化語言 A 對語言 B 的幫助或干擾;共享文字系統或語族通常更有正向 transfer。
  • Multilingual scaling rule:同時考慮模型大小 N、資料量 D、語言數 K;例如語言數翻倍時,ATLAS 估算需約 1.18x 模型大小與 1.66x 總資料量才能抵消 multilinguality 的 capacity tax。
  • Pre-train vs fine-tune crossover:在低 compute / token budget 下,從強 multilingual checkpoint fine-tune 通常較划算;當預算高於特定 crossover point,從目標語言或目標混合 pre-train 可能追上並超越。

為什麼重要

這個概念補強 test-time-compute-evaluation 的模型選型視角:多語模型的品質不能只看單一 benchmark 或總參數量,還要揭露語言分布、transfer 假設、token budget 與評估語言。對產品團隊來說,ATLAS 把「支援更多語言」變成可預算化問題:要新增語言時,先估算是否有相近語言 transfer、資料是否足夠、以及 fine-tune checkpoint 是否已經比從零訓練更省。

它也提醒 model-harness-fit:同一模型在英文任務貼合,不代表在低資源語言、混合語料或本地化產品中仍貼合。多語產品的 harness 應把語言分布、script / language family、fallback 語言與跨語言退化列入 eval,而不是只沿用英文回歸測試。

AI Ark 判準

  • 比較 multilingual / local language 模型時,記錄評測語言、語料混合與 token budget。
  • 新增語言支援前,先查語系/文字系統相近語言是否可提供 transfer,而不是平均灑資料。
  • 預算有限時,優先測 fine-tune 強 multilingual checkpoint;只有當 token / compute 足以跨過 crossover point,才考慮從頭 pre-train。

相關頁面