※注意: ChatGPTによる日本語翻訳と並行して読んだので,原文の用語に相当する日本語が正しいかは未検証。

要点

LLMの一般的能力を示す指標としてのMMLUを経験的に求める式「Performance Law」が提案されている。具体的には「層数N」「隠れ次元h」「中間次元d」「学習データ量T」「モデルサイズS」からほぼ導出できると結論付けられている。0.5B~1,000B超級までの様々なモデルに対して,高精度でMMLUを予測できた(特に高品質データを学習した英語モデルで良好)。

一言で言うと: 既知の定量的な指標によって,LLMの精度を予測する経験式の提案

問題設定

これまでLLMに適用できるスケーリング則の変種が様々提案されてきたが,それらは特定の条件下・モデル群に対してのみ有効であることが多く,一般性には限界があった。また,計算基盤の精度や安定性も考慮されておらず,これらはしばしばモデルの精度を損なっていた。

核心

論文では,より実用的で,MMLUを予測する経験式が提案された。特定の環境下における指標ではなく,広くモデルが持っている要素(層数,隠れ次元…)をもとに高精度でモデルの能力を評価することが確認されている。

主な結果

具体的な経験式 - Performance Law

  • 層数: NN[層]
  • 隠れ次元: hh[次元]
  • FFNの中間次元: dd[次元]
  • 学習データ数: TT[trillion tokens]
  • モデルサイズ: SS[billion parameters]

とした場合,まず次のようにモデル飽和クリップ(model saturation clip) TT'を導入する:

T=min(S,T)T' = min(S, T)

また,モデル不安定割引係数(model unstable discount) uuを次のように定義する:

u=exp((10d+20h)(γN))2u = \exp\Big(-\Big(\frac{10}{d}+\frac{20}{h}\Big)(\gamma N)\Big) ^ 2

ここで,γ\gammaは学習基盤における制度損失を反映する係数(小さいほどhealthy model, 大きいとunhealthy)で,デフォルトではγ=1\gamma = 1とする。
以上を踏まえ,MMLUを予測する対数線形回帰関数を次のように定義する:

MMLU=w1log(uN)+w2log(uh)+w3log(ud)+w4log(uT)+bMMLU = w_1\log(uN) + w_2\log(uh) + w_3\log(ud) + w_4\log(uT') + b

ただし,w1w4,bw_1 \sim w_4, bは回帰パラメータであり,著者らはオープンソースモデル10個を用いてそれらの値を得た。

結果

以下に表1と図1を示す。
表1からわかる通り,様々なレンジのモデルに対してかなり高精度で予測を示した。また,図1からもわかる通り,特に高品質なデータで学習された英語指向モデルで良好な結果が得られている。

表1 55モデルの予測値御報告値

ModelLayerHiddenFFNExpert FFNd′Token / TSize / BAct. / BMoEMMLUPredictionDiff
Llama 7B32409611008--17--35.154.29-19.19
Llama 13B40512013824--113--46.957.35-10.45
Llama 33B60665617920--1.433--57.864.53-6.73
Llama 65B80819222016--1.470--63.468.34-4.94
Llama2 7B32409611008--27--45.358.03-12.73
Llama2 13B40512013824--213--54.861.09-6.29
Llama2 34B48819222016--234--62.663.80-1.20
Llama2 70B80819228672--270--68.970.21-1.31
Llama3.1 8B32409614336--158--66.765.431.27
Llama3.1 70B80819228672--1570--79.381.09-1.79
Llama3.1 405B1261638453248--15405--85.287.64-2.44
Gemma 2B18204816384--32--42.349.64-7.34
Gemma 7B28307224576--67--64.361.582.72
Gemma2 2B2623049216--22--52.254.51-2.31
Gemma2 9B42358414336--89--71.368.482.82
Gemma2 27B46460836864--1327--75.272.442.76
Mistral 7B32409614336--37--60.160.14-0.04
Mixtral 8*7B324096143361433684471370.668.262.34
Mixtral 8*22B5661441638416384-10*1413977.877.510.29
Mistral Large881228828672--7*123--81.278.772.43
Mistral Large 2881228828672--12*123--84.081.682.32
PaLM 540B1181843273728--0.78540--69.370.84-1.54
Falcon 180B801484859392--3.5180--70.773.69-2.99
Text-davinci-002961228849152--0.3175--63.162.710.39
GPT-496*12288*49152*49152*-13183128086.485.830.57
PaLM2 340B96*18432*73728*--3.6340--78.376.351.95
Gemini Ultra200*32768*65536*--11∼1760--90.092.57-2.57
Nemotron 15B32614416384*--815--64.265.78-1.58
Nemotron 340B961843273728--9340--81.181.29-0.19
Gopher 280B801638465536--0.3280--6060.45-0.45
Deepseek-67B95819222016--267--71.372.25-0.95
Deepseek-V2605120153612288-8.12362178.576.831.67
DeekSeek-V2-Lite272048140810944-5.7162.458.357.860.44
Skywork-MoE5246081228812288-8*1462277.474.193.21
Qwen 1.8B24204811008--21.8--44.652.69-8.09
Qwen 7B32409622016--2.47--58.258.78-0.58
Qwen 14B40512027392--314--66.363.043.26
Qwen 72B80819249152--372--77.472.245.16
Qwen 1.5 0.5B2110242816--2.40.5--39.241.18-1.98
Qwen 1.5 1.8B2120485504--2.41.8--46.851.29-4.49
Qwen 1.5 4B2125606912--2.44--56.153.192.91
Qwen 1.5 7B28409611008--47--61.060.060.94
Qwen 1.5 14B40512013696--414--67.664.832.77
Qwen 1.5 32B64512027392--7*32--74.373.301.00
Qwen 1.5 72B80819224576--372--77.572.445.06
Qwen 1.5 110B80819249152--7*110--80.476.813.59
Qwen 2 0.5B248964864--120.5--45.440.704.70
Qwen 2 1.5B2815368960--71.5--56.552.154.35
Qwen 2 7B28358418944--77--70.362.737.57
Qwen 2 72B80819229568--772--84.276.977.23
Qwen 2 57B-A14B2835841894420480-11.5571476.568.248.26
Yi 6B32409611008--36--63.260.222.98
Yi 34B60716820480--334--76.368.737.57
Yi-1.5 34B60716820480--3.634--77.169.727.38
GLM-4 9B40409613696--109--74.768.855.85

(出典: “Performance Law of Large Language Models(Wu & Tang, 2024)“をもとに筆者が再構成)

performance law of llm figure1
図1 異なるモデルにおけるMMLU予測値と報告値。(a)全モデル,(b)英語指向モデル(Llama 1を除外)
(出典: "Performance Law of Large Language Models(Wu & Tang, 2024)")

自分の解釈

  • 一般的に広く適用できる経験式。

疑問と確認事項

  • γ\gammaの定義があまり詳しくわかっていない

  • 逆算的に,限られた計算予算内での最適なモデルの構造を考えることができるのではないかと考えたが,γ=1\gamma = 1と仮定している部分など,未知モデルに対する予測式としては過程による不確実性が依然としてあると思った。

  • 説明変数同士はそれぞれ互いに独立したパラメータなのか,そうでない場合はより簡易的に予測することができないだろうか(要検証)。

  • モデル不安定割引係数(model unstable discount) uu から着想を得て,モデルのキャパシティを構成している要素(N,h,d,S)(N, h, d, S)とそれに対する学習量TTによって新しく「総合健康度」のようなものが定義できるのではないか。

読書履歴

2026-08-10 状態: ざっくり読み 全体を読んだ。次: p3の上部, References

参照先

関連リンク