今日の進捗
-
LLMの性能則に関する論文を読んだ
title: “Performance Law of Large Language Models”
author: Chuhan Wu, Ruiming Tang
year: 2024
link: Performance Law of Large Language Models(Wu & Tang, 2024) -
モデルの性能と計算資源の関係について考えた
-
極小モデルの複数協調について考えた
-
フラクタル的なモデル構造を考えたが2016年に論文が出ていたことを確認
title: “FractalNet: Ultra-Deep Neural Networks without Residuals”
author: Gustav Larsson, Michael Maire, Gregory Shakhnarovich
year: 2016
link: FractalNet: Ultra-Deep Neural Networks without Residuals
メモ
-
モデル構造と学習条件からベンチマーク性能を予測できれば,その性能予測式を逆に利用して,「一定性能以上」という制約下で学習計算量や推論計算量を最小にするモデル構造を探索できるのではないかと考えた。
-
当初は既存モデルのデータを集めてシンボリック回帰により経験式を求めようとしたが,N・h・d・S・TからMMLUを予測するPerformance Lawという先行研究がすでに存在した。(前述の論文)
-
一方,この式にはtraining infrastructureのprecision lossを表す γ が含まれ,論文では通常 γ=1 と仮定されている。未知モデルに対して γ を客観的に決定する方法は示されていないため,未知architectureの性能予測にはこの仮定に由来する不確実性が残る。
-
「単一のモデルを大きくするのと,極小モデルを協調させるのとでは,同じ計算予算ではどちらが高性能か」この分野に最近興味がある
-
極小モデルの協調は先行研究があったが,「どこまで各ノードを小さくできるか」は見当たらなかった。ここは興味があるのでトライする価値はありそう。
-
論文はChatGPTに日本語翻訳させてオリジナルペーパーと並行して読んでいるが,いつまでこの読み方が許されるのだろうか。
-
最前線との距離の遠さに目が眩むのと同時に,さすがレッドオーシャンなだけあるなと思った(そんなことを言えるレベルでは到底ないが)。
-
チョコとコーヒーがないと作業できない体になってしまった。
今後の予定
- 掲示板の作業
- ベンチマークテストの実施(自分で)
- Quen2.5-7Bをローカルに入れてあるのでそれを使おうかな
- FractalNet: Ultra-Deep Neural Networks without Residualsを読む