今日の進捗

  • LLMの性能則に関する論文を読んだ

    title: “Performance Law of Large Language Models”
    author: Chuhan Wu, Ruiming Tang
    year: 2024
    link: Performance Law of Large Language Models(Wu & Tang, 2024)

  • モデルの性能と計算資源の関係について考えた

  • 極小モデルの複数協調について考えた

  • フラクタル的なモデル構造を考えたが2016年に論文が出ていたことを確認

    title: “FractalNet: Ultra-Deep Neural Networks without Residuals”
    author: Gustav Larsson, Michael Maire, Gregory Shakhnarovich
    year: 2016
    link: FractalNet: Ultra-Deep Neural Networks without Residuals

メモ

  • モデル構造と学習条件からベンチマーク性能を予測できれば,その性能予測式を逆に利用して,「一定性能以上」という制約下で学習計算量や推論計算量を最小にするモデル構造を探索できるのではないかと考えた。

  • 当初は既存モデルのデータを集めてシンボリック回帰により経験式を求めようとしたが,N・h・d・S・TからMMLUを予測するPerformance Lawという先行研究がすでに存在した。(前述の論文)

  • 一方,この式にはtraining infrastructureのprecision lossを表す γ が含まれ,論文では通常 γ=1 と仮定されている。未知モデルに対して γ を客観的に決定する方法は示されていないため,未知architectureの性能予測にはこの仮定に由来する不確実性が残る。


  • 「単一のモデルを大きくするのと,極小モデルを協調させるのとでは,同じ計算予算ではどちらが高性能か」この分野に最近興味がある

  • 極小モデルの協調は先行研究があったが,「どこまで各ノードを小さくできるか」は見当たらなかった。ここは興味があるのでトライする価値はありそう。


  • 論文はChatGPTに日本語翻訳させてオリジナルペーパーと並行して読んでいるが,いつまでこの読み方が許されるのだろうか。

  • 最前線との距離の遠さに目が眩むのと同時に,さすがレッドオーシャンなだけあるなと思った(そんなことを言えるレベルでは到底ないが)。

  • チョコとコーヒーがないと作業できない体になってしまった。

今後の予定

関連リンク