今日の進捗
- LLMの新しい評価指標として「Health Score」を考えている。
- ここでいうHealthは,モデルの絶対性能が高いことではなく,与えられたキャパシティ・構造・学習条件に対して,本来利用可能な能力を不必要に損なわず獲得できている状態を指す。
- 小型モデルでも,そのキャパシティを十分に利用できていれば健康であり,大型モデルでも本来利用可能な能力を十分に獲得できていなければ不健康と評価したい。
Performance Lawからの出発
当初は,Performance Lawに含まれる構造・学習安定性に関する項と,Chinchilla Scaling Lawから着想した学習量とキャパシティの関係を組み合わせて,Health Scoreを作れないかと考えた。
Performance Lawはモデル構造や学習データ量などからMMLUを予測する経験式であり,Chinchillaは一定の計算量のもとでモデルサイズと学習トークン数をどう配分するのが効率的かを経験的に調べた研究である。
しかし,Performance Lawはあくまで経験則である。
そのため,
をそのままモデルの不健康さとみなすと,
- モデル自体の問題
- Performance Lawの予測誤差
- Performance Lawに含まれない要因
- benchmarkの測定誤差
などが混ざってしまう。
よって,
Performance Lawの予測値との差をHealthと定義する方法は採用しない。
Performance Lawは,Healthに関係しそうな変数や構造を考えるための着想源として扱う。
「理想状態」をどう定義するか
Healthを評価するには,比較対象となる「そのキャパシティで本来到達可能な状態」が必要ではないかと考えた。
一度,
- 複数の既存LLMの意味空間を比較する
- それらの共通構造や中心を求める
- それをreference semantic spaceとして利用する
という案を考えた。
しかし,既存モデルから理想状態を作ると,
現在のLLMが共通して持っている構造や欠陥まで「理想」に取り込んでしまう
可能性がある。
そのため,現在は,
既存モデルの性能データには依存せず,理論から理想状態を構築する
方向により興味を持っている。
既存モデルは理論の構築には利用せず,最後の検証対象としてのみ利用したい。
「理想意味空間」という発想
モデルのキャパシティを単なるparameter countではなく,
意味をどの程度区別し,関係を保持して表現できるか
というrepresentation capacityとして考えられないかと思った。
まず無制限のキャパシティを持つ理想的意味表現 を考える。
有限キャパシティ () のモデルでは,それを完全に保持することはできないため,
という最適な圧縮が起こると考える。
そして実モデル () の意味表現 () と, との差を調べれば,
キャパシティ不足では説明できない余分な意味表現の歪み
を求められるのではないかと考えた。
意味をベクトルとして考える場合
最初のtoy modelとして,
意味を構成する原子的featureを互いに直交するベクトルとして置く
というアイデアを考えた。
semantic atomを として,
とする。
「dog」や「cat」のような実際の概念そのものを直交させるのではなく,概念を
のようなsemantic atomsの重ね合わせとして表現する。
すると意味の近さは距離ではなく,
のような角度で表現できる。
Vector Symbolic Architectureでは,高次元ベクトルとbundling/bindingを使ったsymbolic representationが研究されており,そのrepresentation capacityを理論的に解析する研究も存在する。
ただし「意味=ベクトル」とは限らない
意味をベクトル空間で表さなければならない理論的必然性はない。
候補として,
- Euclidean vector space
- hyperbolic space
- manifold
- graph
- tree / hierarchy
- probability distribution
- logical structure
- possible worlds
- conceptual region
などが考えられる。
特に意味には単なるsimilarityだけでなく,
- hierarchy
- inclusion
- entailment
- relation
- composition
などが存在する。
例えば階層構造については,Poincaré EmbeddingsのようにEuclidean spaceではなくhyperbolic spaceを利用することで,階層と類似性を低次元で効率よく表現する研究がある。
したがって,一般理論では最初から
と決めず,
程度まで抽象化しておいた方がよいかもしれない。
「意味の量」を測るという方向
言語学・意味論・情報理論から,意味の「大きさ」を定量化する考え方を借りられないか検討した。
特にInformation Bottleneckでは,
有限の表現能力の中で,必要な情報を可能な限り保持する
という問題を扱う。
Zaslavskyらは,人間の言語における色カテゴリーを,semantic representationの複雑さとaccuracyのtrade-offとしてInformation Bottleneckから説明している。
これは,
という今回の発想と近い。
またsemantic informationを対象としたRate-Distortionの定式化も存在する。
「理論値」より先に「上限」を求める
理想的な有限キャパシティ表現そのものを直接構築するのではなく,
まず理論上の上限・下限を求める
という方向を考えた。
表現品質を (),capacity () で実現可能な表現集合を () とすると,
をcapacity () における理論上限として考える。
ただし, しか証明できていない場合,() は単なるupper boundであり,理論的最適値ではない。
上界を実際に達成可能な構成も示せれば, として理論値を得られる。 つまり,
無限capacityでの上限 → capacity制約による不可避な圧縮 → 有限capacityでの理論最適値
という順番で理論を構築できないかと考えた。
キャパシティ制約による意味干渉
例えば () 個の独立semantic featureを () 次元空間に保存する場合, なら全featureを完全に直交させることはできない。
つまり有限capacityによって,一定の意味干渉が必ず発生する。
この「capacityのために不可避な干渉」と,
実モデルでそれ以上に発生している余剰干渉
を分離できればHealthに利用できる。
最近ではTransformerのlatent spaceについて,近直交なfeature directionを有限次元空間にどれだけ保持可能かというrepresentational capacityを幾何学的に扱う研究もある。
トップダウンからボトムアップへ
ここまでは,
というトップダウン的な考え方だった。
しかし,理想意味構造全体を最初に定義するのは非常に難しい。
そこで,
健康な意味表現なら必ず満たしているはずの局所的な法則を一つずつ定義し,それらを積み上げる
というボトムアップ的な方法を考えた。
例えば以下のような条件が候補になる。
- 独立したsemantic feature同士には不要な干渉が少ない
- 意味的類似関係がrepresentation上でも保存される
- paraphraseなど意味を保存する変換に対して表現が安定する
- compositionによって意味構造が破壊されない
- capacityを増加させたとき,理論的最適distortionが悪化しない
モデル () の各条件に対する違反量を とする。
この時点ではHealthを単一スカラーにする必要はなく, というHealth Profileとして扱うこともできる。
最終的なHealth Scoreは,このような複数の理論的Health componentを積み上げた後に考える。
メモ
-
Healthは「モデルが賢いか」ではない。
-
Healthは「安いか」「コスパがよいか」でもない。
-
現在の定義の中心は,“与えられたcapacityに対して,本来保持可能な能力・意味構造を不必要に損なっていないか”というもの。
-
Performance Lawの予測値と実測値との差をHealthとはしない。
-
Performance Lawは経験則なので,その残差にはモデルの異常と予測式の誤差が混在する。
-
既存モデルから理想値を作る方法も検討したが,既存モデルの共通バイアスを理想に取り込む危険がある。
-
現時点ではTheory Firstの方向に興味がある。
-
既存モデルのデータは理論構築には使用せず,理論完成後のvalidationにのみ利用するのが理想。
-
「理想意味空間」という言葉に固執せず,「理想意味構造」として一般化しておく。
-
意味をEuclidean vectorとして表すことは仮定の一つにすぎない。
-
最初のtoy modelでは,扱いやすさのためにvector representationを仮定してもよい。
-
semantic atomを直交基底とし,複合的な意味をそのsuperpositionとして考える案がある。
-
意味の類似性を距離ではなく角度で評価する案がある。
-
parameter countそのものではなく,
- 有効次元
- 独立semantic directionの保持数
- distinguishable feature数 などを「capacity」と考える方が本質的かもしれない。
-
理論値を直接作るのではなく,
- 無制約での理論上限
- capacity制約
- capacityによって不可避なdistortion
- 実モデルで発生したdistortion
- 不可避distortionを超えた余剰distortion の順で考える。
-
Healthの候補は,
のようなexcess distortion。
-
ただし,() が単なるboundなのか,achievable optimumなのかは必ず区別する。
-
Healthを最初から0〜1の単一スカラーにする必要はない。
-
最初はHealth Profileとして複数componentを持たせてもよい。
-
完全な意味理論を最初から構築するより,
- independence
- similarity preservation
- invariance
- compositionality
- hierarchy preservation などの局所的な必要条件を一つずつ理論化する方が現実的かもしれない。
-
「理想意味空間を設計する」のではなく,
局所的なsemantic lawを満たす表現の集合から,大域的な意味構造が結果として創発する という方向も考えられる。
-
最初の研究対象としては,
() 個の独立semantic featuresを有限次元 () に表現するとき,理論的に不可避なsemantic interferenceはどれくらいか を考えるとかなり小さく切り出せそう。
現在の研究イメージ
現時点では,以下のような流れが最も近い。
ここで () が,
モデルのcapacityそのものでは説明できない余剰歪み
であり,Healthの一構成要素になる可能性がある。
最終的には,
のように,健康に必要な理論的条件を積み上げていく構想も考えられる。
次に考えること
- 「semantic atom」という仮定は本当に必要か。
- semantic atomを仮定しない一般化は可能か。
- 意味表現の数学的構造として何を最低限仮定するか。
- capacityを何として定義するか。
- semantic distortion (D) をどのように定義するか。
- 理論上限だけで十分なのか,achievabilityまで示す必要があるのか。
- 最初のtoy problemをどこまで小さくできるか。
- pairwiseな局所法則だけからglobal semantic structureを構築できるか。
- 「Health」という名称が最終的にも適切かは保留する。
関連論文
-
Performance Law of Large Language Models — Wu & Tang, 2024 モデル構造や学習データ量などからMMLUを直接予測する経験式。今回のHealth理論の直接的な基準ではなく,研究の出発点・着想源。
-
Training Compute-Optimal Large Language Models — Hoffmann et al., 2022 Chinchilla Scaling Law。一定compute下でモデルサイズと学習トークン数をどう配分するかという「capacityとtraining amountの適切な関係」を考える出発点。
-
Efficient human-like semantic representations via the Information Bottleneck principle — Zaslavsky et al., 2018 色カテゴリーを題材に,意味表現をcomplexityとaccuracyのtrade-offとして扱う。有限capacityで意味を効率よく圧縮するという今回の発想に近い。
-
A Rate-Distortion Framework for Characterizing Semantic Information — Liu, Zhang & Poor, 2021 semantic aspectを含む情報源に対してRate-Distortionを定式化する研究。semantic distortionとcapacityの関係を考えるための理論的参考。
-
Poincaré Embeddings for Learning Hierarchical Representations — Nickel & Kiela, 2017 意味・知識の階層構造をEuclidean spaceではなくhyperbolic spaceで表現する。意味表現が必ずしもEuclidean vector spaceである必要はないことを考える上で重要。
-
Capacity Analysis of Vector Symbolic Architectures — Clarkson, Ubaru & Yang, 2023 高次元ベクトルを用いたsymbolic representationについて,必要次元数やrepresentation capacityを理論解析する。semantic atoms・superposition・capacityという方向との接続が強い。
-
Representational Capacity: Geometric Limits on Feature Representation in Transformer Language Models — Guha, 2026 Transformerのlatent spaceに保持できるnear-orthogonal feature directionsの数を幾何学的capacityとして捉える最近の研究。parameter countではなく「区別可能なdirection数」としてcapacityを考える際にかなり近い。