第4節 しかし、計算量だけでは十分ではない〜第9節 データの壁
第4節 しかし、計算量だけでは十分ではない
原報告書は、「計算量を増やせば知能が自動的に増える」という単純な見方を採用していません。
力ずくの探索は、ほとんどの現実的な問題では機能しないからです。
たとえば、チェスには膨大な数の可能な局面があります。
すべての手を最後まで調べることはできません。
現実世界の科学、政策、経営、医療は、チェスよりもはるかに複雑です。
したがって、能力向上には計算量だけでなく、探索効率が必要です。
具体的には、
- 重要な可能性を優先する
- 不要な選択肢を早く捨てる
- 有望な仮説を推定する
- 問題をより小さな部分に分解する
- 近似モデルを使う
- 過去の経験を事前知識として利用する
といった仕組みです。
チェスAIが強いのは、単に多くの局面を調べるからではありません。
どの局面を重点的に調べるべきかを、評価関数や学習済みモデルによって選べるからです。
原報告書は、この点から、計算量と知能の関係は単純な比例ではないと指摘します。
より多くの計算を、有効な探索へ変換するアルゴリズムが必要なのです。(原報告書、Section 5.1)
第5節 スケーリング則とは何か
近年の大規模AIモデルでは、モデル規模、データ量、計算量を増やすと、性能が比較的規則的に向上することが観測されてきました。
この関係は、しばしばscaling laws――スケーリング則と呼ばれます。
一般には、計算量を一定倍率で増やすと、損失や誤差が一定の規則に沿って減少するという、べき乗則に近い関係が観測されます。
これは重要です。
なぜなら、AI性能が完全に不規則に変化するのではなく、一定範囲では予測可能であることを意味するからです。
たとえば、
- 計算量を10倍にしたとき、性能がどの程度改善するか
- データ量を増やしたとき、どの程度誤差が減るか
- モデルを大きくしたとき、どの程度能力が向上するか
を推計できる可能性があります。
原報告書は、過去のAI性能が、パラメータ数、データ量、計算量に対して、おおむね予測可能で連続的なスケーリングを示してきたと説明します。
ただし、この傾向がAGI以後も持続するかどうかは未解決です。(原報告書、Section 5.1)
第6節 大きなモデルを作ればよいわけではない
モデル規模だけを大きくすれば性能が上がる、という考え方には限界があります。
大きなモデルには、それに見合う量のデータと学習計算量が必要です。
モデルだけを大きくし、十分に訓練しなければ、計算資源を効率的に利用できません。
この点を示した代表的な研究が、Google DeepMindのChinchilla研究です。
Chinchillaは、より大きいが十分に訓練されていないモデルよりも、モデル規模を抑えながら、より多くのデータで訓練したモデルの方が優れた性能を示し得ることを明らかにしました。
つまり、重要なのは最大のモデルを作ることではなく、
- モデル規模
- データ量
- 学習計算量
を適切な比率で拡大することです。
これをcompute-optimal scaling――計算量最適なスケーリングと呼びます。
原報告書は、AGIからASIへのスケーリングも、単なる巨大化ではなく、モデル、データ、計算資源を協調して増やす必要があると論じています。(原報告書、Section 5.1)
第7節 学習時の計算と推論時の計算
従来のAIスケーリングでは、主として学習時の計算量が注目されてきました。
一度巨大なモデルを訓練し、利用時には一回の前向き計算で答えを出すという考え方です。
しかし、近年は推論時の計算量が重要になっています。
同じモデルでも、問題に応じて長く考えさせれば、より良い答えを出せることがあります。
推論時スケーリングには、次のような方法があります。
- 思考過程を段階的に展開する
- 複数の候補を生成して比較する
- 解答を批判・修正する
- 木構造やグラフ構造で探索する
- コードを実行して検証する
- 数学ソフトや検索ツールを使う
- シミュレーションを行う
- 別のAIに評価させる
この方法では、すべての問題に最大の計算量を使う必要はありません。
簡単な問題には少ない計算を使い、難しい問題には大量の計算を割り当てられます。
これは人間にも似ています。
簡単な質問には即答しますが、難しい研究課題には数日、数か月、数年をかけます。
原報告書は、モデル規模を過度に大きくすると、一回の推論自体が高価になるため、推論時スケーリングに使える計算資源が減る可能性にも言及しています。
そのため、将来はモデルの巨大化だけでなく、
適度な規模のモデルに、必要に応じて大量の推論計算を与える
方向が重要になる可能性があります。(原報告書、Section 5.1)
第8節 「学習済み知識」と「その場で考えること」
AIの能力には、大きく二つの形があります。
学習済みの能力
過去の訓練によって、モデル内部に圧縮された知識や技能です。
これは人間でいえば、長期記憶、専門知識、経験、直感に近いものです。
推論時に生成される能力
与えられた問題に対し、その場で探索、計画、検証を行う能力です。
これは人間が難問について時間をかけて考えることに近いものです。
一度大量の計算を使って見つけた有効な解法は、後の学習によってモデル内部に取り込める可能性があります。
つまり、
- 推論時に多くの探索を行う
- 良い解答や行動を発見する
- その結果を学習データとして使う
- 次世代モデルが、より少ない計算で同じ能力を示す
という循環が考えられます。
これは、後に扱う再帰的自己改善ともつながります。
推論時の計算によって得た成果を、次のモデルの事前知識へ圧縮できれば、計算と学習が相互に能力を高めるからです。
第9節 データの壁
スケーリングを継続するうえで、最も分かりやすい制約の一つがデータです。
現在の大規模言語モデルは、インターネット、書籍、論文、コード、ニュース、会話など、大量の人間生成データを利用して訓練されています。
しかし、高品質な人間生成テキストは有限です。
同じデータを繰り返し使っても、常に同じ効果が得られるわけではありません。
低品質な文章、重複した文章、誤情報を増やせば、モデルの性能を損なう可能性もあります。
原報告書は、現在の傾向が続けば、高品質な自然言語テキストの供給が近い将来に制約となる可能性を指摘しています。
さらに、AGIからASIへ進むためには、人間がすでに生成した文章を学ぶだけでは足りない可能性があります。
人間の知識全体を学習しても、それは人間の知的到達点を圧縮したものだからです。
人間を大幅に超えるには、人間の既存知識を再現するだけでなく、新しいデータ、新しい経験、新しい発見を生み出す必要があります。(原報告書、Section 5.1)
