第8回 1/6 はじめに〜第2節 第一のボトルネック――データの壁

Google DeepMind「From AGI to ASI」完全解説|第8回 / 全9回
本文 1 / 6

はじめに〜第2節 第一のボトルネック――データの壁

はじめに

これまで、Google DeepMindの『From AGI to ASI』が示す四つの技術的経路を検討してきました。

  1. 計算資源、モデル、データのスケーリング
  2. アルゴリズム的パラダイム転換
  3. 再帰的自己改善
  4. マルチエージェント協調と集団的主体性

これらの経路を見ると、AGIが実現した後もAIの能力向上が続き、やがてASIへ至る可能性があるように思われます。

しかし、その進歩が順調に続くとは限りません。

AIの性能を高めるには、データ、計算資源、電力、半導体、研究成果、物理的実験、社会的受容など、多数の条件が必要です。

そのどれか一つが不足しても、進歩は遅くなる可能性があります。

複数の制約が同時に作用すれば、AIの能力向上が長期間停滞するかもしれません。

原報告書のSection 5.5は、こうした制約をfrictions and bottlenecks――摩擦とボトルネックとして整理しています。

ここでいう「摩擦」と「ボトルネック」は、同じではありません。

摩擦

進歩を遅らせるが、資源投入、技術革新、制度変更などによって克服できる制約です。

ボトルネック

能力向上を強く制限し、その問題を解決しない限り、次の段階へ進めなくなる制約です。

ハード・ブロッカー

現在の技術路線では原理的または実質的に克服できず、進歩を長期間停止させる障壁です。

原報告書は、現時点では、どの制約が単なる摩擦にとどまり、どれが進歩を止めるハード・ブロッカーになるかは分からないと強調しています。

そのため、著者たちは未来を断定するのではなく、各制約の影響を検証すべき未解決の研究課題として提示しています。(原報告書、Section 5.5)

第1節 六つの主要なボトルネック

原報告書のTable 4は、AGIからASIへの移行を妨げ得る主要な要因を、次の六つに整理しています。

  1. Data Wall――データの壁
  2. Economic and Natural Resource Demand――経済的・自然資源需要の急増
  3. Neural Paradigm Is Insufficient――現在のニューラル・パラダイムの限界
  4. Research Gets Harder――研究の難化
  5. Abstraction Barrier――抽象化の壁
  6. Deliberate Slowdown――意図的な減速

抽象化の壁からは、さらに重要な問題として、

Embodied Bottleneck――身体性・現実接地のボトルネック

が導かれます。

これらは互いに独立ではありません。

たとえば、データの壁を越えるために物理世界で大量の実験を行えば、エネルギー、設備、時間の制約が強くなります。

AIが研究を自動化して研究の難化を相殺しても、実験設備の建設や薬剤の臨床試験はデジタル速度では進みません。

したがって、AGIからASIへの速度は、最も進歩した一要素ではなく、最も遅い不可欠な工程によって決まる可能性があります。

第2節 第一のボトルネック――データの壁

2.1 なぜデータが不足するのか

現在の基盤モデルは、大量の文章、画像、音声、映像、コードなどから学習します。

モデル規模と計算量を増やし続けるなら、それに対応する量と質の学習データも増やさなければなりません。

しかし、人間が新たに生み出す高品質な情報の量は、AIモデルの計算規模ほど急速には増えません。

原報告書は、モデル規模の成長が、意味ある新規テキストが世界で生産される速度を上回っていると指摘しています。

画像、音声、映像にはテキストより長い余地がある可能性がありますが、それらも人間だけによる生産では、計算需要と同じ速度では増えないかもしれません。(原報告書、Section 5.5)

2.2 データ量とデータ品質

データの壁は、単にファイル数が足りないという問題ではありません。

重要なのは、

  • 正確である
  • 重複が少ない
  • 多様である
  • 学習対象より少し難しい
  • 現実世界と対応している
  • 結果を検証できる

データです。

インターネット上には巨大な情報がありますが、同じ文章の複製、誤情報、自動生成された低品質コンテンツも含まれます。

データを増やしても、信頼性や新規性が低ければ、能力向上につながらない可能性があります。

2.3 AI生成データは解決になるか

生成AIは、文章、画像、音声、映像を大量に作れます。

そのため、AIに次世代AIの訓練データを作らせることが考えられます。

しかし、現在のモデルが生成したデータを、検証せずに次のモデルへ反復学習させると、

  • 誤りが蓄積する
  • 出力の多様性が失われる
  • 既存の偏りが増幅される
  • 能力が頭打ちになる
  • モデルが劣化する

危険があります。

原報告書は、単純な自己生成データの反復利用では、性能停滞や退化が起こる可能性を認めています。(原報告書、Section 5.5)

2.4 高品質な合成データ

ただし、AI生成データがすべて無効というわけではありません。

次のような仕組みがあれば、基盤モデル単独の能力を超える高品質データを作れる可能性があります。

  • 推論時に多数の候補を探索する
  • コード実行によって正しさを確認する
  • 数学的検証器を使う
  • シミュレーションで結果を評価する
  • 自己対戦を行う
  • 外部環境からフィードバックを得る
  • 複数のAIによる独立評価を行う

たとえばAlphaZeroでは、現在のモデルを使って探索を行い、モデル単独より良い手を見つけ、その結果を次の学習へ戻します。

これにより、

現在のモデル

→ 探索による改善

→ 改善結果を学習

→ より良いモデル

という循環が成立します。

原報告書は、推論時計算、検索、自己対戦、強化学習、シミュレーション、エージェントと環境の相互作用が、データの壁を越える主要候補になるとしています。(原報告書、Section 5.5)

2.5 数百万・数十億人の利用者が生むデータ

高度なAIが世界中で利用されれば、利用者とAIの相互作用そのものが大量の学習資源になります。

人間がAIの回答を、

  • 採用する
  • 修正する
  • 拒否する
  • 実行結果を返す
  • さらに質問する

ことで、AIの能力境界付近の情報が生まれます。

特に、各応答について推論時計算を多く使い、その結果を選別・蒸留できれば、人間生成コンテンツとは異なる新しいデータ循環が生じます。

したがって、データの壁は、スケーリングを遅らせる摩擦にはなっても、必ずしも決定的障壁になるとは限りません。

2.6 データの壁が強く作用する経路

スケーリング経路

最も直接的に影響します。

より大きなモデルを訓練しても、十分な新規データがなければ性能向上が鈍化します。

パラダイム転換

データ効率の高い学習方式が生まれれば、壁を弱められます。

再帰的自己改善

AIが高品質データを生成・評価できれば、自己改善を加速できます。

しかし、誤った自己生成データが循環すれば、改善ではなく劣化を起こします。

マルチエージェント経路

多数のAIが相互作用することで新しいデータを生成できます。

ただし、同じ基盤モデル同士の会話では、既存の誤りや概念体系を反復するだけになる可能性もあります。