第6回 3/8 第5節 第二の形――ハードウェアの改善〜第6節 第三の形――データによる自己改善

Google DeepMind「From AGI to ASI」完全解説|第6回 / 全9回
本文 3 / 8

第5節 第二の形――ハードウェアの改善〜第6節 第三の形――データによる自己改善

第5節 第二の形――ハードウェアの改善

AIの能力はソフトウェアだけで決まりません。

計算を実行する半導体、データセンター、電力、通信網が必要です。

そのためAIがハードウェアを改善することも、再帰的自己改善に含まれます。

原報告書は、ハードウェア改善を広く捉えています。

  • より高速なチップの設計
  • より省電力なアクセラレーター
  • より安価な計算装置
  • 半導体配置の最適化
  • 製造工程の改善
  • サプライチェーンの効率化
  • 資源調達の改善
  • エネルギー生産の改善
  • ロボット用ハードウェアの設計

などです。(原報告書、Section 5.3)

5.1 AIがチップを設計する

半導体設計は非常に複雑です。

数十億の構成要素を配置し、

  • 処理速度
  • 消費電力
  • 発熱
  • 信号遅延
  • 製造可能性
  • 面積
  • コスト

を同時に最適化しなければなりません。

AIは、膨大な設計候補を探索し、人間の設計者を支援できます。

より優れたチップが作られれば、そのチップ上でより高度なAIを訓練できます。

そのAIが、さらに優れたチップを設計すれば、次の循環が成立します。

より良いAI

→ より良い半導体設計

→ より多くの計算資源

→ さらに良いAI

ただし、設計図ができても、実物の半導体が直ちに完成するわけではありません。

製造設備の建設、材料調達、試作、検査には物理的時間が必要です。

この点が、再帰的改善の重要な減速要因になります。

5.2 エネルギーとデータセンター

AIがデータセンターの運用を改善すれば、

  • 冷却効率
  • 電力配分
  • 計算タスクの割当
  • 故障予測
  • 通信経路
  • 稼働率

を高められる可能性があります。

さらに、発電、送電、蓄電設備の設計や運用をAIが改善すれば、AIに利用できる計算資源を増やせます。

この場合、自己改善はAIモデル内部だけでなく、AIを支える産業基盤全体へ広がります。

5.3 ロボットと製造能力

ASIが物理世界で急速に能力を拡大するには、設計だけでなく製造も必要です。

AIが工場、物流、採掘、建設、ロボット制御を改善できれば、ハードウェアの生産速度を高められる可能性があります。

しかし、物質を動かし、工場を作り、資源を採掘する速度には限界があります。

このため、純粋なデジタル自己改善が高速でも、物理的設備の拡張が追い付かなければ、全体の進歩は抑制されます。

第6節 第三の形――データによる自己改善

原報告書が重視するもう一つの経路が、データを通じた自己改善です。

AIが、

  • 高品質データを選別する
  • 誤りを修正する
  • 新しい訓練問題を作る
  • シミュレーションを生成する
  • 自己対戦によって経験を作る
  • 推論結果を次の学習へ戻す

ことで、次世代AIを改善します。(原報告書、Section 5.3)

これは、現在のAI発展においても比較的現実的な経路です。

6.1 学習データは固定された資源ではない

従来の機械学習では、データは人間が外部から集めるものと考えられてきました。

しかし高度なAIは、自ら学習すべきデータを生成できる可能性があります。

たとえば、

  • 自分が苦手な問題を特定する
  • その能力を伸ばす問題を作る
  • 複数の解法を探索する
  • 正しさを検証する
  • 最良の解法を学習に使う

という循環です。

これにより、学習は人間が用意した固定的なデータセットから、自律的に変化するカリキュラムへ移行します。

6.2 AlphaZero型の自己改善

原報告書は、AlphaZeroをデータによる再帰的自己改善の代表例として説明しています。

AlphaZero型システムでは、

  1. 現在の方策・価値ネットワークを使う
  2. そのネットワークを事前知識として探索する
  3. 探索によって、元のネットワーク単独より良い行動を見つける
  4. 探索結果をネットワークへ学習させる
  5. 改良されたネットワークが、次の探索をさらに効率化する

という循環が成立します。

ここで重要なのは、推論時に大量の計算を使って得られた優れた判断を、次の学習へ圧縮することです。

つまり、

推論時計算

→ より良いデータ

→ より良い学習済みモデル

→ より効率的な推論

という再帰的改善です。(原報告書、Section 5.3)

6.3 自己対戦という開かれた環境

AlphaZeroでは、自分自身との対戦が新しい訓練データを生みます。

相手も自分とともに強くなるため、学習課題の難易度が自動的に上昇します。

これは固定された試験問題を解くだけの学習とは異なります。

AI自身の能力向上に合わせて、環境も難しくなるからです。

原報告書は、AlphaStarのリーグ形式のような仕組みを、より複雑な自己適応型環境の例として挙げています。(原報告書、Section 5.3)

6.4 推論結果を学習へ戻す

将来のAIが一つの難問について、

  • 多数の解答候補を生成
  • 検証器で評価
  • シミュレーションで確認
  • 最良の解法を選択

する場合、その処理には多くの推論時計算が必要です。

しかし、一度見つけた解法を次世代モデルへ学習させれば、次回は少ない計算で同じ問題を解けます。

これを多数の利用者やAIエージェントの経験について繰り返せば、利用時の計算が、継続的に訓練データへ変換されます。

原報告書は、フロンティアAIにおける推論時計算の増大と、膨大な利用規模を考えれば、この種のデータ循環に強い経済的動機があると指摘しています。(原報告書、Section 5.3)

6.5 合成データの危険

AI生成データを使った自己改善には危険もあります。

  • AIの誤りを正解として学習する
  • 同じ偏りを繰り返す
  • データの多様性が失われる
  • もっともらしい虚偽が増幅される
  • 自己評価だけで誤った方向へ進む

可能性です。

自己改善が成立するには、生成したデータを正しく評価する仕組みが必要です。

数学的証明、コード、ゲームの勝敗のように、結果を明確に検証できる領域では比較的容易です。

しかし、社会政策、倫理、教育、芸術、長期的科学仮説のように、正解が不明確な領域では自己評価が難しくなります。

したがって、データによる自己改善の速度は、

信頼できる評価信号をどれだけ作れるか

に強く依存します。