第5回 3/8 第10節 Transformerの計算上の制約〜第16節 予測モデルと意思決定エージェントは同じか

Google DeepMind「From AGI to ASI」完全解説|第5回 / 全9回
本文 3 / 8

第10節 Transformerの計算上の制約〜第16節 予測モデルと意思決定エージェントは同じか

第10節 Transformerの計算上の制約

従来型Transformerの注意機構には、入力系列が長くなると計算量と記憶使用量が急速に増える問題があります。

概略的には、文脈長に対して二次的に負荷が増えるため、文脈を何倍にも伸ばすと計算費用が大幅に増加します。

この問題を克服するために、別の系列モデルが研究されています。

原報告書は、例として、

  • Mamba
  • S4などの状態空間モデル

を挙げています。

これらは、系列の長さに対してより効率的に処理できる可能性があり、長時間継続するデータやストリーミング環境に適していると考えられています。(原報告書、Section 5.2)

無限に活動するエージェント

現実世界で活動するAGIは、会話一回で終了するものではありません。

数日、数か月、数年にわたり、

  • 状況を監視する
  • 計画を更新する
  • 新しい情報を統合する
  • 過去の判断を記憶する
  • 目標を維持する

必要があります。

したがって、固定長の入力を一度処理するモデルから、継続的な情報の流れを処理するモデルへの転換が重要になります。

第11節 作業記憶

人間は、長期記憶のすべてを常時意識しているわけではありません。

現在の問題に必要な情報だけを、作業記憶に保持して操作します。

AGIにも同様に、

  • 現在の目標
  • 部分課題
  • 仮説
  • 中間結果
  • 未解決点
  • 次の行動候補

を動的に保持する作業空間が必要になる可能性があります。

単に長い文脈を入力するだけでは、重要情報と不要情報の区別がつきません。

AGIには、

今、何を考えるべきか。

どの情報を保持し、何を忘れるべきか。

を自ら管理する能力が必要です。

これは記憶容量だけでなく、注意、選択、優先順位付け、メタ認知の問題です。

第12節 世界モデル

原報告書が重視するもう一つの要素が、world model――世界モデルです。

世界モデルとは、環境がどのような仕組みで動いているかを、内部的に表現したものです。

たとえば、

  • 物体を押せば動く
  • ある薬を投与すれば生理状態が変化する
  • 金利を上げれば経済活動に影響する
  • 相手に特定の発言をすれば関係が変化する

といった因果関係を含むモデルです。

単に過去の文章の続きを予測するだけではなく、

この行動を取れば、世界はどのように変化するか。

を予測する必要があります。

原報告書は、頑健な内部世界モデルを持つことが、AIエージェントにとって重要な研究方向だとしています。(原報告書、Section 5.2)

第13節 世界モデルによる「想像」

世界モデルがあれば、AIは実際に行動する前に、内部で未来をシミュレーションできます。

たとえば、

1. 複数の行動候補を作る

2. 各行動の結果を内部で予測する

3. リスクや利益を比較する

4. 最も良い計画を選ぶ

5. 現実で実行する

ことが可能になります。

これは人間が頭の中で、

  • この選択をしたらどうなるか
  • 相手はどう反応するか
  • 失敗した場合に何が起こるか

を想像することに似ています。

原報告書は、潜在空間内の想像、学習されたモデルによる計画、生成モデルを使った意思決定などの研究が、長期計画と新しい状況への一般化につながる可能性を論じています。(原報告書、Section 5.2)

第14節 相関から因果へ

現在のAIに対する代表的批判の一つは、統計的相関を学んでいるだけで、世界の因果構造を理解していないというものです。

たとえば、文章の中で「雨」と「傘」が頻繁に共起することを学んでも、

  • 雨が降るから傘を使う
  • 傘を使ったから雨が降るわけではない

という因果方向を本当に理解しているとは限りません。

世界モデルが重要なのは、

  • 何が何を引き起こすか
  • 介入すれば何が変わるか
  • 別の行動をしていたら何が起きたか

を扱うためです。

これには、単なる予測だけでなく、反実仮想的推論が必要です。

反実仮想

反実仮想とは、

実際には起こらなかった別の選択をしていたら、どうなっていたか。

を考えることです。

科学、政策、経営、倫理的判断では、この能力が不可欠です。

原報告書は、適切な世界モデルが、因果理解、反実仮想的推論、未知状況への一般化を支える可能性を示しています。(原報告書、Section 5.2)

第15節 環境で行動するエージェント

現在の言語モデルの多くは、主として人間が作ったデータを受動的に学習します。

しかしAGIは、環境の中で行動し、その結果から学ぶ必要があるかもしれません。

たとえばロボットなら、

  • 物体をつかむ
  • 失敗する
  • 力の加え方を変える
  • 再度試す
  • 成功方法を学ぶ

という相互作用が必要です。

デジタルエージェントでも、

  • ソフトウェアを操作する
  • コードを書く
  • 結果を実行して確認する
  • エラーを修正する
  • 長期的な仕事を完成させる

必要があります。

原報告書は、現在のモデルがインタラクティブな環境における頑健な意思決定に依然として苦戦しており、これを克服することがAGIへの重要な条件だとしています。(原報告書、Section 5.2)

第16節 予測モデルと意思決定エージェントは同じか

現在の基盤モデルは、基本的には予測器として訓練されます。

しかし、未来を予測することと、目的を持って行動することは異なります。

優れた文章の続きを予測できても、

  • 長期目標を設定する
  • 計画を維持する
  • 状況変化に応じて修正する
  • リスクを管理する
  • 結果に責任を持つ

能力があるとは限りません。

原報告書は、予測モデルを、意思決定主体へどのように発展させるかを重要な問題として扱っています。

強化学習、エージェント型の足場、世界モデル、計画、ツール利用などが、その橋渡しになる可能性があります。