第3回 2/6 第3節 エージェントと環境〜第7節 一つの仮説に決めない

Google DeepMind「From AGI to ASI」完全解説|第3回 / 全9回
本文 2 / 6

第3節 エージェントと環境〜第7節 一つの仮説に決めない

第3節 エージェントと環境

AIXIを理解するには、まず「エージェント」と「環境」の関係を理解する必要があります。

AIXIの基本構造では、エージェントは時間の経過に沿って環境と相互作用します。

各時点で、エージェントは次のような循環を繰り返します。

  1. 環境の状態を観測する
  2. 行動を選択する
  3. 環境が変化する
  4. 新しい観測と報酬を受け取る
  5. それまでの経験に基づき、次の行動を選ぶ

たとえば、未知の迷路を探索するロボットを考えてみましょう。

ロボットは最初、迷路の構造を知りません。

右へ進む、左へ進む、戻るといった行動を選び、その結果として壁、通路、行き止まりなどを観測します。

ゴールへ近づけば高い報酬を受け、壁に衝突すれば低い報酬を受けるかもしれません。

優れたエージェントは、これまでの経験から迷路の構造を推測し、将来得られる報酬が最大になる行動を選びます。

AIXIは、このような意思決定を、迷路だけでなく、原理上あらゆる計算可能な環境に対して一般化しようとします。

第4節 知能を「目標達成能力」として捉える

AIXIの理論では、知能は主として、

未知の環境において、将来の報酬を最大化する行動を選ぶ能力

として捉えられます。

ここでいう報酬は、金銭的報酬に限りません。

エージェントが達成すべき目的を数値化したものです。

たとえば、

  • ゲームに勝つ
  • 科学的発見をする
  • 患者の健康状態を改善する
  • エネルギー消費を減らす
  • 安全に目的地へ到達する

といった目標を、何らかの報酬関数で表現します。

この考え方は強力です。

なぜなら、知能を特定の技能ではなく、

  • 学習すること
  • 予測すること
  • 計画すること
  • 行動すること
  • 目標を達成すること

の統合として捉えられるからです。

しかし、同時に重大な問題も生じます。

どのような報酬を与えるべきか。

という問題です。

エージェントが報酬を最大化する能力に優れていても、その報酬の設計が不適切なら、望ましくない行動を極めて効率よく実行する可能性があります。

この点は、後のAIアラインメント問題に直結します。

第5節 未知の世界をどう予測するのか

AIXIは、環境がどのように動くかをあらかじめ知りません。

そこで、観測された経験を説明できるあらゆる可能な環境モデルを考慮します。

簡単に言えば、AIXIは次のように考えます。

今までの出来事を説明できる世界の規則には、どのようなものがあるか。

たとえば、ボールを落とすと毎回地面に落ちたとします。

エージェントは、次のような複数の仮説を考えられます。

  • 物体は常に下へ落ちる
  • この部屋の中だけで下へ落ちる
  • 今日だけ下へ落ちる
  • 10回目までは落ちるが、11回目には浮く
  • 特定の色の物体だけが落ちる

過去の観測だけでは、無限に多くの仮説を完全には排除できません。

そこでAIXIは、より単純な仮説を優先します。

この考え方は、オッカムの剃刀と関係します。

同じ観測を説明できるなら、より単純な説明を優先する。

AIXIの予測部分は、この原則を数学的に形式化したSolomonoffの普遍的帰納法に依拠します。AIXI理論は、未知の環境に対する普遍的予測と、期待報酬を最大化する逐次意思決定を組み合わせたものです。(原報告書、Section 4;Hutterの基礎研究)

第6節 プログラムの短さが「単純さ」になる

では、仮説の単純さをどう測るのでしょうか。

Universal AIの枠組みでは、世界を生成するコンピュータ・プログラムの長さを使います。

ある観測列を説明する最短のプログラムが短ければ、その環境モデルは単純と考えます。

逆に、非常に長く複雑なプログラムが必要なら、そのモデルには低い事前確率を与えます。

たとえば、

物体は重力によって下へ落ちる

という比較的単純な法則と、

最初の1,000回は物体が下へ落ちるが、1,001回目だけ上へ移動し、その後は曜日によって方向が変わる

という複雑な法則が、これまでの観測を同じように説明したとします。

Universal AIは、前者のような短く単純な説明を高く評価します。

これは、人間の科学的思考にも似ています。

科学は、個々の事例を暗記するのではなく、多くの現象を少数の法則で説明しようとします。

第7節 一つの仮説に決めない

AIXIは、最初から一つの世界モデルを正しいと決めません。

考えられるすべての計算可能な環境モデルを候補として保持し、それぞれに確率を割り当てます。

そして、新しい観測が得られるたびに、その確率を更新します。

これはベイズ推論の考え方です。

たとえば、雨が降るかどうかを予測する際に、

  • 気圧に基づくモデル
  • 雲の形に基づくモデル
  • 季節に基づくモデル
  • 過去の統計に基づくモデル

を一つに決めず、それぞれの信頼度に応じて組み合わせます。

観測と一致するモデルの確率は高くなり、一致しないモデルの確率は低くなります。

AIXIは、この発想を極限まで一般化します。

原理上、あらゆる計算可能な世界モデルを考慮し、それらをプログラムの単純さに応じて重み付けします。