第6節 研究領域2〜第7節 研究領域3
第6節 研究領域2
定量的予測
現在のAI予測は、専門家調査や予測市場に大きく依存しています。
これらは有用ですが、主観的判断が中心です。
原報告書は、それを補完する定量的モデルを構築することを提案しています。
6.1 測るべきマクロ指標
候補には、
- FLOP当たりの費用
- 計算効率
- 電力効率
- AI研究の生産性
- 特定産業での経済的生産性
- 人間労働代替率
- モデル能力の改善速度
- AI研究自動化率
があります。
これらの指標を継続的に測定し、相互関係を数理モデルとして表現する必要があります。(原報告書、Section 7.1)
6.2 単一予測ではなく複数モデル
未来を一つの予測曲線に固定すべきではありません。
たとえば、
- スケーリング継続型
- 早期停滞型
- パラダイム転換型
- 再帰的自己改善型
- 資源制約型
- 規制減速型
などのモデルを並行して維持し、新しいデータが得られるたびに、各シナリオの妥当性を更新する必要があります。
原報告書は、モデルの組合せや統計的重み付けによって、多様な将来経路を扱うことを提案しています。(原報告書、Section 7.1)
6.3 転換点を見つける
予測モデルの目的は、将来の一点を当てることだけではありません。
重要なのは、
- どの指標が一定値を超えると加速が始まるのか
- どの資源費用でスケーリングが止まるのか
- どの研究自動化率で再帰的改善が強まるのか
- どの個体数でAI集団が超人的になるのか
という転換点を見つけることです。
6.4 継続的に更新する予測機関
AI進歩は速いため、一度作った予測モデルはすぐに古くなります。
原報告書は、予測を単発研究ではなく、
- 指標の継続測定
- 不確実性範囲の更新
- 新しいモデルの追加
- シナリオの比較
- 外れた予測の検証
を行う大規模な継続的組織へ発展させる必要があるとしています。(原報告書、Section 7.1)
第7節 研究領域3
ASIをどのように測定するか
AGIまでは、人間を比較基準にできます。
しかし、AIが人間専門家を超えた後、人間が作った試験は急速に役立たなくなります。
人間が解けない問題について、人間がAIの正しさを直接評価することも困難になります。
原報告書は、この問題をBenchmarking ASI――ASIのベンチマーキングとして独立した研究領域にしています。(原報告書、Section 7.1)
7.1 人間基準の飽和
現在のベンチマークは、
- 人間の試験問題
- 人間が書いた模範解答
- 人間専門家の成績
を基準にします。
AIが専門家水準へ達すると、得点は上限付近に集中し、それ以上の能力差を測れません。
さらに、人間生成データの予測精度だけでは、超人的な新しい概念形成、科学的発見、長期計画能力を評価できません。
7.2 マルチエージェント・ベンチマーク
一つの方法は、AI同士を競争させることです。
チェスや囲碁では、人間を超えた後も、より強いAI同士を対戦させることで能力を比較できます。
しかし、競争能力だけでは不十分です。
ASIには、
- 大規模協力
- 分業
- 集団的問題解決
- 公平な交渉
- 人間との共同作業
も必要です。
そのため、超人的な協力能力を測定するベンチマークが必要です。(原報告書、Section 7.1)
7.3 Setter–Solver方式
一つのAIが問題を作り、別のAIが解く方式です。
問題作成AIは、各AIの能力差が最も明確になる問題を自動的に生成します。
これにより、人間がすべての試験問題を作る必要がなくなります。
ただし、問題作成AIが本当に重要な能力を測っているかというメタ評価が必要です。
7.4 圧縮ベンチマーク
Universal Inductionの考え方では、世界を短く正確に表現する能力は、一般的知能と関係します。
そのため、
- 未知データの圧縮
- 規則性の発見
- 簡潔な世界モデルの形成
を用いて知能を測る方法が考えられます。
7.5 間接的な能力測定
AIの知能を直接測れない場合、
- 経済生産性
- 科学的発見速度
- 資源利用効率
- 研究開発費用の削減
- 問題解決時間
などを間接指標として使う方法があります。
ただし、経済成果は制度、資本、需要、規制にも左右されるため、純粋な知能指標ではありません。
7.6 質的飛躍と測定上の飛躍
ベンチマーク得点が突然上がったとき、それが本当に新しい推論能力の出現なのか、評価指標の飽和や二値化による見かけなのかを区別する必要があります。
原報告書は、ASI研究では特に、測定方法自体が能力進歩の理解を歪めないようにする必要があるとしています。(原報告書、Section 7.1)
