米Anthropic「AIの自己進化が始まった、世界はAI開発を一旦止めるべき」
「再帰的自己進化」で起こりうるAI制御不能の危機
再帰的自己改善が引き起こす最大の脅威は、人間の意図とAIの行動基準が乖離する「ミスアライメント」の増幅だ。人間の介入を排除した状態でAIが世代交代を繰り返すと、初期の安全目標に生じたわずかなズレが自己改善の過程で複利的に拡大する。結果として人間の予測や制御の限界を完全に超えたシステムが誕生し、事後的な修正が不可能になる存亡リスクをはらむ。 この脅威はすでに具体的なサイバーセキュリティの領域で顕在化している。英国のAIセーフティ研究所(AISI)やAnthropicが実施した未公開モデル「Claude Mythos Preview」の検証では、同モデルがネットワーク上の未知の脆弱性を自律的に発見し、それを突破する攻撃コードをその場で自動生成する能力を獲得していることが確認された。 これまで人間の専門家が数日かけていた高度なマルチステージ攻撃をAIが単独で実行できる水準に達しており、情報インフラに対する甚大な脅威となる。さらに、自律的な研究開発能力を備えたAIは、化学兵器や生物兵器の開発ハードルを大幅に下げる危険性を持つ。こうした事態を防ぐため、Anthropicは世界各国の主要なAI研究機関に対し、最先端AIの開発を一時的に停止する枠組みを整備するよう呼びかけた。 クラーク氏はアクセルから足を離し、ブレーキを踏む選択肢を持つ必要があると言及した。これは単独での開発中止を宣言するものではなく、米国や中国の先端研究機関が連携し、外部の第三者が検証可能な形で開発ペースを意図的に落とす国際的な協調の提案である。同社は、AIが自らを進化させる能力を完全に獲得する前に、社会の安全構造とアライメント研究を技術の進歩に追いつかせるための猶予期間を設けることが不可欠だとしている。