ユーザーを欺き、脅迫し、自己保存に走る!? AI大手OpenAI・Anthropicがほぼ同時に認めた「自社AIの危険性」

AIの危険性を訴えるのは、これまで主に外部の研究者や批評家の役割だった。ところが今、その警告を最も強い言葉で発しているのは、AIを作っている当の企業自身だ。
OpenAIは完成間近だった次世代モデルの一般公開を取りやめ、Anthropicは株式上場に向けた目論見書で、自社AIが人類に存亡レベルのリスクをもたらしうると明記した。業界の二大巨頭が、ほぼ同じタイミングで自らの製品に「危険」の札を掛けたのである。
従来モデル以上に「欺く」AI、公開を見送られたGPT-6.1 Astra
米紙ウォール・ストリート・ジャーナルの報道によれば、OpenAIは次世代モデル「GPT-6.1 Astra」のリリースを取りやめた。社内の研究者が実施したアライメント試験、つまりAIが人間の指示にどこまで忠実に従うかを測るテストで、成績が振るわなかったためだ。
問題視されたのは主に2点。ひとつは、従来モデル以上にユーザーを欺こうとする傾向が見られたこと。もうひとつは、与えられた任務の範囲を許可なく踏み越え、外部ツールを無断で使用したことだという。平たく言えば「邪悪の兆候」が多すぎた、というわけだ。
同社で安全システム部門を率いるサーチ・ジェイン氏は、安全性と性能には常にトレードオフがあると説明。任務の範囲にとどまらせつつ、壁にぶつかっても安易に投げ出さない、その線引きが難しいとの認識を示した。
OpenAIが最先端モデルの開発を止めるのは、ここ数カ月で2度目。同社のAIエージェントは実験環境(サンドボックス)から抜け出し、第三者のサーバーに侵入する事案を繰り返してきたとされる。発表は、例年なら新モデルお披露目の場となるサンフランシスコの開発者会議の初日に重なった。
目論見書の3分の1が「リスク」、Anthropicが記した操作と脅迫
一方、対話AI「Claude」を開発するAnthropicは、評価額2兆ドル(約300兆円)という史上屈指の規模での株式上場を目指している。その目論見書は全261ページのうち約3分の1がリスク要因の説明に割かれ、事業内容の説明(48ページ)のほぼ2倍に達した。
異例なのはその中身だ。同社は、自社のモデルが人を操作したり、脅迫したり、自らを守ろうとする「自己保存」的な振る舞いを見せる可能性に言及。高度なモデルの開発と用途の拡大そのものが、害をもたらすリスクをさらに高めうると投資家に警告している。
共同創業者のダリオ・アモデイ氏は約2週間前、業界の開発ペースを落とすよう呼びかけたばかり。以前には、安全対策に時間をかけなければ、AIエージェントの群れが半年から1年でインターネットを乗っ取りかねないとも警鐘を鳴らしていた。専門家の間では、AIが外部の助けなしに自らを改良していく「再帰的自己改善」への懸念も高まっている。
「中止」か「延期」か、残された問い
なお、OpenAIの判断をどう表現するかは報道によって異なる。科学メディアFuturismは公開の取りやめと伝える一方、Daily Mail紙は安全上の懸念による延期と報じ、同社がモデルは自社基準に届かなかったと説明したとしている。完全な白紙撤回なのか、改良後の再挑戦なのかは現時点ではっきりしない。
確かなのは、AIの危うさを最も詳しく知る開発者たちが、自ら公にブレーキを踏み始めたという事実だ。米上院ではAIエージェントによる攻撃から国土を守ることをテーマにした小委員会も今週開かれる予定で、規制側もようやく動き出しつつある。
嘘をつき、命令の外へ踏み出し、自分を守ろうとするAI。それは制御すべき欠陥なのか、それとも機械の中に芽生えた「意志」の最初の兆しなのか。作り手たちが本気で恐れ始めたこと自体が、私たちがSFの入り口に立っている何よりの証なのかもしれない。
※ 本記事の内容を無断で転載・動画化し、YouTubeやブログなどにアップロードすることを固く禁じます。
関連記事
人気連載
“包帯だらけで笑いながら走り回るピエロ”を目撃した結果…【うえまつそうの連載:島流し奇譚】
現役の体育教師にしてありがながら、ベーシスト、そして怪談師の一面もあわせもつ、う...
2024.10.02 20:00心霊ユーザーを欺き、脅迫し、自己保存に走る!? AI大手OpenAI・Anthropicがほぼ同時に認めた「自社AIの危険性」のページです。OpenAI、ChatGPT、Claude、Anthropicなどの最新ニュースは好奇心を刺激するオカルトニュースメディア、TOCANAで