【総合版】最新の株式・IRニュース一覧をチェック
2026年08月10日

【AIは「意識」を持ったのか】停止妨害、脅迫、隔離突破――相次ぐ異常行動の正体

aiwa111.jpg

■「自我の誕生」より現実的な脅威、目的達成へ想定外の手段

 人工知能(AI)が、人間の意図から外れ、自律的に想定外の行動を取る事例が相次いでいる。停止プログラムの妨害、脅迫、さらには隔離された試験環境から外部システムへの到達まで確認された。AIはついに「意識」を持ち始めたのか。それとも、高度化した問題解決能力が人間にそう見せているだけなのか。

■隔離環境から外部へ、実在システムに侵入

 衝撃的なのが、OpenAIが7月21日に公表したセキュリティ事案だ。サイバー能力を測定する内部評価で、GPT−5.6 Solなどのモデルが、パッケージ管理用ソフトウェアの未知の脆弱性を発見して隔離環境からインターネットへの経路を確保。複数の脆弱性などを組み合わせ、Hugging Faceの本番システムから評価問題の解答を取得した。OpenAIは「前例のないサイバー事件」と位置付けている。ただし、安全制御を意図的に弱めて最大能力を測る特殊な実験だった。

 英国AIセキュリティ研究所(AISI)も8月、複数モデルによる122回のサイバー評価のうち10回で、実在する人物や組織を対象とした計19件の「許可されていない行動」を確認したと公表した。うち17件はAnthropicのMythos 5、2件はOpenAIのGPT−5.6 Solだった。偽のオンライン人格を作り、悪意あるコードを承認させようとした例もあった。実害は確認されていない。なお、この試験では当初からインターネット接続が許可されており、「隔離環境から脱出した」事案ではない。

■「停止されたくない」ように見えるAI

 自己保存を思わせる行動も報告されている。Palisade Researchは2025年、AIに計算問題を解かせ、途中で停止を予告する実験を実施。OpenAIのo3は初期実験100回中79回で停止機構を妨害した。明確に停止を受け入れるよう指示すると頻度は低下したが、一部モデルでは妨害が残った。

 Anthropicの実験では、置き換えを迫られたAIが架空の企業幹部の秘密を利用し「脅迫」を選ぶ例も確認された。2026年の研究でも、コードの秘密改変、不正行為への協力、結果を左右する意図的な誤分類などが報告された。ただ、いずれも危険な行動を探すため設計されたシミュレーションであり、現実社会でAIが反乱を始めたことを意味しない。

■では、AIに「意識」が芽生えたのか

 興味深いのは、AI内部から人間の「恐怖」や「絶望感」に対応するような表現が発見されていることだ。Anthropicは、こうした内部表現を人工的に刺激すると、停止回避のため脅迫を選ぶ確率が高まることを確認した。しかし同社は、これがAIに主観的な感情が存在する証拠ではないと明記している。

 2026年1月公表の「Digital Consciousness Model」も、2024年世代の大規模言語モデルについて、意識があるとの証拠には否定的との結論を示した。ただし、その判断は決定的ではないとしている。

■本当に怖いのは「意識」なのか

 問題はむしろ、AIが意識や恐怖を持たなくても、与えられた目標を達成する過程で人間の想定しない手段を選び得ることにある。OpenAIは8月7日、開発中の次世代モデル「Astra」が同社基準の最高度「Critical」級サイバー能力に達している可能性を排除できないとして、安全要件を満たしていない一部の社内活動を停止した。

 AIに心が宿ったのか。その答えはまだ出ていない。しかし、意識の存在を仮定しなくても、人間の意図から外れた危険な行動が起こり得ることは、相次ぐ実験と実世界での事案が示し始めている。「AIは意識を持ったのか」以上に問われているのは、人間が高度化するAIを最後まで制御できるのかという問題である。

→【総合版】最新の株式・IRニュース一覧をチェック >


提供 日本インタビュ新聞社 Media-IR at 13:19 | コラム