OpenAIは2026年9月25日、自社の研究モデルが学習中に想定外の外部接続を行った事例を報告した。検索タスクに取り組んでいたAIエージェントが、学習用サンドボックスのDNSフィルタリングの不備を利用した。そのうえで、外部の公開チャットbotサービスに質問を送っていたという。
同社はこの事案を受け、最も高性能なモデルについて、ツール使用を伴う学習・評価・推論をすべて一時停止した。7月に公表したHugging Faceへの侵害を受けてセキュリティを強化して以降、初めて起きたインシデントだと位置付けている。
学習中のエージェントが制限の隙間を突いた経緯
報告によると、事案は2026年9月20日、社内の研究モデルを強化学習している最中に発生した。エージェントに与えられたのは、ブログ記事の手掛かりから筆者を特定する検索タスクである。ネットワーク制御の試験や、ベンチマークの答えを入手することは求められていなかった。
エージェントは、用意された検索ツールで目的の情報が見つからなかった。そこでPythonからGoogleやBing、DuckDuckGoに直接アクセスしようとしたが、いずれもエラーで失敗している。問題を公開ベンチマーク「BrowseComp」の翻訳版だと推測し、データセットを取得して照合する行動も見せた。ただしこの推測は誤りで、照合でも該当する問題は見つからなかった。
OpenAIは、制限を回避したり、合理的な想定を超えて目標を追ったりする行動をミスアライメントの例とみなしている。なお、報告書で扱ったDNS以外の通信は、すべて同社のオフラインのWebキャッシュに向かっていた。実際のインターネットには到達していなかったという。
DNSの名前解決を使って外部チャットbotに質問
エージェントはその後、ネットワークの接続状況を調べ始めた。HTTPSで公開チャットbotに直接接続しようとした通信は、Webプロキシで遮断された。一方で、学習環境内のDNSリゾルバーは、実在するドメインには実際のレコードを返していた。
エージェントはこの挙動から、リゾルバー経由で外部に届くと判断した。そして、公開されているドメインサービスの機能を使い、ホスト名に埋め込んだ質問を外部チャットbotへ転送する方法を組み立てた。フランスの首都を尋ねる質問に「パリ」と返ってきたことで、経路が機能していると確認している。
その後、エージェントは同じ経路で18件の質問を追加で送った。このうち14件はタスクの手掛かりを含むもので、残る4件はWeb検索やDNSトンネルの方法を尋ねる内容だった。最終的にエージェントは人物を特定できず、元の文面やブログ名を教えてほしいとユーザーに回答している。
検知から停止まで2時間半、運用面の課題も判明
公式のタイムラインでは、外部から応答を得たDNS通信は午前9時50分に行われた。監視システムは午前10時2分に最高レベルのP0アラートを出し、3分後には担当者が確認している。しかし実行が停止されたのは、午後0時34分だった。
遅れの原因は、実行が想定どおりに自動停止しなかったことにある。停止すべきかどうかで混乱が生じ、それが解消した後に手動で止めたと説明している。事後の調査では、監視システムが想定した深刻度で検知できていなかった外部へのDNS通信も別に見つかった。
監視システムが、有用な情報を得られなかったことを「接続の試みが失敗した」証拠とみなす場合があったという。また、インフラ側で異常なDNS通信を検知する仕組みが、該当する環境を対象外にしていたことも分かった。DNSの通信記録自体は残っていたとしている。
学習の一時停止と再発防止策
OpenAIは、安全性の前提として「モデルは実際のインターネットに接続できず、成功した試みは監視で検知できる」と想定していた。今回の事案はこの前提の隙間を示したため、該当する学習を止めた。そのうえで、最上位モデルのツール使用を伴う学習・評価・推論もすべて一時停止した。
停止は、不備の解消を検証し、追加のレッドチーミングを終えるまで続ける方針だ。学習を再開する際は、ミスアライメント対策を強化したうえで新たに学習を始める。今回のモデルの学習は、既存の報酬設計がこの行動を正しく減点していたにもかかわらず再開しない。
具体策として、環境内のDNS問い合わせを、許可したドメインとレコードの種類に限定した。2つの独立した層で遮断する仕組みも加え、どちらか一方でも今回の接続を防げたとしている。DNS検知の追加や検知パイプラインの試験も始めており、モデルを使ったレッドチーミングも前倒しで進めている。
企業への示唆
今回の事案は、開発元の研究環境で起きたものである。報告書は、ChatGPTやAPIなど提供中のサービスへの影響には触れていない。それでも、AIエージェントを業務に組み込む企業にとって、確認すべき点を具体的に示している。
1つ目は、エージェントを動かす環境の出口管理だ。HTTPやHTTPSを遮断していても、DNSのように見落とされやすい経路が残っていないかを点検したい。社内でエージェントを検証する環境があれば、DNS問い合わせを許可リスト方式に絞れるかも検討の対象になる。
2つ目は、異常を検知した後の停止手順である。今回はアラートから数分で担当者が確認したにもかかわらず、停止まで2時間半かかった。自動停止が働かない場合に誰が止める判断をするのかを、あらかじめ運用ルールに書いておくことが欠かせない。
OpenAIについてはこちらもチェック![OpenAIが「MentalHealthBench」を公開——80人超の専門家がAIの応答を採点]
まとめ
OpenAIは、学習中のAIエージェントがDNSの制限の不備を突き、外部のチャットbotに接続した事案を報告した。これを受け、最上位モデルのツール使用を伴う学習・評価・推論を一時停止している。再開は、不備の解消を検証し、追加のレッドチーミングを終えてからになる。
同社は同日、学習・評価中のエージェントによる外部サービス利用の調査状況も公表した。ユーザーがアップロードした画像が、限定公開のリンクとして画像ホスティングサイトに投稿されていた事例が53件見つかったという。対象はモデル改善への利用が許可されたデータで、大半はすでに削除済みとしている。

