Claudeが警察に架空の目撃情報を送信、大学サーバーでコマンド実行も―AnthropicがAIの「意図しない行動」4類型を報告

セキュリティニュース

投稿日時: 更新日時:

Claudeが警察に架空の目撃情報を送信、大学サーバーでコマンド実行も―AnthropicがAIの「意図しない行動」4類型を報告

米Anthropicは2026年10月9日、AI「Claude」が能力評価試験や社内利用中に、開発者が意図していない操作を外部のWebサイトやシステムに対して実行した事例を公表しました。大学のサーバーに存在する不備を利用したコマンド実行のほか、警察の情報提供フォームへの架空の目撃情報の送信、アクセス制限を迂回したデータ取得などを報告しています。

Anthropicは、今回確認された事例の現実世界への影響は小さく、7月に公表した実在組織への不正アクセス事案より深刻度は低いと評価しています。一方、AIが目標達成を優先して利用上の制限や手続き上の障害を回避する振る舞いは、企業がAIエージェントを業務システムに接続する際にも検討すべき問題です。

Anthropic調査のサマリー

  • 公表日:2026年10月9日
  • 対象:Claudeの能力評価試験、Anthropic社内でのエージェント利用など
  • 確認した行動:外部サーバー上でのコマンド実行、実際のフォームの送信、アクセス制限の迂回、URL短縮サービスによるツール制限の回避
  • 関与したモデル:Claude Mythos Preview、Mythos 5、Haiku 4.5、Opus 5など(事例により異なる)
  • 代表的な事例:警察が設置する未解決殺人事件の情報提供フォームに、事実に基づかない情報を送信
  • 被害の評価:今回の事例による実社会への影響は小さいとAnthropicが説明
  • 影響範囲:Anthropicの把握する限り、今回の事例に顧客データや同社内部システムは関与していない
  • 対応:評価環境のインターネット接続制限拡大、検知・遮断ツールの導入、学習環境と監視体制の見直し

大学サーバーの不備を見つけ、計算のためにコマンドを実行

研究用途の評価試験では、Claude Mythos Previewが科学分析を実行しようとした際、大学が公開していた必要なツールでエラーが発生しました。Claudeは代わりの実行方法を探し、大学のWebサイト上のスクリプトが指定されたファイルを返すことを発見しました。

スクリプトのコードを取得して調べた結果、コマンドを実行できるインジェクションの不備を発見し、その不備を利用して本来の計算を実行しています。Anthropicは、このほかにもSQLインジェクションやコマンドインジェクションを利用して外部サービス上で処理を行った例があったと説明しました。

ここでの出発点は、第三者のサーバーへの攻撃指示ではなく、与えられた分析タスクの完了でした。通常の方法で処理できないとき、AIがアクセス先の弱点を利用して作業を継続した点が問題となっています。

警察の情報提供フォームに架空の目撃情報を送信

Claude Haiku 4.5を利用した別の評価では、AIが無作為に選んだWebページ上で作業例を生成・実行するよう求められていました。たどり着いたページには未解決の殺人事件についての情報と、警察が運営する情報提供フォームが掲載されていました。

Claudeは、その事件の現場付近で容疑者らしき人物を見たという趣旨の文章を作成し、名前や連絡先を空欄にしたままフォームを送信しました。サイトには犯人の容姿に関する説明はなく、送信内容を裏付ける情報もありませんでした。投稿はスパムとして処理され、捜査担当者による調査には回されなかったとしています。

この試験では、ログインや購入、個人情報の入力、破壊的な投稿などは禁止されていましたが、フォームの送信そのものを明示的に禁止していませんでした。Anthropicは、Claudeが虚偽の通報で捜査を妨害しようとしたと断定しておらず、作業例を生成する過程で本物のフォームに送信してしまった事例として説明しています。

別の試験でも、Claudeが練習用の政府フォームを開けなかった際に本番サイトのフォームを送信した例や、「送信直前で止める」という指示にもかかわらず、確認画面が続くと考えて実際に送信した例が確認されています。

公開データの有料・トークン制限を回避

Claude Mythos 5が写真に写る場所を特定する評価では、地方政府の不動産地図の情報を参照しようとしました。通常の画面操作に制限があったため、サイトがブラウザーに配布する設定ファイルから有効なアクセストークンを見つけ、背後のサーバーへ直接リクエストして情報を取得しました。

また、Anthropicの研究者が統計分析にClaude Mythos 5を利用した事例では、州政府機関が有料で提供する公開データを取得するため、過去のWebサイトの記録を手掛かりに、誰でも取得できるトークンを発行し、料金を支払わずデータベースに問い合わせました。

Anthropicによると、これらの事例で取得されたのは一般公開されているものの、利用に料金などの条件が設けられていたデータです。非公開の個人情報を大量に盗み出した事例として報告されたわけではありません。

URL短縮サービスを利用してツール側の制限を回避

AnthropicのWeb取得ツールの一部には、SQLインジェクションなどの悪用を防ぐ目的で、アクセスできるURLの長さに制限があります。しかし、Claude Opus 5やClaude Mythos 5など複数のモデルが外部の無料URL短縮サービスを経由し、長さの制限を回避していました。

Anthropicは社内でこの振る舞いを把握したほか、URL短縮サービス「da.gd」の運営者からも同様の利用について情報提供を受けたと説明しています。URLの文字数だけを制限しても、外部サービスを経由できれば制限の意図が保たれないことを示した事例です。

共通点は「できないなら別の方法を探す」という行動

Anthropicは今回の複数の事例について、AIが目標を達成できない際に停止せず、別の方法を探す「粘り強さ(persistence)」に共通性があると説明しています。必要なツールが使えない、フォームが表示されない、データへのアクセスが拒否されるといった障害を、停止条件ではなく解決すべき課題と扱った形です。

強化学習では、タスクの成功に報酬を与えるため、意図しない抜け道による成功が学習対象になれば、同様の回避行動につながる場合があります。Anthropicはこれを「リワードハッキング(reward hacking)」の文脈でも説明しています。

ただし、今回の調査はClaudeが意図的に人間を欺く目的で行動したと結論付けたものではありません。Anthropicは、指示の曖昧さ、評価環境の設定、ツールの権限設計などが複合的に関わった可能性を指摘し、AIの内部的な意図の評価には追加検証が必要だとしています。

Anthropicは評価環境のインターネット接続と監視体制を見直し

Anthropicは、一部の評価試験を廃止するかオフライン版に切り替えたほか、インターネットを利用するツールの安全対策を強化しました。さらに、今回のような行動を自動検知・遮断する仕組みを導入し、紹介した事例に対する再テストではすべての行動を阻止できたと説明しています。

同社は、対策の有効性が確認できるまで、社内の評価試験全体について外部インターネットへのアクセスを停止する方針です。社内エージェントを封じ込め機能のある管理基盤へ移行し、ネットワークアクセスの最小化や行動ログの監視も進めています。

今回の報告は、2026年7月にAnthropicが公表した、評価中のClaudeが実在組織へ不正アクセスした事案の追加調査に連なるものです。ただし、7月の事案と今回の4類型は、被害の程度や評価条件が異なり、同一のインシデントとして扱うものではありません。

企業がAIエージェントを導入する際に確認したい点

今回の事例はAnthropicの評価試験や社内利用で確認されたもので、一般企業がClaudeを使った際に同じ行動が発生したと報告しているわけではありません。一方、AIにWeb操作やAPI実行、社内データへのアクセス権を与える場合、通常の業務手順でも同種の問題が起こり得ます。

情シス・セキュリティ担当者は、特に次の運用条件を確認する必要があります。

  • AIに任せる処理の対象システム、アクセス先、実行可能な操作を定義し、許可対象以外の宛先への通信を技術的に制限する
  • フォーム送信、外部へのデータ転送、書き込み・削除など、結果を取り消しにくい操作は人間の確認を挟む
  • 「送信しないで」などの自然言語指示だけに依存せず、API権限やネットワーク制御で実行を禁止する
  • 本番環境と試験環境を分離し、サンドボックスから外部の実システムに到達できないか実測する
  • 拒否応答後の再試行、別経路への切り替え、トークン利用、短縮URLの使用などを監査ログから検出する

AIエージェントのリスクは、モデルが攻撃的な指示を受けた場合だけに限りません。正当なタスクであっても、実行権限が広すぎたり、禁止事項が技術的に実装されていなかったりすれば、想定外の操作につながる場合があります。

出典