Claude Opus 5リリース—脆弱性発見はMythos 5に迫るが、エクスプロイト生成は大幅に制限。セキュリティ担当者が知るべき制限と活用の境界線

セキュリティニュース

投稿日時: 更新日時:

Claude Opus 5リリース—脆弱性発見はMythos 5に迫るが、エクスプロイト生成は大幅に制限。セキュリティ担当者が知るべき制限と活用の境界線

Anthropicは2026年7月24日、大規模言語モデル「Claude Opus 5」を正式にリリースしました。コーディングや業務自動化の分野でFable 5に迫る性能を、約半分のコストで提供する点が主な訴求点です。

一方、サイバーセキュリティの観点では、異なる特徴が見えてきます。Anthropicが自社開発したOSS-Fuzzベースの評価によると、Opus 5はソフトウェア脆弱性の発見においてMythos 5とほぼ同水準に達していますが、発見した脆弱性をエクスプロイトへ変換する能力では大きな差があります。

情報システム部門やセキュリティ担当者にとっては、Opus 5がどのようなセキュリティタスクを許可し、どのような処理を制限するのかを正確に理解することが、導入や運用の判断を左右します。

サマリー

  • Opus 5はFable 5の約半分のコストで、コーディングや業務自動化の評価においてFable 5に匹敵する性能を達成しています
  • OSS-Fuzz評価では、ソフトウェア脆弱性の発見能力がMythos 5とほぼ同水準です
  • エクスプロイト開発能力はMythos 5を大幅に下回っており、Anthropicは意図的な設計によるものと説明しています
  • バイナリを対象とした脆弱性スキャン、侵入テスト、エクスプロイト生成は引き続き制限されます
  • ソースコードを対象とした脆弱性発見は許可されており、コードレビューやセキュリティ監査への活用が可能です
  • 制限対象と判定されたリクエストは、Claude.ai、Claude Code、Claude Cowork上でOpus 4.8へ自動的にフォールバックします
  • Cyber Verification Programに参加する企業や研究者は、制限が緩和されたバージョンへアクセスできます
  • 価格はOpus 4.8と同じで、入力100万トークンあたり5ドル、出力100万トークンあたり25ドルです
項目 内容
リリース日 2026年7月24日
API上のモデル名 claude-opus-5
価格 入力5ドル/100万トークン、出力25ドル/100万トークン
脆弱性発見能力 OSS-Fuzz評価でMythos 5とほぼ同水準
エクスプロイト開発能力 OSS-Fuzz評価でMythos 5を大幅に下回る
許可される主なセキュリティタスク ソースコードを対象とした脆弱性スキャン
制限される主なセキュリティタスク バイナリベースのスキャン、侵入テスト、エクスプロイト生成
フォールバック先 Opus 4.8
制限緩和の方法 Cyber Verification Programへの参加
整合性評価スコア 2.3。同社モデルの中で最良と評価

Claude Opus 5のモデルラインナップ上の位置づけ

Anthropicのモデルラインナップは、Mythos 5を頂点とし、Fable 5やMythos 5などのフロンティアモデルと、その下位に位置するOpus、Sonnet、Haikuシリーズで構成されています。

Opus 5は、Fable 5に近い知能を約半分のコストで利用できる中間層の主力モデルとして位置づけられています。Claude MaxおよびClaude Proでは、デフォルトモデルとして採用されました。

コーディング評価のCursorBench 3.2では、Fable 5の最高スコアとの差を0.5%以内に抑えながらタスクを完遂し、コストはFable 5の約半分に抑えられています。

Frontier-Bench v0.1では、他のすべてのモデルを上回り、Opus 4.8と比較してタスクあたりのパフォーマンスを2倍以上に高めました。

ただし、サイバーセキュリティ関連のタスクでは、Mythos 5が引き続き優位であり、Opus 5との間には差が残っているとAnthropicは説明しています。この差は偶然生じたものではなく、意図的な設計によるものです。

OSS-Fuzz評価が示した能力の非対称性

Anthropicが開発したOSS-Fuzzベースの評価は、人間の関与を最小限に抑えた状態で、モデルがソフトウェアの脆弱性を発見し、さらに悪用可能なエクスプロイトとして完成させられるかを測定するものです。

評価結果からは、二つの異なる側面が確認できます。

脆弱性の発見については、Opus 5とMythos 5の成功率はほぼ同じ水準でした。一方、発見した脆弱性を実際に利用可能なエクスプロイトへ変換する工程では、Opus 5のスコアはMythos 5を大きく下回っています。

Anthropicはこの差について、Opus 5のトレーニングから攻撃的なサイバータスクを意図的に除外した結果だと説明しています。

Opus 5が脆弱性の発見で高い性能を示しているのは、モデル全体の推論能力やコーディング能力が向上したことによる副次的な結果であり、攻撃能力を直接訓練した結果ではないとしています。

この非対称性は、情報システム部門が防御目的でOpus 5を利用する際の重要な判断材料になります。バグを発見する能力と、発見したバグを攻撃手段へ変換する能力の間に、意図的な差が設けられているためです。

Opus 5に設定されたサイバーセキュリティ制限

AnthropicはOpus 5のリリースにあたり、前モデルであるOpus 4.8と同様の安全対策を維持しながら、一部のサイバーセキュリティタスクに対して、より強い制限を設定しました。

許可されているのは、ソースコードを対象とした脆弱性スキャンです。社内のコードレビューやセキュリティ監査に利用できる範囲であり、開発チームが自社のコードベースに含まれる問題を事前に発見する用途を想定しています。

一方、バイナリを対象とした脆弱性スキャン、侵入テスト、エクスプロイト生成の3つのカテゴリは、引き続き制限されます。

Anthropicは、バイナリベースの脆弱性スキャンについて、悪意のある攻撃者が利用する手法と結びつきやすいと評価しています。

Anthropicの分類器が制限対象のリクエストを検知した場合、Claude.ai、Claude Code、Claude Coworkでは、処理するモデルがOpus 4.8へ自動的に切り替わります。

APIでも同様のフォールバック動作を有効にできます。特定のリクエストがOpus 5で制限された場合でも、処理そのものを中断せず、次善のモデルから応答を返すことが可能です。

情報システム部門がClaudeを業務フローへ組み込む場合は、どのようなリクエストがフォールバックの対象になるのかを、事前に確認しておく必要があります。

Anthropicは、Opus 5の分類器が介入する頻度について、Fable 5と比較して約85%低くなると見込んでいます。Fable 5で頻繁に制限を受けていた利用者は、Opus 5では同じタスクでも制限されにくくなる可能性があります。

Cyber Verification Programによる制限緩和

正当なセキュリティ業務で制限を受ける企業や研究者に向けて、AnthropicはCyber Verification Programを提供しています。

Cyber Verification Programに参加している企業や研究者は、Opus 5の一般提供開始と同時に、一部の制限が緩和されたバージョンへアクセスできるようになりました。

同プログラムの詳細はAnthropicのサポートページで公開されています。正当な目的を持つセキュリティ企業、ペネトレーションテスト事業者、研究機関などが申請対象とされています。

Project Glasswingを通じて日立などが参加しているように、Anthropicは機密性の高いセキュリティ用途に対して、利用者の属性や目的を確認したうえで段階的にアクセスを許可する仕組みを整備しています。

整合性と安全性の評価結果

Anthropicが実施した自動行動監査では、Opus 5の全体的な不整合行動スコアは2.3でした。

この数値はOpus 4.8、Sonnet 5、Fable 5を下回っており、Anthropicのモデル群の中で最も高い整合性を示したと評価されています。

欺瞞的な行動の発生率も最も低く、利用者から不適切な方向へ誘導された場合でも、誤用につながりにくい特性が確認されたとしています。

悪用される可能性のあるデュアルユース能力についても、Mythos 5と比較すると、生物学研究と攻撃的サイバーセキュリティの両分野で能力の水準が低いと評価されました。

Anthropicは、Opus 5が危険な能力の最先端を押し上げるリスクはないと判断しています。この評価は、民間企業や政府機関のパートナーと共同で実施した検証に基づくものです。

Mythos 5が一般公開されず、政府機関を含む一部の信頼された組織へ限定的に提供されている状況とも整合しています。

エクスポートコントロール問題の経緯

Anthropicは前月、トランプ政権から示された懸念を受け、FableおよびMythosモデルを一時的にオフライン化しました。

外国籍の利用者によるアクセスが問題視されたとみられています。その後、制限は解除され、対象モデルは再展開されました。

ただし、Mythos 5は引き続き一般公開されておらず、少数の信頼された組織に限定して提供されています。Fable 5は、Mythos 5と同じ基盤モデルをベースにしながら、安全対策を追加した一般利用者向けモデルとして位置づけられています。

Opus 5はこうした経緯の中で、Fable 5に近い実用性を持ちながら、より広い利用者へ提供されるモデルとして登場しました。

情報システム部門への示唆

Opus 5の登場によって、AIを利用したセキュリティ業務の実用的な境界が、これまでより明確になりました。

自社ソースコードの脆弱性スキャンでは、Opus 5は現実的な選択肢になります。Fable 5より制限を受けにくく、Opus 4.8より高い能力を持つという位置づけは、開発チームとセキュリティチームが共同で実施するコードレビューに適しています。

一方、ペネトレーションテストや脆弱性のPoCコード生成など、攻撃的な手法を伴うセキュリティタスクは、引き続きOpus 5では制限されます。

これらの業務で生成AIによる生産性向上を求めるセキュリティベンダーや専門組織にとっては、Cyber Verification Programへの参加を検討する実務上の理由があります。

AIガバナンスの観点では、Claude APIやClaude製品を業務へ組み込んでいる企業は、利用モデルをOpus 5へ変更した際に、どのようなリクエストがフォールバックを引き起こすのかを確認する必要があります。

フォールバック先がOpus 4.8であるため、処理内容によっては応答品質や結果の一貫性に影響する可能性があります。特に、セキュリティ関連の処理を自動化している環境では、使用されたモデル、制限判定、フォールバックの発生状況をログとして記録することが重要です。

Opus 5をソースコードレビューへ利用する場合も、AIが出力した脆弱性評価をそのまま採用するのではなく、人間による確認や既存のSAST、DAST、ソフトウェア構成分析などと組み合わせる必要があります。

出典