OpenAI、ChatGPTとCodexのテキストに「見えないウォーターマーク」導入へ―EU AI Act対応、APIでは世界向けに任意提供

セキュリティニュース

投稿日時: 更新日時:

OpenAI、ChatGPTとCodexのテキストに「見えないウォーターマーク」導入へ―EU AI Act対応、APIでは世界向けに任意提供

OpenAIは2026年10月5日、EU AI Act(欧州AI法)の透明性要件への対応として、ChatGPTやCodexが生成するテキストへ機械可読のウォーターマークを付与する方針を公表しました。

OpenAIが開発した「textGrain」は、文章へ不可視文字や特殊記号を追加する方式ではなく、モデルが単語やトークンを選択する際の確率をわずかに調整し、人間には見えない統計的なパターンを文章中へ埋め込む仕組みです。

EUでは今後数週間かけて、対象となるChatGPTとCodexのテキスト出力へ順次適用します。一方、APIでは世界中の顧客が対応モデルについて任意で有効化でき、初期状態ではオフとなります。

OpenAIは同時に、テキストウォーターマークの検出には偽陽性・偽陰性があり、文章の言い換えや翻訳によって検出性能が大きく低下すると説明しています。このため、テキスト用検出ツールは当初、承認された研究者や専門組織へ限定して提供します。

OpenAIのテキストウォーターマーク導入のサマリー

  • OpenAIが2026年10月5日に「textGrain」を使ったテキスト来歴管理の方針を公表
  • EUの対象ChatGPT・Codexユーザーへ今後数週間で段階導入
  • APIでは世界中の顧客が対応モデルについて任意で有効化可能
  • APIでは初期状態でテキストウォーターマークはオフ
  • textGrainは不可視文字ではなく、単語・トークン選択の統計パターンを利用
  • OpenAIはSynthID for textと同等以上の検出性能を確認したと説明
  • 1%の偽陽性率を前提に、心理学系の200トークン文章で約80%、400トークンで約95%を検出
  • 400トークン文章で単語の10%を類義語へ置換すると検出率は約92%から66%へ低下
  • 25%を置換すると検出率は17%まで低下
  • 短文、数学、コード、翻訳、大幅な言い換えでは検出が難しくなる
  • 検出器は当初、承認された研究者・専門組織に限定提供
  • OpenAIはtextGrainを将来的にオープンソース化する予定
項目 内容
技術名 textGrain
公表日 2026年10月5日
ChatGPT / Codex EUで対象出力へ段階導入
API 世界向け、任意で有効化
API初期設定 オフ
検出方式 単語・トークン選択へ統計的シグナルを埋め込み
公開検出ツール テキストは一般公開せず、承認組織へ限定
オープンソース化 将来予定
背景 EU AI Act第50条への対応

EU AI Act第50条がAI生成コンテンツの機械可読マークを要求

今回の背景にあるのが、2026年8月2日から適用されているEU AI Act第50条の透明性義務です。

欧州委員会のガイドラインでは、生成AIなどの提供者に対し、AIが生成・加工したコンテンツを機械可読な形式で識別できるようにすることを求めています。

対象にはテキストだけでなく、

  • 画像
  • 音声
  • 動画

も含まれます。

一方、AIシステムを利用する側についても、ディープフェイクや、人間によるレビュー・編集管理なしで公共の関心事項について公開するAI生成テキストなどでは、利用者へAI生成物であることを知らせる義務が定められています。

OpenAIは今回の対応について、EU AI Actと「AI生成コンテンツの透明性に関する行動規範」に沿ったものと説明しています。

Anthropicも同じEU AI Act対応としてClaudeへ機械可読マークを導入しており、セキュリティ対策LabではClaudeがAI生成コンテンツへ機械可読マークを導入した事例を取り上げています。

textGrainは「隠し文字」を文章へ埋め込む仕組みではない

テキストのウォーターマークと聞くと、不可視文字やゼロ幅スペース、特殊なUnicode文字を文章中へ埋め込む方式を想像しがちです。

OpenAIのtextGrainは、その方式ではありません。

大規模言語モデルは文章を生成する際、次に出力する複数の候補トークンへそれぞれ確率を割り当てます。

textGrainでは、この候補の確率分布を秘密鍵に基づいてわずかに調整します。

文章として読んだ場合には通常の文章と変わりませんが、長い文章全体では、特定の単語やトークンが選ばれる確率に統計的なパターンが残ります。

同じ秘密鍵と設定を持つ検出器が文章を分析することで、そのパターンが偶然発生する確率より高いかを確認し、OpenAI由来のウォーターマークが含まれている可能性を評価します。

OpenAIは、textGrainについて、

  • 不可視文字を追加しない
  • 余分なトークンを挿入しない
  • 特殊な句読点を使わない
  • コピー&ペーストでも見えない情報が付着するわけではない

と説明しています。

つまり、文章そのものの「言葉の選ばれ方」にシグナルを持たせる方式です。

200トークンでは約80%、400トークンでは約95%を検出

OpenAIはtextGrainの評価結果も公開しています。

心理学など比較的自由度の高い文章について、偽陽性率を1%に設定した場合、

  • 200トークン:約80%
  • 400トークン:約95%

のウォーターマークを検出できたとしています。

文章が長いほど統計的なシグナルを確認しやすくなるため、検出率が高くなります。

一方、数学のように表現の自由度が低い文章では、検出性能が大きく低下しました。

数学の回答やコードでは、正しい答えを表現するために使える単語や記号の候補が限定されます。

モデル側がウォーターマークを埋め込むために単語を選択できる余地が少なくなるためです。

この特性から、短いメール文、コード、数式、定型文などでは、OpenAIが生成した文章であっても検出できないケースが増えます。

文章の10%を書き換えるだけでも検出率は92%から66%へ

textGrainのもう一つの大きな制約が、編集への耐性です。

OpenAIは400トークンの英語文章について、単語を類義語へ置換する評価を行いました。

結果は次のとおりです。

編集量 ウォーターマーク検出率
編集なし 約92%
単語の10%を類義語へ置換 約66%
単語の25%を類義語へ置換 約17%

文章の4分の1を書き換えると、検出率は大幅に低下します。

また、OpenAIは翻訳や大幅なパラフレーズでもウォーターマークが検出できなくなる可能性があると説明しています。

このため「AI生成文章には必ずウォーターマークが残る」と考えることはできません。

特に企業で、

  • AI生成文章を人間が編集
  • 日本語から英語へ翻訳
  • 要約して再利用
  • 複数のAIでリライト

といった処理を行った場合、最終成果物から元のシグナルが検出できなくなる可能性があります。

ウォーターマークなし=人間が書いた文章、ではない

OpenAIは、検出結果の解釈についても明確に注意を促しています。

ウォーターマークが検出された場合、それは対応するOpenAIモデルが文章生成または加工へ関与した可能性を示すシグナルになります。

しかし、それだけでは、

  • 誰が文章を作成したのか
  • 人間がどの程度編集したのか
  • 誰が所有権を持つのか
  • 著作権上の権利者は誰か
  • 内容が正確か
  • 法的責任を誰が負うのか

を判断できません。

逆に、ウォーターマークが検出されなかったとしても、人間が作成した文章である証拠にはなりません。

例えば、

  • ウォーターマーク導入前に生成された
  • 対象外モデルで生成された
  • 別のAIサービスで生成された
  • 大幅に書き換えられた
  • 翻訳された
  • 短すぎて検出できない

といったケースがあります。

企業が採用選考、学校教育、不正調査、内部監査などでAI検出結果を利用する場合、「検出された/されなかった」という結果だけで人物の行為を断定する運用は避ける必要があります。

検出器を一般公開しない理由は「回避」と「誤判定」

OpenAIは、画像・音声向けのopenai.com/verifyやContent Provenance APIについては公開しています。

一方、テキスト用のウォーターマーク検出器は当初、一般公開しません。

利用できるのは、

  • 学術研究機関
  • テキスト来歴を研究する組織
  • 検出信頼性を評価する専門組織

など、OpenAIが承認した組織に限定されます。

OpenAIは理由の一つとして、偽陽性と偽陰性の問題を挙げています。

誤検出が発生する技術を一般利用へ広げると、「AI生成ではない文章をAI生成と誤判定する」ことで、教育、採用、報道などに不利益を与える可能性があります。

また、検出器を広く公開すると、文章を書き換えながら検出されなくなるまで試す「検出回避」に利用される可能性もあります。

OpenAIは実利用データを集めながら検出器の信頼性を評価し、将来的な提供範囲を検討するとしています。

ウォーターマークを付けてもAstraの性能低下は確認されず

ウォーターマークによって文章品質が下がるのかについても、OpenAIは評価結果を公開しています。

同社のフロンティアモデル「Astra」について、ウォーターマークあり/なしで複数ベンチマークを比較しました。

代表的な結果は次のとおりです。

評価 ウォーターマークなし ウォーターマークあり
Artificial Analysis Intelligence Index 49.57 49.76
DeepSWE v1.1 72.80% 71.68%
BrowseComp 87.92% 87.35%
HealthBench Professional 64.27% 64.60%
GPQA Diamond 94.44% 93.94%

OpenAIは、これらの差は通常の評価実行で発生するばらつきの範囲であり、意味のある品質低下は確認していないとしています。

生成速度への影響も「negligible(無視できる程度)」と説明しています。

EUではChatGPTとCodexへ適用、APIは世界向けオプトイン

OpenAIは提供形態によって異なる導入方法を取ります。

ChatGPT・Codex

EUでは今後数週間かけて、対象となるChatGPTとCodexのテキスト出力へウォーターマークを導入します。

OpenAIは対象プランについて「all plans」としており、対象ユーザーでは利用プランにかかわらず段階的に適用します。

ただし、全てのモデルや全ての出力が必ず対象になるわけではなく、対象モデル、生成経路、出力内容などによって適用範囲が異なる場合があります。

API

APIでは2026年10月5日から、世界中の顧客が対応モデルについてtextGrainを有効化できます。

APIではデフォルトで無効です。

企業側が、

  • EU AI Act対応
  • 自社サービスでAI生成コンテンツを識別
  • コンテンツ管理
  • AI生成物の内部追跡

などの目的に応じて選択します。

OpenAIはクラウドパートナーとも連携し、外部クラウド経由で利用するOpenAIモデルについてもウォーターマーク対応を進めるとしています。

OpenAIは画像・音声ではC2PAとSynthIDを併用

OpenAIはテキストだけでなく、画像や音声についても生成物の来歴を示す仕組みを導入しています。

対応する画像では、

  • Content Credentials(C2PA)
  • SynthID

を併用しています。

音声にはSynthIDを埋め込んでいます。

C2PAはファイルへ生成元や編集履歴などのメタデータを保持できる一方、スクリーンショットや形式変換によって失われる場合があります。

ウォーターマークはコンテンツ自体へ埋め込まれるため、メタデータが削除されても残る場合があります。

OpenAIは「単一の来歴技術だけでは十分ではない」として、複数の技術を組み合わせる方針です。

日本企業にも影響、EU向け生成AIサービスではAPI設定を確認

今回のChatGPTへのウォーターマーク導入はEU地域が中心ですが、日本企業にも影響があります。

特に確認したいのは、OpenAI APIを利用してEU向けサービスを提供している企業です。

APIではウォーターマークがデフォルトでオフのため、

「OpenAIを使っているから自動的にEU AI Actの機械可読マークへ対応する」

とは限りません。

EU向けサービスでAI生成テキストを利用する場合は、

  • 利用モデルがtextGrain対応か
  • API設定でウォーターマークを有効化しているか
  • 対象コンテンツがArticle 50の対象になるか
  • 利用者への表示義務が別途あるか
  • 人間によるレビュー・編集工程があるか
  • 委託先やSaaS経由でAIを利用している場合の責任分界

を法務・AIガバナンス部門と確認する必要があります。

EU AI Actはウォーターマークだけで遵守できる制度ではありません。

セキュリティ対策Labでは、域外適用や取引先経由の影響を含めたAIガバナンスとEU AI Actへの対応も整理しています。

AI生成物を「判定する技術」から「生成時に印を付ける技術」へ

従来のAIテキスト検出では、完成した文章を後から分析し、

「AIが書いた可能性が高いか」

を分類器で推定する方式が多く使われてきました。

textGrainは考え方が異なります。

生成時点でモデル自身が統計的なシグナルを埋め込み、後から対応する検出器で確認します。

この方式では、第三者のAI判定サービスより生成元を直接示しやすい一方、文章が編集されればシグナルが失われるという弱点があります。

そのため、企業での使い方も、

「AI文章かどうかを確定する証拠」

ではなく、

「生成経路を判断するための一つの証拠」

として扱うのが適切です。

AnthropicのClaudeでも同様に機械可読マークの導入が進んでおり、生成AI各社がEU AI Act対応を契機にコンテンツ来歴技術を標準機能へ移し始めています。

一方で、Claudeのウォーターマーク除去をうたうツールが登場した事例のように、マーキング技術と回避手法の競争も発生しています。

今後は「ウォーターマークがあるか」だけではなく、C2PAなどの来歴情報、公開時の表示、編集履歴、利用ログを組み合わせてAI生成コンテンツを管理する形へ移っていくことになります。

出典