HN103
AI生成テキストに透かしを入れる技術:仕組みと実装の基礎を徹底解説
How AI text watermarking works
padolsey・約18時間前
How AI text watermarking works
AIによって生成されたテキストを識別するための「AIテキスト・ウォーターマーキング」がどのように機能するのか、その技術的な仕組みについて解説します。現在の生成AIモデルでは、次に来るトークンを選択する際に特定の確率分布を利用していますが、ウォーターマークはこのプロセスに意図的な偏りを持たせることで実現されます。具体的には、ボキャブラリーを「グリーンリスト(許可される単語)」と「レッドリスト(制限される単語)」のようなグループに擬似ランダムで分割し、グリーンリストのトークンが選ばれやすくなるようにログジット(logit)を調整します。この微細な統計的パターンを検証することで、人間には判別不能でありながら、AIによって生成されたことを数学的に証明することが可能になります。
ウォーターマーカーが使ってるキーを特定するのに、どれくらいの出力テキストが必要になるのか気になるな。
一発で当てられたのが信じられない。ステガノグラフィに興味がある数学の博士なら1週間でいい手法を思いつくかもって推測してたけど、俺みたいな素人でも5分で見抜けたぞ。
これがプロバイダーの新しい収益源になるかもね。Claudeが生成したテキストかどうか知りたい?それならコピペで使える無料のウェブフォームがあるよ。
もちろん、API料金を払えば独自のチェックサービスを運営することもできるし、複数のソースを確認できるサービスならユーザーにとっても便利だよね。まあ、その分どこかへ支払いが発生するわけだけど。
結局のところ、誰かがローカルモデルで文章を書き直せば、マーカーは消えてまた無効化されちゃうんだろうな。