ニュース

Anthropicのセマンティック透かし:Claudeは意図的に悪い単語を選ぶようになる

AnthropicがClaudeのテキストに透かしを埋め込むため、トークン選択を「グリーン」リストの単語に偏らせる計画は、出力品質の意図的な低下であり、200トークンを超えるすべての応答(プライベートチャットも含む)に適用されます。

August 17, 2026· 1 min read· 出典: Daring Fireball
Anthropicのセマンティック透かし:Claudeは意図的に悪い単語を選ぶようになる

Anthropicは、EUの透明性規制に準拠するため、すべてのClaudeモデルが生成テキストにセマンティック透かしを埋め込むと発表しました。元のサポート文書では、透かしは「知覚不能」であり、「意味、品質、読みやすさ」を変えないと主張していました。しかし、その主張は誤解を招くものであることが明らかになりました。実際のメカニズムは、推論時にトークン選択を偏らせ、統計的に検出可能な方法で単語の選択を微妙に変更します。

この技術は、Anthropicのフォローアップ記事とJames Padolseyのインタラクティブエッセイで説明されているように、偏ったコインのように機能します。各トークン生成ステップで、モデルは秘密の「グリーン」リストから単語を選ぶ可能性が「レッド」リストから選ぶ可能性よりもわずかに高くなります。リストは秘密鍵でその場で計算されるため、優先される単語の静的な語彙はありません。検出には鍵が必要です。Anthropicだけが自社の透かしを検証でき、他のプロバイダーは他社の透かしを検出できません。

重要な詳細:これは、200トークン(約150語)を超えるすべてのClaude出力に適用され、ユーザーだけが読むプライベートな会話も含まれます。モデルは、Anthropicの規制遵守に役立つ発信元シグナルを埋め込むために、精度と明瞭さを犠牲にします(たとえわずかでも)。これはユーザーの利益のためではありません。

核心的な問題:同義語はどれも同じではない

「彼はその機会に飛びついた」と「彼はその機会に跳びついた」は同じ文ではありません。正確な単語の選択は文章において重要です。モデルが「グリーン」リストに誘導されると、わずかに精度が低く、わずかに慣用的でなく、またはトーンがわずかにずれた単語を選ぶ可能性があります。これらはすべて、ユーザーが求めていない、そして利益を得ることもない透かしのために行われます。

Anthropicの枠組みはこれを無害なトレードオフとして扱っていますが、これはユーザーに代わって、同意なしに、出力を改善しない目的で行われるトレードオフです。すでに退屈で一般的な散文を生成すると批判されているツールにとって、意図的に(たとえわずかでも)悪くすることは、間違った方向への一歩です。

EU規制の観点

これを動機付ける規制、EUのAI生成コンテンツの透明性に関する行動規範は、AIの発信元に対処するための官僚的な試みです。しかし、実装はコストをユーザーに転嫁します:出力品質の低下であり、ユーザーに直接的な利益はありません。透かしは確率的であるため、短いテキストでは信頼できる検出器でさえありません。150語のメールでは、シグナルが弱すぎて確信が持てません。したがって、ユーザーは品質税を支払い、透かしは最も重要かもしれないテキストでその目的を果たせません。

Anthropicは、ユーザーに何の利益ももたらさない目的のために、意図的にモデルの出力を悪くすると言っています。
Manul X 編集部