DetectGPT と曲率検出 —— 訓練なしで見抜く零サンプル検出
この記事で分かること:訓練データを必要としない検出手法 DetectGPT の発想——AI の文章は対数確率空間の「へこんだ」場所にあり、少し書き換えると確率が下がる——と、その美しい限界です。
更新日:2026年8月16日
発想:AI の文章は「へこみ」に落ちている
解釈Mitchell らの DetectGPT(ICML 2023, arXiv 2301.11305)の核心はこうです。言語モデルが生成した文章は、そのモデルの対数確率関数の「局所的なへこみ(負の曲率)」に位置しています。つまり、その文章を少しだけ書き換えると、確率はたいてい下がります。
人間の文章にはこの性質がありません。書き換えても確率が上がることも下がることもあります。この差を測るのが曲率検出です。
何が巧みなのか
解釈この手法は訓練データを必要としません。新しい検出器を学習する必要がなく、生成モデルへの確率アクセス(そのモデルで「この文章の確率は?」と聞けること)さえあれば動きます。水印のように生成側の協力も要りません。
「モデル自身の確率地形を使う」という発想は、検出の問題を統計から幾何学に置き換えた点でエレガントです。
限界:言い換えと「誰の確率か」
解釈二つの実用的な限界があります。第一に、文章を言い換えると曲率の信号が弱まります——理論限界の研究(页 1 の Sadasivan ら)が示すとおり、言い換えはこの族にも有効です。
第二に、確率アクセスが必要なことです。どのモデルで生成されたか分からない文章に対しては、「どのモデルの確率地形で測るか」という問題が残ります。汎用の検出器としてそのまま使えるわけではありません。
実測で見る:言い換えへの弱さは私たちのデータにもある
実測私たちのベンチマークには「同義言い換え(hard rewrite)」の难易度档があり、複数の検出エンジンがその档で明らかに精度を落とします。曲率検出に限らず、「書き換えに弱い」は現世代の検出技術全体の構造的な弱点です。
このページの読みどころ
このページは技術の深さを示すためのものです。「検出は万能ではないが、工夫の余地は大きい」——検出科学が今日も進んでいることを知ってもらえれば十分です。
