本文へ移動

公開ベンチマーク

日本語AI検出ベンチマーク:221篇の実測マトリクス

主要なAIチェッカーを同じ凍結語料・同じ閾値(≥70でAI判定)で測りました。私たち自身のチェーンも同じ欄に載せ、 誤検知は隠しません。測定日:2026年8月17日

語料(221篇・凍結)

人写 90 篇(すべて 2020 年以前・出所追跡可能)+ AI 131 篇 (Gemini / GPT-4o / Claude 三生成器 × 通常・学生口吻・ 同义改写・人机混写の難度別)。

測定条件

閾値 ≥70 を AI 判定。私たちの経路は本番稼働中の そのまま(GLM+Qwen 组合・分歧时是终审)を測定—— 近似版ではありません。

読み方

人写列は誤判定数(少ないほど良い)、AI 列は正しく AI と 検出した数(多いほど良い)。「—」は未測定です。

引擎人写・文学65 篇(pre-2020 可溯源)人写・学生文体25 篇(同左)AI・Gemini52 篇AI・GPT-4o20 篇AI・Claude20 篇AI・学生口吻15 篇AI・同义改写12 篇(难档)人机混写12 篇(最难档)
OmniDetect(本站)0/655/2551/5220/2020/2015/1512/1212/12
Pangram0/650/2552/5220/2020/2015/1512/126/12
User Local每日 100 次/IP 上限,21 篇缺口全在 AI 侧,人写侧完整0/650/2517/5211/190/150/120/12
Sapling48/6522/2520/527/207/204/152/128/12
ZeroGPT0/650/252/520/200/200/150/120/12
WinstonAPI 实锤不支持日语(LANGUAGE_NOT_SUPPORTED)

私たちの弱点も同じ欄に

OmniDetect のチェーンは学生文体の人写 25 篇中 5 篇を誤判定しました (omni_score 80–95)。この 5 篇は製品改善の的として特定済みで、 改善後に再測定してこの表を更新します。数字が悪い場面を公開することが、 この表の信用の根拠です。

あわせて読む