公開ベンチマーク
日本語AI検出ベンチマーク:221篇の実測マトリクス
主要なAIチェッカーを同じ凍結語料・同じ閾値(≥70でAI判定)で測りました。私たち自身のチェーンも同じ欄に載せ、 誤検知は隠しません。測定日:2026年8月17日。
語料(221篇・凍結)
人写 90 篇(すべて 2020 年以前・出所追跡可能)+ AI 131 篇 (Gemini / GPT-4o / Claude 三生成器 × 通常・学生口吻・ 同义改写・人机混写の難度別)。
測定条件
閾値 ≥70 を AI 判定。私たちの経路は本番稼働中の そのまま(GLM+Qwen 组合・分歧时是终审)を測定—— 近似版ではありません。
読み方
人写列は誤判定数(少ないほど良い)、AI 列は正しく AI と 検出した数(多いほど良い)。「—」は未測定です。
| 引擎 | 人写・文学65 篇(pre-2020 可溯源) | 人写・学生文体25 篇(同左) | AI・Gemini52 篇 | AI・GPT-4o20 篇 | AI・Claude20 篇 | AI・学生口吻15 篇 | AI・同义改写12 篇(难档) | 人机混写12 篇(最难档) |
|---|---|---|---|---|---|---|---|---|
| OmniDetect(本站) | 0/65 | 5/25 | 51/52 | 20/20 | 20/20 | 15/15 | 12/12 | 12/12 |
| Pangram | 0/65 | 0/25 | 52/52 | 20/20 | 20/20 | 15/15 | 12/12 | 6/12 |
| User Local每日 100 次/IP 上限,21 篇缺口全在 AI 侧,人写侧完整 | 0/65 | 0/25 | 17/52 | 11/19 | — | 0/15 | 0/12 | 0/12 |
| Sapling | 48/65 | 22/25 | 20/52 | 7/20 | 7/20 | 4/15 | 2/12 | 8/12 |
| ZeroGPT | 0/65 | 0/25 | 2/52 | 0/20 | 0/20 | 0/15 | 0/12 | 0/12 |
| WinstonAPI 实锤不支持日语(LANGUAGE_NOT_SUPPORTED) | — | — | — | — | — | — | — | — |
私たちの弱点も同じ欄に
OmniDetect のチェーンは学生文体の人写 25 篇中 5 篇を誤判定しました (omni_score 80–95)。この 5 篇は製品改善の的として特定済みで、 改善後に再測定してこの表を更新します。数字が悪い場面を公開することが、 この表の信用の根拠です。
