公開状態
内部validationの過去記録です。既存語料と重ならない盲検held-out評価が通るまで、現在の製品精度数値は公開しません。
手法、検証した範囲、限界を公開します。過去のベンチマークを、現在の精度保証として使い回しません。
現在の手法には、選定に使用した142件の凍結済み validation set があります。このデータは手法の選択に影響したため、開発上の根拠ではありますが、独立した現行精度の推定値ではありません。
独立・盲検の held-out 評価は、まだ公開ゲートを通過していません。そのため、現在の日本語 FPR、TPR、AUC、正解率は公開していません。
エンジン、プロンプト、しきい値の選定に使った語料と重ならない、利用許可を確認した新規サンプルを集めます。
本文ハッシュ、場面メタデータ、費用上限を固定し、実行完了まで正解ラベルを評価側から隔離します。
FPR、TPR、AUC、位置特定 recall/fallout、件数、95%信頼区間を記録します。
現在の手法バージョンに結びついた再現可能な実行だけが、結果画面と本ページの数値を解禁します。
検出結果だけで、文書の執筆者を証明することはできません。
ある言語や文章場面の性能を、別の場面へそのまま流用できません。
部分検査や縮退時の結果は、現行手法による全文検査より根拠の範囲が狭くなります。
手法、提供元、しきい値を変えた場合は、新しいバージョンで再評価が必要です。
現在の手法には、選定に使用した142件の凍結済み validation set があります。このデータは手法の選択に影響したため、開発上の根拠ではありますが、独立した現行精度の推定値ではありません。
現在の手法バージョンに結びついた再現可能な実行だけが、結果画面と本ページの数値を解禁します。
過去のvalidation記録 · 現在の精度ではありません
この凍結済み日本語マトリクスは、監査できる過去の観測記録として残しています。方法選定に影響したデータのため、現在のOmniDetect本番精度の推定や現在の事業者ランキングには使えません。 過去の測定スナップショット: 2026年8月20日.
内部validationの過去記録です。既存語料と重ならない盲検held-out評価が通るまで、現在の製品精度数値は公開しません。
日本語221篇(人間執筆90・AI/混在131)。この過去実行ではスコア70以上をAI判定として数えました。
人間列は誤判定数、AI列は検出数です。この語料、閾値、提供元バージョン、測定日にだけ対応する値です。
この語料はOmniDetectの方法選定にも使われました。その行を現在の性能として見せると、選定データを独立評価のように再利用することになります。再現用アーカイブには行を残しますが、held-out公開ゲートを通るまで顧客向けの数値主張には使いません。
| 過去の測定時の検出器 | 人間執筆・文学65篇(2020年以前・出典追跡可) | 人間執筆・学生文体25篇(同条件) | AI・Gemini52 篇 | AI・GPT-4o20 篇 | AI・Claude20 篇 | AI・学生文体15 篇 | AI・言い換え12篇(難条件) | 人間+AI混在12篇(最難条件) |
|---|---|---|---|---|---|---|---|---|
| Pangram | 0/65 | 0/25 | 52/52 | 20/20 | 20/20 | 15/15 | 12/12 | 6/12 |
| User Local過去実行ではサービス上限の範囲で221/221件を測定。 | 0/65 | 0/25 | 17/52 | 11/20 | 3/20 | 0/15 | 0/12 | 0/12 |
| Sapling | 48/65 | 22/25 | 20/52 | 7/20 | 7/20 | 4/15 | 2/12 | 8/12 |
| ZeroGPT | 0/65 | 0/25 | 2/52 | 0/20 | 0/20 | 0/15 | 0/12 | 0/12 |
| Winston過去のAPI測定時点では日本語非対応(LANGUAGE_NOT_SUPPORTED)。 | — | — | — | — | — | — | — | — |
各提供元のシステムは測定後に変わっている可能性があります。以下は一つの日本語語料での過去観測であり、現在の機能・料金・普遍的精度・推奨順位ではありません。