本文へ移動
バージョン管理された評価記録

信頼できる結果には、根拠の届く範囲が見えます。

手法、検証した範囲、限界を公開します。過去のベンチマークを、現在の精度保証として使い回しません。

現在の日本語評価ステータス

現在の手法には、選定に使用した142件の凍結済み validation set があります。このデータは手法の選択に影響したため、開発上の根拠ではありますが、独立した現行精度の推定値ではありません。

独立・盲検の held-out 評価は、まだ公開ゲートを通過していません。そのため、現在の日本語 FPR、TPR、AUC、正解率は公開していません。

手法バージョン
omnidetect-v5.0
選定時の根拠
142件 · validation のみ
数値の公開状態
held-out 通過まで非公開
held-out 対象場面
大学レポート · 感想文/読書感想文 · 志望理由書 · 一般作文

数値を公開するまでに必要なこと

1

独立して収集

エンジン、プロンプト、しきい値の選定に使った語料と重ならない、利用許可を確認した新規サンプルを集めます。

2

凍結して盲検

本文ハッシュ、場面メタデータ、費用上限を固定し、実行完了まで正解ラベルを評価側から隔離します。

3

実際の課題を測定

FPR、TPR、AUC、位置特定 recall/fallout、件数、95%信頼区間を記録します。

4

一つの記録から公開

現在の手法バージョンに結びついた再現可能な実行だけが、結果画面と本ページの数値を解禁します。

この評価でも証明できないこと

検出結果だけで、文書の執筆者を証明することはできません。

ある言語や文章場面の性能を、別の場面へそのまま流用できません。

部分検査や縮退時の結果は、現行手法による全文検査より根拠の範囲が狭くなります。

手法、提供元、しきい値を変えた場合は、新しいバージョンで再評価が必要です。

現在の手法には、選定に使用した142件の凍結済み validation set があります。このデータは手法の選択に影響したため、開発上の根拠ではありますが、独立した現行精度の推定値ではありません。

現在の手法バージョンに結びついた再現可能な実行だけが、結果画面と本ページの数値を解禁します。

信頼性について

いま確認したい文書を検査

あなたの結果に付いた過程、根拠、限界を確認できます。

無料で検査する

過去のvalidation記録 · 現在の精度ではありません

221篇の選定用マトリクスを、限界と一緒に保存

この凍結済み日本語マトリクスは、監査できる過去の観測記録として残しています。方法選定に影響したデータのため、現在のOmniDetect本番精度の推定や現在の事業者ランキングには使えません。 過去の測定スナップショット: 2026年8月20日.

公開状態

内部validationの過去記録です。既存語料と重ならない盲検held-out評価が通るまで、現在の製品精度数値は公開しません。

コーパスと閾値

日本語221篇(人間執筆90・AI/混在131)。この過去実行ではスコア70以上をAI判定として数えました。

セルの読み方

人間列は誤判定数、AI列は検出数です。この語料、閾値、提供元バージョン、測定日にだけ対応する値です。

OmniDetectの行を表示しない理由

この語料はOmniDetectの方法選定にも使われました。その行を現在の性能として見せると、選定データを独立評価のように再利用することになります。再現用アーカイブには行を残しますが、held-out公開ゲートを通るまで顧客向けの数値主張には使いません。

過去の測定時の検出器人間執筆・文学65篇(2020年以前・出典追跡可)人間執筆・学生文体25篇(同条件)AI・Gemini52 篇AI・GPT-4o20 篇AI・Claude20 篇AI・学生文体15 篇AI・言い換え12篇(難条件)人間+AI混在12篇(最難条件)
Pangram0/650/2552/5220/2020/2015/1512/126/12
User Local過去実行ではサービス上限の範囲で221/221件を測定。0/650/2517/5211/203/200/150/120/12
Sapling48/6522/2520/527/207/204/152/128/12
ZeroGPT0/650/252/520/200/200/150/120/12
Winston過去のAPI測定時点では日本語非対応(LANGUAGE_NOT_SUPPORTED)。

各提供元のシステムは測定後に変わっている可能性があります。以下は一つの日本語語料での過去観測であり、現在の機能・料金・普遍的精度・推奨順位ではありません。