本文へ移動
バージョン管理された評価記録

信頼できる結果には、根拠の届く範囲が見えます。

手法、検証した範囲、限界を公開します。過去のベンチマークを、現在の精度保証として使い回しません。

現在の日本語評価ステータス

現在の手法には、選定に使用した142件の凍結済み validation set があります。このデータは手法の選択に影響したため、開発上の根拠ではありますが、独立した現行精度の推定値ではありません。

独立・盲検の held-out 評価は、まだ公開ゲートを通過していません。そのため、現在の日本語 FPR、TPR、AUC、正解率は公開していません。

手法バージョン
omnidetect-v5.0
選定時の根拠
142件 · validation のみ
数値の公開状態
held-out 通過まで非公開
held-out 対象場面
大学レポート · 感想文/読書感想文 · 志望理由書 · 一般作文

数値を公開するまでに必要なこと

1

独立して収集

エンジン、プロンプト、しきい値の選定に使った語料と重ならない、利用許可を確認した新規サンプルを集めます。

2

凍結して盲検

本文ハッシュ、場面メタデータ、費用上限を固定し、実行完了まで正解ラベルを評価側から隔離します。

3

実際の課題を測定

FPR、TPR、AUC、位置特定 recall/fallout、件数、95%信頼区間を記録します。

4

一つの記録から公開

現在の手法バージョンに結びついた再現可能な実行だけが、結果画面と本ページの数値を解禁します。

この評価でも証明できないこと

検出結果だけで、文書の執筆者を証明することはできません。

ある言語や文章場面の性能を、別の場面へそのまま流用できません。

部分検査や縮退時の結果は、現行手法による全文検査より根拠の範囲が狭くなります。

手法、提供元、しきい値を変えた場合は、新しいバージョンで再評価が必要です。

現在の手法には、選定に使用した142件の凍結済み validation set があります。このデータは手法の選択に影響したため、開発上の根拠ではありますが、独立した現行精度の推定値ではありません。

現在の手法バージョンに結びついた再現可能な実行だけが、結果画面と本ページの数値を解禁します。

信頼性について

いま確認したい文書を検査

あなたの結果に付いた過程、根拠、限界を確認できます。

無料で検査する