バージョン管理された評価記録
信頼できる結果には、根拠の届く範囲が見えます。
手法、検証した範囲、限界を公開します。過去のベンチマークを、現在の精度保証として使い回しません。
現在の日本語評価ステータス
現在の手法には、選定に使用した142件の凍結済み validation set があります。このデータは手法の選択に影響したため、開発上の根拠ではありますが、独立した現行精度の推定値ではありません。
独立・盲検の held-out 評価は、まだ公開ゲートを通過していません。そのため、現在の日本語 FPR、TPR、AUC、正解率は公開していません。
- 手法バージョン
- omnidetect-v5.0
- 選定時の根拠
- 142件 · validation のみ
- 数値の公開状態
- held-out 通過まで非公開
- held-out 対象場面
- 大学レポート · 感想文/読書感想文 · 志望理由書 · 一般作文
数値を公開するまでに必要なこと
1
独立して収集
エンジン、プロンプト、しきい値の選定に使った語料と重ならない、利用許可を確認した新規サンプルを集めます。
2
凍結して盲検
本文ハッシュ、場面メタデータ、費用上限を固定し、実行完了まで正解ラベルを評価側から隔離します。
3
実際の課題を測定
FPR、TPR、AUC、位置特定 recall/fallout、件数、95%信頼区間を記録します。
4
一つの記録から公開
現在の手法バージョンに結びついた再現可能な実行だけが、結果画面と本ページの数値を解禁します。
この評価でも証明できないこと
検出結果だけで、文書の執筆者を証明することはできません。
ある言語や文章場面の性能を、別の場面へそのまま流用できません。
部分検査や縮退時の結果は、現行手法による全文検査より根拠の範囲が狭くなります。
手法、提供元、しきい値を変えた場合は、新しいバージョンで再評価が必要です。
現在の手法には、選定に使用した142件の凍結済み validation set があります。このデータは手法の選択に影響したため、開発上の根拠ではありますが、独立した現行精度の推定値ではありません。
現在の手法バージョンに結びついた再現可能な実行だけが、結果画面と本ページの数値を解禁します。
