モデル選定の信頼性は、証拠の質で決まります。
OpenGPTは要件との適合、実務比較、公開証拠を分けて扱います。何を、どの条件で試し、何が未検証かをすべての結論に示します。
実際の課題から検証可能な結論へ
問いを固定
比較前に課題、成功基準、入力、制約、モデル版、日付、設定を記録します。
同条件で実行
各候補に同じ課題と採点基準を使用します。盲検比較が必要な場合は外部の無作為化実行環境を使います。現在の非公開比較は名称を隠しません。
生の証拠を保持
プロンプト、出力、点数、エラー、遅延、ハッシュを保存し、不足を推測で埋めません。
限界を公開
不確実性、標本数、除外、利害関係、証明できない範囲を明示します。
証拠レベルの目標基準
現在のローカル検証はL1に完全対応し、L2の申告項目を一部確認します。L3とL4はまだ検証しません。各レベルはプロトコル上の目標であり、読み込んだファイルへの自動認定ではありません。
形式確認
宣言したSchemaに従い、明白な秘密情報項目がありません。
手順一致
目標は課題セット、設定、モデル宣言、評価日の一貫した記録です。V1は申告の一部のみ確認します。
再計算可能
目標は第三者が再計算できる生出力と採点入力の保持です。V1にはまだ該当項目がありません。
独立再現
目標は別の実行者または署名済み情報源による同等条件での再現です。V1はまだ検証しません。
ローカル検証で確認できること
- ✓必須項目と対応データ型
- ✓点数、実行、日付、ハッシュの内部整合性
- ✓デモデータの宣言有無
- ✓一般的なAPIキー・秘密情報項目がないこと
単独では確認できないこと
- —宣言された提供元やモデルが実際に出力したか
- —選択偏りや弱い試験設計がないか
- —全用途・言語・利用者・将来版に通用するか
- —高リスク判断に安全・適法・適切か
公開原則
順位を販売しない
協賛は開示できますが、採点、証拠条件、掲載順を変更できません。
ブランドではなく版
モデル系列は固定の試験対象ではありません。正確なID、設定、地域、日付が必要です。
広い主張より実務課題
要件から候補を絞り、利用者自身の代表的な仕事で確認します。
不確実性も結果
同点、小標本、失敗実行、結論不能の証拠を隠しません。