推薦が判断になるまでを公開します。
OpenGPTはAI Decision Intelligence Platformです。編集上の要件適合、事実情報源、実務評価、公開ベンチマークを分け、各結果の条件と限界を示します。
1分で分かる方法
- 順位は一つの情報源と範囲内の相対位置で、万能得点ではありません。
- 正確なモデル版と完全なAgent構成を比較単位にします。
- 不明または比較不能なデータを0や統合順位に変えません。
- ローカル確認は構造と内部整合性を示しますが、出力元や提供元の真正性は証明しません。
編集適合スコア · editorial-fit-v1
0〜10の編集適合スコアの付け方
8つのカタログ信号は項目別比較を支援します。rules-v2推薦点や公開ベンチマーク証拠とは別の、文書化されたOpenGPT編集判断層です。
編集上の製品適合スコア:10は名称付き項目へのより強い適合を示します。項目は等しく表示し、総合勝者へ合成しません。
総合能力
0–10公開機能、カタログ上の役割、既知の製品制約から、幅広く複雑な一般業務への適合を編集判断します。IQやベンチマーク得点ではありません。
コーディング
0–10設計、実装、デバッグ、レビュー、リポジトリ業務への編集上の適合で、実測合格率ではありません。
推論
0–10多段階分析、制約処理、構造化問題解決への編集上の適合で、再現済み推論ベンチマークではありません。
文章作成
0–10下書き、編集、長文、文書業務への編集上の適合で、文体や事実性の実測結果ではありません。
速度
0–10製品位置付けと提供方式から見た反復作業への編集上の適合で、実測遅延の主張ではありません。
コスト効率
0–10掲載プランと配備方式からアクセス料金と運用費管理への適合を編集判断します。総費用計算や価格保証ではありません。
プライバシー管理
0–10ローカル、ハイブリッド、クラウド分類から配備とデータ管理への適合を編集判断します。セキュリティ、法令順守、テレメトリ監査ではありません。
エコシステム
0–10利用可能なツール、連携、環境、配備選択肢への編集上の適合で、市場占有率や連携品質の測定ではありません。
重みと集計
各項目の表示上の重要度は同じです。算術重み、平均、合計点、総合勝者はなく、申告条件に重要な項目を利用者が決めます。
人による編集判断の境界
編集者はrubric、提供元確認済み製品事実、カタログ分類から0〜10の整数を付けます。正確な版の測定、ベンチマーク結果、確率、提供元保証ではありません。
情報源
公式ページは識別、利用経路、公開機能、配備選択肢、掲載料金を支えます。適用タグ、長所、短所、分類、0〜10の値はすべてOpenGPT編集入力です。
カタログ確認
カタログ最終確認日:
信頼度: 編集情報の充足度:中
信頼度はカタログ情報と説明の充足度で、良い性能の確率ではありません。提供元事実は変化し、適合信号は独立測定されていません。
適用範囲
現在の製品・配備仮定の下で、名称付き項目ごとにカタログ記録を比べるために使います。点差を性能の実測差として扱いません。
採用前に現在の提供元事実を確認し、正確なモデル版、プラン、ツール、地域、代表的実務を試してください。
公開方法 · rules-v2
OpenGPT推薦の作り方
BuilderはローカルProfileを決定論的な候補リストへ変換します。以下の点数は予算とプライバシーの必須条件後に編集上の製品適合を並べるもので、モデル品質の測定ではありません。
採点項目と加算規則点
点数は条件付き重みで、百分率ではありません。必須条件に合わない項目は採点前に除外します。
タスクと目標の適合
モデル · ツールモデルは選択タスクとの一致ごとに+12、目標との完全一致で+10。ツールは用途一致ごとに+10です。
利用者が申告した条件 · OpenGPT編集カタログプライバシーと配備
モデル · ツール高プライバシーでは非ローカルモデルと高プライバシー以外のツールを除外。対象ローカルモデルは+30、ツールは+12。中ではハイブリッド/ローカル/クラウドが+8/+5/+2です。
利用者が申告した条件 · OpenGPT編集カタログ予算条件
モデル · ツール選択した掲載価格帯を超える項目は除外。対象モデルは+12、ツールは+8。無料プロフィールで掲載上の無料入口があるモデルはさらに+16です。
利用者が申告した条件 · 提供元が公開する事実 · OpenGPT編集カタログ職種との適合
モデル · ツール学生向けモデル一致は+10、その他の対応モデル職種一致は+8。学生向けツールは+8、その他の対応ツール職種一致は+6です。
利用者が申告した条件 · OpenGPT編集カタログ業界シグナル
モデル · ツール認識した業界語をタスク分類に対応させ、モデルは一致ごとに+5、ツールは+4。自由記述そのものはワークフローへコピーしません。
利用者が申告した条件 · OpenGPT編集カタログ言語適合
モデル英語以外を希望する場合、多言語一致は+14、不一致は−3。英語では文章作成または文書用途の一致が+3です。
利用者が申告した条件 · OpenGPT編集カタログプラットフォーム適合
モデル · ツールモデル一致はWeb +3、デスクトップ +10、ターミナル +8、API +7、モバイル +9。ツールは一致ごとに+7、一致なしは−3です。
利用者が申告した条件 · OpenGPT編集カタログ経験レベル適合
モデル · ツール初心者向けモデル一致は+10(ローカル不一致は−4)、上級一致は+7、中級の主力/ハイブリッド一致は+2。初心者/上級ツール一致は+6/+5です。
利用者が申告した条件 · OpenGPT編集カタログ選択と同点
モデル · ツール対象候補を規則点で並べ、同点は名称順。役割は固定順で満たし、残る一致モデルの上位3件までを代替候補にします。
決定論的rules-v2情報源と主張の境界
提供元が公開する事実
公式ページは識別、利用経路、公開機能説明、掲載料金の根拠です。独立した性能試験としては扱いません。
OpenGPT編集カタログ
適用タグ、長所、プライバシー/配備分類、製品適合シグナルは編集判断であり、ベンチマーク測定や提供元保証ではありません。
利用者が申告した条件
目標、タスク、職種、予算、プライバシー、言語、環境、経験、業界はローカルプロフィール由来で、適用条件であり外部証拠ではありません。
決定論的rules-v2
同じ正規化プロフィールとカタログ版は同じ順序を返します。計算は説明可能ですが、決定論でも編集入力が事実になるわけではありません。
公開ベンチマークの文脈
公開順位は別の証拠です。rules-v2は順位や得点を推薦点へ加えません。候補選定後に情報源の範囲を保って確認します。
事実と編集判断
事実主張は名称付きの提供元またはベンチマーク情報源、可能な場合は正確な識別、確認日へ追跡できなければなりません。
適合タグ、長所、分類、仮定、信頼度、推薦はOpenGPTの編集判断で、正確な版の実測結果として表示しません。
確認周期と信頼度
方法と使用中の推薦記録は少なくとも90日ごと、および変更時に確認予定です。各結果はこのページの日付でなく記録自身の確認日を使います。
再確認の契機
- 提供元がモデルID、ライフサイクル、利用経路、機能説明、掲載料金を変更したとき。
- 推薦エンジン、重み、必須条件、編集分類を変更したとき。
- 訂正で重要な情報源、識別、料金、プライバシー、適用条件の誤りが判明したとき。
信頼度規則
信頼度は適合説明と裏付け記録の充足度を示し、良い性能を出す確率ではありません。
- 高
- 正確な識別と現在の事実情報源があり、重要項目が確認済みで、仮定を表示し、適格な代替候補を示します。
- 中
- 適合理由は説明できますが、採用前に情報源、条件、または現在の事実を一つ以上確認する必要があります。
- 低
- 識別、鮮度、料金、プライバシー、適用条件に重要な不足があり、調査候補としてのみ扱います。
適用範囲と条件
- 現在の審査済みモデル/ツールカタログからrules-v2が作る編集候補に適用します。
- 結果は入力プロフィールとカタログ版に依存し、どちらかを変えると結果も変わり得ます。
- 低リスクの判断補助であり、品質、現在料金、ベンチマーク首位、安全性、合法性、規制用途適合を証明しません。
結果ごとの必須監査表示
統合後の推薦では、利用者が根拠境界を推測しなくてもよいよう、次の7項目をすべて表示します。
- 理由
- 根拠
- 仮定
- 最終確認日
- 信頼度
- 最良の代替候補
- 選ばない条件
実際の課題から検証可能な結論へ
条件を決める
比較前に課題、成功基準、入力、制約、正確なモデル版、設定、日付を記録します。
同じ条件で試す
各候補に同じ課題と採点基準を使います。モデル名を伏せることで名称の偏りは減らせますが、二重盲検や独立実行ではありません。
元データを残す
プロンプト、回答、点数、エラー、遅延、ハッシュを保存し、不足を推測で補いません。
限界を示す
不確実性、標本数、除外、利害関係、結果から言えないことを明記します。
証拠レベル
Evidence v1/v2はファイル形式と申告内容の整合性を確認します。意思決定ワークスペースV3は保存済み入力からハッシュ、割当、対応、得点、集計も再計算します。L4の独立再現は証明しません。
形式確認
宣言したSchemaに従い、明白な秘密情報項目がありません。
記録確認
課題セット、設定、モデル情報、評価日を一貫して記録します。V1が確認できるのはその一部です。
再計算可能
意思決定ワークスペースV3は貼付出力と採点入力を保持し、厳密な端末内再計算に対応します。Evidence v1/v2には同等の項目がありません。
独立再現
目標は別の実行者または署名済み情報源による同等条件での再現です。V1はまだ検証しません。
AIエージェントランキングの比較方法
各行は、明記されたベンチマーク範囲内で公開された一つのAgent構成を表します。基盤モデル単体の得点ではありません。
システム構成を比較
情報源が公開するAgent、基盤モデル、実行基盤、ツール、環境、予算、日付を一体として保持し、未公開項目は不明と表示します。
元の尺度を保持
同じベンチマーク、版、タスク規則、比較可能な実行群の中だけで順位を付け、横断的な万能得点は作りません。
根拠の状態を明示
ベンチマーク公開元の掲載記録、上流確認済み提出、提供元報告、コミュニティ実行を区別します。
運用根拠を保持
比較可能な費用、遅延、手順数、人手介入を情報源が示す場合は表示し、不明値は不明のまま残します。
ローカル検証で確認できること
- ✓必須項目と対応データ型
- ✓点数、実行、日付、ハッシュの内部整合性
- ✓デモデータの宣言有無
- ✓一般的なAPIキー・秘密情報項目がないこと
単独では確認できないこと
- —宣言された提供元やモデルが実際に出力したか
- —選択偏りや弱い試験設計がないか
- —全用途・言語・利用者・将来版に通用するか
- —高リスク判断に安全・適法・適切か
公開原則
順位を販売しない
協賛は開示できますが、採点、証拠条件、掲載順を変更できません。
ブランドではなく版
モデル系列は固定の試験対象ではありません。正確なID、設定、地域、日付が必要です。
広い主張より実務課題
要件から候補を絞り、利用者自身の代表的な仕事で確認します。
不確実性も結果
同点、小標本、失敗実行、結論不能の証拠を隠しません。