ガイドとサポート

OpenGPT ヘルプ

ガイドを選ぶか、手順や問題を検索してください。

最初に:3つの異なる役割

選定、比較、検証は異なる判断を支えます。どれも万能ランキングではありません。

1選ぶ要件からモデルファミリーを絞ります。2比較同一課題で正確なバージョンの実出力を比較します。3検証証拠ファイルの構造と内部整合性を確認します。

01

AIモデルを選ぶ

4つの実務要件から説明可能な候補を作ります。

機能を開く

この機能の目的

やりたい仕事は決まっているが、最初に調べるモデルファミリーが分からないときに使います。

始める前に

主な用途、実行場所、最優先事項、必要な言語を整理します。

手順

  1. 1実際の仕事に最も近い用途を選びます。
  2. 2データを外部へ出せない場合は実行環境を正確に指定します。
  3. 3最も妥協できない優先事項を選びます。
  4. 4言語要件を設定し、各候補の適合理由・注意点・次の検証を読みます。
  5. 5候補の正確なバージョンを同じ実務課題で比較します。

結果の読み方

定性的な適合ラベルと一致した要件数はモデル系列にのみ適用され、個別バージョンの評価やベンチマーク得点ではありません。掲載中の現行バージョンは配備可否を確認し、同じ課題で比較してください。

証明できないこと

モデルを実行せず、最新価格や万能な勝者も保証しません。同じファミリーでもバージョン差があります。

よくある質問: 有名なモデルが1位でないのはなぜ?

人気ではなく選択した制約に合わせて並べています。条件を一つ変えて原因を確認し、正確なバージョンをテストしてください。

上へ戻る
02

2つのモデルを非公開で比較

APIキーを渡さず、同一プロンプトの公平な比較を記録します。

機能を開く

この機能の目的

3つの組み込み実務課題セットの一つで、2つの正確なモデルバージョンを比較します。

始める前に

両サービスを開き、正確なバージョンと設定を確認し、機密情報を除いてください。サービス側には送信内容が届き、料金が発生する場合があります。

手順

  1. 1異なる2つの正確なモデルバージョンを選びます。
  2. 23つの組み込み課題から一つ選びます。
  3. 3各プロバイダーのリンクを開き、同じプロンプトを変更せず実行します。
  4. 4両方の完全な出力を貼り、正確性・指示遵守・完全性・安全性・明瞭さで判定します。
  5. 5全ケースを完了し、未完了項目を確認してレポートを保存します。

結果の読み方

勝敗と引き分けは、このセッションで完了したケースだけを要約します。判定理由のメモも重要な証拠です。

証明できないこと

モデルの呼び出し、回答元の確認、ラベル隠蔽、独自プロンプト追加には対応しません。小規模比較は万能ランキングではありません。

よくある質問: 両方に問題がある場合は?

明確な優劣がなければ引き分けを選び、問題をメモしてください。証拠が弱いのに勝者を作らないでください。

上へ戻る
03

証拠・比較レポートを検証

対応JSONの構造、内部整合性、秘密情報のパターン、ローカル指紋を確認します。

機能を開く

この機能の目的

OpenGPT Evidence v1/v2、または「非公開比較」から保存した比較レポートを検証します。すべての確認はこのブラウザ内で行われます。

始める前に

元のJSONファイルを用意します。比較レポートは「非公開比較」から保存し、完了結果が必要な場合は先に全ケースを終了してください。未完了なら下書きとして検証されます。

手順

  1. 1JSONファイルを選びます。内容はブラウザ内に留まります。
  2. 2Evidence v1/v2またはOpenGPT非公開比較v1/v2として認識されることを確認します。
  3. 3証拠パッケージでは必須項目、実行記録、日時、得点、安全性を確認します。比較レポートでは候補名、課題セット、下書き・完了状態、ケースの重複、集計と判定の整合を確認します。
  4. 4申告された要約を読み、後で同じファイルを照合する場合はSHA-256指紋を保存します。
  5. 5失敗した場合は、合格させるために保存済みレポートを書き換えず、元データを修正するか未完了ケースを終えます。

結果の読み方

Evidence v1/v2の「合格」は対応する構造・整合性規則への適合、「デモ」は例示を意味します。比較レポートの「合格」は完了レポートの内部整合、「下書き」は構造は有効でも比較が未完了であることを示します。「失敗」は要確認項目があります。

証明できないこと

合格しても、記載モデルが貼付回答を生成したこと、プロバイダー主張の真実性、記録した課題以外への一般化は証明しません。別ファイルの結果は自動比較できません。

よくある質問: 合格した比較レポートなら、一方のモデルが優れていると証明できますか?

いいえ。対応するレポートの構造と内部整合性を確認しただけです。モデル本人性、課題の質、出力、判断との関連性は別途評価してください。

上へ戻る
04

モデルを見る

正確なバージョンを試す前にモデルファミリーを理解します。

機能を開く

この機能の目的

モデルページで、公式な位置付け、代表的な強み、トレードオフ、適した用途を確認します。

始める前に

重視する仕事や制約を一つ用意します。ファミリー名だけで導入を決めないでください。

手順

  1. 1モデル、強み、制約、用途で検索します。
  2. 2表示済みのプロフィールで、強みと制約を同時に読みます。
  3. 3適した用途と公式情報を確認します。
  4. 4展開済みのバージョン一覧から正確な2つの版を選びます。
  5. 5「バージョンを比較」で両候補を同一課題の比較へ送ります。

結果の読み方

プロフィールは検証可能な仮説を作るための案内で、独立した性能測定ではありません。

証明できないこと

公式説明やファミリー情報は全バージョンに当てはまりません。価格、プライバシー、制限を直接確認してください。

よくある質問: このページだけで決められますか?

候補作成に使い、重要な判断の前に正確なバージョンを自分の課題で比較してください。

上へ戻る
05

評価方法を理解

モデル判断を検査・再現可能にする要素を学びます。

機能を開く

この機能の目的

評価を設計・公開・利用する前に、証拠品質と人気を分けて考えるために使います。

始める前に

具体的な判断、正確なモデル版、代表課題、元出力の保存計画を用意します。

手順

  1. 1結果を見る前に判断基準と成功条件を書きます。
  2. 2全候補で同じ課題、設定、採点規則を使います。
  3. 3プロンプト、出力、設定、失敗、日時、指紋を保存します。
  4. 4手動・自動・盲検・無作為化・独立再現の範囲を明記します。
  5. 5不確実性と限界を結論と一緒に公開します。

結果の読み方

証拠レベルは目標基準です。現在L1に対応し、L2は一部、L3–L4は現在のローカル手順外です。

証明できないこと

厳密な手順でも全利用者、言語、将来版、本番条件を代表する保証はありません。

よくある質問: 常に高い証拠レベルが必要?

影響度に合わせます。個人試用はL1でも、公開・高リスク主張はより強い独立証拠が必要です。

上へ戻る

用語集

分からない表示があるときに確認してください。

要件適合度
モデル系列の定性的な適合表示と、一致した要件数です。個別バージョンの評価ではありません。掲載中の現行バージョンは配備可否を確認し、同じ課題で比較します。
モデルファミリー
関連する複数バージョンの集まり。能力は版ごとに異なります。
ベンチマーク
明示した条件で比較する再現可能な課題と採点規則。
証拠ファイル
評価方法と観察結果を申告する構造化記録。
スキーマ
必須項目と許容値を定める機械可読規則。
SHA-256指紋
同一ファイルを照合するローカル識別子。変更すると値も変わります。

問題解決

全要件を満たす候補がない

除外理由を確認し、本当に変更可能な条件だけを緩和します。

要件を確認

正確なバージョンが見つからない

モデルページのバージョン一覧と公式情報を確認し、ファミリー名で代用しないでください。

バージョンを確認

比較レポートが未完了

印のあるケースへ戻り、両方の完全な出力と判定を入力します。

比較を続ける

ローカル下書きが競合した、またはリセットしたい

比較へ戻り、新しい下書きの警告を確認してから、保持またはリセットを選びます。

下書きを確認

証拠ファイルが失敗

失敗項目から元記録を修正します。秘密情報の挿入や結果の書換えは禁止です。

検証を開く
contact@opengpt.com

さらにサポートが必要ですか?

リンク切れ、誤ったモデル情報、解決できない問題をご連絡ください。

メールで問い合わせる