07 · 用途別ランキング

画像とマルチモーダル

画像、文書、抽出、視覚と言語を組み合わせた推論。

公式版
3
公開データ
0
データ基準日:
候補にした理由
管理型とオープンなマルチモーダル版を含め、実際の画像、解像度、出力形式で確認します。
確認が必要な点
現在の知能指標は画像専用ではなく、比較可能な公開データがない候補もあります。
公開データ
総合能力
データ基準日
開始候補

最初に試す3つの公式版

公開データは候補を絞る手掛かりです。実際の仕事での比較に代わるものではありません。

3 / 3
開始候補 1

Gemini 3.5 Flash

安定版
gemini-3.5-flash

Googleこの正確な版に対応する比較可能な公開結果は現在ありません。

公式サイト
開始候補 2

Command A Vision

安定版
command-a-vision-07-2025

Cohereこの正確な版に対応する比較可能な公開結果は現在ありません。

公式サイト
開始候補 3

Phi-4 Multimodal Instruct

安定版
microsoft/Phi-4-multimodal-instruct

Microsoftこの正確な版に対応する比較可能な公開結果は現在ありません。

公式サイト
公開データ公開データは異なる尺度を使っています。欠測値を0として扱わず、異なる出典を1つの点数に合成しません。

Gemini 3.5 Flash

この正確な版に対応する比較可能な公開結果は現在ありません。

Command A Vision

この正確な版に対応する比較可能な公開結果は現在ありません。

Phi-4 Multimodal Instruct

この正確な版に対応する比較可能な公開結果は現在ありません。

万能な勝者ではなく、実務検証の出発点2〜3件を選び、公開データを横並びで確認します。

公開データは異なる尺度を使っています。欠測値を0として扱わず、異なる出典を1つの点数に合成しません。

現在の知能指標は画像専用ではなく、比較可能な公開データがない候補もあります。

この用途のテンプレートと選択した最初の2候補を設定して開きます。回答収集前に課題を編集できます。