精选模型对比
Gemini 3.5 Flash 与 Grok 4.5
先比较两个当前候选,再用真实任务验证速度、成本和质量。 使用准确的官方模型 ID,对比公开数据、服务商入口和单独标注的模型系列说明。
更新日期:公开数据对比
每项数据保留原始来源和量尺。缺失数据不按 0 处理,OpenGPT 也不会生成一个综合赢家。
| 排名角度 | Gemini 3.5 Flash | Grok 4.5 |
|---|---|---|
| 用户偏好 | 排名 17公开数值: 1476来源: LMArena ↗ | 排名 33公开数值: 1468来源: LMArena ↗ |
| 综合能力指数 | 暂无匹配的可比数据 | 排名 7公开数值: 54来源: Artificial Analysis ↗ |
| 客观任务 | 暂无匹配的可比数据 | 排名 9公开数值: 76.3来源: LiveBench ↗ |
| 单次成功任务成本 | 排名 9公开数值: $0.249来源: LiveBench ↗ | 排名 1公开数值: $0.128来源: LiveBench ↗ |
| 开放权重模型 | 暂无匹配的可比数据 | 暂无匹配的可比数据 |
本页面整理已发布的第三方数据,OpenGPT 没有重新运行这些评测。
需要验证什么
以下优势和限制来自模型系列的官方定位,不是这个具体版本的实测结果。
继续完成选择
在交互式对比中加入更多模型,再用自己的提示词和条件验证最后两个候选。