공개 순위 출처
LiveBench AI 모델 순위 데이터
OpenGPT는 LiveBench 공개 레코드 22개를 원래 출처 범위로 보존합니다. 재평가하거나 다른 벤치마크와 합치지 않습니다.
- 공개 레코드
- 22
- 순위 보기
- 객관적 과제 · 점수당 비용 · 오픈 웨이트
- 출처 데이터 날짜
- 수집일
근거 범위
LiveBench-2026-06-25. Twenty-three objective tasks across seven categories; questions refresh every six months.
OpenGPT의 근거 처리 방식
게시자의 이름, 순위, 구성, 날짜와 값을 같은 범위로 보존합니다. 누락값을 0으로 바꾸거나 출처 간 종합 점수를 만들지 않습니다.
비교 범위
- 순위와 값은 명시된 출처 릴리스와 범위 안에서만 비교할 수 있습니다.
- 공식 모델 ID 연결은 매핑 근거를 검토한 경우에만 제공합니다.
- 공개 순위는 후보 신호이며 실제 업무에서 정확한 버전을 검증해야 합니다.
LiveBench-2026-06-25
공개 22개 중 대표 14개를 표시합니다. 각 행에서 출처 ID와 매핑 근거를 확인할 수 있습니다.
- Claude Fable 5Anthropic · 객관적 과제#183.0Max effort
- GPT-5.6 SolOpenAI · 객관적 과제#281.1Max effort
- GPT-5.5OpenAI · 객관적 과제#380.2xHigh effort
- Claude Opus 5Anthropic · 객관적 과제#480.1Max effort
- Kimi K3Moonshot AI · 객관적 과제#579.2Published benchmark configuration
- Qwen 3.8Alibaba · 객관적 과제#678.5Max effort
- DeepSeek V4 FlashDeepSeek · 점수당 비용#1$0.0161Published benchmark configuration
- Grok Build 0.1xAI · 점수당 비용#2$0.0240Published benchmark configuration
- DeepSeek V4 ProDeepSeek · 점수당 비용#3$0.0498Published benchmark configuration
- DeepSeek V4 Flash 0731DeepSeek · 점수당 비용#4$0.0596Published benchmark configuration
- MiniMax M3MiniMax · 점수당 비용#5$0.0597Published benchmark configuration
- Grok 4.3xAI · 점수당 비용#6$0.0614Published benchmark configuration
- Kimi K3Moonshot AI · 오픈 웨이트#179.2Open weights
- DeepSeek V4 Flash 0731DeepSeek · 오픈 웨이트#274.2Open weights