공개 순위 출처

LiveBench AI 모델 순위 데이터

OpenGPT는 LiveBench 공개 레코드 22개를 원래 출처 범위로 보존합니다. 재평가하거나 다른 벤치마크와 합치지 않습니다.

공개 레코드
22
순위 보기
객관적 과제 · 점수당 비용 · 오픈 웨이트
출처 데이터 날짜
수집일

근거 범위

LiveBench-2026-06-25. Twenty-three objective tasks across seven categories; questions refresh every six months.

OpenGPT의 근거 처리 방식

게시자의 이름, 순위, 구성, 날짜와 값을 같은 범위로 보존합니다. 누락값을 0으로 바꾸거나 출처 간 종합 점수를 만들지 않습니다.

비교 범위

  • 순위와 값은 명시된 출처 릴리스와 범위 안에서만 비교할 수 있습니다.
  • 공식 모델 ID 연결은 매핑 근거를 검토한 경우에만 제공합니다.
  • 공개 순위는 후보 신호이며 실제 업무에서 정확한 버전을 검증해야 합니다.

LiveBench-2026-06-25

공개 22개 중 대표 14개를 표시합니다. 각 행에서 출처 ID와 매핑 근거를 확인할 수 있습니다.

  1. Claude Fable 5Anthropic · 객관적 과제#183.0Max effort
  2. GPT-5.6 SolOpenAI · 객관적 과제#281.1Max effort
  3. GPT-5.5OpenAI · 객관적 과제#380.2xHigh effort
  4. Claude Opus 5Anthropic · 객관적 과제#480.1Max effort
  5. Kimi K3Moonshot AI · 객관적 과제#579.2Published benchmark configuration
  6. Qwen 3.8Alibaba · 객관적 과제#678.5Max effort
  7. DeepSeek V4 FlashDeepSeek · 점수당 비용#1$0.0161Published benchmark configuration
  8. Grok Build 0.1xAI · 점수당 비용#2$0.0240Published benchmark configuration
  9. DeepSeek V4 ProDeepSeek · 점수당 비용#3$0.0498Published benchmark configuration
  10. DeepSeek V4 Flash 0731DeepSeek · 점수당 비용#4$0.0596Published benchmark configuration
  11. MiniMax M3MiniMax · 점수당 비용#5$0.0597Published benchmark configuration
  12. Grok 4.3xAI · 점수당 비용#6$0.0614Published benchmark configuration
  13. Kimi K3Moonshot AI · 오픈 웨이트#179.2Open weights
  14. DeepSeek V4 Flash 0731DeepSeek · 오픈 웨이트#274.2Open weights