- 순위 1Claude Fable 5.1 Max EffortAnthropic83.41
- 순위 2Claude Fable 5 Max EffortAnthropic82.97
- 순위 3GPT-6 Astra Max EffortOpenAI82.16
공개 평가 데이터OpenGPT 외부 공개 출처 2곳LiveBench · 이번 판 데이터 기준일
OpenGPT는 공개된 제3자 평가 데이터를 정리해 보여 주며, 모델 테스트를 다시 실행하지 않았습니다. 순위는 모델 간 상대적인 성능을 이해하기 위한 참고 자료입니다. 실제 선택 전에는 구체적인 작업으로 직접 확인하세요.
순위 지표 선택
결정하려는 일부터 선택하세요. 각 상황에 가장 관련 있는 공개 순위 지표를 보여 줍니다. 원본 출처와 평가 척도도 함께 확인할 수 있습니다.
별칭과 실행 설정을 포함한 게시자의 모든 기록을 원본 모델 ID 또는 원본 이름과 함께 표시합니다. 출처 순위를 그대로 유지하므로 공동 순위 뒤에는 번호가 건너뛸 수 있습니다.
객관 과제 점수. 7개 범주의 객관 채점 작업 23개에 대한 LiveBench 전체 점수입니다.
10개 중 10개 표시. 객관 과제 점수.
- 순위 1
Claude Fable 5.1 Max Effort
Anthropic객관 과제 점수83.41 - 순위 2
Claude Fable 5 Max Effort
Anthropic객관 과제 점수82.97 - 순위 3
GPT-6 Astra Max Effort
OpenAI객관 과제 점수82.16 - 순위 4객관 과제 점수81.59
- 순위 5
GPT-5.6 Sol Max Effort
OpenAI객관 과제 점수81.05 - 순위 6객관 과제 점수80.19
- 순위 7
Claude 5 Opus Thinking Max Effort
Anthropic객관 과제 점수80.08 - 순위 8
Kimi K3
Moonshot AI객관 과제 점수79.19 - 순위 9
Gemini 3.7 Flash High
Google객관 과제 점수78.83 - 순위 10
Qwen 3.8 Max
Alibaba객관 과제 점수78.46
순위 산정 방법각 보기는 출처의 지표, 릴리스, 방법론을 유지합니다. 링크에서 근거를 확인하세요.
순위 근거
전체 공개 순위와 공식 모델 ID
기본 순위는 게시자의 모든 기록과 원본 모델 ID 또는 이름을 보존합니다. 모든 행을 비교할 수 있으며 설정을 보존할 수 있는 정확한 매핑은 공식 버전으로, 나머지는 같은 출처의 기록으로 비교합니다. 누락 데이터는 0점으로 처리하지 않습니다.- 공식 모델 ID 79개
- 79
- 공개 순위 데이터 있음 0개
- 0
- 비교 가능한 데이터 대기 79개
- 79
- LiveBench · 감사용 출처 기록 56개
- 56
순위 근거
이 연구판을 읽는 방법
점수는 각 게시자의 원래 척도를 유지하며 하나의 종합 점수로 합치지 않습니다.
누락 데이터는 0이 아닙니다. 이 스냅샷에서 게시자가 해당 지표를 보고하지 않았다는 뜻입니다.
출처에 모델 설정이 명시된 경우 순위는 해당 설정과 출처 릴리스에 적용되며 모든 작업·지역·배포에 일반화되지 않습니다.
공급자는 순위를 구매할 수 없습니다. 사용된 근거로 직접 연결합니다.
순위 근거
데이터와 출처
각 보기는 출처의 지표, 릴리스, 방법론을 유지합니다. 링크에서 근거를 확인하세요.방법 버전
예측 가능한 게시 주기
활성 모델 출처를 6시간마다 확인합니다. LMArena와 LiveBench는 버전이 지정된 검증 정책을 통과한 경우에만 자동 게시합니다. 일시 중지된 출처는 과거 자료로 보존하며 현재 순위에 사용하지 않습니다.- 01
6시간마다 출처 확인
LMArena와 LiveBench는 스키마, 완전성, 날짜, 무결성 및 이상값 검사를 통과한 업데이트만 자동 게시합니다. 일시 중지된 출처는 과거 자료로 남습니다.
- 02
주간 변경 요약
중요한 순위, 모델, 출처 변경을 검토 가능한 하나의 업데이트로 정리합니다.
- 03
월간 기록 스냅샷
정확한 설정, 출처 릴리스, 정정 내역을 포함한 날짜별 스냅샷을 고정합니다.