OpenGPT RESEARCH
AI 모델·에이전트 근거 인덱스
상위 출처나 제공사에서 정확한 모델, 에이전트 제품 또는 벤치마크 레코드로 이동하세요. 각 페이지는 근거의 범위와 한계를 설명합니다.
- 공개 순위 출처
- 3
- 모델 제공사
- 11
- 모델 계열
- 13
- 에이전트 범주 · 에이전트 벤치마크
- 7 · 9
근거 범위
기존 공개 근거와 제공사가 문서화한 ID의 인덱스입니다. 포함은 추천이나 보편적 순위를 의미하지 않습니다.
OpenGPT의 근거 처리 방식
표시 순위와 같은 모델 목록, 공개 스냅샷, 공식 에이전트 ID 목록과 벤치마크 레코드에서 생성합니다.
비교 범위
- 출처마다 측정 대상이 달라 하나의 보편 점수로 합칠 수 없습니다.
- 결정 전에 날짜, 버전과 구성 ID를 확인해야 합니다.
- OpenGPT는 공개 근거를 정리하며 모든 평가를 재실행했다고 주장하지 않습니다.
근거 허브 탐색
공개 순위 출처, 검증된 제공사, 모델 계열, 에이전트 범주와 벤치마크 범위를 하나의 연구 인덱스에서 탐색합니다.
- LMArena공개 순위 출처Text Style Control
- Artificial Analysis공개 순위 출처Intelligence Index v4.1.1
- LiveBench공개 순위 출처LiveBench-2026-06-25
- OpenAI모델 제공사7 공식 모델 ID
- Anthropic모델 제공사6 공식 모델 ID
- Google모델 제공사12 공식 모델 ID
- Meta모델 제공사5 공식 모델 ID
- DeepSeek모델 제공사2 공식 모델 ID
- Alibaba Qwen모델 제공사12 공식 모델 ID
- Mistral AI모델 제공사6 공식 모델 ID
- xAI모델 제공사5 공식 모델 ID
- Cohere모델 제공사8 공식 모델 ID
- Microsoft모델 제공사5 공식 모델 ID
- Moonshot AI모델 제공사11 공식 모델 ID
- GPT모델 계열7 공식 모델 ID
- CLAUDE모델 계열6 공식 모델 ID
- GEMINI모델 계열7 공식 모델 ID
- LLAMA모델 계열3 공식 모델 ID
- MUSE모델 계열2 공식 모델 ID
- DEEPSEEK모델 계열2 공식 모델 ID
- QWEN모델 계열12 공식 모델 ID
- MISTRAL모델 계열6 공식 모델 ID
- GROK모델 계열5 공식 모델 ID
- Command모델 계열8 공식 모델 ID
- GEMMA모델 계열5 공식 모델 ID
- PHI모델 계열5 공식 모델 ID
- KIMI모델 계열11 공식 모델 ID
- 코딩에이전트 범주21 검증 제품
- 터미널·DevOps에이전트 범주7 검증 제품
- 브라우저에이전트 범주7 검증 제품
- 컴퓨터 사용에이전트 범주6 검증 제품
- 도구·API에이전트 범주7 검증 제품
- 리서치에이전트 범주9 검증 제품
- 업무 워크플로에이전트 범주9 검증 제품
- SWE-bench Verified에이전트 벤치마크Verified · Top 10 published configurations · 500 tasks
- Terminal-Bench 2.1에이전트 벤치마크terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
- AssistantBench에이전트 벤치마크HAL verified snapshot · 33 public tasks · 1 scaffold
- WebArena에이전트 벤치마크v0.2.0 · canonical self-hosted environment
- OSWorld 2.0에이전트 벤치마크task version v2026.06.24 · 500-step budget
- Berkeley Function-Calling Leaderboard에이전트 벤치마크BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
- GAIA에이전트 벤치마크HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
- τ²-bench Core에이전트 벤치마크v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
- τ³-Banking Knowledge에이전트 벤치마크v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials