OpenGPT RESEARCH

AI 모델·에이전트 근거 인덱스

상위 출처나 제공사에서 정확한 모델, 에이전트 제품 또는 벤치마크 레코드로 이동하세요. 각 페이지는 근거의 범위와 한계를 설명합니다.

공개 순위 출처
3
모델 제공사
11
모델 계열
13
에이전트 범주 · 에이전트 벤치마크
7 · 9

근거 범위

기존 공개 근거와 제공사가 문서화한 ID의 인덱스입니다. 포함은 추천이나 보편적 순위를 의미하지 않습니다.

OpenGPT의 근거 처리 방식

표시 순위와 같은 모델 목록, 공개 스냅샷, 공식 에이전트 ID 목록과 벤치마크 레코드에서 생성합니다.

비교 범위

  • 출처마다 측정 대상이 달라 하나의 보편 점수로 합칠 수 없습니다.
  • 결정 전에 날짜, 버전과 구성 ID를 확인해야 합니다.
  • OpenGPT는 공개 근거를 정리하며 모든 평가를 재실행했다고 주장하지 않습니다.

근거 허브 탐색

공개 순위 출처, 검증된 제공사, 모델 계열, 에이전트 범주와 벤치마크 범위를 하나의 연구 인덱스에서 탐색합니다.

  1. LMArena공개 순위 출처Text Style Control
  2. Artificial Analysis공개 순위 출처Intelligence Index v4.1.1
  3. LiveBench공개 순위 출처LiveBench-2026-06-25
  4. OpenAI모델 제공사7 공식 모델 ID
  5. Anthropic모델 제공사6 공식 모델 ID
  6. Google모델 제공사12 공식 모델 ID
  7. Meta모델 제공사5 공식 모델 ID
  8. DeepSeek모델 제공사2 공식 모델 ID
  9. Alibaba Qwen모델 제공사12 공식 모델 ID
  10. Mistral AI모델 제공사6 공식 모델 ID
  11. xAI모델 제공사5 공식 모델 ID
  12. Cohere모델 제공사8 공식 모델 ID
  13. Microsoft모델 제공사5 공식 모델 ID
  14. Moonshot AI모델 제공사11 공식 모델 ID
  15. GPT모델 계열7 공식 모델 ID
  16. CLAUDE모델 계열6 공식 모델 ID
  17. GEMINI모델 계열7 공식 모델 ID
  18. LLAMA모델 계열3 공식 모델 ID
  19. MUSE모델 계열2 공식 모델 ID
  20. DEEPSEEK모델 계열2 공식 모델 ID
  21. QWEN모델 계열12 공식 모델 ID
  22. MISTRAL모델 계열6 공식 모델 ID
  23. GROK모델 계열5 공식 모델 ID
  24. Command모델 계열8 공식 모델 ID
  25. GEMMA모델 계열5 공식 모델 ID
  26. PHI모델 계열5 공식 모델 ID
  27. KIMI모델 계열11 공식 모델 ID
  28. 코딩에이전트 범주21 검증 제품
  29. 터미널·DevOps에이전트 범주7 검증 제품
  30. 브라우저에이전트 범주7 검증 제품
  31. 컴퓨터 사용에이전트 범주6 검증 제품
  32. 도구·API에이전트 범주7 검증 제품
  33. 리서치에이전트 범주9 검증 제품
  34. 업무 워크플로에이전트 범주9 검증 제품
  35. SWE-bench Verified에이전트 벤치마크Verified · Top 10 published configurations · 500 tasks
  36. Terminal-Bench 2.1에이전트 벤치마크terminal-bench/terminal-bench-2-1 · publisher-verified leaderboard
  37. AssistantBench에이전트 벤치마크HAL verified snapshot · 33 public tasks · 1 scaffold
  38. WebArena에이전트 벤치마크v0.2.0 · canonical self-hosted environment
  39. OSWorld 2.0에이전트 벤치마크task version v2026.06.24 · 500-step budget
  40. Berkeley Function-Calling Leaderboard에이전트 벤치마크BFCL V4 · commit f7cf735 · bfcl-eval 2025.12.17
  41. GAIA에이전트 벤치마크HAL verified snapshot · Top 15 published configurations · public validation set · 165 questions
  42. τ²-bench Core에이전트 벤치마크v1.0.1 · standard agent · GPT-5.2 low user simulator · 4 trials
  43. τ³-Banking Knowledge에이전트 벤치마크v1.0.1 · AllTools · GPT-5.2 low user simulator · seed 300 · 4 trials