모든 요구를 만족하는 모델이 없음
각 후보가 제외된 이유를 보고 실제로 유연한 조건만 완화하세요.
요구사항 검토목표에 맞는 작업을 찾고 단계와 결과의 한계를 확인하세요.
각 작업은 서로 다른 질문에 답합니다. 가장 가까운 목표에서 가이드를 시작하세요.
순위 대상, 데이터 출처와 공식 모델 ID 유무를 살펴봅니다.
공개 지표와 원본 기록을 확인하고 실제 작업으로 시험할 후보를 만듭니다.
먼저 필요한 판단을 정하세요. 사용자 선호도, 종합 능력, 객관 작업, 비용과 오픈 가중치 순위는 출처와 척도가 다릅니다.
순위는 하나의 출처와 범위 안에서의 상대 위치입니다. 동점으로 번호가 건너뛸 수 있고 다른 관점의 점수는 직접 비교할 수 없습니다.
OpenGPT는 제3자 공개 데이터를 정리하며 평가를 다시 실행하지 않았습니다. 모든 사용자와 작업에 맞는 최고 모델을 정하지 않습니다.
모든 행에 모델 상세와 비교 기능이 있습니다. 공급자 문서로 정확한 매핑을 확인한 경우에만 공식 모델 ID를 추가하고, 나머지는 새 공식 ID를 만들지 않고 원본 기록으로 공개 이름, 설정과 순위 데이터를 보존합니다.
작업, 전체 구성, 근거 품질과 비교 가능한 결과로 Agent를 선택합니다.
서로 다른 근거를 하나의 점수로 합치지 않고 7가지 작업 범위의 Agent 평가 구성 74개와 별도 BFCL 도구 호출 모델 결과 109개를 살펴봅니다.
Agent 결과는 기반 모델, 실행 구조, 도구, 권한, 예산, 환경, 벤치마크 버전과 날짜를 포함한 하나의 전체 구성에 속합니다. 출처가 공개하지 않은 값은 0이 아니라 미보고로 남깁니다.
순위는 한 벤치마크 범위 안에서 전체 시스템 구성의 위치입니다. 근거 등급, 최신 상태, 실행 수와 공개된 비용·신뢰성 지표를 함께 읽으세요.
OpenGPT는 보편적인 Agent 총점을 만들지 않습니다. 재현됨으로 명시되지 않은 결과는 상위 출처의 근거를 정리한 것이며 어떤 벤치마크도 모든 업무의 운영 준비도를 증명하지 않습니다.
실행 구조, 모델 버전, 도구, 권한, 예산 또는 벤치마크 설정이 다르면 별도의 Agent 구성으로 기록해야 합니다.
순위를 바꾸지 않고 공개 신원이나 근거 기록을 검토에 보냅니다.
공식 모델 ID나 Agent 제품이 없거나 공개 출처에 편집 검토가 필요할 때 사용합니다.
확인된 계정으로 로그인하고 공개 HTTPS 출처를 준비하세요. 자격 증명, 비공개 파일 또는 개인정보를 제출하지 마세요.
제출이 완료되면 참조 번호와 함께 검토 대기열에 들어갑니다. 공개 후보 기록은 공개 근거이며 순위표 순위나 카탈로그 항목이 아닙니다.
제출자는 순위, 근거 등급, 비교 가능성 또는 게시 상태를 정할 수 없습니다. 중복·횟수 제한으로 남용을 줄이며 승인되어도 순위는 자동 변경되지 않습니다.
승인은 편집 검토를 통과했다는 뜻입니다. 카탈로그 신원과 비교 가능한 순위 근거는 별도로 검증해야 합니다.
비교 가능한 스냅샷 사이의 변화와 공식 문서의 모델 ID를 살펴봅니다.
이전 월간 출처 스냅샷 이후의 변화, 첫 등장, 정확한 버전 차이와 데이터 수집일을 확인할 때 사용합니다.
과거 변화는 LMArena 사용자 선호 범위를 사용합니다. 다른 순위는 비교 가능한 이전 스냅샷이 생길 때까지 현재 데이터만 표시합니다.
출처, 범위, 단위와 방법이 같을 때만 변화를 계산하고 월간 스냅샷을 보존합니다.
새 출시에는 공급자 문서의 출시일이 필요합니다. 이름에서 속도, 가격, 컨텍스트 길이나 품질을 추정하지 않습니다.
비교 가능한 이전 판을 아직 동결하지 않았기 때문입니다. 누락된 기록에서 가상 변화를 만들지 않습니다.
실제 업무에서 시작해 먼저 시험할 공식 모델 버전 3개를 확인합니다.
코딩, 조사, 문서, 고객 지원, 다국어, 멀티모달, 비용, 비공개 배포와 속도 업무에 대해 넓은 공개 신호를 실용적인 후보 목록으로 좁힙니다.
실제 업무와 가장 가까운 시나리오를 고르고 프롬프트, 데이터, 도구, 지역, 예산과 개인정보 요구를 정리하세요. 표시된 공개 근거의 범위가 해당 업무보다 넓을 수 있습니다.
공식 시작 후보 3개, 가능한 공개 근거와 데이터 비교 및 실제 업무 평가 경로를 얻습니다.
업무별 순위는 시작 후보 목록이며 보편적인 순위나 최고 모델의 증명이 아닙니다. 누락 근거는 0이 아니며 서로 다른 공개 출처를 한 점수로 합치지 않습니다.
공식 버전의 제품 위치나 배포 방식이 업무에 적합해도 선택한 공개 출처에 정확한 버전 결과가 없을 수 있습니다. 누락 상태를 그대로 표시하므로 직접 업무로 확인해야 합니다.
현재 사용하는 모델, 반복 업무와 우선순위를 설정하고 공정한 비교가 필요한 변화만 신중하게 확인합니다.
비교 가능한 공개 데이터가 현재 모델의 대안을 시험할 만큼 충분한지 판단합니다.
정확한 공식 버전, 하나 이상의 반복 업무와 최대 두 가지 우선순위를 선택하세요. 설정은 이 기기에만 저장됩니다.
현재 모델, 업무에 맞는 대안, 데이터 날짜, 불확실성 범위와 비교 경로를 포함한 업그레이드 점검 결과가 이 기기에만 생성됩니다.
업그레이드 점검은 모델을 바꾸라는 지시가 아닙니다. 비교 가능한 데이터가 없는 조건은 직접 시험해야 하며 로컬 설정은 동기화되거나 백업되지 않습니다.
아닙니다. 같은 업무로 시험해 볼 가치가 있다는 뜻입니다. 대안 모델이 실제 업무와 제약 조건에서 더 나은 경우에만 교체를 검토하세요.
네 가지 실무 요구사항으로 설명 가능한 후보를 만듭니다.
해야 할 작업은 알지만 어떤 모델 계열부터 살펴볼지 모를 때 사용합니다.
주요 작업, 실행 위치, 가장 중요한 운영 기준과 언어 요구를 정리하세요.
정성적 적합도 표시와 충족한 요구 수는 모델 계열에만 적용되며 개별 버전 평가나 벤치마크 점수가 아닙니다. 표시된 현재 버전은 배포 가능 여부를 확인하고 동일한 작업으로 비교하세요.
모델을 호출하거나 최신 가격과 보편적 승자를 확인하지 않습니다. 같은 계열도 버전에 따라 다릅니다.
인기가 아니라 선택한 제약에 맞춰 순서를 정합니다. 조건을 바꿔 원인을 확인하고 특정 모델 버전을 테스트하세요.
공급자 문서에 있는 모델 ID를 찾고 전용 상세 페이지와 비교 가능한 공개 순위 데이터를 확인합니다.
정확한 공식 모델 ID, 공급자 목적지, 적합하거나 부적합한 작업, 출처와 순위 데이터 상태가 필요할 때 사용합니다.
모델명, 공급자, 배포 요구 또는 작업을 준비하세요. 공급자 문서에 모델 ID가 있어도 비교 가능한 공개 평가 데이터가 있다는 뜻은 아닙니다.
순위 포함은 비교 가능한 공개 데이터가 해당 모델 ID에 연결된 상태입니다. 순위 없음은 이번 판에 적절한 비교 기록이 없다는 뜻이며 0점이 아닙니다.
공급자 문서는 목록의 식별 정보를 뒷받침하지만 모든 국가와 서비스 등급의 현재 제공을 보장하지 않습니다. 표시 이후 순위 범위와 이용 조건이 바뀔 수 있습니다.
아니요. 이번 판에 그 모델 ID에 맞는 비교 가능한 공개 데이터가 없다는 뜻입니다. 결정에 중요하다면 직접 시험하세요.
정확한 공식 버전 2–4개 또는 하나의 게시된 순위 보기에서 원본 기록을 비교합니다.
공식 버전 비교는 공급자 문서의 ID를 공개 출처별로 정리합니다. 정확한 공식 비교에서 정보가 사라질 경우 원본 기록 비교가 게시 이름과 설정을 보존합니다.
공식 버전은 카탈로그 ID 2–4개를 고르세요. 원본 기록은 같은 출처, 지표, 스냅샷에서 2–4개를 고르세요.
정보가 없는 부분까지 드러나는 근거 중심 후보 목록을 만듭니다. 새 벤치마크 점수나 보편적인 우승자를 만들지 않습니다.
이 화면에서는 모델을 호출하지 않습니다. 출처나 범위가 다른 점수는 서로 바꿔 비교할 수 없고, 검토일 이후 모델 정보가 달라질 수 있습니다.
데이터 비교는 모델 2–4개의 공개 정보를 정리합니다. 실제 작업 평가는 정확히 두 버전에서 같은 프롬프트를 실행하고 붙여넣은 답변을 모델명 없이 검토합니다.
순위 후보를 이 브라우저의 간단한 작업 목록에 저장합니다.
후보를 빠르게 다시 찾고 신뢰할 수 있는 공급자 페이지를 열며 지원되는 모델 ID를 비교로 옮길 때 사용합니다.
같은 브라우저와 기기를 사용하세요. OpenGPT 계정이나 클라우드 동기화 없이 목록이 로컬에 저장됩니다.
저장한 모델 옆 숫자는 저장된 항목 수입니다. 원본 식별 정보와 공식 모델 식별 정보는 별도로 유지됩니다.
계정, 북마크 동기화 또는 백업이 아닙니다. 다른 브라우저나 기기에는 보이지 않으며 비공개 모드, 저장 제한, 사이트 데이터 삭제로 사라질 수 있습니다.
같은 브라우저 프로필과 기기를 사용하는지 확인하세요. 사이트 저장소가 삭제되거나 차단되면 로컬 목록을 복구할 수 없습니다.
실제 작업을 사용하고 의사결정 프로젝트를 이 기기에 저장합니다.
템플릿 또는 편집 가능한 사용자 작업으로 특정 모델 버전 두 개를 비교합니다.
두 공급자 서비스를 열고 버전과 설정을 확인하며 민감한 정보를 제거하세요. 그곳에 제출한 내용은 각 공급자 정책을 따릅니다.
종합 선호가 작업별 결과를 결정합니다. 차이가 작거나 완료 작업이 3개 미만이면 결론 부족입니다.
이름 숨김은 보이는 라벨 편향만 줄입니다. 이중맹검이나 독립 실행이 아니며 답변 출처나 보편 순위를 증명하지 않습니다.
차이를 메모로 설명할 수 있을 때만 선호를 유지하고, 그렇지 않으면 점수를 다시 확인하세요.
작업 모음을 다시 만들지 않고 같은 실제 프롬프트를 다음 모델 평가에 재사용합니다.
이후 비교 조건을 일관되게 유지하고 모델 출시나 공개 데이터 변경 뒤 정확한 버전을 다시 평가할 때 사용합니다.
작업 제목과 프롬프트를 완성하고 알아보기 쉬운 이름을 지정한 뒤 같은 브라우저와 기기를 사용하세요. 민감한 업무 내용은 저장 전에 제거해야 합니다.
작업 모음 이름, 템플릿, 언어, 작업 제목과 프롬프트가 기기에 저장됩니다. 재평가는 의도한 입력을 유지하면서 깨끗한 새 실행을 만듭니다.
저장한 작업 모음은 이 기기에만 있고 동기화나 백업이 없습니다. 답변, 모델 선택, 검토, 보고서와 API 키는 작업 모음에 저장하지 않으며 사이트 데이터를 지우면 사라질 수 있습니다.
같은 작업과 정확한 모델 버전은 유지하고 이전 답변, 점수, 판단, 공개 상태와 보고서를 지워 과거 결과와 독립된 새 실행을 시작합니다.
지원되는 JSON의 구조, 내부 일관성, 비밀정보 패턴과 로컬 지문을 확인합니다.
OpenGPT Evidence v1/v2 또는 의사결정 워크스페이스에서 내려받은 V3 보고서를 검사합니다. 모든 검사는 이 브라우저 안에서 실행됩니다.
원본 JSON 파일을 준비하세요. 비교 보고서는 의사결정 워크스페이스에서 내려받고, 초안이 아닌 완료 결과가 필요하다면 먼저 모든 사례를 끝내세요.
Evidence v1/v2에서 통과는 지원 구조와 일관성 규칙을 만족한다는 뜻이고 데모는 예제임을 나타냅니다. 비교 보고서에서 통과는 완료 보고서가 내부적으로 일치함을, 초안은 구조는 유효하지만 비교가 끝나지 않았음을 뜻합니다. 실패는 검토할 필수 항목이 있다는 뜻입니다.
통과해도 이름 붙은 모델이 붙여넣은 답변을 만들었다는 것, 공급자 주장의 진실성 또는 기록한 작업 밖으로 결과가 일반화된다는 것을 증명하지 않습니다. 서로 다른 파일의 결과는 자동 비교할 수 없습니다.
아니요. 지원되는 보고서의 구조와 내부 일관성만 확인합니다. 모델 신원, 테스트 품질, 출력과 의사결정 관련성은 별도로 판단해야 합니다.
모델 결정을 검토하고 재현 가능하게 만드는 요소를 배웁니다.
평가를 설계, 공개 또는 신뢰하기 전에 근거 품질과 인기를 구분할 때 사용합니다.
구체적 결정 질문, 특정 모델 버전, 대표 작업과 원본 출력 보존 계획을 준비하세요.
Evidence v1/v2는 주로 형식과 선언을 확인합니다. 의사결정 워크스페이스 V3는 로컬 재계산(L3)을 지원하며 L4 독립 재현은 지원하지 않습니다.
엄격한 과정도 모든 사용자, 언어, 미래 버전과 운영 환경을 대표한다고 보장할 수 없습니다.
결정의 영향에 맞추세요. 개인 시험은 L1로 충분할 수 있지만 공개·고위험 주장은 더 강한 독립 근거가 필요합니다.
낯선 표시가 있을 때 확인하세요.
각 후보가 제외된 이유를 보고 실제로 유연한 조건만 완화하세요.
요구사항 검토게시자의 동점 순위 또는 여러 설정을 보존하기 때문입니다. OpenGPT는 보이는 행을 다시 번호 매기지 않습니다.
순위 확인출처가 비교 가능한 값을 공개하지 않았습니다. OpenGPT는 누락 값을 0으로 보지 않고 미보고로 남기며 같은 벤치마크 범위의 값만 비교합니다.
Agent 근거 확인미완료 상태가 아니라 원본 기록으로 분류된 항목입니다. 원본 출처를 확인하고 공식 모델 ID가 필요하면 모델 목록을 이용하세요.
원본 식별 정보같은 브라우저 프로필과 기기를 사용하세요. 비공개 모드, 저장 제한 또는 사이트 데이터 삭제로 목록이 사라질 수 있습니다.
내 모델 열기데이터 비교는 목록의 모델 ID를 사용합니다. 같은 버전을 이미 선택했거나 4개 제한에 도달했다면 다른 버전을 선택하거나 후보 하나를 먼저 제거하세요.
모델 목록 열기표시된 사례로 돌아가 두 출력과 판정을 모두 입력하세요.
비교 계속비교로 돌아가 더 새 로컬 초안 경고를 확인한 뒤 유지 또는 초기화를 선택하세요.
로컬 초안 확인실패 항목으로 원본 기록을 수정하세요. 비밀정보를 넣거나 결과를 다시 쓰지 마세요.
검증기 열기깨진 링크, 잘못된 모델 정보 또는 해결되지 않은 문제를 알려 주세요.