가이드 및 지원

OpenGPT 도움말

목표에 맞는 작업을 찾고 단계와 결과의 한계를 확인하세요.

하려는 일에서 시작하세요

각 작업은 서로 다른 질문에 답합니다. 가장 가까운 목표에서 가이드를 시작하세요.

1AI 모델 순위공개 지표와 모델 식별 정보를 이해합니다.2Agent 순위작업과 근거로 전체 Agent 구성을 선택합니다.3선택실제 요구사항으로 후보를 좁힙니다.4공개 데이터 비교목록의 모델 ID 2–4개를 나란히 봅니다.5모델 저장후보를 이 브라우저 목록에 보관합니다.6실제 답변 평가특정 버전 두 개를 같은 작업으로 시험합니다.7근거 제출 또는 수정모델이나 Agent의 공개 출처를 편집 검토에 보냅니다.8보고서 검증공유 전에 OpenGPT JSON 보고서를 기기에서 확인합니다.

01

AI 모델 순위

순위 대상, 데이터 출처와 공식 모델 ID 유무를 살펴봅니다.

열기

이 기능의 목적

공개 지표와 원본 기록을 확인하고 실제 작업으로 시험할 후보를 만듭니다.

시작 전 준비

먼저 필요한 판단을 정하세요. 사용자 선호도, 종합 능력, 객관 작업, 비용과 오픈 가중치 순위는 출처와 척도가 다릅니다.

단계별 튜토리얼

  1. 1결정에 맞는 순위 관점을 선택합니다.
  2. 2모든 기록은 전체 원본 순위에서, 공급자 문서에 모델 ID가 있는 기록은 공식 모델 ID에서 봅니다.
  3. 3원본 순위, 점수 범위, 투표 수, 라이선스와 설정을 함께 읽습니다.
  4. 4모든 행에서 모델 상세를 열 수 있습니다. 정확히 매핑된 행은 공식 프로필을, 나머지는 공개 이름과 설정을 보존한 출처 프로필을 표시합니다.
  5. 5모든 행을 비교에 추가할 수 있습니다. 설정을 잃지 않고 공식 버전으로 다룰 수 있는 기록은 공식 비교를, 나머지는 같은 출처·지표·스냅샷의 원본 기록 비교를 사용합니다.

결과 읽는 법

순위는 하나의 출처와 범위 안에서의 상대 위치입니다. 동점으로 번호가 건너뛸 수 있고 다른 관점의 점수는 직접 비교할 수 없습니다.

증명할 수 없는 것

OpenGPT는 제3자 공개 데이터를 정리하며 평가를 다시 실행하지 않았습니다. 모든 사용자와 작업에 맞는 최고 모델을 정하지 않습니다.

자주 묻는 질문: 일부 행에 원본 모델 ID 또는 이름만 표시되는 이유는?

모든 행에 모델 상세와 비교 기능이 있습니다. 공급자 문서로 정확한 매핑을 확인한 경우에만 공식 모델 ID를 추가하고, 나머지는 새 공식 ID를 만들지 않고 원본 기록으로 공개 이름, 설정과 순위 데이터를 보존합니다.

맨 위로
02

AI 에이전트 순위

작업, 전체 구성, 근거 품질과 비교 가능한 결과로 Agent를 선택합니다.

열기

이 기능의 목적

서로 다른 근거를 하나의 점수로 합치지 않고 7가지 작업 범위의 Agent 평가 구성 74개와 별도 BFCL 도구 호출 모델 결과 109개를 살펴봅니다.

시작 전 준비

Agent 결과는 기반 모델, 실행 구조, 도구, 권한, 예산, 환경, 벤치마크 버전과 날짜를 포함한 하나의 전체 구성에 속합니다. 출처가 공개하지 않은 값은 0이 아니라 미보고로 남깁니다.

단계별 튜토리얼

  1. 1실제 업무에 맞는 작업 범주를 선택합니다.
  2. 2순위를 읽기 전에 벤치마크 범위, 버전, 평가일, 최신 상태와 감사 메모를 확인합니다.
  3. 3근거 등급으로 재현·검증 결과, 투명한 공개 실행, 공급자 보고 결과를 구분합니다.
  4. 4성공률, 반복 실행 근거, 소요 시간과 사람 개입률은 같은 조건에서 공개된 경우에만 비교합니다. 성공당 비용은 공개 총비용과 작업/실행 분모가 같은 범위임을 확인한 경우에만 계산합니다.
  5. 5유용한 구성을 팔로우해 기록을 확인하고 같은 비교 그룹에서 2–4개를 나란히 봅니다.

결과 읽는 법

순위는 한 벤치마크 범위 안에서 전체 시스템 구성의 위치입니다. 근거 등급, 최신 상태, 실행 수와 공개된 비용·신뢰성 지표를 함께 읽으세요.

증명할 수 없는 것

OpenGPT는 보편적인 Agent 총점을 만들지 않습니다. 재현됨으로 명시되지 않은 결과는 상위 출처의 근거를 정리한 것이며 어떤 벤치마크도 모든 업무의 운영 준비도를 증명하지 않습니다.

자주 묻는 질문: 같은 Agent나 모델이 여러 번 표시되는 이유는?

실행 구조, 모델 버전, 도구, 권한, 예산 또는 벤치마크 설정이 다르면 별도의 Agent 구성으로 기록해야 합니다.

맨 위로
03

모델 또는 Agent 제출

순위를 바꾸지 않고 공개 신원이나 근거 기록을 검토에 보냅니다.

열기

이 기능의 목적

공식 모델 ID나 Agent 제품이 없거나 공개 출처에 편집 검토가 필요할 때 사용합니다.

시작 전 준비

확인된 계정으로 로그인하고 공개 HTTPS 출처를 준비하세요. 자격 증명, 비공개 파일 또는 개인정보를 제출하지 마세요.

단계별 튜토리얼

  1. 1양식 상단에서 모델 또는 Agent를 선택합니다.
  2. 2정확한 공개 이름, 공급자·조직과 요청된 신원 항목을 입력합니다.
  3. 3출처 유형을 선택하고 공식 문서, 공개 저장소 또는 공개 벤치마크 결과를 연결합니다.
  4. 4검토자가 확인할 내용을 설명한 뒤 한 번만 제출합니다.
  5. 5최근 제출에서 상태를 확인합니다. 검토 후 후보 기록이 공개될 수 있지만 순위와 카탈로그 수록은 별도 결정입니다.

결과 읽는 법

제출이 완료되면 참조 번호와 함께 검토 대기열에 들어갑니다. 공개 후보 기록은 공개 근거이며 순위표 순위나 카탈로그 항목이 아닙니다.

증명할 수 없는 것

제출자는 순위, 근거 등급, 비교 가능성 또는 게시 상태를 정할 수 없습니다. 중복·횟수 제한으로 남용을 줄이며 승인되어도 순위는 자동 변경되지 않습니다.

자주 묻는 질문: 승인된 제출이 순위에 추가되지 않은 이유는?

승인은 편집 검토를 통과했다는 뜻입니다. 카탈로그 신원과 비교 가능한 순위 근거는 별도로 검증해야 합니다.

맨 위로
04

순위 변화와 버전 기록

비교 가능한 스냅샷 사이의 변화와 공식 문서의 모델 ID를 살펴봅니다.

열기

이 기능의 목적

이전 월간 출처 스냅샷 이후의 변화, 첫 등장, 정확한 버전 차이와 데이터 수집일을 확인할 때 사용합니다.

시작 전 준비

과거 변화는 LMArena 사용자 선호 범위를 사용합니다. 다른 순위는 비교 가능한 이전 스냅샷이 생길 때까지 현재 데이터만 표시합니다.

단계별 튜토리얼

  1. 1현재 출처 날짜, 비교 기준, 수집일과 비교 규칙을 확인합니다.
  2. 2가장 많이 오른 모델은 두 스냅샷에 모두 있는 기록의 순위 변화로만 읽습니다.
  3. 3첫 등장을 공식 제품 출시로 해석하지 않습니다.
  4. 4전체 표를 상승, 하락, 변동 없음, 첫 등장, 목록 제외로 필터링합니다.
  5. 5공식 문서에 있는 모델 ID 두 개를 비교하고 필요한 월간 스냅샷을 내려받습니다.

결과 읽는 법

출처, 범위, 단위와 방법이 같을 때만 변화를 계산하고 월간 스냅샷을 보존합니다.

증명할 수 없는 것

새 출시에는 공급자 문서의 출시일이 필요합니다. 이름에서 속도, 가격, 컨텍스트 길이나 품질을 추정하지 않습니다.

자주 묻는 질문: Artificial Analysis와 LiveBench에 순위 변화가 없는 이유는?

비교 가능한 이전 판을 아직 동결하지 않았기 때문입니다. 누락된 기록에서 가상 변화를 만들지 않습니다.

맨 위로
05

업무별 순위

실제 업무에서 시작해 먼저 시험할 공식 모델 버전 3개를 확인합니다.

열기

이 기능의 목적

코딩, 조사, 문서, 고객 지원, 다국어, 멀티모달, 비용, 비공개 배포와 속도 업무에 대해 넓은 공개 신호를 실용적인 후보 목록으로 좁힙니다.

시작 전 준비

실제 업무와 가장 가까운 시나리오를 고르고 프롬프트, 데이터, 도구, 지역, 예산과 개인정보 요구를 정리하세요. 표시된 공개 근거의 범위가 해당 업무보다 넓을 수 있습니다.

단계별 튜토리얼

  1. 1필요한 결정과 가장 가까운 업무 시나리오를 엽니다.
  2. 2공식 버전 3개를 고른 이유와 남은 불확실성을 읽습니다.
  3. 3후보별 공개 출처, 출처 순위 또는 값, 연결 확인일과 데이터 기준일을 확인합니다.
  4. 4후보 2~3개를 선택해 공개 데이터를 나란히 비교합니다.
  5. 5첫 두 후보로 실제 업무 평가를 열고 예제 작업 모음을 편집한 뒤 같은 조건으로 시험합니다.

결과 읽는 법

공식 시작 후보 3개, 가능한 공개 근거와 데이터 비교 및 실제 업무 평가 경로를 얻습니다.

증명할 수 없는 것

업무별 순위는 시작 후보 목록이며 보편적인 순위나 최고 모델의 증명이 아닙니다. 누락 근거는 0이 아니며 서로 다른 공개 출처를 한 점수로 합치지 않습니다.

자주 묻는 질문: 비교 가능한 공개 결과가 없는 후보가 포함되는 이유는?

공식 버전의 제품 위치나 배포 방식이 업무에 적합해도 선택한 공개 출처에 정확한 버전 결과가 없을 수 있습니다. 누락 상태를 그대로 표시하므로 직접 업무로 확인해야 합니다.

맨 위로
06

모델 업그레이드 레이더

현재 사용하는 모델, 반복 업무와 우선순위를 설정하고 공정한 비교가 필요한 변화만 신중하게 확인합니다.

열기

이 기능의 목적

비교 가능한 공개 데이터가 현재 모델의 대안을 시험할 만큼 충분한지 판단합니다.

시작 전 준비

정확한 공식 버전, 하나 이상의 반복 업무와 최대 두 가지 우선순위를 선택하세요. 설정은 이 기기에만 저장됩니다.

단계별 튜토리얼

  1. 1현재 사용하는 정확한 공식 버전을 선택합니다. 저장한 모델이 자동으로 현재 모델로 간주되지는 않습니다.
  2. 2반복 업무를 선택하고 품질, 비용, 속도, 개인정보 보호와 긴 컨텍스트 중 우선순위를 최대 두 개 고릅니다.
  3. 3각 모델이 비교할 가치가 있는지, 계속 지켜볼지, 대안을 준비해야 하는지 확인합니다.
  4. 4같은 척도의 공개 데이터를 확인한 뒤 두 모델에 동일한 실제 업무를 수행하게 합니다.
  5. 5공개 데이터 변화를 정기적으로 확인하거나 순위 변화 RSS를 구독합니다.

결과 읽는 법

현재 모델, 업무에 맞는 대안, 데이터 날짜, 불확실성 범위와 비교 경로를 포함한 업그레이드 점검 결과가 이 기기에만 생성됩니다.

증명할 수 없는 것

업그레이드 점검은 모델을 바꾸라는 지시가 아닙니다. 비교 가능한 데이터가 없는 조건은 직접 시험해야 하며 로컬 설정은 동기화되거나 백업되지 않습니다.

자주 묻는 질문: ‘비교할 가치가 있음’은 현재 모델을 바꿔야 한다는 뜻인가요?

아닙니다. 같은 업무로 시험해 볼 가치가 있다는 뜻입니다. 대안 모델이 실제 업무와 제약 조건에서 더 나은 경우에만 교체를 검토하세요.

맨 위로
07

AI 모델 선택

네 가지 실무 요구사항으로 설명 가능한 후보를 만듭니다.

열기

이 기능의 목적

해야 할 작업은 알지만 어떤 모델 계열부터 살펴볼지 모를 때 사용합니다.

시작 전 준비

주요 작업, 실행 위치, 가장 중요한 운영 기준과 언어 요구를 정리하세요.

단계별 튜토리얼

  1. 1실제 업무와 가장 가까운 작업을 선택합니다.
  2. 2데이터를 외부로 보낼 수 없다면 배포 경계를 정확히 설정합니다.
  3. 3가장 포기하기 어려운 우선순위를 선택합니다.
  4. 4언어 요구를 설정하고 각 후보의 적합 이유, 위험과 다음 검증 단계를 읽습니다.
  5. 5후보의 특정 모델 버전을 동일한 실제 작업으로 비교합니다.

결과 읽는 법

정성적 적합도 표시와 충족한 요구 수는 모델 계열에만 적용되며 개별 버전 평가나 벤치마크 점수가 아닙니다. 표시된 현재 버전은 배포 가능 여부를 확인하고 동일한 작업으로 비교하세요.

증명할 수 없는 것

모델을 호출하거나 최신 가격과 보편적 승자를 확인하지 않습니다. 같은 계열도 버전에 따라 다릅니다.

자주 묻는 질문: 유명한 모델이 첫 번째가 아닌 이유는?

인기가 아니라 선택한 제약에 맞춰 순서를 정합니다. 조건을 바꿔 원인을 확인하고 특정 모델 버전을 테스트하세요.

맨 위로
08

모델 목록과 상세

공급자 문서에 있는 모델 ID를 찾고 전용 상세 페이지와 비교 가능한 공개 순위 데이터를 확인합니다.

열기

이 기능의 목적

정확한 공식 모델 ID, 공급자 목적지, 적합하거나 부적합한 작업, 출처와 순위 데이터 상태가 필요할 때 사용합니다.

시작 전 준비

모델명, 공급자, 배포 요구 또는 작업을 준비하세요. 공급자 문서에 모델 ID가 있어도 비교 가능한 공개 평가 데이터가 있다는 뜻은 아닙니다.

단계별 튜토리얼

  1. 1모델, 버전, 공급자 또는 작업으로 검색합니다.
  2. 2배포 방식과 순위 포함 또는 현재 순위 없음 상태로 필터링합니다.
  3. 3상세 페이지에서 식별 정보, 용도, 공개 데이터 범위, 강점, 한계, 출처와 검토일을 확인합니다.
  4. 4공식 목적지에서 현재 제공 여부, 가격, 개인정보와 제한을 확인합니다.
  5. 5목록의 버전 2–4개를 데이터 비교에 추가한 뒤 최종 두 개를 실제 작업 평가로 보냅니다.

결과 읽는 법

순위 포함은 비교 가능한 공개 데이터가 해당 모델 ID에 연결된 상태입니다. 순위 없음은 이번 판에 적절한 비교 기록이 없다는 뜻이며 0점이 아닙니다.

증명할 수 없는 것

공급자 문서는 목록의 식별 정보를 뒷받침하지만 모든 국가와 서비스 등급의 현재 제공을 보장하지 않습니다. 표시 이후 순위 범위와 이용 조건이 바뀔 수 있습니다.

자주 묻는 질문: 순위 없음은 성능이 낮다는 뜻인가요?

아니요. 이번 판에 그 모델 ID에 맞는 비교 가능한 공개 데이터가 없다는 뜻입니다. 결정에 중요하다면 직접 시험하세요.

맨 위로
09

데이터 비교

정확한 공식 버전 2–4개 또는 하나의 게시된 순위 보기에서 원본 기록을 비교합니다.

열기

이 기능의 목적

공식 버전 비교는 공급자 문서의 ID를 공개 출처별로 정리합니다. 정확한 공식 비교에서 정보가 사라질 경우 원본 기록 비교가 게시 이름과 설정을 보존합니다.

시작 전 준비

공식 버전은 카탈로그 ID 2–4개를 고르세요. 원본 기록은 같은 출처, 지표, 스냅샷에서 2–4개를 고르세요.

단계별 튜토리얼

  1. 1순위의 모든 행을 비교에 추가할 수 있습니다. 설정을 보존할 수 있는 정확한 매핑은 공식 비교를, 나머지는 원본 기록 비교를 사용합니다.
  2. 2공식 결과는 출처와 지표별로 나누어 표시합니다.
  3. 3원본 기록 비교는 게시된 이름, 설정, 순위, 점수를 하나의 출처 척도로 유지합니다.
  4. 4누락 데이터는 0이 아니라 알 수 없음으로 표시합니다.
  5. 5정확한 공식 버전만 최종 두 후보를 실제 작업 평가로 보낼 수 있습니다.

결과 읽는 법

정보가 없는 부분까지 드러나는 근거 중심 후보 목록을 만듭니다. 새 벤치마크 점수나 보편적인 우승자를 만들지 않습니다.

증명할 수 없는 것

이 화면에서는 모델을 호출하지 않습니다. 출처나 범위가 다른 점수는 서로 바꿔 비교할 수 없고, 검토일 이후 모델 정보가 달라질 수 있습니다.

자주 묻는 질문: 데이터 비교와 실제 작업 평가는 어떻게 다른가요?

데이터 비교는 모델 2–4개의 공개 정보를 정리합니다. 실제 작업 평가는 정확히 두 버전에서 같은 프롬프트를 실행하고 붙여넣은 답변을 모델명 없이 검토합니다.

맨 위로
10

저장한 모델

순위 후보를 이 브라우저의 간단한 작업 목록에 저장합니다.

열기

이 기능의 목적

후보를 빠르게 다시 찾고 신뢰할 수 있는 공급자 페이지를 열며 지원되는 모델 ID를 비교로 옮길 때 사용합니다.

시작 전 준비

같은 브라우저와 기기를 사용하세요. OpenGPT 계정이나 클라우드 동기화 없이 목록이 로컬에 저장됩니다.

단계별 튜토리얼

  1. 1순위의 아무 행에서 저장을 선택합니다.
  2. 2상단 탐색 메뉴에서 저장한 모델을 열어 저장 항목을 확인합니다.
  3. 3모든 원본 기록은 원본 모델 ID 또는 이름을 표시합니다. 공식 모델 ID가 있는 기록은 공급자 페이지를 열거나 비교에 추가할 수 있습니다.
  4. 4지원되는 서로 다른 모델 ID 두 개를 추가한 뒤 동일 작업 비교를 시작합니다.
  5. 5필요 없는 항목을 삭제합니다. 같은 브라우저라면 새로고침하거나 언어를 바꿔도 목록이 유지됩니다.

결과 읽는 법

저장한 모델 옆 숫자는 저장된 항목 수입니다. 원본 식별 정보와 공식 모델 식별 정보는 별도로 유지됩니다.

증명할 수 없는 것

계정, 북마크 동기화 또는 백업이 아닙니다. 다른 브라우저나 기기에는 보이지 않으며 비공개 모드, 저장 제한, 사이트 데이터 삭제로 사라질 수 있습니다.

자주 묻는 질문: 저장한 모델이 사라진 이유는?

같은 브라우저 프로필과 기기를 사용하는지 확인하세요. 사이트 저장소가 삭제되거나 차단되면 로컬 목록을 복구할 수 없습니다.

맨 위로
11

실제 작업 평가

실제 작업을 사용하고 의사결정 프로젝트를 이 기기에 저장합니다.

열기

이 기능의 목적

템플릿 또는 편집 가능한 사용자 작업으로 특정 모델 버전 두 개를 비교합니다.

시작 전 준비

두 공급자 서비스를 열고 버전과 설정을 확인하며 민감한 정보를 제거하세요. 그곳에 제출한 내용은 각 공급자 정책을 따릅니다.

단계별 튜토리얼

  1. 1서로 다른 특정 모델 버전 두 개를 선택합니다.
  2. 2템플릿을 불러오거나 작업을 추가·편집합니다.
  3. 3각 프롬프트를 두 서비스에서 실행하고 전체 답변을 붙여넣습니다.
  4. 4모델명을 가리고 답변을 비교해 다섯 항목을 평가하고 답변 1·답변 2·동점을 선택해 메모합니다.
  5. 5모든 판단 후 한 번에 공개하고 V3 보고서를 저장하거나 로컬 검증합니다.

결과 읽는 법

종합 선호가 작업별 결과를 결정합니다. 차이가 작거나 완료 작업이 3개 미만이면 결론 부족입니다.

증명할 수 없는 것

이름 숨김은 보이는 라벨 편향만 줄입니다. 이중맹검이나 독립 실행이 아니며 답변 출처나 보편 순위를 증명하지 않습니다.

자주 묻는 질문: 점수와 종합 선호가 다르면?

차이를 메모로 설명할 수 있을 때만 선호를 유지하고, 그렇지 않으면 점수를 다시 확인하세요.

맨 위로
12

저장한 작업 모음과 재평가

작업 모음을 다시 만들지 않고 같은 실제 프롬프트를 다음 모델 평가에 재사용합니다.

열기

이 기능의 목적

이후 비교 조건을 일관되게 유지하고 모델 출시나 공개 데이터 변경 뒤 정확한 버전을 다시 평가할 때 사용합니다.

시작 전 준비

작업 제목과 프롬프트를 완성하고 알아보기 쉬운 이름을 지정한 뒤 같은 브라우저와 기기를 사용하세요. 민감한 업무 내용은 저장 전에 제거해야 합니다.

단계별 튜토리얼

  1. 1실제 업무 평가에서 업무를 대표하는 작업 모음을 준비하거나 편집합니다.
  2. 2알아보기 쉬운 이름을 붙여 작업 모음을 저장합니다.
  3. 3나중에 저장된 작업 모음을 선택해 현재 평가에 불러옵니다.
  4. 4정확한 모델 버전 두 개를 선택하고 같은 설정으로 모든 프롬프트를 실행합니다.
  5. 5완료 결과에서 재평가를 선택하면 작업과 모델 버전은 유지하고 이전 답변, 판단과 보고서를 지운 새 실행을 시작합니다.

결과 읽는 법

작업 모음 이름, 템플릿, 언어, 작업 제목과 프롬프트가 기기에 저장됩니다. 재평가는 의도한 입력을 유지하면서 깨끗한 새 실행을 만듭니다.

증명할 수 없는 것

저장한 작업 모음은 이 기기에만 있고 동기화나 백업이 없습니다. 답변, 모델 선택, 검토, 보고서와 API 키는 작업 모음에 저장하지 않으며 사이트 데이터를 지우면 사라질 수 있습니다.

자주 묻는 질문: 재평가를 선택하면 무엇이 바뀌나요?

같은 작업과 정확한 모델 버전은 유지하고 이전 답변, 점수, 판단, 공개 상태와 보고서를 지워 과거 결과와 독립된 새 실행을 시작합니다.

맨 위로
13

공유 가능한 결정 보고서

공식 모델 후보와 공개 데이터 기준일을 개인정보 없이 링크로 공유합니다.

열기

이 기능의 목적

검토 중인 업무, 정확한 공식 버전, 공개 근거와 선택 후보를 다른 사람에게 설명할 때 사용합니다.

시작 전 준비

업무별 순위에서 보고서를 만들고 업무, 정확한 모델 ID, 데이터 기준일과 선택 항목을 확인한 뒤 공유하세요.

단계별 튜토리얼

  1. 1업무별 순위에서 공식 후보 2~3개로 보고서를 만듭니다.
  2. 2원하면 모델 하나를 선택으로 표시합니다. 선택 없이 공유해도 됩니다.
  3. 3공개 데이터 범위와 보고서의 한계를 검토합니다.
  4. 4링크 복사, 기기 공유, 인쇄 또는 정제된 JSON 다운로드를 사용합니다.
  5. 5받는 사람은 같은 후보를 열어 공개 데이터를 비교하거나 실제 업무 평가를 시작할 수 있습니다.

결과 읽는 법

공유 URL에는 업무 ID, 정확한 공식 모델 ID, 공개 데이터 기준일과 선택 모델만 들어 있어 같은 후보 목록을 확인할 수 있습니다.

증명할 수 없는 것

프롬프트, 모델 답변, 메모, API 키와 전체 평가 보고서는 포함되지 않습니다. 보편적 우승자나 공급자가 답변을 생성했다는 증명도 아닙니다.

자주 묻는 질문: 공유 링크로 내 평가 내용을 볼 수 있나요?

아니요. 프롬프트, 답변, 메모, API 키와 로컬 평가 프로젝트는 제외됩니다. 지원 흐름 밖에서 정보를 추가했다면 공유 전 링크를 확인하세요.

맨 위로
14

보고서 검증

지원되는 JSON의 구조, 내부 일관성, 비밀정보 패턴과 로컬 지문을 확인합니다.

열기

이 기능의 목적

OpenGPT Evidence v1/v2 또는 의사결정 워크스페이스에서 내려받은 V3 보고서를 검사합니다. 모든 검사는 이 브라우저 안에서 실행됩니다.

시작 전 준비

원본 JSON 파일을 준비하세요. 비교 보고서는 의사결정 워크스페이스에서 내려받고, 초안이 아닌 완료 결과가 필요하다면 먼저 모든 사례를 끝내세요.

단계별 튜토리얼

  1. 1JSON 파일을 선택합니다. 내용은 브라우저에 남습니다.
  2. 2Evidence v1/v2 또는 OpenGPT 비공개 비교 v1/v2 또는 의사결정 워크스페이스 v3로 인식되는지 확인합니다.
  3. 3근거 패키지는 필수 필드, 실행 기록, 날짜, 점수와 비밀정보 안전 규칙을 확인합니다. 비교 보고서는 후보 이름, 작업 모음, 초안·완료 상태, 중복 없는 사례, 요약과 기록된 판정의 일치 여부를 확인합니다.
  4. 4선언된 요약을 읽고 나중에 같은 파일인지 확인해야 한다면 SHA-256 지문을 저장합니다.
  5. 5검사에 실패하면 통과시키려고 내려받은 보고서를 편집하지 말고 원본 데이터를 고치거나 미완료 사례를 끝내세요.

결과 읽는 법

Evidence v1/v2에서 통과는 지원 구조와 일관성 규칙을 만족한다는 뜻이고 데모는 예제임을 나타냅니다. 비교 보고서에서 통과는 완료 보고서가 내부적으로 일치함을, 초안은 구조는 유효하지만 비교가 끝나지 않았음을 뜻합니다. 실패는 검토할 필수 항목이 있다는 뜻입니다.

증명할 수 없는 것

통과해도 이름 붙은 모델이 붙여넣은 답변을 만들었다는 것, 공급자 주장의 진실성 또는 기록한 작업 밖으로 결과가 일반화된다는 것을 증명하지 않습니다. 서로 다른 파일의 결과는 자동 비교할 수 없습니다.

자주 묻는 질문: 통과한 비교 보고서는 한 모델이 더 우수함을 증명하나요?

아니요. 지원되는 보고서의 구조와 내부 일관성만 확인합니다. 모델 신원, 테스트 품질, 출력과 의사결정 관련성은 별도로 판단해야 합니다.

맨 위로
15

평가 방법

모델 결정을 검토하고 재현 가능하게 만드는 요소를 배웁니다.

열기

이 기능의 목적

평가를 설계, 공개 또는 신뢰하기 전에 근거 품질과 인기를 구분할 때 사용합니다.

시작 전 준비

구체적 결정 질문, 특정 모델 버전, 대표 작업과 원본 출력 보존 계획을 준비하세요.

단계별 튜토리얼

  1. 1결과를 보기 전에 결정과 성공 기준을 작성합니다.
  2. 2모든 후보에 같은 작업, 설정과 채점 규칙을 사용합니다.
  3. 3프롬프트, 출력, 설정, 실패, 시간과 모음 지문을 보존합니다.
  4. 4수동, 자동, 모델명을 가린 검토, 무작위, 독립 재현 범위를 밝힙니다.
  5. 5불확실성과 명시적 한계를 결론과 함께 공개합니다.

결과 읽는 법

Evidence v1/v2는 주로 형식과 선언을 확인합니다. 의사결정 워크스페이스 V3는 로컬 재계산(L3)을 지원하며 L4 독립 재현은 지원하지 않습니다.

증명할 수 없는 것

엄격한 과정도 모든 사용자, 언어, 미래 버전과 운영 환경을 대표한다고 보장할 수 없습니다.

자주 묻는 질문: 항상 더 높은 근거 수준이 필요한가요?

결정의 영향에 맞추세요. 개인 시험은 L1로 충분할 수 있지만 공개·고위험 주장은 더 강한 독립 근거가 필요합니다.

맨 위로

쉬운 용어집

낯선 표시가 있을 때 확인하세요.

원본 기록
공개 순위에서 보존한 한 행입니다. 출처의 모델 ID 또는 이름을 그대로 유지해 검토와 감사에 사용합니다.
공식 모델 ID
공급자 문서에 기재된 모델 식별자로, 원본 기록 이름과 구분해 표시합니다.
목록 버전
공급자 문서에서 수록하고 공식 목적지와 검토 출처를 제공하는 모델 버전입니다.
예상 점수 범위
공개된 점수 불확실성 범위입니다. 넓을수록 정밀도가 낮고 다른 순위 출처와 직접 비교할 수 없습니다.
내 모델
이 브라우저에만 저장되는 후보 목록이며 계정이나 클라우드 동기화가 아닙니다.
요구사항 적합도
모델 계열의 정성적 적합도와 충족 요구 수이며 개별 버전 평가가 아닙니다. 특정 버전을 같은 작업으로 비교하세요.
모델 계열
관련 버전 그룹이며 기능, 가격과 접근 방식이 버전마다 다를 수 있습니다.
벤치마크
명시된 조건에서 시스템을 비교하는 반복 가능한 작업과 채점 규칙입니다.
Agent 구성
한 결과를 만든 기반 모델, 실행 구조, 도구, 권한, 예산, 환경, 벤치마크 버전과 날짜의 조합입니다.
근거 등급
결과가 어떻게 생성되거나 확인되었는지 나타내며 원본 점수는 바꾸지 않습니다.
성공당 비용
보고된 평가 비용을 성공 작업 수로 나눈 값입니다. 비교 가능한 출처 데이터가 있을 때만 표시하고 누락 비용은 0이 아닙니다.
근거 파일
평가 방법과 관찰 결과를 선언하는 구조화 기록입니다.
스키마
필수 필드와 허용 값을 정의하는 기계 판독 규칙입니다.
SHA-256 지문
정확히 같은 파일을 확인하는 로컬 식별자로 파일이 바뀌면 값도 바뀝니다.

문제 해결

모든 요구를 만족하는 모델이 없음

각 후보가 제외된 이유를 보고 실제로 유연한 조건만 완화하세요.

요구사항 검토

순위 번호가 건너뜀

게시자의 동점 순위 또는 여러 설정을 보존하기 때문입니다. OpenGPT는 보이는 행을 다시 번호 매기지 않습니다.

순위 확인

Agent 비용 또는 신뢰성이 누락됨

출처가 비교 가능한 값을 공개하지 않았습니다. OpenGPT는 누락 값을 0으로 보지 않고 미보고로 남기며 같은 벤치마크 범위의 값만 비교합니다.

Agent 근거 확인

공식 모델 ID가 없는 기록

미완료 상태가 아니라 원본 기록으로 분류된 항목입니다. 원본 출처를 확인하고 공식 모델 ID가 필요하면 모델 목록을 이용하세요.

원본 식별 정보

내 모델이 비었거나 사라짐

같은 브라우저 프로필과 기기를 사용하세요. 비공개 모드, 저장 제한 또는 사이트 데이터 삭제로 목록이 사라질 수 있습니다.

내 모델 열기

데이터 비교에 추가할 수 없음

데이터 비교는 목록의 모델 ID를 사용합니다. 같은 버전을 이미 선택했거나 4개 제한에 도달했다면 다른 버전을 선택하거나 후보 하나를 먼저 제거하세요.

모델 목록 열기

비교 보고서가 미완성

표시된 사례로 돌아가 두 출력과 판정을 모두 입력하세요.

비교 계속

로컬 초안이 충돌했거나 초기화가 필요함

비교로 돌아가 더 새 로컬 초안 경고를 확인한 뒤 유지 또는 초기화를 선택하세요.

로컬 초안 확인

근거 파일 검증 실패

실패 항목으로 원본 기록을 수정하세요. 비밀정보를 넣거나 결과를 다시 쓰지 마세요.

검증기 열기
contact@opengpt.com

도움이 더 필요한가요?

깨진 링크, 잘못된 모델 정보 또는 해결되지 않은 문제를 알려 주세요.

이메일 문의