OPENGPT 근거 프로토콜 V1

모델 선택의 신뢰도는 근거의 품질에 달려 있습니다.

OpenGPT는 요구사항 매칭, 직접 비교, 공개 근거를 분리합니다. 무엇을 어떤 조건에서 시험했고 무엇이 검증되지 않았는지 모든 결론에 표시합니다.

실제 작업에서 검토 가능한 결론까지

1

질문 고정

비교 전에 작업, 성공 기준, 입력, 제약, 모델 버전, 날짜와 설정을 기록합니다.

2

동일 조건 실행

모든 후보에 같은 작업과 평가 기준을 사용합니다. 블라인드 선호 비교가 필요하면 외부 무작위 실행기를 사용하세요. 현재 비공개 비교는 이름을 숨기지 않습니다.

3

원본 근거 보관

프롬프트, 출력, 점수, 오류, 지연 시간과 해시를 보관하고 누락된 근거를 추정으로 채우지 않습니다.

4

한계 공개

불확실성, 표본 수, 제외 항목, 이해관계와 증명할 수 없는 범위를 공개합니다.

근거 수준 목표 기준

현재 로컬 검증기는 L1을 완전히 지원하고 L2 선언 일부만 확인합니다. L3와 L4는 아직 검증하지 않습니다. 각 수준은 프로토콜 목표이며 업로드한 파일에 대한 자동 인증이 아닙니다.

L1현재 지원

형식 확인

선언한 스키마를 따르고 뚜렷한 비밀 정보 필드가 없습니다.

L2부분 지원

프로토콜 일치

목표는 작업 모음, 설정, 모델 선언과 평가 날짜를 일관되게 기록하는 것입니다. V1은 선언 일부만 확인합니다.

L3아직 미지원

재계산 가능

목표는 독립 검토자가 재계산할 원본 출력과 채점 입력을 포함하는 것입니다. V1에는 아직 이 필드가 없습니다.

L4아직 미지원

독립 재현

목표는 별도 실행자 또는 서명 출처가 비교 가능한 조건에서 결과를 재현하는 것입니다. V1은 이를 검증하지 않습니다.

로컬 검증으로 확인할 수 있는 것

  • 필수 필드와 지원 데이터 형식
  • 점수, 실행, 날짜, 해시의 내부 일관성
  • 데모 데이터 선언 여부
  • 일반적인 API 키와 비밀 필드가 없는지

단독으로 확인할 수 없는 것

  • 선언한 공급자나 모델이 실제 출력을 만들었는지
  • 선택 편향이나 부실한 시험 설계가 없는지
  • 모든 작업, 언어, 사용자와 미래 버전에 적용되는지
  • 고위험 판단에 안전하고 적법하며 적합한지

공개 원칙

순위를 판매하지 않음

후원은 공개할 수 있지만 점수, 근거 기준과 배치를 바꿀 수 없습니다.

브랜드가 아닌 버전

모델 계열은 고정된 시험 대상이 아닙니다. 정확한 ID, 설정, 지역과 날짜가 중요합니다.

광범위한 주장보다 실제 작업

요구사항으로 후보를 좁힌 뒤 사용자의 대표 작업으로 직접 확인합니다.

불확실성도 결과

동점, 작은 표본, 실패한 실행과 결론이 나지 않는 근거를 그대로 표시합니다.