추천이 결정이 되는 과정을 공개합니다.
OpenGPT는 AI Decision Intelligence Platform입니다. 편집상 요구 적합성, 사실 출처, 실제 작업 평가와 공개 벤치마크를 분리해 각 결과의 조건과 한계를 보여 줍니다.
1분 요약
- 순위는 하나의 출처와 범위 안의 상대 위치이며 범용 점수가 아닙니다.
- 정확한 모델 버전과 전체 Agent 구성을 비교 단위로 사용합니다.
- 알 수 없거나 비교할 수 없는 데이터는 0이나 통합 순위로 바꾸지 않습니다.
- 로컬 보고서 검사는 구조와 내부 일관성을 확인하지만 출력 출처나 공급자 진위를 증명하지 않습니다.
편집 적합도 점수 · editorial-fit-v1
0~10 편집 적합도 점수 부여 방식
8개 카탈로그 신호는 차원별 비교를 지원합니다. rules-v2 추천 점수 및 공개 벤치마크 근거와 분리된 OpenGPT 편집 판단 계층입니다.
편집 제품 적합도 점수: 10은 이름이 표시된 차원에 더 강하게 맞음을 뜻합니다. 차원은 동등하게 표시하며 종합 우승자로 합치지 않습니다.
종합 능력
0–10공개 기능, 카탈로그 역할과 알려진 제품 제약을 바탕으로 폭넓고 복잡한 일반 업무 적합성을 편집 판단합니다. IQ나 벤치마크 점수가 아닙니다.
코딩
0–10소프트웨어 계획, 구현, 디버깅, 검토와 저장소 업무에 대한 편집 적합성이며 실측 통과율이 아닙니다.
추론
0–10다단계 분석, 제약 처리와 구조적 문제 해결에 대한 편집 적합성이며 재현한 추론 벤치마크가 아닙니다.
글쓰기
0–10초안, 편집, 장문 작성과 문서 업무에 대한 편집 적합성이며 문체나 사실성 실측 결과가 아닙니다.
속도
0–10제품 포지셔닝과 제공 방식에 따른 빠른 반복 작업의 편집 적합성이며 실측 지연시간 주장이 아닙니다.
비용 효율
0–10표시 요금제와 배포 방식으로 접근 가격 및 운영비 통제 적합성을 편집 판단합니다. 총비용 계산이나 가격 보장이 아닙니다.
개인정보 통제
0–10로컬, 하이브리드 또는 클라우드 분류로 배포와 데이터 통제 적합성을 편집 판단합니다. 보안, 규정 준수 또는 원격 측정 감사가 아닙니다.
생태계
0–10사용 가능한 도구, 연동, 플랫폼과 배포 선택지에 대한 편집 적합성이며 시장 점유율이나 연동 품질 측정값이 아닙니다.
가중치와 합산
각 차원은 같은 표시 비중을 가집니다. 산술 가중치, 평균, 총점 또는 종합 우승자가 없으며 선언 조건에서 중요한 차원은 사용자가 결정합니다.
사람의 편집 판단 경계
편집자가 rubric, 공급자가 확인한 제품 사실과 카탈로그 분류를 바탕으로 0~10 정수를 부여합니다. 정확한 버전 측정, 벤치마크 결과, 확률 또는 공급자 보증이 아닙니다.
출처
공식 공급자 페이지는 신원, 접근, 공개 기능, 배포 선택지와 표시 가격을 뒷받침합니다. 적합 태그, 강점, 약점, 분류와 모든 0~10 값은 OpenGPT 편집 입력입니다.
카탈로그 검토
카탈로그 최근 검토일:
신뢰도: 편집 범위 완전성: 중간
신뢰도는 카탈로그 범위와 설명의 완전성이며 좋은 성능 확률이 아닙니다. 공급자 사실은 바뀔 수 있고 적합 신호는 독립 측정되지 않았습니다.
적용 범위
현재 제품과 배포 가정 아래 이름이 표시된 차원별로 카탈로그 항목을 비교할 때 사용합니다. 점수 차이를 실측 성능 차이로 취급하지 않습니다.
도입 전에 현재 공급자 사실을 확인하고 정확한 모델 버전, 서비스 요금제, 도구, 지역과 대표 업무를 시험하세요.
공개 방법 · rules-v2
OpenGPT 추천 생성 방식
Builder는 로컬 Profile을 결정론적 후보 목록으로 바꿉니다. 아래 점수는 예산·개인정보 하드 게이트 뒤 편집상 제품 적합성을 정렬하며 모델 품질을 측정하지 않습니다.
점수 차원과 가산 규칙 점수
점수는 조건부 가중치이며 백분율이 아닙니다. 하드 게이트는 부적격 항목을 채점 전에 제외합니다.
작업·목표 적합성
모델 · 도구모델은 선택 작업 일치마다 +12, 목표의 정확한 일치에 +10을 받습니다. 도구는 사용 사례 일치마다 +10을 받습니다.
사용자 선언 조건 · OpenGPT 편집 카탈로그개인정보·배포
모델 · 도구높은 개인정보 조건에서는 비로컬 모델과 고개인정보로 분류되지 않은 도구를 제외합니다. 적격 로컬 모델은 +30, 도구는 +12이며 중간 조건은 하이브리드/로컬/클라우드에 +8/+5/+2입니다.
사용자 선언 조건 · OpenGPT 편집 카탈로그예산 적격성
모델 · 도구선택한 표시 가격 범위를 벗어난 항목은 제외합니다. 적격 모델은 +12, 도구는 +8이며 무료 프로필에서 표시된 무료 진입점이 있는 모델은 추가 +16을 받습니다.
사용자 선언 조건 · 공급자 공개 사실 · OpenGPT 편집 카탈로그직무 적합성
모델 · 도구학생-모델 일치는 +10, 다른 지원 모델-직무 일치는 +8입니다. 학생-도구 일치는 +8, 다른 지원 도구-직무 일치는 +6입니다.
사용자 선언 조건 · OpenGPT 편집 카탈로그산업 신호
모델 · 도구인식된 산업 용어를 작업 범주에 매핑하며 모델은 일치마다 +5, 도구는 +4를 받습니다. 자유 입력 문구 자체는 워크플로에 복사하지 않습니다.
사용자 선언 조건 · OpenGPT 편집 카탈로그언어 적합성
모델영어 외 언어 선호에서는 다국어 일치에 +14, 불일치에 −3을 적용합니다. 영어에서는 글쓰기 또는 문서 적합성에 +3을 적용합니다.
사용자 선언 조건 · OpenGPT 편집 카탈로그플랫폼 적합성
모델 · 도구모델 일치는 웹 +3, 데스크톱 +10, 터미널 +8, API +7, 모바일 +9입니다. 도구는 플랫폼 일치마다 +7, 일치가 없으면 −3입니다.
사용자 선언 조건 · OpenGPT 편집 카탈로그경험 수준 적합성
모델 · 도구초보 모델 적합은 +10(로컬 모델 불일치는 −4), 고급 적합은 +7, 중급의 프런티어/하이브리드 적합은 +2입니다. 초보/고급 도구 적합은 +6/+5입니다.
사용자 선언 조건 · OpenGPT 편집 카탈로그선택·동점
모델 · 도구적격 후보를 규칙 점수로 정렬하고 동점은 이름순으로 정합니다. 역할은 고정 순서로 채우며 남은 일치 모델 중 최대 3개를 대안으로 둡니다.
결정론적 rules-v2출처와 주장 경계
공급자 공개 사실
공식 페이지는 신원, 이용 경로, 공개 기능 설명과 표시 가격의 근거입니다. 독립 성능 시험으로 취급하지 않습니다.
OpenGPT 편집 카탈로그
적합 용도 태그, 강점, 개인정보/배포 분류와 제품 적합 신호는 편집 판단이며 벤치마크 측정값이나 공급자 보증이 아닙니다.
사용자 선언 조건
목표, 작업, 직무, 예산, 개인정보, 언어, 플랫폼, 숙련도와 산업 신호는 로컬 프로필에서 오며 적용 조건이지 외부 근거가 아닙니다.
결정론적 rules-v2
같은 정규화 프로필과 카탈로그 스냅샷은 같은 순서를 만듭니다. 계산은 설명 가능하지만 결정론이 편집 입력을 사실로 만들지는 않습니다.
공개 벤치마크 맥락
공개 순위는 별도 근거입니다. rules-v2는 순위나 점수를 추천 점수에 더하지 않으며 후보 선정 뒤 출처 범위를 유지해 확인합니다.
사실과 편집 판단
사실 주장은 이름이 있는 공급자 또는 벤치마크 출처, 가능한 경우 정확한 신원과 검토 날짜로 추적할 수 있어야 합니다.
적합 태그, 강점, 분류, 가정, 신뢰도와 추천은 OpenGPT 편집 판단이며 정확한 버전의 실측 결과로 표시하지 않습니다.
검토 주기와 신뢰도
방법론과 활성 추천 기록은 최소 90일마다, 그리고 변경 사건이 있을 때 검토할 예정입니다. 각 결과는 이 페이지 날짜가 아니라 해당 기록의 검토 날짜를 사용합니다.
검토 트리거
- 공급자가 모델 ID, 수명 주기, 이용 경로, 기능 설명 또는 표시 가격을 바꿀 때.
- 추천 엔진, 가중치, 하드 게이트 또는 편집 분류가 바뀔 때.
- 수정 요청에서 중요한 출처, 신원, 가격, 개인정보 또는 적용 오류가 확인될 때.
신뢰도 규칙
신뢰도는 적합 설명과 지원 기록의 완전성을 나타내며 모델이 잘 작동할 확률이 아닙니다.
- 높음
- 정확한 신원과 최신 사실 출처가 있고 중요한 필드가 해결되며 가정이 공개되고 적격 대안이 제시됩니다.
- 중간
- 적합 근거는 설명할 수 있지만 도입 전에 출처, 조건 또는 최신 사실 하나 이상을 확인해야 합니다.
- 낮음
- 신원, 최신성, 가격, 개인정보 또는 적용성에 중요한 공백이 있어 조사할 후보로만 취급합니다.
적용 범위와 조건
- 현재 검토된 모델·도구 카탈로그에서 rules-v2가 만든 편집 후보에 적용합니다.
- 결과는 입력 프로필과 카탈로그 스냅샷에 따라 달라지며 어느 하나가 바뀌면 결과도 달라질 수 있습니다.
- 저위험 의사결정 보조이며 품질, 실시간 가격, 벤치마크 우위, 안전성, 적법성 또는 규제 용도 적합성을 증명하지 않습니다.
결과별 필수 감사 표시
통합 추천은 사용자가 근거 경계를 추측하지 않도록 아래 7개 필드를 모두 표시해야 합니다.
- 추천 이유
- 근거
- 가정
- 최근 검토일
- 신뢰도
- 최선의 대안
- 선택하지 말아야 할 때
실제 작업에서 검토 가능한 결론까지
조건 정하기
비교 전에 작업, 성공 기준, 입력, 제약, 정확한 모델 버전, 설정과 날짜를 기록합니다.
같은 조건으로 시험
모든 후보에 같은 작업과 평가 기준을 씁니다. 모델명을 가리면 이름 편향은 줄일 수 있지만 이중맹검이나 독립 실행은 아닙니다.
원본 데이터 보관
프롬프트, 답변, 점수, 오류, 지연 시간과 해시를 보관하고 누락값을 추정으로 채우지 않습니다.
한계 밝히기
불확실성, 표본 수, 제외 항목, 이해관계와 결과가 증명하지 못하는 범위를 표시합니다.
근거 수준
Evidence v1/v2는 파일 형식과 선언 내용의 일관성을 확인합니다. 의사결정 워크스페이스 V3는 저장된 입력에서 해시, 배정, 매핑, 점수와 요약도 다시 계산합니다. L4 독립 재현은 입증하지 않습니다.
형식 확인
선언한 스키마를 따르고 뚜렷한 비밀 정보 필드가 없습니다.
기록 확인
작업 모음, 설정, 모델 정보와 평가 날짜를 일관되게 기록합니다. V1은 그중 일부만 확인합니다.
재계산 가능
의사결정 워크스페이스 V3는 붙여넣은 원본 출력과 채점 입력을 포함해 엄격한 로컬 재계산을 지원합니다. Evidence v1/v2에는 같은 필드가 없습니다.
독립 재현
목표는 별도 실행자 또는 서명 출처가 비교 가능한 조건에서 결과를 재현하는 것입니다. V1은 이를 검증하지 않습니다.
AI 에이전트 순위 비교 방법
각 행은 명시된 벤치마크 범위에서 공개된 하나의 Agent 구성을 나타내며 기반 모델만의 점수가 아닙니다.
시스템 구성 비교
출처가 공개한 Agent, 기반 모델, 실행 구조, 도구, 환경, 예산과 날짜를 함께 보존하고 미공개 항목은 알 수 없음으로 표시합니다.
원본 척도 유지
동일한 벤치마크, 버전, 작업 규칙과 비교 가능한 실행 그룹 안에서만 순위를 매기며 범용 종합 점수를 만들지 않습니다.
근거 상태 표시
벤치마크 공식 목록의 기록, 상위 확인 제출, 공급자 보고와 커뮤니티 실행을 구분합니다.
운영 근거 유지
출처가 비교 가능한 비용, 지연, 단계 수와 인적 개입을 제공하면 표시하고 누락값은 미확인으로 둡니다.
로컬 검증으로 확인할 수 있는 것
- ✓필수 필드와 지원 데이터 형식
- ✓점수, 실행, 날짜, 해시의 내부 일관성
- ✓데모 데이터 선언 여부
- ✓일반적인 API 키와 비밀 필드가 없는지
단독으로 확인할 수 없는 것
- —선언한 공급자나 모델이 실제 출력을 만들었는지
- —선택 편향이나 부실한 시험 설계가 없는지
- —모든 작업, 언어, 사용자와 미래 버전에 적용되는지
- —고위험 판단에 안전하고 적법하며 적합한지
공개 원칙
순위를 판매하지 않음
후원은 공개할 수 있지만 점수, 근거 기준과 배치를 바꿀 수 없습니다.
브랜드가 아닌 버전
모델 계열은 고정된 시험 대상이 아닙니다. 정확한 ID, 설정, 지역과 날짜가 중요합니다.
광범위한 주장보다 실제 작업
요구사항으로 후보를 좁힌 뒤 사용자의 대표 작업으로 직접 확인합니다.
불확실성도 결과
동점, 작은 표본, 실패한 실행과 결론이 나지 않는 근거를 그대로 표시합니다.