에이전트 벤치마크
WebArena 에이전트 벤치마크
WebArena의 표시된 버전과 환경에 연결된 공개 행 0개를 유지합니다.
- 과제
- 812
- 공개 행
- 0
- 출처 데이터 날짜
- ID 검토일
- 검토 필요
근거 범위
v0.2.0 · canonical self-hosted environment. realistic web tasks. Self-hosted websites with functional outcome evaluators. Submission-specific.
OpenGPT의 근거 처리 방식
게시자의 지표, 과제 범위, 환경, 버전, 구성과 날짜를 보존하며 벤치마크 간 종합 점수를 만들지 않습니다.
비교 범위
- 높은 결과는 표시된 벤치마크 버전과 조건에만 적용됩니다.
- 에이전트 결과는 기반 모델 하나가 아닌 전체 시스템을 반영합니다.
- 비용, 신뢰성, 안전성 또는 지연 시간 누락값은 추정하지 않습니다.
- OpenGPT has verified the official benchmark scope, but has not yet frozen a configuration-complete, directly comparable result snapshot.
v0.2.0 · canonical self-hosted environment
공개 0개 중 0개를 표시합니다. 모든 결과는 출처 벤치마크와 구성에 연결됩니다.