Documentos y preguntas y respuestas fundamentadas
Archivos largos, resúmenes, citas y respuestas limitadas al texto proporcionado.
- Por qué estos candidatos
- Assumption · Historical. Compara modelos diseñados para mantener contextos extensos o para la recuperación empresarial y comprueba después el comportamiento exacto de las citas y las negativas.
- Qué sigue siendo incierto
- Las afirmaciones sobre la ventana de contexto no demuestran la calidad de la recuperación ni el uso fiel de un documento largo.
Tres versiones oficiales que probar primero
Los datos públicos acotan las opciones, pero no sustituyen una prueba controlada con tu propio trabajo. Seleccione dos o tres candidatos para comparar en paralelo los datos públicos.
Unknown · Not automatically certified
Actualmente no hay ningún resultado público comparable asociado a esta versión exacta.
Evidencia públicaLos modelos utilizan distintas escalas de evidencias públicas. Las evidencias ausentes no se tratan como cero y OpenGPT no combina fuentes diferentes en una sola puntuación.+
Un punto de partida práctico, no un ganador universalSeleccione dos o tres candidatos para comparar en paralelo los datos públicos.+
Los modelos utilizan distintas escalas de evidencias públicas. Las evidencias ausentes no se tratan como cero y OpenGPT no combina fuentes diferentes en una sola puntuación.
Las afirmaciones sobre la ventana de contexto no demuestran la calidad de la recuperación ni el uso fiel de un documento largo.
La evaluación se abre con esta plantilla de tareas y los dos primeros modelos seleccionados. Puede editar todas las tareas antes de recopilar respuestas.