Configurazione dell’Agent · GAIA

HAL Generalist Agent · Claude-3.7 Sonnet (February 2025)

L’oggetto classificato: modello, scaffold, strumenti, autorizzazioni, budget e ambiente nel loro insieme.

Accuratezza56.36%
Costo per attività riuscita1,41 USD
Intervallo dei risultati pubblicatiNon pubblicato

01

Configurazione

Sistema AgentHAL Generalist Agent · Claude-3.7 Sonnet (February 2025)
Modello di baseClaude-3.7 Sonnet (February 2025)
ID o etichetta del modello della fonteClaude-3.7 Sonnet (February 2025)
ScaffoldHAL Generalist Agent
Versione dello scaffoldNon indicato
StrumentiNon indicato
AmbienteAttività per assistenti generici che richiedono ragionamento, multimodalità, navigazione e strumenti
BudgetSpecifico della fonte · nessun limite normalizzato di passaggi o token pubblicato

02

Esito

Accuratezza56.36%
Punteggio parzialeNon pubblicato
Costo per attività riuscita1,41 USD
Costo di benchmark indicato130,68 USD
Tempo mediano di completamentoNon pubblicato
Intervento umanoNon pubblicato

03

Operazione

Evidenze delle esecuzioni ripetute1 esecuzioni
Intervallo dei risultati pubblicatiNon pubblicato
Nota sulla sicurezzaNon pubblicato
Gruppo di comparabilitàhal-gaia-public-validation-165
Data della valutazioneNon pubblicato
Dati acquisiti

04

Attendibilità

EvidenzeRecord pubblico completo dell’esecuzione
FonteHolistic Agent Leaderboard · GAIA
Istantanea della fonteIstantanea HAL verificata · set pubblico di convalida · 165 domande
Data dei dati della fonteNon pubblicato dalla fonte
Recuperato da OpenGPT
Ultima modifica della classificaAncora nessuna cronologia comparabile
Ultimo controllo
Attività165 domande pubbliche di convalida
Livello delle evidenzeAvvertenza esterna
Nota sulle evidenze

HAL ha riprodotto queste righe di convalida pubblica e pubblica scaffold, modello, punteggio, costo, conteggio delle esecuzioni e tracce. Considera l’istantanea Storica; non viene pubblicato alcun budget normalizzato di strumenti o passaggi.

Apri l’audit

Cosa non dimostra questo risultato

Questo risultato si applica alle condizioni esatte del sistema e della fonte qui indicate. Non stabilisce quale sia il miglior agente in assoluto, né l’affidabilità in produzione, la governance dei dati o le prestazioni su una versione diversa del benchmark.

Confronta elementi omogenei

Soltanto configurazioni della stessa versione del benchmark e dello stesso ambito di attività possono essere inserite in un unico confronto.

Dati riportati dalla fonte; i valori mancanti rimangono sconosciuti.

Convalida prima dell’adozione

Le classifiche pubbliche creano una rosa di candidati. Una piccola prova privata determina se la configurazione è adatta al tuo lavoro.

  1. 1

    Scegli 10–20 attività rappresentative e definisci una chiara condizione di superamento.

  2. 2

    Fissa Agent, modello, strumenti, autorizzazioni e budget prima del test.

  3. 3

    Esegui più volte ogni attività importante; registra esito positivo, costo, tempo e interventi umani.

  4. 4

    Esamina gli errori e i rischi legati alla gestione dei dati prima di una decisione per la produzione.

Directory e valutazioni degli Agent