Agent-benchmarks
AssistantBench agent-benchmark
OpenGPT houdt 15 gepubliceerde rijen gekoppeld aan de exacte AssistantBench-benchmarkversie en hieronder weergegeven omgeving.
- Taken
- 33
- Gepubliceerde rijen
- 15
- Datum van brongegevens
- Identiteit beoordeeld
- Historisch
Bewijsbereik
HAL verified snapshot · 33 public tasks · 1 scaffold. public, automatically verifiable browsing tasks. Live-web research and browsing tasks reproduced door the Holistic Agent Leaderboard. Source-specific; no normalized step or token limit published.
How OpenGPT handles this evidence
OpenGPT behoudt de meetwaarde, het taakbereik, de omgeving, versie, configuratievelden en brondatum van de uitgever. Het maakt geen algehele Agent-score over benchmarks heen.
Vergelijkingsgrenzen
- Een hoger resultaat geldt alleen voor de weergegeven benchmarkversie en de bijbehorende voorwaarden.
- Agentresultaten weerspiegelen het volledige systeem, niet alleen het basismodel.
- Ontbrekende gegevens over kosten, betrouwbaarheid, veiligheid of latentie worden niet afgeleid maar blijven niet-gerapporteerd.
- HAL heeft deze rijen gereproduceerd en publiceert traces, kosten en aantallen uitvoeringen. De ranglijst is een Historische momentopname: HAL heeft het toevoegen van nieuwe modellen gepauzeerd en de gerapporteerde kosten omvatten geen voordelen van caching.
Door HAL geverifieerde momentopname · 33 openbare taken · 1 scaffold
15 van 15 gepubliceerde rijen weergegeven. Elk resultaat blijft gekoppeld aan de bronbenchmark en configuratie.
- Browser-Use · o3 Medium (April 2025)Browser Use · o3 Medium (April 2025)#1Accuracy: 38.81%Browser-Use
- Browser-Use · GPT-5 Medium (August 2025)Browser Use · GPT-5 Medium (August 2025)#2Accuracy: 35.23%Browser-Use
- Browser-Use · o4-mini Low (April 2025)Browser Use · o4-mini Low (April 2025)#3Accuracy: 28.05%Browser-Use
- Browser-Use · o4-mini High (April 2025)Browser Use · o4-mini High (April 2025)#4Accuracy: 23.84%Browser-Use
- Browser-Use · GPT-4.1 (April 2025)Browser Use · GPT-4.1 (April 2025)#5Accuracy: 17.39%Browser-Use
- Browser-Use · Claude-3.7 Sonnet (February 2025)Browser Use · Claude-3.7 Sonnet (February 2025)#6Accuracy: 16.69%Browser-Use
- Browser-Use · Claude Opus 4.1 High (August 2025)Browser Use · Claude Opus 4.1 High (August 2025)#7Accuracy: 13.75%Browser-Use
- Browser-Use · Claude-3.7 Sonnet High (February 2025)Browser Use · Claude-3.7 Sonnet High (February 2025)#8Accuracy: 13.08%Browser-Use
- Browser-Use · Claude Sonnet 4.5 High (September 2025)Browser Use · Claude Sonnet 4.5 High (September 2025)#9Accuracy: 11.80%Browser-Use
- Browser-Use · DeepSeek R1 (May 2025)Browser Use · DeepSeek R1 (May 2025)#10Accuracy: 8.75%Browser-Use
- Browser-Use · Claude Opus 4.1 (August 2025)Browser Use · Claude Opus 4.1 (August 2025)#11Accuracy: 7.26%Browser-Use
- Browser-Use · Claude Sonnet 4.5 (September 2025)Browser Use · Claude Sonnet 4.5 (September 2025)#12Accuracy: 7.09%Browser-Use
- Browser-Use · Gemini 2.0 Flash (February 2025)Browser Use · Gemini 2.0 Flash (February 2025)#13Accuracy: 2.62%Browser-Use
- Browser-Use · DeepSeek V3 (March 2025)Browser Use · DeepSeek V3 (March 2025)#14Accuracy: 2.03%Browser-Use
- Browser-Use · DeepSeek R1 (January 2025)Browser Use · DeepSeek R1 (January 2025)#15Accuracy: 0.00%Browser-Use