Agent benchmarks
AssistantBench agent benchmark
OpenGPT keeps 15 published rows attached to the exact AssistantBench benchmark version and environment shown below.
- Tasks
- 33
- Published rows
- 15
- Source data date
- Identity reviewed
- Historical
Evidence scope
HAL verified snapshot · 33 public tasks · 1 scaffold. public, automatically verifiable browsing tasks. Live-web research and browsing tasks reproduced by the Holistic Agent Leaderboard. Source-specific; no normalized step or token limit published.
How OpenGPT handles this evidence
OpenGPT preserves the publisher's metric, task scope, environment, version, configuration fields, and source date. It does not create a cross-benchmark overall Agent score.
Comparison boundaries
- A higher result applies only to the displayed benchmark version and conditions.
- Agent results reflect the full system, not the base model alone.
- Missing cost, reliability, safety, or latency data remains unreported rather than being inferred.
- HAL reproduced these rows and publishes traces, costs, and run counts. The leaderboard is a historical snapshot: HAL has paused adding new models, and reported costs do not include caching benefits.
HAL verified snapshot · 33 public tasks · 1 scaffold
Showing 15 of 15 published rows. Every result remains attached to the source benchmark and configuration.
- Browser-Use · o3 Medium (April 2025)Browser Use · o3 Medium (April 2025)#1Accuracy: 38.81%Browser-Use
- Browser-Use · GPT-5 Medium (August 2025)Browser Use · GPT-5 Medium (August 2025)#2Accuracy: 35.23%Browser-Use
- Browser-Use · o4-mini Low (April 2025)Browser Use · o4-mini Low (April 2025)#3Accuracy: 28.05%Browser-Use
- Browser-Use · o4-mini High (April 2025)Browser Use · o4-mini High (April 2025)#4Accuracy: 23.84%Browser-Use
- Browser-Use · GPT-4.1 (April 2025)Browser Use · GPT-4.1 (April 2025)#5Accuracy: 17.39%Browser-Use
- Browser-Use · Claude-3.7 Sonnet (February 2025)Browser Use · Claude-3.7 Sonnet (February 2025)#6Accuracy: 16.69%Browser-Use
- Browser-Use · Claude Opus 4.1 High (August 2025)Browser Use · Claude Opus 4.1 High (August 2025)#7Accuracy: 13.75%Browser-Use
- Browser-Use · Claude-3.7 Sonnet High (February 2025)Browser Use · Claude-3.7 Sonnet High (February 2025)#8Accuracy: 13.08%Browser-Use
- Browser-Use · Claude Sonnet 4.5 High (September 2025)Browser Use · Claude Sonnet 4.5 High (September 2025)#9Accuracy: 11.80%Browser-Use
- Browser-Use · DeepSeek R1 (May 2025)Browser Use · DeepSeek R1 (May 2025)#10Accuracy: 8.75%Browser-Use
- Browser-Use · Claude Opus 4.1 (August 2025)Browser Use · Claude Opus 4.1 (August 2025)#11Accuracy: 7.26%Browser-Use
- Browser-Use · Claude Sonnet 4.5 (September 2025)Browser Use · Claude Sonnet 4.5 (September 2025)#12Accuracy: 7.09%Browser-Use
- Browser-Use · Gemini 2.0 Flash (February 2025)Browser Use · Gemini 2.0 Flash (February 2025)#13Accuracy: 2.62%Browser-Use
- Browser-Use · DeepSeek V3 (March 2025)Browser Use · DeepSeek V3 (March 2025)#14Accuracy: 2.03%Browser-Use
- Browser-Use · DeepSeek R1 (January 2025)Browser Use · DeepSeek R1 (January 2025)#15Accuracy: 0.00%Browser-Use