Agent benchmarks

AssistantBench agent benchmark

OpenGPT keeps 15 published rows attached to the exact AssistantBench benchmark version and environment shown below.

Tasks
33
Published rows
15
Source data date
Identity reviewed
Historical

Evidence scope

HAL verified snapshot · 33 public tasks · 1 scaffold. public, automatically verifiable browsing tasks. Live-web research and browsing tasks reproduced by the Holistic Agent Leaderboard. Source-specific; no normalized step or token limit published.

How OpenGPT handles this evidence

OpenGPT preserves the publisher's metric, task scope, environment, version, configuration fields, and source date. It does not create a cross-benchmark overall Agent score.

Comparison boundaries

  • A higher result applies only to the displayed benchmark version and conditions.
  • Agent results reflect the full system, not the base model alone.
  • Missing cost, reliability, safety, or latency data remains unreported rather than being inferred.
  • HAL reproduced these rows and publishes traces, costs, and run counts. The leaderboard is a historical snapshot: HAL has paused adding new models, and reported costs do not include caching benefits.

HAL verified snapshot · 33 public tasks · 1 scaffold

Showing 15 of 15 published rows. Every result remains attached to the source benchmark and configuration.

  1. Browser-Use · o3 Medium (April 2025)Browser Use · o3 Medium (April 2025)#1Accuracy: 38.81%Browser-Use
  2. Browser-Use · GPT-5 Medium (August 2025)Browser Use · GPT-5 Medium (August 2025)#2Accuracy: 35.23%Browser-Use
  3. Browser-Use · o4-mini Low (April 2025)Browser Use · o4-mini Low (April 2025)#3Accuracy: 28.05%Browser-Use
  4. Browser-Use · o4-mini High (April 2025)Browser Use · o4-mini High (April 2025)#4Accuracy: 23.84%Browser-Use
  5. Browser-Use · GPT-4.1 (April 2025)Browser Use · GPT-4.1 (April 2025)#5Accuracy: 17.39%Browser-Use
  6. Browser-Use · Claude-3.7 Sonnet (February 2025)Browser Use · Claude-3.7 Sonnet (February 2025)#6Accuracy: 16.69%Browser-Use
  7. Browser-Use · Claude Opus 4.1 High (August 2025)Browser Use · Claude Opus 4.1 High (August 2025)#7Accuracy: 13.75%Browser-Use
  8. Browser-Use · Claude-3.7 Sonnet High (February 2025)Browser Use · Claude-3.7 Sonnet High (February 2025)#8Accuracy: 13.08%Browser-Use
  9. Browser-Use · Claude Sonnet 4.5 High (September 2025)Browser Use · Claude Sonnet 4.5 High (September 2025)#9Accuracy: 11.80%Browser-Use
  10. Browser-Use · DeepSeek R1 (May 2025)Browser Use · DeepSeek R1 (May 2025)#10Accuracy: 8.75%Browser-Use
  11. Browser-Use · Claude Opus 4.1 (August 2025)Browser Use · Claude Opus 4.1 (August 2025)#11Accuracy: 7.26%Browser-Use
  12. Browser-Use · Claude Sonnet 4.5 (September 2025)Browser Use · Claude Sonnet 4.5 (September 2025)#12Accuracy: 7.09%Browser-Use
  13. Browser-Use · Gemini 2.0 Flash (February 2025)Browser Use · Gemini 2.0 Flash (February 2025)#13Accuracy: 2.62%Browser-Use
  14. Browser-Use · DeepSeek V3 (March 2025)Browser Use · DeepSeek V3 (March 2025)#14Accuracy: 2.03%Browser-Use
  15. Browser-Use · DeepSeek R1 (January 2025)Browser Use · DeepSeek R1 (January 2025)#15Accuracy: 0.00%Browser-Use