AGENT Benchmarks#

Below is the list of supported AGENT benchmarks. Click on a benchmark name for details.

Benchmark Name

Pretty Name

Task Categories

acebench

ACEBench

Agent, FunctionCalling, MultiTurn

automation_bench

AutomationBench

Agent, FunctionCalling, MultiTurn

bfcl_v3

BFCL-v3

Agent, FunctionCalling

bfcl_v4

BFCL-v4

Agent, FunctionCalling

browsecomp

BrowseComp

Agent, Knowledge, QA

claw_eval

Claw-Eval

Agent, MultiModal, MultiTurn

deep_swe

DeepSWE

Agent, Coding, MultiTurn

deepsearchqa

DeepSearchQA

Agent, Knowledge, QA, Retrieval

gaia

GAIA

Agent, MultiTurn, Reasoning

gdpval

GDPval

Agent, Knowledge, MultiTurn

general_fc

General-FunctionCalling

Agent, Custom, FunctionCalling

job_bench

JobBench

Agent, Knowledge, MultiTurn

k2_verifier

K2-Vendor-Verifier

Agent, FunctionCalling

kimi_verifier

Kimi-Vendor-Verifier

Agent, FunctionCalling

mcp_atlas

MCP-Atlas

Agent, MultiTurn

minimax_verifier

MiniMax-Vendor-Verifier

Agent, FunctionCalling

miniwob

MiniWoB

Agent, FunctionCalling, MultiModal, MultiTurn

officeqa

OfficeQA

Agent, Knowledge, QA

researchrubrics

ResearchRubrics

Agent, MultiTurn, Reasoning, Retrieval

skillsbench

SkillsBench

Agent, MultiTurn

swe_bench_lite_agentic

SWE-bench_Lite_Agentic

Coding

swe_bench_multilingual_agentic

SWE-bench_Multilingual_Agentic

Coding

swe_bench_pro

SWE-bench_Pro

Coding

swe_bench_verified_agentic

SWE-bench_Verified_Agentic

Coding

swe_bench_verified_mini_agentic

SWE-bench_Verified_Mini_Agentic

Coding

tau2_bench

τ²-bench

Agent, FunctionCalling, Reasoning

tau3_bench

τ³-bench

Agent, FunctionCalling, Reasoning

tau_bench

τ-bench

Agent, FunctionCalling, Reasoning

terminal_bench_v2

Terminal-Bench-2.0

Coding

terminal_bench_v2_1

Terminal-Bench-2.1

Coding

toolathlon

Toolathlon Official Service Wrapper

Agent, FunctionCalling, MultiTurn

wide_search

WideSearch

Agent, MultiTurn, Retrieval