The Agents Leaderboard ranks large language models by their ability to act as autonomous problem-solvers rather than simply generate responses. Unlike standard text-generation evaluations, agentic benchmarks test whether a model can independently break down complex goals, execute shell commands in terminal environments, invoke external APIs, interpret tool outputs, and recover from runtime errors.
Drawing on evaluations agent-focused benchmarks this leaderboard highlights models capable of handling complex, multi-step tasks across developer and enterprise workflows.
Looking for well-rounded performance? Agentic capabilities account for 20% of the composite evaluation. Check the Overall LLM Ranking to see how top agentic models perform across coding, mathematics, and complex reasoning.
| Rank | Model Name | Relative Quality | Score |
|---|---|---|---|
| 1 | Claude Fable 5.1 |
|
92.88 |
| 2 | Claude Opus 5.5 |
|
92.76 |
| 3 | GPT-6 Astra |
|
88.23 |
| 4 | Claude Opus 5 |
|
86.55 |
| 5 | MiMo-V2.6-Pro |
|
85.49 |
| 6 | DeepSeek-V4.1-Flash |
|
85.02 |
| 7 | Claude Fable 5 |
|
83.92 |
| 8 | DeepSeek-V4-Flash |
|
80.28 |
| 9 | GPT-5.6 Sol |
|
79.44 |
| 10 | Muse Spark 1.3 |
|
79.00 |
| 11 | Kimi K3 |
|
78.45 |
| 12 | MiMo-V2.6-Flash |
|
77.89 |
| 13 | Qwen3.8 |
|
76.67 |
| 14 | GLM-5.3 |
|
75.98 |
| 15 | Seed 2.1 Pro |
|
75.65 |
| 16 | Hy4 |
|
75.32 |
| 17 | Claude Opus 4.8 |
|
75.17 |
| 18 | GPT-6 Sol |
|
74.53 |
| 19 | Claude Sonnet 5 |
|
73.62 |
| 20 | DeepSeek-V4-Pro |
|
73.00 |
| 21 | Grok 4.7 |
|
72.78 |
| 22 | Gemini 3.8 Flash |
|
72.72 |
| 23 | GPT-5.5 |
|
71.50 |
| 24 | Grok 4.6 |
|
70.91 |
| 25 | Ling 3.0 Flash Fin |
|
70.81 |
| 26 | GPT-5.6 Terra |
|
70.47 |
| 27 | Claude Opus 4.7 |
|
70.01 |
| 28 | Qwen3.8-Flash-Next |
|
69.78 |
| 29 | GLM-5.3-Flash |
|
69.61 |
| 30 | GLM-5.2 |
|
68.85 |
| 31 | Grok 4.5 |
|
67.86 |
| 32 | Gemini 3.5 Flash |
|
67.36 |
| 33 | Qwen3.8-27B |
|
66.37 |
| 34 | Gemini 3.7 Flash |
|
66.33 |
| 35 | GPT-6 Luna |
|
66.24 |
| 36 | Claude Opus 4.6 |
|
66.15 |
| 37 | Muse Spark 1.1 |
|
64.05 |
| 38 | Kimi K2.6 |
|
63.84 |
| 39 | GPT-5.4 |
|
63.54 |
| 40 | Kimi K2.7 Code |
|
63.33 |
| 41 | GPT-5.6 Luna |
|
62.55 |
| 42 | GLM-5.1 |
|
62.35 |
| 43 | Muse Spark 1.2 |
|
60.41 |
| 44 | GPT-5.3 Codex |
|
59.93 |
| 45 | Grok Build 0.1 |
|
59.25 |
| 46 | Claude Sonnet 4.6 |
|
58.99 |
| 47 | GPT-5.2 Codex |
|
58.81 |
| 48 | MiMo-V2.5 |
|
57.51 |
| 49 | GPT-5.2 |
|
55.68 |
| 50 | Qwen3.5-397B-A17B |
|
55.27 |
| 51 | Qwen3.6 Plus |
|
54.93 |
| 52 | GLM-5 |
|
54.58 |
| 53 | Qwen3.7 |
|
54.52 |
| 54 | Ling 3.0 Flash |
|
54.23 |
| 55 | GPT-5.4 mini |
|
54.00 |
| 56 | GLM-5V-Turbo |
|
53.89 |
| 57 | Gemini 3.5 Flash-Lite |
|
52.88 |
| 58 | Kimi K2.5 |
|
52.16 |
| 59 | MiniMax M2.1 |
|
51.81 |
| 60 | Gemini 3 Flash |
|
51.47 |
| 61 | Claude Opus 4.5 |
|
51.24 |
| 62 | Gemini 3.6 Flash |
|
50.43 |
| 63 | MiMo-V2-Pro |
|
50.43 |
| 64 | Claude Sonnet 4.5 |
|
50.43 |
| 65 | MiniMax M2.5 |
|
50.26 |
| 66 | GPT-5.4 nano |
|
50.05 |
| 67 | Hy3 |
|
49.85 |
| 68 | Seed 2.0 Pro |
|
49.74 |
| 69 | Qwen3.6-27B |
|
49.69 |
| 70 | Gemini 3.1 Pro |
|
49.10 |
| 71 | MiniMax M3 |
|
49.05 |
| 72 | Kimi K2 |
|
48.36 |
| 73 | MiniMax M2.7 |
|
48.01 |
| 74 | Qwen3.5-122B-A10B |
|
47.50 |
| 75 | Gemini 3 Pro |
|
47.15 |
| 76 | Step-3.5-Flash |
|
47.15 |
| 77 | MiMo-V2.5-Pro |
|
46.00 |
| 78 | Qwen3.5-27B |
|
45.94 |
| 79 | Muse Spark |
|
45.42 |
| 80 | Qwen3.7-Plus |
|
45.36 |
| 81 | Gemma 4 31B |
|
44.21 |
| 82 | Inkling |
|
44.16 |
| 83 | Claude Haiku 4.5 |
|
44.04 |
| 84 | Step 3.7 Flash |
|
43.70 |
| 85 | Qwen3 VL 235B A22B |
|
43.35 |
| 86 | LongCat-Flash |
|
43.18 |
| 87 | Claude Opus 4.1 |
|
43.01 |
| 88 | Qwen3 VL 32B |
|
43.01 |
| 89 | Gemma 4 26B-A4B |
|
42.49 |
| 90 | Qwen3.5-35B-A3B |
|
42.14 |
| 91 | Qwen3-Next-80B-A3B |
|
41.80 |
| 92 | DeepSeek-V3.2 |
|
41.62 |
| 93 | Qwen3.6-35B-A3B |
|
41.11 |
| 94 | Qwen3 235B A22B |
|
40.41 |
| 95 | Inkling-Small |
|
39.79 |
| 96 | DeepSeek-V3.2-Speciale |
|
39.55 |
| 97 | Gemini 3.1 Flash-Lite |
|
39.21 |
| 98 | GPT-5.1 Codex |
|
38.69 |
| 99 | Nova Pro |
|
38.34 |
| 100 | Qwen3 |
|
38.17 |