The Agents Leaderboard ranks large language models by their ability to act as autonomous problem-solvers rather than simply generate responses. Unlike standard text-generation evaluations, agentic benchmarks test whether a model can independently break down complex goals, execute shell commands in terminal environments, invoke external APIs, interpret tool outputs, and recover from runtime errors.

Drawing on evaluations agent-focused benchmarks this leaderboard highlights models capable of handling complex, multi-step tasks across developer and enterprise workflows.

Looking for well-rounded performance? Agentic capabilities account for 20% of the composite evaluation. Check the Overall LLM Ranking to see how top agentic models perform across coding, mathematics, and complex reasoning.

Last updated: September 26, 2026
Rank Model Name Relative Quality Score
1 Claude Fable 5.1
Quality of Agents 92.88%

92.88
2 Claude Opus 5.5
Quality of Agents 92.76%

92.76
3 GPT-6 Astra
Quality of Agents 88.23%

88.23
4 Claude Opus 5
Quality of Agents 86.55%

86.55
5 MiMo-V2.6-Pro
Quality of Agents 85.49%

85.49
6 DeepSeek-V4.1-Flash
Quality of Agents 85.02%

85.02
7 Claude Fable 5
Quality of Agents 83.92%

83.92
8 DeepSeek-V4-Flash
Quality of Agents 80.28%

80.28
9 GPT-5.6 Sol
Quality of Agents 79.44%

79.44
10 Muse Spark 1.3
Quality of Agents 79.00%

79.00
11 Kimi K3
Quality of Agents 78.45%

78.45
12 MiMo-V2.6-Flash
Quality of Agents 77.89%

77.89
13 Qwen3.8
Quality of Agents 76.67%

76.67
14 GLM-5.3
Quality of Agents 75.98%

75.98
15 Seed 2.1 Pro
Quality of Agents 75.65%

75.65
16 Hy4
Quality of Agents 75.32%

75.32
17 Claude Opus 4.8
Quality of Agents 75.17%

75.17
18 GPT-6 Sol
Quality of Agents 74.53%

74.53
19 Claude Sonnet 5
Quality of Agents 73.62%

73.62
20 DeepSeek-V4-Pro
Quality of Agents 73.00%

73.00
21 Grok 4.7
Quality of Agents 72.78%

72.78
22 Gemini 3.8 Flash
Quality of Agents 72.72%

72.72
23 GPT-5.5
Quality of Agents 71.50%

71.50
24 Grok 4.6
Quality of Agents 70.91%

70.91
25 Ling 3.0 Flash Fin
Quality of Agents 70.81%

70.81
26 GPT-5.6 Terra
Quality of Agents 70.47%

70.47
27 Claude Opus 4.7
Quality of Agents 70.01%

70.01
28 Qwen3.8-Flash-Next
Quality of Agents 69.78%

69.78
29 GLM-5.3-Flash
Quality of Agents 69.61%

69.61
30 GLM-5.2
Quality of Agents 68.85%

68.85
31 Grok 4.5
Quality of Agents 67.86%

67.86
32 Gemini 3.5 Flash
Quality of Agents 67.36%

67.36
33 Qwen3.8-27B
Quality of Agents 66.37%

66.37
34 Gemini 3.7 Flash
Quality of Agents 66.33%

66.33
35 GPT-6 Luna
Quality of Agents 66.24%

66.24
36 Claude Opus 4.6
Quality of Agents 66.15%

66.15
37 Muse Spark 1.1
Quality of Agents 64.05%

64.05
38 Kimi K2.6
Quality of Agents 63.84%

63.84
39 GPT-5.4
Quality of Agents 63.54%

63.54
40 Kimi K2.7 Code
Quality of Agents 63.33%

63.33
41 GPT-5.6 Luna
Quality of Agents 62.55%

62.55
42 GLM-5.1
Quality of Agents 62.35%

62.35
43 Muse Spark 1.2
Quality of Agents 60.41%

60.41
44 GPT-5.3 Codex
Quality of Agents 59.93%

59.93
45 Grok Build 0.1
Quality of Agents 59.25%

59.25
46 Claude Sonnet 4.6
Quality of Agents 58.99%

58.99
47 GPT-5.2 Codex
Quality of Agents 58.81%

58.81
48 MiMo-V2.5
Quality of Agents 57.51%

57.51
49 GPT-5.2
Quality of Agents 55.68%

55.68
50 Qwen3.5-397B-A17B
Quality of Agents 55.27%

55.27
51 Qwen3.6 Plus
Quality of Agents 54.93%

54.93
52 GLM-5
Quality of Agents 54.58%

54.58
53 Qwen3.7
Quality of Agents 54.52%

54.52
54 Ling 3.0 Flash
Quality of Agents 54.23%

54.23
55 GPT-5.4 mini
Quality of Agents 54.00%

54.00
56 GLM-5V-Turbo
Quality of Agents 53.89%

53.89
57 Gemini 3.5 Flash-Lite
Quality of Agents 52.88%

52.88
58 Kimi K2.5
Quality of Agents 52.16%

52.16
59 MiniMax M2.1
Quality of Agents 51.81%

51.81
60 Gemini 3 Flash
Quality of Agents 51.47%

51.47
61 Claude Opus 4.5
Quality of Agents 51.24%

51.24
62 Gemini 3.6 Flash
Quality of Agents 50.43%

50.43
63 MiMo-V2-Pro
Quality of Agents 50.43%

50.43
64 Claude Sonnet 4.5
Quality of Agents 50.43%

50.43
65 MiniMax M2.5
Quality of Agents 50.26%

50.26
66 GPT-5.4 nano
Quality of Agents 50.05%

50.05
67 Hy3
Quality of Agents 49.85%

49.85
68 Seed 2.0 Pro
Quality of Agents 49.74%

49.74
69 Qwen3.6-27B
Quality of Agents 49.69%

49.69
70 Gemini 3.1 Pro
Quality of Agents 49.10%

49.10
71 MiniMax M3
Quality of Agents 49.05%

49.05
72 Kimi K2
Quality of Agents 48.36%

48.36
73 MiniMax M2.7
Quality of Agents 48.01%

48.01
74 Qwen3.5-122B-A10B
Quality of Agents 47.50%

47.50
75 Gemini 3 Pro
Quality of Agents 47.15%

47.15
76 Step-3.5-Flash
Quality of Agents 47.15%

47.15
77 MiMo-V2.5-Pro
Quality of Agents 46.00%

46.00
78 Qwen3.5-27B
Quality of Agents 45.94%

45.94
79 Muse Spark
Quality of Agents 45.42%

45.42
80 Qwen3.7-Plus
Quality of Agents 45.36%

45.36
81 Gemma 4 31B
Quality of Agents 44.21%

44.21
82 Inkling
Quality of Agents 44.16%

44.16
83 Claude Haiku 4.5
Quality of Agents 44.04%

44.04
84 Step 3.7 Flash
Quality of Agents 43.70%

43.70
85 Qwen3 VL 235B A22B
Quality of Agents 43.35%

43.35
86 LongCat-Flash
Quality of Agents 43.18%

43.18
87 Claude Opus 4.1
Quality of Agents 43.01%

43.01
88 Qwen3 VL 32B
Quality of Agents 43.01%

43.01
89 Gemma 4 26B-A4B
Quality of Agents 42.49%

42.49
90 Qwen3.5-35B-A3B
Quality of Agents 42.14%

42.14
91 Qwen3-Next-80B-A3B
Quality of Agents 41.80%

41.80
92 DeepSeek-V3.2
Quality of Agents 41.62%

41.62
93 Qwen3.6-35B-A3B
Quality of Agents 41.11%

41.11
94 Qwen3 235B A22B
Quality of Agents 40.41%

40.41
95 Inkling-Small
Quality of Agents 39.79%

39.79
96 DeepSeek-V3.2-Speciale
Quality of Agents 39.55%

39.55
97 Gemini 3.1 Flash-Lite
Quality of Agents 39.21%

39.21
98 GPT-5.1 Codex
Quality of Agents 38.69%

38.69
99 Nova Pro
Quality of Agents 38.34%

38.34
100 Qwen3
Quality of Agents 38.17%

38.17