The Reasoning Leaderboard shows how AI models able to handle complex logical and analytical tasks. It measures deep logical deduction, counterfactual reasoning, scientific problem-solving, and consistency across long, multi-turn interactions. These benchmarks are especially relevant for tasks that require more than simple information retrieval or pattern recognition.

Our composite score aggregates several leading reasoning benchmarks. Together, they highlight the models that perform best on complex reasoning, scientific analysis, and multi-step problem-solving.

Looking for the full picture? Reasoning accounts for 30% of the overall evaluation. Visit the Overall LLM Ranking to see how top reasoning models perform across coding, mathematics, and autonomous agent tasks.

Last updated: September 26, 2026
Rank Model Name Relative Quality Score
1 Claude Opus 5.5
Quality of Reasoning 99.82%

99.82
2 GPT-6 Astra
Quality of Reasoning 97.58%

97.58
3 Claude Fable 5.1
Quality of Reasoning 95.97%

95.97
4 Claude Fable 5
Quality of Reasoning 95.24%

95.24
5 Claude Opus 5
Quality of Reasoning 95.14%

95.14
6 GPT-5.6 Sol
Quality of Reasoning 93.82%

93.82
7 Kimi K3
Quality of Reasoning 92.94%

92.94
8 Muse Spark 1.3
Quality of Reasoning 92.81%

92.81
9 Claude Opus 4.8
Quality of Reasoning 92.12%

92.12
10 Gemini 3.8 Flash
Quality of Reasoning 91.38%

91.38
11 Gemini 3.7 Flash
Quality of Reasoning 90.72%

90.72
12 Muse Spark 1.1
Quality of Reasoning 90.59%

90.59
13 GPT-5.5
Quality of Reasoning 90.56%

90.56
14 Qwen3.8
Quality of Reasoning 90.45%

90.45
15 Hy4
Quality of Reasoning 90.38%

90.38
16 GPT-5.6 Terra
Quality of Reasoning 89.68%

89.68
17 GLM-5.3
Quality of Reasoning 89.56%

89.56
18 GPT-6 Sol
Quality of Reasoning 89.44%

89.44
19 Gemini 3.1 Pro
Quality of Reasoning 89.04%

89.04
20 Claude Opus 4.7
Quality of Reasoning 88.94%

88.94
21 Grok 4.6
Quality of Reasoning 88.90%

88.90
22 Claude Opus 4.6
Quality of Reasoning 88.60%

88.60
23 DeepSeek-V4-Pro
Quality of Reasoning 88.58%

88.58
24 Claude Sonnet 5
Quality of Reasoning 88.04%

88.04
25 GPT-5.4
Quality of Reasoning 87.79%

87.79
26 Grok 4.5
Quality of Reasoning 87.11%

87.11
27 Qwen3.7
Quality of Reasoning 86.97%

86.97
28 Gemini 3.5 Flash
Quality of Reasoning 86.16%

86.16
29 DeepSeek-V4.1-Flash
Quality of Reasoning 86.09%

86.09
30 Seed 2.1 Pro
Quality of Reasoning 86.00%

86.00
31 Qwen3.8-Flash-Next
Quality of Reasoning 85.92%

85.92
32 GLM-5.3-Flash
Quality of Reasoning 85.86%

85.86
33 Muse Spark 1.2
Quality of Reasoning 85.52%

85.52
34 Gemini 3.6 Flash
Quality of Reasoning 85.42%

85.42
35 MiMo-V2.6-Pro
Quality of Reasoning 85.03%

85.03
36 MiMo-V2.6-Flash
Quality of Reasoning 85.01%

85.01
37 GPT-5.6 Luna
Quality of Reasoning 84.94%

84.94
38 GLM-5.2
Quality of Reasoning 84.63%

84.63
39 GPT-5.2
Quality of Reasoning 84.36%

84.36
40 DeepSeek-V4-Flash
Quality of Reasoning 84.30%

84.30
41 Muse Spark
Quality of Reasoning 83.38%

83.38
42 Kimi K2.6
Quality of Reasoning 83.30%

83.30
43 Gemini 3 Pro
Quality of Reasoning 82.94%

82.94
44 GPT-6 Luna
Quality of Reasoning 82.31%

82.31
45 Qwen3.8-27B
Quality of Reasoning 82.27%

82.27
46 Qwen3.7-Plus
Quality of Reasoning 81.87%

81.87
47 MiniMax M3
Quality of Reasoning 81.75%

81.75
48 Claude Sonnet 4.6
Quality of Reasoning 81.69%

81.69
49 Seed 2.0 Pro
Quality of Reasoning 81.69%

81.69
50 Gemini 3 Flash
Quality of Reasoning 80.71%

80.71
51 Qwen3.6
Quality of Reasoning 80.59%

80.59
52 Claude Opus 4.5
Quality of Reasoning 80.54%

80.54
53 Hy3
Quality of Reasoning 80.36%

80.36
54 Grok 4.7
Quality of Reasoning 79.60%

79.60
55 Grok Build 0.1
Quality of Reasoning 79.02%

79.02
56 GLM-5.1
Quality of Reasoning 78.30%

78.30
57 LongCat-Flash
Quality of Reasoning 77.91%

77.91
58 Qwen3.6 Plus
Quality of Reasoning 77.90%

77.90
59 Inkling
Quality of Reasoning 77.90%

77.90
60 Kimi K2.5
Quality of Reasoning 77.45%

77.45
61 GPT-5.3 Codex
Quality of Reasoning 77.17%

77.17
62 Qwen3.5-397B-A17B
Quality of Reasoning 77.05%

77.05
63 MiMo-V2-Pro
Quality of Reasoning 77.01%

77.01
64 Inkling-Small
Quality of Reasoning 76.35%

76.35
65 Kimi K2.7 Code
Quality of Reasoning 76.20%

76.20
66 GLM-5
Quality of Reasoning 75.85%

75.85
67 GPT-5.1
Quality of Reasoning 75.81%

75.81
68 GPT-5.2 Codex
Quality of Reasoning 75.30%

75.30
69 Step 5
Quality of Reasoning 75.00%

75.00
70 GPT-5.4 mini
Quality of Reasoning 74.55%

74.55
71 MiMo-V2.5
Quality of Reasoning 74.13%

74.13
72 GLM-4.7
Quality of Reasoning 74.01%

74.01
73 MiniMax M2.7
Quality of Reasoning 74.00%

74.00
74 Qwen3
Quality of Reasoning 73.76%

73.76
75 MiMo-V2.5-Pro
Quality of Reasoning 73.73%

73.73
76 GPT-5
Quality of Reasoning 73.72%

73.72
77 Grok 4.3
Quality of Reasoning 73.20%

73.20
78 Gemma 4 31B
Quality of Reasoning 73.19%

73.19
79 ChatGPT-4o
Quality of Reasoning 72.77%

72.77
80 Muse Glimmer
Quality of Reasoning 72.26%

72.26
81 GPT-5.4 nano
Quality of Reasoning 72.20%

72.20
82 Qwen3.5-122B-A10B
Quality of Reasoning 72.14%

72.14
83 GPT-5.5 Instant
Quality of Reasoning 72.11%

72.11
84 Kimi K2
Quality of Reasoning 71.75%

71.75
85 Grok-4
Quality of Reasoning 71.72%

71.72
86 Qwen3.5-27B
Quality of Reasoning 71.24%

71.24
87 DeepSeek-V3.2
Quality of Reasoning 71.12%

71.12
88 KAT-Coder-Pro V2
Quality of Reasoning 71.10%

71.10
89 Step-3.5-Flash
Quality of Reasoning 70.87%

70.87
90 Grok-4.20
Quality of Reasoning 70.35%

70.35
91 MiniMax M2.5
Quality of Reasoning 70.28%

70.28
92 Claude Sonnet 4.5
Quality of Reasoning 70.27%

70.27
93 Grok 4.1 Fast
Quality of Reasoning 70.03%

70.03
94 GPT-4.5
Quality of Reasoning 69.84%

69.84
95 Grok-4.1
Quality of Reasoning 69.46%

69.46
96 MiMo-V2-Omni
Quality of Reasoning 69.04%

69.04
97 Gemini 2.5 Pro
Quality of Reasoning 68.85%

68.85
98 Solar Pro 4
Quality of Reasoning 68.77%

68.77
99 MiniMax M2.1
Quality of Reasoning 68.16%

68.16
100 Qwen3.6-27B
Quality of Reasoning 68.15%

68.15