The Coding Leaderboard evaluates LLMs on their software engineering capabilities. From generating production-ready code across major programming languages to designing algorithms, debugging complex functions, and translating scientific concepts into executable scripts, this category measures a model’s ability to handle a broad range of coding and software development tasks.

Scores in this category are compiled from leading coding benchmarks highlighting models that perform well on code generation, debugging, problem-solving, and technical accuracy.

Need more than code generation? Coding performance accounts for 30% of our composite rating. Explore the Overall LLM Ranking to see which top coding models also excel at autonomous agent workflows, advanced mathematics, and complex reasoning.

Last updated: September 26, 2026
Rank Model Name Relative Quality Score
1 Claude Opus 5.5
Quality of Coding 99.88%

99.88
2 GPT-6 Astra
Quality of Coding 93.89%

93.89
3 GPT-5.6 Sol
Quality of Coding 93.37%

93.37
4 ERNIE 5.0
Quality of Coding 90.87%

90.87
5 Claude Fable 5.1
Quality of Coding 90.09%

90.09
6 Claude Fable 5
Quality of Coding 89.81%

89.81
7 GPT-5.6 Terra
Quality of Coding 88.17%

88.17
8 Kimi K3
Quality of Coding 88.05%

88.05
9 Claude Opus 5
Quality of Coding 87.82%

87.82
10 Muse Spark 1.3
Quality of Coding 87.62%

87.62
11 GPT-6 Sol
Quality of Coding 87.48%

87.48
12 GPT-5.5
Quality of Coding 87.44%

87.44
13 ChatGPT-4o
Quality of Coding 87.43%

87.43
14 Qwen3 VL 235B A22B
Quality of Coding 86.83%

86.83
15 MiMo-V2.6-Flash
Quality of Coding 86.51%

86.51
16 GPT-5.6 Luna
Quality of Coding 85.90%

85.90
17 MiMo-V2.6-Pro
Quality of Coding 85.72%

85.72
18 GLM-5.3
Quality of Coding 85.49%

85.49
19 GPT-5.5 Instant
Quality of Coding 85.49%

85.49
20 Mistral
Quality of Coding 85.48%

85.48
21 DeepSeek-V4.1-Flash
Quality of Coding 84.88%

84.88
22 Grok 4.7
Quality of Coding 83.57%

83.57
23 Qwen3.8
Quality of Coding 83.19%

83.19
24 Claude Opus 4.8
Quality of Coding 82.57%

82.57
25 Claude Opus 4.7
Quality of Coding 81.79%

81.79
26 Gemini 3.7 Flash
Quality of Coding 81.78%

81.78
27 Grok 4.6
Quality of Coding 81.72%

81.72
28 GPT-6 Luna
Quality of Coding 81.47%

81.47
29 Gemini 3.8 Flash
Quality of Coding 80.84%

80.84
30 DeepSeek-V4-Pro
Quality of Coding 80.55%

80.55
31 GLM-5.3-Flash
Quality of Coding 80.32%

80.32
32 GLM-5.2
Quality of Coding 80.13%

80.13
33 INTELLECT-3
Quality of Coding 79.79%

79.79
34 GLM-4.6V
Quality of Coding 79.79%

79.79
35 Claude Sonnet 5
Quality of Coding 79.68%

79.68
36 Muse Spark 1.1
Quality of Coding 79.68%

79.68
37 Hy4
Quality of Coding 79.32%

79.32
38 Mistral Small
Quality of Coding 79.19%

79.19
39 Ling-flash-2.0
Quality of Coding 78.89%

78.89
40 Claude Opus 4.6
Quality of Coding 78.52%

78.52
41 GLM-4.5V
Quality of Coding 77.69%

77.69
42 Qwen2.5
Quality of Coding 77.69%

77.69
43 Qwen3.8-Flash-Next
Quality of Coding 77.35%

77.35
44 DeepSeek-V4-Flash
Quality of Coding 77.23%

77.23
45 Muse Spark 1.2
Quality of Coding 77.05%

77.05
46 Grok 4.5
Quality of Coding 76.77%

76.77
47 Kimi K2.6
Quality of Coding 76.46%

76.46
48 Qwen3.7
Quality of Coding 76.33%

76.33
49 Qwen3.8-27B
Quality of Coding 76.11%

76.11
50 Ring-flash-2.0
Quality of Coding 75.90%

75.90
51 Gemini 3.6 Flash
Quality of Coding 75.45%

75.45
52 Gemini 3.5 Flash
Quality of Coding 75.39%

75.39
53 Qwen3.7-Plus
Quality of Coding 75.32%

75.32
54 GPT-5 nano
Quality of Coding 75.00%

75.00
55 Gemini 3.1 Pro
Quality of Coding 74.77%

74.77
56 Olmo 3.1 32B
Quality of Coding 74.55%

74.55
57 Claude Opus 4.5
Quality of Coding 74.32%

74.32
58 Claude Sonnet 4.6
Quality of Coding 73.85%

73.85
59 Muse Spark
Quality of Coding 73.39%

73.39
60 Grok Build 0.1
Quality of Coding 73.24%

73.24
61 Step 5
Quality of Coding 73.22%

73.22
62 Hy3
Quality of Coding 71.92%

71.92
63 MiMo-V2.5-Pro
Quality of Coding 71.76%

71.76
64 Qwen3.6 Plus
Quality of Coding 71.61%

71.61
65 Olmo 3 32B Think
Quality of Coding 71.41%

71.41
66 Seed 2.0 Pro
Quality of Coding 71.40%

71.40
67 GPT-5.4
Quality of Coding 70.91%

70.91
68 MiniMax M3
Quality of Coding 70.88%

70.88
69 Mistral Large
Quality of Coding 70.51%

70.51
70 GPT-5.3 Codex
Quality of Coding 70.03%

70.03
71 GLM-5.1
Quality of Coding 69.73%

69.73
72 Qwen3.6
Quality of Coding 69.05%

69.05
73 DeepSeek V3.1 Terminus
Quality of Coding 69.02%

69.02
74 Olmo 3.1 32B Think
Quality of Coding 68.56%

68.56
75 MiMo-V2-Omni
Quality of Coding 68.42%

68.42
76 Qwen3.6-27B
Quality of Coding 68.29%

68.29
77 Kimi K2.7 Code
Quality of Coding 68.18%

68.18
78 GPT-5.2
Quality of Coding 67.86%

67.86
79 Kimi K2
Quality of Coding 67.78%

67.78
80 GPT-5.4 nano
Quality of Coding 67.68%

67.68
81 GPT-5 mini
Quality of Coding 67.68%

67.68
82 LongCat-Flash
Quality of Coding 67.52%

67.52
83 Seed 2.1 Pro
Quality of Coding 67.23%

67.23
84 Inkling
Quality of Coding 67.17%

67.17
85 Llama 3.1 Nemotron 70B
Quality of Coding 66.62%

66.62
86 Step-3.5-Flash
Quality of Coding 66.28%

66.28
87 GPT-5.4 mini
Quality of Coding 66.13%

66.13
88 Claude Opus 4
Quality of Coding 65.97%

65.97
89 Inkling-Small
Quality of Coding 65.38%

65.38
90 MiMo-V2.5
Quality of Coding 65.35%

65.35
91 Grok 4.3
Quality of Coding 65.15%

65.15
92 MiniMax M2.7
Quality of Coding 64.47%

64.47
93 Granite 4.2 30B
Quality of Coding 64.38%

64.38
94 GLM-5
Quality of Coding 64.30%

64.30
95 MiMo-V2-Pro
Quality of Coding 64.24%

64.24
96 Jamba 1.5 Large
Quality of Coding 64.22%

64.22
97 Gemini 3 Pro
Quality of Coding 64.21%

64.21
98 Qwen3
Quality of Coding 63.98%

63.98
99 Kimi K2.5
Quality of Coding 63.87%

63.87
100 Claude Sonnet 4
Quality of Coding 63.84%

63.84