Towards AITowards AIToneBench

Head-to-head comparisons

The best configuration of each top model family, every pair compared on the same 9 real scripts under the three-judge panel. 28 match-ups.

Claude Opus 5 (max) vs Kimi K3
90.8 vs 89.4
Claude Opus 5 (max) vs GPT-5.6 Sol (ultra)
90.8 vs 88.4
Claude Opus 5 (max) vs Grok 4.5
90.8 vs 85.8
Claude Opus 5 (max) vs DeepSeek V4 Flash 0731
90.8 vs 84.2
Claude Opus 5 (max) vs Qwen3.8 Max
90.8 vs 83.4
Claude Opus 5 (max) vs MiniMax M3
90.8 vs 82.4
Claude Opus 5 (max) vs GLM-5
90.8 vs 82.4
Kimi K3 vs GPT-5.6 Sol (ultra)
89.4 vs 88.4
Kimi K3 vs Grok 4.5
89.4 vs 85.8
Kimi K3 vs DeepSeek V4 Flash 0731
89.4 vs 84.2
Kimi K3 vs Qwen3.8 Max
89.4 vs 83.4
Kimi K3 vs MiniMax M3
89.4 vs 82.4
Kimi K3 vs GLM-5
89.4 vs 82.4
GPT-5.6 Sol (ultra) vs Grok 4.5
88.4 vs 85.8
GPT-5.6 Sol (ultra) vs DeepSeek V4 Flash 0731
88.4 vs 84.2
GPT-5.6 Sol (ultra) vs Qwen3.8 Max
88.4 vs 83.4
GPT-5.6 Sol (ultra) vs MiniMax M3
88.4 vs 82.4
GPT-5.6 Sol (ultra) vs GLM-5
88.4 vs 82.4
Grok 4.5 vs DeepSeek V4 Flash 0731
85.8 vs 84.2
Grok 4.5 vs Qwen3.8 Max
85.8 vs 83.4
Grok 4.5 vs MiniMax M3
85.8 vs 82.4
Grok 4.5 vs GLM-5
85.8 vs 82.4
DeepSeek V4 Flash 0731 vs Qwen3.8 Max
84.2 vs 83.4
DeepSeek V4 Flash 0731 vs MiniMax M3
84.2 vs 82.4
DeepSeek V4 Flash 0731 vs GLM-5
84.2 vs 82.4
Qwen3.8 Max vs MiniMax M3
83.4 vs 82.4
Qwen3.8 Max vs GLM-5
83.4 vs 82.4
MiniMax M3 vs GLM-5
82.4 vs 82.4

Past match-ups

Pairs from earlier boards where a model is no longer a family champion. Kept current with every rebuild.

Claude Fable 5 (max) vs Kimi K3 (thinking)
90.3 vs 89.2
Claude Fable 5 (max) vs GPT-5.6 Sol (high)
90.3 vs 88.4
Claude Fable 5 (max) vs Grok 4.5
90.3 vs 85.8
Claude Fable 5 (max) vs GLM-5
90.3 vs 82.4
Claude Fable 5 (max) vs MiniMax M3
90.3 vs 82.4
Claude Fable 5 (max) vs Qwen3.7 Max (high)
90.3 vs 81.5
Claude Fable 5 (max) vs Gemini 3.1 Pro (default)
90.3 vs 80.2
Kimi K3 (thinking) vs GPT-5.6 Sol (high)
89.2 vs 88.4
Kimi K3 (thinking) vs Grok 4.5
89.2 vs 85.8
Kimi K3 (thinking) vs GLM-5
89.2 vs 82.4
Kimi K3 (thinking) vs MiniMax M3
89.2 vs 82.4
Kimi K3 (thinking) vs Qwen3.7 Max (high)
89.2 vs 81.5
Kimi K3 (thinking) vs Gemini 3.1 Pro (default)
89.2 vs 80.2
GPT-5.6 Sol (high) vs Grok 4.5
88.4 vs 85.8
GPT-5.6 Sol (high) vs GLM-5
88.4 vs 82.4
GPT-5.6 Sol (high) vs MiniMax M3
88.4 vs 82.4
GPT-5.6 Sol (high) vs Qwen3.7 Max (high)
88.4 vs 81.5
GPT-5.6 Sol (high) vs Gemini 3.1 Pro (default)
88.4 vs 80.2
Grok 4.5 vs Qwen3.7 Max (high)
85.8 vs 81.5
Grok 4.5 vs Gemini 3.1 Pro (default)
85.8 vs 80.2
GLM-5 vs MiniMax M3
82.4 vs 82.4
GLM-5 vs Qwen3.7 Max (high)
82.4 vs 81.5
GLM-5 vs Gemini 3.1 Pro (default)
82.4 vs 80.2
MiniMax M3 vs Qwen3.7 Max (high)
82.4 vs 81.5
MiniMax M3 vs Gemini 3.1 Pro (default)
82.4 vs 80.2
Qwen3.7 Max (high) vs Gemini 3.1 Pro (default)
81.5 vs 80.2
Claude Fable 5 (max) vs DeepSeek V4 Pro (xhigh)
90.3 vs 80.5
Kimi K3 (thinking) vs DeepSeek V4 Pro (xhigh)
89.2 vs 80.5
GPT-5.6 Sol (high) vs DeepSeek V4 Pro (xhigh)
88.4 vs 80.5
Grok 4.5 vs DeepSeek V4 Pro (xhigh)
85.8 vs 80.5
GLM-5 vs DeepSeek V4 Pro (xhigh)
82.4 vs 80.5
MiniMax M3 vs DeepSeek V4 Pro (xhigh)
82.4 vs 80.5
Qwen3.7 Max (high) vs DeepSeek V4 Pro (xhigh)
81.5 vs 80.5
Claude Opus 5 (max) vs Kimi K3 (thinking)
90.8 vs 89.2
Claude Opus 5 (max) vs GPT-5.6 Sol (high)
90.8 vs 88.4
Claude Opus 5 (max) vs Gemini 3.1 Pro (default)
90.8 vs 80.2
Claude Opus 5 (max) vs Qwen3.7 Max (default)
90.8 vs 81.7
Claude Opus 5 (max) vs Qwen3.7 Max (high)
90.8 vs 81.5
Claude Opus 5 (max) vs DeepSeek V4 Pro (xhigh)
90.8 vs 80.5
Kimi K3 vs GPT-5.6 Sol (high)
89.4 vs 88.4
Kimi K3 vs Qwen3.7 Max (high)
89.4 vs 81.5
Kimi K3 vs Gemini 3.1 Pro (default)
89.4 vs 80.2
Kimi K3 (thinking) vs Qwen3.7 Max (default)
89.2 vs 81.7
GPT-5.6 Sol (high) vs Qwen3.7 Max (default)
88.4 vs 81.7
Grok 4.5 vs Qwen3.7 Max (default)
85.8 vs 81.7
GLM-5 vs Qwen3.7 Max (default)
82.4 vs 81.7
MiniMax M3 vs Qwen3.7 Max (default)
82.4 vs 81.7
Qwen3.7 Max (default) vs DeepSeek V4 Pro (xhigh)
81.7 vs 80.5
GPT-5.6 Sol (ultra) vs Kimi K3 (thinking)
88.4 vs 89.2
Kimi K3 (thinking) vs Qwen3.8 Max
89.2 vs 83.4
Kimi K3 (thinking) vs DeepSeek V4 Flash 0731
89.2 vs 84.2
Qwen3.8 Max vs DeepSeek V4 Flash 0731
83.4 vs 84.2
Kimi K3 (thinking) vs GPT-5.6 Sol (ultra)
89.2 vs 88.4
← Back to the leaderboard