Towards AITowards AIToneBench

All models

130 configurations tracked; 130 with complete 9-task coverage; 130 with current ranks.

Claude Opus 5 (max effort)
Anthropic · closed
#1
2649Elo90.8overall$0.12/task
Open scorecard →
Claude Fable 5 (max effort + 4.8 fallback)
Anthropic · closed
#2
2575Elo90.3overall$0.908/task
Open scorecard →
Claude Opus 5 (xhigh)
Anthropic · closed
#3
2568Elo90.3overall$0.117/task
Open scorecard →
Claude Opus 5 (high)
Anthropic · closed
#4
2542Elo90.0overall$0.117/task
Open scorecard →
Claude Opus 5 (adaptive default)
Anthropic · closed
#5
2491Elo89.7overall$0.117/task
Open scorecard →
Claude Fable 5 (xhigh)
Anthropic · closed
#6
2451Elo89.3overall$0.545/task
Open scorecard →
Claude Fable 5 (high)
Anthropic · closed
#7
2441Elo89.2overall$0.319/task
Open scorecard →
K
Kimi K3
Moonshot (Kimi) · open
#8
2438Elo89.4overall$0.263/task
Open scorecard →
Claude Opus 5 (medium)
Anthropic · closed
#9
2435Elo89.4overall$0.117/task
Open scorecard →
Claude Fable 5 (adaptive default)
Anthropic · closed
#10
2430Elo89.2overall$0.323/task
Open scorecard →
Claude Opus 5 (low)
Anthropic · closed
#11
2421Elo89.2overall$0.115/task
Open scorecard →
K
Kimi K3 (thinking)
Moonshot (Kimi) · open
#12
2416Elo89.2overall$0.187/task
Open scorecard →
Claude Fable 5 (medium)
Anthropic · closed
#13
2398Elo88.8overall$0.31/task
Open scorecard →
Claude Opus 4.8 (max effort)
Anthropic · closed
#14
2361Elo88.5overall$0.435/task
Open scorecard →
Claude Fable 5 (low)
Anthropic · closed
#15
2361Elo88.6overall$0.301/task
Open scorecard →
GPT-5.6 Sol (ultra)
OpenAI · closed
#16
2316Elo88.4overall$0.137/task
Open scorecard →
GPT-5.6 Sol (high)
OpenAI · closed
#17
2315Elo88.4overall$0.163/task
Open scorecard →
GPT-5.6 Sol (xhigh)
OpenAI · closed
#18
2276Elo87.9overall$0.256/task
Open scorecard →
GPT-5.6 Sol (default)
OpenAI · closed
#19
2271Elo87.8overall$0.152/task
Open scorecard →
GPT-5.6 Sol (low)
OpenAI · closed
#20
2249Elo87.7overall$0.149/task
Open scorecard →
GPT-5.4 (xhigh)
OpenAI · closed
#21
2202Elo87.5overall$0.279/task
Open scorecard →
GPT-5.6 Terra (ultra)
OpenAI · closed
#22
2186Elo87.2overall$0.065/task
Open scorecard →
GPT-5.6 Sol (none)
OpenAI · closed
#23
2164Elo87.2overall$0.15/task
Open scorecard →
Claude Sonnet 5 (max effort)
Anthropic · closed
#24
2137Elo86.1overall$0.707/task
Open scorecard →
Claude Opus 4.8 (default)
Anthropic · closed
#25
2123Elo86.7overall$0.15/task
Open scorecard →
GPT-5.6 Terra (xhigh)
OpenAI · closed
#26
2110Elo86.6overall$0.104/task
Open scorecard →
GPT-5.6 Terra (default)
OpenAI · closed
#27
2094Elo86.4overall$0.074/task
Open scorecard →
Claude Opus 4.7
Anthropic · closed
#28
2064Elo86.0overall$0.149/task
Open scorecard →
GPT-5.6 Terra (none)
OpenAI · closed
#29
2058Elo86.3overall$0.072/task
Open scorecard →
Grok 4.5
xAI · closed
#30
2042Elo85.8overall$0.038/task
Open scorecard →
GPT-5.6 Terra (high)
OpenAI · closed
#31
2016Elo85.7overall$0.077/task
Open scorecard →
GPT-5.6 Terra (low)
OpenAI · closed
#32
2012Elo85.9overall$0.075/task
Open scorecard →
GPT-5.5 (xhigh)
OpenAI · closed
#33
1969Elo85.4overall$0.309/task
Open scorecard →
ds
DeepSeek V4 Flash 0731
DeepSeek · open
#34
1955Elo84.2overall$0.005/task
Open scorecard →
Claude Sonnet 5 (default)
Anthropic · closed
#35
1940Elo85.0overall$0.06/task
Open scorecard →
Claude Opus 4.6
Anthropic · closed
#36
1935Elo84.6overall$0.122/task
Open scorecard →
GPT-5.6 Luna (ultra)
OpenAI · closed
#37
1923Elo84.8overall$0.028/task
Open scorecard →
Qwen3.8 Max
Alibaba (Qwen) · closed
#38
1866Elo83.4overall$0.15/task
Open scorecard →
GPT-5.6 Luna (xhigh)
OpenAI · closed
#39
1844Elo83.8overall$0.05/task
Open scorecard →
K
Kimi K2.6 (thinking)
Moonshot (Kimi) · open
#40
1843Elo83.4overall$0.051/task
Open scorecard →
Claude Sonnet 4.6
Anthropic · closed
#41
1828Elo83.5overall$0.072/task
Open scorecard →
MiniMax M3
MiniMax · open
#42
1790Elo82.4overall$0.019 (estimated)/task
Open scorecard →
Z
GLM-5
Zhipu (GLM) · open
#43
1783Elo82.4overall$0.023/task
Open scorecard →
GPT-5.5 (high)
OpenAI · closed
#44
1779Elo83.3overall$0.185/task
Open scorecard →
Z
GLM-5.2
Zhipu (GLM) · open
#45
1764Elo83.0overall$0.022/task
Open scorecard →
GPT-5.4 mini (high)
OpenAI · closed
#46
1755Elo82.8overall$0.047/task
Open scorecard →
GPT-5.4
OpenAI · closed
#47
1729Elo82.5overall$0.078/task
Open scorecard →
K
Kimi K2.6
Moonshot (Kimi) · open
#48
1708Elo81.8overall$0.052/task
Open scorecard →
GPT-5.6 Luna (default)
OpenAI · closed
#49
1702Elo82.0overall$0.031/task
Open scorecard →
Qwen3.7 Max (default)
Alibaba (Qwen) · closed
#50
1699Elo81.7overall$0.054/task
Open scorecard →
GPT-5.6 Luna (high)
OpenAI · closed
#51
1697Elo82.2overall$0.034/task
Open scorecard →
GPT-5.5 (default)
OpenAI · closed
#52
1696Elo82.3overall$0.17/task
Open scorecard →
GPT-5.5 (none)
OpenAI · closed
#53
1693Elo82.2overall$0.17/task
Open scorecard →
ai
Muse Spark 1.1 (thinking)
Other · closed
#54
1675Elo81.8overall$0.039/task
Open scorecard →
Qwen3.7 Max (high)
Alibaba (Qwen) · closed
#55
1674Elo81.5overall$0.054/task
Open scorecard →
GPT-5.6 Luna (none)
OpenAI · closed
#56
1635Elo81.3overall$0.031/task
Open scorecard →
GPT-5.6 Luna (low)
OpenAI · closed
#57
1628Elo81.0overall$0.031/task
Open scorecard →
GPT-5.4 mini
OpenAI · closed
#58
1625Elo81.1overall$0.025/task
Open scorecard →
ai
Muse Spark 1.1
Other · closed
#59
1618Elo81.1overall$0.029/task
Open scorecard →
ds
DeepSeek V4 Pro (xhigh)
DeepSeek · open
#60
1601Elo80.5overall$0.014/task
Open scorecard →
ds
DeepSeek V4 Pro (default)
DeepSeek · open
#61
1590Elo80.3overall$0.008/task
Open scorecard →
ds
DeepSeek V4 Flash (native reasoner alias)
DeepSeek · open
#62
1588Elo80.0overall$0.004/task
Open scorecard →
Gemini 3.1 Pro (default)
Google · closed
#63
1577Elo80.2overall$0.118/task
Open scorecard →
Gemini 3.1 Pro (high thinking)
Google · closed
#64
1571Elo80.1overall$0.118/task
Open scorecard →
ai
Inkling
Other · open
#65
1523Elo78.9overall$0.034/task
Open scorecard →
Claude Sonnet 4.5
Anthropic · closed
#66
1516Elo79.2overall$0.072/task
Open scorecard →
Z
GLM-4.7
Zhipu (GLM) · open
#67
1508Elo78.8overall$0.012 (estimated)/task
Open scorecard →
Gemini 2.5 Pro
Google · closed
#68
1506Elo78.9overall$0.058/task
Open scorecard →
ds
DeepSeek V4 Flash (native chat alias)
DeepSeek · open
#69
1490Elo77.8overall$0.002/task
Open scorecard →
Gemini 3.1 Pro (low thinking)
Google · closed
#70
1488Elo78.7overall$0.071/task
Open scorecard →
GPT-5.2
OpenAI · closed
#71
1488Elo79.4overall$0.074/task
Open scorecard →
ai
Inkling (high)
Other · open
#72
1486Elo78.6overall$0.033/task
Open scorecard →
ds
DeepSeek V4 Flash (xhigh)
DeepSeek · open
#73
1477Elo78.5overall$0.005/task
Open scorecard →
Gemini 3.6 Flash (default)
Google · closed
#74
1476Elo78.3overall$0.075/task
Open scorecard →
Gemini 3.6 Flash (high thinking)
Google · closed
#75
1443Elo78.2overall$0.088/task
Open scorecard →
K
Kimi K2 Thinking
Moonshot (Kimi) · open
#76
1437Elo77.6overall$0.025/task
Open scorecard →
ds
DeepSeek V3.2
DeepSeek · open
#77
1410Elo77.2overall$0.004/task
Open scorecard →
Grok 4.20 (reasoning)
xAI · closed
#78
1398Elo77.2overall$0.021/task
Open scorecard →
Nemotron 3 Ultra 550B
NVIDIA · open
#79
1394Elo76.8overall$0.011 (estimated)/task
Open scorecard →
K
Kimi K2 (0905)
Moonshot (Kimi) · open
#80
1391Elo75.5overall$0.011/task
Open scorecard →
Nemotron 3 Ultra 550B (reasoning)
NVIDIA · open
#81
1390Elo76.7overall$0.011 (estimated)/task
Open scorecard →
GPT-5
OpenAI · closed
#82
1373Elo77.1overall$0.069/task
Open scorecard →
ds
DeepSeek V4 Flash (default)
DeepSeek · open
#83
1362Elo76.6overall$0.002/task
Open scorecard →
Z
GLM-4.6
Zhipu (GLM) · open
#84
1344Elo75.8overall$0.011/task
Open scorecard →
GPT-5 mini
OpenAI · closed
#85
1334Elo76.4overall$0.01/task
Open scorecard →
Gemini 3.5 Flash (high thinking)
Google · closed
#86
1328Elo75.8overall$0.142/task
Open scorecard →
GPT-5.1
OpenAI · closed
#87
1321Elo76.5overall$0.051 (estimated)/task
Open scorecard →
Gemini 3.5 Flash (default)
Google · closed
#88
1319Elo76.3overall$0.094/task
Open scorecard →
Gemini 2.5 Flash
Google · closed
#89
1248Elo74.7overall$0.013/task
Open scorecard →
MiniMax M2
MiniMax · open
#90
1228Elo74.0overall$0.005/task
Open scorecard →
Qwen3-Max
Alibaba (Qwen) · closed
#91
1224Elo74.5overall$0.017/task
Open scorecard →
Grok 4.3 (high)
xAI · closed
#92
1222Elo74.0overall$0.033/task
Open scorecard →
Claude Haiku 4.5
Anthropic · closed
#93
1220Elo74.2overall$0.022/task
Open scorecard →
Gemini 3.5 Flash-Lite
Google · closed
#94
1215Elo74.3overall$0.008/task
Open scorecard →
Grok 4 Fast (reasoning)
xAI · closed
#95
1201Elo74.2overall$0.034/task
Open scorecard →
MiniMax M2.1
MiniMax · open
#96
1172Elo73.0overall$0.006 (estimated)/task
Open scorecard →
Mistral Medium 3.5 (reasoning)
Mistral · closed
#97
1158Elo73.0overall$0.149 (estimated)/task
Open scorecard →
Mistral Medium 3.5
Mistral · closed
#98
1100Elo72.3overall$0.03 (estimated)/task
Open scorecard →
Mistral Medium 3.1
Mistral · closed
#99
1071Elo71.9overall$0.009/task
Open scorecard →
Qwen3 235B A22B
Alibaba (Qwen) · open
#100
1040Elo70.8overall$0.003/task
Open scorecard →
Grok 4.3
xAI · closed
#101
1039Elo70.7overall$0.018/task
Open scorecard →
Mistral Large 3
Mistral · open
#102
1030Elo71.0overall$0.008/task
Open scorecard →
Grok 3
xAI · closed
#103
1016Elo70.5overall$0.018/task
Open scorecard →
Gemini 3.1 Flash-Lite
Google · closed
#104
988Elo70.1overall$0.005/task
Open scorecard →
Nemotron 3 Super 120B (reasoning)
NVIDIA · open
#105
986Elo68.7overall$0.003/task
Open scorecard →
Grok 4 Fast
xAI · closed
#106
971Elo70.3overall$0.018/task
Open scorecard →
Gemini 2.5 Flash-Lite
Google · closed
#107
920Elo69.0overall$0.002/task
Open scorecard →
GPT-5.4 nano
OpenAI · closed
#108
902Elo68.8overall$0.007/task
Open scorecard →
Qwen3 235B Thinking
Alibaba (Qwen) · open
#109
894Elo68.3overall$0.015/task
Open scorecard →
Nemotron 3 Super 120B
NVIDIA · open
#110
858Elo66.4overall$0.003/task
Open scorecard →
Z
GLM-4.5 Air
Zhipu (GLM) · open
#111
847Elo67.8overall$0.004/task
Open scorecard →
gpt-oss 120B (high)
OpenAI · open
#112
839Elo67.6overall$0.002/task
Open scorecard →
gpt-oss 120B
OpenAI · open
#113
797Elo66.8overall$0.001/task
Open scorecard →
Qwen3 Next 80B
Alibaba (Qwen) · open
#114
639Elo63.5overall$0.004/task
Open scorecard →
co
Cohere Command A Reasoning
Cohere · open
#115
616Elo62.1overall$0/task
Open scorecard →
Llama 4 Maverick
Meta · open
#116
584Elo60.7overall$0.003/task
Open scorecard →
co
Cohere Command A+ (05-2026)
Cohere · open
#117
574Elo61.1overall$0/task
Open scorecard →
GPT-4o
OpenAI · closed
#118
473Elo58.3overall$0.038/task
Open scorecard →
GPT-5 nano
OpenAI · closed
#119
466Elo58.3overall$0.003/task
Open scorecard →
co
Cohere Command A (03-2025)
Cohere · open
#120
459Elo57.3overall$0.039/task
Open scorecard →
GPT-4o mini
OpenAI · closed
#121
384Elo55.8overall$0.002/task
Open scorecard →
Qwen3 8B
Alibaba (Qwen) · open
#122
376Elo55.6overall$0.002/task
Open scorecard →
Qwen3.5 9B
Alibaba (Qwen) · open
#123
365Elo54.6overall$0.002/task
Open scorecard →
co
Cohere Command R+
Cohere · open
#124
265Elo46.6overall$0.043/task
Open scorecard →
co
Cohere Command R
Cohere · open
#125
263Elo51.3overall$0.002/task
Open scorecard →
Gemma 3 4B
Google · open
#126
72Elo45.4overall$0.001/task
Open scorecard →
Llama 3.1 8B
Meta · open
#127
48Elo44.0overall$0.001/task
Open scorecard →
Llama 4 Scout
Meta · open
#128
42Elo43.6overall$0.001/task
Open scorecard →
Qwen2.5 7B
Alibaba (Qwen) · open
#129
-136Elo26.7overall$0.001/task
Open scorecard →
co
Cohere Command R7B
Cohere · open
#130
-166Elo28.6overall$0.001/task
Open scorecard →

Frequently asked questions

How many AI models does ToneBench test for writing?

130 model configurations are tracked across 14 providers; 130 have complete coverage for all 9 current tasks, while 130 are eligible for and form the current rank. The catalog spans Anthropic, OpenAI, Google, Meta, DeepSeek, xAI, Mistral, Alibaba/Qwen, Moonshot/Kimi, Zhipu/GLM and more, across proprietary and open weights. Every current-ranked model writes the same 9 real YouTube scripts and is scored blind against our finished versions; archived rows are not compared in the current rank.

Which model writes best overall?

Claude Opus 5 (max effort) tops the board with a writing Elo of 2649 and 90.8/100 overall. Open its scorecard for the full per-metric and per-article breakdown, or see the leaderboard for the ranking.

What is the best open-weights model for writing?

Kimi K3 is the strongest open-weights model here, at Elo 2438. Open weights still trail the closed frontier on pure voice fidelity, but they have closed a lot of the gap at a fraction of the cost.

What is the best value model for writing?

DeepSeek V4 Flash 0731 gives the most writing quality per dollar in the cheaper half of the board (Elo 1955 at $0.005/task). Use the cost column on each card, or sort the leaderboard by any metric.

How many of the models are open source?

47 of the 130 tracked configurations are open-weights; the rest are proprietary. Use the filter buttons above to see each group on its own.

How often is this list updated?

New models are added as soon as practical after release (we monitor the major provider APIs daily), and new articles are added a few times a year. Source-publication timing is recorded, including disclosed exceptions to the normal pre-publication workflow. Every card and score regenerates from the live board. See the methodology for how scoring works.

Can I see detailed scores for a specific model?

Yes. Click any card to open that model's scorecard: stat cards, a written recap, all nine metric scores with board rank, per-article results, and its own FAQ.

← Back to the leaderboard