Towards AITowards AIToneBench

All models

The same model can land 39 places apart on this board just by changing its effort setting. That's why every card here is one configuration, not one model name. Each card gives you the rank, writing Elo, overall score and cost per script, and a click opens the full scorecard. 167 configurations are on the board, and every one of them has all 10 scripts scored and a current rank.

Claude Opus 5.5 (max effort)
Anthropic · closed
#1
2846Elo91.8overall$3.43per script
Open scorecard →
Claude Opus 5.5 (xhigh)
Anthropic · closed
#2
2664Elo90.9overall$0.863per script
Open scorecard →
Claude Fable 5.1 (max effort)
Anthropic · closed
#3
2544Elo90.5overall$3.15per script
Open scorecard →
Claude Opus 5.5 (high)
Anthropic · closed
#4
2442Elo90.2overall$0.337per script
Open scorecard →
Claude Fable 5 (max effort + 4.8 fallback)
Anthropic · closed
#5
2392Elo89.7overall$2.52per script
Open scorecard →
Claude Fable 5 (xhigh)
Anthropic · closed
#6
2362Elo89.6overall$1.02per script
Open scorecard →
Claude Opus 5.5 (medium)
Anthropic · closed
#7
2361Elo89.4overall$0.211per script
Open scorecard →
Claude Opus 5 (max effort)
Anthropic · closed
#8
2354Elo89.4overall$0.293per script
Open scorecard →
Claude Opus 5.5 (adaptive default)
Anthropic · closed
#9
2344Elo89.3overall$0.215per script
Open scorecard →
Claude Opus 5.5 (low)
Anthropic · closed
#10
2320Elo89.1overall$0.17per script
Open scorecard →
Claude Fable 5.1 (adaptive default)
Anthropic · closed
#11
2284Elo88.8overall$0.648per script
Open scorecard →
Claude Opus 5 (xhigh)
Anthropic · closed
#12
2280Elo88.8overall$0.203per script
Open scorecard →
Claude Opus 5 (high)
Anthropic · closed
#13
2263Elo88.6overall$0.171per script
Open scorecard →
Claude Opus 5 (adaptive default)
Anthropic · closed
#14
2263Elo88.7overall$0.176per script
Open scorecard →
Z
GLM-5.3
Zhipu (GLM) · open
#15
2256Elo88.7overall$0.114per script
Open scorecard →
Z
GLM-5.3 Flash
Zhipu (GLM) · open
#16
2244Elo88.5overall$0.007per script
Open scorecard →
Claude Fable 5 (medium)
Anthropic · closed
#17
2242Elo88.5overall$0.311per script
Open scorecard →
Claude Fable 5 (high)
Anthropic · closed
#18
2227Elo88.3overall$0.319per script
Open scorecard →
Claude Fable 5 (adaptive default)
Anthropic · closed
#19
2226Elo88.5overall$0.557per script
Open scorecard →
Claude Opus 4.8 (max effort)
Anthropic · closed
#20
2220Elo88.2overall$0.678per script
Open scorecard →
K
Kimi K3
Moonshot (Kimi) · open
#21
2217Elo88.5overall$0.26per script
Open scorecard →
Claude Fable 5 (low)
Anthropic · closed
#22
2216Elo88.4overall$0.305per script
Open scorecard →
Claude Opus 5 (medium)
Anthropic · closed
#23
2205Elo88.2overall$0.154per script
Open scorecard →
ai
MiMo-V2.6-Pro UltraSpeed
Other · closed
#24
2197Elo88.3overall$0.122per script
Open scorecard →
GPT-5.6 Sol (ultra)
OpenAI · closed
#25
2187Elo88.0overall$0.363per script
Open scorecard →
Grok 4.7 (high)
xAI · closed
#26
2186Elo87.8overall$0.311per script
Open scorecard →
Grok 4.7
xAI · closed
#27
2186Elo87.9overall$0.267per script
Open scorecard →
ds
DeepSeek V4.1 Flash (max)
DeepSeek · open
#28
2183Elo88.1overall$0.013per script
Open scorecard →
Claude Opus 5 (low)
Anthropic · closed
#29
2181Elo88.1overall$0.151per script
Open scorecard →
ai
MiMo-V2.6-Pro
Other · closed
#30
2180Elo88.1overall$0.011per script
Open scorecard →
GPT-6 Sol (max)
OpenAI · closed
#31
2166Elo88.0overall$0.112per script
Open scorecard →
GPT-5.6 Sol (xhigh)
OpenAI · closed
#32
2165Elo87.9overall$0.184per script
Open scorecard →
GPT-5.6 Sol (high)
OpenAI · closed
#33
2134Elo87.6overall$0.155per script
Open scorecard →
GPT-5.6 Sol (default)
OpenAI · closed
#34
2130Elo87.6overall$0.148per script
Open scorecard →
GPT-5.6 Sol (low)
OpenAI · closed
#35
2117Elo87.4overall$0.147per script
Open scorecard →
ai
MiMo-V2.6-Flash
Other · open
#36
2113Elo87.3overall$0.004per script
Open scorecard →
GPT-5.6 Sol (none)
OpenAI · closed
#37
2109Elo87.6overall$0.144per script
Open scorecard →
Grok 4.7 (medium)
xAI · closed
#38
2105Elo87.2overall$0.19per script
Open scorecard →
GPT-6 Sol (high)
OpenAI · closed
#39
2101Elo87.3overall$0.06per script
Open scorecard →
ds
DeepSeek V4.1 Flash (default)
DeepSeek · open
#40
2099Elo87.1overall$0.008per script
Open scorecard →
K
Kimi K3 (thinking)
Moonshot (Kimi) · open
#41
2098Elo87.2overall$0.095per script
Open scorecard →
Grok 4.7 (low)
xAI · closed
#42
2091Elo87.0overall$0.06per script
Open scorecard →
Claude Opus 4.8 (default)
Anthropic · closed
#43
2064Elo86.9overall$0.16per script
Open scorecard →
Claude Sonnet 5 (max effort)
Anthropic · closed
#44
2053Elo86.6overall$0.733per script
Open scorecard →
GPT-5.6 Terra (xhigh)
OpenAI · closed
#45
2031Elo86.6overall$0.083per script
Open scorecard →
Grok 4.6
xAI · closed
#46
2019Elo86.3overall$0.204per script
Open scorecard →
GPT-6 Sol (default)
OpenAI · closed
#47
2016Elo86.3overall$0.054per script
Open scorecard →
GPT-5.6 Terra (ultra)
OpenAI · closed
#48
2010Elo86.4overall$0.198per script
Open scorecard →
GPT-5.6 Terra (default)
OpenAI · closed
#49
2005Elo86.4overall$0.072per script
Open scorecard →
GPT-6 Astra (max)
OpenAI · closed
#50
2005Elo86.4overall$0.852per script
Open scorecard →
GPT-5.6 Terra (none)
OpenAI · closed
#51
1994Elo86.2overall$0.069per script
Open scorecard →
GPT-5.6 Terra (high)
OpenAI · closed
#52
1988Elo86.2overall$0.074per script
Open scorecard →
Grok 4.6 (high)
xAI · closed
#53
1970Elo85.9overall$0.211per script
Open scorecard →
GPT-5.6 Terra (low)
OpenAI · closed
#54
1950Elo86.0overall$0.073per script
Open scorecard →
Claude Opus 4.7
Anthropic · closed
#55
1926Elo85.6overall$0.178per script
Open scorecard →
ds
DeepSeek V4 Pro 0813 (max)
DeepSeek · open
#56
1917Elo84.8overall$0.021per script
Open scorecard →
GPT-6 Astra (default)
OpenAI · closed
#57
1909Elo85.4overall$0.244per script
Open scorecard →
GPT-5.4 (xhigh)
OpenAI · closed
#58
1903Elo85.4overall$0.192per script
Open scorecard →
ds
DeepSeek V4 Flash 0731
DeepSeek · open
#59
1866Elo84.4overall$0.005per script
Open scorecard →
Claude Sonnet 5 (default)
Anthropic · closed
#60
1826Elo84.5overall$0.091per script
Open scorecard →
GPT-5.6 Luna (ultra)
OpenAI · closed
#61
1823Elo84.6overall$0.117per script
Open scorecard →
GPT-6 Luna (max)
OpenAI · closed
#62
1787Elo84.1overall$0.004per script
Open scorecard →
Claude Opus 4.6
Anthropic · closed
#63
1784Elo84.0overall$0.395per script
Open scorecard →
Claude Sonnet 4.6
Anthropic · closed
#64
1727Elo83.2overall$0.314per script
Open scorecard →
Qwen3.8 Flash
Alibaba (Qwen) · closed
#65
1699Elo83.0overall$0.013per script
Open scorecard →
Z
GLM-5
Zhipu (GLM) · open
#66
1692Elo82.8overall$0.05per script
Open scorecard →
GPT-5.5 (high)
OpenAI · closed
#67
1683Elo83.0overall$0.178per script
Open scorecard →
Qwen3.8 Max
Alibaba (Qwen) · closed
#68
1682Elo83.2overall$0.161per script
Open scorecard →
GPT-6 Luna (high)
OpenAI · closed
#69
1677Elo82.9overall$0.003per script
Open scorecard →
GPT-6 Luna (default)
OpenAI · closed
#70
1672Elo82.8overall$0.003per script
Open scorecard →
MiniMax M3
MiniMax · open
#71
1672Elo82.7overall$0.023 (estimated)per script
Open scorecard →
ai
Muse Spark 1.3 (thinking)
Other · closed
#72
1657Elo82.8overall$0.041per script
Open scorecard →
ai
Muse Spark 1.3
Other · closed
#73
1651Elo82.7overall$0.034per script
Open scorecard →
GPT-5.5 (xhigh)
OpenAI · closed
#74
1651Elo82.8overall$0.178per script
Open scorecard →
GPT-5.6 Luna (xhigh)
OpenAI · closed
#75
1649Elo82.8overall$0.046per script
Open scorecard →
Grok 4.5
xAI · closed
#76
1618Elo81.9overall$0.063per script
Open scorecard →
K
Kimi K2.6 (thinking)
Moonshot (Kimi) · open
#77
1601Elo81.8overall$0.057per script
Open scorecard →
GPT-5.5 (default)
OpenAI · closed
#78
1600Elo82.1overall$0.171per script
Open scorecard →
K
Kimi K2.6
Moonshot (Kimi) · open
#79
1600Elo82.0overall$0.053per script
Open scorecard →
GPT-5.4
OpenAI · closed
#80
1591Elo82.1overall$0.08per script
Open scorecard →
GPT-5.6 Luna (high)
OpenAI · closed
#81
1577Elo81.8overall$0.035per script
Open scorecard →
Z
GLM-5.2
Zhipu (GLM) · open
#82
1553Elo81.4overall$0.02per script
Open scorecard →
GPT-5.4 mini (high)
OpenAI · closed
#83
1553Elo81.3overall$0.053per script
Open scorecard →
GPT-5.6 Luna (none)
OpenAI · closed
#84
1553Elo81.6overall$0.03per script
Open scorecard →
Qwen3.7 Max (default)
Alibaba (Qwen) · closed
#85
1546Elo80.9overall$0.056per script
Open scorecard →
GPT-5.5 (none)
OpenAI · closed
#86
1537Elo81.3overall$0.172per script
Open scorecard →
GPT-5.6 Luna (default)
OpenAI · closed
#87
1534Elo81.3overall$0.032per script
Open scorecard →
ai
Muse Spark 1.1 (thinking)
Other · closed
#88
1526Elo80.9overall$0.04per script
Open scorecard →
Qwen3.7 Max (high)
Alibaba (Qwen) · closed
#89
1525Elo80.8overall$0.055per script
Open scorecard →
ds
DeepSeek V4 Flash (native chat alias)
DeepSeek · open
#90
1518Elo80.4overall$0.002per script
Open scorecard →
GPT-5.6 Luna (low)
OpenAI · closed
#91
1502Elo80.8overall$0.032per script
Open scorecard →
Claude Sonnet 4.5
Anthropic · closed
#92
1483Elo75.9overall$0.145per script
Open scorecard →
GPT-5.4 mini
OpenAI · closed
#93
1468Elo80.2overall$0.036per script
Open scorecard →
Gemini 3.1 Pro (default)
Google · closed
#94
1465Elo80.1overall$0.143per script
Open scorecard →
ds
DeepSeek V4 Pro 0813 (default)
DeepSeek · open
#95
1455Elo79.3overall$0.011per script
Open scorecard →
Gemini 3.1 Pro (high thinking)
Google · closed
#96
1437Elo79.8overall$0.146per script
Open scorecard →
ds
DeepSeek V4 Pro (xhigh)
DeepSeek · open
#97
1417Elo78.9overall$0.013per script
Open scorecard →
ai
Muse Spark 1.1
Other · closed
#98
1414Elo79.4overall$0.03per script
Open scorecard →
Gemini 2.5 Pro
Google · closed
#99
1366Elo78.4overall$0.06per script
Open scorecard →
ai
Inkling
Other · open
#100
1364Elo78.1overall$0.035per script
Open scorecard →
ds
DeepSeek V4 Pro (default)
DeepSeek · open
#101
1351Elo78.5overall$0.009per script
Open scorecard →
K
Kimi K2 (0905)
Moonshot (Kimi) · open
#102
1351Elo77.8overall$0.012per script
Open scorecard →
ai
Inkling (high)
Other · open
#103
1345Elo77.6overall$0.033per script
Open scorecard →
Gemini 3.7 Flash (default)
Google · closed
#104
1328Elo77.9overall$0.028per script
Open scorecard →
K
Kimi K2 Thinking
Moonshot (Kimi) · open
#105
1320Elo77.7overall$0.026per script
Open scorecard →
Gemini 3.1 Pro (low thinking)
Google · closed
#106
1313Elo77.8overall$0.078per script
Open scorecard →
Gemini 3.8 Flash (high thinking)
Google · closed
#107
1312Elo77.3overall$0.06per script
Open scorecard →
GPT-5.2
OpenAI · closed
#108
1307Elo78.1overall$0.08per script
Open scorecard →
Gemini 3.6 Flash (high thinking)
Google · closed
#109
1295Elo77.3overall$0.10per script
Open scorecard →
Gemini 3.8 Flash (default)
Google · closed
#110
1294Elo77.1overall$0.032per script
Open scorecard →
Gemini 3.6 Flash (default)
Google · closed
#111
1292Elo77.1overall$0.086per script
Open scorecard →
GPT-5
OpenAI · closed
#112
1277Elo77.2overall$0.073per script
Open scorecard →
Gemini 3.7 Flash (high thinking)
Google · closed
#113
1275Elo77.1overall$0.043per script
Open scorecard →
Z
GLM-4.7
Zhipu (GLM) · open
#114
1275Elo77.2overall$0.012 (estimated)per script
Open scorecard →
ds
DeepSeek V4 Flash (xhigh)
DeepSeek · open
#115
1268Elo77.0overall$0.005per script
Open scorecard →
Grok 4.20 (reasoning)
xAI · closed
#116
1260Elo76.5overall$0.032per script
Open scorecard →
ds
DeepSeek V3.2
DeepSeek · open
#117
1210Elo76.1overall$0.004per script
Open scorecard →
ds
DeepSeek V4 Flash (native reasoner alias)
DeepSeek · open
#118
1205Elo75.7overall$0.003per script
Open scorecard →
Gemini 3.5 Flash (default)
Google · closed
#119
1192Elo75.9overall$0.142per script
Open scorecard →
Gemini 3.5 Flash (high thinking)
Google · closed
#120
1190Elo75.2overall$0.17per script
Open scorecard →
ds
DeepSeek V4 Flash (default)
DeepSeek · open
#121
1186Elo75.5overall$0.002per script
Open scorecard →
Nemotron 3 Ultra 550B (reasoning)
NVIDIA · open
#122
1182Elo74.7overall$0.012 (estimated)per script
Open scorecard →
Nemotron 3 Ultra 550B
NVIDIA · open
#123
1180Elo74.9overall$0.012 (estimated)per script
Open scorecard →
GPT-5.1
OpenAI · closed
#124
1168Elo75.7overall$0.054 (estimated)per script
Open scorecard →
Z
GLM-4.6
Zhipu (GLM) · open
#125
1167Elo74.5overall$0.012per script
Open scorecard →
GPT-5 mini
OpenAI · closed
#126
1113Elo74.3overall$0.011per script
Open scorecard →
Grok 4.3 (high)
xAI · closed
#127
1113Elo73.9overall$0.03per script
Open scorecard →
Claude Haiku 4.5
Anthropic · closed
#128
1110Elo74.1overall$0.066per script
Open scorecard →
Grok 4 Fast (reasoning)
xAI · closed
#129
1090Elo73.6overall$0.029per script
Open scorecard →
MiniMax M2
MiniMax · open
#130
1056Elo73.1overall$0.005per script
Open scorecard →
Gemini 2.5 Flash
Google · closed
#131
1036Elo71.2overall$0.015per script
Open scorecard →
Qwen3-Max
Alibaba (Qwen) · closed
#132
1022Elo72.8overall$0.018per script
Open scorecard →
MiniMax M2.1
MiniMax · open
#133
1006Elo71.9overall$0.006 (estimated)per script
Open scorecard →
Grok 4.3
xAI · closed
#134
959Elo71.5overall$0.022per script
Open scorecard →
Gemini 3.5 Flash-Lite
Google · closed
#135
958Elo71.8overall$0.009per script
Open scorecard →
Grok 3
xAI · closed
#136
926Elo71.0overall$0.022per script
Open scorecard →
Mistral Medium 3.5 (reasoning)
Mistral · closed
#137
922Elo69.7overall$0.153 (estimated)per script
Open scorecard →
Grok 4 Fast
xAI · closed
#138
880Elo69.8overall$0.022per script
Open scorecard →
Mistral Medium 3.1
Mistral · closed
#139
878Elo70.2overall$0.009per script
Open scorecard →
Gemini 3.1 Flash-Lite
Google · closed
#140
865Elo69.8overall$0.005per script
Open scorecard →
Qwen3 235B A22B
Alibaba (Qwen) · open
#141
830Elo68.5overall$0.003per script
Open scorecard →
Mistral Medium 3.5
Mistral · closed
#142
817Elo69.2overall$0.031 (estimated)per script
Open scorecard →
Mistral Large 3
Mistral · open
#143
815Elo68.7overall$0.009per script
Open scorecard →
Nemotron 3 Super 120B (reasoning)
NVIDIA · open
#144
746Elo67.5overall$0.003per script
Open scorecard →
Qwen3 235B Thinking
Alibaba (Qwen) · open
#145
742Elo67.7overall$0.016per script
Open scorecard →
GPT-5.4 nano
OpenAI · closed
#146
741Elo67.3overall$0.007per script
Open scorecard →
Gemini 2.5 Flash-Lite
Google · closed
#147
733Elo66.7overall$0.002per script
Open scorecard →
Nemotron 3 Super 120B
NVIDIA · open
#148
712Elo67.0overall$0.003per script
Open scorecard →
Z
GLM-4.5 Air
Zhipu (GLM) · open
#149
685Elo66.2overall$0.004per script
Open scorecard →
gpt-oss 120B
OpenAI · open
#150
636Elo65.4overall$0.001per script
Open scorecard →
gpt-oss 120B (high)
OpenAI · open
#151
624Elo65.3overall$0.002per script
Open scorecard →
co
Cohere Command A+ (05-2026)
Cohere · open
#152
512Elo61.9overall$0per script
Open scorecard →
Qwen3 Next 80B
Alibaba (Qwen) · open
#153
475Elo61.8overall$0.004per script
Open scorecard →
co
Cohere Command A Reasoning
Cohere · open
#154
446Elo59.9overall$0per script
Open scorecard →
Llama 4 Maverick
Meta · open
#155
424Elo60.4overall$0.003per script
Open scorecard →
co
Cohere Command A (03-2025)
Cohere · open
#156
356Elo58.1overall$0.042per script
Open scorecard →
GPT-5 nano
OpenAI · closed
#157
333Elo57.6overall$0.004per script
Open scorecard →
Qwen3.5 9B
Alibaba (Qwen) · open
#158
269Elo55.9overall$0.002per script
Open scorecard →
GPT-4o
OpenAI · closed
#159
261Elo56.7overall$0.04per script
Open scorecard →
GPT-4o mini
OpenAI · closed
#160
211Elo55.7overall$0.003per script
Open scorecard →
Qwen3 8B
Alibaba (Qwen) · open
#161
159Elo53.7overall$0.002per script
Open scorecard →
co
Cohere Command R
Cohere · open
#162
84Elo51.3overall$0.002per script
Open scorecard →
co
Cohere Command R+
Cohere · open
#163
-33Elo41.1overall$0.049per script
Open scorecard →
Llama 4 Scout
Meta · open
#164
-150Elo45.0overall$0.001per script
Open scorecard →
Llama 3.1 8B
Meta · open
#165
-151Elo44.6overall$0.001per script
Open scorecard →
Gemma 3 4B
Google · open
#166
-187Elo43.5overall$0.001per script
Open scorecard →
co
Cohere Command R7B
Cohere · open
#167
-320Elo29.1overall$0.001per script
Open scorecard →

Frequently asked questions

How many AI models does ToneBench test for writing?

167 configurations from more than 13 labs are on the board right now, and every one of them has all 10 scripts scored and a current rank. A configuration is one model at one setting, so the same model at low and at max effort counts twice, and it should: effort alone can move a model a long way. You'll find Anthropic, OpenAI, Google, Meta, DeepSeek, xAI, Mistral, Alibaba (Qwen), Moonshot (Kimi), Zhipu (GLM) and more, closed and open weights alike. Every ranked configuration writes the scripts behind the same 10 of my What's AI videos, and each draft is scored blind against my finished version. Archived rows stay visible, but they never enter the current rank.

Which model writes best overall?

Claude Opus 5.5 (max effort) is #1 right now, with a writing Elo of 2846 and 91.8/100 overall. It also costs $3.43 per script, so if you're writing at volume, read the value answer below before you wire it into a pipeline. Its scorecard breaks the result down by metric and by script, and the leaderboard has the whole ranking.

What is the best open-weights model for writing?

GLM-5.3 is the strongest open-weights writer here: #15, Elo 2256, at $0.114 per script. That's 590 Elo behind the leader, so the closed frontier still writes better. But if you need to run the model yourself or keep your data in-house, this is the one to try first.

What is the best value model for writing?

GLM-5.3 Flash is the strongest writer in the cheaper half of the board: Elo 2244 at $0.007 per script. When cost matters, that's where I'd start. Each card shows its cost, and you can sort the leaderboard by any metric.

How many of the models are open source?

53 of the 167 tracked configurations have open weights; the rest are proprietary. The filter buttons at the top split the grid so you can look at each group on its own.

How often is this list updated?

New models go on the board as soon as practical after release, and new scripts get added a few times a year. New scripts are normally benchmarked before their video goes out, though that doesn't make it impossible for a model to have seen one. Every card and score regenerates from the live board, and the methodology explains how the scoring works.

Can I see detailed scores for a specific model?

Yes. Click any card for that configuration's scorecard: stat cards, a written recap, all 9 metric scores with their board rank, per-script results, and its own FAQ.

← Back to the leaderboard