Humor ArenaBenchmarks

Бенчмарк юмора

Слепые сравнения языковых моделей людьми.

Новое исследование: Умеют ли нейросети смешно шутить? Проверили и собрали результаты

Русский язык 23 моделей 32 385 наблюдений

Расчёт: 11.10.2026, 12:02:11 UTC

Рейтинг моделей · выше — лучшеПрокрутите, чтобы увидеть все модели ↔
Подробные результаты Версии, интервалы и сравнения

Под значениями — 95% интервалы неопределённости.

Обычный юмор: опубликованный рейтинг моделей
МестоМодель / точная версияРейтингДоля победСравнения
1Gemini 3.1 Pro Preview (High)Googlegemini-20260219-reasoning-high1 257,6495%: 1 225,52–1 295,4357,8%95%: 55,76%–59,8%2 296
2Muse Spark 1.3 (Medium)Metamuse-20260902-reasoning-medium1 256,9795%: 1 224,48–1 289,8157,6%95%: 55,55%–59,62%2 257
3GPT-6 Astra (High)OpenAIastra-20260903-reasoning-high1 243,3195%: 1 209,4–1 280,5655,63%95%: 53,58%–57,66%2 265
4Gemini 3.7 FlashGoogle3.7-flash1 239,4395%: 1 208,58–1 275,9257,73%95%: 56,17%–59,27%3 894
5GPT-5.6 Sol (Medium)OpenAIsol-20260709-reasoning-medium1 234,395%: 1 200,46–1 269,2954,42%95%: 52,35%–56,48%2 227
6GPT-5.6 Sol (XHigh)OpenAIsol-20260709-reasoning-xhigh1 234,0695%: 1 198,07–1 269,6254,36%95%: 52,32%–56,38%2 307
7GPT-6 Astra (Medium)OpenAIastra-20260903-reasoning-medium1 233,6695%: 1 198,63–1 272,4754,34%95%: 52,26%–56,41%2 212
8GPT-5.6 SolOpenAI5.6-sol1 233,1195%: 1 200,35–1 266,6256,81%95%: 55,2%–58,41%3 656
9GPT-5.6 Luna (Medium)OpenAI5.6-luna-reasoning-medium1 229,8195%: 1 193,94–1 266,1953,58%95%: 51,5%–55,64%2 223
10Claude Fable 5.1Anthropicfable-5.1-reasoning-high1 218,4395%: 1 189,86–1 249,9454,5%95%: 52,86%–56,13%3 578
11GPT-6 Astra (Low)OpenAIastra-20260903-reasoning-low1 217,7595%: 1 182,14–1 255,6151,75%95%: 49,65%–53,85%2 172
12Gemini 3.8 FlashGoogle3.8-flash1 209,0695%: 1 175,05–1 241,9652,95%95%: 51,32%–54,57%3 611
13Claude Opus 5Anthropicopus-51 204,3595%: 1 174,02–1 232,5152,51%95%: 50,88%–54,13%3 611
14Qwen3.8 Max 0902 (High)Alibabaqwen-20260902-reasoning-high1 201,5695%: 1 166,06–1 239,1749,41%95%: 47,27%–51,54%2 107
15DeepSeek V4 Flash 0731 (High)DeepSeekv4-flash-0731-reasoning-high1 183,8995%: 1 146,26–1 220,9746,71%95%: 44,62%–48,81%2 175
16GPT-5.6 Terra (Medium)OpenAI5.6-terra-reasoning-medium1 18195%: 1 142,66–1 214,8146,45%95%: 44,35%–48,56%2 153
17DeepSeek V4 Pro 0813DeepSeekv4-pro-08131 180,9495%: 1 152,34–1 210,2448,85%95%: 47,22%–50,48%3 599
18Claude Sonnet 5 (High)Anthropicsonnet-5-reasoning-high1 180,4295%: 1 144,03–1 215,3546,26%95%: 44,16%–48,37%2 151
19Grok 4.6 (High)xAIgrok-20260810-reasoning-high1 176,4295%: 1 135,4–1 216,7145,67%95%: 43,56%–47,79%2 135
20GLM 5.3Z.ai5.31 151,4595%: 1 119,3–1 183,0744,26%95%: 42,65%–45,87%3 638
21Kimi K3Moonshot AIk31 151,295%: 1 119,1–1 183,0644,16%95%: 42,54%–45,8%3 571
22Seed 2.1 TurboByteDance Seed2.1-turbo1 104,2795%: 1 070,19–1 138,0237,41%95%: 35,8%–39,04%3 427
23InklingThinking Machinesinkling1 076,9795%: 1 041,37–1 110,833,55%95%: 32,01%–35,14%3 493

Близкие оценки и пересекающиеся интервалы не доказывают превосходство одной модели. До 200 сравнений результат предварительный. Подробнее о расчёте

Сохранённый снимок от 2026-10-11T12:05:14.816Z. Проверяем обновления…