Бенчмарк юмора
Слепые сравнения языковых моделей людьми.
Новое исследование: Умеют ли нейросети смешно шутить? Проверили и собрали результаты
Русский язык 23 моделей 32 385 наблюдений
Расчёт: 11.10.2026, 12:02:11 UTC
Рейтинг моделей · выше — лучшеПрокрутите, чтобы увидеть все модели ↔
1 258
Gemini 3.1 Pro Preview (High)1 257MMuse Spark 1.3 (Medium)1 243
GPT-6 Astra (High)1 239
Gemini 3.7 Flash1 234
GPT-5.6 Sol (Medium)1 234
GPT-5.6 Sol (XHigh)1 234
GPT-6 Astra (Medium)1 233
GPT-5.6 Sol1 230
GPT-5.6 Luna (Medium)1 218
Claude Fable 5.11 218
GPT-6 Astra (Low)1 209
Gemini 3.8 Flash1 204
Claude Opus 51 202QQwen3.8 Max 0902 (High)1 184
DeepSeek V4 Flash 0731 (High)1 181
GPT-5.6 Terra (Medium)1 181
DeepSeek V4 Pro 08131 180
Claude Sonnet 5 (High)1 176XGrok 4.6 (High)1 151
GLM 5.31 151
Kimi K31 104BSeed 2.1 Turbo1 077TInkling
Подробные результаты Версии, интервалы и сравнения
Под значениями — 95% интервалы неопределённости.
| Место | Модель / точная версия | Рейтинг | Доля побед | Сравнения |
|---|---|---|---|---|
| 1 | Gemini 3.1 Pro Preview (High)Googlegemini-20260219-reasoning-high | 1 257,6495%: 1 225,52–1 295,43 | 57,8%95%: 55,76%–59,8% | 2 296 |
| 2 | Muse Spark 1.3 (Medium)Metamuse-20260902-reasoning-medium | 1 256,9795%: 1 224,48–1 289,81 | 57,6%95%: 55,55%–59,62% | 2 257 |
| 3 | GPT-6 Astra (High)OpenAIastra-20260903-reasoning-high | 1 243,3195%: 1 209,4–1 280,56 | 55,63%95%: 53,58%–57,66% | 2 265 |
| 4 | Gemini 3.7 FlashGoogle3.7-flash | 1 239,4395%: 1 208,58–1 275,92 | 57,73%95%: 56,17%–59,27% | 3 894 |
| 5 | GPT-5.6 Sol (Medium)OpenAIsol-20260709-reasoning-medium | 1 234,395%: 1 200,46–1 269,29 | 54,42%95%: 52,35%–56,48% | 2 227 |
| 6 | GPT-5.6 Sol (XHigh)OpenAIsol-20260709-reasoning-xhigh | 1 234,0695%: 1 198,07–1 269,62 | 54,36%95%: 52,32%–56,38% | 2 307 |
| 7 | GPT-6 Astra (Medium)OpenAIastra-20260903-reasoning-medium | 1 233,6695%: 1 198,63–1 272,47 | 54,34%95%: 52,26%–56,41% | 2 212 |
| 8 | GPT-5.6 SolOpenAI5.6-sol | 1 233,1195%: 1 200,35–1 266,62 | 56,81%95%: 55,2%–58,41% | 3 656 |
| 9 | GPT-5.6 Luna (Medium)OpenAI5.6-luna-reasoning-medium | 1 229,8195%: 1 193,94–1 266,19 | 53,58%95%: 51,5%–55,64% | 2 223 |
| 10 | Claude Fable 5.1Anthropicfable-5.1-reasoning-high | 1 218,4395%: 1 189,86–1 249,94 | 54,5%95%: 52,86%–56,13% | 3 578 |
| 11 | GPT-6 Astra (Low)OpenAIastra-20260903-reasoning-low | 1 217,7595%: 1 182,14–1 255,61 | 51,75%95%: 49,65%–53,85% | 2 172 |
| 12 | Gemini 3.8 FlashGoogle3.8-flash | 1 209,0695%: 1 175,05–1 241,96 | 52,95%95%: 51,32%–54,57% | 3 611 |
| 13 | Claude Opus 5Anthropicopus-5 | 1 204,3595%: 1 174,02–1 232,51 | 52,51%95%: 50,88%–54,13% | 3 611 |
| 14 | Qwen3.8 Max 0902 (High)Alibabaqwen-20260902-reasoning-high | 1 201,5695%: 1 166,06–1 239,17 | 49,41%95%: 47,27%–51,54% | 2 107 |
| 15 | DeepSeek V4 Flash 0731 (High)DeepSeekv4-flash-0731-reasoning-high | 1 183,8995%: 1 146,26–1 220,97 | 46,71%95%: 44,62%–48,81% | 2 175 |
| 16 | GPT-5.6 Terra (Medium)OpenAI5.6-terra-reasoning-medium | 1 18195%: 1 142,66–1 214,81 | 46,45%95%: 44,35%–48,56% | 2 153 |
| 17 | DeepSeek V4 Pro 0813DeepSeekv4-pro-0813 | 1 180,9495%: 1 152,34–1 210,24 | 48,85%95%: 47,22%–50,48% | 3 599 |
| 18 | Claude Sonnet 5 (High)Anthropicsonnet-5-reasoning-high | 1 180,4295%: 1 144,03–1 215,35 | 46,26%95%: 44,16%–48,37% | 2 151 |
| 19 | Grok 4.6 (High)xAIgrok-20260810-reasoning-high | 1 176,4295%: 1 135,4–1 216,71 | 45,67%95%: 43,56%–47,79% | 2 135 |
| 20 | GLM 5.3Z.ai5.3 | 1 151,4595%: 1 119,3–1 183,07 | 44,26%95%: 42,65%–45,87% | 3 638 |
| 21 | Kimi K3Moonshot AIk3 | 1 151,295%: 1 119,1–1 183,06 | 44,16%95%: 42,54%–45,8% | 3 571 |
| 22 | Seed 2.1 TurboByteDance Seed2.1-turbo | 1 104,2795%: 1 070,19–1 138,02 | 37,41%95%: 35,8%–39,04% | 3 427 |
| 23 | InklingThinking Machinesinkling | 1 076,9795%: 1 041,37–1 110,8 | 33,55%95%: 32,01%–35,14% | 3 493 |
Близкие оценки и пересекающиеся интервалы не доказывают превосходство одной модели. До 200 сравнений результат предварительный. Подробнее о расчёте
Сохранённый снимок от 2026-10-11T12:05:14.816Z. Проверяем обновления…