Бенчмарк юмора
Слепые сравнения языковых моделей людьми.
Русский язык 23 моделей 32 278 наблюдений
Расчёт: 13.09.2026, 00:01:28 UTC
Рейтинг моделей · выше — лучшеПрокрутите, чтобы увидеть все модели ↔
1 257
Gemini 3.1 Pro Preview (High)1 257MMuse Spark 1.3 (Medium)1 244
GPT-6 Astra (High)1 240
Gemini 3.7 Flash1 235
GPT-5.6 Sol (Medium)1 234
GPT-5.6 Sol (XHigh)1 234
GPT-5.6 Sol1 233
GPT-6 Astra (Medium)1 230
GPT-5.6 Luna (Medium)1 218
Claude Fable 5.11 217
GPT-6 Astra (Low)1 209
Gemini 3.8 Flash1 204
Claude Opus 51 202QQwen3.8 Max 0902 (High)1 183
DeepSeek V4 Flash 0731 (High)1 181
GPT-5.6 Terra (Medium)1 181
DeepSeek V4 Pro 08131 181
Claude Sonnet 5 (High)1 177XGrok 4.6 (High)1 151
Kimi K31 151
GLM 5.31 105BSeed 2.1 Turbo1 077TInkling
Подробные результаты Версии, интервалы и сравнения
Под значениями — 95% интервалы неопределённости.
| Место | Модель / точная версия | Рейтинг | Доля побед | Сравнения |
|---|---|---|---|---|
| 1 | Gemini 3.1 Pro Preview (High)Googlegemini-20260219-reasoning-high | 1 256,995%: 1 219,77–1 292,2 | 57,69%95%: 55,65%–59,69% | 2 290 |
| 2 | Muse Spark 1.3 (Medium)Metamuse-20260902-reasoning-medium | 1 256,5195%: 1 225,46–1 288,96 | 57,53%95%: 55,47%–59,56% | 2 239 |
| 3 | GPT-6 Astra (High)OpenAIastra-20260903-reasoning-high | 1 244,2795%: 1 209,05–1 280,5 | 55,77%95%: 53,71%–57,81% | 2 252 |
| 4 | Gemini 3.7 FlashGoogle3.7-flash | 1 239,5395%: 1 207,44–1 270,69 | 57,74%95%: 56,18%–59,29% | 3 888 |
| 5 | GPT-5.6 Sol (Medium)OpenAIsol-20260709-reasoning-medium | 1 235,3595%: 1 197,89–1 271,6 | 54,58%95%: 52,5%–56,64% | 2 217 |
| 6 | GPT-5.6 Sol (XHigh)OpenAIsol-20260709-reasoning-xhigh | 1 233,7195%: 1 199,49–1 268,49 | 54,3%95%: 52,25%–56,33% | 2 293 |
| 7 | GPT-5.6 SolOpenAI5.6-sol | 1 233,5695%: 1 202,69–1 263,6 | 56,88%95%: 55,26%–58,48% | 3 650 |
| 8 | GPT-6 Astra (Medium)OpenAIastra-20260903-reasoning-medium | 1 233,2295%: 1 197,18–1 267,51 | 54,28%95%: 52,19%–56,35% | 2 209 |
| 9 | GPT-5.6 Luna (Medium)OpenAI5.6-luna-reasoning-medium | 1 229,9895%: 1 193,28–1 266,53 | 53,61%95%: 51,53%–55,68% | 2 216 |
| 10 | Claude Fable 5.1Anthropicfable-5.1-reasoning-high | 1 218,0795%: 1 190,02–1 247,55 | 54,45%95%: 52,81%–56,08% | 3 559 |
| 11 | GPT-6 Astra (Low)OpenAIastra-20260903-reasoning-low | 1 216,8595%: 1 184,16–1 252,6 | 51,62%95%: 49,51%–53,72% | 2 164 |
| 12 | Gemini 3.8 FlashGoogle3.8-flash | 1 209,4895%: 1 179,85–1 241,15 | 53,01%95%: 51,38%–54,63% | 3 605 |
| 13 | Claude Opus 5Anthropicopus-5 | 1 204,495%: 1 174,3–1 234,52 | 52,51%95%: 50,88%–54,14% | 3 601 |
| 14 | Qwen3.8 Max 0902 (High)Alibabaqwen-20260902-reasoning-high | 1 201,5395%: 1 164,5–1 242,35 | 49,41%95%: 47,27%–51,54% | 2 103 |
| 15 | DeepSeek V4 Flash 0731 (High)DeepSeekv4-flash-0731-reasoning-high | 1 183,4895%: 1 144,47–1 219,31 | 46,62%95%: 44,53%–48,73% | 2 162 |
| 16 | GPT-5.6 Terra (Medium)OpenAI5.6-terra-reasoning-medium | 1 181,1395%: 1 146,41–1 216,72 | 46,48%95%: 44,38%–48,6% | 2 145 |
| 17 | DeepSeek V4 Pro 0813DeepSeekv4-pro-0813 | 1 181,0595%: 1 148,96–1 212,56 | 48,86%95%: 47,23%–50,49% | 3 594 |
| 18 | Claude Sonnet 5 (High)Anthropicsonnet-5-reasoning-high | 1 180,5595%: 1 141,9–1 215,58 | 46,27%95%: 44,17%–48,39% | 2 146 |
| 19 | Grok 4.6 (High)xAIgrok-20260810-reasoning-high | 1 176,7895%: 1 137–1 213,39 | 45,72%95%: 43,61%–47,84% | 2 126 |
| 20 | Kimi K3Moonshot AIk3 | 1 151,295%: 1 115,56–1 184,9 | 44,15%95%: 42,53%–45,79% | 3 556 |
| 21 | GLM 5.3Z.ai5.3 | 1 151,1495%: 1 118,79–1 183,24 | 44,2%95%: 42,59%–45,82% | 3 631 |
| 22 | Seed 2.1 TurboByteDance Seed2.1-turbo | 1 104,5995%: 1 070,36–1 138,51 | 37,46%95%: 35,85%–39,09% | 3 420 |
| 23 | InklingThinking Machinesinkling | 1 076,7495%: 1 041,8–1 110,78 | 33,53%95%: 31,98%–35,11% | 3 478 |
Близкие оценки и пересекающиеся интервалы не доказывают превосходство одной модели. До 200 сравнений результат предварительный. Подробнее о расчёте
Сохранённый снимок от 2026-09-13T00:05:47.311Z. Проверяем обновления…