Humor ArenaBenchmarks

Бенчмарк юмора

Слепые сравнения языковых моделей людьми.

Русский язык 23 моделей 32 278 наблюдений

Расчёт: 13.09.2026, 00:01:28 UTC

Рейтинг моделей · выше — лучшеПрокрутите, чтобы увидеть все модели ↔
Подробные результаты Версии, интервалы и сравнения

Под значениями — 95% интервалы неопределённости.

Обычный юмор: опубликованный рейтинг моделей
МестоМодель / точная версияРейтингДоля победСравнения
1Gemini 3.1 Pro Preview (High)Googlegemini-20260219-reasoning-high1 256,995%: 1 219,77–1 292,257,69%95%: 55,65%–59,69%2 290
2Muse Spark 1.3 (Medium)Metamuse-20260902-reasoning-medium1 256,5195%: 1 225,46–1 288,9657,53%95%: 55,47%–59,56%2 239
3GPT-6 Astra (High)OpenAIastra-20260903-reasoning-high1 244,2795%: 1 209,05–1 280,555,77%95%: 53,71%–57,81%2 252
4Gemini 3.7 FlashGoogle3.7-flash1 239,5395%: 1 207,44–1 270,6957,74%95%: 56,18%–59,29%3 888
5GPT-5.6 Sol (Medium)OpenAIsol-20260709-reasoning-medium1 235,3595%: 1 197,89–1 271,654,58%95%: 52,5%–56,64%2 217
6GPT-5.6 Sol (XHigh)OpenAIsol-20260709-reasoning-xhigh1 233,7195%: 1 199,49–1 268,4954,3%95%: 52,25%–56,33%2 293
7GPT-5.6 SolOpenAI5.6-sol1 233,5695%: 1 202,69–1 263,656,88%95%: 55,26%–58,48%3 650
8GPT-6 Astra (Medium)OpenAIastra-20260903-reasoning-medium1 233,2295%: 1 197,18–1 267,5154,28%95%: 52,19%–56,35%2 209
9GPT-5.6 Luna (Medium)OpenAI5.6-luna-reasoning-medium1 229,9895%: 1 193,28–1 266,5353,61%95%: 51,53%–55,68%2 216
10Claude Fable 5.1Anthropicfable-5.1-reasoning-high1 218,0795%: 1 190,02–1 247,5554,45%95%: 52,81%–56,08%3 559
11GPT-6 Astra (Low)OpenAIastra-20260903-reasoning-low1 216,8595%: 1 184,16–1 252,651,62%95%: 49,51%–53,72%2 164
12Gemini 3.8 FlashGoogle3.8-flash1 209,4895%: 1 179,85–1 241,1553,01%95%: 51,38%–54,63%3 605
13Claude Opus 5Anthropicopus-51 204,495%: 1 174,3–1 234,5252,51%95%: 50,88%–54,14%3 601
14Qwen3.8 Max 0902 (High)Alibabaqwen-20260902-reasoning-high1 201,5395%: 1 164,5–1 242,3549,41%95%: 47,27%–51,54%2 103
15DeepSeek V4 Flash 0731 (High)DeepSeekv4-flash-0731-reasoning-high1 183,4895%: 1 144,47–1 219,3146,62%95%: 44,53%–48,73%2 162
16GPT-5.6 Terra (Medium)OpenAI5.6-terra-reasoning-medium1 181,1395%: 1 146,41–1 216,7246,48%95%: 44,38%–48,6%2 145
17DeepSeek V4 Pro 0813DeepSeekv4-pro-08131 181,0595%: 1 148,96–1 212,5648,86%95%: 47,23%–50,49%3 594
18Claude Sonnet 5 (High)Anthropicsonnet-5-reasoning-high1 180,5595%: 1 141,9–1 215,5846,27%95%: 44,17%–48,39%2 146
19Grok 4.6 (High)xAIgrok-20260810-reasoning-high1 176,7895%: 1 137–1 213,3945,72%95%: 43,61%–47,84%2 126
20Kimi K3Moonshot AIk31 151,295%: 1 115,56–1 184,944,15%95%: 42,53%–45,79%3 556
21GLM 5.3Z.ai5.31 151,1495%: 1 118,79–1 183,2444,2%95%: 42,59%–45,82%3 631
22Seed 2.1 TurboByteDance Seed2.1-turbo1 104,5995%: 1 070,36–1 138,5137,46%95%: 35,85%–39,09%3 420
23InklingThinking Machinesinkling1 076,7495%: 1 041,8–1 110,7833,53%95%: 31,98%–35,11%3 478

Близкие оценки и пересекающиеся интервалы не доказывают превосходство одной модели. До 200 сравнений результат предварительный. Подробнее о расчёте

Сохранённый снимок от 2026-09-13T00:05:47.311Z. Проверяем обновления…