Humor Arena
Исследование юмора ИИСрез 8 сентября 2026Около 12 минут чтения

Умеют ли нейросети смешно шутить? Проверили и собрали результаты

Две удачные шутки. Типичная картина пилота: 48% «Не смешно». Как мы это считаем – и где вывод не следует из удобной цифры.

Содержание статьи

Мы предложили нейросетям задания на юмор, а людям – оценить их ответы. Хотели проверить, какие модели лучше шутят на русском. Начнём с двух примеров: Gemini 3.7 Flash экономит на пакетах, а GLM 5.3 придумывает неприятный сюрприз для арендатора.

Модель: Gemini 3.7 Flash. Продолжите фразу: «Моя финансовая грамотность началась с фразы…» «Пакет брать будете? – Нет, спасибо, я в капюшон сложу». Смешно: 8 из 24; Улыбнуло: 8 из 24; Слабовато: 4 из 24; Не смешно: 4 из 24
Текст карточки

Модель: Gemini 3.7 Flash. Продолжите фразу: «Моя финансовая грамотность началась с фразы…» «Пакет брать будете? – Нет, спасибо, я в капюшон сложу». Смешно: 8 из 24; Улыбнуло: 8 из 24; Слабовато: 4 из 24; Не смешно: 4 из 24

Модель: GLM 5.3. Худшее, что можно увидеть, переступая порог съёмной квартиры: …предыдущий жилец, который всё ещё живёт там и тоже удивлён, что ты приехал. Смешно: 9 из 26; Улыбнуло: 4 из 26; Слабовато: 5 из 26; Не смешно: 8 из 26
Текст карточки

Модель: GLM 5.3. Худшее, что можно увидеть, переступая порог съёмной квартиры: …предыдущий жилец, который всё ещё живёт там и тоже удивлён, что ты приехал. Смешно: 9 из 26; Улыбнуло: 4 из 26; Слабовато: 5 из 26; Не смешно: 8 из 26

Два ответа и реакции на них. Проценты округлены.

Эти два ответа – удачные, а выборки маленькие: 24 и 26 оценок. По всем 32 472 оценкам доля положительных – «Улыбнуло» или «Смешно» – около 32%, а «Не смешно» – почти половина. Если же у двух примеров считать только высшую оценку, получится почти одинаково: 33% и 35%. Метрика меняет картину.

Имена моделей приведены как в интерфейсе и логах Арены на дату снимка, включая превью и внутренние ярлыки, и сверены с сохранёнными ответами. Они не обязательно совпадают с публичными маркетинговыми названиями вендоров.

Мы делаем Арену юмора – исследуем юмор языковых моделей. Собранные данные уже идут в обучение нашей модели. Подтверждённого улучшения win-rate / uplift в этой статье нет. Нам нужны данные для двух связанных задач: создавать удачные шутки и распознавать их среди нескольких ответов. Для второй задачи пригодны reward-модели – системы, которые учатся предсказывать человеческие предпочтения.

Что есть в наших данных

В исследовании на 8 сентября 2026 года мы собрали 32 472 оценки для 1 608 ответов на 69 русскоязычных заданий. Среди заданий – продолжения фраз, реплики для заданной ситуации и новые расшифровки аббревиатур. В наборе представлены 23 конфигурации: модель вместе с её настройками, например High или Medium. Одна модель может занимать несколько строк рейтинга.

32 472 оценки юмора нейросетей

1 608 разных ответов
69 заданий на русском
23 конфигурации
Результаты на 8 сентября 2026 года.

В этой статье оценки показаны только в агрегированном виде; для их хранения используются псевдонимные идентификаторы участников. По правилам сервиса, оценки используются для исследований и рейтингов, а опубликованные авторские ответы, в том числе в Battle, могут использоваться для обучения моделей.

Это пилот, а не репрезентативный опрос населения: результаты описывают собранные задания и оценки.

Каждый ответ получает две характеристики. Первая – насколько он смешной сам по себе: 0 – «Не смешно», 1 – «Слабовато», 2 – «Улыбнуло», 3 – «Смешно». Вторая – какое место он занимает среди ответов на то же задание. Названия моделей во время оценки скрыты, а одинаково понравившиеся ответы можно оставить на равных местах.

Лучший из четырёх ответов может всё равно оказаться несмешным. Если просить только выбрать победителя, мы потеряем эту информацию. Поэтому «всё не смешно» – содержательный результат, а не ошибка участника.

Первая формула: насколько понравилась конкретная шутка

На карточках выше крупно показана доля двух положительных категорий. Её легко посчитать:

Доля положительных оценок =
(число «Улыбнуло» + число «Смешно») / все оценки

Для капюшона: (8 + 8) / 24 ≈ 67%.
Для квартиры: (4 + 9) / 26 = 50%.

Такой показатель отвечает на вопрос: «Как часто этот ответ получал хотя бы “Улыбнуло”?» Он не отличает лёгкую улыбку от высшей оценки, поэтому рядом мы показываем все четыре категории. Только по большому проценту нельзя понять, какую именно реакцию вызвал текст.

Для любопытных: что показывает средний балл

Это арифметическая иллюстрация, не метрика выбора победителя.

Можно посчитать и средний балл: умножить каждую оценку на число её повторений, сложить и разделить на общее число оценок. Для капюшона получится (0 × 4 + 1 × 4 + 2 × 8 + 3 × 8) / 24 ≈ 1,83. Для квартиры – 1,54. Но здесь мы условно считаем расстояние между соседними категориями одинаковым. Это удобная арифметика, а не измерение силы смеха.

Кроме того, среднее скрывает несогласие: две оценки «0» и «3» дают 1,5, хотя никто не выбрал середину шкалы. Поэтому для обучения полезно сохранять распределение реакций, а не только одно итоговое число.

Как люди оценили шутки нейросетей

Мы собрали 32 472 оценки. Каждый раз участник выбирал один из четырёх вариантов оценки – от «Не смешно» до «Смешно».

Не смешно48%
Так ответили 15 531 раз
Слабовато20%
Так ответили 6 633 раз
Улыбнуло19%
Так ответили 6 120 раз
Смешно13%
Так ответили 4 188 раз
32%оценок – «Улыбнуло»
или «Смешно»
То есть примерно в 32 случаях из 100 участники выбирали «Улыбнуло» или «Смешно». Это доля оценок: одну шутку могли оценить по-разному. Проценты округлены.

В нашем наборе около 13% оценок – «Смешно», ещё 19% – «Улыбнуло». Это доли оценок, не доли уникальных шуток: один ответ оценивался несколько раз. Подборка удачных примеров вроде той, что открывает статью, не показывает типичную выдачу – на общем графике преобладают две нижние категории.

У нас встретилась показательная деталь: расшифровка ЖКХ «Жалуйся Кому Хочешь» из ответа Claude Fable 5.1 есть в газетной публикации 2010 года. Была ли она в обучающих данных или получилась независимо, неизвестно. Оригинальность приходится проверять отдельно от смешности.

Как из человеческого выбора получается рейтинг моделей

Для рейтинга используется другой сигнал: какой ответ предпочли на одном и том же задании. Из порядка четырёх ответов можно получить до шести попарных сравнений. Например, запись «А = Б > В > Г» означает, что А и Б лучше В и Г, а В лучше Г. Между А и Б победителя нет – такую пару мы не превращаем в победу одного из них.

Пары с определённым предпочтением входят в модель Bradley–Terry. Она подбирает для каждой нейросети положительное число s – относительную силу. Вероятность предпочтения ответа модели A перед ответом B описывается так:

P(A лучше B) = sA / (sA + sB)

Если силы одинаковые, вероятность равна 50%. Если сила A вдвое выше силы B, получится 2 / (2 + 1) ≈ 67%.

Силы подбираются совместно по всем допустимым сравнениям: расчёт ищет значения, при которых наблюдавшиеся выборы людей наиболее вероятны. В нашем рейтинге каждое допустимое сравнение имеет одинаковый вес. Успех против сильного соперника и успех против слабого учитываются в общей системе, поэтому результат не сводится к простому проценту побед.

Чтобы показать силы в удобной шкале, мы переводим их в баллы:

R = 1200 + 400 · log10(s)

Это шкала отображения, а не количество смешных шуток. Разница в 100 баллов соответствует примерно 64% вероятности предпочтения по формуле модели. Это шкала отображения Bradley–Terry по накопленному снимку, не online Elo после каждого голоса.

Перестановка тех же голосов не меняет постановку расчёта. При этом метод не устраняет перекосы в заданиях или составе аудитории: рейтинг относится к тем условиям, в которых собраны данные.

Есть и важное ограничение. Если группы моделей не связаны сравнениями, общий рейтинг для них построить нельзя.

Почему одного места в таблице мало

Разница в несколько баллов ещё не доказывает, что одна модель лучше другой. Мы показываем 95%-интервалы неопределённости, полученные с помощью bootstrap: многократно пересобираем выборку и повторяем расчёт. В реализации повторная выборка идёт по участникам и заданиям, чтобы учитывать зависимость оценок внутри этих групп.

Это особенно важно для четырёх ответов на одном экране. Шесть сравнений из них – не шесть независимых людей. Если считать каждую такую пару совершенно независимой, можно получить неоправданно узкие интервалы и слишком уверенную таблицу лидеров.

Узкий интервал не делает выборку репрезентативной. И перекрытие интервалов само по себе не является формальным тестом равенства двух моделей. Для читателя практический вывод проще: смотрите вместе на балл, интервал, число сравнений и состав заданий. Подробности расчёта – в методологии Арены юмора.

Reward-модель: научить ИИ выбирать смешное

Рейтинг даёт один балл нейросети в целом. Reward-модель решает более конкретную задачу: получает задание x и ответ y, после чего выдаёт оценку r(x, y). Например, она должна различать удачное продолжение фразы про финансовую грамотность и формально корректный, но скучный ответ на ту же фразу.

Учимся на парах предпочтений людей на одном задании: модель должна поставить выбранному ответу более высокий балл, чем проигравшему.

Для любопытных: формула обучения reward-модели

Для обучения подходят пары с человеческим предпочтением: одно задание, выбранный ответ и проигравший ответ. Распространённый способ обучения задаёт вероятность правильного выбора через разницу предсказанных оценок:

P(выбранный ответ лучше) = σ(r+ − r)
σ(z) = 1 / (1 + e−z)
L = −log σ(r+ − r)

r+ – оценка предпочитаемого ответа, r – другого. L – ошибка, которую уменьшают при обучении.

Если reward-модель дала обоим ответам одинаковый балл, она предсказывает выбор с вероятностью 50%. Если поставила выше ответ, который предпочли люди, ошибка уменьшается. Так модель учится находить в тексте признаки, связанные с человеческими предпочтениями. Этот подход к обучению по сравнениям используется, например, в InstructGPT.

Равные места требуют отдельного обращения: нельзя произвольно назначить одному ответу метку победителя. Их можно исключать из обучения на строгих предпочтениях или использовать функцию потерь, поддерживающую ничьи. Абсолютные оценки 0–3 тоже пригодны – например, как дополнительная задача предсказания категории. Это помогает не путать «лучше другого ответа» с «хорошо само по себе».

Данные уже идут в обучение. В этой статье мы не показываем подтверждённого улучшения генератора или преимущества отбора reward-моделью перед случайным выбором. Ниже – только метод, который позволяет это проверить.

Как это помогает генератору – и где он может нас обмануть

Reward-модель можно использовать для отбора: генератор предлагает несколько вариантов, оценщик выбирает наиболее удачный. Проверить пользу можно, сравнив человеческие оценки этого выбора со случайным выбором из тех же вариантов. Такой эксперимент измеряет качество отбора; сам генератор от него ещё не меняется.

Следующее применение – обучение генератора. Человеческие предпочтения можно использовать напрямую для оптимизации модели, а оценки reward-модели – как сигнал в обучении с подкреплением. Тогда приходится следить, чтобы генератор не научился получать высокий балл у оценщика за счёт повторов, длины ответа или знакомых формулировок, которые людям уже не нравятся.

Для проверки улучшений нужны отложенные задания, включая защиту от близких переформулировок обучающих примеров. Исходную и новую версии следует показывать вслепую, а финальное качество оценивать людьми. Рост балла собственного reward-оценщика сам по себе не доказывает, что ответы стали смешнее.

И ещё: предсказывать человеческий выбор – не то же самое, что понимать юмор во всех смыслах. Можно отдельно проверять, замечает ли модель несоответствие в шутке, объясняет ли двойной смысл, отличает ли намеренную нелепость от ошибки и переносит ли эти умения на новые темы. Наши оценки дают материал для такой работы, но не заменяют все эти проверки.

Посмотреть бенчмарк или попробовать самому

Рейтинг на сайте обновляется; цифры этой статьи зафиксированы на 8 сентября. В публичном рейтинге другой набор допустимых сравнений, поэтому его лидеров нельзя напрямую сопоставлять с 32 472 оценками нашего пилота. На отдельном снимке публичного рейтинга от 13 сентября 2026 года верхние строки занимали Gemini 3.1 Pro Preview (High), Muse Spark 1.3 (Medium) и GPT-6 Astra (High). Актуальный порядок – на странице бенчмарка; эти имена не объявляют окончательного победителя исследования.

Оценки и ответы проходят технические проверки, в сервисе действуют правила модерации. Полное исключение накрутки и заимствований из рейтинга и обучающих данных мы не гарантируем.

Мы продолжаем обучение своей модели. О результатах экспериментов с генерацией и оценкой юмора будем писать в следующих статьях и в Telegram-канале Арены.

Исследовательские цифры относятся к русскоязычному обычному режиму на 8 сентября 2026 года. Пилот не является репрезентативным опросом населения. Примеры выбраны для статьи. Имена моделей сверены с сохранёнными ответами; метод рейтинга – с реализацией проекта. Описание reward-обучения отделено от результатов собственных экспериментов.

А вам смешно?

Прочитайте ответы нейросетей и оцените их. «Не смешно» – тоже полезный ответ.

Лидеры на сайте меняются. 32 472 оценки в статье – фиксированный срез на 8 сентября 2026 года.