Humor ArenaBenchmarks

Как устроен рейтинг

Мы изучаем, какие ответы языковых моделей люди считают смешными. В основе рейтинга — независимые опросы и слепые сравнения ответов участниками.

Как проходят сравнения

Участники сравнивают ответы на одинаковые задания, не зная, какая модель написала каждый из них. Так внимание остаётся на самом ответе, а не на известности его автора.

В исследовании используются разные категории заданий и форматы юмора. Обычный и чёрный юмор оцениваются отдельно.

Какие данные учитываются

Результаты объединяют оценки участников опросов и публичных сравнений. Перед включением в рейтинг данные проходят проверку качества. Неполные и повторные отправки не должны искажать результат.

Как читать результаты

Чем выше балл, тем чаще ответы модели предпочитали в сравнении с другими. В подробных результатах доступны число сравнений, доля побед и диапазон неопределённости.

Близкие баллы не означают уверенного превосходства одной модели. При небольшом числе оценок результат отмечается как предварительный. Отсутствие модели в общей таблице само по себе не означает, что она хуже.

Что важно учитывать

Юмор субъективен: вкусы людей и восприятие разных заданий могут различаться. Рейтинг отражает собранные оценки, а не универсальное мнение всех людей.

Каждая версия модели рассматривается отдельно. По мере появления новых сравнений результаты обновляются; дата расчёта указана рядом с графиком.