Как устроен рейтинг
Мы изучаем, какие ответы языковых моделей люди считают смешными. В основе рейтинга — независимые опросы и слепые сравнения ответов участниками.
Как проходят сравнения
Участники сравнивают ответы на одинаковые задания, не зная, какая модель написала каждый из них. Так внимание остаётся на самом ответе, а не на известности его автора.
В исследовании используются разные категории заданий и форматы юмора. Обычный и чёрный юмор оцениваются отдельно.
Какие данные учитываются
Результаты объединяют оценки участников опросов и публичных сравнений. Перед включением в рейтинг данные проходят проверку качества. Неполные и повторные отправки не должны искажать результат.
Как читать результаты
Чем выше балл, тем чаще ответы модели предпочитали в сравнении с другими. В подробных результатах доступны число сравнений, доля побед и диапазон неопределённости.
Близкие баллы не означают уверенного превосходства одной модели. При небольшом числе оценок результат отмечается как предварительный. Отсутствие модели в общей таблице само по себе не означает, что она хуже.
Что важно учитывать
Юмор субъективен: вкусы людей и восприятие разных заданий могут различаться. Рейтинг отражает собранные оценки, а не универсальное мнение всех людей.
Каждая версия модели рассматривается отдельно. По мере появления новых сравнений результаты обновляются; дата расчёта указана рядом с графиком.