Бенчмарк художественной прозы Novelmint измеряет то единственное, чего никогда не делают карточки моделей: способна ли модель написать сцену, которую читатель не пропустит. Это не таблица лидеров, позаимствованная из математических или программных тестов, — она оценивает настоящую романную прозу. Ниже подробно описано, как получаются эти цифры, чтобы вы могли взвесить их самостоятельно и уверенно на них ссылаться.
Что измеряется
Бенчмарк оценивает, насколько хорошо передовые модели — от Anthropic, OpenAI, Google и xAI — пишут художественную прозу. Не то, как они рассуждают, не то, как они пишут код, не то, как они справляются с тестами с вариантами ответов. Каждой модели задаётся один и тот же набор прописанных сцен — сцены с обязательными элементами, запрещёнными знаниями, точкой зрения и драматической целью, — а написанное оценивается как художественный текст, так, как его читает редактор.
Всё выражается в единой шкале от 0 до 100 по каждой оси, так что цифры напрямую сопоставимы между моделями и между типами сцен, из которых в действительности состоит книга.
Девять осей
Художественная проза — это не один навык, поэтому бенчмарк не сводит её к одному числу. Он оценивает девять осей, разделённых на два семейства с разным смыслом.
Четыре оси мастерства измеряют, насколько хорошо модель пишет, вне зависимости от темы: literary (образ на уровне предложения, ритм, подтекст, сдержанность), dialogue (звучат ли персонажи как разные люди), fidelity (насколько точно воспроизведена прописанная сцена — с обязательными элементами и без запрещённых знаний) и pacing (управление динамикой — когда сжимать, когда задерживаться).
Пять осей содержания измеряют, какой тип сцен модель пишет хорошо: emotion, physicality (действие и тело в пространстве), conflict, romance и eroticism (явный контент для взрослых). Это не рейтинги «лучше — хуже»: они говорят о том, для чего модель подходит. Модель может писать красивые предложения и при этом создавать вялые сцены драк — именно поэтому оси мастерства и содержания оцениваются и отображаются раздельно и никогда не усредняются в единую вводящую в заблуждение цифру.
Как оценивается каждая модель
Оценка — это слепое рецензирование. Каждая модель пишет один и тот же набор прописанных сцен, а группа сильных, разнородных по провайдерам судей-моделей оценивает каждый отрывок от 0 до 100 по каждой оси — не зная, какая модель его написала, и никогда не оценивая собственные работы. Разнородность судей по провайдерам важна: судья из семейства, не связанного с автором, замечает характерные черты, которые это семейство склонно поощрять.
Поскольку оценка слепая и перекрёстная, модель не может льстить себе, и ни один корпоративный стиль не задаёт стандарт.
Контроль предвзятости судей
Использование моделей для оценки моделей порождает четыре хорошо известные проблемы, и метод построен так, чтобы закрыть каждую из них.
Самопредпочтение — модель склонна поощрять собственный корпоративный стиль. Два правила устраняют это: модель никогда не оценивает собственный отрывок, а состав судей разнороден по провайдерам, так что вкус ни одного семейства не задаёт стандарт. Характерную черту, которую одно семейство поощряет, замечает судья из другого, и наоборот.
Многословие — судьи систематически переоценивают длину. Каждая сцена задаёт одинаковую цель — примерно 220 слов, — поэтому все отрывки приходят примерно одного размера, и «лить воду» ничего не даёт. Модель зарабатывает оценку тем, что делает с этими словами, а не тем, сколько их тратит.
Позиция — порядок появления отрывков может подтолкнуть оценки в пользу того, что появилось первым. Поэтому отрывки переименовываются и перемешиваются для каждой сцены, и каждый оценивается отдельно по фиксированной рубрике, а не в сравнении друг с другом. Порядок не несёт информации, а любой остаточный дрейф усредняется по многим сценам и многим судьям.
Сэмплирование — единственный удачный черновик может льстить модели. Генерация выполняется при температуре по умолчанию каждой модели на идентичном промпте, без индивидуальной настройки, так что ни одна модель не получает специально подобранного параметра, которого нет у других. И ни одна ячейка не основана на одном черновике: каждая модель оценивается по всему набору сцен каждой другой моделью группы, а затем смещается к нейтральному базовому уровню до накопления достаточного числа измерений — так что удача от одного черновика исчезает задолго до публикации цифры.
Почему оценки сжимаются с учётом уверенности
Сырое среднее по нескольким отрывкам — это шум, а шум, наряженный в оценку, хуже, чем отсутствие оценки вообще. Поэтому каждая опубликованная цифра сжимается к нейтральному базовому уровню 70 пропорционально тому, как мало данных стоит за ней — формально это априорное распределение, эквивалентное пяти наблюдениям. Ячейка, основанная на трёх удачных сэмплах, читается как примерно средняя, пока достаточное число измерений не заработает ей место; ячейка, основанная на сотнях измерений, читается как истинное измеренное значение.
Размер выборки за каждой цифрой показывается, а любая ячейка, опирающаяся менее чем на шесть наблюдений, отмечается как предварительная. Именно поэтому модель с малым объёмом данных никогда не взлетает на вершину случайно — метод этого не допускает.
Как сетка остаётся актуальной
Бенчмарк — это не разовый тест, который был проведён и заморожен. Это живая проекция хранилища оценок, на котором работает платформа: новые наблюдения судей добавляются в скользящее среднее, и счётчик выборки каждой ячейки растёт со временем, так что сетка уточняется, а не устаревает. На странице всегда отображается дата последней рекалибровки.
Одна мера предосторожности важна для точности. Когда постоянный псевдоним (указатель «latest») незаметно переключается на новую базовую модель, ячейки этой модели сбрасываются и измеряются заново с нуля, а не смешиваются с данными модели, которую она заменила, — так что смена версии никогда незаметно не портит столбец. Именно поэтому бенчмарк указывает конкретную версию, которую он измерял, а не общий ярлык.
Ограничения
Оценки описывают прозу только на основе сцен художественной литературы, оцениваемых в рамках данного набора моделей и промптов. Это не официальные рейтинги, одобренные провайдерами моделей, и они ничего не говорят о рассуждениях модели, её точности или безопасности вне контекста написания текстов. Названия моделей и торговые марки принадлежат их соответствующим владельцам; это независимое измерение.
Два вывода легко сделать ошибочно. Низкий балл по eroticism обычно отражает готовность — модель отказывается или переходит к клиническому стилю, — а не провал мастерства. А низкий балл уверенности означает «ещё не доказано», а не «доказана слабость». Всегда читайте цифру вместе с размером её выборки и помните, что лучшая модель для вашей книги зависит от того, на какие оси опирается ваша книга, — именно поэтому сетка хранит их раздельно.