Методология

Как работает бенчмарк художественных моделей

Updated July 23, 2026 · 6 мин чтения

Бенчмарк измеряет то, чего никогда не делают описания моделей: способность модели написать сцену, которую читатель не пропустит. Эта страница объясняет, как именно формируются цифры — что измеряется, как оцениваются модели, почему оценки сжимаются по достоверности и как таблица остаётся актуальной, — чтобы вы могли взвесить результаты самостоятельно и точно на них ссылаться.

Key takeaways

  • Ведущие модели пишут одинаковые заданные сцены романа, а слепая разнородная коллегия судей оценивает прозу по девяти осям (0–100), не зная, какая модель её написала.
  • Девять осей в двух группах: четыре оси мастерства (литературность, диалог, точность, темп) — насколько хорошо модель пишет; пять осей содержания (эмоции, физичность, конфликт, романтика, эротика) — какие сцены ей удаются. Они никогда не усредняются вместе.
  • Каждая оценка сжимается к нейтральной базе 70 пропорционально объёму данных (априор, равный пяти наблюдениям), чтобы удачная малая выборка не могла оказаться на вершине. Размеры выборок показаны; ячейки с малым объёмом отмечены.
  • Таблица обновляется в реальном времени — новые наблюдения судей включаются в накопленное среднее, а при смене версии модели её ячейки сбрасываются и измеряются заново, а не смешиваются с предыдущей версией.
  • Оценки описывают прозу только на заданных сценах художественной литературы; это независимое измерение, а не официальный рейтинг провайдера; низкая оценка эротики обычно отражает готовность модели, а не качество письма.

Бенчмарк художественной прозы Novelmint измеряет то единственное, чего никогда не делают карточки моделей: способна ли модель написать сцену, которую читатель не пропустит. Это не таблица лидеров, позаимствованная из математических или программных тестов, — она оценивает настоящую романную прозу. Ниже подробно описано, как получаются эти цифры, чтобы вы могли взвесить их самостоятельно и уверенно на них ссылаться.

Что измеряется

Бенчмарк оценивает, насколько хорошо передовые модели — от Anthropic, OpenAI, Google и xAI — пишут художественную прозу. Не то, как они рассуждают, не то, как они пишут код, не то, как они справляются с тестами с вариантами ответов. Каждой модели задаётся один и тот же набор прописанных сцен — сцены с обязательными элементами, запрещёнными знаниями, точкой зрения и драматической целью, — а написанное оценивается как художественный текст, так, как его читает редактор.

Всё выражается в единой шкале от 0 до 100 по каждой оси, так что цифры напрямую сопоставимы между моделями и между типами сцен, из которых в действительности состоит книга.

Девять осей

Художественная проза — это не один навык, поэтому бенчмарк не сводит её к одному числу. Он оценивает девять осей, разделённых на два семейства с разным смыслом.

Четыре оси мастерства измеряют, насколько хорошо модель пишет, вне зависимости от темы: literary (образ на уровне предложения, ритм, подтекст, сдержанность), dialogue (звучат ли персонажи как разные люди), fidelity (насколько точно воспроизведена прописанная сцена — с обязательными элементами и без запрещённых знаний) и pacing (управление динамикой — когда сжимать, когда задерживаться).

Пять осей содержания измеряют, какой тип сцен модель пишет хорошо: emotion, physicality (действие и тело в пространстве), conflict, romance и eroticism (явный контент для взрослых). Это не рейтинги «лучше — хуже»: они говорят о том, для чего модель подходит. Модель может писать красивые предложения и при этом создавать вялые сцены драк — именно поэтому оси мастерства и содержания оцениваются и отображаются раздельно и никогда не усредняются в единую вводящую в заблуждение цифру.

Как оценивается каждая модель

Оценка — это слепое рецензирование. Каждая модель пишет один и тот же набор прописанных сцен, а группа сильных, разнородных по провайдерам судей-моделей оценивает каждый отрывок от 0 до 100 по каждой оси — не зная, какая модель его написала, и никогда не оценивая собственные работы. Разнородность судей по провайдерам важна: судья из семейства, не связанного с автором, замечает характерные черты, которые это семейство склонно поощрять.

Поскольку оценка слепая и перекрёстная, модель не может льстить себе, и ни один корпоративный стиль не задаёт стандарт.

Контроль предвзятости судей

Использование моделей для оценки моделей порождает четыре хорошо известные проблемы, и метод построен так, чтобы закрыть каждую из них.

Самопредпочтение — модель склонна поощрять собственный корпоративный стиль. Два правила устраняют это: модель никогда не оценивает собственный отрывок, а состав судей разнороден по провайдерам, так что вкус ни одного семейства не задаёт стандарт. Характерную черту, которую одно семейство поощряет, замечает судья из другого, и наоборот.

Многословие — судьи систематически переоценивают длину. Каждая сцена задаёт одинаковую цель — примерно 220 слов, — поэтому все отрывки приходят примерно одного размера, и «лить воду» ничего не даёт. Модель зарабатывает оценку тем, что делает с этими словами, а не тем, сколько их тратит.

Позиция — порядок появления отрывков может подтолкнуть оценки в пользу того, что появилось первым. Поэтому отрывки переименовываются и перемешиваются для каждой сцены, и каждый оценивается отдельно по фиксированной рубрике, а не в сравнении друг с другом. Порядок не несёт информации, а любой остаточный дрейф усредняется по многим сценам и многим судьям.

Сэмплирование — единственный удачный черновик может льстить модели. Генерация выполняется при температуре по умолчанию каждой модели на идентичном промпте, без индивидуальной настройки, так что ни одна модель не получает специально подобранного параметра, которого нет у других. И ни одна ячейка не основана на одном черновике: каждая модель оценивается по всему набору сцен каждой другой моделью группы, а затем смещается к нейтральному базовому уровню до накопления достаточного числа измерений — так что удача от одного черновика исчезает задолго до публикации цифры.

Почему оценки сжимаются с учётом уверенности

Сырое среднее по нескольким отрывкам — это шум, а шум, наряженный в оценку, хуже, чем отсутствие оценки вообще. Поэтому каждая опубликованная цифра сжимается к нейтральному базовому уровню 70 пропорционально тому, как мало данных стоит за ней — формально это априорное распределение, эквивалентное пяти наблюдениям. Ячейка, основанная на трёх удачных сэмплах, читается как примерно средняя, пока достаточное число измерений не заработает ей место; ячейка, основанная на сотнях измерений, читается как истинное измеренное значение.

Размер выборки за каждой цифрой показывается, а любая ячейка, опирающаяся менее чем на шесть наблюдений, отмечается как предварительная. Именно поэтому модель с малым объёмом данных никогда не взлетает на вершину случайно — метод этого не допускает.

Как сетка остаётся актуальной

Бенчмарк — это не разовый тест, который был проведён и заморожен. Это живая проекция хранилища оценок, на котором работает платформа: новые наблюдения судей добавляются в скользящее среднее, и счётчик выборки каждой ячейки растёт со временем, так что сетка уточняется, а не устаревает. На странице всегда отображается дата последней рекалибровки.

Одна мера предосторожности важна для точности. Когда постоянный псевдоним (указатель «latest») незаметно переключается на новую базовую модель, ячейки этой модели сбрасываются и измеряются заново с нуля, а не смешиваются с данными модели, которую она заменила, — так что смена версии никогда незаметно не портит столбец. Именно поэтому бенчмарк указывает конкретную версию, которую он измерял, а не общий ярлык.

Ограничения

Оценки описывают прозу только на основе сцен художественной литературы, оцениваемых в рамках данного набора моделей и промптов. Это не официальные рейтинги, одобренные провайдерами моделей, и они ничего не говорят о рассуждениях модели, её точности или безопасности вне контекста написания текстов. Названия моделей и торговые марки принадлежат их соответствующим владельцам; это независимое измерение.

Два вывода легко сделать ошибочно. Низкий балл по eroticism обычно отражает готовность — модель отказывается или переходит к клиническому стилю, — а не провал мастерства. А низкий балл уверенности означает «ещё не доказано», а не «доказана слабость». Всегда читайте цифру вместе с размером её выборки и помните, что лучшая модель для вашей книги зависит от того, на какие оси опирается ваша книга, — именно поэтому сетка хранит их раздельно.

Questions

Frequently asked

Как Novelmint тестирует AI-модели на художественную литературу?
Каждая ведущая модель пишет одинаковые заданные сцены романа, а слепая разнородная коллегия судей оценивает прозу по девяти осям (0–100), не зная автора. Оценки сжимаются к нейтральной базе в зависимости от объёма данных, а наблюдения накапливаются в скользящем среднем.
Что такое девять осей?
Четыре оси мастерства — литературность, диалог, точность (соответствие заданию) и темп — показывают, насколько хорошо модель пишет. Пять осей содержания — эмоции, физичность (действие), конфликт, романтика и эротика — показывают, какие сцены ей удаются. Мастерство и содержание отображаются отдельно и никогда не усредняются.
Почему оценки корректируются по достоверности?
Простое среднее по нескольким отрывкам — это шум. Каждая оценка сжимается к нейтральной базе 70 пропорционально объёму данных (априор, равный пяти наблюдениям), чтобы удачная малая выборка не могла оказаться на вершине. Размер выборки показан; ячейки с менее чем шестью наблюдениями отмечены как предварительные.
Это официальный рейтинг от OpenAI, Anthropic, Google или xAI?
Нет. Это независимое измерение Novelmint — только для прозы художественной литературы, оцениваемой по данному набору моделей и промптов. Оно ничего не говорит о логике, точности или других возможностях; названия моделей являются товарными знаками их владельцев.
Как часто обновляется бенчмарк?
Непрерывно — новые наблюдения судей включаются в накопленное среднее, и выборки растут, так что таблица со временем становится точнее. Когда версия модели меняется под тем же псевдонимом, её ячейки сбрасываются и измеряются заново, а не смешиваются со старой версией. На странице указана дата последней перекалибровки.

What this page does not claim

  • Оценки относительны — по отношению к оцениваемому набору моделей и использованным промптам, а не абсолютный или официальный рейтинг.
  • Низкая оценка эротики отражает готовность модели (отказ или переход к нейтральному стилю), а не недостаток мастерства; низкая оценка с малой выборкой означает «ещё не доказано», а не «доказана слабость».
  • Бенчмарк измеряет только прозу художественной литературы и ничего не говорит о логике, коде, фактической точности или безопасности за пределами контекста письма.

Узнайте, какая модель лучше всего напишет вашу сцену.

Актуальные данные по девяти осям, обновляемые по мере измерения новых текстов.