Бенчмарк моделей для художественной прозы

Какая AI-модель на самом деле пишет лучшую художественную прозу?

Live data · measured as of July 24, 2026

Каждая карточка модели измеряет математику, программирование и логику. Ни одна не измеряет, способна ли модель написать сцену, которую читатель не захочет пропустить. Поэтому мы создали этот бенчмарк. Слепая судейская панель оценивает реально сгенерированный романный текст ведущих моделей по девяти осям — четырём осям мастерства и пяти осям содержания — и числа ниже отражают живой результат. Это не маркетинговый график: это именно та таблица, по которой Novelmint выбирает модель для каждого эпизода вашей книги.

Key takeaways

  • Бенчмарк оценивает ведущие модели от Anthropic, OpenAI, Google и xAI на реальном сгенерированном романном тексте — не тестах с выбором ответа — по девяти осям: четырём мастерства (литературность, диалог, точность, темп) и пяти содержания (эмоции, физичность, конфликт, романтика, эротика).
  • Оси мастерства измеряют, КАК ХОРОШО модель пишет; оси содержания — КАКОЙ ТИП сцены она пишет хорошо. Модель может создавать красивые предложения и при этом писать невыразительные сцены драки, поэтому обе категории оцениваются отдельно и никогда не усредняются в одно вводящее в заблуждение число.
  • Каждый балл корректируется в сторону нейтрального базового значения 70 пропорционально объёму данных за ним, чтобы удачный результат на трёх образцах никогда не мог выдать себя за устоявшийся факт. Размер выборки за каждым числом указан.
  • Ни одна модель не выигрывает по всем осям. Сильнейшее литературное мастерство, наиболее стабильная точность, лучший экшен, и наиболее гибкая романтика и откровенный текст — всё это находится в разных столбцах, что само по себе является аргументом за распределение книги по моделям, а не за выбор одной.
  • Это та же таблица, которую Novelmint использует для выбора модели на каждый эпизод при создании главы — и тот же судья, который оценивает отрывок в процессе работы, её и пополняет, поэтому числа продолжают обновляться по мере того, как авторы пишут с движком. Это живой механизм, а не ретроспективное утверждение.

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

Это живые данные, а не разовое тестирование

Таблица ниже — не бенчмарк, который мы провели однажды и заморозили. Это живая проекция хранилища оценок платформы: тот же судья, который оценивает отрывок во время работы, пополняет эту таблицу, поэтому каждая глава, написанная на Novelmint, добавляет наблюдения, объёмы выборки растут, а числа становятся точнее. Чем больше авторов работает с движком, тем актуальнее бенчмарк — дата выше — это просто дата последней рекалибровки.

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

Как читать таблицу

Заголовочное число — это общее мастерство: среднее по четырём осям исполнения модели, что ближе всего к понятию «насколько хороша её проза». Оси содержания справа — не рейтинг «лучше или хуже»; они показывают, для чего модель ПОДХОДИТ. Высокий балл по физичности означает чёткий экшен; низкий балл по эротике обычно означает отказ или клиническую сухость, а не слабое письмо — готовность, а не навык. Читайте мастерство по столбцу для сравнения моделей и читайте содержание по строке, чтобы видеть сильные и слабые стороны каждой модели.

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

Генерируем реальную прозу, а не ответы на тесты

Каждая модель пишет одни и те же эпизоды — готовые сцены с обязательными элементами, запрещёнными знаниями, точкой зрения и драматической целью — в одинаковых условиях. Мы оцениваем результат как художественный текст, так, как его читает редактор, а не по принципу теста.

02

Слепая оценка по девяти осям

Судейская панель оценивает каждый отрывок по шкале 0–100 по четырём осям мастерства (литературность, диалог, точность, темп) и пяти осям содержания (эмоции, физичность, конфликт, романтика, эротика), не зная, какая модель его написала. Мастерство — это качество исполнения; содержание — соответствие типу сцены.

03

Коррекция к нейтральному приоритету

Простое среднее по нескольким образцам — это шум. Каждая ячейка притягивается к нейтральному базовому значению 70 пропорционально скудости доказательной базы, чтобы ранний случайный результат читался как примерно средний до накопления достаточного числа наблюдений. Публикуемое число — это скорректированное значение; рядом указан размер выборки.

04

Продолжать накопление, никогда не перезаписывать вручную

Новые оценки судей вливаются в скользящее среднее, счётчик выборки растёт, и таблица со временем уточняется. Числа генерируются из наблюдений, а не вводятся вручную; при смене версии модели под псевдонимом её ячейки сбрасываются для чистого повторного измерения, а не смешиваются с данными другой модели.

Where this leads

Почему такой бенчмарк вообще применим

Использовать разные модели для разных сцен возможно только если книга строится из отдельных, заранее готовых эпизодов, а не генерируется за один проход. Такой единицей является бит, а поддержание целостности истории при написании разных битов разными моделями — задача дуговой памяти с сущностями, которая сопровождает весь процесс. Бенчмарк — это таблица результатов; биты и дуговая память — то, что позволяет книге реально ими пользоваться.

Questions

Frequently asked

Какая AI-модель пишет лучшую художественную прозу?
По общему мастерству — среднему по осям литературности, диалога, точности и темпа на реальном романном тексте — в настоящее время лидирует Claude Opus 4.8, а GPT-5.6 Sol следует вплотную. Но понятие «лучший» зависит от сцены: высшие баллы по экшену, романтике и откровенному контенту принадлежат разным моделям. Таблица на этой странице показывает актуальные позиции и объём выборки за каждым числом.
Как измеряется этот бенчмарк?
Каждая модель пишет одинаковые готовые эпизоды в одинаковых условиях, а слепая судейская панель оценивает полученный текст по шкале 0–100 по девяти осям — четырём мастерства (литературность, диалог, точность, темп) и пяти содержания (эмоции, физичность, конфликт, романтика, эротика). Баллы корректируются к нейтральному базовому значению 70, чтобы малый объём данных не мог сильно сдвинуть число; рядом с каждым баллом указан размер выборки.
В чём разница между осями мастерства и осями содержания?
Оси мастерства измеряют, насколько хорошо модель пишет вне зависимости от темы — качество предложений, голос персонажей, точность следования брифу и контроль темпа. Оси содержания измеряют соответствие типу сцены: эмоции, физическое действие, конфликт, романтика и откровенный контент. Модель может создавать прекрасные предложения и при этом плохо справляться со сценой драки, поэтому обе категории оцениваются и отображаются отдельно.
Почему бы просто не выбрать одну лучшую модель и использовать её для всего?
Потому что ни одна модель не выигрывает по всем осям. Сильнейшее литературное мастерство, лучший экшен и наиболее способная романтика или откровенный текст принадлежат разным моделям. Novelmint маршрутизирует книгу по моделям побитово — сохраняя основной объём в одном голосе серии для связности и отклоняясь к более сильной модели на конкретных битах, которые того заслуживают — и это возможно только потому, что существует эта таблица.
Означает ли низкий балл, что модель плохая?
Не обязательно. Низкий балл по содержанию может означать, что модель способна, но не хочет — большинство моделей получают низкий балл по эротике, потому что отказывают или становятся клинически сухими, а не потому что им не хватает мастерства. А балл с низкой уверенностью (мало образцов) притягивается к нейтральному базовому значению и читается как «ещё не доказано», а не «доказанно слабо». Всегда читайте балл вместе с размером выборки.
Как часто обновляется бенчмарк?
Непрерывно. Таблица — живая проекция хранилища оценок платформы: тот же судья, который оценивает отрывок во время создания главы в Novelmint, вливает свои наблюдения обратно, поэтому числа меняются по мере использования движка авторами и роста объёмов выборки. На странице отображается дата последней рекалибровки. Новые версии моделей измеряются заново с нуля, а не смешиваются с предшественниками — смена версии никогда незаметно не портит столбец.

What this page does not claim

  • Этот бенчмарк измеряет только качество прозы и соответствие содержания требованиям художественного текста. Он ничего не говорит о логике модели, программировании, математике, фактической точности или безопасности за пределами контекста написания.
  • Баллы относительны к оцениваемой выборке и используемым промптам — это не абсолютный или официальный рейтинг, одобренный производителями моделей. Названия моделей и торговые марки принадлежат их владельцам.
  • Более высокий общий балл мастерства не означает, что модель подходит для любой книги — голос, жанр, потребности в контенте и стоимость тоже важны, именно поэтому Novelmint распределяет задачи по моделям, а не возводит одну на пьедестал.
  • Ячейки с малой выборкой носят предварительный характер. Там, где за числом стоит мало наблюдений, оно притягивается к нейтральному базовому значению и помечается флагом — и изменится по мере поступления новых измерений.

Перестаньте гадать, какую модель использовать. Пусть книга выбирает сама.

Novelmint направляет каждый эпизод к модели, которую эта таблица считает наиболее подходящей. Первая глава — бесплатно.