O benchmark de modelos de ficção

Qual modelo de IA realmente escreve a melhor ficção?

Live data · measured as of July 24, 2026

Todo card de modelo mede matemática, código e raciocínio. Nenhum deles mede se um modelo consegue escrever uma cena que o leitor não vai pular. Por isso criamos este benchmark. Um painel de juízes às cegas avalia prosa real de romance gerada pelos modelos de fronteira em nove eixos — quatro de técnica, cinco para os tipos de cena que compõem um livro de verdade — e os números abaixo são o resultado em tempo real. Isto não é um gráfico de marketing: é a grade exata que o Novelmint usa para escolher um modelo a cada beat do seu livro.

Key takeaways

  • O benchmark avalia modelos de fronteira da Anthropic, OpenAI, Google e xAI em prosa real gerada — não em testes de múltipla escolha — em nove eixos: quatro de técnica (literário, diálogo, fidelidade, ritmo) e cinco de conteúdo (emoção, fisicalidade, conflito, romance, erotismo).
  • Os eixos de técnica medem o QUÃO BEM um modelo escreve; os eixos de conteúdo medem para QUE TIPO de cena ele escreve bem. Um modelo pode ter frases bonitas e ainda assim escrever cenas de luta sem energia — por isso os dois são mantidos separados e nunca combinados em um único número enganoso.
  • Cada pontuação é reduzida por confiança em direção a uma linha de base neutra de 70, proporcionalmente à escassez de dados por trás dela — assim, um resultado sortudo de três amostras nunca pode se passar por um fato consolidado. O tamanho da amostra por trás de cada número é exibido.
  • Nenhum modelo vence em tudo. A técnica literária mais forte no geral, a fidelidade mais consistente, a melhor ação e a escrita de romance e conteúdo explícito mais dispostos estão em colunas diferentes — o que é o argumento principal para distribuir um livro entre modelos em vez de escolher apenas um.
  • Esta é a mesma grade que o Novelmint usa para selecionar um modelo por beat ao construir um capítulo — e o mesmo juiz que avalia uma passagem durante a construção alimenta os dados, então os números continuam atualizando conforme os autores escrevem com o motor. É um mecanismo vivo, não uma afirmação retrospectiva.

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

Estes são dados em tempo real, não um teste único

A tabela abaixo não é um benchmark que rodamos uma vez e congelamos. É uma projeção em tempo real do repositório de pontuações em que a plataforma opera: o mesmo juiz que avalia uma passagem durante a construção alimenta esta grade — assim, cada capítulo escrito no Novelmint adiciona observações, os tamanhos de amostra crescem e os números se afinam. Conforme mais autores constroem com o motor, o benchmark continua atualizando — a data acima é simplesmente a recalibração mais recente.

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

Como ler a grade

O número principal é a técnica geral — a média dos quatro eixos de execução de um modelo, que é a melhor aproximação de "quão boa é sua prosa". Os eixos de conteúdo à direita não são rankings de melhor ou pior; eles indicam para quê o modelo é ADEQUADO. Uma pontuação alta em fisicalidade significa ação limpa; uma pontuação baixa em erotismo geralmente indica recusa ou frieza clínica, não escrita fraca — disposição, não habilidade. Leia a técnica pela coluna para comparar modelos, e leia o conteúdo pela linha para ver onde um único modelo é forte e onde não é.

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

Gerar prosa real, não respostas de teste

Cada modelo escreve os mesmos beats — cenas briefadas com elementos obrigatórios, conhecimentos proibidos, um ponto de vista e um objetivo dramático — em condições idênticas. Avaliamos o que produz como ficção, da forma como um editor lê, não como ele se sai em um questionário.

02

Avaliar às cegas, em nove eixos

Um painel de juízes avalia cada passagem de 0 a 100 em quatro eixos de técnica (literário, diálogo, fidelidade, ritmo) e cinco eixos de conteúdo (emoção, fisicalidade, conflito, romance, erotismo), sem saber qual modelo a escreveu. Técnica é qualidade de execução; conteúdo é adequação a um tipo de cena.

03

Reduzir em direção a um prior neutro

Uma média bruta de poucas amostras é ruído. Cada célula é puxada em direção a uma linha de base neutra de 70, proporcionalmente à fragilidade das evidências — assim, uma medição inicial sortuda se lê como aproximadamente mediana até que observações suficientes a consolidem. O número publicado é esse valor reduzido; o tamanho da amostra é exibido ao lado.

04

Continuar dobrando, nunca sobrescrever manualmente

Novas observações dos juízes são incorporadas à média acumulada e a contagem de amostras cresce, então a grade se afina com o tempo. Os números são gerados a partir das observações, nunca digitados manualmente — e quando uma versão de modelo muda sob um alias, suas células são redefinidas para uma nova medição limpa em vez de misturar dois modelos diferentes.

Where this leads

Por que um benchmark como este pode ser usado

Escolher um modelo diferente para uma cena só funciona se o livro for construído em unidades discretas e briefadas, em vez de gerado de uma só vez. Essa unidade é o beat, e manter a coerência da história enquanto modelos diferentes escrevem beats diferentes é tarefa de uma memória de arco e entidades que acompanha a construção. O benchmark é o placar; beats e memória de arco são o que permitem que um livro realmente o utilize.

Questions

Frequently asked

Qual modelo de IA escreve a melhor ficção?
Em técnica geral — a média dos eixos literário, diálogo, fidelidade e ritmo em prosa real de romance — o Claude Opus 4.8 lidera atualmente, com o GPT-5.6 Sol bem próximo. Mas "melhor" depende da cena: as pontuações mais altas para ação, romance e conteúdo explícito estão com modelos diferentes. A grade nesta página mostra as classificações atuais e o tamanho da amostra por trás de cada número.
Como este benchmark é medido?
Cada modelo escreve os mesmos beats briefados em condições idênticas, e um painel de juízes às cegas avalia a prosa resultante de 0 a 100 em nove eixos — quatro de técnica (literário, diálogo, fidelidade, ritmo) e cinco de tipo de conteúdo (emoção, fisicalidade, conflito, romance, erotismo). As pontuações são reduzidas por confiança em direção a uma linha de base neutra de 70 para que dados escassos não distorçam um número, e a contagem de amostras é exibida ao lado de cada pontuação.
Qual é a diferença entre os eixos de técnica e os eixos de conteúdo?
Os eixos de técnica medem quão bem um modelo escreve, independentemente do assunto — qualidade das frases, voz dos personagens, fidelidade ao brief e controle do ritmo. Os eixos de conteúdo medem a adequação a um tipo de cena: emoção, ação física, conflito, romance e conteúdo explícito. Um modelo pode escrever frases lindas e ainda assim lidar mal com uma cena de luta — por isso as duas famílias são pontuadas e exibidas separadamente.
Por que não escolher simplesmente o melhor modelo e usá-lo para tudo?
Porque nenhum modelo vence em todos os eixos. A técnica literária mais forte, a melhor ação e a escrita de romance ou conteúdo explícito mais capaz pertencem a modelos diferentes. O Novelmint distribui um livro entre modelos beat a beat — mantendo a maior parte em uma voz de série para coerência e desviando para um modelo mais forte nos beats específicos que justificam isso — o que só é possível porque esta grade existe.
Uma pontuação baixa significa que um modelo é ruim?
Não necessariamente. Uma pontuação baixa de conteúdo pode significar que o modelo é capaz, mas relutante — a maioria dos modelos pontua baixo em erotismo porque recusa ou fica clínico, não por falta de habilidade. E uma pontuação de baixa confiança (poucas amostras) é reduzida em direção à linha de base neutra, então se lê como "ainda não provado", não "provadamente fraco". Sempre leia a pontuação junto com seu tamanho de amostra.
Com que frequência o benchmark é atualizado?
Continuamente. A grade é uma projeção em tempo real do repositório de pontuações da plataforma: o mesmo juiz que avalia uma passagem enquanto o Novelmint constrói um capítulo incorpora suas observações de volta, então os números se movem conforme os autores usam o motor e os tamanhos de amostra crescem. A página exibe a data da recalibração mais recente. Novas versões de modelos são remedidas do zero em vez de mescladas com o modelo que substituíram — então uma mudança de versão nunca corrompe silenciosamente uma coluna.

What this page does not claim

  • Este benchmark mede qualidade de prosa e adequação de conteúdo apenas para ficção. Não diz nada sobre raciocínio, código, matemática, precisão factual ou segurança de um modelo fora do contexto de escrita.
  • As pontuações são relativas ao conjunto avaliado e aos prompts usados, não uma classificação absoluta ou oficial endossada pelos provedores de modelos. Nomes e marcas registradas de modelos pertencem aos seus respectivos donos.
  • Uma pontuação mais alta de técnica geral não significa que um modelo é a escolha certa para todo livro — voz, gênero, necessidades de conteúdo e custo são fatores importantes, o que é exatamente por isso o Novelmint distribui entre modelos em vez de coroar um único.
  • Células com poucos dados são provisórias. Onde um número tem poucas observações, ele é reduzido em direção à linha de base neutra e sinalizado — e mudará conforme mais medições forem incorporadas.

Pare de adivinhar qual modelo usar. Deixe o livro escolher.

O Novelmint direciona cada beat para o modelo que esta grade indica como o mais adequado. Seu primeiro capítulo é gratuito.