Metodologia

Como funciona o benchmark de modelos de ficção

Updated July 23, 2026 · 6 min de leitura

O benchmark mede a única coisa que os cartões de modelo nunca medem: se um modelo consegue escrever uma cena que o leitor não pularia. Esta página explica exatamente como os números são produzidos — o que é medido, como os modelos são avaliados, por que as pontuações são ajustadas por confiança e como a grade se mantém atualizada — para que você possa analisar os resultados e citá-los com precisão.

Key takeaways

  • Modelos de ponta escrevem os mesmos beats de romance com briefing, e um painel cego e diversificado de juízes pontua a prosa de 0 a 100 em nove eixos — sem saber qual modelo a escreveu.
  • Nove eixos em duas famílias: quatro de craft (literário, diálogo, fidelidade, ritmo) medem a qualidade da escrita; cinco de conteúdo (emoção, fisicalidade, conflito, romance, erotismo) medem o tipo de cena que o modelo escreve bem. Eles nunca são calculados juntos.
  • Cada pontuação é ajustada em direção a uma linha de base neutra de 70, proporcionalmente à quantidade de dados que a sustenta (uma prior equivalente a cinco observações), para que uma amostra pequena com sorte não alcance o topo. O tamanho das amostras é exibido; células com poucos dados são sinalizadas.
  • A grade é ao vivo — novas observações dos juízes se incorporam a uma média contínua ao longo do tempo, e uma mudança de versão redefine e remede um modelo em vez de misturá-lo com seu predecessor.
  • As pontuações descrevem a prosa apenas em beats de ficção; são uma medição independente, não uma avaliação oficial do provedor, e uma pontuação baixa em erotismo geralmente reflete disposição, não craft.

O benchmark de ficção da Novelmint mede a única coisa que os cartões de modelo nunca medem: se um modelo consegue escrever uma cena que o leitor não pularia. Não é um ranking emprestado de testes de matemática ou programação — ele pontua prosa literária de verdade. Aqui está exatamente como os números são produzidos, para que você possa avaliá-los por conta própria e citá-los com confiança.

O que ele mede

O benchmark avalia o desempenho dos modelos de fronteira — da Anthropic, OpenAI, Google e xAI — na escrita de ficção. Não o raciocínio, não a programação, não o desempenho em testes de múltipla escolha. Cada modelo recebe os mesmos beats narrativos previamente definidos — cenas com elementos obrigatórios, conhecimentos proibidos, um ponto de vista e um objetivo dramático — e o que ele escreve é julgado como ficção, da maneira que um editor lê.

Tudo é expresso em uma escala única de 0 a 100 por eixo, tornando os números diretamente comparáveis entre modelos e entre os tipos de cena de que um livro é realmente feito.

Os nove eixos

Ficção não é uma habilidade única, portanto o benchmark não a reduz a um único número. Ele pontua nove eixos, divididos em duas famílias com significados distintos.

Os quatro eixos de craft medem quão bem um modelo escreve, independentemente do assunto: literary (imagem no nível da frase, ritmo, subtexto, contenção), dialogue (se os personagens soam como pessoas distintas), fidelity (com que fidelidade o modelo reproduz exatamente o beat definido, mantendo os elementos obrigatórios e excluindo o conhecimento proibido) e pacing (controle do momentum — quando comprimir, quando se demorar).

Os cinco eixos de content medem que tipo de cena um modelo escreve bem: emotion, physicality (ação e o corpo no espaço), conflict, romance e eroticism (conteúdo adulto explícito). Esses eixos não são classificações de melhor ou pior — eles indicam para que um modelo é adequado. Um modelo pode ter frases belíssimas e ainda assim escrever cenas de luta sem vida, razão pela qual craft e content são pontuados e reportados separadamente e jamais são combinados em um único número enganoso.

Como cada modelo é pontuado

A pontuação é feita por revisão cega por pares. Cada modelo escreve o mesmo conjunto de beats definidos, e um painel de modelos juízes robustos e diversificados por provedor avalia cada trecho de 0 a 100 em cada eixo — sem saber qual modelo o escreveu e sem jamais julgar o próprio trabalho. Um painel diversificado por provedor é importante: um juiz de fora da família de um modelo capta os traços que essa família tende a recompensar.

Como o julgamento é cego e cross-model, um modelo não pode se elogiar, e nenhum estilo de casa isolado define o padrão.

Controlando o viés dos juízes

Usar modelos para julgar modelos abre quatro modos de falha bem conhecidos, e o método foi construído para fechar cada um deles.

Autopreferência — um modelo tende a recompensar seu próprio estilo de casa. Duas regras eliminam isso: um modelo nunca pontua seu próprio trecho, e o painel de juízes é diversificado por provedor, de modo que o gosto de nenhuma família isolada define o padrão. Um traço que uma casa recompensa é captado por um juiz de outra, e vice-versa.

Verbosidade — juízes tendem a recompensar em excesso a extensão. Cada beat define o mesmo alvo, aproximadamente 220 palavras, de modo que todos os trechos chegam praticamente com o mesmo tamanho e o preenchimento não compensa nada. Um modelo ganha sua pontuação pelo que faz com essas palavras, não pela quantidade que utiliza.

Posição — a ordem em que os trechos aparecem pode influenciar as pontuações em favor do que veio primeiro. Por isso, os trechos são renomeados e embaralhados para cada beat, e cada um é pontuado individualmente em relação a um rubric fixo, em vez de classificado cara a cara. A ordem não carrega nenhum sinal, e qualquer deriva residual se dilui ao longo de muitos beats e muitos juízes.

Amostragem — um único rascunho sortudo pode inflar a avaliação de um modelo. A geração é executada na temperatura padrão de cada modelo, a partir de um prompt idêntico, sem ajuste por modelo, de modo que nenhum modelo recebe uma configuração selecionada a dedo que os outros não têm. E nenhuma célula repousa sobre um único rascunho: cada modelo é pontuado em todo o conjunto de beats por todos os outros modelos do painel e, em seguida, reduzido em direção à linha de base neutra até que medições suficientes se acumulem — de modo que a sorte de um único rascunho desaparece muito antes de um número ser publicado.

Por que as pontuações são reduzidas pela confiança

Uma média bruta de um punhado de trechos é ruído, e ruído disfarçado de pontuação é pior do que nenhuma pontuação. Por isso, todo número publicado é reduzido em direção a uma linha de base neutra de 70, proporcionalmente à quantidade de dados que o sustenta — formalmente, uma prior equivalente a cinco observações. Uma célula sustentada por três amostras sortudas é lida como aproximadamente mediana até que medições suficientes a legitimem; uma célula sustentada por centenas é lida como seu valor medido real.

O tamanho da amostra por trás de cada número é exibido, e qualquer célula que ainda repousa sobre menos de seis observações é sinalizada como provisória. É por isso que um modelo com poucos dados jamais dispara para o topo por acaso — o método não permite.

Como o grid se mantém atualizado

O benchmark não é um teste único que foi executado e congelado. É uma projeção ao vivo do repositório de pontuações sobre o qual a plataforma opera: novas observações dos juízes se incorporam a uma média contínua, e a contagem de amostras de cada célula cresce com o tempo, de modo que o grid se aprimora em vez de envelhecer. A página sempre exibe a data da recalibragem mais recente.

Uma salvaguarda é importante para a precisão. Quando um alias duradouro (um ponteiro "latest") aponta silenciosamente para um novo modelo subjacente, as células desse modelo são reiniciadas e remensuradas do zero, em vez de serem misturadas com as do modelo que substituíram — de modo que uma mudança de versão nunca corrompe silenciosamente uma coluna. É também por isso que o benchmark nomeia a versão específica que mensurou, em vez de um rótulo genérico.

Limitações

As pontuações descrevem prosa em beats de ficção apenas, julgada em relação a este conjunto de modelos e prompts. Elas não são avaliações oficiais endossadas pelos provedores dos modelos e não dizem nada sobre raciocínio, precisão ou segurança de um modelo fora do contexto de escrita. Os nomes e marcas dos modelos pertencem aos seus respectivos proprietários; esta é uma mensuração independente.

Duas leituras são fáceis de errar. Uma pontuação baixa em eroticism geralmente reflete disposição — um modelo recusando ou tornando-se clínico — e não uma falha de craft. E uma pontuação de baixa confiança significa "ainda não comprovado", não "comprovado fraco". Leia sempre um número junto com o tamanho de sua amostra e lembre-se de que o melhor modelo para o seu livro depende de quais eixos o seu livro privilegia — que é exatamente a razão pela qual o grid os mantém separados.

Questions

Frequently asked

Como a Novelmint avalia modelos de IA para ficção?
Cada modelo de ponta escreve os mesmos beats de romance com briefing, e um painel cego e diversificado de modelos juízes fortes pontua a prosa resultante de 0 a 100 em nove eixos sem saber o autor. As pontuações são ajustadas em direção a uma linha de base neutra conforme a quantidade de dados que as sustenta, e as observações se incorporam a uma média contínua ao longo do tempo.
Quais são os nove eixos?
Quatro eixos de craft — literário, diálogo, fidelidade (fidelidade ao briefing) e ritmo — medem a qualidade da escrita. Cinco eixos de conteúdo — emoção, fisicalidade (ação), conflito, romance e erotismo — medem o tipo de cena que o modelo escreve bem. Craft e conteúdo são reportados separadamente, nunca combinados.
Por que as pontuações são ajustadas por confiança?
Uma média bruta de poucos trechos é ruído. Cada pontuação é ajustada em direção a uma linha de base neutra de 70, proporcionalmente à quantidade de dados que a sustenta — uma prior equivalente a cinco observações — para que uma amostra pequena com sorte não alcance o topo. O tamanho da amostra é exibido, e células com menos de seis observações são sinalizadas como provisórias.
Este é um ranking oficial da OpenAI, Anthropic, Google ou xAI?
Não. É uma medição independente da Novelmint, apenas em prosa de ficção, avaliada em relação a este conjunto de modelos e prompts. Não diz nada sobre raciocínio, precisão ou outras capacidades, e os nomes dos modelos são marcas registradas de seus respectivos proprietários.
Com que frequência o benchmark é atualizado?
Continuamente — novas observações dos juízes se incorporam a uma média contínua e as contagens de amostras crescem, tornando a grade mais precisa ao longo do tempo. Quando a versão de um modelo muda sob um alias, suas células são redefinidas e remedidas em vez de mescladas com a versão anterior. A página exibe a data da recalibração mais recente.

What this page does not claim

  • As pontuações são relativas ao conjunto de modelos avaliados e aos prompts usados — não são uma avaliação absoluta ou oficial.
  • Uma pontuação baixa em erotismo reflete disposição (o modelo recusando ou tornando-se clínico), não falta de craft; uma pontuação de baixa confiança significa "ainda não comprovado", não "comprovadamente fraco".
  • O benchmark mede apenas prosa de ficção e não diz nada sobre raciocínio, programação, precisão factual ou segurança fora do contexto de escrita.

Veja qual modelo escreve melhor o tipo de cena que você precisa.

Dados ao vivo em nove eixos, atualizados conforme mais prosa é medida.