Méthodologie

Comment fonctionne le benchmark des modèles fiction

Updated July 23, 2026 · 6 min de lecture

Le benchmark mesure ce que les fiches modèles n'évaluent jamais : si un modèle peut écrire une scène qu'un lecteur ne sauterait pas. Cette page explique précisément comment les chiffres sont produits — ce qui est mesuré, comment les modèles sont jugés, pourquoi les scores sont réduits par confiance et comment la grille reste à jour — afin que vous puissiez peser les résultats par vous-même et les citer avec exactitude.

Key takeaways

  • Des modèles frontier écrivent les mêmes passages romanesques balisés, et un jury aveugle, diversifié par fournisseur, note la prose de 0 à 100 sur neuf axes — sans savoir quel modèle l'a écrite.
  • Neuf axes en deux familles : quatre axes de forme (littéraire, dialogue, fidélité, rythme) mesurent la qualité d'écriture ; cinq axes de contenu (émotion, physicalité, conflit, romance, érotisme) mesurent le type de scène bien maîtrisé. Ils ne sont jamais moyennés ensemble.
  • Chaque score est réduit vers une base neutre de 70 proportionnellement au peu de données qui le soutient (un prior équivalant à cinq observations), afin qu'un petit échantillon chanceux ne puisse pas atteindre le sommet. Les tailles d'échantillon sont affichées ; les cellules peu fournies sont signalées.
  • La grille est en direct — de nouvelles observations de juges s'intègrent à une moyenne glissante au fil du temps, et un changement de version réinitialise et re-mesure un modèle plutôt que de le fusionner avec son prédécesseur.
  • Les scores décrivent la prose sur des passages fiction uniquement ; ils constituent une mesure indépendante, pas une note officielle du fournisseur, et un score d'érotisme faible reflète généralement la volonté du modèle, pas sa maîtrise.

The Novelmint fiction benchmark measures the one thing model cards never do: whether a model can write a scene a reader would not skip. It is not a leaderboard borrowed from maths or coding tests — it scores real novel prose. Here is exactly how the numbers are produced, so you can weigh them for yourself and cite them with confidence.

What it measures

The benchmark scores how well the frontier models — from Anthropic, OpenAI, Google, and xAI — write fiction. Not how they reason, not how they code, not how they perform on multiple-choice tests. Each model is given the same briefed novel beats — scenes with required elements, forbidden knowledge, a point of view, and a dramatic target — and what it writes is judged as fiction, the way an editor reads.

Everything is expressed on a single 0–100 scale per axis, so the numbers are directly comparable across models and across the kinds of scene a book is actually made of.

The nine axes

Fiction is not one skill, so the benchmark does not collapse it into one number. It scores nine axes, split into two families that mean different things.

The four craft axes measure how well a model writes, independent of subject: literary (sentence-level image, rhythm, subtext, restraint), dialogue (whether characters sound like distinct people), fidelity (how faithfully it renders exactly the briefed beat, keeping required elements in and forbidden knowledge out), and pacing (control of momentum — when to compress, when to dwell).

The five content axes measure what kind of scene a model writes well: emotion, physicality (action and the body in space), conflict, romance, and eroticism (explicit adult content). These are not better-or-worse rankings — they say what a model is fit for. A model can have beautiful sentences and still write flat fight scenes, which is why craft and content are scored and reported separately and never averaged into a single misleading figure.

How each model is scored

Scoring is blind peer review. Each model writes the same set of briefed beats, and a panel of strong, provider-diverse judge models rates every passage 0–100 on each axis — without knowing which model wrote it, and never judging its own work. A provider-diverse panel matters: a judge from outside a model's own family catches the tells that family tends to reward.

Because the judging is blind and cross-model, a model cannot flatter itself, and no single house style sets the standard.

Why scores are shrunk by confidence

A raw average from a handful of passages is noise, and noise dressed up as a score is worse than no score at all. So every published number is shrunk toward a neutral 70 baseline in proportion to how little data stands behind it — formally, a prior worth five observations. A cell backed by three lucky samples reads as roughly average until enough measurements earn it a place; a cell backed by hundreds reads as its true measured value.

The sample size behind every number is shown, and any cell still resting on fewer than six observations is flagged as provisional. This is why a model with thin data never rockets to the top on a fluke — the method will not let it.

How the grid stays current

The benchmark is not a one-time test that was run and frozen. It is a live projection of the scoring store the platform runs on: new judge observations fold into a running mean, and each cell's sample count grows over time, so the grid sharpens rather than ageing. The page always shows the date of the most recent recalibration.

One safeguard matters for accuracy. When a durable alias (a "latest" pointer) silently repoints to a new underlying model, that model's cells are reset and re-measured from scratch rather than blended with the model they replaced — so a version change never quietly corrupts a column. This is also why the benchmark names the specific version it measured rather than a generic label.

Limitations

The scores describe prose on fiction beats only, judged against this set of models and prompts. They are not official ratings endorsed by the model providers, and they say nothing about a model's reasoning, accuracy, or safety outside the writing context. Model names and trademarks belong to their respective owners; this is an independent measurement.

Two reads are easy to get wrong. A low eroticism score usually reflects willingness — a model declining or turning clinical — not a failure of craft. And a low-confidence score means "not yet proven", not "proven weak". Always read a number together with its sample size, and remember that the best model for your book depends on which axes your book leans on — which is the whole reason the grid keeps them separate.

Questions

Frequently asked

Comment Novelmint évalue-t-il les modèles IA pour la fiction ?
Chaque modèle frontier écrit les mêmes passages romanesques balisés, et un jury aveugle de juges-modèles performants, diversifié par fournisseur, note la prose de 0 à 100 sur neuf axes sans connaître l'auteur. Les scores sont réduits vers une base neutre selon le volume de données disponibles, et les observations s'intègrent à une moyenne glissante au fil du temps.
Quels sont les neuf axes ?
Quatre axes de forme — littéraire, dialogue, fidélité (respect du brief) et rythme — mesurent la qualité d'écriture. Cinq axes de contenu — émotion, physicalité (action), conflit, romance et érotisme — mesurent le type de scène bien maîtrisé. Forme et contenu sont présentés séparément, jamais moyennés.
Pourquoi les scores sont-ils ajustés par confiance ?
Une moyenne brute calculée sur quelques passages n'est que du bruit. Chaque score est réduit vers une base neutre de 70 proportionnellement au peu de données qui le sous-tend — un prior équivalant à cinq observations — afin qu'un petit échantillon chanceux ne puisse pas atteindre le sommet. La taille de l'échantillon est affichée, et les cellules avec moins de six observations sont signalées comme provisoires.
S'agit-il d'un classement officiel d'OpenAI, Anthropic, Google ou xAI ?
Non. Il s'agit d'une mesure indépendante réalisée par Novelmint, sur la prose fiction uniquement, évaluée sur cet ensemble de modèles et de prompts. Elle ne dit rien sur le raisonnement, la précision ou d'autres capacités, et les noms de modèles sont des marques appartenant à leurs propriétaires respectifs.
À quelle fréquence le benchmark est-il mis à jour ?
En continu — de nouvelles observations de juges s'intègrent à une moyenne glissante et les effectifs augmentent, affinant la grille au fil du temps. Lorsqu'une version de modèle change sous un alias, ses cellules sont réinitialisées et re-mesurées plutôt que fusionnées avec l'ancienne version. La page affiche la date de la dernière recalibration.

What this page does not claim

  • Les scores sont relatifs à l'ensemble de modèles jugés et aux prompts utilisés — il ne s'agit pas d'une note absolue ou officielle.
  • Un score d'érotisme faible reflète la volonté du modèle (refus ou ton clinique), pas un manque de maîtrise ; un score peu fiable signifie « pas encore prouvé », pas « prouvé faible ».
  • Le benchmark mesure la prose fiction uniquement et ne dit rien sur le raisonnement, le code, la précision factuelle ou la sécurité hors contexte d'écriture.

Découvrez quel modèle écrit le mieux votre type de scène.

Données en direct sur neuf axes, mises à jour au fur et à mesure des mesures de prose.