Quel modèle d'IA écrit vraiment la meilleure fiction ?
Live data · measured as of July 24, 2026
Toutes les fiches de modèle mesurent les maths, le code et le raisonnement. Aucune ne mesure si un modèle peut écrire une scène qu'un lecteur ne sauterait pas. Alors nous avons créé le benchmark qui le fait. Un jury à l'aveugle note de vraie prose romanesque générée par les modèles de pointe sur neuf axes — quatre pour le style, cinq pour les types de scène dont un livre est réellement fait — et les chiffres ci-dessous sont le résultat en direct. Ce n'est pas un graphique marketing : c'est la grille exacte que Novelmint utilise pour choisir un modèle à chaque temps fort de votre livre.
Key takeaways
- Le benchmark évalue les modèles de pointe d'Anthropic, OpenAI, Google et xAI sur de vraie prose romanesque générée — pas des tests à choix multiples — selon neuf axes : quatre de style (littéraire, dialogue, fidélité, rythme) et cinq de contenu (émotion, physicalité, conflit, romance, érotisme).
- Les axes de style mesurent COMMENT un modèle écrit ; les axes de contenu mesurent quel TYPE de scène il maîtrise. Un modèle peut avoir de belles phrases et quand même écrire des scènes de combat fades — les deux sont donc séparés et jamais agrégés en un seul chiffre trompeur.
- Chaque score est ramené vers une base neutre de 70 proportionnellement au peu de données qui le soutient, de sorte qu'un résultat chanceux sur trois échantillons ne peut jamais passer pour un fait établi. La taille d'échantillon derrière chaque chiffre est indiquée.
- Aucun modèle ne remporte tous les axes. Le meilleur style littéraire global, la fidélité la plus constante, la meilleure action, et la romance et l'écriture explicite les plus engagées se trouvent dans des colonnes différentes — c'est tout l'argument pour router un livre sur plusieurs modèles plutôt que d'en choisir un seul.
- C'est la même grille que Novelmint utilise pour sélectionner un modèle par temps fort lors de la construction d'un chapitre — et le même jury qui note un passage pendant une génération l'alimente, de sorte que les chiffres continuent de s'actualiser au fil des écrits des auteurs. C'est un mécanisme vivant, pas une affirmation rétrospective.
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
Ce sont des données en direct, pas un test ponctuel
Le tableau ci-dessous n'est pas un benchmark que nous avons exécuté une fois et figé. C'est une projection en direct du store de notation sur lequel tourne la plateforme : le même jury qui note un passage pendant une génération alimente cette grille, donc chaque chapitre écrit sur Novelmint ajoute des observations, les tailles d'échantillon augmentent, et les chiffres s'affinent. Plus les auteurs construisent avec le moteur, plus le benchmark se met à jour — la date ci-dessus est simplement le recalibrage le plus récent.
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
Comment lire la grille
Le chiffre principal est le style global — la moyenne des quatre axes d'exécution d'un modèle, ce qui se rapproche le plus de « quelle est la qualité de sa prose ». Les axes de contenu à droite ne sont pas des classements meilleur/moins bon ; ils indiquent à quoi le modèle est APTE. Un score de physicalité élevé signifie une action nette ; un score d'érotisme bas signifie généralement un refus ou une platitude clinique plutôt qu'une faible écriture — c'est une question de volonté, pas de compétence. Lisez le style en descendant la colonne pour comparer les modèles, et le contenu en parcourant la ligne pour voir où un modèle est fort et où il ne l'est pas.
Best AI for…
A straight answer for one kind of scene — or one genre
By what your scene needs
- Meilleure IA pour l'écriture littéraire
- Meilleure IA pour écrire des dialogues
- Meilleure IA pour suivre les instructions
- Meilleure IA pour le rythme narratif
- Meilleure IA pour les scènes émotionnelles
- Meilleure IA pour les scènes d'action
- Meilleure IA pour les scènes de conflit
- Meilleure IA pour écrire de la romance
- Meilleure IA pour les scènes explicites
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
Générer de vraie prose, pas des réponses de test
Chaque modèle écrit les mêmes temps forts — des scènes briefées avec des éléments obligatoires, des connaissances interdites, un point de vue et un objectif dramatique — dans des conditions identiques. Nous notons ce qu'il produit comme de la fiction, comme un éditeur lit, pas comme il performe sur un quiz.
Noter à l'aveugle, sur neuf axes
Un jury note chaque passage de 0 à 100 sur quatre axes de style (littéraire, dialogue, fidélité, rythme) et cinq axes de contenu (émotion, physicalité, conflit, romance, érotisme), sans savoir quel modèle l'a écrit. Le style, c'est la qualité d'exécution ; le contenu, c'est l'adéquation à un type de scène.
Rapprocher vers une référence neutre
Une moyenne brute sur une poignée d'échantillons, c'est du bruit. Chaque cellule est attirée vers une base neutre de 70 proportionnellement à la faiblesse de ses données, de sorte qu'une mesure précoce et chanceuse apparaît comme environ dans la moyenne jusqu'à ce que suffisamment d'observations lui donnent sa place. Le chiffre publié est cette valeur ajustée ; la taille d'échantillon est indiquée à côté.
Continuer à intégrer, jamais écraser manuellement
Les nouvelles observations du jury s'intègrent dans une moyenne glissante et le nombre d'échantillons augmente, de sorte que la grille s'affine avec le temps. Les chiffres sont recalculés à partir des observations, jamais saisis manuellement, et lorsqu'une version de modèle change sous un alias, ses cellules se réinitialisent à une nouvelle mesure propre plutôt que de mélanger deux modèles différents.
Where this leads
Pourquoi un tel benchmark peut même être utilisé
Choisir un modèle différent pour une scène ne fonctionne que si un livre est construit en unités discrètes et briefées plutôt que généré en une seule passe. Cette unité, c'est le temps fort, et maintenir la cohérence de l'histoire pendant que différents modèles écrivent différents temps forts est le rôle d'une mémoire d'arc et d'entités qui voyage avec la génération. Le benchmark est le tableau de bord ; les temps forts et la mémoire d'arc sont ce qui permet à un livre d'en tirer parti.
Questions
Frequently asked
- Quel modèle d'IA écrit la meilleure fiction ?
- En style global — la moyenne des axes littéraire, dialogue, fidélité et rythme sur de vraie prose romanesque — Claude Opus 4.8 mène actuellement, avec GPT-5.6 Sol juste derrière. Mais « meilleur » dépend de la scène : les scores les plus élevés pour l'action, la romance et le contenu explicite appartiennent à des modèles différents. La grille sur cette page affiche les classements actuels et la taille d'échantillon derrière chaque chiffre.
- Comment ce benchmark est-il mesuré ?
- Chaque modèle écrit les mêmes temps forts briefés dans des conditions identiques, et un jury à l'aveugle note la prose résultante de 0 à 100 sur neuf axes — quatre pour le style (littéraire, dialogue, fidélité, rythme) et cinq pour le type de contenu (émotion, physicalité, conflit, romance, érotisme). Les scores sont ramenés vers une base neutre de 70 pour que les données insuffisantes ne fassent pas varier un chiffre, et le nombre d'échantillons est indiqué à côté de chaque score.
- Quelle est la différence entre les axes de style et les axes de contenu ?
- Les axes de style mesurent comment un modèle écrit, indépendamment du sujet — qualité des phrases, voix des personnages, fidélité au brief, et maîtrise du rythme. Les axes de contenu mesurent l'adéquation à un type de scène : émotion, action physique, conflit, romance et contenu explicite. Un modèle peut écrire de magnifiques phrases et quand même mal gérer une scène de combat, c'est pourquoi les deux familles sont notées et présentées séparément.
- Pourquoi ne pas simplement choisir le meilleur modèle unique et l'utiliser pour tout ?
- Parce qu'aucun modèle ne remporte tous les axes. Le meilleur style littéraire, la meilleure action, et la romance ou l'écriture explicite la plus capable appartiennent à des modèles différents. Novelmint route un livre sur plusieurs modèles temps fort par temps fort — en conservant la majeure partie dans une voix de série pour la cohérence et en déviant vers un modèle plus fort sur les temps forts spécifiques qui le méritent — ce qui n'est possible que parce que cette grille existe.
- Un score faible signifie-t-il qu'un modèle est mauvais ?
- Pas nécessairement. Un score de contenu faible peut signifier que le modèle est capable mais peu enclin — la plupart des modèles ont de faibles scores en érotisme parce qu'ils refusent ou deviennent cliniques, pas parce qu'ils manquent de compétence. Et un score peu fiable (peu d'échantillons) est ramené vers la base neutre, il se lit donc comme « pas encore prouvé », pas « prouvé faible ». Lisez toujours le score avec sa taille d'échantillon.
- À quelle fréquence le benchmark est-il mis à jour ?
- En continu. La grille est une projection en direct du store de notation de la plateforme : le même jury qui note un passage pendant que Novelmint génère un chapitre y intègre ses observations, donc les chiffres évoluent au fil de l'utilisation du moteur par les auteurs et les tailles d'échantillon augmentent. La page affiche la date du recalibrage le plus récent. Les nouvelles versions de modèle sont mesurées de zéro plutôt que fusionnées avec le modèle qu'elles remplacent, de sorte qu'un changement de version ne corrompt jamais silencieusement une colonne.
What this page does not claim
- Ce benchmark mesure uniquement la qualité de la prose et l'adéquation au contenu pour la fiction. Il ne dit rien sur le raisonnement, le code, les mathématiques, la précision factuelle ou la sécurité d'un modèle en dehors du contexte d'écriture.
- Les scores sont relatifs à l'ensemble évalué et aux prompts utilisés, pas une note absolue ou officielle approuvée par les fournisseurs de modèles. Les noms et marques déposées des modèles appartiennent à leurs propriétaires respectifs.
- Un score de style global plus élevé ne signifie pas qu'un modèle est le bon choix pour chaque livre — la voix, le genre, les besoins en contenu et le coût comptent tous, ce qui est exactement pourquoi Novelmint route sur plusieurs modèles plutôt que d'en couronner un.
- Les cellules avec peu d'échantillons sont provisoires. Là où un chiffre repose sur peu d'observations, il est ramené vers la base neutre et signalé, et il évoluera au fur et à mesure que d'autres mesures seront intégrées.
Associé
Meilleure IA pour les scènes d'action
Quelle IA garde un combat ou une poursuite claire et ancrée plutôt que vague. Classée sur la physicalité.
Meilleure IA pour les scènes de conflit
Quelle IA garde une dispute ou une confrontation tendue et montante. Classée sur le conflit mesuré.
Meilleure IA pour les scènes émotionnelles
Quelle IA fait atterrir une scène portée par les émotions plutôt que de se contenter de la décrire. Classée sur l'émotion.
Meilleure IA pour les scènes explicites
Quelle IA écrira vraiment du contenu adulte explicite — et lesquelles refusent. Classé sur la volonté.
Arrêtez de deviner quel modèle utiliser. Laissez le livre choisir.
Novelmint route chaque temps fort vers le modèle que cette grille juge le plus adapté. Votre premier chapitre est gratuit.