Welk AI-model schrijft echt de beste fictie?
Live data · measured as of July 24, 2026
Elke modelkaart meet wiskunde, codering en redeneren. Geen enkele meet of een model een scène kan schrijven die een lezer niet overslaat. Dus bouwden wij de benchmark die dat wel doet. Een blind jurypenel beoordeelt echt gegenereerde romanproza van frontiermodellen op negen assen — vier voor vakmanschap, vijf voor de soorten scènes waaruit een boek daadwerkelijk bestaat — en de onderstaande cijfers zijn het live resultaat. Dit is geen marketinggrafiek: het is het exacte raster dat Novelmint gebruikt om per beat van jouw boek een model te kiezen.
Key takeaways
- De benchmark beoordeelt frontiermodellen van Anthropic, OpenAI, Google en xAI op echt gegenereerde romanproza — geen meerkeuzevragen — over negen assen: vier vakmanschap (literair, dialoog, trouw, tempo) en vijf inhoud (emotie, fysicaliteit, conflict, romantiek, erotiek).
- Vakmanschapsassen meten HOE GOED een model schrijft; inhoudsassen meten welk SOORT scène het goed schrijft. Een model kan prachtige zinnen hebben en toch vlakke vechtscènes schrijven, dus de twee worden apart gehouden en nooit gemiddeld tot één misleidend getal.
- Elke score wordt met vertrouwen teruggetrokken naar een neutraal basisniveau van 70, evenredig met hoe weinig data er achter staat, zodat een gelukkig resultaat van drie steekproeven nooit kan doorgaan voor een vastgesteld feit. De steekproefgrootte achter elk getal wordt getoond.
- Geen enkel model wint alles. Het sterkste literaire vakmanschap overall, de meest consistente trouw, de beste actie en de meest bereidwillige romantiek en expliciete schrijfstijl zitten in verschillende kolommen — wat het hele argument vormt voor het routeren van een boek over modellen in plaats van één te kiezen.
- Dit is hetzelfde raster dat Novelmint gebruikt om per beat een model te selecteren tijdens het opbouwen van een hoofdstuk — en dezelfde jury die een passage beoordeelt tijdens een build voedt het, zodat de cijfers blijven bijwerken naarmate auteurs met de engine schrijven. Het is een levend mechanisme, geen retrospectieve claim.
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
Dit zijn live gegevens, geen eenmalige test
De onderstaande tabel is niet een benchmark die we eenmalig hebben uitgevoerd en bevroren. Het is een live projectie van de scoreopslag waarop het platform draait: dezelfde jury die een passage beoordeelt tijdens een build voedt dit raster, zodat elk hoofdstuk geschreven op Novelmint observaties toevoegt, de steekproefgroottes groeien en de cijfers scherper worden. Naarmate meer auteurs met de engine bouwen, blijft de benchmark bijwerken — de datum hierboven is simpelweg de meest recente herkalibratie.
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
Hoe het raster te lezen
Het kopgetal is het overall vakmanschap — het gemiddelde van de vier uitvoeringsassen van een model, wat het dichtst bij \"hoe goed is de proza\" komt. De inhoudsassen aan de rechterkant zijn geen beter-of-slechter rangschikkingen; ze geven aan waarvoor het model GESCHIKT is. Een hoge fysicaliteitsscore betekent strakke actie; een lage erotieksscore betekent meestal weigering of klinische vlakheid in plaats van zwak schrijven — bereidheid, niet vaardigheid. Lees vakmanschap langs de kolom om modellen te vergelijken, en lees inhoud langs de rij om te zien waar een enkel model sterk is en waar niet.
Best AI for…
A straight answer for one kind of scene — or one genre
By what your scene needs
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
Genereer echte proza, geen testvantwoorden
Elk model schrijft dezelfde beats — gebriefde scènes met vereiste elementen, verboden kennis, een gezichtspunt en een dramatisch doel — onder identieke omstandigheden. We beoordelen wat het produceert als fictie, zoals een redacteur leest, niet hoe het presteert op een quiz.
Blind scoren op negen assen
Een jurypenel beoordeelt elke passage van 0–100 op vier vakmanschapsassen (literair, dialoog, trouw, tempo) en vijf inhoudsassen (emotie, fysicaliteit, conflict, romantiek, erotiek), zonder te weten welk model het schreef. Vakmanschap is uitvoeringskwaliteit; inhoud is geschiktheid voor een type scène.
Terugbrengen naar een neutraal basisniveau
Een ruw gemiddelde van een handvol steekproeven is ruis. Elke cel wordt naar een neutraal basisniveau van 70 getrokken, evenredig met hoe dun het bewijs is, zodat een vroege, gelukkige meting als ongeveer gemiddeld wordt gelezen totdat genoeg observaties het een plek verdienen. Het gepubliceerde getal is deze gekrompen waarde; de steekproefgrootte wordt ernaast getoond.
Blijven vouwen, nooit handmatig overschrijven
Nieuwe jurywaarnemingen worden gevouwen in een lopend gemiddelde en het aantal steekproeven groeit, zodat het raster scherper wordt met de tijd. Cijfers worden gegenereerd uit de waarnemingen, nooit ingevoerd, en wanneer een modelversie verandert onder een alias worden de cellen teruggezet naar een schone hermeting in plaats van twee verschillende modellen samen te voegen.
Where this leads
Waarom een benchmark zoals deze überhaupt bruikbaar is
Een ander model kiezen voor één scène werkt alleen als een boek is opgebouwd in afzonderlijke, gebriefde eenheden in plaats van in één keer gegenereerd. Die eenheid is de beat, en het verhaal coherent houden terwijl verschillende modellen verschillende beats schrijven is de taak van een arc-en-entiteitgeheugen dat meegaat met de build. De benchmark is het scorebord; beats en arc-geheugen zijn wat een boek in staat stelt het daadwerkelijk te benutten.
Questions
Frequently asked
- Welk AI-model schrijft de beste fictie?
- Op overall vakmanschap — het gemiddelde van de literaire, dialoog-, trouw- en tempo-assen op echte romanproza — leidt Claude Opus 4.8 momenteel, met GPT-5.6 Sol vlak daarna. Maar \"best\" hangt af van de scène: de hoogste scores voor actie, romantiek en expliciete inhoud zitten bij andere modellen. Het raster op deze pagina toont de huidige standen en de steekproefgrootte achter elk getal.
- Hoe wordt deze benchmark gemeten?
- Elk model schrijft dezelfde gebriefde beats onder identieke omstandigheden, en een blind jurypenel beoordeelt de resulterende proza van 0–100 op negen assen — vier voor vakmanschap (literair, dialoog, trouw, tempo) en vijf voor inhoudstype (emotie, fysicaliteit, conflict, romantiek, erotiek). Scores worden met vertrouwen teruggebracht naar een neutraal basisniveau van 70 zodat dunne data een getal niet kan doen uitslaan, en het aantal steekproeven wordt naast elke score getoond.
- Wat is het verschil tussen de vakmanschapsassen en de inhoudsassen?
- Vakmanschapsassen meten hoe goed een model schrijft, ongeacht het onderwerp — zinkwaliteit, karakterstem, trouw aan het briefing en controle over het tempo. Inhoudsassen meten geschiktheid voor een soort scène: emotie, fysieke actie, conflict, romantiek en expliciete inhoud. Een model kan prachtige zinnen schrijven en toch een vechtscène slecht verwerken, dus de twee families worden apart gescoord en getoond.
- Waarom niet gewoon het beste model kiezen en voor alles gebruiken?
- Omdat geen enkel model elke as wint. Het sterkste literaire vakmanschap, de beste actie en de meest capabele romantiek of expliciete schrijfstijl behoren tot verschillende modellen. Novelmint routeert een boek per beat over modellen — het grootste deel in één seriestem voor coherentie en afwijkend naar een sterker model op de specifieke beats die dat verdienen — wat alleen mogelijk is omdat dit raster bestaat.
- Betekent een lage score dat een model slecht is?
- Niet noodzakelijk. Een lage inhoudsscore kan betekenen dat het model capabel maar onwillig is — de meeste modellen scoren laag op erotiek omdat ze weigeren of klinisch worden, niet omdat ze de vaardigheid missen. En een lage-betrouwbaarheidsscore (weinig steekproeven) wordt teruggebracht naar het neutrale basisniveau, zodat het gelezen wordt als \"nog niet bewezen\", niet als \"bewezen zwak\". Lees de score altijd samen met de steekproefgrootte.
- Hoe vaak wordt de benchmark bijgewerkt?
- Continu. Het raster is een live projectie van de scoreopslag van het platform: dezelfde jury die een passage beoordeelt terwijl Novelmint een hoofdstuk bouwt, vouwt zijn waarnemingen terug in, zodat de cijfers bewegen naarmate auteurs de engine gebruiken en de steekproefgroottes groeien. De pagina toont de datum van de meest recente herkalibratie. Nieuwe modelversies worden opnieuw gemeten vanaf nul in plaats van gemengd met het model dat ze vervingen, zodat een versiewijziging nooit stilletjes een kolom corrumpeert.
What this page does not claim
- Deze benchmark meet alleen prozakwaliteit en inhoudsgeschiktheid voor fictie. Het zegt niets over het redeneren, de codering, de wiskunde, de feitelijke nauwkeurigheid of de veiligheid van een model buiten de schrijfcontext.
- Scores zijn relatief ten opzichte van de beoordeelde set en de gebruikte prompts, niet een absolute of officiële beoordeling onderschreven door de modelaanbieders. Modelnamen en handelsmerken zijn eigendom van hun respectievelijke eigenaren.
- Een hogere overall-vakmanschapsscore betekent niet dat een model de juiste keuze is voor elk boek — stem, genre, inhoudsbehoeften en kosten zijn allemaal belangrijk, wat precies de reden is waarom Novelmint over modellen routeert in plaats van één te kronen.
- Cellen met weinig steekproeven zijn voorlopig. Waar een getal weinig observaties heeft, wordt het naar het neutrale basisniveau teruggebracht en gemarkeerd, en het zal bewegen naarmate meer metingen worden ingevoegd.
Gerelateerd
Beste AI voor actiescènes
Welke AI houdt een gevecht of achtervolging helder en geaard in plaats van vaag. Gerangschikt op fysicaliteit.
Beste AI voor conflictscènes
Welke AI houdt een ruzie of impasse strak en oplopend. Gerangschikt op gemeten conflict.
Beste AI voor emotionele scènes
Welke AI laat een gevoelsgedreven scène echt landen in plaats van die alleen te beschrijven. Gerangschikt op emotie.
Beste AI voor expliciete scènes
Welke AI wil eigenlijk expliciete inhoud voor volwassenen schrijven — en welke weigeren. Gerangschikt op bereidheid.
Stop met raden welk model je moet gebruiken. Laat het boek kiezen.
Novelmint routeert elke beat naar het model dat dit raster het meest geschikt acht. Je eerste hoofdstuk is gratis.