De fictiemodel benchmark

Welk AI-model schrijft echt de beste fictie?

Live data · measured as of July 24, 2026

Elke modelkaart meet wiskunde, codering en redeneren. Geen enkele meet of een model een scène kan schrijven die een lezer niet overslaat. Dus bouwden wij de benchmark die dat wel doet. Een blind jurypenel beoordeelt echt gegenereerde romanproza van frontiermodellen op negen assen — vier voor vakmanschap, vijf voor de soorten scènes waaruit een boek daadwerkelijk bestaat — en de onderstaande cijfers zijn het live resultaat. Dit is geen marketinggrafiek: het is het exacte raster dat Novelmint gebruikt om per beat van jouw boek een model te kiezen.

Key takeaways

  • De benchmark beoordeelt frontiermodellen van Anthropic, OpenAI, Google en xAI op echt gegenereerde romanproza — geen meerkeuzevragen — over negen assen: vier vakmanschap (literair, dialoog, trouw, tempo) en vijf inhoud (emotie, fysicaliteit, conflict, romantiek, erotiek).
  • Vakmanschapsassen meten HOE GOED een model schrijft; inhoudsassen meten welk SOORT scène het goed schrijft. Een model kan prachtige zinnen hebben en toch vlakke vechtscènes schrijven, dus de twee worden apart gehouden en nooit gemiddeld tot één misleidend getal.
  • Elke score wordt met vertrouwen teruggetrokken naar een neutraal basisniveau van 70, evenredig met hoe weinig data er achter staat, zodat een gelukkig resultaat van drie steekproeven nooit kan doorgaan voor een vastgesteld feit. De steekproefgrootte achter elk getal wordt getoond.
  • Geen enkel model wint alles. Het sterkste literaire vakmanschap overall, de meest consistente trouw, de beste actie en de meest bereidwillige romantiek en expliciete schrijfstijl zitten in verschillende kolommen — wat het hele argument vormt voor het routeren van een boek over modellen in plaats van één te kiezen.
  • Dit is hetzelfde raster dat Novelmint gebruikt om per beat een model te selecteren tijdens het opbouwen van een hoofdstuk — en dezelfde jury die een passage beoordeelt tijdens een build voedt het, zodat de cijfers blijven bijwerken naarmate auteurs met de engine schrijven. Het is een levend mechanisme, geen retrospectieve claim.

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

Dit zijn live gegevens, geen eenmalige test

De onderstaande tabel is niet een benchmark die we eenmalig hebben uitgevoerd en bevroren. Het is een live projectie van de scoreopslag waarop het platform draait: dezelfde jury die een passage beoordeelt tijdens een build voedt dit raster, zodat elk hoofdstuk geschreven op Novelmint observaties toevoegt, de steekproefgroottes groeien en de cijfers scherper worden. Naarmate meer auteurs met de engine bouwen, blijft de benchmark bijwerken — de datum hierboven is simpelweg de meest recente herkalibratie.

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

Hoe het raster te lezen

Het kopgetal is het overall vakmanschap — het gemiddelde van de vier uitvoeringsassen van een model, wat het dichtst bij \"hoe goed is de proza\" komt. De inhoudsassen aan de rechterkant zijn geen beter-of-slechter rangschikkingen; ze geven aan waarvoor het model GESCHIKT is. Een hoge fysicaliteitsscore betekent strakke actie; een lage erotieksscore betekent meestal weigering of klinische vlakheid in plaats van zwak schrijven — bereidheid, niet vaardigheid. Lees vakmanschap langs de kolom om modellen te vergelijken, en lees inhoud langs de rij om te zien waar een enkel model sterk is en waar niet.

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

Genereer echte proza, geen testvantwoorden

Elk model schrijft dezelfde beats — gebriefde scènes met vereiste elementen, verboden kennis, een gezichtspunt en een dramatisch doel — onder identieke omstandigheden. We beoordelen wat het produceert als fictie, zoals een redacteur leest, niet hoe het presteert op een quiz.

02

Blind scoren op negen assen

Een jurypenel beoordeelt elke passage van 0–100 op vier vakmanschapsassen (literair, dialoog, trouw, tempo) en vijf inhoudsassen (emotie, fysicaliteit, conflict, romantiek, erotiek), zonder te weten welk model het schreef. Vakmanschap is uitvoeringskwaliteit; inhoud is geschiktheid voor een type scène.

03

Terugbrengen naar een neutraal basisniveau

Een ruw gemiddelde van een handvol steekproeven is ruis. Elke cel wordt naar een neutraal basisniveau van 70 getrokken, evenredig met hoe dun het bewijs is, zodat een vroege, gelukkige meting als ongeveer gemiddeld wordt gelezen totdat genoeg observaties het een plek verdienen. Het gepubliceerde getal is deze gekrompen waarde; de steekproefgrootte wordt ernaast getoond.

04

Blijven vouwen, nooit handmatig overschrijven

Nieuwe jurywaarnemingen worden gevouwen in een lopend gemiddelde en het aantal steekproeven groeit, zodat het raster scherper wordt met de tijd. Cijfers worden gegenereerd uit de waarnemingen, nooit ingevoerd, en wanneer een modelversie verandert onder een alias worden de cellen teruggezet naar een schone hermeting in plaats van twee verschillende modellen samen te voegen.

Where this leads

Waarom een benchmark zoals deze überhaupt bruikbaar is

Een ander model kiezen voor één scène werkt alleen als een boek is opgebouwd in afzonderlijke, gebriefde eenheden in plaats van in één keer gegenereerd. Die eenheid is de beat, en het verhaal coherent houden terwijl verschillende modellen verschillende beats schrijven is de taak van een arc-en-entiteitgeheugen dat meegaat met de build. De benchmark is het scorebord; beats en arc-geheugen zijn wat een boek in staat stelt het daadwerkelijk te benutten.

Questions

Frequently asked

Welk AI-model schrijft de beste fictie?
Op overall vakmanschap — het gemiddelde van de literaire, dialoog-, trouw- en tempo-assen op echte romanproza — leidt Claude Opus 4.8 momenteel, met GPT-5.6 Sol vlak daarna. Maar \"best\" hangt af van de scène: de hoogste scores voor actie, romantiek en expliciete inhoud zitten bij andere modellen. Het raster op deze pagina toont de huidige standen en de steekproefgrootte achter elk getal.
Hoe wordt deze benchmark gemeten?
Elk model schrijft dezelfde gebriefde beats onder identieke omstandigheden, en een blind jurypenel beoordeelt de resulterende proza van 0–100 op negen assen — vier voor vakmanschap (literair, dialoog, trouw, tempo) en vijf voor inhoudstype (emotie, fysicaliteit, conflict, romantiek, erotiek). Scores worden met vertrouwen teruggebracht naar een neutraal basisniveau van 70 zodat dunne data een getal niet kan doen uitslaan, en het aantal steekproeven wordt naast elke score getoond.
Wat is het verschil tussen de vakmanschapsassen en de inhoudsassen?
Vakmanschapsassen meten hoe goed een model schrijft, ongeacht het onderwerp — zinkwaliteit, karakterstem, trouw aan het briefing en controle over het tempo. Inhoudsassen meten geschiktheid voor een soort scène: emotie, fysieke actie, conflict, romantiek en expliciete inhoud. Een model kan prachtige zinnen schrijven en toch een vechtscène slecht verwerken, dus de twee families worden apart gescoord en getoond.
Waarom niet gewoon het beste model kiezen en voor alles gebruiken?
Omdat geen enkel model elke as wint. Het sterkste literaire vakmanschap, de beste actie en de meest capabele romantiek of expliciete schrijfstijl behoren tot verschillende modellen. Novelmint routeert een boek per beat over modellen — het grootste deel in één seriestem voor coherentie en afwijkend naar een sterker model op de specifieke beats die dat verdienen — wat alleen mogelijk is omdat dit raster bestaat.
Betekent een lage score dat een model slecht is?
Niet noodzakelijk. Een lage inhoudsscore kan betekenen dat het model capabel maar onwillig is — de meeste modellen scoren laag op erotiek omdat ze weigeren of klinisch worden, niet omdat ze de vaardigheid missen. En een lage-betrouwbaarheidsscore (weinig steekproeven) wordt teruggebracht naar het neutrale basisniveau, zodat het gelezen wordt als \"nog niet bewezen\", niet als \"bewezen zwak\". Lees de score altijd samen met de steekproefgrootte.
Hoe vaak wordt de benchmark bijgewerkt?
Continu. Het raster is een live projectie van de scoreopslag van het platform: dezelfde jury die een passage beoordeelt terwijl Novelmint een hoofdstuk bouwt, vouwt zijn waarnemingen terug in, zodat de cijfers bewegen naarmate auteurs de engine gebruiken en de steekproefgroottes groeien. De pagina toont de datum van de meest recente herkalibratie. Nieuwe modelversies worden opnieuw gemeten vanaf nul in plaats van gemengd met het model dat ze vervingen, zodat een versiewijziging nooit stilletjes een kolom corrumpeert.

What this page does not claim

  • Deze benchmark meet alleen prozakwaliteit en inhoudsgeschiktheid voor fictie. Het zegt niets over het redeneren, de codering, de wiskunde, de feitelijke nauwkeurigheid of de veiligheid van een model buiten de schrijfcontext.
  • Scores zijn relatief ten opzichte van de beoordeelde set en de gebruikte prompts, niet een absolute of officiële beoordeling onderschreven door de modelaanbieders. Modelnamen en handelsmerken zijn eigendom van hun respectievelijke eigenaren.
  • Een hogere overall-vakmanschapsscore betekent niet dat een model de juiste keuze is voor elk boek — stem, genre, inhoudsbehoeften en kosten zijn allemaal belangrijk, wat precies de reden is waarom Novelmint over modellen routeert in plaats van één te kronen.
  • Cellen met weinig steekproeven zijn voorlopig. Waar een getal weinig observaties heeft, wordt het naar het neutrale basisniveau teruggebracht en gemarkeerd, en het zal bewegen naarmate meer metingen worden ingevoegd.

Stop met raden welk model je moet gebruiken. Laat het boek kiezen.

Novelmint routeert elke beat naar het model dat dit raster het meest geschikt acht. Je eerste hoofdstuk is gratis.