Methodologie

Hoe de fictiemodel-benchmark werkt

Updated July 23, 2026 · 6 min lezen

De benchmark meet het enige wat modelkaarten nooit doen: of een model een scène kan schrijven die een lezer niet overslaat. Deze pagina legt precies uit hoe de cijfers tot stand komen — wat er gemeten wordt, hoe modellen worden beoordeeld, waarom scores worden gecorrigeerd voor betrouwbaarheid, en hoe het overzicht actueel blijft — zodat je de resultaten zelf kunt afwegen en nauwkeurig kunt citeren.

Key takeaways

  • Grensverleggende modellen schrijven dezelfde gebriefde romanscènes, en een blind, providerdiverses jurypanel beoordeelt het proza van 0–100 op negen assen — zonder te weten welk model het schreef.
  • Negen assen in twee families: vier vakmanschapsassen (literair, dialoog, getrouwheid, tempo) meten hoe goed een model schrijft; vijf inhoudsassen (emotie, fysicaliteit, conflict, romantiek, erotiek) meten wat voor scène het goed schrijft. Ze worden nooit gemiddeld.
  • Elke score wordt richting een neutrale basislijn van 70 gekrompen in verhouding tot hoeveel data erachter staat (een prior ter waarde van vijf observaties), zodat een gelukstreffer met een kleine steekproef de top niet kan bereiken. Steekproefgroottes worden getoond; dunne cellen worden gemarkeerd.
  • Het overzicht is live — nieuwe juryobservaties worden voortdurend in een lopend gemiddelde verwerkt, en een versiewijziging reset en hermeet een model in plaats van het te vermengen met zijn voorganger.
  • Scores beschrijven proza op fictie-beats alleen; het is een onafhankelijke meting, geen officiële providerbeoordeling, en een lage erotieksscore weerspiegelt doorgaans bereidheid, niet vakmanschap.

De Novelmint fictie-benchmark meet het enige wat modelkaarten nooit doen: of een model een scène kan schrijven die een lezer niet zou overslaan. Het is geen scorelijst ontleend aan wiskunde- of coderingstests — het beoordeelt echte romanprosatekst. Hier is precies hoe de cijfers tot stand komen, zodat je ze zelf kunt afwegen en met vertrouwen kunt citeren.

Wat het meet

De benchmark beoordeelt hoe goed de grensverleggende modellen — van Anthropic, OpenAI, Google en xAI — fictie schrijven. Niet hoe ze redeneren, niet hoe ze coderen, niet hoe ze presteren op meerkeuzevragen. Elk model krijgt dezelfde uitgebreide romanbeats — scènes met vereiste elementen, verboden kennis, een gezichtspunt en een dramatisch doel — en wat het schrijft wordt beoordeeld als fictie, zoals een redacteur leest.

Alles wordt uitgedrukt op een enkele schaal van 0–100 per as, zodat de cijfers direct vergelijkbaar zijn tussen modellen en tussen de soorten scènes waaruit een boek daadwerkelijk bestaat.

De negen assen

Fictie is niet één vaardigheid, dus de benchmark brengt het niet terug tot één getal. Er worden negen assen beoordeeld, verdeeld in twee families met verschillende betekenissen.

De vier ambacht-assen meten hoe goed een model schrijft, ongeacht het onderwerp: literair (beeldvorming op zinsniveau, ritme, subtekst, ingetogenheid), dialoog (of personages klinken als afzonderlijke mensen), getrouwheid (hoe nauwkeurig het precies de uitgebreide beat weergeeft, met behoud van vereiste elementen en uitsluiting van verboden kennis), en tempo (beheersing van de vaart — wanneer te verdichten, wanneer te verwijlen).

De vijf inhoud-assen meten voor welk soort scène een model goed is: emotie, fysicaliteit (actie en het lichaam in de ruimte), conflict, romantiek en erotiek (expliciete content voor volwassenen). Dit zijn geen beter-of-slechter-rangschikkingen — ze geven aan waarvoor een model geschikt is. Een model kan prachtige zinnen hebben en toch vlakke vechtscènes schrijven, en dat is waarom ambacht en inhoud afzonderlijk worden beoordeeld en gerapporteerd, en nooit worden gemiddeld tot één misleidend getal.

Hoe elk model wordt beoordeeld

Beoordeling is anonieme collegiale toetsing. Elk model schrijft dezelfde set uitgebreide beats, en een panel van sterke, providerdiversere beoordelingsmodellen beoordeelt elk fragment van 0–100 op elke as — zonder te weten welk model het heeft geschreven, en nooit het eigen werk beoordelend. Een providerdiverser panel is belangrijk: een beoordelaar van buiten de eigen familie van een model herkent de kenmerken die die familie doorgaans beloont.

Omdat de beoordeling anoniem en modeloverschrijdend is, kan een model zichzelf niet vleien, en stelt geen enkele huisstijl de norm.

Beoordelaarsvertekening controleren

Het gebruik van modellen om modellen te beoordelen kent vier bekende faalpatronen, en de methode is ontworpen om elk ervan te ondervangen.

Zelfvoorkeur — een model beloont doorgaans zijn eigen huisstijl. Twee regels verwijderen dit: een model beoordeelt nooit zijn eigen fragment, en het beoordelingspanel is providerdiverser, zodat de smaak van geen enkele familie de norm stelt. Een kenmerk dat één huis beloont, wordt opgemerkt door een beoordelaar van een ander, en omgekeerd.

Breedsprakigheid — beoordelaars belonen betrouwbaar grotere lengte. Elke beat heeft hetzelfde doellengte, ongeveer 220 woorden, zodat alle fragmenten nagenoeg even lang zijn en opvulling niets oplevert. Een model verdient zijn score op wat het met die woorden doet, niet op hoeveel het er gebruikt.

Positie — de volgorde waarin fragmenten verschijnen kan scores sturen naar wat als eerste kwam. Daarom worden fragmenten voor elke beat opnieuw gelabeld en geschud, en elk fragment wordt op zichzelf beoordeeld aan de hand van een vaste rubric in plaats van onderling gerangschikt. Volgorde geeft geen signaal, en eventuele resterende afwijking middelt uit over vele beats en vele beoordelaars.

Steekproef — één gelukkige kladversie kan een model flatteren. Generatie wordt uitgevoerd op de standaardtemperatuur van elk model met een identieke prompt, zonder modelspecifieke aanpassing, zodat geen enkel model een zorgvuldig uitgekozen instelling krijgt die de anderen niet krijgen. En geen enkele cel rust op één kladversie: elk model wordt door elk ander model op het panel over de volledige beatset beoordeeld, waarna de scores worden getrokken naar de neutrale basislijn totdat er voldoende metingen zijn verzameld — zodat geluk met één kladversie verdwijnt lang voordat een getal gepubliceerd wordt.

Waarom scores worden gekrompen op basis van betrouwbaarheid

Een ruwe gemiddelde van een handvol fragmenten is ruis, en ruis vermomd als een score is erger dan helemaal geen score. Daarom wordt elk gepubliceerd getal in verhouding tot hoeveel data er achter staat gekrompen naar een neutrale basislijn van 70 — formeel een prior ter waarde van vijf observaties. Een cel met drie gelukkige steekproeven leest als ruwweg gemiddeld totdat er voldoende metingen zijn om een plek te verdienen; een cel met honderden metingen leest als de werkelijk gemeten waarde.

De steekproefomvang achter elk getal wordt getoond, en elke cel die nog steeds rust op minder dan zes observaties wordt aangemerkt als voorlopig. Dit is waarom een model met weinig data nooit door een fluke naar de top schiet — de methode laat het niet toe.

Hoe het raster actueel blijft

De benchmark is geen eenmalige test die werd uitgevoerd en bevroren. Het is een live projectie van de scoreopslag waarop het platform draait: nieuwe beoordelaarsobservaties worden gevouwen in een voortschrijdend gemiddelde, en het steekproefaantal van elke cel groeit in de tijd, zodat het raster scherper wordt in plaats van te verouderen. De pagina toont altijd de datum van de meest recente herijking.

Één veiligheidsmaatregel is belangrijk voor nauwkeurigheid. Wanneer een duurzame alias (een "latest"-verwijzing) stilzwijgend verwijst naar een nieuw onderliggend model, worden de cellen van dat model gereset en opnieuw gemeten vanaf nul in plaats van vermengd met het model dat ze vervingen — zodat een versiewijziging nooit stilletjes een kolom corrumpeert. Dit is ook waarom de benchmark de specifieke versie vermeldt die gemeten is in plaats van een generiek label.

Beperkingen

De scores beschrijven proza op fictiebeats alleen, beoordeeld aan de hand van deze set modellen en prompts. Het zijn geen officiële beoordelingen die door de modelaanbieders zijn onderschreven, en ze zeggen niets over het redeneren, de nauwkeurigheid of de veiligheid van een model buiten de schrijfcontext. Modelnamen en handelsmerken behoren toe aan hun respectieve eigenaren; dit is een onafhankelijke meting.

Twee lezingen zijn makkelijk verkeerd te begrijpen. Een lage erotiek-score weerspiegelt doorgaans bereidheid — een model dat afwijst of klinisch wordt — niet een gebrek aan vakmanschap. En een lage-betrouwbaarheidsscore betekent "nog niet bewezen", niet "bewezen zwak". Lees een getal altijd samen met de steekproefomvang, en onthoud dat het beste model voor jouw boek afhangt van de assen waarop jouw boek leunt — en dat is precies de reden waarom het raster ze gescheiden houdt.

Questions

Frequently asked

Hoe benchmarkt Novelmint AI-modellen voor fictie?
Elk grensverleggend model schrijft dezelfde gebriefde romanbeats, en een blind, providerdiverses panel van sterke jurymodellen beoordeelt het resulterende proza van 0–100 op negen assen zonder de auteur te kennen. Scores worden richting een neutrale basislijn gekrompen op basis van hoeveel data erachter staat, en observaties worden voortdurend in een lopend gemiddelde verwerkt.
Wat zijn de negen assen?
Vier vakmanschapsassen — literair, dialoog, getrouwheid (aan de brief) en tempo — meten hoe goed een model schrijft. Vijf inhoudsassen — emotie, fysicaliteit (actie), conflict, romantiek en erotiek — meten wat voor scène het goed schrijft. Vakmanschap en inhoud worden apart gerapporteerd, nooit gemiddeld.
Waarom worden scores aangepast voor betrouwbaarheid?
Een ruw gemiddelde van een paar passages is ruis. Elke score wordt richting een neutrale basislijn van 70 gekrompen in verhouding tot hoeveel data erachter staat — een prior ter waarde van vijf observaties — zodat een gelukstreffer met een kleine steekproef de top niet kan bereiken. De steekproefgrootte wordt getoond, en cellen met minder dan zes observaties worden als voorlopig gemarkeerd.
Is dit een officiële ranking van OpenAI, Anthropic, Google of xAI?
Nee. Het is een onafhankelijke meting door Novelmint, uitsluitend op fictieproza, beoordeeld ten opzichte van deze set modellen en prompts. Het zegt niets over redeneren, nauwkeurigheid of andere mogelijkheden, en modelnamen zijn handelsmerken van hun respectieve eigenaren.
Hoe vaak wordt de benchmark bijgewerkt?
Continu — nieuwe juryobservaties worden in een lopend gemiddelde verwerkt en steekproefgroottes groeien, zodat het overzicht in de loop van de tijd scherper wordt. Wanneer een modelversie verandert onder een alias, worden de cellen gereset en hermeten in plaats van vermengd met de oudere versie. De pagina toont de datum van de meest recente herkalibrering.

What this page does not claim

  • De scores zijn relatief ten opzichte van de beoordeelde set modellen en de gebruikte prompts — geen absolute of officiële beoordeling.
  • Een lage eroticascore weerspiegelt bereidheid (een model dat weigert of klinisch wordt), niet een gebrek aan vakmanschap; een lage betrouwbaarheidsscore betekent \"nog niet bewezen\", niet \"bewezen zwak\".
  • De benchmark meet uitsluitend fictieproza en zegt niets over redeneren, coderen, feitelijke nauwkeurigheid of veiligheid buiten de schrijfcontext.

Ontdek welk model jouw soort scène het beste schrijft.

Live data over negen assen, bijgewerkt naarmate er meer proza wordt gemeten.