Methodik

Wie der Fictions-Modell-Benchmark funktioniert

Updated July 23, 2026 · 6 Min. Lesezeit

Der Benchmark misst genau das, was Modellkarten nie messen: ob ein Modell eine Szene schreiben kann, die ein Leser nicht überspringen würde. Diese Seite erklärt genau, wie die Zahlen entstehen – was gemessen wird, wie Modelle bewertet werden, warum Scores durch Konfidenz korrigiert werden und wie das Raster aktuell bleibt –, damit du die Ergebnisse selbst einordnen und korrekt zitieren kannst.

Key takeaways

  • Frontier-Modelle schreiben dieselben gebrieften Romanszenen, und ein blindes, anbieterseitig diverses Jurorenpanel bewertet die Prosa auf neun Achsen mit 0–100 – ohne zu wissen, welches Modell sie geschrieben hat.
  • Neun Achsen in zwei Kategorien: Vier Handwerks-Achsen (Literarizität, Dialog, Werktreue, Tempo) messen, wie gut ein Modell schreibt; fünf Inhalts-Achsen (Emotion, Körperlichkeit, Konflikt, Romantik, Erotik) messen, welche Art von Szene es gut schreibt. Sie werden nie zusammengemittelt.
  • Jeder Score wird proportional zur Datenmenge auf eine neutrale Baseline von 70 zurückgeführt (ein Prior mit dem Gewicht von fünf Beobachtungen), damit eine glückliche kleine Stichprobe nicht an die Spitze gelangen kann. Stichprobengrößen werden angezeigt; dünne Zellen werden markiert.
  • Das Raster ist live – neue Jurorbeobachtungen fließen fortlaufend in einen laufenden Mittelwert ein, und eine Versionsänderung setzt ein Modell zurück und misst es neu, anstatt es mit seinem Vorgänger zu vermischen.
  • Scores beschreiben Prosa nur auf Fictions-Szenen; sie sind eine unabhängige Messung, keine offizielle Anbieterbewertung, und ein niedriger Erotik-Score spiegelt meist die Bereitschaft wider, nicht das Handwerk.

Der Novelmint-Fiktion-Benchmark misst das eine, was Modellkarten nie messen: ob ein Modell eine Szene schreiben kann, die ein Leser nicht überspringen würde. Es ist kein Leaderboard, das aus Mathematik- oder Programmiertests entlehnt wurde — er bewertet echte Romanprosa. Hier wird genau erklärt, wie die Zahlen zustande kommen, damit Sie sie selbst abwägen und mit Zuversicht zitieren können.

Was er misst

Der Benchmark bewertet, wie gut die führenden Modelle — von Anthropic, OpenAI, Google und xAI — Fiktion schreiben. Nicht wie sie schlussfolgern, nicht wie sie programmieren, nicht wie sie bei Multiple-Choice-Tests abschneiden. Jedes Modell erhält dieselben gebrieften Romanszenen — Szenen mit vorgeschriebenen Elementen, verbotenem Wissen, einer Perspektive und einem dramatischen Ziel — und das, was es schreibt, wird als Fiktion beurteilt, so wie ein Lektor liest.

Alles wird auf einer einzigen Skala von 0–100 pro Achse ausgedrückt, sodass die Zahlen direkt über Modelle hinweg und über die verschiedenen Szenentypen, aus denen ein Buch tatsächlich besteht, vergleichbar sind.

Die neun Achsen

Fiktion ist keine einzelne Fähigkeit, daher reduziert der Benchmark sie nicht auf eine einzige Zahl. Er bewertet neun Achsen, aufgeteilt in zwei Gruppen, die unterschiedliches bedeuten.

Die vier Handwerks-Achsen messen, wie gut ein Modell schreibt, unabhängig vom Thema: Literarisch (Bildsprache auf Satzebene, Rhythmus, Subtext, Zurückhaltung), Dialog (ob Figuren wie eigenständige Personen klingen), Treue (wie genau es die gebrieften Szenen wiedergibt, vorgeschriebene Elemente beibehält und verbotenes Wissen ausschließt) und Tempo (Kontrolle des Schwungs — wann zu verdichten ist, wann zu verweilen ist).

Die fünf Inhalts-Achsen messen, welche Art von Szene ein Modell gut schreibt: Emotion, Körperlichkeit (Aktion und der Körper im Raum), Konflikt, Romanze und Erotik (expliziter Inhalt für Erwachsene). Das sind keine Besser-oder-Schlechter-Rangfolgen — sie zeigen, wofür ein Modell geeignet ist. Ein Modell kann wunderschöne Sätze haben und dennoch flache Kampfszenen schreiben, weshalb Handwerk und Inhalt separat bewertet und gemeldet werden und niemals zu einer einzigen irreführenden Zahl zusammengefasst werden.

Wie jedes Modell bewertet wird

Die Bewertung ist blinde Peer-Review. Jedes Modell schreibt dieselbe Reihe gebriefter Szenen, und ein Panel aus starken, anbieterübergreifend zusammengesetzten Richtermodellen bewertet jede Passage auf einer Skala von 0–100 für jede Achse — ohne zu wissen, welches Modell sie verfasst hat, und ohne jemals die eigene Arbeit zu beurteilen. Ein anbieterübergreifendes Panel ist wichtig: Ein Richter von außerhalb der eigenen Modellfamilie erkennt die Eigenheiten, die diese Familie dazu neigt zu belohnen.

Da die Bewertung blind und modellübergreifend erfolgt, kann sich ein Modell nicht selbst schmeicheln, und kein einzelner Hausstil setzt den Standard.

Kontrolle von Richterverzerrungen

Modelle zur Beurteilung von Modellen einzusetzen, birgt vier bekannte Fehlerquellen, und die Methode ist darauf ausgelegt, jede einzelne zu schließen.

Selbstbevorzugung — ein Modell neigt dazu, seinen eigenen Hausstil zu belohnen. Zwei Regeln beseitigen das: Ein Modell bewertet niemals seine eigene Passage, und das Richter-Panel ist anbieterübergreifend zusammengesetzt, sodass kein einzelner Familiengeschmack den Standard setzt. Ein Merkmal, das eine Familie belohnt, wird von einem Richter aus einer anderen erkannt, und umgekehrt.

Weitschweifigkeit — Richter belohnen verlässlich zu großen Umfang. Jede Szene gibt dasselbe Ziel vor, ungefähr 220 Wörter, sodass alle Passagen nahezu gleich lang ausfallen und Füllmaterial nichts einbringt. Ein Modell verdient seine Bewertung durch das, was es mit diesen Wörtern macht, nicht durch die Anzahl, die es verbraucht.

Reihenfolge — die Reihenfolge, in der Passagen erscheinen, kann die Bewertungen in Richtung des zuerst Erschienenen lenken. Deshalb werden Passagen für jede Szene neu beschriftet und neu gemischt, und jede wird einzeln anhand einer festen Rubrik bewertet, anstatt gegeneinander eingestuft zu werden. Die Reihenfolge trägt kein Signal, und jede verbleibende Drift mittelt sich über viele Szenen und viele Richter heraus.

Stichprobennahme — ein einziger glücklicher Entwurf kann ein Modell zu gut erscheinen lassen. Die Generierung läuft bei der Standardtemperatur jedes Modells auf einem identischen Prompt, ohne modellspezifische Anpassung, sodass kein Modell eine sorgfältig ausgewählte Einstellung erhält, die die anderen nicht bekommen. Und keine Zelle beruht auf einem einzigen Entwurf: Jedes Modell wird über den gesamten Szenensatz von jedem anderen Modell im Panel bewertet und dann in Richtung des neutralen Ausgangswerts gedrückt, bis genügend Messungen gesammelt wurden — sodass das Glück eines einzelnen Entwurfs längst ausgeglichen ist, bevor eine Zahl veröffentlicht wird.

Warum Bewertungen durch Konfidenz gedrückt werden

Ein roher Durchschnitt aus einer Handvoll Passagen ist Rauschen, und Rauschen, das als Bewertung verkleidet ist, ist schlimmer als gar keine Bewertung. Daher wird jede veröffentlichte Zahl proportional zu den dahinterstehenden Datenmenge in Richtung eines neutralen Ausgangswerts von 70 gedrückt — formal gesehen ein Prior im Wert von fünf Beobachtungen. Eine Zelle, die auf drei glücklichen Stichproben beruht, erscheint als ungefähr durchschnittlich, bis genügend Messungen ihr einen Platz verdienen; eine Zelle, die auf Hunderten beruht, erscheint als ihr wahres gemessener Wert.

Die Stichprobengröße hinter jeder Zahl wird angezeigt, und jede Zelle, die noch auf weniger als sechs Beobachtungen beruht, wird als vorläufig gekennzeichnet. Deshalb schießt ein Modell mit dünner Datenlage nie durch einen Glückstreffer an die Spitze — die Methode lässt es nicht zu.

Wie das Raster aktuell bleibt

Der Benchmark ist kein einmaliger Test, der durchgeführt und eingefroren wurde. Er ist eine Live-Projektion des Bewertungsspeichers, auf dem die Plattform läuft: Neue Richterbeobachtungen fließen in einen laufenden Mittelwert ein, und die Stichprobenzahl jeder Zelle wächst mit der Zeit, sodass das Raster schärfer wird, anstatt zu veralten. Die Seite zeigt immer das Datum der jüngsten Neukalibrierung.

Eine Schutzmaßnahme ist wichtig für die Genauigkeit. Wenn ein dauerhafter Alias (ein „neuester"-Zeiger) stillschweigend auf ein neues zugrunde liegendes Modell umgeleitet wird, werden die Zellen dieses Modells zurückgesetzt und von Grund auf neu gemessen, anstatt mit dem Modell, das es ersetzt hat, vermischt zu werden — sodass eine Versionsänderung eine Spalte nie still korrumpiert. Das ist auch der Grund, warum der Benchmark die spezifische gemessene Version benennt und nicht ein generisches Etikett.

Einschränkungen

Die Bewertungen beschreiben Prosa nur auf Fiktionsszenen, beurteilt anhand dieser Modelle und Prompts. Es handelt sich nicht um offizielle Bewertungen, die von den Modellanbietern gebilligt werden, und sie sagen nichts über die Schlussfolgerungsfähigkeit, Genauigkeit oder Sicherheit eines Modells außerhalb des Schreibkontexts aus. Modellnamen und Marken gehören ihren jeweiligen Eigentümern; dies ist eine unabhängige Messung.

Zwei Lesarten sind leicht falsch zu verstehen. Ein niedriger Erotik-Wert spiegelt in der Regel Bereitschaft wider — ein Modell, das ablehnt oder klinisch wird — und kein Versagen des Handwerks. Und ein Wert mit niedriger Konfidenz bedeutet „noch nicht bewiesen", nicht „als schwach bewiesen". Lesen Sie eine Zahl immer zusammen mit ihrer Stichprobengröße, und denken Sie daran, dass das beste Modell für Ihr Buch davon abhängt, auf welche Achsen Ihr Buch sich stützt — das ist der eigentliche Grund, warum das Raster sie getrennt hält.

Questions

Frequently asked

Wie bewertet Novelmint KI-Modelle für Fiction?
Jedes Frontier-Modell schreibt dieselben gebrieften Romanszenen, und ein blindes, anbieterseitig diverses Panel starker Juror-Modelle bewertet die entstehende Prosa mit 0–100 auf neun Achsen – ohne den Autor zu kennen. Scores werden proportional zur Datenmenge auf eine neutrale Baseline zurückgeführt, und Beobachtungen fließen laufend in einen Mittelwert ein.
Was sind die neun Achsen?
Vier Handwerks-Achsen – Literarizität, Dialog, Werktreue (Treue zum Brief) und Tempo – messen, wie gut ein Modell schreibt. Fünf Inhalts-Achsen – Emotion, Körperlichkeit (Action), Konflikt, Romantik und Erotik – messen, welche Art von Szene es gut schreibt. Handwerk und Inhalt werden separat ausgewiesen und nie gemittelt.
Warum werden die Scores für Konfidenz angepasst?
Ein roher Mittelwert aus wenigen Passagen ist Rauschen. Jeder Score wird proportional zur Datenmenge auf eine neutrale Baseline von 70 zurückgeführt – ein Prior mit dem Gewicht von fünf Beobachtungen –, damit eine glückliche kleine Stichprobe nicht an die Spitze gelangen kann. Die Stichprobengröße wird angezeigt, und Zellen mit weniger als sechs Beobachtungen werden als vorläufig markiert.
Ist dies ein offizielles Ranking von OpenAI, Anthropic, Google oder xAI?
Nein. Es ist eine unabhängige Messung von Novelmint, ausschließlich für Fiction-Prosa, bewertet anhand dieser Modell- und Prompt-Auswahl. Sie sagt nichts über Denkvermögen, Genauigkeit oder andere Fähigkeiten aus, und Modellnamen sind Marken ihrer jeweiligen Inhaber.
Wie oft wird der Benchmark aktualisiert?
Kontinuierlich – neue Jurorbeobachtungen fließen in einen laufenden Mittelwert ein und Stichprobengrößen wachsen, sodass das Raster mit der Zeit schärfer wird. Ändert sich eine Modellversion unter einem Alias, werden ihre Zellen zurückgesetzt und neu gemessen, anstatt mit der älteren Version vermischt zu werden. Die Seite zeigt das Datum der letzten Rekalibrierung.

What this page does not claim

  • Die Scores sind relativ zur bewerteten Modellmenge und den verwendeten Prompts – keine absolute oder offizielle Bewertung.
  • Ein niedriger Erotik-Score spiegelt die Bereitschaft wider (ein Modell lehnt ab oder wird klinisch), nicht mangelndes Handwerk; ein niedrig-konfidenter Score bedeutet „noch nicht belegt", nicht „als schwach belegt".
  • Der Benchmark misst ausschließlich Fiction-Prosa und sagt nichts über Denkvermögen, Coding, Faktengenauigkeit oder Sicherheit außerhalb des Schreibkontexts aus.

Finde heraus, welches Modell deine Art von Szene am besten schreibt.

Live-Daten über neun Achsen, aktualisiert während mehr Prosa gemessen wird.