Der Fiktionsmodell-Benchmark

Welches KI-Modell schreibt wirklich die beste Fiktion?

Live data · measured as of July 24, 2026

Jede Modellkarte misst Mathematik, Programmierung und logisches Denken. Keine misst, ob ein Modell eine Szene schreiben kann, die ein Leser nicht überspringen würde. Also haben wir den Benchmark gebaut, der genau das tut. Ein Blindjury-Panel bewertet echte, von führenden Modellen generierte Romanprosa auf neun Achsen – vier für das Handwerk, fünf für die Szenentypen, aus denen ein Buch besteht – und die Zahlen unten sind das Live-Ergebnis. Das ist kein Marketingdiagramm: Es ist das exakte Raster, das Novelmint nutzt, um für jeden Beat Ihres Buches ein Modell auszuwählen.

Key takeaways

  • Der Benchmark bewertet führende Modelle von Anthropic, OpenAI, Google und xAI anhand echter generierter Romanprosa – keine Multiple-Choice-Tests – auf neun Achsen: vier handwerkliche (Literarizität, Dialog, Treue, Tempo) und fünf inhaltliche (Emotion, Körperlichkeit, Konflikt, Romantik, Erotik).
  • Handwerksachsen messen, WIE GUT ein Modell schreibt; Inhaltsachsen messen, für welche ART von Szene es gut geeignet ist. Ein Modell kann wunderschöne Sätze produzieren und trotzdem flache Kampfszenen liefern – deshalb werden beide getrennt bewertet und nie zu einer einzigen irreführenden Zahl zusammengefasst.
  • Jeder Wert wird proportional zur Datenmenge auf einen neutralen Basiswert von 70 zurückgezogen, sodass ein glückliches Drei-Stichproben-Ergebnis nie als gesichertes Fakt erscheinen kann. Die Stichprobengröße hinter jeder Zahl wird angezeigt.
  • Kein einzelnes Modell gewinnt auf allen Achsen. Das stärkste literarische Handwerk, die zuverlässigste Treue, die beste Action sowie die bereitwilligste Romantik und explizite Schreibweise finden sich in verschiedenen Spalten – das ist das Hauptargument dafür, ein Buch über mehrere Modelle zu verteilen, statt eines zu wählen.
  • Dies ist dasselbe Raster, das Novelmint beim Aufbau eines Kapitels zur Modellauswahl pro Beat verwendet – und dasselbe Jury-Mitglied, das eine Passage während eines Builds bewertet, speist es, sodass die Zahlen aktuell bleiben, während Autorinnen und Autoren mit der Engine schreiben. Es ist ein lebendiger Mechanismus, keine rückblickende Behauptung.

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

Dies sind Live-Daten, kein einmaliger Test

Die nachstehende Tabelle ist kein Benchmark, den wir einmal durchgeführt und eingefroren haben. Es ist eine Live-Projektion des Bewertungsspeichers, auf dem die Plattform läuft: Dasselbe Jury-Mitglied, das eine Passage während eines Builds bewertet, speist dieses Raster – jedes auf Novelmint geschriebene Kapitel fügt also Beobachtungen hinzu, die Stichprobengrößen wachsen und die Zahlen werden schärfer. Je mehr Autorinnen und Autoren mit der Engine arbeiten, desto aktueller bleibt der Benchmark – das obige Datum ist schlicht die letzte Rekalibrierung.

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

So liest man das Raster

Die Kopfzahl ist das allgemeine Handwerk – der Durchschnitt der vier Ausführungsachsen eines Modells, was dem nächsten Wert für „wie gut ist seine Prosa" entspricht. Die Inhaltsachsen rechts sind keine Besser-oder-Schlechter-Rankings; sie zeigen, wofür das Modell GEEIGNET ist. Ein hoher Körperlichkeitswert bedeutet saubere Action; ein niedriger Erotikviert bedeutet meist Verweigerung oder klinische Flachheit statt schlechtes Schreiben – Bereitschaft, nicht Können. Lesen Sie das Handwerk in der Spalte nach unten, um Modelle zu vergleichen, und den Inhalt in der Zeile nach rechts, um zu sehen, wo ein einzelnes Modell stark und wo es schwächer ist.

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

Echte Prosa generieren, keine Testantworten

Jedes Modell schreibt unter identischen Bedingungen dieselben Beats – gebriefete Szenen mit erforderlichen Elementen, verbotenem Wissen, einer Erzählperspektive und einem dramatischen Ziel. Wir bewerten das Ergebnis als Fiktion, so wie ein Lektor liest – nicht als Quiz-Leistung.

02

Blind auf neun Achsen bewerten

Ein Jury-Panel bewertet jede Passage von 0–100 auf vier Handwerksachsen (Literarizität, Dialog, Treue, Tempo) und fünf Inhaltsachsen (Emotion, Körperlichkeit, Konflikt, Romantik, Erotik), ohne zu wissen, welches Modell sie verfasst hat. Handwerk ist Ausführungsqualität; Inhalt ist Eignung für einen Szenentyp.

03

Auf einen neutralen Vorwert zurückziehen

Ein Rohdurchschnitt aus wenigen Stichproben ist Rauschen. Jede Zelle wird proportional zur Dünnheit der Evidenz auf einen neutralen Basiswert von 70 zurückgezogen, sodass eine frühe Glücksmessung als ungefähr durchschnittlich gilt, bis genügend Beobachtungen sie etablieren. Die veröffentlichte Zahl ist dieser zurückgezogene Wert; die Stichprobengröße wird daneben angezeigt.

04

Kontinuierlich einfalten, nie manuell überschreiben

Neue Jury-Beobachtungen werden in einen laufenden Mittelwert eingefaltet und die Stichprobenanzahl wächst, sodass das Raster mit der Zeit schärfer wird. Zahlen werden aus den Beobachtungen neu berechnet, nie manuell eingetragen – und wenn sich eine Modellversion unter einem Alias ändert, werden ihre Zellen auf eine saubere Neuausmessung zurückgesetzt, statt zwei verschiedene Modelle zu vermischen.

Where this leads

Warum ein solcher Benchmark überhaupt nutzbar ist

Ein anderes Modell für eine einzelne Szene zu wählen funktioniert nur, wenn ein Buch in diskreten, gebriefeten Einheiten aufgebaut wird, statt in einem Durchgang generiert zu werden. Diese Einheit ist der Beat – und die Geschichte kohärent zu halten, während verschiedene Modelle verschiedene Beats schreiben, ist die Aufgabe eines Arc-und-Entity-Speichers, der den Build begleitet. Der Benchmark ist das Scoreboard; Beats und Arc-Speicher ermöglichen es, ihn tatsächlich einzusetzen.

Questions

Frequently asked

Welches KI-Modell schreibt die beste Fiktion?
Nach allgemeinem Handwerk – dem Durchschnitt der Literarizitäts-, Dialog-, Treue- und Tempoachsen auf echter Romanprosa – führt derzeit Claude Opus 4.8, gefolgt von GPT-5.6 Sol. Aber „beste" hängt von der Szene ab: Die höchsten Werte für Action, Romantik und explizite Inhalte finden sich bei verschiedenen Modellen. Das Raster auf dieser Seite zeigt den aktuellen Stand und die Stichprobengröße hinter jeder Zahl.
Wie wird dieser Benchmark gemessen?
Jedes Modell schreibt unter identischen Bedingungen dieselben gebriefeten Beats, und ein Blindjury-Panel bewertet die resultierende Prosa von 0–100 auf neun Achsen – vier für das Handwerk (Literarizität, Dialog, Treue, Tempo) und fünf für den Inhaltstyp (Emotion, Körperlichkeit, Konflikt, Romantik, Erotik). Werte werden auf einen neutralen Basiswert von 70 zurückgezogen, damit dünne Daten keine Zahl verzerren, und die Stichprobenanzahl wird neben jedem Wert angezeigt.
Was ist der Unterschied zwischen Handwerksachsen und Inhaltsachsen?
Handwerksachsen messen, wie gut ein Modell schreibt, unabhängig vom Thema – Satzqualität, Charakterstimme, Treue zum Brief und Temposteuerung. Inhaltsachsen messen die Eignung für einen Szenentyp: Emotion, körperliche Action, Konflikt, Romantik und explizite Inhalte. Ein Modell kann wunderschöne Sätze schreiben und trotzdem schlechte Kampfszenen liefern – deshalb werden beide Gruppen getrennt bewertet und angezeigt.
Warum nicht einfach das beste Modell nehmen und für alles verwenden?
Weil kein Modell auf allen Achsen gewinnt. Das stärkste literarische Handwerk, die beste Action und die fähigste Romantik oder explizite Schreibweise finden sich bei verschiedenen Modellen. Novelmint verteilt ein Buch Beat für Beat über Modelle – behält den Großteil in einer Serienstimme für Kohärenz und weicht für spezifische Beats, die es rechtfertigen, auf ein stärkeres Modell aus – was nur möglich ist, weil dieses Raster existiert.
Bedeutet ein niedriger Wert, dass ein Modell schlecht ist?
Nicht unbedingt. Ein niedriger Inhaltswert kann bedeuten, dass das Modell fähig, aber nicht bereit ist – die meisten Modelle erzielen niedrige Erotikvierte, weil sie verweigern oder klinisch werden, nicht weil ihnen die Fähigkeit fehlt. Ein niedrig-konfidenter Wert (wenige Stichproben) wird auf den neutralen Basiswert zurückgezogen und liest sich als „noch nicht bewiesen", nicht als „schwach bewiesen". Lesen Sie den Wert immer zusammen mit seiner Stichprobengröße.
Wie oft wird der Benchmark aktualisiert?
Kontinuierlich. Das Raster ist eine Live-Projektion des Plattform-Bewertungsspeichers: Dasselbe Jury-Mitglied, das eine Passage bewertet, während Novelmint ein Kapitel aufbaut, faltet seine Beobachtungen ein – die Zahlen bewegen sich also, während Autorinnen und Autoren die Engine nutzen und die Stichprobengrößen wachsen. Die Seite zeigt das Datum der letzten Rekalibrierung. Neue Modellversionen werden von Grund auf neu gemessen statt mit dem ersetzten Modell vermischt, sodass ein Versionswechsel nie eine Spalte unbemerkt verfälscht.

What this page does not claim

  • Dieser Benchmark misst Prosaqualität und inhaltliche Eignung ausschließlich für Fiktion. Er sagt nichts über das logische Denken, Programmieren, Mathematik, faktische Genauigkeit oder Sicherheit eines Modells außerhalb des Schreibkontexts aus.
  • Werte sind relativ zur bewerteten Gruppe und den verwendeten Prompts – keine absoluten oder offiziellen Bewertungen, die von den Modellanbietern gebilligt werden. Modellnamen und Marken gehören ihren jeweiligen Eigentümern.
  • Ein höherer allgemeiner Handwerkswert bedeutet nicht, dass ein Modell die richtige Wahl für jedes Buch ist – Stimme, Genre, inhaltliche Anforderungen und Kosten spielen alle eine Rolle, weshalb Novelmint genau deshalb über Modelle verteilt, statt eines zu krönen.
  • Zellen mit wenigen Stichproben sind vorläufig. Wo eine Zahl auf wenigen Beobachtungen basiert, wird sie auf den neutralen Basiswert zurückgezogen und markiert – sie wird sich verändern, wenn mehr Messungen einfließen.

Hören Sie auf zu raten, welches Modell Sie verwenden sollen. Lassen Sie das Buch entscheiden.

Novelmint weist jeden Beat dem Modell zu, das dieses Raster als am besten geeignet ausweist. Ihr erstes Kapitel ist kostenlos.