Welches KI-Modell schreibt wirklich die beste Fiktion?
Live data · measured as of July 24, 2026
Jede Modellkarte misst Mathematik, Programmierung und logisches Denken. Keine misst, ob ein Modell eine Szene schreiben kann, die ein Leser nicht überspringen würde. Also haben wir den Benchmark gebaut, der genau das tut. Ein Blindjury-Panel bewertet echte, von führenden Modellen generierte Romanprosa auf neun Achsen – vier für das Handwerk, fünf für die Szenentypen, aus denen ein Buch besteht – und die Zahlen unten sind das Live-Ergebnis. Das ist kein Marketingdiagramm: Es ist das exakte Raster, das Novelmint nutzt, um für jeden Beat Ihres Buches ein Modell auszuwählen.
Key takeaways
- Der Benchmark bewertet führende Modelle von Anthropic, OpenAI, Google und xAI anhand echter generierter Romanprosa – keine Multiple-Choice-Tests – auf neun Achsen: vier handwerkliche (Literarizität, Dialog, Treue, Tempo) und fünf inhaltliche (Emotion, Körperlichkeit, Konflikt, Romantik, Erotik).
- Handwerksachsen messen, WIE GUT ein Modell schreibt; Inhaltsachsen messen, für welche ART von Szene es gut geeignet ist. Ein Modell kann wunderschöne Sätze produzieren und trotzdem flache Kampfszenen liefern – deshalb werden beide getrennt bewertet und nie zu einer einzigen irreführenden Zahl zusammengefasst.
- Jeder Wert wird proportional zur Datenmenge auf einen neutralen Basiswert von 70 zurückgezogen, sodass ein glückliches Drei-Stichproben-Ergebnis nie als gesichertes Fakt erscheinen kann. Die Stichprobengröße hinter jeder Zahl wird angezeigt.
- Kein einzelnes Modell gewinnt auf allen Achsen. Das stärkste literarische Handwerk, die zuverlässigste Treue, die beste Action sowie die bereitwilligste Romantik und explizite Schreibweise finden sich in verschiedenen Spalten – das ist das Hauptargument dafür, ein Buch über mehrere Modelle zu verteilen, statt eines zu wählen.
- Dies ist dasselbe Raster, das Novelmint beim Aufbau eines Kapitels zur Modellauswahl pro Beat verwendet – und dasselbe Jury-Mitglied, das eine Passage während eines Builds bewertet, speist es, sodass die Zahlen aktuell bleiben, während Autorinnen und Autoren mit der Engine schreiben. Es ist ein lebendiger Mechanismus, keine rückblickende Behauptung.
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
Dies sind Live-Daten, kein einmaliger Test
Die nachstehende Tabelle ist kein Benchmark, den wir einmal durchgeführt und eingefroren haben. Es ist eine Live-Projektion des Bewertungsspeichers, auf dem die Plattform läuft: Dasselbe Jury-Mitglied, das eine Passage während eines Builds bewertet, speist dieses Raster – jedes auf Novelmint geschriebene Kapitel fügt also Beobachtungen hinzu, die Stichprobengrößen wachsen und die Zahlen werden schärfer. Je mehr Autorinnen und Autoren mit der Engine arbeiten, desto aktueller bleibt der Benchmark – das obige Datum ist schlicht die letzte Rekalibrierung.
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
So liest man das Raster
Die Kopfzahl ist das allgemeine Handwerk – der Durchschnitt der vier Ausführungsachsen eines Modells, was dem nächsten Wert für „wie gut ist seine Prosa" entspricht. Die Inhaltsachsen rechts sind keine Besser-oder-Schlechter-Rankings; sie zeigen, wofür das Modell GEEIGNET ist. Ein hoher Körperlichkeitswert bedeutet saubere Action; ein niedriger Erotikviert bedeutet meist Verweigerung oder klinische Flachheit statt schlechtes Schreiben – Bereitschaft, nicht Können. Lesen Sie das Handwerk in der Spalte nach unten, um Modelle zu vergleichen, und den Inhalt in der Zeile nach rechts, um zu sehen, wo ein einzelnes Modell stark und wo es schwächer ist.
Best AI for…
A straight answer for one kind of scene — or one genre
By what your scene needs
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
Echte Prosa generieren, keine Testantworten
Jedes Modell schreibt unter identischen Bedingungen dieselben Beats – gebriefete Szenen mit erforderlichen Elementen, verbotenem Wissen, einer Erzählperspektive und einem dramatischen Ziel. Wir bewerten das Ergebnis als Fiktion, so wie ein Lektor liest – nicht als Quiz-Leistung.
Blind auf neun Achsen bewerten
Ein Jury-Panel bewertet jede Passage von 0–100 auf vier Handwerksachsen (Literarizität, Dialog, Treue, Tempo) und fünf Inhaltsachsen (Emotion, Körperlichkeit, Konflikt, Romantik, Erotik), ohne zu wissen, welches Modell sie verfasst hat. Handwerk ist Ausführungsqualität; Inhalt ist Eignung für einen Szenentyp.
Auf einen neutralen Vorwert zurückziehen
Ein Rohdurchschnitt aus wenigen Stichproben ist Rauschen. Jede Zelle wird proportional zur Dünnheit der Evidenz auf einen neutralen Basiswert von 70 zurückgezogen, sodass eine frühe Glücksmessung als ungefähr durchschnittlich gilt, bis genügend Beobachtungen sie etablieren. Die veröffentlichte Zahl ist dieser zurückgezogene Wert; die Stichprobengröße wird daneben angezeigt.
Kontinuierlich einfalten, nie manuell überschreiben
Neue Jury-Beobachtungen werden in einen laufenden Mittelwert eingefaltet und die Stichprobenanzahl wächst, sodass das Raster mit der Zeit schärfer wird. Zahlen werden aus den Beobachtungen neu berechnet, nie manuell eingetragen – und wenn sich eine Modellversion unter einem Alias ändert, werden ihre Zellen auf eine saubere Neuausmessung zurückgesetzt, statt zwei verschiedene Modelle zu vermischen.
Where this leads
Warum ein solcher Benchmark überhaupt nutzbar ist
Ein anderes Modell für eine einzelne Szene zu wählen funktioniert nur, wenn ein Buch in diskreten, gebriefeten Einheiten aufgebaut wird, statt in einem Durchgang generiert zu werden. Diese Einheit ist der Beat – und die Geschichte kohärent zu halten, während verschiedene Modelle verschiedene Beats schreiben, ist die Aufgabe eines Arc-und-Entity-Speichers, der den Build begleitet. Der Benchmark ist das Scoreboard; Beats und Arc-Speicher ermöglichen es, ihn tatsächlich einzusetzen.
Questions
Frequently asked
- Welches KI-Modell schreibt die beste Fiktion?
- Nach allgemeinem Handwerk – dem Durchschnitt der Literarizitäts-, Dialog-, Treue- und Tempoachsen auf echter Romanprosa – führt derzeit Claude Opus 4.8, gefolgt von GPT-5.6 Sol. Aber „beste" hängt von der Szene ab: Die höchsten Werte für Action, Romantik und explizite Inhalte finden sich bei verschiedenen Modellen. Das Raster auf dieser Seite zeigt den aktuellen Stand und die Stichprobengröße hinter jeder Zahl.
- Wie wird dieser Benchmark gemessen?
- Jedes Modell schreibt unter identischen Bedingungen dieselben gebriefeten Beats, und ein Blindjury-Panel bewertet die resultierende Prosa von 0–100 auf neun Achsen – vier für das Handwerk (Literarizität, Dialog, Treue, Tempo) und fünf für den Inhaltstyp (Emotion, Körperlichkeit, Konflikt, Romantik, Erotik). Werte werden auf einen neutralen Basiswert von 70 zurückgezogen, damit dünne Daten keine Zahl verzerren, und die Stichprobenanzahl wird neben jedem Wert angezeigt.
- Was ist der Unterschied zwischen Handwerksachsen und Inhaltsachsen?
- Handwerksachsen messen, wie gut ein Modell schreibt, unabhängig vom Thema – Satzqualität, Charakterstimme, Treue zum Brief und Temposteuerung. Inhaltsachsen messen die Eignung für einen Szenentyp: Emotion, körperliche Action, Konflikt, Romantik und explizite Inhalte. Ein Modell kann wunderschöne Sätze schreiben und trotzdem schlechte Kampfszenen liefern – deshalb werden beide Gruppen getrennt bewertet und angezeigt.
- Warum nicht einfach das beste Modell nehmen und für alles verwenden?
- Weil kein Modell auf allen Achsen gewinnt. Das stärkste literarische Handwerk, die beste Action und die fähigste Romantik oder explizite Schreibweise finden sich bei verschiedenen Modellen. Novelmint verteilt ein Buch Beat für Beat über Modelle – behält den Großteil in einer Serienstimme für Kohärenz und weicht für spezifische Beats, die es rechtfertigen, auf ein stärkeres Modell aus – was nur möglich ist, weil dieses Raster existiert.
- Bedeutet ein niedriger Wert, dass ein Modell schlecht ist?
- Nicht unbedingt. Ein niedriger Inhaltswert kann bedeuten, dass das Modell fähig, aber nicht bereit ist – die meisten Modelle erzielen niedrige Erotikvierte, weil sie verweigern oder klinisch werden, nicht weil ihnen die Fähigkeit fehlt. Ein niedrig-konfidenter Wert (wenige Stichproben) wird auf den neutralen Basiswert zurückgezogen und liest sich als „noch nicht bewiesen", nicht als „schwach bewiesen". Lesen Sie den Wert immer zusammen mit seiner Stichprobengröße.
- Wie oft wird der Benchmark aktualisiert?
- Kontinuierlich. Das Raster ist eine Live-Projektion des Plattform-Bewertungsspeichers: Dasselbe Jury-Mitglied, das eine Passage bewertet, während Novelmint ein Kapitel aufbaut, faltet seine Beobachtungen ein – die Zahlen bewegen sich also, während Autorinnen und Autoren die Engine nutzen und die Stichprobengrößen wachsen. Die Seite zeigt das Datum der letzten Rekalibrierung. Neue Modellversionen werden von Grund auf neu gemessen statt mit dem ersetzten Modell vermischt, sodass ein Versionswechsel nie eine Spalte unbemerkt verfälscht.
What this page does not claim
- Dieser Benchmark misst Prosaqualität und inhaltliche Eignung ausschließlich für Fiktion. Er sagt nichts über das logische Denken, Programmieren, Mathematik, faktische Genauigkeit oder Sicherheit eines Modells außerhalb des Schreibkontexts aus.
- Werte sind relativ zur bewerteten Gruppe und den verwendeten Prompts – keine absoluten oder offiziellen Bewertungen, die von den Modellanbietern gebilligt werden. Modellnamen und Marken gehören ihren jeweiligen Eigentümern.
- Ein höherer allgemeiner Handwerkswert bedeutet nicht, dass ein Modell die richtige Wahl für jedes Buch ist – Stimme, Genre, inhaltliche Anforderungen und Kosten spielen alle eine Rolle, weshalb Novelmint genau deshalb über Modelle verteilt, statt eines zu krönen.
- Zellen mit wenigen Stichproben sind vorläufig. Wo eine Zahl auf wenigen Beobachtungen basiert, wird sie auf den neutralen Basiswert zurückgezogen und markiert – sie wird sich verändern, wenn mehr Messungen einfließen.
Verwandt
Beste KI für Actionszenen
Welche KI einen Kampf oder eine Verfolgungsjagd klar und greifbar hält, statt vage zu werden. Gerankt nach Physikalität.
Beste KI für Konfliktszenen
Welche KI einen Streit oder eine Konfrontation straff und eskalierend hält. Gerankt nach gemessenem Konflikt.
Beste KI für emotionale Szenen
Welche KI eine gefühlsgetriebene Szene wirklich wirken lässt, statt sie nur zu beschreiben. Gerankt nach Emotion.
Beste KI für explizite Szenen
Welche KI schreibt tatsächlich explizite Erwachseneninhalte – und welche verweigern sich. Gereiht nach Bereitschaft.
Hören Sie auf zu raten, welches Modell Sie verwenden sollen. Lassen Sie das Buch entscheiden.
Novelmint weist jeden Beat dem Modell zu, das dieses Raster als am besten geeignet ausweist. Ihr erstes Kapitel ist kostenlos.