Die beste KI für das Befolgen von Anweisungen
Live data · ranked by Fidelity · measured as of August 31, 2026
Wenn du nach einem Exposé schreibst, ist das Wertvollste, was ein Modell tun kann, genau das, worum du gebeten hast – Pflichtelemente einhalten, zurückgehaltenes Wissen ausschließen und nicht in erfundene Hintergrundgeschichten abweichen. Dieses Ranking bewertet die führenden Modelle nach dieser Treue, die bei Langform-Fiction stiller eine größere Rolle spielt als Stil: Ein Modell, das bei jeder Szene abweicht, produziert ein Manuskript, das du ständig nachkorrigieren musst.
Key takeaways
- Modelle werden nach gemessener Treue bewertet – wie treu sie die vorgegebene Szene umsetzen – auf echtem Romantext.
- Claude Opus 4.8 führt die Treue mit deutlichem Abstand an, was ein zentraler Grund ist, warum es als primäre Stimme eines Buches funktioniert.
- Hohe Treue verstärkt sich über einen Roman: Sie lässt die geplante Struktur tatsächlich halten, anstatt bei jeder Szene ein wenig abzuweichen.
- Das Ranking ist live und wird aktualisiert, sobald mehr Text gemessen wird.
The ranking
Ranked by Fidelity
Von höchster zu niedrigster gemessener Treue geordnet. Der Wert ist der konfidenzangepasste Wert jedes Modells auf der Treue-Achse, 0–100.
- Claude Opus 4.8Anthropic91
Führt die Treue mit großem Abstand an. Es setzt die vorgegebene Szene nahezu exakt um – die nützlichste Eigenschaft für eine verlässliche Hauptstimme.
- Claude Opus 5Anthropic · Novelmint Lead89
- GPT-5.6 SolOpenAI83
Stark und zuverlässig beim Briefing, zusätzlich führend bei Action und Konflikt.
- GPT-5.6 TerraOpenAI80
- Gemini 3.5 FlashGoogle80
Seine am besten belegte Stärke ist Treue, was dieses schnelle, günstige Modell zu einem verlässlichen Arbeitstier für hochvolumige Entwürfe macht.
- Claude Sonnet 5Anthropic79
- Gemini 3.6 FlashGoogle78
- Gemini 3.1 ProGoogle77
- Grok 4.5xAI75
- Grok 4.3xAI74
- Fable 5Anthropic73
Das Erzählmodell hält das Briefing lockerer – oft die Quelle seiner Lebendigkeit auf der Seite, gelegentlich bei kontinuitätskritischen Szenen mit einem festeren Prompt nachzusteuern.
- GPT-4.1OpenAI70
- Claude Haiku 4.5Anthropic64
How this ranking is made
Bewertet nach genauer Briefing-Umsetzung
Jedes Modell schreibt dieselben gebrieften Beats – mit geforderten Elementen, verbotenем Wissen, einem Blickwinkel – und ein blindes Richtergremium bewertet, wie treu die Prosa diesen Vertrag einhält, ohne den Autor zu kennen. Dünne Stichproben werden auf eine neutrale Basislinie angepasst. Diese Seite ordnet die Modelle nach dieser einen Achse.
See the full nine-axis benchmark and methodologyQuestions
Frequently asked
- Welche KI befolgt ein Schreibbriefing am treuesten?
- Claude Opus 4.8 führt die gemessene Treue im Novelmint-Benchmark mit deutlichem Abstand an – es setzt die vorgegebene Szene mit geringstem Abweichen oder Erfinden um. Das Live-Ranking zeigt die vollständige Reihenfolge.
- Warum ist Treue für einen Roman wichtig?
- Ein Modell, das bei jeder Szene leicht abweicht, produziert ein Manuskript, das ständig nachkorrigiert werden muss. Hohe Treue lässt die geplante Struktur halten, sodass Bearbeitungen greifen und die Kontinuität erhalten bleibt.
- Ist ein treu folgendes Modell weniger kreativ?
- Nicht unbedingt – Treue misst Zuverlässigkeit gegenüber dem Briefing, nicht Einfallslosigkeit. Opus führt sowohl Treue als auch literarisches Handwerk an. Ein lockereres Modell wie Fable kann sich freier anfühlen, was manchmal ein Vorteil und manchmal ein Abweichen ist.
What this page does not claim
- Dies bewertet gemessene Treue ausschließlich auf Fiction-Szenen.
- Briefing-Treue ist eine von neun Achsen; prüfe auch die anderen, die dein Buch braucht.
- Modellnamen sind Markenzeichen ihrer jeweiligen Eigentümer; dies ist eine unabhängige Messung.
Verwandt
KI-Benchmark für Fiktionsmodelle
Wie die führenden KI-Modelle Fiktion schreiben – gemessen auf neun Achsen.
Beste KI für Actionszenen
Welche KI einen Kampf oder eine Verfolgungsjagd klar und greifbar hält, statt vage zu werden. Gerankt nach Physikalität.
Beste KI für Konfliktszenen
Welche KI einen Streit oder eine Konfrontation straff und eskalierend hält. Gerankt nach gemessenem Konflikt.
Beste KI für emotionale Szenen
Welche KI eine gefühlsgetriebene Szene wirklich wirken lässt, statt sie nur zu beschreiben. Gerankt nach Emotion.
Schreibe nach einem Exposé, das das Modell wirklich respektiert.
Novelmint entwirft anhand eines strukturierten Beat-Briefings. Dein erstes Kapitel ist kostenlos.