Który model AI naprawdę pisze najlepszą fikcję?
Live data · measured as of July 24, 2026
Karty każdego modelu mierzą matematykę, kodowanie i rozumowanie. Żadna nie mierzy, czy model potrafi napisać scenę, której czytelnik nie przewinie. Dlatego stworzyliśmy ten benchmark. Ślepa komisja sędziowska ocenia prawdziwą prozę powieściową generowaną przez czołowe modele w dziewięciu wymiarach — cztery dotyczą rzemiosła, pięć rodzajów scen, z których faktycznie składa się książka — a poniższe liczby to wyniki na żywo. To nie jest wykres marketingowy: to dokładnie ta siatka, którą Novelmint odczytuje, wybierając model dla każdego fragmentu Twojej książki.
Key takeaways
- Benchmark ocenia czołowe modele Anthropic, OpenAI, Google i xAI na rzeczywistej generowanej prozie powieściowej — nie testach wielokrotnego wyboru — w dziewięciu wymiarach: cztery rzemiosła (literackość, dialog, wierność, tempo) i pięć treści (emocje, fizyczność, konflikt, romans, erotyzm).
- Wymiary rzemiosła mierzą, JAK DOBRZE model pisze; wymiary treści mierzą, JAKI RODZAJ sceny pisze dobrze. Model może tworzyć piękne zdania i nadal pisać płaskie sceny walki — dlatego obie grupy są oceniane osobno i nigdy nie są uśredniane do jednej mylącej liczby.
- Każdy wynik jest ściągany w stronę neutralnej bazy 70, proporcjonalnie do ilości danych za nim stojących — dzięki czemu szczęśliwy wynik z trzech próbek nie może udawać ustalonego faktu. Rozmiar próbki za każdą liczbą jest widoczny.
- Żaden model nie wygrywa we wszystkim. Najsilniejsze ogólne rzemiosło literackie, najbardziej stabilna wierność, najlepsza akcja oraz najbardziej skłonny do romansu i treści erotycznych — wszystkie siedzą w różnych kolumnach. To właśnie argument za tym, by kierować książkę przez wiele modeli, zamiast wybierać jeden.
- To ta sama siatka, której Novelmint używa do wyboru modelu dla każdego fragmentu podczas budowania rozdziału — i ten sam sędzia, który ocenia fragment podczas budowania, zasila ją danymi, więc liczby stale się aktualizują w miarę jak autorzy piszą z silnikiem. To mechanizm na żywo, a nie retrospektywne twierdzenie.
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
To dane na żywo, nie jednorazowy test
Tabela poniżej nie jest benchmarkiem, który uruchomiliśmy raz i zamroziliśmy. To żywa projekcja zasobu ocen, na którym działa platforma: ten sam sędzia, który ocenia fragment podczas budowania, zasila tę siatkę — więc każdy rozdział napisany na Novelmint dodaje obserwacje, rozmiary próbek rosną, a liczby się wyostrzają. W miarę jak coraz więcej autorów korzysta z silnika, benchmark stale się aktualizuje — data powyżej to po prostu ostatnia rekalibracja.
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
Jak czytać siatkę
Główna liczba to ogólne rzemiosło — średnia czterech osi wykonania modelu, czyli najbliższe odpowiedzi na pytanie „jak dobra jest jego proza". Osie treści po prawej nie są rankingiem lepszy-gorszy; mówią, do czego model NADAJE SIĘ. Wysoki wynik fizyczności oznacza czystą akcję; niski wynik erotyzmu zazwyczaj oznacza odmowę lub kliniczną płaskość, a nie słabe pisanie — chęć, nie umiejętność. Czytaj rzemiosło w dół kolumny, by porównywać modele, i czytaj treść wzdłuż wiersza, by zobaczyć, gdzie dany model jest mocny, a gdzie nie.
Best AI for…
A straight answer for one kind of scene — or one genre
By what your scene needs
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
Generuj prawdziwą prozę, nie odpowiedzi testowe
Każdy model pisze te same fragmenty — opatrzone briefem sceny z wymaganymi elementami, zakazaną wiedzą, punktem widzenia i celem dramatycznym — w identycznych warunkach. Oceniamy to, co produkuje jako fikcję, tak jak redaktor czyta, a nie jak wypada na quizie.
Oceniaj ślepo, w dziewięciu wymiarach
Komisja sędziowska ocenia każdy fragment w skali 0–100 na czterech osiach rzemiosła (literackość, dialog, wierność, tempo) i pięciu osiach treści (emocje, fizyczność, konflikt, romans, erotyzm), nie wiedząc, który model go napisał. Rzemiosło to jakość wykonania; treść to przydatność do danego rodzaju sceny.
Ściągaj wyniki w stronę neutralnej bazy
Surowa średnia z garstki próbek to szum. Każda komórka jest ściągana w stronę neutralnej bazy 70, proporcjonalnie do skromności dowodów — dzięki czemu wczesny, szczęśliwy pomiar czyta się jako mniej więcej przeciętny, dopóki wystarczająca liczba obserwacji nie zasłuży na swoje miejsce. Publikowana liczba to ta ściągnięta wartość; rozmiar próbki jest podany obok.
Dodawaj obserwacje, nigdy nie nadpisuj ręcznie
Nowe obserwacje sędziów są wplatane w bieżącą średnią, a liczba próbek rośnie — siatka wyostrza się z czasem. Liczby są regenerowane z obserwacji, nigdy nie wpisywane ręcznie, a gdy wersja modelu zmienia się pod aliasem, jego komórki resetują się do czystego ponownego pomiaru, zamiast mieszać dwa różne modele.
Where this leads
Dlaczego taki benchmark w ogóle można stosować
Wybór innego modelu do jednej sceny jest możliwy tylko wtedy, gdy książka jest budowana w oddzielnych, opatrzonych briefem jednostkach, a nie generowana jednorazowo. Tą jednostką jest fragment, a utrzymanie spójności historii, gdy różne modele piszą różne fragmenty, jest zadaniem pamięci łuków i bytów, która towarzyszy budowaniu. Benchmark to tabela wyników; fragmenty i pamięć łuków to to, co pozwala książce faktycznie z niej korzystać.
Questions
Frequently asked
- Który model AI pisze najlepszą fikcję?
- Pod względem ogólnego rzemiosła — średniej osi literackości, dialogu, wierności i tempa na rzeczywistej prozie powieściowej — Claude Opus 4.8 aktualnie prowadzi, z GPT-5.6 Sol tuż za nim. Ale „najlepszy" zależy od sceny: najwyższe wyniki w akcji, romansie i treściach erotycznych należą do różnych modeli. Siatka na tej stronie pokazuje aktualne zestawienie i rozmiar próbki za każdą liczbą.
- Jak mierzony jest ten benchmark?
- Każdy model pisze te same briefowane fragmenty w identycznych warunkach, a ślepa komisja sędziowska ocenia wynikową prozę w skali 0–100 w dziewięciu wymiarach — cztery dla rzemiosła (literackość, dialog, wierność, tempo) i pięć dla rodzaju treści (emocje, fizyczność, konflikt, romans, erotyzm). Wyniki są ściągane w stronę neutralnej bazy 70, by skąpe dane nie mogły przechylić wyniku, a liczba próbek jest podana obok każdego wyniku.
- Jaka jest różnica między osiami rzemiosła a osiami treści?
- Osie rzemiosła mierzą, jak dobrze model pisze, niezależnie od tematu — jakość zdań, głos postaci, wierność briefowi i kontrolę tempa. Osie treści mierzą przydatność do danego rodzaju sceny: emocje, akcja fizyczna, konflikt, romans i treści erotyczne. Model może pisać wspaniałe zdania i nadal słabo radzić sobie ze sceną walki, dlatego obie grupy są oceniane i pokazywane osobno.
- Dlaczego nie wybrać po prostu jednego najlepszego modelu i używać go do wszystkiego?
- Bo żaden model nie wygrywa we wszystkich wymiarach. Najsilniejsze rzemiosło literackie, najlepsza akcja oraz najbardziej zdolny romans lub treści erotyczne należą do różnych modeli. Novelmint kieruje książkę przez modele fragment po fragmencie — utrzymując większość w jednym głosie serii dla spójności i odchylając do mocniejszego modelu w konkretnych fragmentach, które na to zasługują — co jest możliwe tylko dlatego, że ta siatka istnieje.
- Czy niski wynik oznacza, że model jest słaby?
- Niekoniecznie. Niski wynik treści może oznaczać, że model jest zdolny, ale niechętny — większość modeli osiąga niskie wyniki erotyzmu, bo odmawia lub staje się kliniczny, a nie dlatego, że brak mu umiejętności. A niski wynik o małej pewności (mała próbka) jest ściągany w stronę neutralnej bazy, więc czyta się jako „jeszcze nieudowodniony", a nie „udowodniony słaby". Zawsze czytaj wynik razem z rozmiarem jego próbki.
- Jak często benchmark jest aktualizowany?
- Ciągle. Siatka to żywa projekcja zasobu ocen platformy: ten sam sędzia, który ocenia fragment podczas gdy Novelmint buduje rozdział, wplata swoje obserwacje z powrotem, więc liczby zmieniają się w miarę jak autorzy korzystają z silnika i rosną rozmiary próbek. Strona pokazuje datę ostatniej rekalibracji. Nowe wersje modeli są mierzone od nowa, a nie mieszane z modelem, który zastępują — zmiana wersji nigdy nie psuje po cichu kolumny.
What this page does not claim
- Ten benchmark mierzy jakość prozy i przydatność treści wyłącznie do fikcji. Nie mówi nic o rozumowaniu, kodowaniu, matematyce, dokładności faktów ani bezpieczeństwie modelu poza kontekstem pisarskim.
- Wyniki są względem ocenianego zestawu i użytych promptów, a nie oficjalną ani absolutną oceną zatwierdzoną przez dostawców modeli. Nazwy modeli i znaki towarowe należą do ich odpowiednich właścicieli.
- Wyższy wynik ogólnego rzemiosła nie oznacza, że model jest właściwym wyborem do każdej książki — głos, gatunek, potrzeby treściowe i koszty — wszystko ma znaczenie, i właśnie dlatego Novelmint kieruje przez wiele modeli, zamiast koronować jeden.
- Komórki z małą próbką są tymczasowe. Tam, gdzie liczba ma mało obserwacji, jest ściągana w stronę neutralnej bazy i oznaczona flagą — i zmieni się, gdy zostanie wplecione więcej pomiarów.
Powiązane
Najlepsze AI do scen akcji
Które AI utrzymuje walkę lub pościg czytelnym i osadzonym zamiast mglistym. Ranking fizyczności.
Najlepsze AI do scen konfliktów
Które AI utrzymuje kłótnię lub pat napięty i eskalujący. Ranking zmierzonego konfliktu.
Najlepsze AI do scen emocjonalnych
Które AI sprawia, że scena oparta na uczuciach naprawdę trafia — zamiast tylko ją opisywać. Ranking emocji.
Najlepsza AI do scen erotycznych
Która AI napiszę jawne treści dla dorosłych — a która odmawia. Ranking gotowości.
Przestań zgadywać, który model wybrać. Pozwól, by zdecydowała książka.
Novelmint kieruje każdy fragment do modelu, który według tej siatki najlepiej do niego pasuje. Twój pierwszy rozdział jest za darmo.