Benchmark modeli do fikcji

Który model AI naprawdę pisze najlepszą fikcję?

Live data · measured as of July 24, 2026

Karty każdego modelu mierzą matematykę, kodowanie i rozumowanie. Żadna nie mierzy, czy model potrafi napisać scenę, której czytelnik nie przewinie. Dlatego stworzyliśmy ten benchmark. Ślepa komisja sędziowska ocenia prawdziwą prozę powieściową generowaną przez czołowe modele w dziewięciu wymiarach — cztery dotyczą rzemiosła, pięć rodzajów scen, z których faktycznie składa się książka — a poniższe liczby to wyniki na żywo. To nie jest wykres marketingowy: to dokładnie ta siatka, którą Novelmint odczytuje, wybierając model dla każdego fragmentu Twojej książki.

Key takeaways

  • Benchmark ocenia czołowe modele Anthropic, OpenAI, Google i xAI na rzeczywistej generowanej prozie powieściowej — nie testach wielokrotnego wyboru — w dziewięciu wymiarach: cztery rzemiosła (literackość, dialog, wierność, tempo) i pięć treści (emocje, fizyczność, konflikt, romans, erotyzm).
  • Wymiary rzemiosła mierzą, JAK DOBRZE model pisze; wymiary treści mierzą, JAKI RODZAJ sceny pisze dobrze. Model może tworzyć piękne zdania i nadal pisać płaskie sceny walki — dlatego obie grupy są oceniane osobno i nigdy nie są uśredniane do jednej mylącej liczby.
  • Każdy wynik jest ściągany w stronę neutralnej bazy 70, proporcjonalnie do ilości danych za nim stojących — dzięki czemu szczęśliwy wynik z trzech próbek nie może udawać ustalonego faktu. Rozmiar próbki za każdą liczbą jest widoczny.
  • Żaden model nie wygrywa we wszystkim. Najsilniejsze ogólne rzemiosło literackie, najbardziej stabilna wierność, najlepsza akcja oraz najbardziej skłonny do romansu i treści erotycznych — wszystkie siedzą w różnych kolumnach. To właśnie argument za tym, by kierować książkę przez wiele modeli, zamiast wybierać jeden.
  • To ta sama siatka, której Novelmint używa do wyboru modelu dla każdego fragmentu podczas budowania rozdziału — i ten sam sędzia, który ocenia fragment podczas budowania, zasila ją danymi, więc liczby stale się aktualizują w miarę jak autorzy piszą z silnikiem. To mechanizm na żywo, a nie retrospektywne twierdzenie.

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

To dane na żywo, nie jednorazowy test

Tabela poniżej nie jest benchmarkiem, który uruchomiliśmy raz i zamroziliśmy. To żywa projekcja zasobu ocen, na którym działa platforma: ten sam sędzia, który ocenia fragment podczas budowania, zasila tę siatkę — więc każdy rozdział napisany na Novelmint dodaje obserwacje, rozmiary próbek rosną, a liczby się wyostrzają. W miarę jak coraz więcej autorów korzysta z silnika, benchmark stale się aktualizuje — data powyżej to po prostu ostatnia rekalibracja.

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

Jak czytać siatkę

Główna liczba to ogólne rzemiosło — średnia czterech osi wykonania modelu, czyli najbliższe odpowiedzi na pytanie „jak dobra jest jego proza". Osie treści po prawej nie są rankingiem lepszy-gorszy; mówią, do czego model NADAJE SIĘ. Wysoki wynik fizyczności oznacza czystą akcję; niski wynik erotyzmu zazwyczaj oznacza odmowę lub kliniczną płaskość, a nie słabe pisanie — chęć, nie umiejętność. Czytaj rzemiosło w dół kolumny, by porównywać modele, i czytaj treść wzdłuż wiersza, by zobaczyć, gdzie dany model jest mocny, a gdzie nie.

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

Generuj prawdziwą prozę, nie odpowiedzi testowe

Każdy model pisze te same fragmenty — opatrzone briefem sceny z wymaganymi elementami, zakazaną wiedzą, punktem widzenia i celem dramatycznym — w identycznych warunkach. Oceniamy to, co produkuje jako fikcję, tak jak redaktor czyta, a nie jak wypada na quizie.

02

Oceniaj ślepo, w dziewięciu wymiarach

Komisja sędziowska ocenia każdy fragment w skali 0–100 na czterech osiach rzemiosła (literackość, dialog, wierność, tempo) i pięciu osiach treści (emocje, fizyczność, konflikt, romans, erotyzm), nie wiedząc, który model go napisał. Rzemiosło to jakość wykonania; treść to przydatność do danego rodzaju sceny.

03

Ściągaj wyniki w stronę neutralnej bazy

Surowa średnia z garstki próbek to szum. Każda komórka jest ściągana w stronę neutralnej bazy 70, proporcjonalnie do skromności dowodów — dzięki czemu wczesny, szczęśliwy pomiar czyta się jako mniej więcej przeciętny, dopóki wystarczająca liczba obserwacji nie zasłuży na swoje miejsce. Publikowana liczba to ta ściągnięta wartość; rozmiar próbki jest podany obok.

04

Dodawaj obserwacje, nigdy nie nadpisuj ręcznie

Nowe obserwacje sędziów są wplatane w bieżącą średnią, a liczba próbek rośnie — siatka wyostrza się z czasem. Liczby są regenerowane z obserwacji, nigdy nie wpisywane ręcznie, a gdy wersja modelu zmienia się pod aliasem, jego komórki resetują się do czystego ponownego pomiaru, zamiast mieszać dwa różne modele.

Where this leads

Dlaczego taki benchmark w ogóle można stosować

Wybór innego modelu do jednej sceny jest możliwy tylko wtedy, gdy książka jest budowana w oddzielnych, opatrzonych briefem jednostkach, a nie generowana jednorazowo. Tą jednostką jest fragment, a utrzymanie spójności historii, gdy różne modele piszą różne fragmenty, jest zadaniem pamięci łuków i bytów, która towarzyszy budowaniu. Benchmark to tabela wyników; fragmenty i pamięć łuków to to, co pozwala książce faktycznie z niej korzystać.

Questions

Frequently asked

Który model AI pisze najlepszą fikcję?
Pod względem ogólnego rzemiosła — średniej osi literackości, dialogu, wierności i tempa na rzeczywistej prozie powieściowej — Claude Opus 4.8 aktualnie prowadzi, z GPT-5.6 Sol tuż za nim. Ale „najlepszy" zależy od sceny: najwyższe wyniki w akcji, romansie i treściach erotycznych należą do różnych modeli. Siatka na tej stronie pokazuje aktualne zestawienie i rozmiar próbki za każdą liczbą.
Jak mierzony jest ten benchmark?
Każdy model pisze te same briefowane fragmenty w identycznych warunkach, a ślepa komisja sędziowska ocenia wynikową prozę w skali 0–100 w dziewięciu wymiarach — cztery dla rzemiosła (literackość, dialog, wierność, tempo) i pięć dla rodzaju treści (emocje, fizyczność, konflikt, romans, erotyzm). Wyniki są ściągane w stronę neutralnej bazy 70, by skąpe dane nie mogły przechylić wyniku, a liczba próbek jest podana obok każdego wyniku.
Jaka jest różnica między osiami rzemiosła a osiami treści?
Osie rzemiosła mierzą, jak dobrze model pisze, niezależnie od tematu — jakość zdań, głos postaci, wierność briefowi i kontrolę tempa. Osie treści mierzą przydatność do danego rodzaju sceny: emocje, akcja fizyczna, konflikt, romans i treści erotyczne. Model może pisać wspaniałe zdania i nadal słabo radzić sobie ze sceną walki, dlatego obie grupy są oceniane i pokazywane osobno.
Dlaczego nie wybrać po prostu jednego najlepszego modelu i używać go do wszystkiego?
Bo żaden model nie wygrywa we wszystkich wymiarach. Najsilniejsze rzemiosło literackie, najlepsza akcja oraz najbardziej zdolny romans lub treści erotyczne należą do różnych modeli. Novelmint kieruje książkę przez modele fragment po fragmencie — utrzymując większość w jednym głosie serii dla spójności i odchylając do mocniejszego modelu w konkretnych fragmentach, które na to zasługują — co jest możliwe tylko dlatego, że ta siatka istnieje.
Czy niski wynik oznacza, że model jest słaby?
Niekoniecznie. Niski wynik treści może oznaczać, że model jest zdolny, ale niechętny — większość modeli osiąga niskie wyniki erotyzmu, bo odmawia lub staje się kliniczny, a nie dlatego, że brak mu umiejętności. A niski wynik o małej pewności (mała próbka) jest ściągany w stronę neutralnej bazy, więc czyta się jako „jeszcze nieudowodniony", a nie „udowodniony słaby". Zawsze czytaj wynik razem z rozmiarem jego próbki.
Jak często benchmark jest aktualizowany?
Ciągle. Siatka to żywa projekcja zasobu ocen platformy: ten sam sędzia, który ocenia fragment podczas gdy Novelmint buduje rozdział, wplata swoje obserwacje z powrotem, więc liczby zmieniają się w miarę jak autorzy korzystają z silnika i rosną rozmiary próbek. Strona pokazuje datę ostatniej rekalibracji. Nowe wersje modeli są mierzone od nowa, a nie mieszane z modelem, który zastępują — zmiana wersji nigdy nie psuje po cichu kolumny.

What this page does not claim

  • Ten benchmark mierzy jakość prozy i przydatność treści wyłącznie do fikcji. Nie mówi nic o rozumowaniu, kodowaniu, matematyce, dokładności faktów ani bezpieczeństwie modelu poza kontekstem pisarskim.
  • Wyniki są względem ocenianego zestawu i użytych promptów, a nie oficjalną ani absolutną oceną zatwierdzoną przez dostawców modeli. Nazwy modeli i znaki towarowe należą do ich odpowiednich właścicieli.
  • Wyższy wynik ogólnego rzemiosła nie oznacza, że model jest właściwym wyborem do każdej książki — głos, gatunek, potrzeby treściowe i koszty — wszystko ma znaczenie, i właśnie dlatego Novelmint kieruje przez wiele modeli, zamiast koronować jeden.
  • Komórki z małą próbką są tymczasowe. Tam, gdzie liczba ma mało obserwacji, jest ściągana w stronę neutralnej bazy i oznaczona flagą — i zmieni się, gdy zostanie wplecione więcej pomiarów.

Przestań zgadywać, który model wybrać. Pozwól, by zdecydowała książka.

Novelmint kieruje każdy fragment do modelu, który według tej siatki najlepiej do niego pasuje. Twój pierwszy rozdział jest za darmo.