Il benchmark per i modelli di narrativa

Quale modello AI scrive davvero la migliore narrativa?

Live data · measured as of July 24, 2026

Ogni scheda modello misura matematica, codice e ragionamento. Nessuna misura se un modello sa scrivere una scena che un lettore non salterebbe. Così abbiamo creato noi il benchmark. Una giuria cieca valuta la prosa romanzesca reale generata dai modelli di frontiera su nove assi — quattro per lo stile, cinque per i tipi di scena di cui è fatto un libro — e i numeri qui sotto sono il risultato in tempo reale. Non è un grafico di marketing: è la stessa griglia che Novelmint usa per scegliere un modello per ogni battuta del tuo libro.

Key takeaways

  • Il benchmark valuta i modelli di frontiera di Anthropic, OpenAI, Google e xAI su prosa romanzesca reale generata — non test a risposta multipla — su nove assi: quattro di stile (letterario, dialogo, fedeltà, ritmo) e cinque di contenuto (emozione, fisicità, conflitto, romance, erotismo).
  • Gli assi di stile misurano QUANTO BENE un modello scrive; gli assi di contenuto misurano CHE TIPO di scena sa scrivere bene. Un modello può avere frasi bellissime e scrivere comunque scene d'azione piatte, quindi i due aspetti sono tenuti separati e non vengono mai mediati in un unico numero fuorviante.
  • Ogni punteggio viene ridimensionato con confidenza verso una base neutra di 70, in proporzione alla scarsità dei dati a supporto, così un risultato fortunato su tre campioni non può mai spacciarsi per un fatto assodato. La dimensione del campione dietro ogni numero è indicata.
  • Nessun modello vince su tutto. Lo stile letterario complessivo più forte, la fedeltà più stabile, la migliore azione e il romance e la scrittura esplicita più disponibili si trovano in colonne diverse — ed è proprio questo l'argomento a favore di distribuire un libro tra più modelli invece di sceglierne uno solo.
  • È la stessa griglia che Novelmint usa per selezionare un modello per ogni battuta durante la costruzione di un capitolo — e la stessa giuria che valuta un passaggio durante una build la alimenta, così i numeri continuano ad aggiornarsi man mano che gli autori scrivono con il motore. È un meccanismo vivo, non un'affermazione retrospettiva.

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

Questi sono dati in tempo reale, non un test una tantum

La tabella qui sotto non è un benchmark eseguito una volta e poi congelato. È una proiezione live dello store di valutazione su cui gira la piattaforma: la stessa giuria che valuta un passaggio durante una build alimenta questa griglia, così ogni capitolo scritto su Novelmint aggiunge osservazioni, le dimensioni dei campioni crescono e i numeri si affinano. Man mano che più autori usano il motore, il benchmark continua ad aggiornarsi — la data sopra è semplicemente la calibrazione più recente.

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

Come leggere la griglia

Il numero principale è lo stile complessivo — la media dei quattro assi esecutivi di un modello, che è la misura più vicina a «quanto è buona la sua prosa». Gli assi di contenuto a destra non sono classifiche di meglio-o-peggio; indicano per cosa il modello è ADATTO. Un punteggio alto in fisicità significa azione pulita; un punteggio basso in erotismo di solito indica rifiuto o piattezza clinica, non scrittura debole — disponibilità, non abilità. Leggi lo stile lungo la colonna per confrontare i modelli, e il contenuto lungo la riga per vedere dove un singolo modello è forte e dove no.

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

Genera prosa reale, non risposte di test

Ogni modello scrive le stesse battute — scene con istruzioni dettagliate, elementi obbligatori, conoscenze vietate, un punto di vista e un obiettivo drammatico — in condizioni identiche. Valutiamo ciò che produce come narrativa, nel modo in cui legge un editor, non come risponde a un quiz.

02

Valutazione cieca su nove assi

Una giuria valuta ogni passaggio da 0 a 100 su quattro assi di stile (letterario, dialogo, fedeltà, ritmo) e cinque assi di contenuto (emozione, fisicità, conflitto, romance, erotismo), senza sapere quale modello lo ha scritto. Lo stile riguarda la qualità esecutiva; il contenuto riguarda l'idoneità a un tipo di scena.

03

Ridimensionamento verso una base neutra

Una media grezza da pochi campioni è rumore. Ogni cella viene attratta verso una base neutra di 70 in proporzione alla scarsità delle prove, così una misurazione iniziale e fortunata risulta circa nella media finché un numero sufficiente di osservazioni non le dà un posto stabile. Il numero pubblicato è questo valore ridimensionato; la dimensione del campione è indicata accanto.

04

Aggiornamento continuo, mai modifica manuale

Le nuove osservazioni della giuria confluiscono in una media progressiva e il conteggio dei campioni cresce, così la griglia si affina nel tempo. I numeri vengono ricalcolati dalle osservazioni, mai inseriti manualmente, e quando la versione di un modello cambia sotto un alias, le sue celle vengono azzerate per una nuova misurazione anziché mescolare due modelli diversi.

Where this leads

Perché un benchmark come questo può essere effettivamente usato

Scegliere un modello diverso per una scena funziona solo se il libro è costruito in unità discrete e dettagliate, anziché generato in un'unica passata. Quell'unità è la battuta, e mantenere la storia coerente mentre modelli diversi scrivono battute diverse è il compito di una memoria ad arco ed entità che accompagna la build. Il benchmark è il tabellone dei punteggi; le battute e la memoria ad arco sono ciò che permette a un libro di usarlo davvero.

Questions

Frequently asked

Quale modello AI scrive la migliore narrativa?
Per stile complessivo — la media degli assi letterario, dialogo, fedeltà e ritmo su prosa romanzesca reale — Claude Opus 4.8 è attualmente in testa, con GPT-5.6 Sol subito dietro. Ma «migliore» dipende dalla scena: i punteggi più alti per azione, romance e contenuto esplicito appartengono a modelli diversi. La griglia in questa pagina mostra le classifiche attuali e la dimensione del campione dietro ogni numero.
Come viene misurato questo benchmark?
Ogni modello scrive le stesse battute dettagliate in condizioni identiche, e una giuria cieca valuta la prosa risultante da 0 a 100 su nove assi — quattro per lo stile (letterario, dialogo, fedeltà, ritmo) e cinque per il tipo di contenuto (emozione, fisicità, conflitto, romance, erotismo). I punteggi vengono ridimensionati con confidenza verso una base neutra di 70 così che i dati scarsi non possano far oscillare un numero, e il conteggio dei campioni è indicato accanto a ogni punteggio.
Qual è la differenza tra gli assi di stile e quelli di contenuto?
Gli assi di stile misurano quanto bene un modello scrive, indipendentemente dal soggetto — qualità delle frasi, voce dei personaggi, fedeltà alle istruzioni e controllo del ritmo. Gli assi di contenuto misurano l'idoneità a un tipo di scena: emozione, azione fisica, conflitto, romance e contenuto esplicito. Un modello può scrivere frasi splendide e gestire comunque male una scena di combattimento, quindi le due famiglie vengono valutate e mostrate separatamente.
Perché non scegliere semplicemente il modello migliore e usarlo per tutto?
Perché nessun modello vince su ogni asse. Lo stile letterario più forte, la migliore azione e il romance o la scrittura esplicita più capace appartengono a modelli diversi. Novelmint distribuisce un libro tra i modelli battuta per battuta — mantenendo la maggior parte in una voce seriale coerente e passando a un modello più forte sulle battute specifiche che lo meritano — il che è possibile solo grazie a questa griglia.
Un punteggio basso significa che un modello è scarso?
Non necessariamente. Un punteggio di contenuto basso può significare che il modello è capace ma non disponibile — la maggior parte dei modelli ottiene punteggi bassi in erotismo perché rifiuta o diventa clinica, non perché manchi di abilità. E un punteggio a bassa confidenza (pochi campioni) viene ridimensionato verso la base neutra, quindi si legge come «non ancora dimostrato», non «dimostratamente debole». Leggi sempre il punteggio insieme alla dimensione del campione.
Con quale frequenza viene aggiornato il benchmark?
Continuamente. La griglia è una proiezione live dello store di valutazione della piattaforma: la stessa giuria che valuta un passaggio mentre Novelmint costruisce un capitolo riversa le proprie osservazioni, così i numeri si aggiornano man mano che gli autori usano il motore e le dimensioni dei campioni crescono. La pagina mostra la data della calibrazione più recente. Le nuove versioni dei modelli vengono misurate da zero anziché essere mescolate con il modello che hanno sostituito, così un cambio di versione non corrompe mai silenziosamente una colonna.

What this page does not claim

  • Questo benchmark misura la qualità della prosa e l'idoneità al contenuto solo per la narrativa. Non dice nulla sul ragionamento, la codifica, la matematica, l'accuratezza fattuale o la sicurezza di un modello al di fuori del contesto della scrittura.
  • I punteggi sono relativi al set valutato e ai prompt usati, non una valutazione assoluta o ufficiale approvata dai fornitori dei modelli. I nomi e i marchi dei modelli appartengono ai rispettivi proprietari.
  • Un punteggio di stile complessivo più alto non significa che un modello sia la scelta giusta per ogni libro — voce, genere, esigenze di contenuto e costo contano tutti, ed è esattamente per questo che Novelmint distribuisce tra i modelli anziché incoronarne uno.
  • Le celle con pochi campioni sono provvisorie. Dove un numero ha poche osservazioni viene ridimensionato verso la base neutra e segnalato, e si modificherà man mano che vengono aggiunte altre misurazioni.

Smetti di indovinare quale modello usare. Lascia che sia il libro a scegliere.

Novelmint assegna ogni battuta al modello che questa griglia indica come più adatto. Il tuo primo capitolo è gratuito.