Quale modello AI scrive davvero la migliore narrativa?
Live data · measured as of July 24, 2026
Ogni scheda modello misura matematica, codice e ragionamento. Nessuna misura se un modello sa scrivere una scena che un lettore non salterebbe. Così abbiamo creato noi il benchmark. Una giuria cieca valuta la prosa romanzesca reale generata dai modelli di frontiera su nove assi — quattro per lo stile, cinque per i tipi di scena di cui è fatto un libro — e i numeri qui sotto sono il risultato in tempo reale. Non è un grafico di marketing: è la stessa griglia che Novelmint usa per scegliere un modello per ogni battuta del tuo libro.
Key takeaways
- Il benchmark valuta i modelli di frontiera di Anthropic, OpenAI, Google e xAI su prosa romanzesca reale generata — non test a risposta multipla — su nove assi: quattro di stile (letterario, dialogo, fedeltà, ritmo) e cinque di contenuto (emozione, fisicità, conflitto, romance, erotismo).
- Gli assi di stile misurano QUANTO BENE un modello scrive; gli assi di contenuto misurano CHE TIPO di scena sa scrivere bene. Un modello può avere frasi bellissime e scrivere comunque scene d'azione piatte, quindi i due aspetti sono tenuti separati e non vengono mai mediati in un unico numero fuorviante.
- Ogni punteggio viene ridimensionato con confidenza verso una base neutra di 70, in proporzione alla scarsità dei dati a supporto, così un risultato fortunato su tre campioni non può mai spacciarsi per un fatto assodato. La dimensione del campione dietro ogni numero è indicata.
- Nessun modello vince su tutto. Lo stile letterario complessivo più forte, la fedeltà più stabile, la migliore azione e il romance e la scrittura esplicita più disponibili si trovano in colonne diverse — ed è proprio questo l'argomento a favore di distribuire un libro tra più modelli invece di sceglierne uno solo.
- È la stessa griglia che Novelmint usa per selezionare un modello per ogni battuta durante la costruzione di un capitolo — e la stessa giuria che valuta un passaggio durante una build la alimenta, così i numeri continuano ad aggiornarsi man mano che gli autori scrivono con il motore. È un meccanismo vivo, non un'affermazione retrospettiva.
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
Questi sono dati in tempo reale, non un test una tantum
La tabella qui sotto non è un benchmark eseguito una volta e poi congelato. È una proiezione live dello store di valutazione su cui gira la piattaforma: la stessa giuria che valuta un passaggio durante una build alimenta questa griglia, così ogni capitolo scritto su Novelmint aggiunge osservazioni, le dimensioni dei campioni crescono e i numeri si affinano. Man mano che più autori usano il motore, il benchmark continua ad aggiornarsi — la data sopra è semplicemente la calibrazione più recente.
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
Come leggere la griglia
Il numero principale è lo stile complessivo — la media dei quattro assi esecutivi di un modello, che è la misura più vicina a «quanto è buona la sua prosa». Gli assi di contenuto a destra non sono classifiche di meglio-o-peggio; indicano per cosa il modello è ADATTO. Un punteggio alto in fisicità significa azione pulita; un punteggio basso in erotismo di solito indica rifiuto o piattezza clinica, non scrittura debole — disponibilità, non abilità. Leggi lo stile lungo la colonna per confrontare i modelli, e il contenuto lungo la riga per vedere dove un singolo modello è forte e dove no.
Best AI for…
A straight answer for one kind of scene — or one genre
By what your scene needs
- Migliore IA per la scrittura letteraria
- Migliore IA per scrivere dialoghi
- La migliore IA per seguire le istruzioni
- La migliore IA per il ritmo narrativo
- Migliore AI per le scene emotive
- Migliore AI per le scene d'azione
- Migliore AI per le scene di conflitto
- Miglior AI per scrivere romanzi d'amore
- Miglior AI per scene esplicite
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
Genera prosa reale, non risposte di test
Ogni modello scrive le stesse battute — scene con istruzioni dettagliate, elementi obbligatori, conoscenze vietate, un punto di vista e un obiettivo drammatico — in condizioni identiche. Valutiamo ciò che produce come narrativa, nel modo in cui legge un editor, non come risponde a un quiz.
Valutazione cieca su nove assi
Una giuria valuta ogni passaggio da 0 a 100 su quattro assi di stile (letterario, dialogo, fedeltà, ritmo) e cinque assi di contenuto (emozione, fisicità, conflitto, romance, erotismo), senza sapere quale modello lo ha scritto. Lo stile riguarda la qualità esecutiva; il contenuto riguarda l'idoneità a un tipo di scena.
Ridimensionamento verso una base neutra
Una media grezza da pochi campioni è rumore. Ogni cella viene attratta verso una base neutra di 70 in proporzione alla scarsità delle prove, così una misurazione iniziale e fortunata risulta circa nella media finché un numero sufficiente di osservazioni non le dà un posto stabile. Il numero pubblicato è questo valore ridimensionato; la dimensione del campione è indicata accanto.
Aggiornamento continuo, mai modifica manuale
Le nuove osservazioni della giuria confluiscono in una media progressiva e il conteggio dei campioni cresce, così la griglia si affina nel tempo. I numeri vengono ricalcolati dalle osservazioni, mai inseriti manualmente, e quando la versione di un modello cambia sotto un alias, le sue celle vengono azzerate per una nuova misurazione anziché mescolare due modelli diversi.
Where this leads
Perché un benchmark come questo può essere effettivamente usato
Scegliere un modello diverso per una scena funziona solo se il libro è costruito in unità discrete e dettagliate, anziché generato in un'unica passata. Quell'unità è la battuta, e mantenere la storia coerente mentre modelli diversi scrivono battute diverse è il compito di una memoria ad arco ed entità che accompagna la build. Il benchmark è il tabellone dei punteggi; le battute e la memoria ad arco sono ciò che permette a un libro di usarlo davvero.
Questions
Frequently asked
- Quale modello AI scrive la migliore narrativa?
- Per stile complessivo — la media degli assi letterario, dialogo, fedeltà e ritmo su prosa romanzesca reale — Claude Opus 4.8 è attualmente in testa, con GPT-5.6 Sol subito dietro. Ma «migliore» dipende dalla scena: i punteggi più alti per azione, romance e contenuto esplicito appartengono a modelli diversi. La griglia in questa pagina mostra le classifiche attuali e la dimensione del campione dietro ogni numero.
- Come viene misurato questo benchmark?
- Ogni modello scrive le stesse battute dettagliate in condizioni identiche, e una giuria cieca valuta la prosa risultante da 0 a 100 su nove assi — quattro per lo stile (letterario, dialogo, fedeltà, ritmo) e cinque per il tipo di contenuto (emozione, fisicità, conflitto, romance, erotismo). I punteggi vengono ridimensionati con confidenza verso una base neutra di 70 così che i dati scarsi non possano far oscillare un numero, e il conteggio dei campioni è indicato accanto a ogni punteggio.
- Qual è la differenza tra gli assi di stile e quelli di contenuto?
- Gli assi di stile misurano quanto bene un modello scrive, indipendentemente dal soggetto — qualità delle frasi, voce dei personaggi, fedeltà alle istruzioni e controllo del ritmo. Gli assi di contenuto misurano l'idoneità a un tipo di scena: emozione, azione fisica, conflitto, romance e contenuto esplicito. Un modello può scrivere frasi splendide e gestire comunque male una scena di combattimento, quindi le due famiglie vengono valutate e mostrate separatamente.
- Perché non scegliere semplicemente il modello migliore e usarlo per tutto?
- Perché nessun modello vince su ogni asse. Lo stile letterario più forte, la migliore azione e il romance o la scrittura esplicita più capace appartengono a modelli diversi. Novelmint distribuisce un libro tra i modelli battuta per battuta — mantenendo la maggior parte in una voce seriale coerente e passando a un modello più forte sulle battute specifiche che lo meritano — il che è possibile solo grazie a questa griglia.
- Un punteggio basso significa che un modello è scarso?
- Non necessariamente. Un punteggio di contenuto basso può significare che il modello è capace ma non disponibile — la maggior parte dei modelli ottiene punteggi bassi in erotismo perché rifiuta o diventa clinica, non perché manchi di abilità. E un punteggio a bassa confidenza (pochi campioni) viene ridimensionato verso la base neutra, quindi si legge come «non ancora dimostrato», non «dimostratamente debole». Leggi sempre il punteggio insieme alla dimensione del campione.
- Con quale frequenza viene aggiornato il benchmark?
- Continuamente. La griglia è una proiezione live dello store di valutazione della piattaforma: la stessa giuria che valuta un passaggio mentre Novelmint costruisce un capitolo riversa le proprie osservazioni, così i numeri si aggiornano man mano che gli autori usano il motore e le dimensioni dei campioni crescono. La pagina mostra la data della calibrazione più recente. Le nuove versioni dei modelli vengono misurate da zero anziché essere mescolate con il modello che hanno sostituito, così un cambio di versione non corrompe mai silenziosamente una colonna.
What this page does not claim
- Questo benchmark misura la qualità della prosa e l'idoneità al contenuto solo per la narrativa. Non dice nulla sul ragionamento, la codifica, la matematica, l'accuratezza fattuale o la sicurezza di un modello al di fuori del contesto della scrittura.
- I punteggi sono relativi al set valutato e ai prompt usati, non una valutazione assoluta o ufficiale approvata dai fornitori dei modelli. I nomi e i marchi dei modelli appartengono ai rispettivi proprietari.
- Un punteggio di stile complessivo più alto non significa che un modello sia la scelta giusta per ogni libro — voce, genere, esigenze di contenuto e costo contano tutti, ed è esattamente per questo che Novelmint distribuisce tra i modelli anziché incoronarne uno.
- Le celle con pochi campioni sono provvisorie. Dove un numero ha poche osservazioni viene ridimensionato verso la base neutra e segnalato, e si modificherà man mano che vengono aggiunte altre misurazioni.
Correlati
Migliore AI per le scene d'azione
Quale AI mantiene un combattimento o un inseguimento chiaro e concreto invece di vago. Classificata sulla fisicità.
Migliore AI per le scene di conflitto
Quale AI mantiene una discussione o uno stallo teso e crescente. Classificata sul conflitto misurato.
Migliore AI per le scene emotive
Quale AI fa funzionare una scena emotiva invece di limitarsi a descriverla. Classificata sull'emozione.
Miglior AI per scene esplicite
Quale AI scriverà davvero contenuti adulti espliciti — e quali rifiutano. Classificati per disponibilità.
Smetti di indovinare quale modello usare. Lascia che sia il libro a scegliere.
Novelmint assegna ogni battuta al modello che questa griglia indica come più adatto. Il tuo primo capitolo è gratuito.