Metodologia

Come funziona il benchmark per i modelli narrativi

Updated July 23, 2026 · 6 min di lettura

Il benchmark misura l'unica cosa che le schede dei modelli non misurano mai: se un modello sa scrivere una scena che un lettore non salterebbe. Questa pagina spiega esattamente come vengono prodotti i numeri — cosa viene misurato, come vengono valutati i modelli, perché i punteggi vengono ridotti per confidenza e come la griglia rimane aggiornata — così puoi valutare i risultati autonomamente e citarli con precisione.

Key takeaways

  • I modelli frontier scrivono gli stessi beat narrativi briefati, e un panel cieco e diversificato di giudici valuta la prosa da 0 a 100 su nove assi — senza sapere quale modello l'ha scritta.
  • Nove assi in due famiglie: quattro di stile (letterario, dialogo, fedeltà, ritmo) misurano quanto bene un modello scrive; cinque di contenuto (emozione, fisicità, conflitto, romanticismo, erotismo) misurano che tipo di scena sa scrivere bene. Non vengono mai mediati insieme.
  • Ogni punteggio viene ridotto verso una baseline neutra di 70 in proporzione a quanti pochi dati lo supportano (un prior equivalente a cinque osservazioni), così un campione piccolo fortunato non può raggiungere il vertice. Le dimensioni del campione sono mostrate; le celle con pochi dati sono segnalate.
  • La griglia è live — nuove osservazioni dei giudici si integrano in una media progressiva nel tempo, e un cambio di versione azzera e rimisura un modello invece di unirlo al predecessore.
  • I punteggi descrivono la prosa solo su beat narrativi; sono una misurazione indipendente, non una valutazione ufficiale del provider, e un punteggio basso sull'erotismo di solito riflette la disponibilità, non la qualità della scrittura.

Il benchmark di narrativa Novelmint misura l'unica cosa che le schede dei modelli non misurano mai: se un modello è in grado di scrivere una scena che un lettore non salterebbe. Non è una classifica mutuata da test di matematica o di programmazione — valuta vera prosa romanzesca. Ecco esattamente come vengono prodotti i numeri, così puoi soppesarli autonomamente e citarli con fiducia.

Cosa misura

Il benchmark valuta quanto bene i modelli di frontiera — di Anthropic, OpenAI, Google e xAI — scrivano narrativa. Non come ragionano, non come programmano, non come si comportano nei test a risposta multipla. A ogni modello vengono assegnati gli stessi beat romanzeschi briefati — scene con elementi obbligatori, conoscenze vietate, un punto di vista e un obiettivo drammatico — e ciò che scrive viene giudicato come narrativa, nel modo in cui legge un editor.

Tutto è espresso su una scala unica da 0 a 100 per asse, così i numeri sono direttamente comparabili tra modelli e tra i tipi di scena di cui è effettivamente composto un libro.

I nove assi

La narrativa non è un'unica abilità, quindi il benchmark non la riduce a un solo numero. Valuta nove assi, suddivisi in due famiglie con significati diversi.

I quattro assi di craft misurano quanto bene un modello scriva, indipendentemente dall'argomento: literary (immagine a livello di frase, ritmo, sottotesto, misura), dialogue (se i personaggi suonano come persone distinte), fidelity (quanto fedelmente riproduce esattamente il beat briefato, mantenendo gli elementi obbligatori e escludendo le conoscenze vietate) e pacing (controllo del momentum — quando comprimere, quando soffermarsi).

I cinque assi di content misurano che tipo di scena un modello sa scrivere bene: emotion, physicality (azione e corpo nello spazio), conflict, romance ed eroticism (contenuto esplicito per adulti). Non sono classifiche di merito — indicano per cosa un modello è adatto. Un modello può avere frasi splendide e tuttavia scrivere scene d'azione piatte, ed è per questo che craft e content vengono valutati e riportati separatamente e non vengono mai mediati in un'unica cifra fuorviante.

Come viene valutato ogni modello

La valutazione è una revisione tra pari in cieco. Ogni modello scrive lo stesso insieme di beat briefati, e un panel di modelli giudici autorevoli e diversificati per fornitore assegna a ogni passaggio un punteggio da 0 a 100 su ciascun asse — senza sapere quale modello lo abbia scritto, e senza mai giudicare il proprio lavoro. Un panel diversificato per fornitore è importante: un giudice esterno alla famiglia di un modello coglie i segnali stilistici che quella famiglia tende a premiare.

Poiché la valutazione è in cieco e cross-model, un modello non può compiacere se stesso, e nessun singolo stile di casa impone lo standard.

Controllo del bias dei giudici

Usare modelli per giudicare modelli introduce quattro modalità di fallimento ben note, e il metodo è costruito per chiudere ciascuna di esse.

Auto-preferenza — un modello tende a premiare il proprio stile di casa. Due regole la eliminano: un modello non valuta mai il proprio passaggio, e il panel dei giudici è diversificato per fornitore, così il gusto di nessuna singola famiglia stabilisce lo standard. Un segnale che una famiglia premia viene colto da un giudice di un'altra, e viceversa.

Prolissità — i giudici tendono sistematicamente a premiare eccessivamente la lunghezza. Ogni beat prevede lo stesso obiettivo, circa 220 parole, così tutti i passaggi arrivano a dimensioni quasi identiche e il riempimento non porta alcun vantaggio. Un modello guadagna il suo punteggio su ciò che fa con quelle parole, non su quante ne usa.

Posizione — l'ordine in cui appaiono i passaggi può orientare i punteggi verso quello che è venuto per primo. Perciò i passaggi vengono rinominati e mescolati per ogni beat, e ciascuno viene valutato singolarmente rispetto a una rubrica fissa anziché classificato testa a testa. L'ordine non porta alcun segnale, e qualsiasi deriva residua si media su molti beat e molti giudici.

Campionamento — una singola bozza fortunata può adulare un modello. La generazione avviene alla temperatura predefinita di ciascun modello su un prompt identico, senza alcuna messa a punto per modello, così nessun modello riceve un'impostazione selezionata ad hoc che gli altri non ottengono. E nessuna cella si basa su una singola bozza: ogni modello viene valutato sull'intero set di beat da ogni altro modello del panel, poi ridotto verso la baseline neutra fino a quando non si accumulano misurazioni sufficienti — così la fortuna di una singola bozza svanisce ben prima che un numero venga pubblicato.

Perché i punteggi vengono ridotti in base alla confidenza

Una media grezza di una manciata di passaggi è rumore, e il rumore mascherato da punteggio è peggio di nessun punteggio. Quindi ogni numero pubblicato è ridotto verso una baseline neutra di 70 in proporzione a quanti pochi dati lo sostengono — formalmente, un prior equivalente a cinque osservazioni. Una cella supportata da tre campioni fortunati viene letta come all'incirca nella media finché misurazioni sufficienti non le guadagnano un posto; una cella supportata da centinaia viene letta come il suo vero valore misurato.

La dimensione del campione dietro ogni numero è mostrata, e qualsiasi cella che si basa ancora su meno di sei osservazioni è contrassegnata come provvisoria. Questo è il motivo per cui un modello con dati scarsi non schizza mai in cima per un colpo di fortuna — il metodo non glielo consente.

Come la griglia rimane aggiornata

Il benchmark non è un test eseguito una volta sola e poi congelato. È una proiezione in tempo reale dell'archivio di punteggi su cui gira la piattaforma: le nuove osservazioni dei giudici confluiscono in una media progressiva, e il conteggio dei campioni di ogni cella cresce nel tempo, così la griglia si affina invece di invecchiare. La pagina mostra sempre la data della calibrazione più recente.

Una salvaguardia è importante per l'accuratezza. Quando un alias duraturo (un puntatore "latest") si reindirizza silenziosamente a un nuovo modello sottostante, le celle di quel modello vengono azzerate e ri-misurate da zero anziché fuse con quelle del modello che ha sostituito — così un cambio di versione non corrompe mai silenziosamente una colonna. È anche per questo che il benchmark nomina la versione specifica che ha misurato anziché un'etichetta generica.

Limitazioni

I punteggi descrivono la prosa su beat narrativi soltanto, giudicata rispetto a questo insieme di modelli e prompt. Non sono valutazioni ufficiali approvate dai fornitori dei modelli, e non dicono nulla sul ragionamento, sull'accuratezza o sulla sicurezza di un modello al di fuori del contesto della scrittura. I nomi dei modelli e i marchi appartengono ai rispettivi proprietari; questa è una misurazione indipendente.

Due letture sono facili da fraintendere. Un punteggio basso su eroticism di solito riflette la disponibilità — un modello che declina o diventa clinico — non un fallimento di craft. E un punteggio a bassa confidenza significa "non ancora dimostrato", non "dimostrato debole". Leggi sempre un numero insieme alla sua dimensione campionaria, e ricorda che il modello migliore per il tuo libro dipende da quali assi il tuo libro privilegia — che è l'unica ragione per cui la griglia li mantiene separati.

Questions

Frequently asked

Come fa Novelmint a valutare i modelli AI per la narrativa?
Ogni modello frontier scrive gli stessi beat narrativi briefati, e un panel cieco e diversificato di modelli giudici forti valuta la prosa risultante da 0 a 100 su nove assi senza conoscere l'autore. I punteggi vengono ridotti verso una baseline neutra in base ai dati disponibili, e le osservazioni si integrano in una media progressiva nel tempo.
Quali sono i nove assi?
Quattro assi di stile — letterario, dialogo, fedeltà (rispetto del brief) e ritmo — misurano quanto bene un modello scrive. Cinque assi di contenuto — emozione, fisicità (azione), conflitto, romanticismo ed erotismo — misurano che tipo di scena sa scrivere bene. Stile e contenuto vengono riportati separatamente, mai mediati.
Perché i punteggi vengono corretti per confidenza?
Una media grezza da pochi brani è solo rumore. Ogni punteggio viene ridotto verso una baseline neutra di 70 in proporzione a quanti pochi dati lo supportano — un prior equivalente a cinque osservazioni — così un campione piccolo fortunato non può raggiungere il vertice. La dimensione del campione è mostrata, e le celle con meno di sei osservazioni sono contrassegnate come provvisorie.
È una classifica ufficiale di OpenAI, Anthropic, Google o xAI?
No. È una misurazione indipendente di Novelmint, sulla sola prosa narrativa, valutata su questo insieme di modelli e prompt. Non dice nulla su ragionamento, accuratezza o altre capacità, e i nomi dei modelli sono marchi registrati dei rispettivi proprietari.
Con quale frequenza si aggiorna il benchmark?
Continuamente — nuove osservazioni dei giudici si integrano in una media progressiva e i conteggi dei campioni crescono, così la griglia migliora nel tempo. Quando la versione di un modello cambia sotto un alias, le sue celle vengono azzerate e rimisurai invece di essere unite alla versione precedente. La pagina mostra la data dell'ultima ricalibrazione.

What this page does not claim

  • I punteggi sono relativi all'insieme di modelli valutati e ai prompt usati — non sono una valutazione assoluta o ufficiale.
  • Un punteggio basso sull'erotismo riflette la disponibilità (un modello che declina o diventa clinico), non una mancanza di stile; un punteggio a bassa confidenza significa «non ancora dimostrato», non «dimostrato debole».
  • Il benchmark misura solo la prosa narrativa e non dice nulla su ragionamento, codice, accuratezza fattuale o sicurezza al di fuori del contesto della scrittura.

Scopri quale modello scrive meglio il tipo di scena che cerchi.

Dati live su nove assi, aggiornati man mano che viene misurata altra prosa.