El benchmark de modelos de ficción

¿Qué modelo de IA escribe realmente mejor ficción?

Live data · measured as of July 24, 2026

Todas las fichas de modelos miden matemáticas, código y razonamiento. Ninguna mide si un modelo puede escribir una escena que el lector no se saltaría. Así que construimos el benchmark que sí lo hace. Un panel de jueces ciegos puntúa prosa novelística real generada por los modelos frontier en nueve ejes — cuatro de oficio y cinco de los tipos de escena que componen un libro — y los números de abajo son el resultado en vivo. Esto no es un gráfico de marketing: es la cuadrícula exacta que Novelmint usa para elegir un modelo en cada beat de tu libro.

Key takeaways

  • El benchmark puntúa modelos frontier de Anthropic, OpenAI, Google y xAI sobre prosa novelística real generada — no pruebas de opción múltiple — en nueve ejes: cuatro de oficio (literario, diálogo, fidelidad, ritmo) y cinco de contenido (emoción, fisicidad, conflicto, romance, erotismo).
  • Los ejes de oficio miden QUÉ TAN BIEN escribe un modelo; los ejes de contenido miden para QUÉ TIPO de escena escribe bien. Un modelo puede tener frases hermosas y aun así escribir escenas de acción planas, por eso ambos se mantienen separados y nunca se promedian en un único número engañoso.
  • Cada puntuación se contrae hacia una base neutral de 70 en proporción a los pocos datos que la respaldan, de modo que un resultado afortunado de tres muestras nunca puede hacerse pasar por un hecho consolidado. El tamaño de muestra detrás de cada número se muestra.
  • Ningún modelo lo gana todo. El mejor oficio literario general, la fidelidad más constante, la mejor acción, y el romance y la escritura explícita más dispuestos se encuentran en columnas distintas — lo cual es el argumento completo para distribuir un libro entre modelos en lugar de elegir uno solo.
  • Esta es la misma cuadrícula que Novelmint usa para seleccionar un modelo por beat al construir un capítulo — y el mismo juez que puntúa un pasaje durante una construcción la alimenta, por lo que los números se actualizan continuamente mientras los autores escriben con el motor. Es un mecanismo en vivo, no una afirmación retrospectiva.

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

Estos son datos en vivo, no una prueba puntual

La tabla de abajo no es un benchmark que ejecutamos una vez y congelamos. Es una proyección en vivo del almacén de puntuaciones sobre el que corre la plataforma: el mismo juez que valora un pasaje durante una construcción alimenta esta cuadrícula, así que cada capítulo escrito en Novelmint añade observaciones, los tamaños de muestra crecen y los números se afinan. A medida que más autores construyen con el motor, el benchmark sigue actualizándose — la fecha de arriba es simplemente la recalibración más reciente.

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

Cómo leer la cuadrícula

El número principal es el oficio general — el promedio de los cuatro ejes de ejecución del modelo, que es lo más parecido a «qué tan buena es su prosa». Los ejes de contenido a la derecha no son rankings de mejor o peor; indican para qué está PREPARADO el modelo. Una puntuación alta en fisicidad significa acción clara; una puntuación baja en erotismo suele significar rechazo o frialdad clínica más que escritura débil — disposición, no habilidad. Lee el oficio hacia abajo por la columna para comparar modelos, y lee el contenido a lo largo de la fila para ver dónde un modelo es fuerte y dónde no.

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

Generar prosa real, no respuestas de examen

Cada modelo escribe los mismos beats — escenas con instrucciones que incluyen elementos requeridos, conocimiento prohibido, un punto de vista y un objetivo dramático — en condiciones idénticas. Puntuamos lo que produce como ficción, como lo leería un editor, no cómo rinde en un cuestionario.

02

Puntuar a ciegas, en nueve ejes

Un panel de jueces valora cada pasaje de 0 a 100 en cuatro ejes de oficio (literario, diálogo, fidelidad, ritmo) y cinco ejes de contenido (emoción, fisicidad, conflicto, romance, erotismo), sin saber qué modelo lo escribió. El oficio es calidad de ejecución; el contenido es idoneidad para un tipo de escena.

03

Contraer hacia una referencia neutral

Un promedio bruto de un puñado de muestras es ruido. Cada celda se atrae hacia una base neutral de 70 en proporción a la escasez de su evidencia, de modo que una medición temprana y afortunada se lee como aproximadamente promedio hasta que suficientes observaciones le ganan un lugar. El número publicado es este valor contraído; el tamaño de muestra se muestra junto a él.

04

Seguir incorporando datos, nunca sobrescribir manualmente

Las nuevas observaciones del juez se integran en una media acumulativa y el recuento de muestras crece, por lo que la cuadrícula se afina con el tiempo. Los números se regeneran a partir de las observaciones, nunca se escriben manualmente, y cuando la versión de un modelo cambia bajo un alias sus celdas se reinician a una nueva medición limpia en lugar de mezclar dos modelos distintos.

Where this leads

Por qué un benchmark así puede usarse de verdad

Elegir un modelo distinto para una escena solo funciona si un libro se construye en unidades discretas con instrucciones, en lugar de generarse de una sola vez. Esa unidad es el beat, y mantener la coherencia de la historia mientras distintos modelos escriben beats diferentes es tarea de una memoria de arco y entidades que acompaña la construcción. El benchmark es el marcador; los beats y la memoria de arco son lo que permite a un libro aprovecharlo realmente.

Questions

Frequently asked

¿Qué modelo de IA escribe mejor ficción?
Por oficio general — el promedio de los ejes literario, diálogo, fidelidad y ritmo sobre prosa novelística real — Claude Opus 4.8 lidera actualmente, con GPT-5.6 Sol justo detrás. Pero «mejor» depende de la escena: las puntuaciones más altas para acción, romance y contenido explícito corresponden a modelos distintos. La cuadrícula en esta página muestra las posiciones actuales y el tamaño de muestra detrás de cada número.
¿Cómo se mide este benchmark?
Cada modelo escribe los mismos beats con instrucciones en condiciones idénticas, y un panel de jueces ciegos puntúa la prosa resultante de 0 a 100 en nueve ejes — cuatro de oficio (literario, diálogo, fidelidad, ritmo) y cinco de tipo de contenido (emoción, fisicidad, conflicto, romance, erotismo). Las puntuaciones se contraen hacia una base neutral de 70 para que los datos escasos no distorsionen un número, y el recuento de muestras se muestra junto a cada puntuación.
¿Cuál es la diferencia entre los ejes de oficio y los ejes de contenido?
Los ejes de oficio miden qué tan bien escribe un modelo, independientemente del tema — calidad de las frases, voz de los personajes, fidelidad al encargo y control del ritmo. Los ejes de contenido miden la idoneidad para un tipo de escena: emoción, acción física, conflicto, romance y contenido explícito. Un modelo puede escribir frases espléndidas y aun así manejar mal una escena de pelea, por eso ambas familias se puntúan y muestran por separado.
¿Por qué no elegir simplemente el mejor modelo y usarlo para todo?
Porque ningún modelo gana en todos los ejes. El mejor oficio literario, la mejor acción y la escritura de romance o contenido explícito más capaz pertenecen a modelos distintos. Novelmint distribuye un libro entre modelos beat a beat — manteniendo la mayor parte en una voz de serie por coherencia y desviándose a un modelo más fuerte en los beats específicos que lo merecen — lo cual solo es posible porque existe esta cuadrícula.
¿Una puntuación baja significa que un modelo es malo?
No necesariamente. Una puntuación baja de contenido puede significar que el modelo es capaz pero renuente — la mayoría puntúa bajo en erotismo porque se niegan o se vuelven clínicos, no por falta de habilidad. Y una puntuación de baja confianza (pocas muestras) se contrae hacia la base neutral, por lo que se lee como «aún no probado», no como «probadamente débil». Lee siempre la puntuación junto con su tamaño de muestra.
¿Con qué frecuencia se actualiza el benchmark?
Continuamente. La cuadrícula es una proyección en vivo del almacén de puntuaciones de la plataforma: el mismo juez que valora un pasaje mientras Novelmint construye un capítulo incorpora sus observaciones, así que los números se mueven a medida que los autores usan el motor y los tamaños de muestra crecen. La página muestra la fecha de la recalibración más reciente. Las nuevas versiones de modelos se miden desde cero en lugar de mezclarse con el modelo que reemplazaron, así que un cambio de versión nunca corrompe silenciosamente una columna.

What this page does not claim

  • Este benchmark mide únicamente la calidad de la prosa y la idoneidad de contenido para la ficción. No dice nada sobre el razonamiento, el código, las matemáticas, la precisión factual ni la seguridad de un modelo fuera del contexto de escritura.
  • Las puntuaciones son relativas al conjunto juzgado y a los prompts utilizados, no una valoración absoluta u oficial respaldada por los proveedores de los modelos. Los nombres y marcas de los modelos pertenecen a sus respectivos propietarios.
  • Una puntuación más alta de oficio general no significa que un modelo sea la elección correcta para todo libro — la voz, el género, las necesidades de contenido y el coste importan, lo cual es exactamente la razón por la que Novelmint distribuye entre modelos en lugar de coronar uno solo.
  • Las celdas con pocas muestras son provisionales. Donde un número lleva pocas observaciones se contrae hacia la base neutral y se señala, y cambiará a medida que se incorporen más mediciones.

Deja de adivinar qué modelo usar. Deja que el libro elija.

Novelmint dirige cada beat al modelo que esta cuadrícula considera más adecuado. Tu primer capítulo es gratis.