El benchmark de ficción de Novelmint mide lo único que las fichas de modelo nunca miden: si un modelo puede escribir una escena que un lector no se saltaría. No es una tabla de clasificación tomada prestada de pruebas de matemáticas o programación — puntúa prosa novelística real. Aquí se explica exactamente cómo se producen los números, para que puedas valorarlos por ti mismo y citarlos con confianza.
Qué mide
El benchmark evalúa qué tan bien escriben ficción los modelos de frontera — de Anthropic, OpenAI, Google y xAI —. No cómo razonan, no cómo programan, no cómo se desempeñan en pruebas de opción múltiple. A cada modelo se le dan los mismos beats novelísticos indicados — escenas con elementos requeridos, conocimiento prohibido, un punto de vista y un objetivo dramático — y lo que escribe se juzga como ficción, de la forma en que lo lee un editor.
Todo se expresa en una escala única de 0 a 100 por eje, de modo que los números son directamente comparables entre modelos y entre los tipos de escena de los que realmente está hecho un libro.
Los nueve ejes
La ficción no es una sola habilidad, por lo que el benchmark no la colapsa en un único número. Puntúa nueve ejes, divididos en dos familias que significan cosas distintas.
Los cuatro ejes de oficio miden qué tan bien escribe un modelo, independientemente del tema: literario (imagen a nivel de oración, ritmo, subtexto, contención), diálogo (si los personajes suenan como personas distintas), fidelidad (qué tan fielmente reproduce exactamente el beat indicado, manteniendo los elementos requeridos e impidiendo el conocimiento prohibido) y ritmo narrativo (control del impulso — cuándo comprimir, cuándo detenerse).
Los cinco ejes de contenido miden qué tipo de escena escribe bien un modelo: emoción, fisicalidad (acción y el cuerpo en el espacio), conflicto, romance y erotismo (contenido adulto explícito). Estos no son rankings de mejor o peor — indican para qué es apto un modelo. Un modelo puede tener oraciones hermosas y aun así escribir escenas de pelea planas, razón por la cual el oficio y el contenido se puntúan y reportan por separado y nunca se promedian en una única cifra engañosa.
Cómo se puntúa cada modelo
La puntuación es revisión por pares a ciegas. Cada modelo escribe el mismo conjunto de beats indicados, y un panel de modelos jueces sólidos y diversos en cuanto a proveedor califica cada pasaje de 0 a 100 en cada eje — sin saber qué modelo lo escribió, y sin juzgar nunca su propio trabajo. Un panel diverso en cuanto a proveedor importa: un juez externo a la familia de un modelo capta los indicios que esa familia tiende a recompensar.
Dado que el juicio es ciego y cruzado entre modelos, un modelo no puede adularse a sí mismo, y ningún estilo de casa único establece el estándar.
Control del sesgo de los jueces
Usar modelos para juzgar modelos invita a cuatro modos de fallo bien conocidos, y el método está construido para cerrar cada uno de ellos.
Autopreferencia — un modelo tiende a recompensar su propio estilo de casa. Dos reglas lo eliminan: un modelo nunca puntúa su propio pasaje, y el panel de jueces es diverso en cuanto a proveedor, de modo que el gusto de ninguna familia única establece el estándar. Un indicio que una casa recompensa es captado por un juez de otra, y viceversa.
Verbosidad — los jueces tienden a recompensar en exceso la longitud. Cada beat indica el mismo objetivo, aproximadamente 220 palabras, de modo que todos los pasajes llegan a un tamaño casi igual y el relleno no sirve de nada. Un modelo gana su puntuación por lo que hace con esas palabras, no por cuántas gasta.
Posición — el orden en que aparecen los pasajes puede inclinar las puntuaciones hacia lo que apareció primero. Por eso los pasajes se reesquematizan y se mezclan para cada beat, y cada uno se puntúa de forma independiente frente a una rúbrica fija en lugar de clasificarse cara a cara. El orden no lleva ninguna señal, y cualquier deriva residual se promedia entre muchos beats y muchos jueces.
Muestreo — un único borrador afortunado puede adular a un modelo. La generación se ejecuta a la temperatura predeterminada de cada modelo con un prompt idéntico, sin ajuste por modelo, de modo que ningún modelo recibe una configuración seleccionada a dedo que los demás no obtienen. Y ninguna celda descansa en un solo borrador: cada modelo se puntúa a lo largo del conjunto completo de beats por todos los demás modelos del panel, y luego se acerca a la línea de base neutral hasta que se acumulen suficientes mediciones — de modo que la suerte de un solo borrador desaparece mucho antes de que se publique un número.
Por qué las puntuaciones se ajustan según la confianza
Un promedio bruto de un puñado de pasajes es ruido, y el ruido disfrazado de puntuación es peor que ninguna puntuación en absoluto. Por eso, cada número publicado se ajusta hacia una línea de base neutral de 70 en proporción a cuán pocos datos lo respaldan — formalmente, una distribución previa equivalente a cinco observaciones. Una celda respaldada por tres muestras afortunadas se lee como aproximadamente promedio hasta que suficientes mediciones la merezcan un lugar; una celda respaldada por cientos se lee como su valor medido real.
El tamaño de la muestra detrás de cada número se muestra, y cualquier celda que aún descanse en menos de seis observaciones se marca como provisional. Por eso un modelo con datos escasos nunca sube disparado a lo más alto por un golpe de suerte — el método no lo permite.
Cómo se mantiene actualizada la cuadrícula
El benchmark no es una prueba única que se ejecutó y se congeló. Es una proyección en vivo del almacén de puntuaciones en el que funciona la plataforma: las nuevas observaciones de los jueces se incorporan a una media continua, y el recuento de muestras de cada celda crece con el tiempo, de modo que la cuadrícula se afina en lugar de envejecer. La página siempre muestra la fecha de la recalibración más reciente.
Una salvaguarda es importante para la precisión. Cuando un alias duradero (un puntero "latest") redirige silenciosamente a un nuevo modelo subyacente, las celdas de ese modelo se restablecen y se vuelven a medir desde cero en lugar de mezclarse con el modelo al que reemplazaron — de modo que un cambio de versión nunca corrompe silenciosamente una columna. Esta es también la razón por la que el benchmark nombra la versión específica que midió en lugar de una etiqueta genérica.
Limitaciones
Las puntuaciones describen prosa únicamente en beats de ficción, juzgada frente a este conjunto de modelos y prompts. No son calificaciones oficiales respaldadas por los proveedores de modelos, y no dicen nada sobre el razonamiento, la precisión o la seguridad de un modelo fuera del contexto de escritura. Los nombres de modelos y marcas comerciales pertenecen a sus respectivos propietarios; esta es una medición independiente.
Dos lecturas son fáciles de malinterpretar. Una puntuación baja en erotismo generalmente refleja disposición — un modelo que declina o adopta un tono clínico — no un fallo de oficio. Y una puntuación de baja confianza significa "aún no probado", no "probado débil". Lee siempre un número junto con su tamaño de muestra, y recuerda que el mejor modelo para tu libro depende de en qué ejes se apoya tu libro — que es la razón por la que la cuadrícula los mantiene separados.