Metodologi

Cara kerja benchmark model fiksi

Updated July 23, 2026 · Baca 6 menit

Benchmark ini mengukur satu hal yang tidak pernah dilakukan kartu model: apakah sebuah model mampu menulis adegan yang tidak akan dilewati pembaca. Halaman ini menjelaskan secara tepat bagaimana angka-angka dihasilkan — apa yang diukur, bagaimana model dinilai, mengapa skor disusutkan oleh kepercayaan, dan bagaimana tabel tetap mutakhir — sehingga Anda dapat menilai hasilnya sendiri dan mengutipnya secara akurat.

Key takeaways

  • Model-model terdepan menulis beat novel yang sama berdasarkan brief, dan panel juri buta yang beragam penyedia menilai prosa 0–100 pada sembilan sumbu — tanpa mengetahui model mana yang menulisnya.
  • Sembilan sumbu dalam dua keluarga: empat keahlian (sastra, dialog, fidelitas, ritme) mengukur seberapa baik model menulis; lima konten (emosi, fisikalitas, konflik, romansa, erotisme) mengukur jenis adegan yang ditulis dengan baik. Keduanya tidak pernah dirata-ratakan bersama.
  • Setiap skor disusutkan ke arah baseline netral 70 sebanding dengan sedikitnya data yang mendukungnya (prior senilai lima observasi), sehingga sampel kecil yang beruntung tidak bisa mencapai posisi teratas. Ukuran sampel ditampilkan; sel yang tipis ditandai.
  • Tabel ini live — observasi juri baru masuk ke rata-rata berjalan dari waktu ke waktu, dan perubahan versi mengatur ulang dan mengukur ulang model, bukan mencampurnya dengan pendahulunya.
  • Skor mendeskripsikan prosa pada beat fiksi saja; ini adalah pengukuran independen, bukan peringkat resmi penyedia, dan skor erotisme yang rendah biasanya mencerminkan kesediaan, bukan keahlian.

Tolok ukur fiksi Novelmint mengukur satu hal yang tidak pernah dilakukan kartu model mana pun: apakah sebuah model dapat menulis adegan yang tidak akan dilewati oleh pembaca. Ini bukan papan peringkat yang dipinjam dari tes matematika atau pemrograman — ia menilai prosa novel yang sesungguhnya. Berikut adalah cara persis angka-angka itu dihasilkan, sehingga Anda dapat menimbangnya sendiri dan mengutipnya dengan penuh keyakinan.

Apa yang diukur

Tolok ukur ini menilai seberapa baik model-model terdepan — dari Anthropic, OpenAI, Google, dan xAI — menulis fiksi. Bukan cara mereka bernalar, bukan cara mereka membuat kode, bukan cara mereka tampil dalam tes pilihan ganda. Setiap model diberi rangkaian beat novel yang sama — adegan dengan elemen yang diwajibkan, pengetahuan yang dilarang, sudut pandang, dan target dramatis — dan apa yang ditulisnya dinilai sebagai fiksi, sebagaimana seorang editor membacanya.

Semuanya dinyatakan dalam skala tunggal 0–100 per sumbu, sehingga angka-angka tersebut dapat dibandingkan secara langsung antar model dan antar jenis adegan yang sesungguhnya membentuk sebuah buku.

Sembilan sumbu

Fiksi bukan satu keterampilan tunggal, sehingga tolok ukur ini tidak meringkasnya menjadi satu angka. Ia menilai sembilan sumbu, dibagi menjadi dua kelompok yang memiliki arti berbeda.

Empat sumbu keahlian mengukur seberapa baik sebuah model menulis, terlepas dari subjeknya: literary (citra di tingkat kalimat, ritme, subteks, pengendalian diri), dialogue (apakah karakter terdengar seperti orang-orang yang berbeda), fidelity (seberapa setia model merender persis beat yang diperintahkan, menjaga elemen yang diwajibkan tetap ada dan pengetahuan yang dilarang tetap keluar), dan pacing (kendali atas momentum — kapan harus memampatkan, kapan harus memperlambat).

Lima sumbu konten mengukur jenis adegan apa yang ditulis model dengan baik: emotion, physicality (aksi dan tubuh dalam ruang), conflict, romance, dan eroticism (konten dewasa eksplisit). Ini bukan peringkat lebih baik atau lebih buruk — mereka menunjukkan untuk apa sebuah model cocok digunakan. Sebuah model bisa memiliki kalimat yang indah namun tetap menulis adegan pertarungan yang datar, itulah mengapa keahlian dan konten dinilai serta dilaporkan secara terpisah dan tidak pernah dirata-ratakan menjadi satu angka yang menyesatkan.

Cara setiap model dinilai

Penilaian dilakukan secara blind peer review. Setiap model menulis rangkaian beat yang sama, dan sebuah panel model juri yang kuat dan beragam penyedianya menilai setiap bagian 0–100 pada setiap sumbu — tanpa mengetahui model mana yang menulisnya, dan tidak pernah menilai karyanya sendiri. Panel yang beragam penyedianya sangat penting: juri dari luar keluarga model tersendiri akan menangkap ciri khas yang cenderung dihargai oleh keluarga itu.

Karena penilaian dilakukan secara buta dan lintas model, sebuah model tidak dapat memuji dirinya sendiri, dan tidak ada satu gaya rumah tunggal yang menetapkan standar.

Mengendalikan bias juri

Menggunakan model untuk menilai model mengundang empat modus kegagalan yang sudah dikenal, dan metode ini dibangun untuk menutup masing-masingnya.

Preferensi diri — sebuah model cenderung menghargai gaya rumahnya sendiri. Dua aturan menghapusnya: sebuah model tidak pernah menilai bagiannya sendiri, dan panel juri beragam penyedianya, sehingga selera satu keluarga tidak menetapkan standar. Ciri khas yang dihargai satu rumah akan tertangkap oleh juri dari rumah lain, dan sebaliknya.

Verbositas — juri secara konsisten memberikan hadiah berlebih untuk panjang tulisan. Setiap beat memerintahkan target yang sama, sekitar 220 kata, sehingga semua bagian tiba dengan ukuran yang hampir sama dan pengisian tidak menghasilkan apa-apa. Sebuah model mendapatkan nilainya dari apa yang dilakukannya dengan kata-kata itu, bukan dari berapa banyak yang dihabiskannya.

Posisi — urutan munculnya bagian dapat mendorong nilai ke arah apa pun yang muncul pertama. Maka bagian-bagian diberi label ulang dan diacak untuk setiap beat, dan masing-masing dinilai sendiri terhadap rubrik tetap daripada dibandingkan satu sama lain. Urutan tidak membawa sinyal, dan setiap penyimpangan sisa rata-rata menjadi nol di banyak beat dan banyak juri.

Pengambilan sampel — satu draf yang beruntung dapat membuat model tampak lebih baik. Generasi berjalan pada suhu default setiap model dengan prompt yang identik, tanpa penyetelan per model, sehingga tidak ada model yang diberi pengaturan yang dipilih secara khusus yang tidak didapat model lain. Dan tidak ada sel yang bergantung pada satu draf: setiap model dinilai di seluruh rangkaian beat oleh setiap model lain di panel, kemudian diciutkan ke arah garis dasar netral hingga cukup pengukuran terkumpul — sehingga keberuntungan draf tunggal menghilang jauh sebelum angka diterbitkan.

Mengapa nilai diciutkan berdasarkan keyakinan

Rata-rata mentah dari segelintir bagian adalah kebisingan, dan kebisingan yang berpenampilan sebagai nilai lebih buruk daripada tidak ada nilai sama sekali. Maka setiap angka yang diterbitkan diciutkan ke arah garis dasar netral 70 sebanding dengan betapa sedikitnya data yang mendukungnya — secara formal, sebuah prior senilai lima pengamatan. Sebuah sel yang didukung tiga sampel beruntung terbaca sebagai kira-kira rata-rata hingga cukup pengukuran mendapatkan tempatnya; sebuah sel yang didukung ratusan terbaca sebagai nilai terukurnya yang sesungguhnya.

Ukuran sampel di balik setiap angka ditampilkan, dan setiap sel yang masih bergantung pada kurang dari enam pengamatan ditandai sebagai sementara. Inilah mengapa model dengan data tipis tidak pernah melesat ke puncak karena keberuntungan — metode ini tidak mengizinkannya.

Cara grid tetap terkini

Tolok ukur ini bukan uji satu kali yang dijalankan lalu dibekukan. Ini adalah proyeksi langsung dari penyimpanan penilaian yang dijalankan platform: pengamatan juri baru terlipat ke dalam rata-rata berjalan, dan jumlah sampel setiap sel tumbuh seiring waktu, sehingga grid semakin tajam daripada menua. Halaman selalu menampilkan tanggal rekalibrasi terbaru.

Satu pengamanan penting untuk akurasi. Ketika alias yang tahan lama (penunjuk "terbaru") secara diam-diam mengarah ulang ke model dasar baru, sel-sel model tersebut direset dan diukur ulang dari awal daripada dicampur dengan model yang digantikannya — sehingga perubahan versi tidak pernah diam-diam merusak sebuah kolom. Inilah juga mengapa tolok ukur menyebutkan versi spesifik yang diukurnya daripada label generik.

Keterbatasan

Nilai-nilai ini menggambarkan prosa pada beat fiksi saja, dinilai terhadap rangkaian model dan prompt ini. Ini bukan peringkat resmi yang didukung oleh penyedia model, dan tidak mengatakan apa pun tentang penalaran, akurasi, atau keamanan model di luar konteks penulisan. Nama dan merek dagang model adalah milik pemiliknya masing-masing; ini adalah pengukuran independen.

Dua pembacaan mudah disalahartikan. Nilai eroticism yang rendah biasanya mencerminkan kesediaan — sebuah model yang menolak atau menjadi klinis — bukan kegagalan keahlian. Dan nilai dengan keyakinan rendah berarti "belum terbukti", bukan "terbukti lemah". Selalu baca angka bersama ukuran sampelnya, dan ingat bahwa model terbaik untuk buku Anda bergantung pada sumbu mana yang diandalkan buku Anda — itulah alasan utama grid menjaga mereka tetap terpisah.

Questions

Frequently asked

Bagaimana Novelmint membenchmark model AI untuk fiksi?
Setiap model terdepan menulis beat novel yang sama berdasarkan brief, dan panel juri model kuat yang buta dan beragam penyedia menilai prosa yang dihasilkan 0–100 pada sembilan sumbu tanpa mengetahui siapa penulisnya. Skor disusutkan ke arah baseline netral berdasarkan seberapa banyak data yang mendukungnya, dan observasi masuk ke rata-rata berjalan dari waktu ke waktu.
Apa saja sembilan sumbu tersebut?
Empat sumbu keahlian — sastra, dialog, fidelitas (kesetiaan pada brief), dan ritme — mengukur seberapa baik model menulis. Lima sumbu konten — emosi, fisikalitas (aksi), konflik, romansa, dan erotisme — mengukur jenis adegan yang ditulis dengan baik. Keahlian dan konten dilaporkan secara terpisah, tidak pernah dirata-ratakan.
Mengapa skor disesuaikan untuk kepercayaan?
Rata-rata mentah dari beberapa bagian adalah kebisingan belaka. Setiap skor disusutkan ke arah baseline netral 70 sebanding dengan sedikitnya data yang mendukungnya — prior senilai lima observasi — sehingga sampel kecil yang beruntung tidak bisa mencapai posisi teratas. Ukuran sampel ditampilkan, dan sel dengan kurang dari enam observasi ditandai sebagai sementara.
Apakah ini peringkat resmi dari OpenAI, Anthropic, Google, atau xAI?
Tidak. Ini adalah pengukuran independen oleh Novelmint, hanya pada prosa fiksi, dinilai berdasarkan kumpulan model dan prompt ini. Ini tidak menyatakan apa pun tentang penalaran, akurasi, atau kemampuan lainnya, dan nama model adalah merek dagang dari pemiliknya masing-masing.
Seberapa sering benchmark diperbarui?
Terus-menerus — observasi juri baru masuk ke rata-rata berjalan dan jumlah sampel bertambah, sehingga tabel semakin tajam dari waktu ke waktu. Ketika versi model berubah di bawah alias, sel-selnya direset dan diukur ulang, bukan dicampur dengan versi sebelumnya. Halaman menampilkan tanggal rekalibrasi terbaru.

What this page does not claim

  • Skor bersifat relatif terhadap kumpulan model yang dinilai dan prompt yang digunakan — bukan peringkat absolut atau resmi.
  • Skor erotisme yang rendah mencerminkan kesediaan (model yang menolak atau bersikap klinis), bukan kurangnya keahlian; skor dengan kepercayaan rendah berarti "belum terbukti", bukan "terbukti lemah".
  • Benchmark mengukur prosa fiksi saja dan tidak menyatakan apa pun tentang penalaran, pengkodean, akurasi faktual, atau keamanan di luar konteks penulisan.

Lihat model mana yang paling cocok menulis jenis adegan Anda.

Data live di sembilan sumbu, diperbarui seiring lebih banyak prosa yang diukur.