Benchmark model fiksi

Model AI mana yang benar-benar menulis fiksi terbaik?

Live data · measured as of July 24, 2026

Setiap kartu model mengukur matematika, coding, dan penalaran. Tidak ada yang mengukur apakah model bisa menulis adegan yang tidak akan dilewati pembaca. Jadi kami membangun benchmark yang melakukannya. Panel juri buta menilai prosa novel yang dihasilkan model-model terdepan dari sembilan dimensi — empat untuk keahlian, lima untuk jenis adegan yang membentuk sebuah buku — dan angka di bawah ini adalah hasilnya secara langsung. Ini bukan grafik pemasaran: ini adalah grid persis yang dibaca Novelmint untuk memilih model di setiap beat bukumu.

Key takeaways

  • Benchmark ini menilai model-model terdepan dari Anthropic, OpenAI, Google, dan xAI pada prosa novel yang benar-benar dihasilkan — bukan tes pilihan ganda — di sembilan dimensi: empat keahlian (sastra, dialog, kesetiaan, ritme) dan lima konten (emosi, fisikalitas, konflik, romansa, erotisme).
  • Dimensi keahlian mengukur SEBERAPA BAIK model menulis; dimensi konten mengukur JENIS adegan apa yang ditulis dengan baik. Model bisa menulis kalimat indah namun tetap menghasilkan adegan pertarungan yang datar, jadi keduanya dipisah dan tidak pernah dirata-rata menjadi satu angka yang menyesatkan.
  • Setiap skor dikecilkan dengan kepercayaan menuju baseline netral 70 sebanding dengan seberapa sedikit data di baliknya, sehingga hasil beruntung dari tiga sampel tidak bisa berpura-pura sebagai fakta yang mapan. Ukuran sampel di balik setiap angka ditampilkan.
  • Tidak ada satu model pun yang menang di semua dimensi. Keahlian sastra keseluruhan terkuat, kesetiaan paling stabil, aksi terbaik, serta penulisan romansa dan konten dewasa yang paling bersedia ada di kolom berbeda — inilah alasan utama untuk merutekan buku ke berbagai model daripada memilih satu.
  • Ini adalah grid yang sama yang digunakan Novelmint untuk memilih model per beat saat membangun bab — dan juri yang menilai suatu bagian saat proses build mengisinya, sehingga angka terus diperbarui saat penulis menulis dengan mesin ini. Ini adalah mekanisme langsung, bukan klaim retrospektif.

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

Ini adalah data langsung, bukan tes sekali jalan

Tabel di bawah ini bukan benchmark yang kami jalankan sekali lalu dibekukan. Ini adalah proyeksi langsung dari penyimpanan penilaian yang dijalankan platform: juri yang menilai bagian saat proses build mengisi grid ini, sehingga setiap bab yang ditulis di Novelmint menambah observasi, ukuran sampel bertambah, dan angka semakin tajam. Semakin banyak penulis yang membangun dengan mesin ini, benchmark terus diperbarui — tanggal di atas hanyalah kalibrasi ulang terbaru.

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

Cara membaca grid

Angka utama adalah keahlian keseluruhan — rata-rata dari empat dimensi eksekusi model, yang paling mendekati \"seberapa bagus prosanya\". Dimensi konten di sebelah kanan bukan peringkat lebih baik-lebih buruk; mereka menunjukkan untuk apa model itu COCOK. Skor fisikalitas tinggi berarti aksi yang bersih; skor erotisme rendah biasanya berarti penolakan atau kerataan klinis daripada tulisan lemah — kesediaan, bukan keterampilan. Baca keahlian ke bawah kolom untuk membandingkan model, dan baca konten ke samping baris untuk melihat di mana satu model kuat dan di mana tidak.

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

Hasilkan prosa nyata, bukan jawaban tes

Setiap model menulis beat yang sama — adegan terstruktur dengan elemen yang diperlukan, pengetahuan yang dilarang, sudut pandang, dan target dramatis — dalam kondisi identik. Kami menilai hasilnya sebagai fiksi, seperti cara editor membaca, bukan cara menjawab kuis.

02

Nilai secara buta, di sembilan dimensi

Panel juri menilai setiap bagian 0–100 pada empat dimensi keahlian (sastra, dialog, kesetiaan, ritme) dan lima dimensi konten (emosi, fisikalitas, konflik, romansa, erotisme), tanpa mengetahui model mana yang menulisnya. Keahlian adalah kualitas eksekusi; konten adalah kesesuaian untuk jenis adegan.

03

Tarik menuju prior netral

Rata-rata mentah dari segelintir sampel adalah kebisingan. Setiap sel ditarik menuju baseline netral 70 sebanding dengan betapa tipisnya buktinya, sehingga pengukuran awal yang beruntung terbaca sebagai kurang lebih rata-rata hingga cukup observasi membuktikannya. Angka yang dipublikasikan adalah nilai yang sudah dikecilkan ini; ukuran sampel ditampilkan di sebelahnya.

04

Terus lipat, jangan timpa secara manual

Observasi juri baru dilipat ke dalam rata-rata berjalan dan jumlah sampel bertambah, sehingga grid semakin tajam dari waktu ke waktu. Angka diregenerasi dari observasi, tidak pernah diketik langsung, dan ketika versi model berubah di balik alias, sel-selnya direset ke pengukuran ulang yang bersih alih-alih mencampurkan dua model yang berbeda.

Where this leads

Mengapa benchmark seperti ini bisa digunakan

Memilih model berbeda untuk satu adegan hanya berhasil jika buku dibangun dalam unit-unit terstruktur yang terpisah daripada dihasilkan dalam satu kali jalan. Unit itu adalah beat, dan menjaga koherensi cerita sementara model berbeda menulis beat berbeda adalah tugas memori arc-dan-entitas yang menyertai proses build. Benchmark adalah papan skor; beat dan memori arc adalah yang memungkinkan buku benar-benar memanfaatkannya.

Questions

Frequently asked

Model AI mana yang menulis fiksi terbaik?
Berdasarkan keahlian keseluruhan — rata-rata dimensi sastra, dialog, kesetiaan, dan ritme pada prosa novel nyata — Claude Opus 4.8 saat ini memimpin, dengan GPT-5.6 Sol tidak jauh di belakang. Namun \"terbaik\" bergantung pada adegan: skor tertinggi untuk aksi, romansa, dan konten dewasa ada di model yang berbeda. Grid di halaman ini menampilkan peringkat terkini dan ukuran sampel di balik setiap angka.
Bagaimana benchmark ini diukur?
Setiap model menulis beat terstruktur yang sama dalam kondisi identik, dan panel juri buta menilai prosa yang dihasilkan 0–100 di sembilan dimensi — empat untuk keahlian (sastra, dialog, kesetiaan, ritme) dan lima untuk jenis konten (emosi, fisikalitas, konflik, romansa, erotisme). Skor dikecilkan dengan kepercayaan menuju baseline netral 70 agar data tipis tidak mengayunkan angka, dan jumlah sampel ditampilkan di sebelah setiap skor.
Apa perbedaan antara dimensi keahlian dan dimensi konten?
Dimensi keahlian mengukur seberapa baik model menulis, terlepas dari subjek — kualitas kalimat, suara karakter, kesetiaan terhadap brief, dan kontrol ritme. Dimensi konten mengukur kesesuaian untuk jenis adegan: emosi, aksi fisik, konflik, romansa, dan konten dewasa. Model bisa menulis kalimat indah namun tetap menangani adegan pertarungan dengan buruk, jadi kedua keluarga ini dinilai dan ditampilkan secara terpisah.
Mengapa tidak memilih satu model terbaik dan menggunakannya untuk segalanya?
Karena tidak ada model yang menang di setiap dimensi. Keahlian sastra terkuat, aksi terbaik, dan penulisan romansa atau konten dewasa paling mampu ada di model yang berbeda. Novelmint merutekan buku ke berbagai model beat demi beat — menjaga sebagian besar dalam satu suara serial demi koherensi dan menyimpang ke model yang lebih kuat pada beat tertentu yang memerlukannya — yang hanya mungkin karena grid ini ada.
Apakah skor rendah berarti model itu buruk?
Belum tentu. Skor konten rendah bisa berarti model itu mampu tetapi tidak bersedia — kebanyakan model mendapat skor rendah pada erotisme karena mereka menolak atau menjadi klinis, bukan karena kurang keterampilan. Dan skor dengan kepercayaan rendah (sedikit sampel) dikecilkan menuju baseline netral, sehingga terbaca sebagai \"belum terbukti\", bukan \"terbukti lemah\". Selalu baca skor bersamaan dengan ukuran sampelnya.
Seberapa sering benchmark diperbarui?
Terus-menerus. Grid adalah proyeksi langsung dari penyimpanan penilaian platform: juri yang menilai bagian saat Novelmint membangun bab melipat observasinya kembali, sehingga angka bergerak seiring penulis menggunakan mesin dan ukuran sampel bertambah. Halaman menampilkan tanggal kalibrasi ulang terbaru. Versi model baru diukur ulang dari awal daripada dicampurkan dengan model yang digantikannya, sehingga perubahan versi tidak diam-diam merusak kolom.

What this page does not claim

  • Benchmark ini mengukur kualitas prosa dan kesesuaian konten khusus untuk fiksi. Tidak ada pernyataan tentang penalaran, coding, matematika, akurasi faktual, atau keamanan model di luar konteks penulisan.
  • Skor bersifat relatif terhadap set yang dinilai dan prompt yang digunakan, bukan peringkat absolut atau resmi yang didukung oleh penyedia model. Nama dan merek dagang model adalah milik pemiliknya masing-masing.
  • Skor keahlian keseluruhan yang lebih tinggi tidak berarti model adalah pilihan tepat untuk setiap buku — suara, genre, kebutuhan konten, dan biaya semuanya penting, dan itulah tepatnya mengapa Novelmint merutekan ke berbagai model daripada memahkotai satu.
  • Sel dengan sampel sedikit bersifat sementara. Di mana angka memiliki sedikit observasi, angka itu dikecilkan menuju baseline netral dan ditandai, dan akan berubah seiring lebih banyak pengukuran dilipat masuk.

Berhenti menebak model mana yang harus digunakan. Biarkan buku yang memilih.

Novelmint merutekan setiap beat ke model yang dinyatakan grid ini paling sesuai. Bab pertamamu gratis.