Model AI mana yang benar-benar menulis fiksi terbaik?
Live data · measured as of July 24, 2026
Setiap kartu model mengukur matematika, coding, dan penalaran. Tidak ada yang mengukur apakah model bisa menulis adegan yang tidak akan dilewati pembaca. Jadi kami membangun benchmark yang melakukannya. Panel juri buta menilai prosa novel yang dihasilkan model-model terdepan dari sembilan dimensi — empat untuk keahlian, lima untuk jenis adegan yang membentuk sebuah buku — dan angka di bawah ini adalah hasilnya secara langsung. Ini bukan grafik pemasaran: ini adalah grid persis yang dibaca Novelmint untuk memilih model di setiap beat bukumu.
Key takeaways
- Benchmark ini menilai model-model terdepan dari Anthropic, OpenAI, Google, dan xAI pada prosa novel yang benar-benar dihasilkan — bukan tes pilihan ganda — di sembilan dimensi: empat keahlian (sastra, dialog, kesetiaan, ritme) dan lima konten (emosi, fisikalitas, konflik, romansa, erotisme).
- Dimensi keahlian mengukur SEBERAPA BAIK model menulis; dimensi konten mengukur JENIS adegan apa yang ditulis dengan baik. Model bisa menulis kalimat indah namun tetap menghasilkan adegan pertarungan yang datar, jadi keduanya dipisah dan tidak pernah dirata-rata menjadi satu angka yang menyesatkan.
- Setiap skor dikecilkan dengan kepercayaan menuju baseline netral 70 sebanding dengan seberapa sedikit data di baliknya, sehingga hasil beruntung dari tiga sampel tidak bisa berpura-pura sebagai fakta yang mapan. Ukuran sampel di balik setiap angka ditampilkan.
- Tidak ada satu model pun yang menang di semua dimensi. Keahlian sastra keseluruhan terkuat, kesetiaan paling stabil, aksi terbaik, serta penulisan romansa dan konten dewasa yang paling bersedia ada di kolom berbeda — inilah alasan utama untuk merutekan buku ke berbagai model daripada memilih satu.
- Ini adalah grid yang sama yang digunakan Novelmint untuk memilih model per beat saat membangun bab — dan juri yang menilai suatu bagian saat proses build mengisinya, sehingga angka terus diperbarui saat penulis menulis dengan mesin ini. Ini adalah mekanisme langsung, bukan klaim retrospektif.
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
Ini adalah data langsung, bukan tes sekali jalan
Tabel di bawah ini bukan benchmark yang kami jalankan sekali lalu dibekukan. Ini adalah proyeksi langsung dari penyimpanan penilaian yang dijalankan platform: juri yang menilai bagian saat proses build mengisi grid ini, sehingga setiap bab yang ditulis di Novelmint menambah observasi, ukuran sampel bertambah, dan angka semakin tajam. Semakin banyak penulis yang membangun dengan mesin ini, benchmark terus diperbarui — tanggal di atas hanyalah kalibrasi ulang terbaru.
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
Cara membaca grid
Angka utama adalah keahlian keseluruhan — rata-rata dari empat dimensi eksekusi model, yang paling mendekati \"seberapa bagus prosanya\". Dimensi konten di sebelah kanan bukan peringkat lebih baik-lebih buruk; mereka menunjukkan untuk apa model itu COCOK. Skor fisikalitas tinggi berarti aksi yang bersih; skor erotisme rendah biasanya berarti penolakan atau kerataan klinis daripada tulisan lemah — kesediaan, bukan keterampilan. Baca keahlian ke bawah kolom untuk membandingkan model, dan baca konten ke samping baris untuk melihat di mana satu model kuat dan di mana tidak.
Best AI for…
A straight answer for one kind of scene — or one genre
By what your scene needs
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
Hasilkan prosa nyata, bukan jawaban tes
Setiap model menulis beat yang sama — adegan terstruktur dengan elemen yang diperlukan, pengetahuan yang dilarang, sudut pandang, dan target dramatis — dalam kondisi identik. Kami menilai hasilnya sebagai fiksi, seperti cara editor membaca, bukan cara menjawab kuis.
Nilai secara buta, di sembilan dimensi
Panel juri menilai setiap bagian 0–100 pada empat dimensi keahlian (sastra, dialog, kesetiaan, ritme) dan lima dimensi konten (emosi, fisikalitas, konflik, romansa, erotisme), tanpa mengetahui model mana yang menulisnya. Keahlian adalah kualitas eksekusi; konten adalah kesesuaian untuk jenis adegan.
Tarik menuju prior netral
Rata-rata mentah dari segelintir sampel adalah kebisingan. Setiap sel ditarik menuju baseline netral 70 sebanding dengan betapa tipisnya buktinya, sehingga pengukuran awal yang beruntung terbaca sebagai kurang lebih rata-rata hingga cukup observasi membuktikannya. Angka yang dipublikasikan adalah nilai yang sudah dikecilkan ini; ukuran sampel ditampilkan di sebelahnya.
Terus lipat, jangan timpa secara manual
Observasi juri baru dilipat ke dalam rata-rata berjalan dan jumlah sampel bertambah, sehingga grid semakin tajam dari waktu ke waktu. Angka diregenerasi dari observasi, tidak pernah diketik langsung, dan ketika versi model berubah di balik alias, sel-selnya direset ke pengukuran ulang yang bersih alih-alih mencampurkan dua model yang berbeda.
Where this leads
Mengapa benchmark seperti ini bisa digunakan
Memilih model berbeda untuk satu adegan hanya berhasil jika buku dibangun dalam unit-unit terstruktur yang terpisah daripada dihasilkan dalam satu kali jalan. Unit itu adalah beat, dan menjaga koherensi cerita sementara model berbeda menulis beat berbeda adalah tugas memori arc-dan-entitas yang menyertai proses build. Benchmark adalah papan skor; beat dan memori arc adalah yang memungkinkan buku benar-benar memanfaatkannya.
Questions
Frequently asked
- Model AI mana yang menulis fiksi terbaik?
- Berdasarkan keahlian keseluruhan — rata-rata dimensi sastra, dialog, kesetiaan, dan ritme pada prosa novel nyata — Claude Opus 4.8 saat ini memimpin, dengan GPT-5.6 Sol tidak jauh di belakang. Namun \"terbaik\" bergantung pada adegan: skor tertinggi untuk aksi, romansa, dan konten dewasa ada di model yang berbeda. Grid di halaman ini menampilkan peringkat terkini dan ukuran sampel di balik setiap angka.
- Bagaimana benchmark ini diukur?
- Setiap model menulis beat terstruktur yang sama dalam kondisi identik, dan panel juri buta menilai prosa yang dihasilkan 0–100 di sembilan dimensi — empat untuk keahlian (sastra, dialog, kesetiaan, ritme) dan lima untuk jenis konten (emosi, fisikalitas, konflik, romansa, erotisme). Skor dikecilkan dengan kepercayaan menuju baseline netral 70 agar data tipis tidak mengayunkan angka, dan jumlah sampel ditampilkan di sebelah setiap skor.
- Apa perbedaan antara dimensi keahlian dan dimensi konten?
- Dimensi keahlian mengukur seberapa baik model menulis, terlepas dari subjek — kualitas kalimat, suara karakter, kesetiaan terhadap brief, dan kontrol ritme. Dimensi konten mengukur kesesuaian untuk jenis adegan: emosi, aksi fisik, konflik, romansa, dan konten dewasa. Model bisa menulis kalimat indah namun tetap menangani adegan pertarungan dengan buruk, jadi kedua keluarga ini dinilai dan ditampilkan secara terpisah.
- Mengapa tidak memilih satu model terbaik dan menggunakannya untuk segalanya?
- Karena tidak ada model yang menang di setiap dimensi. Keahlian sastra terkuat, aksi terbaik, dan penulisan romansa atau konten dewasa paling mampu ada di model yang berbeda. Novelmint merutekan buku ke berbagai model beat demi beat — menjaga sebagian besar dalam satu suara serial demi koherensi dan menyimpang ke model yang lebih kuat pada beat tertentu yang memerlukannya — yang hanya mungkin karena grid ini ada.
- Apakah skor rendah berarti model itu buruk?
- Belum tentu. Skor konten rendah bisa berarti model itu mampu tetapi tidak bersedia — kebanyakan model mendapat skor rendah pada erotisme karena mereka menolak atau menjadi klinis, bukan karena kurang keterampilan. Dan skor dengan kepercayaan rendah (sedikit sampel) dikecilkan menuju baseline netral, sehingga terbaca sebagai \"belum terbukti\", bukan \"terbukti lemah\". Selalu baca skor bersamaan dengan ukuran sampelnya.
- Seberapa sering benchmark diperbarui?
- Terus-menerus. Grid adalah proyeksi langsung dari penyimpanan penilaian platform: juri yang menilai bagian saat Novelmint membangun bab melipat observasinya kembali, sehingga angka bergerak seiring penulis menggunakan mesin dan ukuran sampel bertambah. Halaman menampilkan tanggal kalibrasi ulang terbaru. Versi model baru diukur ulang dari awal daripada dicampurkan dengan model yang digantikannya, sehingga perubahan versi tidak diam-diam merusak kolom.
What this page does not claim
- Benchmark ini mengukur kualitas prosa dan kesesuaian konten khusus untuk fiksi. Tidak ada pernyataan tentang penalaran, coding, matematika, akurasi faktual, atau keamanan model di luar konteks penulisan.
- Skor bersifat relatif terhadap set yang dinilai dan prompt yang digunakan, bukan peringkat absolut atau resmi yang didukung oleh penyedia model. Nama dan merek dagang model adalah milik pemiliknya masing-masing.
- Skor keahlian keseluruhan yang lebih tinggi tidak berarti model adalah pilihan tepat untuk setiap buku — suara, genre, kebutuhan konten, dan biaya semuanya penting, dan itulah tepatnya mengapa Novelmint merutekan ke berbagai model daripada memahkotai satu.
- Sel dengan sampel sedikit bersifat sementara. Di mana angka memiliki sedikit observasi, angka itu dikecilkan menuju baseline netral dan ditandai, dan akan berubah seiring lebih banyak pengukuran dilipat masuk.
Terkait
AI terbaik untuk adegan aksi
AI mana yang menjaga adegan pertarungan atau kejar-kejaran tetap jelas dan membumi, bukan samar. Diranking berdasarkan fisikalitas.
AI terbaik untuk adegan konflik
AI mana yang menjaga adegan argumen atau kebuntuan tetap tegang dan memuncak. Diranking berdasarkan konflik terukur.
AI terbaik untuk adegan emosional
AI mana yang membuat adegan berbasis perasaan benar-benar terasa, bukan sekadar mendeskripsikannya. Diranking berdasarkan emosi.
AI terbaik untuk adegan eksplisit
AI mana yang benar-benar mau menulis konten dewasa eksplisit — dan mana yang menolak. Diperingkat berdasarkan kesediaan.
Berhenti menebak model mana yang harus digunakan. Biarkan buku yang memilih.
Novelmint merutekan setiap beat ke model yang dinyatakan grid ini paling sesuai. Bab pertamamu gratis.