Kurgu modeli kıyaslaması

Hangi yapay zeka modeli gerçekten en iyi kurguyu yazıyor?

Live data · measured as of July 24, 2026

Her model kartı matematik, kodlama ve akıl yürütmeyi ölçüyor. Hiçbiri bir modelin okuyucunun atlamayacağı bir sahne yazıp yazamadığını ölçmüyor. Bu yüzden biz o kıyaslamayı inşa ettik. Kör bir jüri paneli, öncü modellerin gerçek roman düz yazılarını dokuz eksende puanlıyor — dördü zanaat için, beşi bir kitabın gerçekten hangi tür sahnelerden oluştuğu için — ve aşağıdaki rakamlar canlı sonuçtur. Bu bir pazarlama grafiği değil: Novelmint'in kitabınızın her vuruşu için model seçerken kullandığı tam ızgaradır.

Key takeaways

  • Kıyaslama, Anthropic, OpenAI, Google ve xAI'dan öncü modelleri gerçek roman düz yazısında — çoktan seçmeli testlerde değil — dokuz eksende puanlıyor: dört zanaat (edebi, diyalog, bağlılık, tempo) ve beş içerik (duygu, fiziksellik, çatışma, romantizm, erotizm).
  • Zanaat eksenleri bir modelin NE KADAR İYİ yazdığını ölçer; içerik eksenleri hangi tür sahneyi iyi yazdığını. Bir model güzel cümleler yazabilir ama yine de düz dövüş sahneleri üretebilir; bu yüzden ikisi ayrı tutulur ve hiçbir zaman yanıltıcı tek bir sayıda birleştirilmez.
  • Her puan, arkasındaki veri miktarıyla orantılı olarak tarafsız 70 temel çizgisine doğru güven çekimi uygulanır; böylece şanslı üç örnekli bir sonuç asla yerleşik bir gerçekmiş gibi görünemez. Her sayının arkasındaki örnek boyutu gösterilir.
  • Hiçbir model her şeyi kazanmıyor. En güçlü genel edebi zanaat, en istikrarlı bağlılık, en iyi aksiyon ve en istekli romantizm ile yetişkin yazımı farklı sütunlarda yer alıyor — bu da bir kitabı tek bir model seçmek yerine modeller arasında yönlendirmenin tüm argümanı.
  • Bu, Novelmint'in bir bölüm oluştururken vuruş başına model seçmek için kullandığı ızgaranın ta kendisidir — ve bir yapım sırasında bir pasajı puanlayan aynı jüri bunu besler; bu nedenle yazarlar motoru kullandıkça rakamlar güncellenir. Bu canlı bir mekanizmadır, geriye dönük bir iddia değil.

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

Bu canlı veridir, tek seferlik bir test değil

Aşağıdaki tablo bir kez çalıştırıp dondurduğumuz bir kıyaslama değil. Platformun çalıştığı puanlama deposunun canlı bir projeksiyonudur: bir yapım sırasında bir pasajı derecelendiren aynı jüri bu ızgarayı besler; bu nedenle Novelmint'te yazılan her bölüm gözlem ekler, örnek boyutları büyür ve rakamlar keskinleşir. Daha fazla yazar motorla kitap ürettikçe kıyaslama güncellenir — yukarıdaki tarih yalnızca en son yeniden kalibrasyon tarihidir.

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

Izgara nasıl okunur

Başlık sayısı genel zanaat — bir modelin dört yürütme ekseninin ortalaması; bu \"düz yazısı ne kadar iyi\" sorusunun en yakın yanıtıdır. Sağdaki içerik eksenleri daha iyi-daha kötü sıralamaları değildir; modelin NE İÇİN UYGUN olduğunu söyler. Yüksek fiziksellik puanı temiz aksiyon demektir; düşük erotizm puanı genellikle zayıf yazarlıktan değil, reddetme veya klinik düzlükten kaynaklanır — bu beceri değil, isteklilik göstergesidir. Modelleri karşılaştırmak için zanaat puanını sütun boyunca okuyun; tek bir modelin güçlü ve zayıf olduğu yerleri görmek için içeriği satır boyunca okuyun.

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

Test cevapları değil, gerçek düz yazı üret

Her model aynı vuruşları yazar — gerekli öğeleri, yasaklı bilgileri, bir bakış açısını ve dramatik bir hedefi olan brifinge dayalı sahneler — özdeş koşullar altında. Bir sınavdaki performansı değil, kurgusal üretimini bir editörün okuduğu gibi puanlıyoruz.

02

Kör olarak, dokuz eksende puanla

Bir jüri paneli, hangi modelin yazdığını bilmeden her pasajı dört zanaat ekseni (edebi, diyalog, bağlılık, tempo) ve beş içerik ekseni (duygu, fiziksellik, çatışma, romantizm, erotizm) üzerinden 0–100 arasında değerlendirir. Zanaat yürütme kalitesidir; içerik ise bir sahne türüne uygunluktur.

03

Tarafsız bir önceliğe doğru çek

Bir avuç örnekten elde edilen ham ortalama gürültüdür. Her hücre, kanıtı ne kadar ince olduğuyla orantılı olarak tarafsız 70 temel çizgisine doğru çekilir; böylece erken, şanslı bir ölçüm yeterli gözlem ona bir yer kazanana kadar kabaca ortalama olarak okunur. Yayınlanan sayı bu çekilmiş değerdir; örnek boyutu yanında gösterilir.

04

Katlamaya devam et, elle asla üzerine yazma

Yeni jüri gözlemleri çalışan bir ortalamaya katlanır ve örnek sayısı büyür; böylece ızgara zamanla keskinleşir. Sayılar gözlemlerden yeniden üretilir, asla elle girilmez; bir model sürümü bir takma ad altında değiştiğinde hücreleri iki farklı modeli harmanlamak yerine temiz bir yeniden ölçüme sıfırlanır.

Where this leads

Bu tür bir kıyaslamanın kullanılabilir olmasının nedeni

Tek bir sahne için farklı bir model seçmek, ancak bir kitap tek geçişte oluşturulmak yerine ayrık, brifinge dayalı birimlerle inşa edildiğinde işe yarar. Bu birim vuruştur; farklı modeller farklı vuruşları yazarken hikayeyi tutarlı tutmak, yapımla birlikte gelen bir yay-ve-varlık belleğinin işidir. Kıyaslama bir puan tahtasıdır; vuruşlar ve yay belleği bir kitabın bunu gerçekten kullanabilmesini sağlar.

Questions

Frequently asked

Hangi yapay zeka modeli en iyi kurguyu yazıyor?
Genel zanaat — edebi, diyalog, bağlılık ve tempo eksenlerinin gerçek roman düz yazısındaki ortalaması — açısından Claude Opus 4.8 şu an önde, GPT-5.6 Sol hemen arkasında. Ancak \"en iyi\" sahneye göre değişir: aksiyon, romantizm ve yetişkin içeriği için en yüksek puanlar farklı modellerde. Bu sayfadaki ızgara mevcut sıralamaları ve her sayının arkasındaki örnek boyutunu gösteriyor.
Bu kıyaslama nasıl ölçülüyor?
Her model özdeş koşullar altında aynı brifinge dayalı vuruşları yazar; kör bir jüri paneli ortaya çıkan düz yazıyı dokuz eksende 0–100 arasında puanlar — dördü zanaat için (edebi, diyalog, bağlılık, tempo), beşi içerik türü için (duygu, fiziksellik, çatışma, romantizm, erotizm). Puanlar, ince verilerin sayıyı saptıramaması için tarafsız 70 temel çizgisine doğru güven çekimi uygulanır ve örnek sayısı her puanın yanında gösterilir.
Zanaat eksenleri ile içerik eksenleri arasındaki fark nedir?
Zanaat eksenleri bir modelin konudan bağımsız olarak ne kadar iyi yazdığını ölçer — cümle kalitesi, karakter sesi, brifinge bağlılık ve tempo kontrolü. İçerik eksenleri ise bir sahne türüne uygunluğu ölçer: duygu, fiziksel aksiyon, çatışma, romantizm ve yetişkin içeriği. Bir model güzel cümleler yazabilir ama yine de dövüş sahnelerini kötü yönetebilir; bu yüzden iki aile ayrı ayrı puanlanır ve gösterilir.
Neden tek en iyi modeli seçip her şey için kullanmıyoruz?
Çünkü hiçbir model her ekseni kazanmıyor. En güçlü edebi zanaat, en iyi aksiyon ve en yetenekli romantizm veya yetişkin yazımı farklı modellere ait. Novelmint bir kitabı vuruş vuruş modeller arasında yönlendirir — büyük çoğunluğu tutarlılık için tek bir seri sesinde tutar ve belirli vuruşlarda daha güçlü bir modele sapma yapar — bu yalnızca bu ızgara var olduğu için mümkündür.
Düşük puan bir modelin kötü olduğu anlamına mı gelir?
Zorunlu değil. Düşük içerik puanı, modelin yetenekli ama isteksiz olduğu anlamına gelebilir — çoğu model erotizmde düşük puan alır çünkü reddeder veya klinik bir dil kullanır, beceri eksikliğinden değil. Düşük güvenlik puanı (az örnek) ise tarafsız temel çizgisine doğru çekilir; bu \"henüz kanıtlanmamış\" demektir, \"zayıf olduğu kanıtlanmış\" değil. Puanı her zaman örnek boyutuyla birlikte okuyun.
Kıyaslama ne sıklıkla güncelleniyor?
Sürekli olarak. Izgara, platformun puanlama deposunun canlı bir projeksiyonudur: Novelmint bir bölüm oluştururken bir pasajı derecelendiren aynı jüri gözlemlerini geri katlar; bu nedenle yazarlar motoru kullandıkça ve örnek boyutları büyüdükçe sayılar değişir. Sayfa en son yeniden kalibrasyon tarihini gösterir. Yeni model sürümleri, yerini aldıkları modelle harmanlenmak yerine sıfırdan yeniden ölçülür; böylece bir sürüm değişikliği bir sütunu sessizce asla bozmaz.

What this page does not claim

  • Bu kıyaslama yalnızca kurgu için düz yazı kalitesini ve içerik uygunluğunu ölçer. Bir modelin yazma bağlamı dışındaki akıl yürütme, kodlama, matematik, olgusal doğruluk veya güvenlik hakkında hiçbir şey söylemez.
  • Puanlar, değerlendirilen set ve kullanılan istemlerle göreli olup model sağlayıcılarının onayladığı mutlak veya resmi bir derecelendirme değildir. Model adları ve ticari markalar ilgili sahiplerine aittir.
  • Daha yüksek genel zanaat puanı, bir modelin her kitap için doğru seçim olduğu anlamına gelmez — ses, tür, içerik ihtiyaçları ve maliyet de önemlidir; bu yüzden Novelmint tek bir modeli taçlandırmak yerine modeller arasında yönlendirme yapar.
  • Az örnekli hücreler geçicidir. Bir sayı az gözlem taşıdığında tarafsız temel çizgisine doğru çekilir ve işaretlenir; daha fazla ölçüm katlandıkça değişecektir.

Hangi modeli kullanacağınızı tahmin etmeyi bırakın. Kitabın seçmesine izin verin.

Novelmint her vuruşu bu ızgaranın en uygun dediği modele yönlendirir. İlk bölümünüz ücretsiz.