Hangi yapay zeka modeli gerçekten en iyi kurguyu yazıyor?
Live data · measured as of July 24, 2026
Her model kartı matematik, kodlama ve akıl yürütmeyi ölçüyor. Hiçbiri bir modelin okuyucunun atlamayacağı bir sahne yazıp yazamadığını ölçmüyor. Bu yüzden biz o kıyaslamayı inşa ettik. Kör bir jüri paneli, öncü modellerin gerçek roman düz yazılarını dokuz eksende puanlıyor — dördü zanaat için, beşi bir kitabın gerçekten hangi tür sahnelerden oluştuğu için — ve aşağıdaki rakamlar canlı sonuçtur. Bu bir pazarlama grafiği değil: Novelmint'in kitabınızın her vuruşu için model seçerken kullandığı tam ızgaradır.
Key takeaways
- Kıyaslama, Anthropic, OpenAI, Google ve xAI'dan öncü modelleri gerçek roman düz yazısında — çoktan seçmeli testlerde değil — dokuz eksende puanlıyor: dört zanaat (edebi, diyalog, bağlılık, tempo) ve beş içerik (duygu, fiziksellik, çatışma, romantizm, erotizm).
- Zanaat eksenleri bir modelin NE KADAR İYİ yazdığını ölçer; içerik eksenleri hangi tür sahneyi iyi yazdığını. Bir model güzel cümleler yazabilir ama yine de düz dövüş sahneleri üretebilir; bu yüzden ikisi ayrı tutulur ve hiçbir zaman yanıltıcı tek bir sayıda birleştirilmez.
- Her puan, arkasındaki veri miktarıyla orantılı olarak tarafsız 70 temel çizgisine doğru güven çekimi uygulanır; böylece şanslı üç örnekli bir sonuç asla yerleşik bir gerçekmiş gibi görünemez. Her sayının arkasındaki örnek boyutu gösterilir.
- Hiçbir model her şeyi kazanmıyor. En güçlü genel edebi zanaat, en istikrarlı bağlılık, en iyi aksiyon ve en istekli romantizm ile yetişkin yazımı farklı sütunlarda yer alıyor — bu da bir kitabı tek bir model seçmek yerine modeller arasında yönlendirmenin tüm argümanı.
- Bu, Novelmint'in bir bölüm oluştururken vuruş başına model seçmek için kullandığı ızgaranın ta kendisidir — ve bir yapım sırasında bir pasajı puanlayan aynı jüri bunu besler; bu nedenle yazarlar motoru kullandıkça rakamlar güncellenir. Bu canlı bir mekanizmadır, geriye dönük bir iddia değil.
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
Bu canlı veridir, tek seferlik bir test değil
Aşağıdaki tablo bir kez çalıştırıp dondurduğumuz bir kıyaslama değil. Platformun çalıştığı puanlama deposunun canlı bir projeksiyonudur: bir yapım sırasında bir pasajı derecelendiren aynı jüri bu ızgarayı besler; bu nedenle Novelmint'te yazılan her bölüm gözlem ekler, örnek boyutları büyür ve rakamlar keskinleşir. Daha fazla yazar motorla kitap ürettikçe kıyaslama güncellenir — yukarıdaki tarih yalnızca en son yeniden kalibrasyon tarihidir.
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
Izgara nasıl okunur
Başlık sayısı genel zanaat — bir modelin dört yürütme ekseninin ortalaması; bu \"düz yazısı ne kadar iyi\" sorusunun en yakın yanıtıdır. Sağdaki içerik eksenleri daha iyi-daha kötü sıralamaları değildir; modelin NE İÇİN UYGUN olduğunu söyler. Yüksek fiziksellik puanı temiz aksiyon demektir; düşük erotizm puanı genellikle zayıf yazarlıktan değil, reddetme veya klinik düzlükten kaynaklanır — bu beceri değil, isteklilik göstergesidir. Modelleri karşılaştırmak için zanaat puanını sütun boyunca okuyun; tek bir modelin güçlü ve zayıf olduğu yerleri görmek için içeriği satır boyunca okuyun.
Best AI for…
A straight answer for one kind of scene — or one genre
By what your scene needs
- Edebi yazarlık için en iyi yapay zeka
- Diyalog yazmak için en iyi yapay zeka
- Talimat takibinde en iyi yapay zeka
- Tempolama için en iyi yapay zeka
- Duygusal sahneler için en iyi yapay zeka
- Aksiyon sahneleri için en iyi yapay zeka
- Çatışma sahneleri için en iyi yapay zeka
- Romantizm yazmada en iyi yapay zeka
- Açık sahneler için en iyi yapay zeka
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
Test cevapları değil, gerçek düz yazı üret
Her model aynı vuruşları yazar — gerekli öğeleri, yasaklı bilgileri, bir bakış açısını ve dramatik bir hedefi olan brifinge dayalı sahneler — özdeş koşullar altında. Bir sınavdaki performansı değil, kurgusal üretimini bir editörün okuduğu gibi puanlıyoruz.
Kör olarak, dokuz eksende puanla
Bir jüri paneli, hangi modelin yazdığını bilmeden her pasajı dört zanaat ekseni (edebi, diyalog, bağlılık, tempo) ve beş içerik ekseni (duygu, fiziksellik, çatışma, romantizm, erotizm) üzerinden 0–100 arasında değerlendirir. Zanaat yürütme kalitesidir; içerik ise bir sahne türüne uygunluktur.
Tarafsız bir önceliğe doğru çek
Bir avuç örnekten elde edilen ham ortalama gürültüdür. Her hücre, kanıtı ne kadar ince olduğuyla orantılı olarak tarafsız 70 temel çizgisine doğru çekilir; böylece erken, şanslı bir ölçüm yeterli gözlem ona bir yer kazanana kadar kabaca ortalama olarak okunur. Yayınlanan sayı bu çekilmiş değerdir; örnek boyutu yanında gösterilir.
Katlamaya devam et, elle asla üzerine yazma
Yeni jüri gözlemleri çalışan bir ortalamaya katlanır ve örnek sayısı büyür; böylece ızgara zamanla keskinleşir. Sayılar gözlemlerden yeniden üretilir, asla elle girilmez; bir model sürümü bir takma ad altında değiştiğinde hücreleri iki farklı modeli harmanlamak yerine temiz bir yeniden ölçüme sıfırlanır.
Where this leads
Bu tür bir kıyaslamanın kullanılabilir olmasının nedeni
Tek bir sahne için farklı bir model seçmek, ancak bir kitap tek geçişte oluşturulmak yerine ayrık, brifinge dayalı birimlerle inşa edildiğinde işe yarar. Bu birim vuruştur; farklı modeller farklı vuruşları yazarken hikayeyi tutarlı tutmak, yapımla birlikte gelen bir yay-ve-varlık belleğinin işidir. Kıyaslama bir puan tahtasıdır; vuruşlar ve yay belleği bir kitabın bunu gerçekten kullanabilmesini sağlar.
Questions
Frequently asked
- Hangi yapay zeka modeli en iyi kurguyu yazıyor?
- Genel zanaat — edebi, diyalog, bağlılık ve tempo eksenlerinin gerçek roman düz yazısındaki ortalaması — açısından Claude Opus 4.8 şu an önde, GPT-5.6 Sol hemen arkasında. Ancak \"en iyi\" sahneye göre değişir: aksiyon, romantizm ve yetişkin içeriği için en yüksek puanlar farklı modellerde. Bu sayfadaki ızgara mevcut sıralamaları ve her sayının arkasındaki örnek boyutunu gösteriyor.
- Bu kıyaslama nasıl ölçülüyor?
- Her model özdeş koşullar altında aynı brifinge dayalı vuruşları yazar; kör bir jüri paneli ortaya çıkan düz yazıyı dokuz eksende 0–100 arasında puanlar — dördü zanaat için (edebi, diyalog, bağlılık, tempo), beşi içerik türü için (duygu, fiziksellik, çatışma, romantizm, erotizm). Puanlar, ince verilerin sayıyı saptıramaması için tarafsız 70 temel çizgisine doğru güven çekimi uygulanır ve örnek sayısı her puanın yanında gösterilir.
- Zanaat eksenleri ile içerik eksenleri arasındaki fark nedir?
- Zanaat eksenleri bir modelin konudan bağımsız olarak ne kadar iyi yazdığını ölçer — cümle kalitesi, karakter sesi, brifinge bağlılık ve tempo kontrolü. İçerik eksenleri ise bir sahne türüne uygunluğu ölçer: duygu, fiziksel aksiyon, çatışma, romantizm ve yetişkin içeriği. Bir model güzel cümleler yazabilir ama yine de dövüş sahnelerini kötü yönetebilir; bu yüzden iki aile ayrı ayrı puanlanır ve gösterilir.
- Neden tek en iyi modeli seçip her şey için kullanmıyoruz?
- Çünkü hiçbir model her ekseni kazanmıyor. En güçlü edebi zanaat, en iyi aksiyon ve en yetenekli romantizm veya yetişkin yazımı farklı modellere ait. Novelmint bir kitabı vuruş vuruş modeller arasında yönlendirir — büyük çoğunluğu tutarlılık için tek bir seri sesinde tutar ve belirli vuruşlarda daha güçlü bir modele sapma yapar — bu yalnızca bu ızgara var olduğu için mümkündür.
- Düşük puan bir modelin kötü olduğu anlamına mı gelir?
- Zorunlu değil. Düşük içerik puanı, modelin yetenekli ama isteksiz olduğu anlamına gelebilir — çoğu model erotizmde düşük puan alır çünkü reddeder veya klinik bir dil kullanır, beceri eksikliğinden değil. Düşük güvenlik puanı (az örnek) ise tarafsız temel çizgisine doğru çekilir; bu \"henüz kanıtlanmamış\" demektir, \"zayıf olduğu kanıtlanmış\" değil. Puanı her zaman örnek boyutuyla birlikte okuyun.
- Kıyaslama ne sıklıkla güncelleniyor?
- Sürekli olarak. Izgara, platformun puanlama deposunun canlı bir projeksiyonudur: Novelmint bir bölüm oluştururken bir pasajı derecelendiren aynı jüri gözlemlerini geri katlar; bu nedenle yazarlar motoru kullandıkça ve örnek boyutları büyüdükçe sayılar değişir. Sayfa en son yeniden kalibrasyon tarihini gösterir. Yeni model sürümleri, yerini aldıkları modelle harmanlenmak yerine sıfırdan yeniden ölçülür; böylece bir sürüm değişikliği bir sütunu sessizce asla bozmaz.
What this page does not claim
- Bu kıyaslama yalnızca kurgu için düz yazı kalitesini ve içerik uygunluğunu ölçer. Bir modelin yazma bağlamı dışındaki akıl yürütme, kodlama, matematik, olgusal doğruluk veya güvenlik hakkında hiçbir şey söylemez.
- Puanlar, değerlendirilen set ve kullanılan istemlerle göreli olup model sağlayıcılarının onayladığı mutlak veya resmi bir derecelendirme değildir. Model adları ve ticari markalar ilgili sahiplerine aittir.
- Daha yüksek genel zanaat puanı, bir modelin her kitap için doğru seçim olduğu anlamına gelmez — ses, tür, içerik ihtiyaçları ve maliyet de önemlidir; bu yüzden Novelmint tek bir modeli taçlandırmak yerine modeller arasında yönlendirme yapar.
- Az örnekli hücreler geçicidir. Bir sayı az gözlem taşıdığında tarafsız temel çizgisine doğru çekilir ve işaretlenir; daha fazla ölçüm katlandıkça değişecektir.
İlgili
Aksiyon sahneleri için en iyi yapay zeka
Hangi yapay zeka bir dövüşü veya kovalamacayı belirsiz bırakmak yerine net ve gerçekçi tutar? Fiziksellik ekseninde sıralandı.
Çatışma sahneleri için en iyi yapay zeka
Hangi yapay zeka bir tartışma veya gerginliği gergin ve tırmanır halde tutar. Ölçülen çatışma ekseninde sıralandı.
Duygusal sahneler için en iyi yapay zeka
Hangi yapay zeka, duygu odaklı bir sahneyi yalnızca anlatmak yerine gerçekten hissettiriyor? Duygusallık ekseninde sıralandı.
Açık sahneler için en iyi yapay zeka
Hangi yapay zeka gerçekten açık yetişkin içeriği yazar — hangisi reddeder. İstekliliğe göre sıralandı.
Hangi modeli kullanacağınızı tahmin etmeyi bırakın. Kitabın seçmesine izin verin.
Novelmint her vuruşu bu ızgaranın en uygun dediği modele yönlendirir. İlk bölümünüz ücretsiz.