Metodoloji

Kurgu modeli kıyaslama testi nasıl çalışır

Updated July 23, 2026 · 6 dakikalık okuma

Bu kıyaslama testi, model kartlarının hiçbir zaman ölçmediği tek şeyi ölçer: bir modelin, okuyucunun atlamayacağı bir sahne yazıp yazamayacağını. Bu sayfa, sayıların tam olarak nasıl üretildiğini açıklar — neyin ölçüldüğünü, modellerin nasıl değerlendirildiğini, puanların neden güvene göre küçültüldüğünü ve tablonun nasıl güncel tutulduğunu — böylece sonuçları kendiniz değerlendirebilir ve doğru şekilde atıfta bulunabilirsiniz.

Key takeaways

  • Öncü modeller aynı brifinge alınmış roman sahnelerini yazar; kör ve sağlayıcı çeşitliliğine sahip bir jüri paneli, hangi modelin yazdığını bilmeden düzyazıyı dokuz eksende 0–100 arasında puanlar.
  • İki ailede dokuz eksen: dört zanaat ekseni (edebi, diyalog, sadakat, tempo) modelin ne kadar iyi yazdığını ölçer; beş içerik ekseni (duygu, fiziksellik, çatışma, romantizm, erotizm) ise hangi tür sahneyi iyi yazdığını ölçer. Bunlar hiçbir zaman birlikte ortalaması alınmaz.
  • Her puan, arkasındaki verinin azlığıyla orantılı biçimde tarafsız 70 taban değerine doğru küçültülür (beş gözlem değerinde bir önsel), böylece şanslı küçük bir örneklem zirveye ulaşamaz. Örneklem büyüklükleri gösterilir; ince hücreler işaretlenir.
  • Tablo canlıdır — yeni jüri gözlemleri zamanla yürüyen ortalamaya eklenir; bir sürüm değişikliği, modeli önceki sürümüyle harmanlamak yerine sıfırlayarak yeniden ölçer.
  • Puanlar yalnızca kurgu sahnelerindeki düzyazıyı tanımlar; bağımsız bir ölçümdür, resmi bir sağlayıcı değerlendirmesi değildir ve düşük erotizm puanı genellikle beceriyi değil, istekliliği yansıtır.

Novelmint kurgu kıyaslaması, model kartlarının hiçbir zaman ölçmediği tek şeyi ölçer: bir modelin, okuyucunun atlamayacağı bir sahne yazıp yazamadığını. Bu, matematik ya da kodlama testlerinden ödünç alınmış bir liderlik tablosu değil — gerçek roman düzyazısını puanlıyor. Sayıların nasıl üretildiği aşağıda açıkça anlatılıyor; böylece bunları kendiniz değerlendirebilir ve güvenle atıf yapabilirsiniz.

Ne ölçer

Kıyaslama, sınır modellerinin — Anthropic, OpenAI, Google ve xAI'dan — kurgu yazma becerisini puanlar. Nasıl akıl yürüttüklerini değil, nasıl kod yazdıklarını değil, çoktan seçmeli testlerdeki performanslarını değil. Her modele aynı özetlenmiş roman vuruşları verilir — gerekli öğelere, yasak bilgiye, bir bakış açısına ve dramatik bir hedefe sahip sahneler — ve yazdıkları, bir editörün okuduğu gibi, kurgu olarak değerlendirilir.

Her şey, eksen başına 0–100'lük tek bir ölçekte ifade edilir; dolayısıyla sayılar, modeller arasında ve bir kitabın gerçekten oluşturulduğu sahne türleri arasında doğrudan karşılaştırılabilir.

Dokuz eksen

Kurgu tek bir beceri değildir, bu nedenle kıyaslama onu tek bir sayıya indirgemez. Farklı anlamlar taşıyan iki aileye bölünmüş dokuz ekseni puanlar.

Dört zanaat ekseni, konudan bağımsız olarak bir modelin ne kadar iyi yazdığını ölçer: edebi (cümle düzeyinde imge, ritim, alt metin, kısıtlama), diyalog (karakterlerin birbirinden ayrışan insanlar gibi konuşup konuşmadığı), sadakat (özetlenmiş vuruşu tam olarak ne kadar sadıkla aktardığı — gerekli öğeleri dahil ederek, yasak bilgiyi dışarıda tutarak) ve tempo (ivme kontrolü — ne zaman sıkıştırılacağı, ne zaman üzerinde durulacağı).

Beş içerik ekseni, bir modelin ne tür bir sahneyi iyi yazdığını ölçer: duygu, fiziksellik (aksiyon ve bedenin uzaydaki konumu), çatışma, romantizm ve erotizm (açık yetişkin içeriği). Bunlar iyi-kötü sıralamaları değil — bir modelin ne için uygun olduğunu ortaya koyarlar. Bir model güzel cümleler yazabilir ama yine de yavan dövüş sahneleri yazabilir; bu yüzden zanaat ve içerik ayrı ayrı puanlanır, raporlanır ve yanıltıcı tek bir rakama asla ortalaması alınmaz.

Her model nasıl puanlanır

Puanlama, kör akran değerlendirmesidir. Her model aynı özetlenmiş vuruş setini yazar ve güçlü, sağlayıcı çeşitliliğine sahip bir hakem modeller paneli, her pasajı hangi modelin yazdığını bilmeksizin ve kendi çalışmasını hiçbir zaman yargılamaksızın her eksende 0–100 arasında puanlar. Sağlayıcı çeşitliliğine sahip bir panel önemlidir: bir modelin kendi ailesinin dışından bir hakem, o ailenin ödüllendirme eğiliminde olduğu özellikleri yakalar.

Yargılama kör ve çapraz model olduğundan, bir model kendine iltimas geçemez ve hiçbir tek bir ev stili standardı belirleyemez.

Hakem yanlılığını kontrol etmek

Modelleri yargılamak için model kullanmak, iyi bilinen dört başarısızlık modunu davet eder ve yöntem, her birini kapatacak şekilde tasarlanmıştır.

Kendini tercih — bir model kendi ev stilini ödüllendirme eğilimindedir. İki kural bunu ortadan kaldırır: bir model kendi pasajını hiçbir zaman puanlamaz ve hakem paneli sağlayıcı açısından çeşitlidir, dolayısıyla hiçbir ailenin beğenisi standardı belirleyemez. Bir evin ödüllendirdiği bir özellik, başka bir aileden bir hakem tarafından yakalanır ve bunun tersi de geçerlidir.

Ayrıntılılık — hakemler güvenilir biçimde uzunluğu fazla ödüllendirir. Her vuruş yaklaşık 220 kelimelik aynı hedefi özetler, böylece tüm pasajlar neredeyse aynı boyuta ulaşır ve dolgu malzemesi hiçbir işe yaramaz. Bir model puanını o kelimelerle ne yaptığıyla kazanır, kaç kelime harcadığıyla değil.

Konum — pasajların göründüğü sıra, puanları ilk gelene doğru yönlendirebilir. Bu nedenle pasajlar her vuruş için yeniden etiketlenir ve karıştırılır; her biri baş başa sıralanmak yerine sabit bir rubriğe göre kendi başına puanlanır. Sıra herhangi bir sinyal taşımaz ve olası artık sapma, çok sayıda vuruş ve çok sayıda hakem genelinde ortalamasına yaklaşır.

Örnekleme — tek bir şanslı taslak bir modeli pohpohlayabilir. Üretim, her modelin varsayılan sıcaklığında özdeş bir istem üzerinde çalışır; modele özgü herhangi bir ayarlama yapılmaz, dolayısıyla hiçbir modele diğerlerinin sahip olmadığı kiraz toplama ayarı verilmez. Ve hiçbir hücre tek bir taslağa dayanmaz: her model, tam vuruş seti boyunca paneldeki diğer her model tarafından puanlanır, ardından yeterli ölçümler birikene kadar nötr taban çizgisine doğru küçültülür — böylece tek taslak şansı, bir sayı yayımlanmadan çok önce yok olur.

Puanlar neden güvene göre küçültülür

Bir avuç pasajdan elde edilen ham ortalama gürültüdür ve puan kılığına büründürülmüş gürültü, hiç puan olmamasından daha kötüdür. Bu nedenle yayımlanan her sayı, arkasındaki verinin ne kadar az olduğuyla orantılı biçimde 70 nötr taban çizgisine doğru küçültülür — biçimsel olarak, beş gözlem değerinde bir ön. Üç şanslı örneğe dayanan bir hücre, yeterli ölçüm onu hak edene kadar kabaca ortalama olarak okunur; yüzlerce örneğe dayanan bir hücre ise gerçek ölçülen değeri olarak okunur.

Her sayının arkasındaki örneklem büyüklüğü gösterilir ve hâlâ altı gözlemden az olan her hücre geçici olarak işaretlenir. Bu yüzden ince veriye sahip bir model hiçbir zaman bir şans eseri zirveye fırlamaz — yöntem buna izin vermez.

Tablo nasıl güncel kalır

Kıyaslama, bir kez çalıştırılıp dondurulmuş tek seferlik bir test değildir. Platformun üzerinde çalıştığı puanlama deposunun canlı bir yansımasıdır: yeni hakem gözlemleri devam eden bir ortalamaya katlanır ve her hücrenin örneklem sayısı zamanla büyür, böylece tablo yaşlanmak yerine keskinleşir. Sayfa her zaman en son yeniden kalibrasyon tarihini gösterir.

Doğruluk açısından önemli bir güvence mevcuttur. Kalıcı bir takma ad ("en son" işaretçisi) sessizce yeni bir temel modele yönlendirildiğinde, o modelin hücreleri sıfırlanır ve sıfırdan yeniden ölçülür; yerine geçtiği modelle harmanlanmak yerine — böylece bir sürüm değişikliği bir sütunu sessizce bozmaz. Bu ayrıca kıyaslamanın genel bir etiket yerine ölçtüğü belirli sürümü adlandırmasının nedenidir.

Sınırlılıklar

Puanlar yalnızca kurgu vuruşları üzerindeki düzyazıyı tanımlar; bu model ve istem kümesine göre değerlendirilir. Model sağlayıcıları tarafından onaylanmış resmi derecelendirmeler değildir ve yazma bağlamı dışında bir modelin akıl yürütmesi, doğruluğu veya güvenliği hakkında hiçbir şey söylemezler. Model adları ve ticari markalar ilgili sahiplerine aittir; bu bağımsız bir ölçümdür.

İki okuma kolayca yanlış anlaşılabilir. Düşük bir erotizm puanı genellikle isteksizliği yansıtır — bir modelin ret etmesi veya klinik bir dile dönmesi — zanaat başarısızlığını değil. Ve düşük güvenilirlikli bir puan "henüz kanıtlanmamış" anlamına gelir, "zayıf olduğu kanıtlanmış" değil. Bir sayıyı her zaman örneklem büyüklüğüyle birlikte okuyun ve kitabınız için en iyi modelin, kitabınızın hangi eksenlere yaslandığına bağlı olduğunu unutmayın — tablonun bunları ayrı tutmasının tüm nedeni de budur.

Questions

Frequently asked

Novelmint, yapay zeka modellerini kurgu için nasıl kıyaslar?
Her öncü model, brifinge alınmış aynı roman sahnelerini yazar; kör ve sağlayıcı çeşitliliğine sahip güçlü jüri modellerinden oluşan bir panel, yazarı bilmeden elde edilen düzyazıyı dokuz eksende 0–100 arasında puanlar. Puanlar, arkasındaki veri miktarına göre tarafsız bir taban değere doğru küçültülür ve gözlemler zamanla yürüyen ortalamaya eklenir.
Dokuz eksen nedir?
Dört zanaat ekseni — edebi, diyalog, sadakat (brifinge uygunluk) ve tempo — modelin ne kadar iyi yazdığını ölçer. Beş içerik ekseni — duygu, fiziksellik (aksiyon), çatışma, romantizm ve erotizm — hangi tür sahneyi iyi yazdığını ölçer. Zanaat ve içerik ayrı ayrı raporlanır, hiçbir zaman ortalaması alınmaz.
Puanlar neden güvene göre ayarlanır?
Birkaç pasajdan elde edilen ham ortalama gürültüdür. Her puan, arkasındaki verinin azlığıyla orantılı biçimde tarafsız 70 taban değerine doğru küçültülür — beş gözlem değerinde bir önsel — böylece şanslı küçük bir örneklem zirveye ulaşamaz. Örneklem büyüklüğü gösterilir; altı gözlemden az olan hücreler geçici olarak işaretlenir.
Bu, OpenAI, Anthropic, Google veya xAI'ın resmi sıralaması mı?
Hayır. Bu, Novelmint tarafından yalnızca kurgu düzyazısı üzerinde, belirli bir model ve komut seti kullanılarak yapılan bağımsız bir ölçümdür. Akıl yürütme, doğruluk veya diğer yetenekler hakkında hiçbir şey söylemez; model adları ilgili sahiplerinin ticari markalarıdır.
Kıyaslama testi ne sıklıkla güncellenir?
Sürekli olarak — yeni jüri gözlemleri yürüyen ortalamaya eklenir ve örneklem sayıları artar, böylece tablo zamanla netleşir. Bir takma ad altındaki model sürümü değiştiğinde, hücreler eski sürümle harmanlanmak yerine sıfırlanıp yeniden ölçülür. Sayfada en son yeniden kalibrasyon tarihi gösterilir.

What this page does not claim

  • Puanlar, değerlendirilen model seti ve kullanılan komutlara görelidir — mutlak veya resmi bir derecelendirme değildir.
  • Düşük erotizm puanı istekliliği (modelin reddetmesi veya klinik kalması) yansıtır, beceri eksikliğini değil; düşük güven puanı "henüz kanıtlanmadı" anlamına gelir, "zayıf olduğu kanıtlandı" değil.
  • Kıyaslama testi yalnızca kurgu düzyazısını ölçer; akıl yürütme, kodlama, olgusal doğruluk veya yazarlık bağlamı dışındaki güvenlik hakkında hiçbir şey söylemez.

Hangi modelin senin tarzındaki sahneyi en iyi yazdığını gör.

Daha fazla düzyazı ölçüldükçe güncellenen, dokuz eksende canlı veriler.