फिक्शन मॉडल बेंचमार्क

कौन-सा AI मॉडल वास्तव में सबसे अच्छा फिक्शन लिखता है?

Live data · measured as of July 24, 2026

हर मॉडल कार्ड गणित, कोडिंग और तर्क को मापता है। कोई यह नहीं मापता कि मॉडल ऐसा दृश्य लिख सकता है जिसे पाठक स्किप न करे। इसलिए हमने वह बेंचमार्क बनाया जो यह करता है। एक ब्लाइंड जज पैनल फ्रंटियर मॉडलों द्वारा जनरेट किए गए वास्तविक उपन्यास प्रोज़ को नौ मानदंडों पर स्कोर करता है — चार craft के लिए, पाँच उन दृश्यों के प्रकारों के लिए जो एक किताब में वास्तव में होते हैं — और नीचे के नंबर लाइव परिणाम हैं। यह कोई मार्केटिंग चार्ट नहीं है: यह वही ग्रिड है जिसे Novelmint आपकी किताब के हर बीट के लिए मॉडल चुनने में उपयोग करता है।

Key takeaways

  • यह बेंचमार्क Anthropic, OpenAI, Google और xAI के फ्रंटियर मॉडलों को वास्तविक जनरेटेड उपन्यास प्रोज़ पर स्कोर करता है — मल्टीपल-चॉइस टेस्ट पर नहीं — नौ मानदंडों पर: चार craft (literary, dialogue, fidelity, pacing) और पाँच content (emotion, physicality, conflict, romance, eroticism)।
  • Craft मानदंड यह मापते हैं कि मॉडल कितनी अच्छी तरह लिखता है; content मानदंड यह मापते हैं कि वह किस प्रकार का दृश्य अच्छे से लिखता है। एक मॉडल की वाक्य-रचना सुंदर हो सकती है और फिर भी उसके fight scene सपाट हों — इसलिए दोनों को अलग रखा जाता है और कभी एक भ्रामक संख्या में औसत नहीं किया जाता।
  • हर स्कोर को neutral 70 बेसलाइन की ओर confidence के आधार पर सिकोड़ा जाता है — उसके पीछे जितना कम डेटा, उतना अधिक सिकुड़ाव — ताकि तीन नमूनों का भाग्यशाली परिणाम कभी पक्की सच्चाई न बन सके। हर संख्या के पीछे का नमूना आकार दिखाया जाता है।
  • कोई एक मॉडल सब कुछ नहीं जीतता। सबसे मजबूत literary craft, सबसे स्थिर fidelity, सबसे अच्छा एक्शन, और सबसे बेहतर रोमांस व एक्सप्लिसिट लेखन — सब अलग-अलग columns में हैं — यही तर्क है किसी एक मॉडल को चुनने की बजाय book को मॉडलों के बीच रूट करने का।
  • यह वही ग्रिड है जिसे Novelmint एक chapter बनाते समय प्रति बीट मॉडल चुनने के लिए उपयोग करता है — और जो जज किसी passage को बिल्ड के दौरान स्कोर करता है वह इसे फीड करता है, इसलिए लेखकों के इंजन के साथ लिखने पर संख्याएँ अपडेट होती रहती हैं। यह एक लाइव तंत्र है, कोई पूर्वव्यापी दावा नहीं।

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

यह लाइव डेटा है, कोई एक-बार का टेस्ट नहीं

नीचे की तालिका कोई ऐसा बेंचमार्क नहीं है जिसे हमने एक बार चलाकर फ्रीज़ कर दिया। यह प्लेटफ़ॉर्म के scoring store का लाइव projection है: जो जज बिल्ड के दौरान किसी passage को रेट करता है वह इस ग्रिड को फीड करता है, इसलिए Novelmint पर लिखा हर chapter observations जोड़ता है, नमूना आकार बढ़ते हैं, और संख्याएँ तीक्ष्ण होती हैं। जैसे-जैसे अधिक लेखक इंजन के साथ बनाते हैं, बेंचमार्क अपडेट होता रहता है — ऊपर दी गई तारीख केवल सबसे हालिया recalibration है।

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

ग्रिड कैसे पढ़ें

headline नंबर overall craft है — मॉडल के चार execution axes का औसत, जो "इसका prose कितना अच्छा है" का सबसे करीबी माप है। दाईं ओर content axes बेहतर-या-खराब रैंकिंग नहीं हैं; वे बताते हैं कि मॉडल किसके लिए FIT है। उच्च physicality score का मतलब साफ एक्शन है; कम eroticism score आमतौर पर कमज़ोर लेखन नहीं बल्कि इनकार या clinical flatness दर्शाता है — skill नहीं, willingness। मॉडलों की तुलना के लिए column में नीचे craft पढ़ें, और एक मॉडल की ताकत-कमज़ोरी देखने के लिए row में across content पढ़ें।

Best AI for…

A straight answer for one kind of scene — or one genre

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

टेस्ट के जवाब नहीं, वास्तविक प्रोज़ जनरेट करें

हर मॉडल समान beats लिखता है — briefed दृश्य जिनमें आवश्यक तत्व, वर्जित जानकारी, एक दृष्टिकोण और एक नाटकीय लक्ष्य होता है — समान परिस्थितियों में। हम जो produce होता है उसे fiction की तरह स्कोर करते हैं, जैसे एक editor पढ़ता है — न कि quiz performance की तरह।

02

नौ मानदंडों पर ब्लाइंड स्कोर करें

एक जज पैनल हर passage को चार craft मानदंडों (literary, dialogue, fidelity, pacing) और पाँच content मानदंडों (emotion, physicality, conflict, romance, eroticism) पर 0–100 रेट करता है — बिना यह जाने कि किस मॉडल ने लिखा। Craft = execution quality; content = किसी दृश्य के लिए उपयुक्तता।

03

neutral prior की ओर सिकोड़ें

कुछ नमूनों का कच्चा औसत शोर है। हर cell को neutral 70 बेसलाइन की ओर उसके evidence की कमज़ोरी के अनुपात में खींचा जाता है, ताकि शुरुआती भाग्यशाली माप तब तक लगभग औसत लगे जब तक पर्याप्त observations उसे जगह न दिलाएँ। प्रकाशित संख्या यही shrunk value है; नमूना आकार उसके साथ दिखाया जाता है।

04

fold करते रहें, हाथ से कभी न बदलें

नए जज observations एक running mean में fold होते हैं और नमूना count बढ़ता है, इसलिए ग्रिड समय के साथ तीक्ष्ण होती है। संख्याएँ observations से regenerate होती हैं, हाथ से टाइप नहीं की जातीं, और जब किसी alias के नीचे मॉडल version बदलता है तो उसके cells दो अलग मॉडलों को मिलाने की बजाय clean re-measure के लिए reset हो जाते हैं।

Where this leads

इस तरह का बेंचमार्क क्यों काम करता है

एक दृश्य के लिए अलग मॉडल चुनना तभी काम करता है जब किताब discrete, briefed units में बनाई जाए — एक ही pass में नहीं। वह unit है beat, और जब अलग-अलग मॉडल अलग beats लिखते हैं तो कहानी को coherent रखना arc-and-entity memory का काम है जो बिल्ड के साथ चलती है। बेंचमार्क scoreboard है; beats और arc memory वह हैं जो किताब को इसका फायदा उठाने देते हैं।

Questions

Frequently asked

कौन-सा AI मॉडल सबसे अच्छा फिक्शन लिखता है?
overall craft — literary, dialogue, fidelity और pacing axes के औसत — के आधार पर, वास्तविक उपन्यास प्रोज़ पर, Claude Opus 4.8 फिलहाल आगे है, GPT-5.6 Sol उसके करीब है। लेकिन "सबसे अच्छा" दृश्य पर निर्भर करता है: एक्शन, रोमांस और एक्सप्लिसिट कंटेंट के सबसे ऊँचे स्कोर अलग-अलग मॉडलों के पास हैं। इस पेज की ग्रिड मौजूदा standings और हर नंबर के पीछे का नमूना आकार दिखाती है।
यह बेंचमार्क कैसे मापा जाता है?
हर मॉडल समान briefed beats समान परिस्थितियों में लिखता है, और एक ब्लाइंड जज पैनल उस prose को नौ मानदंडों पर 0–100 स्कोर करता है — चार craft (literary, dialogue, fidelity, pacing) और पाँच content type (emotion, physicality, conflict, romance, eroticism)। स्कोर को neutral 70 बेसलाइन की ओर confidence से सिकोड़ा जाता है ताकि पतला डेटा संख्या को न बिगाड़े, और नमूना count हर स्कोर के साथ दिखाया जाता है।
craft axes और content axes में क्या अंतर है?
Craft axes मापते हैं कि मॉडल कितना अच्छा लिखता है, विषय से स्वतंत्र — वाक्य गुणवत्ता, character voice, brief के प्रति निष्ठा, और pace का नियंत्रण। Content axes किसी दृश्य प्रकार के लिए उपयुक्तता मापते हैं: emotion, physical action, conflict, romance और explicit content। मॉडल सुंदर वाक्य लिख सकता है और फिर भी fight scene खराब तरीके से संभाल सकता है — इसलिए दोनों परिवारों को अलग स्कोर किया और दिखाया जाता है।
एक सबसे अच्छा मॉडल चुनकर सब कुछ के लिए उपयोग क्यों न करें?
क्योंकि कोई मॉडल हर axis नहीं जीतता। सबसे मजबूत literary craft, सबसे अच्छा एक्शन, और सबसे सक्षम रोमांस या explicit लेखन अलग-अलग मॉडलों के पास है। Novelmint किताब को beat-by-beat मॉडलों के बीच रूट करता है — bulk को एक series voice में coherence के लिए रखता है और specific beats पर मजबूत मॉडल को चुनता है — जो इस ग्रिड के होने से ही संभव है।
कम स्कोर का मतलब मॉडल खराब है?
ज़रूरी नहीं। कम content score का मतलब हो सकता है मॉडल सक्षम है पर इच्छुक नहीं — अधिकांश मॉडल eroticism पर कम स्कोर करते हैं क्योंकि वे इनकार करते हैं या clinical हो जाते हैं, skill की कमी नहीं। और कम-confidence स्कोर (कम नमूने) neutral बेसलाइन की ओर सिकुड़ा होता है, इसलिए वह "अभी साबित नहीं" पढ़ता है, "कमज़ोर साबित" नहीं। हमेशा स्कोर को उसके नमूना आकार के साथ पढ़ें।
बेंचमार्क कितनी बार अपडेट होता है?
लगातार। ग्रिड प्लेटफ़ॉर्म के scoring store का लाइव projection है: जो जज Novelmint के chapter बनाते समय किसी passage को रेट करता है वह अपने observations वापस fold करता है, इसलिए संख्याएँ लेखकों के उपयोग के साथ बदलती हैं और नमूना आकार बढ़ते हैं। पेज सबसे हालिया recalibration की तारीख दिखाता है। नए मॉडल versions को scratch से re-measure किया जाता है, पिछले मॉडल के साथ blend नहीं किया जाता — इसलिए version बदलने पर column चुपचाप खराब नहीं होता।

What this page does not claim

  • यह बेंचमार्क केवल fiction के लिए prose quality और content fitness मापता है। यह मॉडल की reasoning, coding, maths, factual accuracy, या लेखन संदर्भ से बाहर की safety के बारे में कुछ नहीं कहता।
  • स्कोर judged set और उपयोग किए गए prompts के सापेक्ष हैं — मॉडल providers द्वारा समर्थित कोई पूर्ण या आधिकारिक रेटिंग नहीं। मॉडल नाम और ट्रेडमार्क उनके respective owners के हैं।
  • उच्च overall-craft score का मतलब यह नहीं कि मॉडल हर किताब के लिए सही है — voice, genre, content ज़रूरतें और लागत सब मायने रखते हैं, यही कारण है कि Novelmint किसी एक को नहीं चुनता बल्कि मॉडलों के बीच रूट करता है।
  • कम-नमूना cells अस्थायी हैं। जहाँ किसी नंबर के पीछे कम observations हैं, उसे neutral बेसलाइन की ओर सिकोड़कर flagged किया जाता है, और यह और measurements fold होने पर बदलेगा।

अंदाज़ लगाना बंद करें। किताब को चुनने दें।

Novelmint हर beat को उस मॉडल पर रूट करता है जिसे यह ग्रिड सबसे उपयुक्त बताती है। आपका पहला chapter मुफ़्त है।