कौन-सा AI मॉडल वास्तव में सबसे अच्छा फिक्शन लिखता है?
Live data · measured as of July 24, 2026
हर मॉडल कार्ड गणित, कोडिंग और तर्क को मापता है। कोई यह नहीं मापता कि मॉडल ऐसा दृश्य लिख सकता है जिसे पाठक स्किप न करे। इसलिए हमने वह बेंचमार्क बनाया जो यह करता है। एक ब्लाइंड जज पैनल फ्रंटियर मॉडलों द्वारा जनरेट किए गए वास्तविक उपन्यास प्रोज़ को नौ मानदंडों पर स्कोर करता है — चार craft के लिए, पाँच उन दृश्यों के प्रकारों के लिए जो एक किताब में वास्तव में होते हैं — और नीचे के नंबर लाइव परिणाम हैं। यह कोई मार्केटिंग चार्ट नहीं है: यह वही ग्रिड है जिसे Novelmint आपकी किताब के हर बीट के लिए मॉडल चुनने में उपयोग करता है।
Key takeaways
- यह बेंचमार्क Anthropic, OpenAI, Google और xAI के फ्रंटियर मॉडलों को वास्तविक जनरेटेड उपन्यास प्रोज़ पर स्कोर करता है — मल्टीपल-चॉइस टेस्ट पर नहीं — नौ मानदंडों पर: चार craft (literary, dialogue, fidelity, pacing) और पाँच content (emotion, physicality, conflict, romance, eroticism)।
- Craft मानदंड यह मापते हैं कि मॉडल कितनी अच्छी तरह लिखता है; content मानदंड यह मापते हैं कि वह किस प्रकार का दृश्य अच्छे से लिखता है। एक मॉडल की वाक्य-रचना सुंदर हो सकती है और फिर भी उसके fight scene सपाट हों — इसलिए दोनों को अलग रखा जाता है और कभी एक भ्रामक संख्या में औसत नहीं किया जाता।
- हर स्कोर को neutral 70 बेसलाइन की ओर confidence के आधार पर सिकोड़ा जाता है — उसके पीछे जितना कम डेटा, उतना अधिक सिकुड़ाव — ताकि तीन नमूनों का भाग्यशाली परिणाम कभी पक्की सच्चाई न बन सके। हर संख्या के पीछे का नमूना आकार दिखाया जाता है।
- कोई एक मॉडल सब कुछ नहीं जीतता। सबसे मजबूत literary craft, सबसे स्थिर fidelity, सबसे अच्छा एक्शन, और सबसे बेहतर रोमांस व एक्सप्लिसिट लेखन — सब अलग-अलग columns में हैं — यही तर्क है किसी एक मॉडल को चुनने की बजाय book को मॉडलों के बीच रूट करने का।
- यह वही ग्रिड है जिसे Novelmint एक chapter बनाते समय प्रति बीट मॉडल चुनने के लिए उपयोग करता है — और जो जज किसी passage को बिल्ड के दौरान स्कोर करता है वह इसे फीड करता है, इसलिए लेखकों के इंजन के साथ लिखने पर संख्याएँ अपडेट होती रहती हैं। यह एक लाइव तंत्र है, कोई पूर्वव्यापी दावा नहीं।
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
यह लाइव डेटा है, कोई एक-बार का टेस्ट नहीं
नीचे की तालिका कोई ऐसा बेंचमार्क नहीं है जिसे हमने एक बार चलाकर फ्रीज़ कर दिया। यह प्लेटफ़ॉर्म के scoring store का लाइव projection है: जो जज बिल्ड के दौरान किसी passage को रेट करता है वह इस ग्रिड को फीड करता है, इसलिए Novelmint पर लिखा हर chapter observations जोड़ता है, नमूना आकार बढ़ते हैं, और संख्याएँ तीक्ष्ण होती हैं। जैसे-जैसे अधिक लेखक इंजन के साथ बनाते हैं, बेंचमार्क अपडेट होता रहता है — ऊपर दी गई तारीख केवल सबसे हालिया recalibration है।
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
ग्रिड कैसे पढ़ें
headline नंबर overall craft है — मॉडल के चार execution axes का औसत, जो "इसका prose कितना अच्छा है" का सबसे करीबी माप है। दाईं ओर content axes बेहतर-या-खराब रैंकिंग नहीं हैं; वे बताते हैं कि मॉडल किसके लिए FIT है। उच्च physicality score का मतलब साफ एक्शन है; कम eroticism score आमतौर पर कमज़ोर लेखन नहीं बल्कि इनकार या clinical flatness दर्शाता है — skill नहीं, willingness। मॉडलों की तुलना के लिए column में नीचे craft पढ़ें, और एक मॉडल की ताकत-कमज़ोरी देखने के लिए row में across content पढ़ें।
Best AI for…
A straight answer for one kind of scene — or one genre
By what your scene needs
- साहित्यिक लेखन के लिए सर्वश्रेष्ठ AI
- संवाद लेखन के लिए सर्वश्रेष्ठ AI
- निर्देशों का पालन करने के लिए सर्वश्रेष्ठ AI
- गति के लिए सर्वश्रेष्ठ AI
- भावनात्मक दृश्यों के लिए सबसे अच्छा AI
- एक्शन दृश्यों के लिए सबसे अच्छा AI
- संघर्ष दृश्यों के लिए सबसे अच्छा AI
- रोमांस लिखने के लिए सर्वश्रेष्ठ AI
- स्पष्ट दृश्यों के लिए सर्वश्रेष्ठ AI
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
टेस्ट के जवाब नहीं, वास्तविक प्रोज़ जनरेट करें
हर मॉडल समान beats लिखता है — briefed दृश्य जिनमें आवश्यक तत्व, वर्जित जानकारी, एक दृष्टिकोण और एक नाटकीय लक्ष्य होता है — समान परिस्थितियों में। हम जो produce होता है उसे fiction की तरह स्कोर करते हैं, जैसे एक editor पढ़ता है — न कि quiz performance की तरह।
नौ मानदंडों पर ब्लाइंड स्कोर करें
एक जज पैनल हर passage को चार craft मानदंडों (literary, dialogue, fidelity, pacing) और पाँच content मानदंडों (emotion, physicality, conflict, romance, eroticism) पर 0–100 रेट करता है — बिना यह जाने कि किस मॉडल ने लिखा। Craft = execution quality; content = किसी दृश्य के लिए उपयुक्तता।
neutral prior की ओर सिकोड़ें
कुछ नमूनों का कच्चा औसत शोर है। हर cell को neutral 70 बेसलाइन की ओर उसके evidence की कमज़ोरी के अनुपात में खींचा जाता है, ताकि शुरुआती भाग्यशाली माप तब तक लगभग औसत लगे जब तक पर्याप्त observations उसे जगह न दिलाएँ। प्रकाशित संख्या यही shrunk value है; नमूना आकार उसके साथ दिखाया जाता है।
fold करते रहें, हाथ से कभी न बदलें
नए जज observations एक running mean में fold होते हैं और नमूना count बढ़ता है, इसलिए ग्रिड समय के साथ तीक्ष्ण होती है। संख्याएँ observations से regenerate होती हैं, हाथ से टाइप नहीं की जातीं, और जब किसी alias के नीचे मॉडल version बदलता है तो उसके cells दो अलग मॉडलों को मिलाने की बजाय clean re-measure के लिए reset हो जाते हैं।
Where this leads
इस तरह का बेंचमार्क क्यों काम करता है
एक दृश्य के लिए अलग मॉडल चुनना तभी काम करता है जब किताब discrete, briefed units में बनाई जाए — एक ही pass में नहीं। वह unit है beat, और जब अलग-अलग मॉडल अलग beats लिखते हैं तो कहानी को coherent रखना arc-and-entity memory का काम है जो बिल्ड के साथ चलती है। बेंचमार्क scoreboard है; beats और arc memory वह हैं जो किताब को इसका फायदा उठाने देते हैं।
Questions
Frequently asked
- कौन-सा AI मॉडल सबसे अच्छा फिक्शन लिखता है?
- overall craft — literary, dialogue, fidelity और pacing axes के औसत — के आधार पर, वास्तविक उपन्यास प्रोज़ पर, Claude Opus 4.8 फिलहाल आगे है, GPT-5.6 Sol उसके करीब है। लेकिन "सबसे अच्छा" दृश्य पर निर्भर करता है: एक्शन, रोमांस और एक्सप्लिसिट कंटेंट के सबसे ऊँचे स्कोर अलग-अलग मॉडलों के पास हैं। इस पेज की ग्रिड मौजूदा standings और हर नंबर के पीछे का नमूना आकार दिखाती है।
- यह बेंचमार्क कैसे मापा जाता है?
- हर मॉडल समान briefed beats समान परिस्थितियों में लिखता है, और एक ब्लाइंड जज पैनल उस prose को नौ मानदंडों पर 0–100 स्कोर करता है — चार craft (literary, dialogue, fidelity, pacing) और पाँच content type (emotion, physicality, conflict, romance, eroticism)। स्कोर को neutral 70 बेसलाइन की ओर confidence से सिकोड़ा जाता है ताकि पतला डेटा संख्या को न बिगाड़े, और नमूना count हर स्कोर के साथ दिखाया जाता है।
- craft axes और content axes में क्या अंतर है?
- Craft axes मापते हैं कि मॉडल कितना अच्छा लिखता है, विषय से स्वतंत्र — वाक्य गुणवत्ता, character voice, brief के प्रति निष्ठा, और pace का नियंत्रण। Content axes किसी दृश्य प्रकार के लिए उपयुक्तता मापते हैं: emotion, physical action, conflict, romance और explicit content। मॉडल सुंदर वाक्य लिख सकता है और फिर भी fight scene खराब तरीके से संभाल सकता है — इसलिए दोनों परिवारों को अलग स्कोर किया और दिखाया जाता है।
- एक सबसे अच्छा मॉडल चुनकर सब कुछ के लिए उपयोग क्यों न करें?
- क्योंकि कोई मॉडल हर axis नहीं जीतता। सबसे मजबूत literary craft, सबसे अच्छा एक्शन, और सबसे सक्षम रोमांस या explicit लेखन अलग-अलग मॉडलों के पास है। Novelmint किताब को beat-by-beat मॉडलों के बीच रूट करता है — bulk को एक series voice में coherence के लिए रखता है और specific beats पर मजबूत मॉडल को चुनता है — जो इस ग्रिड के होने से ही संभव है।
- कम स्कोर का मतलब मॉडल खराब है?
- ज़रूरी नहीं। कम content score का मतलब हो सकता है मॉडल सक्षम है पर इच्छुक नहीं — अधिकांश मॉडल eroticism पर कम स्कोर करते हैं क्योंकि वे इनकार करते हैं या clinical हो जाते हैं, skill की कमी नहीं। और कम-confidence स्कोर (कम नमूने) neutral बेसलाइन की ओर सिकुड़ा होता है, इसलिए वह "अभी साबित नहीं" पढ़ता है, "कमज़ोर साबित" नहीं। हमेशा स्कोर को उसके नमूना आकार के साथ पढ़ें।
- बेंचमार्क कितनी बार अपडेट होता है?
- लगातार। ग्रिड प्लेटफ़ॉर्म के scoring store का लाइव projection है: जो जज Novelmint के chapter बनाते समय किसी passage को रेट करता है वह अपने observations वापस fold करता है, इसलिए संख्याएँ लेखकों के उपयोग के साथ बदलती हैं और नमूना आकार बढ़ते हैं। पेज सबसे हालिया recalibration की तारीख दिखाता है। नए मॉडल versions को scratch से re-measure किया जाता है, पिछले मॉडल के साथ blend नहीं किया जाता — इसलिए version बदलने पर column चुपचाप खराब नहीं होता।
What this page does not claim
- यह बेंचमार्क केवल fiction के लिए prose quality और content fitness मापता है। यह मॉडल की reasoning, coding, maths, factual accuracy, या लेखन संदर्भ से बाहर की safety के बारे में कुछ नहीं कहता।
- स्कोर judged set और उपयोग किए गए prompts के सापेक्ष हैं — मॉडल providers द्वारा समर्थित कोई पूर्ण या आधिकारिक रेटिंग नहीं। मॉडल नाम और ट्रेडमार्क उनके respective owners के हैं।
- उच्च overall-craft score का मतलब यह नहीं कि मॉडल हर किताब के लिए सही है — voice, genre, content ज़रूरतें और लागत सब मायने रखते हैं, यही कारण है कि Novelmint किसी एक को नहीं चुनता बल्कि मॉडलों के बीच रूट करता है।
- कम-नमूना cells अस्थायी हैं। जहाँ किसी नंबर के पीछे कम observations हैं, उसे neutral बेसलाइन की ओर सिकोड़कर flagged किया जाता है, और यह और measurements fold होने पर बदलेगा।
संबंधित
एक्शन दृश्यों के लिए सबसे अच्छा AI
कौन सा AI लड़ाई या पीछा करने के दृश्य को स्पष्ट और ठोस रखता है, अस्पष्ट नहीं। भौतिकता के आधार पर रैंक किया गया।
संघर्ष दृश्यों के लिए सबसे अच्छा AI
कौन सा AI किसी बहस या गतिरोध को तनावपूर्ण और बढ़ता हुआ रखता है। मापे गए संघर्ष के आधार पर रैंक किया गया।
भावनात्मक दृश्यों के लिए सबसे अच्छा AI
कौन सा AI भावना-प्रधान दृश्य को बस बताने की बजाय असल में महसूस कराता है। भावना के आधार पर रैंक किया गया।
स्पष्ट दृश्यों के लिए सर्वश्रेष्ठ AI
कौन सा AI वास्तव में स्पष्ट वयस्क सामग्री लिखेगा — और कौन मना कर देगा। इच्छाशक्ति के आधार पर रैंक किया गया।
अंदाज़ लगाना बंद करें। किताब को चुनने दें।
Novelmint हर beat को उस मॉडल पर रूट करता है जिसे यह ग्रिड सबसे उपयुक्त बताती है। आपका पहला chapter मुफ़्त है।