कार्यपद्धति

फिक्शन मॉडल बेंचमार्क कैसे काम करता है

Updated July 23, 2026 · 6 मिनट पढ़ें

यह बेंचमार्क वह एक चीज़ मापता है जो मॉडल कार्ड कभी नहीं मापते: क्या कोई मॉडल ऐसा दृश्य लिख सकता है जिसे पाठक स्किप न करे। यह पेज बताता है कि संख्याएँ कैसे तैयार होती हैं — क्या मापा जाता है, मॉडलों को कैसे जज किया जाता है, स्कोर कॉन्फिडेंस के अनुसार क्यों श्रिंक होते हैं, और ग्रिड को कैसे अपडेट रखा जाता है — ताकि आप परिणामों को स्वयं परख सकें और सटीक रूप से उद्धृत कर सकें।

Key takeaways

  • फ्रंटियर मॉडल एक ही ब्रीफ किए गए नॉवेल बीट्स लिखते हैं, और एक ब्लाइंड, प्रोवाइडर-डाइवर्स जज पैनल यह जाने बिना कि किस मॉडल ने लिखा है, नौ आयामों पर प्रोज़ को 0–100 स्कोर देता है।
  • नौ आयाम दो परिवारों में: चार क्राफ्ट (साहित्यिक, संवाद, निष्ठा, गति) मापते हैं कि मॉडल कितना अच्छा लिखता है; पाँच कंटेंट (भावना, भौतिकता, संघर्ष, रोमांस, कामुकता) मापते हैं कि वह किस तरह का दृश्य अच्छा लिखता है। इन्हें कभी एक साथ औसत नहीं किया जाता।
  • हर स्कोर को न्यूट्रल 70 बेसलाइन की ओर इस अनुपात में श्रिंक किया जाता है कि उसके पीछे कितना कम डेटा है (पाँच ऑब्ज़र्वेशन के बराबर एक प्रायर), ताकि एक भाग्यशाली छोटा सैंपल शीर्ष तक न पहुँच सके। सैंपल साइज़ दिखाए जाते हैं; कमज़ोर सेल को फ्लैग किया जाता है।
  • ग्रिड लाइव है — नए जज ऑब्ज़र्वेशन समय के साथ रनिंग मीन में जुड़ते जाते हैं, और किसी मॉडल का वर्शन बदलने पर उसके सेल रीसेट होकर फिर से मापे जाते हैं, न कि पुराने वर्शन से मिलाए जाते हैं।
  • स्कोर केवल फिक्शन बीट्स पर प्रोज़ का वर्णन करते हैं; ये एक स्वतंत्र माप हैं, न कि कोई आधिकारिक प्रोवाइडर रेटिंग, और कम कामुकता स्कोर आमतौर पर इच्छाशक्ति को दर्शाता है, क्राफ्ट को नहीं।

Novelmint फिक्शन बेंचमार्क वह एकमात्र चीज़ मापता है जो मॉडल कार्ड कभी नहीं मापते: क्या कोई मॉडल ऐसा दृश्य लिख सकता है जिसे पाठक छोड़ना न चाहे। यह गणित या कोडिंग परीक्षणों से उधार लिया गया लीडरबोर्ड नहीं है — यह वास्तविक उपन्यास-गद्य को अंक देता है। यहाँ बताया गया है कि संख्याएँ ठीक किस तरह तैयार की जाती हैं, ताकि आप उन्हें खुद परख सकें और आत्मविश्वास के साथ उद्धृत कर सकें।

यह क्या मापता है

बेंचमार्क यह अंकित करता है कि अग्रणी मॉडल — Anthropic, OpenAI, Google और xAI के — फिक्शन कितनी अच्छी तरह लिखते हैं। यह नहीं कि वे कैसे तर्क करते हैं, कैसे कोड करते हैं, या बहुविकल्पीय परीक्षणों में कैसा प्रदर्शन करते हैं। प्रत्येक मॉडल को समान रूप से ब्रीफ किए गए उपन्यास-बीट्स दिए जाते हैं — ऐसे दृश्य जिनमें आवश्यक तत्व, वर्जित ज्ञान, एक दृष्टिकोण और एक नाटकीय लक्ष्य होता है — और जो वे लिखते हैं उसे फिक्शन की तरह आँका जाता है, ठीक वैसे जैसे एक संपादक पढ़ता है।

सब कुछ प्रत्येक अक्ष पर 0–100 के एकल पैमाने पर व्यक्त किया जाता है, इसलिए संख्याएँ मॉडलों के बीच और उन दृश्यों के प्रकारों के बीच सीधे तुलनीय हैं जिनसे एक पुस्तक वास्तव में बनती है।

नौ अक्ष

फिक्शन एक ही कौशल नहीं है, इसलिए बेंचमार्क इसे एक संख्या में समेट नहीं देता। यह नौ अक्षों को अंक देता है, जो दो परिवारों में विभाजित हैं जिनके अलग-अलग अर्थ हैं।

चार शिल्प अक्ष यह मापते हैं कि एक मॉडल कितनी अच्छी तरह लिखता है, विषय से स्वतंत्र रूप से: literary (वाक्य-स्तरीय बिम्ब, लय, उपाठ, संयम), dialogue (क्या पात्र अलग-अलग व्यक्तियों की तरह बोलते हैं), fidelity (यह कितनी विश्वसनीयता से ब्रीफ किए गए बीट को प्रस्तुत करता है, आवश्यक तत्वों को बनाए रखते हुए और वर्जित ज्ञान को बाहर रखते हुए), और pacing (गति का नियंत्रण — कब संक्षिप्त करना है, कब ठहरना है)।

पाँच content अक्ष यह मापते हैं कि एक मॉडल किस प्रकार का दृश्य अच्छी तरह लिखता है: emotion, physicality (क्रिया और अंतरिक्ष में शरीर), conflict, romance, और eroticism (स्पष्ट वयस्क सामग्री)। ये बेहतर-या-बदतर रैंकिंग नहीं हैं — ये बताते हैं कि एक मॉडल किसके लिए उपयुक्त है। एक मॉडल के पास सुंदर वाक्य हो सकते हैं और फिर भी वह सपाट लड़ाई के दृश्य लिख सकता है, इसीलिए शिल्प और सामग्री को अलग-अलग अंकित और रिपोर्ट किया जाता है और कभी भी एकल भ्रामक आंकड़े में औसत नहीं किया जाता।

प्रत्येक मॉडल को कैसे अंकित किया जाता है

अंकन अंध सहकर्मी-समीक्षा है। प्रत्येक मॉडल समान ब्रीफ किए गए बीट्स का समूह लिखता है, और प्रदाता-विविध न्यायाधीश मॉडलों का एक पैनल प्रत्येक अनुच्छेद को प्रत्येक अक्ष पर 0–100 के पैमाने पर रेटिंग देता है — यह जाने बिना कि किस मॉडल ने इसे लिखा, और अपने स्वयं के काम का कभी मूल्यांकन किए बिना। प्रदाता-विविध पैनल मायने रखता है: किसी मॉडल के अपने परिवार के बाहर का न्यायाधीश उन संकेतों को पकड़ता है जिन्हें वह परिवार प्रायः पुरस्कृत करता है।

चूँकि निर्णय अंध और क्रॉस-मॉडल है, इसलिए कोई मॉडल स्वयं की चापलूसी नहीं कर सकता, और कोई एकल गृह-शैली मानक नहीं तय करती।

न्यायाधीश पूर्वाग्रह को नियंत्रित करना

निर्णय के लिए मॉडलों का उपयोग करने से चार प्रसिद्ध विफलता-मोड उत्पन्न होते हैं, और विधि प्रत्येक को बंद करने के लिए बनाई गई है।

स्व-वरीयता — एक मॉडल अपनी गृह-शैली को पुरस्कृत करता है। दो नियम इसे हटाते हैं: एक मॉडल कभी भी अपने अनुच्छेद को अंक नहीं देता, और न्यायाधीश पैनल प्रदाता-विविध है, इसलिए कोई एकल परिवार की रुचि मानक नहीं तय करती। एक संकेत जिसे एक घर पुरस्कृत करता है, दूसरे के न्यायाधीश द्वारा पकड़ा जाता है, और इसके विपरीत भी।

वाचालता — न्यायाधीश भरोसेमंद ढंग से लंबाई को अधिक पुरस्कृत करते हैं। प्रत्येक बीट समान लक्ष्य — लगभग 220 शब्द — ब्रीफ करता है, इसलिए सभी अनुच्छेद लगभग समान आकार में आते हैं और भराव से कुछ नहीं मिलता। एक मॉडल उन शब्दों के साथ क्या करता है उस पर अपना अंक अर्जित करता है, न कि इस पर कि वह कितने खर्च करता है।

स्थिति — अनुच्छेद जिस क्रम में दिखाई देते हैं, वे अंकों को जो पहले आया उसकी ओर धकेल सकते हैं। इसलिए प्रत्येक बीट के लिए अनुच्छेदों को पुनर्नामांकित और फेरबदल किया जाता है, और प्रत्येक को एक निश्चित रूब्रिक के विरुद्ध आमने-सामने रैंक करने के बजाय स्वतंत्र रूप से अंकित किया जाता है। क्रम कोई संकेत नहीं देता, और कोई भी अवशिष्ट बदलाव कई बीट्स और कई न्यायाधीशों में औसत हो जाता है।

नमूनाकरण — एक भाग्यशाली ड्राफ्ट एक मॉडल की तारीफ कर सकता है। जनरेशन प्रत्येक मॉडल के डिफ़ॉल्ट तापमान पर एक समान प्रॉम्प्ट के साथ चलता है, बिना किसी प्रति-मॉडल ट्यूनिंग के, इसलिए किसी मॉडल को चेरी-पिक की गई सेटिंग नहीं दी जाती जो दूसरों को नहीं मिलती। और कोई भी सेल एक ड्राफ्ट पर नहीं टिकता: प्रत्येक मॉडल को पैनल के हर दूसरे मॉडल द्वारा पूरे बीट सेट में अंकित किया जाता है, फिर तब तक तटस्थ आधार रेखा की ओर सिकोड़ा जाता है जब तक पर्याप्त माप एकत्र न हो जाएँ — इसलिए एकल-ड्राफ्ट भाग्य संख्या प्रकाशित होने से बहुत पहले धुल जाता है।

स्कोर को विश्वास के अनुसार क्यों सिकोड़ा जाता है

मुट्ठी भर अनुच्छेदों से प्राप्त कच्चा औसत शोर है, और शोर जो स्कोर के रूप में सजाया गया हो, बिना स्कोर के होने से भी बदतर है। इसलिए प्रत्येक प्रकाशित संख्या को उसके पीछे कितना कम डेटा है, उसके अनुपात में 70 के तटस्थ आधार की ओर सिकोड़ा जाता है — औपचारिक रूप से, पाँच अवलोकनों के मूल्य का एक पूर्व-धारणा। तीन भाग्यशाली नमूनों द्वारा समर्थित एक सेल लगभग औसत के रूप में पढ़ा जाता है जब तक पर्याप्त माप उसे एक स्थान न दिला दें; सैकड़ों द्वारा समर्थित एक सेल अपने वास्तविक मापे गए मूल्य के रूप में पढ़ा जाता है।

प्रत्येक संख्या के पीछे का नमूना आकार दिखाया जाता है, और जो भी सेल अभी भी छह से कम अवलोकनों पर टिकी है उसे अनंतिम के रूप में चिह्नित किया जाता है। यही कारण है कि पतले डेटा वाला कोई मॉडल कभी भी एक संयोग से शीर्ष पर नहीं पहुँच जाता — विधि इसे नहीं होने देती।

ग्रिड कैसे अद्यतन रहता है

बेंचमार्क एक बार का परीक्षण नहीं है जो चलाया गया और जमा दिया गया। यह उस स्कोरिंग स्टोर का एक जीवंत प्रक्षेपण है जिस पर प्लेटफ़ॉर्म चलता है: नए न्यायाधीश अवलोकन एक चालू माध्य में जुड़ते रहते हैं, और प्रत्येक सेल की नमूना संख्या समय के साथ बढ़ती है, इसलिए ग्रिड पुराना होने के बजाय तीखा होता जाता है। पृष्ठ हमेशा सबसे हालिया पुनर्अंशांकन की तारीख दिखाता है।

सटीकता के लिए एक सुरक्षा उपाय मायने रखता है। जब कोई स्थायी उपनाम (एक "latest" पॉइंटर) चुपचाप किसी नए अंतर्निहित मॉडल पर पुनर्निर्देशित होता है, तो उस मॉडल की सेलें रीसेट की जाती हैं और शुरू से फिर से मापी जाती हैं, न कि उस मॉडल के साथ मिश्रित की जाती हैं जिसे उन्होंने प्रतिस्थापित किया — इसलिए संस्करण परिवर्तन कभी चुपचाप एक कॉलम को दूषित नहीं करता। यही कारण है कि बेंचमार्क एक सामान्य लेबल के बजाय उस विशिष्ट संस्करण का नाम लेता है जिसे उसने मापा।

सीमाएँ

अंक केवल फिक्शन बीट्स पर गद्य का वर्णन करते हैं, जो मॉडलों और प्रॉम्प्ट के इस समूह के विरुद्ध आंके गए हैं। ये मॉडल प्रदाताओं द्वारा समर्थित आधिकारिक रेटिंग नहीं हैं, और ये लेखन संदर्भ के बाहर किसी मॉडल के तर्क, सटीकता या सुरक्षा के बारे में कुछ नहीं कहते। मॉडल नाम और ट्रेडमार्क उनके संबंधित स्वामियों के हैं; यह एक स्वतंत्र माप है।

दो पाठ गलत करना आसान है। कम eroticism स्कोर आमतौर पर इच्छाशक्ति को दर्शाता है — एक मॉडल का मना करना या नैदानिक हो जाना — न कि शिल्प की विफलता। और कम-विश्वास स्कोर का अर्थ है "अभी तक सिद्ध नहीं", न कि "कमज़ोर साबित"। हमेशा किसी संख्या को उसके नमूना आकार के साथ पढ़ें, और याद रखें कि आपकी पुस्तक के लिए सबसे अच्छा मॉडल इस बात पर निर्भर करता है कि आपकी पुस्तक किन अक्षों पर झुकती है — और यही पूरा कारण है कि ग्रिड उन्हें अलग रखता है।

Questions

Frequently asked

Novelmint AI मॉडलों को फिक्शन के लिए कैसे बेंचमार्क करता है?
हर फ्रंटियर मॉडल एक ही ब्रीफ किए गए नॉवेल बीट्स लिखता है, और मज़बूत जज मॉडलों का एक ब्लाइंड, प्रोवाइडर-डाइवर्स पैनल लेखक की पहचान जाने बिना नौ आयामों पर प्रोज़ को 0–100 स्कोर देता है। स्कोर को डेटा की मात्रा के अनुसार न्यूट्रल बेसलाइन की ओर श्रिंक किया जाता है, और ऑब्ज़र्वेशन समय के साथ रनिंग मीन में जुड़ते जाते हैं।
नौ आयाम कौन से हैं?
चार क्राफ्ट आयाम — साहित्यिक, संवाद, निष्ठा (ब्रीफ के प्रति), और गति — मापते हैं कि मॉडल कितना अच्छा लिखता है। पाँच कंटेंट आयाम — भावना, भौतिकता (एक्शन), संघर्ष, रोमांस, और कामुकता — मापते हैं कि वह किस तरह का दृश्य अच्छा लिखता है। क्राफ्ट और कंटेंट अलग-अलग रिपोर्ट किए जाते हैं, कभी औसत नहीं।
स्कोर को कॉन्फिडेंस के लिए क्यों एडजस्ट किया जाता है?
कुछ अंशों का कच्चा औसत केवल शोर है। हर स्कोर को न्यूट्रल 70 बेसलाइन की ओर इस अनुपात में श्रिंक किया जाता है कि उसके पीछे कितना कम डेटा है — पाँच ऑब्ज़र्वेशन के बराबर एक प्रायर — ताकि एक भाग्यशाली छोटा सैंपल शीर्ष तक न पहुँच सके। सैंपल साइज़ दिखाया जाता है, और छह से कम ऑब्ज़र्वेशन वाले सेल को अनंतिम के रूप में फ्लैग किया जाता है।
क्या यह OpenAI, Anthropic, Google, या xAI की आधिकारिक रैंकिंग है?
नहीं। यह Novelmint का एक स्वतंत्र माप है, केवल फिक्शन प्रोज़ पर, इस मॉडल और प्रॉम्प्ट सेट के विरुद्ध जज किया गया। यह तर्क, सटीकता, या अन्य क्षमताओं के बारे में कुछ नहीं कहता, और मॉडल नाम उनके संबंधित स्वामियों के ट्रेडमार्क हैं।
बेंचमार्क कितनी बार अपडेट होता है?
लगातार — नए जज ऑब्ज़र्वेशन रनिंग मीन में जुड़ते हैं और सैंपल काउंट बढ़ते हैं, इसलिए ग्रिड समय के साथ और सटीक होता जाता है। जब किसी उपनाम के तहत मॉडल वर्शन बदलता है, तो उसके सेल रीसेट होकर फिर से मापे जाते हैं, न कि पुराने वर्शन से मिलाए जाते हैं। पेज पर सबसे हालिया रीकैलिब्रेशन की तारीख दिखाई जाती है।

What this page does not claim

  • स्कोर जज किए गए मॉडल सेट और उपयोग किए गए प्रॉम्प्ट के सापेक्ष हैं — न कि कोई निरपेक्ष या आधिकारिक रेटिंग।
  • कम कामुकता स्कोर इच्छाशक्ति को दर्शाता है (मॉडल का मना करना या क्लिनिकल हो जाना), क्राफ्ट की कमी को नहीं; कम-कॉन्फिडेंस स्कोर का अर्थ है "अभी साबित नहीं हुआ", न कि "कमज़ोर साबित हुआ"।
  • बेंचमार्क केवल फिक्शन प्रोज़ मापता है और लेखन संदर्भ के बाहर तर्क, कोडिंग, तथ्यात्मक सटीकता, या सुरक्षा के बारे में कुछ नहीं कहता।

देखें कि कौन सा मॉडल आपके जैसे दृश्य सबसे अच्छा लिखता है।

नौ आयामों पर लाइव डेटा, जैसे-जैसे अधिक प्रोज़ मापा जाता है अपडेट होता है।