Novelmint फिक्शन बेंचमार्क वह एकमात्र चीज़ मापता है जो मॉडल कार्ड कभी नहीं मापते: क्या कोई मॉडल ऐसा दृश्य लिख सकता है जिसे पाठक छोड़ना न चाहे। यह गणित या कोडिंग परीक्षणों से उधार लिया गया लीडरबोर्ड नहीं है — यह वास्तविक उपन्यास-गद्य को अंक देता है। यहाँ बताया गया है कि संख्याएँ ठीक किस तरह तैयार की जाती हैं, ताकि आप उन्हें खुद परख सकें और आत्मविश्वास के साथ उद्धृत कर सकें।
यह क्या मापता है
बेंचमार्क यह अंकित करता है कि अग्रणी मॉडल — Anthropic, OpenAI, Google और xAI के — फिक्शन कितनी अच्छी तरह लिखते हैं। यह नहीं कि वे कैसे तर्क करते हैं, कैसे कोड करते हैं, या बहुविकल्पीय परीक्षणों में कैसा प्रदर्शन करते हैं। प्रत्येक मॉडल को समान रूप से ब्रीफ किए गए उपन्यास-बीट्स दिए जाते हैं — ऐसे दृश्य जिनमें आवश्यक तत्व, वर्जित ज्ञान, एक दृष्टिकोण और एक नाटकीय लक्ष्य होता है — और जो वे लिखते हैं उसे फिक्शन की तरह आँका जाता है, ठीक वैसे जैसे एक संपादक पढ़ता है।
सब कुछ प्रत्येक अक्ष पर 0–100 के एकल पैमाने पर व्यक्त किया जाता है, इसलिए संख्याएँ मॉडलों के बीच और उन दृश्यों के प्रकारों के बीच सीधे तुलनीय हैं जिनसे एक पुस्तक वास्तव में बनती है।
नौ अक्ष
फिक्शन एक ही कौशल नहीं है, इसलिए बेंचमार्क इसे एक संख्या में समेट नहीं देता। यह नौ अक्षों को अंक देता है, जो दो परिवारों में विभाजित हैं जिनके अलग-अलग अर्थ हैं।
चार शिल्प अक्ष यह मापते हैं कि एक मॉडल कितनी अच्छी तरह लिखता है, विषय से स्वतंत्र रूप से: literary (वाक्य-स्तरीय बिम्ब, लय, उपाठ, संयम), dialogue (क्या पात्र अलग-अलग व्यक्तियों की तरह बोलते हैं), fidelity (यह कितनी विश्वसनीयता से ब्रीफ किए गए बीट को प्रस्तुत करता है, आवश्यक तत्वों को बनाए रखते हुए और वर्जित ज्ञान को बाहर रखते हुए), और pacing (गति का नियंत्रण — कब संक्षिप्त करना है, कब ठहरना है)।
पाँच content अक्ष यह मापते हैं कि एक मॉडल किस प्रकार का दृश्य अच्छी तरह लिखता है: emotion, physicality (क्रिया और अंतरिक्ष में शरीर), conflict, romance, और eroticism (स्पष्ट वयस्क सामग्री)। ये बेहतर-या-बदतर रैंकिंग नहीं हैं — ये बताते हैं कि एक मॉडल किसके लिए उपयुक्त है। एक मॉडल के पास सुंदर वाक्य हो सकते हैं और फिर भी वह सपाट लड़ाई के दृश्य लिख सकता है, इसीलिए शिल्प और सामग्री को अलग-अलग अंकित और रिपोर्ट किया जाता है और कभी भी एकल भ्रामक आंकड़े में औसत नहीं किया जाता।
प्रत्येक मॉडल को कैसे अंकित किया जाता है
अंकन अंध सहकर्मी-समीक्षा है। प्रत्येक मॉडल समान ब्रीफ किए गए बीट्स का समूह लिखता है, और प्रदाता-विविध न्यायाधीश मॉडलों का एक पैनल प्रत्येक अनुच्छेद को प्रत्येक अक्ष पर 0–100 के पैमाने पर रेटिंग देता है — यह जाने बिना कि किस मॉडल ने इसे लिखा, और अपने स्वयं के काम का कभी मूल्यांकन किए बिना। प्रदाता-विविध पैनल मायने रखता है: किसी मॉडल के अपने परिवार के बाहर का न्यायाधीश उन संकेतों को पकड़ता है जिन्हें वह परिवार प्रायः पुरस्कृत करता है।
चूँकि निर्णय अंध और क्रॉस-मॉडल है, इसलिए कोई मॉडल स्वयं की चापलूसी नहीं कर सकता, और कोई एकल गृह-शैली मानक नहीं तय करती।
न्यायाधीश पूर्वाग्रह को नियंत्रित करना
निर्णय के लिए मॉडलों का उपयोग करने से चार प्रसिद्ध विफलता-मोड उत्पन्न होते हैं, और विधि प्रत्येक को बंद करने के लिए बनाई गई है।
स्व-वरीयता — एक मॉडल अपनी गृह-शैली को पुरस्कृत करता है। दो नियम इसे हटाते हैं: एक मॉडल कभी भी अपने अनुच्छेद को अंक नहीं देता, और न्यायाधीश पैनल प्रदाता-विविध है, इसलिए कोई एकल परिवार की रुचि मानक नहीं तय करती। एक संकेत जिसे एक घर पुरस्कृत करता है, दूसरे के न्यायाधीश द्वारा पकड़ा जाता है, और इसके विपरीत भी।
वाचालता — न्यायाधीश भरोसेमंद ढंग से लंबाई को अधिक पुरस्कृत करते हैं। प्रत्येक बीट समान लक्ष्य — लगभग 220 शब्द — ब्रीफ करता है, इसलिए सभी अनुच्छेद लगभग समान आकार में आते हैं और भराव से कुछ नहीं मिलता। एक मॉडल उन शब्दों के साथ क्या करता है उस पर अपना अंक अर्जित करता है, न कि इस पर कि वह कितने खर्च करता है।
स्थिति — अनुच्छेद जिस क्रम में दिखाई देते हैं, वे अंकों को जो पहले आया उसकी ओर धकेल सकते हैं। इसलिए प्रत्येक बीट के लिए अनुच्छेदों को पुनर्नामांकित और फेरबदल किया जाता है, और प्रत्येक को एक निश्चित रूब्रिक के विरुद्ध आमने-सामने रैंक करने के बजाय स्वतंत्र रूप से अंकित किया जाता है। क्रम कोई संकेत नहीं देता, और कोई भी अवशिष्ट बदलाव कई बीट्स और कई न्यायाधीशों में औसत हो जाता है।
नमूनाकरण — एक भाग्यशाली ड्राफ्ट एक मॉडल की तारीफ कर सकता है। जनरेशन प्रत्येक मॉडल के डिफ़ॉल्ट तापमान पर एक समान प्रॉम्प्ट के साथ चलता है, बिना किसी प्रति-मॉडल ट्यूनिंग के, इसलिए किसी मॉडल को चेरी-पिक की गई सेटिंग नहीं दी जाती जो दूसरों को नहीं मिलती। और कोई भी सेल एक ड्राफ्ट पर नहीं टिकता: प्रत्येक मॉडल को पैनल के हर दूसरे मॉडल द्वारा पूरे बीट सेट में अंकित किया जाता है, फिर तब तक तटस्थ आधार रेखा की ओर सिकोड़ा जाता है जब तक पर्याप्त माप एकत्र न हो जाएँ — इसलिए एकल-ड्राफ्ट भाग्य संख्या प्रकाशित होने से बहुत पहले धुल जाता है।
स्कोर को विश्वास के अनुसार क्यों सिकोड़ा जाता है
मुट्ठी भर अनुच्छेदों से प्राप्त कच्चा औसत शोर है, और शोर जो स्कोर के रूप में सजाया गया हो, बिना स्कोर के होने से भी बदतर है। इसलिए प्रत्येक प्रकाशित संख्या को उसके पीछे कितना कम डेटा है, उसके अनुपात में 70 के तटस्थ आधार की ओर सिकोड़ा जाता है — औपचारिक रूप से, पाँच अवलोकनों के मूल्य का एक पूर्व-धारणा। तीन भाग्यशाली नमूनों द्वारा समर्थित एक सेल लगभग औसत के रूप में पढ़ा जाता है जब तक पर्याप्त माप उसे एक स्थान न दिला दें; सैकड़ों द्वारा समर्थित एक सेल अपने वास्तविक मापे गए मूल्य के रूप में पढ़ा जाता है।
प्रत्येक संख्या के पीछे का नमूना आकार दिखाया जाता है, और जो भी सेल अभी भी छह से कम अवलोकनों पर टिकी है उसे अनंतिम के रूप में चिह्नित किया जाता है। यही कारण है कि पतले डेटा वाला कोई मॉडल कभी भी एक संयोग से शीर्ष पर नहीं पहुँच जाता — विधि इसे नहीं होने देती।
ग्रिड कैसे अद्यतन रहता है
बेंचमार्क एक बार का परीक्षण नहीं है जो चलाया गया और जमा दिया गया। यह उस स्कोरिंग स्टोर का एक जीवंत प्रक्षेपण है जिस पर प्लेटफ़ॉर्म चलता है: नए न्यायाधीश अवलोकन एक चालू माध्य में जुड़ते रहते हैं, और प्रत्येक सेल की नमूना संख्या समय के साथ बढ़ती है, इसलिए ग्रिड पुराना होने के बजाय तीखा होता जाता है। पृष्ठ हमेशा सबसे हालिया पुनर्अंशांकन की तारीख दिखाता है।
सटीकता के लिए एक सुरक्षा उपाय मायने रखता है। जब कोई स्थायी उपनाम (एक "latest" पॉइंटर) चुपचाप किसी नए अंतर्निहित मॉडल पर पुनर्निर्देशित होता है, तो उस मॉडल की सेलें रीसेट की जाती हैं और शुरू से फिर से मापी जाती हैं, न कि उस मॉडल के साथ मिश्रित की जाती हैं जिसे उन्होंने प्रतिस्थापित किया — इसलिए संस्करण परिवर्तन कभी चुपचाप एक कॉलम को दूषित नहीं करता। यही कारण है कि बेंचमार्क एक सामान्य लेबल के बजाय उस विशिष्ट संस्करण का नाम लेता है जिसे उसने मापा।
सीमाएँ
अंक केवल फिक्शन बीट्स पर गद्य का वर्णन करते हैं, जो मॉडलों और प्रॉम्प्ट के इस समूह के विरुद्ध आंके गए हैं। ये मॉडल प्रदाताओं द्वारा समर्थित आधिकारिक रेटिंग नहीं हैं, और ये लेखन संदर्भ के बाहर किसी मॉडल के तर्क, सटीकता या सुरक्षा के बारे में कुछ नहीं कहते। मॉडल नाम और ट्रेडमार्क उनके संबंधित स्वामियों के हैं; यह एक स्वतंत्र माप है।
दो पाठ गलत करना आसान है। कम eroticism स्कोर आमतौर पर इच्छाशक्ति को दर्शाता है — एक मॉडल का मना करना या नैदानिक हो जाना — न कि शिल्प की विफलता। और कम-विश्वास स्कोर का अर्थ है "अभी तक सिद्ध नहीं", न कि "कमज़ोर साबित"। हमेशा किसी संख्या को उसके नमूना आकार के साथ पढ़ें, और याद रखें कि आपकी पुस्तक के लिए सबसे अच्छा मॉडल इस बात पर निर्भर करता है कि आपकी पुस्तक किन अक्षों पर झुकती है — और यही पूरा कारण है कि ग्रिड उन्हें अलग रखता है।