Novelmint புனைகதை அளவுகோல் ஒரே ஒரு விஷயத்தை அளவிடுகிறது, அதை மாடல் கார்டுகள் ஒருபோதும் செய்வதில்லை: ஒரு மாடல் படிக்காமல் தவிர்க்கப்படாத ஒரு காட்சியை எழுத முடியுமா என்பதை. இது கணிதம் அல்லது கோடிங் சோதனைகளிலிருந்து கடன் வாங்கிய தரவரிசைப் பட்டியல் அல்ல — இது உண்மையான நாவல் உரைநடையை மதிப்பிடுகிறது. எண்கள் எவ்வாறு உருவாக்கப்படுகின்றன என்பது இங்கே சரியாக விளக்கப்பட்டுள்ளது, இதனால் நீங்கள் அவற்றை சொந்தமாக மதிப்பிட்டு நம்பிக்கையுடன் மேற்கோள் காட்டலாம்.
இது என்ன அளவிடுகிறது
இந்த அளவுகோல் எல்லை மாடல்கள் — Anthropic, OpenAI, Google மற்றும் xAI ஆகியவற்றிலிருந்து — புனைகதையை எவ்வளவு சிறப்பாக எழுதுகின்றன என்பதை மதிப்பிடுகிறது. அவை எவ்வாறு சிந்திக்கின்றன என்பதை அல்ல, எவ்வாறு குறியீடு எழுதுகின்றன என்பதை அல்ல, பல விருப்ப சோதனைகளில் எவ்வாறு செயல்படுகின்றன என்பதை அல்ல. ஒவ்வொரு மாடலுக்கும் ஒரே மாதிரியான சுருக்கமான நாவல் தாளங்கள் வழங்கப்படுகின்றன — தேவையான கூறுகள், தடைசெய்யப்பட்ட அறிவு, ஒரு கண்ணோட்டம் மற்றும் ஒரு நாடகீய இலக்கு கொண்ட காட்சிகள் — அது எழுதுவது ஒரு ஆசிரியர் படிப்பது போல், புனைகதையாக மதிப்பிடப்படுகிறது.
எல்லாமே ஒவ்வொரு அச்சுக்கும் 0–100 என்ற ஒற்றை அளவுகோலில் வெளிப்படுத்தப்படுகிறது, எனவே எண்கள் மாடல்களுக்கிடையிலும் ஒரு புத்தகம் உண்மையில் உருவாக்கப்படும் காட்சி வகைகளுக்கிடையிலும் நேரடியாக ஒப்பிடக்கூடியவை.
ஒன்பது அச்சுகள்
புனைகதை என்பது ஒரே ஒரு திறன் அல்ல, எனவே அளவுகோல் அதை ஒரே எண்ணாக சுருக்குவதில்லை. இது ஒன்பது அச்சுகளை மதிப்பிடுகிறது, வெவ்வேறு அர்த்தங்கள் கொண்ட இரண்டு குடும்பங்களாக பிரிக்கப்பட்டுள்ளன.
நான்கு கைவினை அச்சுகள் ஒரு மாடல் எவ்வளவு சிறப்பாக எழுதுகிறது என்பதை அளவிடுகின்றன, பொருளிலிருந்து சுதந்திரமாக: இலக்கியம் (வாக்கிய அளவிலான படிமம், தாளம், உட்பொருள், கட்டுப்பாடு), உரையாடல் (கதாபாத்திரங்கள் தனித்தனி நபர்களைப் போல் ஒலிக்கிறார்களா), நம்பகத்தன்மை (சுருக்கமான தாளத்தை எவ்வளவு உண்மையாக வழங்குகிறது, தேவையான கூறுகளை உள்ளே வைத்து தடைசெய்யப்பட்ட அறிவை வெளியே வைக்கிறது), மற்றும் வேகம் (உந்தத்தின் கட்டுப்பாடு — எப்போது சுருக்குவது, எப்போது தங்குவது).
ஐந்து உள்ளடக்க அச்சுகள் ஒரு மாடல் எந்த வகையான காட்சியை சிறப்பாக எழுதுகிறது என்பதை அளவிடுகின்றன: உணர்ச்சி, உடல்நிலை (செயல் மற்றும் வெளியில் உடல்), மோதல், காதல், மற்றும் காமம் (வெளிப்படையான பெரியோர் உள்ளடக்கம்). இவை சிறந்தது-அல்லது-மோசமான தரவரிசைகள் அல்ல — அவை ஒரு மாடல் எதற்கு பொருத்தமானது என்பதைக் கூறுகின்றன. ஒரு மாடலுக்கு அழகான வாக்கியங்கள் இருக்கலாம், ஆனால் இன்னும் தட்டையான சண்டைக் காட்சிகளை எழுதலாம், அதனால்தான் கைவினை மற்றும் உள்ளடக்கம் தனித்தனியாக மதிப்பிடப்பட்டு அறிவிக்கப்படுகின்றன, ஒருபோதும் ஒற்றை தவறான படத்தில் சராசரியாக்கப்படுவதில்லை.
ஒவ்வொரு மாடலும் எவ்வாறு மதிப்பிடப்படுகிறது
மதிப்பீடு குருட்டு சக மதிப்பாய்வு ஆகும். ஒவ்வொரு மாடலும் ஒரே மாதிரியான சுருக்கமான தாளங்களை எழுதுகிறது, மேலும் வலிமையான, வழங்குநர்-பல்வகை நடுவர் மாடல்களின் குழு ஒவ்வொரு பத்தியையும் ஒவ்வொரு அச்சிலும் 0–100 என்று மதிப்பிடுகிறது — எந்த மாடல் அதை எழுதியது என்று தெரியாமல், மற்றும் ஒருபோதும் தன்னுடைய வேலையை நடுவராக மதிப்பிடாமல். வழங்குநர்-பல்வகை குழு முக்கியமானது: ஒரு மாடலின் சொந்த குடும்பத்திற்கு வெளியே இருந்து வந்த நடுவர் அந்த குடும்பம் பரிசளிக்கும் அடையாளங்களைப் பிடிக்கிறார்.
மதிப்பீடு குருட்டாகவும் கிராஸ்-மாடலாகவும் இருப்பதால், ஒரு மாடல் தன்னைத்தானே புகழ்ந்துகொள்ள முடியாது, மேலும் எந்த ஒரு இல்ல பாணியும் தரநிலையை நிர்ணயிக்காது.
நடுவர் சார்புத்தன்மையை கட்டுப்படுத்துதல்
மாடல்களை மதிப்பிட மாடல்களைப் பயன்படுத்துவது நான்கு நன்கு அறியப்பட்ட தோல்வி முறைகளை அழைக்கிறது, மேலும் ஒவ்வொன்றையும் மூட முறை கட்டப்பட்டுள்ளது.
சுய-விருப்பம் — ஒரு மாடல் தன்னுடைய சொந்த இல்ல பாணியை பரிசளிக்கும் போக்கு உள்ளது. இரண்டு விதிகள் அதை நீக்குகின்றன: ஒரு மாடல் ஒருபோதும் தன்னுடைய சொந்த பத்தியை மதிப்பிடாது, மேலும் நடுவர் குழு வழங்குநர்-பல்வகையாக உள்ளது, எனவே எந்த ஒரு குடும்பத்தின் சுவையும் தரநிலையை நிர்ணயிக்காது. ஒரு இல்லம் பரிசளிக்கும் அடையாளம் மற்றொரு இல்லத்திலிருந்து வரும் நடுவரால் பிடிக்கப்படுகிறது, மற்றும் நேர்மாறும்.
வாக்கு வளம் — நடுவர்கள் நம்பகமாக நீளத்தை அதிகமாக பரிசளிக்கிறார்கள். ஒவ்வொரு தாளமும் தோராயமாக 220 வார்த்தைகளை இலக்காக கொண்டுள்ளது, எனவே எல்லா பத்திகளும் கிட்டத்தட்ட ஒரே அளவில் வருகின்றன, நிரப்பு வார்த்தைகள் எதுவும் பயன் தராது. ஒரு மாடல் அந்த வார்த்தைகளால் என்ன செய்கிறது என்பதில் மதிப்பெண் பெறுகிறது, எத்தனை செலவிடுகிறது என்பதில் அல்ல.
நிலை — பத்திகள் தோன்றும் வரிசை மதிப்பெண்களை முதலில் வந்தது என்னவோ அதன் பக்கம் தள்ளலாம். எனவே பத்திகள் ஒவ்வொரு தாளத்திற்கும் மறுபெயரிடப்பட்டு கலைக்கப்படுகின்றன, மேலும் ஒவ்வொன்றும் நேருக்கு நேர் தரவரிசைப்படுத்துவதற்குப் பதிலாக ஒரு நிலையான கட்டக்கோட்டிற்கு எதிராக தன்னிச்சையாக மதிப்பிடப்படுகிறது. வரிசை எந்த சமிக்ஞையையும் கொண்டு செல்வதில்லை, மேலும் எந்த எஞ்சிய நழுவலும் பல தாளங்கள் மற்றும் பல நடுவர்களில் சராசரியாகிவிடுகிறது.
மாதிரி எடுத்தல் — ஒரு ஒற்றை அதிர்ஷ்டமான வரைவு ஒரு மாடலை புகழ்ந்துகொள்ளலாம். உருவாக்கம் ஒரே மாதிரியான உடனடி வழிமுறையில் ஒவ்வொரு மாடலின் இயல்பு வெப்பநிலையில் இயங்குகிறது, மாடல்-வாரியான சரிசெய்தல் இல்லாமல், எனவே எந்த மாடலுக்கும் மற்றவர்களுக்கு கிடைக்காத தேர்வுசெய்யப்பட்ட அமைப்பு கொடுக்கப்படவில்லை. மேலும் எந்த கலமும் ஒரு வரைவில் தங்கவில்லை: ஒவ்வொரு மாடலும் குழுவில் உள்ள ஒவ்வொரு மாடலாலும் முழு தாள தொகுப்பிலும் மதிப்பிடப்படுகிறது, பின்னர் போதுமான அளவீடுகள் திரட்டப்படும் வரை நடுநிலை அடிப்படையை நோக்கி சுருக்கப்படுகிறது — எனவே ஒற்றை-வரைவு அதிர்ஷ்டம் ஒரு எண் வெளியிடப்படுவதற்கு நீண்ட நேரத்திற்கு முன்பே கழுவப்படுகிறது.
மதிப்பெண்கள் நம்பிக்கையால் ஏன் சுருக்கப்படுகின்றன
ஒரு சில பத்திகளிலிருந்து வரும் மூல சராசரி சத்தம், மேலும் மதிப்பெண்னாக வேடமிட்ட சத்தம் எந்த மதிப்பெண்ணும் இல்லாததை விட மோசமானது. எனவே ஒவ்வொரு வெளியிடப்பட்ட எண்ணும் அதன் பின்னால் எவ்வளவு குறைந்த தரவு நிற்கிறது என்பதற்கு விகிதாசாரமாக நடுநிலை 70 அடிப்படையை நோக்கி சுருக்கப்படுகிறது — முறையாக, ஐந்து கவனிப்புகளுக்கு மதிப்புள்ள ஒரு முந்தைய நிலை. மூன்று அதிர்ஷ்டமான மாதிரிகளால் ஆதரிக்கப்படும் ஒரு கலம் போதுமான அளவீடுகள் அதற்கு ஒரு இடம் கிடைக்கும் வரை தோராயமாக சராசரியாக படிக்கப்படுகிறது; நூற்றுக்கணக்கானவற்றால் ஆதரிக்கப்படும் கலம் அதன் உண்மையான அளவிடப்பட்ட மதிப்பாக படிக்கப்படுகிறது.
ஒவ்வொரு எண்ணின் பின்னாலும் உள்ள மாதிரி அளவு காண்பிக்கப்படுகிறது, மேலும் இன்னும் ஆறுக்கும் குறைவான கவனிப்புகளில் தங்கியிருக்கும் எந்த கலமும் தற்காலிகமாக கொடியிடப்படுகிறது. அதனால்தான் மெலிந்த தரவு கொண்ட ஒரு மாடல் ஒரு திடீர் அதிர்ஷ்டத்தால் மேலே ராக்கெட் ஆவதில்லை — முறை அதை அனுமதிக்காது.
கட்டம் எவ்வாறு தற்போதையதாக இருக்கிறது
அளவுகோல் ஒரு முறை இயக்கப்பட்டு உறைந்த ஒரு-முறை சோதனை அல்ல. இது தளம் இயங்கும் மதிப்பீட்டு களஞ்சியத்தின் நேரடி திட்டம்: புதிய நடுவர் கவனிப்புகள் ஒரு இயங்கும் சராசரியில் மடிக்கப்படுகின்றன, மேலும் ஒவ்வொரு கலத்தின் மாதிரி எண்ணிக்கையும் காலப்போக்கில் வளருகிறது, எனவே கட்டம் வயதாவதற்குப் பதிலாக கூர்மையாகிறது. பக்கம் எப்போதும் மிக சமீபத்திய மறுசீரமைப்பின் தேதியை காண்பிக்கிறது.
ஒரு பாதுகாப்பு நடவடிக்கை துல்லியத்திற்கு முக்கியத்துவம் வாய்ந்தது. ஒரு நீடித்த மாற்றுப்பெயர் (ஒரு "சமீபத்திய" சுட்டிக்காட்டி) புதிய அடிப்படை மாடலை சத்தமின்றி மறுசுட்டி செய்யும்போது, அந்த மாடலின் கலங்கள் அது மாற்றிய மாடலுடன் கலக்கப்படுவதற்குப் பதிலாக மீட்டமைக்கப்பட்டு புதிதாக அளவிடப்படுகின்றன — எனவே ஒரு பதிப்பு மாற்றம் ஒருபோதும் ஒரு நெடுவரிசையை அமைதியாக சிதைக்காது. இது ஏன் அளவுகோல் பொதுவான தலைப்பிற்குப் பதிலாக அளவிடப்பட்ட குறிப்பிட்ட பதிப்பை பெயரிடுகிறது என்பதற்கும் காரணம்.
வரம்புகள்
மதிப்பெண்கள் புனைகதை தாளங்களில் மட்டுமே உரைநடையை விவரிக்கின்றன, இந்த மாடல்கள் மற்றும் உடனடி வழிமுறைகளின் தொகுப்பிற்கு எதிராக மதிப்பிடப்படுகின்றன. அவை மாடல் வழங்குநர்களால் அங்கீகரிக்கப்பட்ட அதிகாரப்பூர்வ மதிப்பீடுகள் அல்ல, மேலும் எழுத்து சூழலுக்கு வெளியே ஒரு மாடலின் சிந்தனை, துல்லியம் அல்லது பாதுகாப்பு பற்றி அவை எதுவும் சொல்வதில்லை. மாடல் பெயர்கள் மற்றும் வர்த்தக முத்திரைகள் அவற்றின் அந்தந்த உரிமையாளர்களுக்கு சொந்தமானவை; இது ஒரு சுதந்திரமான அளவீடு.
இரண்டு வாசிப்புகள் தவறுவதற்கு எளிதானவை. குறைந்த காமம் மதிப்பெண் பொதுவாக விருப்பத்தை பிரதிபலிக்கிறது — ஒரு மாடல் மறுக்கிறது அல்லது மருத்துவமாக திரும்புகிறது — கைவினையின் தோல்வி அல்ல. மேலும் குறைந்த நம்பிக்கை மதிப்பெண் என்பது "இன்னும் நிரூபிக்கப்படவில்லை" என்று பொருள், "பலவீனமாக நிரூபிக்கப்பட்டது" என்று அல்ல. எப்போதும் ஒரு எண்ணை அதன் மாதிரி அளவுடன் சேர்த்துப் படியுங்கள், மேலும் உங்கள் புத்தகத்திற்கான சிறந்த மாடல் உங்கள் புத்தகம் எந்த அச்சுகளை சார்ந்துள்ளது என்பதை பொறுத்தது என்பதை நினைவில் கொள்ளுங்கள் — இதுதான் கட்டம் அவற்றை தனித்தனியாக வைத்திருக்கும் முழு காரணம்.