Novelmint ফিকশন বেঞ্চমার্ক এমন একটি বিষয় পরিমাপ করে যা মডেল কার্ডগুলো কখনো করে না: একটি মডেল এমন কোনো দৃশ্য লিখতে পারে কি না যা পাঠক এড়িয়ে যাবে না। এটি গণিত বা কোডিং পরীক্ষা থেকে ধার করা কোনো লিডারবোর্ড নয় — এটি প্রকৃত উপন্যাসের গদ্যকে নম্বর দেয়। এখানে ঠিক কীভাবে এই সংখ্যাগুলো তৈরি হয় তা বিস্তারিত বলা হয়েছে, যাতে আপনি নিজে বিচার করতে পারেন এবং আত্মবিশ্বাসের সঙ্গে উদ্ধৃত করতে পারেন।
এটি কী পরিমাপ করে
বেঞ্চমার্কটি পরিমাপ করে যে ফ্রন্টিয়ার মডেলগুলো — Anthropic, OpenAI, Google এবং xAI-এর — কতটা ভালো ফিকশন লিখতে পারে। তারা কীভাবে যুক্তি দেয় নয়, কীভাবে কোড করে নয়, বহুনির্বাচনী পরীক্ষায় কেমন করে নয়। প্রতিটি মডেলকে একই সংক্ষিপ্ত উপন্যাসের বিটগুলো দেওয়া হয় — এমন দৃশ্য যেখানে প্রয়োজনীয় উপাদান, নিষিদ্ধ জ্ঞান, একটি দৃষ্টিভঙ্গি এবং একটি নাটকীয় লক্ষ্য থাকে — এবং যা লেখা হয় তা ফিকশন হিসেবে বিচার করা হয়, যেভাবে একজন সম্পাদক পড়েন।
সবকিছু প্রতিটি অক্ষে একটি একক ০–১০০ স্কেলে প্রকাশ করা হয়, তাই সংখ্যাগুলো মডেলগুলোর মধ্যে এবং একটি বইয়ে সত্যিকারের যে ধরনের দৃশ্য থাকে তার মধ্যে সরাসরি তুলনীয়।
নয়টি অক্ষ
ফিকশন একটিমাত্র দক্ষতা নয়, তাই বেঞ্চমার্ক এটিকে একটি সংখ্যায় সংকুচিত করে না। এটি নয়টি অক্ষে নম্বর দেয়, যা দুটি পরিবারে বিভক্ত যাদের অর্থ আলাদা।
চারটি কারুকাজ অক্ষ পরিমাপ করে একটি মডেল কতটা ভালো লেখে, বিষয় নির্বিশেষে: literary (বাক্য-স্তরের চিত্র, ছন্দ, সাব-টেক্সট, সংযম), dialogue (চরিত্রগুলো আলাদা মানুষের মতো শোনায় কি না), fidelity (এটি ঠিক কতটা বিশ্বস্তভাবে সংক্ষিপ্ত বিটটি উপস্থাপন করে, প্রয়োজনীয় উপাদান রেখে এবং নিষিদ্ধ জ্ঞান বাদ দিয়ে), এবং pacing (গতির নিয়ন্ত্রণ — কখন সংকুচিত করতে হবে, কখন থামতে হবে)।
পাঁচটি বিষয়বস্তু অক্ষ পরিমাপ করে একটি মডেল কী ধরনের দৃশ্য ভালো লেখে: emotion, physicality (অ্যাকশন এবং মহাকাশে শরীর), conflict, romance, এবং eroticism (স্পষ্ট প্রাপ্তবয়স্ক বিষয়বস্তু)। এগুলো ভালো-বা-খারাপের র্যাংকিং নয় — এগুলো বলে একটি মডেল কীসের উপযুক্ত। একটি মডেলের সুন্দর বাক্য থাকতে পারে এবং তবুও সমতল যুদ্ধের দৃশ্য লিখতে পারে, এই কারণেই কারুকাজ এবং বিষয়বস্তু আলাদাভাবে নম্বর দেওয়া হয় এবং রিপোর্ট করা হয় এবং কখনো একটি বিভ্রান্তিকর একক সংখ্যায় গড় করা হয় না।
প্রতিটি মডেল কীভাবে নম্বর পায়
নম্বর দেওয়া হয় অন্ধ পিয়ার রিভিউ পদ্ধতিতে। প্রতিটি মডেল একই সেটের সংক্ষিপ্ত বিট লেখে, এবং শক্তিশালী, প্রদানকারী-বৈচিত্র্যময় বিচারক মডেলের একটি প্যানেল প্রতিটি অনুচ্ছেদকে প্রতিটি অক্ষে ০–১০০ নম্বর দেয় — কোন মডেল এটি লিখেছে তা না জেনে, এবং নিজের কাজ কখনো বিচার না করে। একটি প্রদানকারী-বৈচিত্র্যময় প্যানেল গুরুত্বপূর্ণ: একটি মডেলের নিজস্ব পরিবারের বাইরের বিচারক সেই লক্ষণগুলো ধরে যা সেই পরিবার পুরস্কৃত করে।
যেহেতু বিচার প্রক্রিয়া অন্ধ এবং ক্রস-মডেল, একটি মডেল নিজেকে তোষামোদ করতে পারে না, এবং কোনো একক হাউস স্টাইল মান নির্ধারণ করে না।
বিচারকের পক্ষপাত নিয়ন্ত্রণ
মডেলগুলো দিয়ে মডেল বিচার করালে চারটি সুপরিচিত ব্যর্থতার ধরন তৈরি হয়, এবং পদ্ধতিটি প্রতিটি বন্ধ করতে তৈরি।
নিজেকে প্রাধান্য দেওয়া — একটি মডেল তার নিজস্ব হাউস স্টাইলকে পুরস্কৃত করার প্রবণতা দেখায়। দুটি নিয়ম এটি দূর করে: একটি মডেল কখনো তার নিজের অনুচ্ছেদে নম্বর দেয় না, এবং বিচারক প্যানেলটি প্রদানকারী-বৈচিত্র্যময়, তাই কোনো একক পরিবারের রুচি মান নির্ধারণ করে না। একটি হাউস যে লক্ষণকে পুরস্কৃত করে তা অন্য একজন বিচারক ধরে ফেলে, এবং বিপরীতভাবেও।
বাচালতা — বিচারকরা নির্ভরযোগ্যভাবে দৈর্ঘ্যকে বেশি পুরস্কৃত করেন। প্রতিটি বিট একই লক্ষ্যমাত্রায় সংক্ষিপ্ত করা হয়, প্রায় ২২০ শব্দে, তাই সমস্ত অনুচ্ছেদ প্রায় একই আকারে আসে এবং প্যাডিং কিছু অর্জন করে না। একটি মডেল সেই শব্দগুলো দিয়ে কী করে তার উপর নম্বর অর্জন করে, কতগুলো খরচ করে তার উপর নয়।
অবস্থান — অনুচ্ছেদগুলো যে ক্রমে আসে তা স্কোরকে যা প্রথমে এসেছিল তার দিকে ঠেলে দিতে পারে। তাই প্রতিটি বিটের জন্য অনুচ্ছেদগুলো পুনরায় লেবেল করা হয় এবং এলোমেলো করা হয়, এবং প্রতিটিকে একটি নির্দিষ্ট রুব্রিকের বিপরীতে আলাদাভাবে নম্বর দেওয়া হয় না কি মাথায়-মাথায় র্যাংক করা হয়। ক্রমটি কোনো সংকেত বহন করে না, এবং যেকোনো অবশিষ্ট পরিবর্তন অনেক বিট এবং অনেক বিচারক জুড়ে গড়ে যায়।
স্যাম্পলিং — একটি একক ভাগ্যবান খসড়া একটি মডেলকে তোষামোদ করতে পারে। জেনারেশন প্রতিটি মডেলের ডিফল্ট তাপমাত্রায় একটি অভিন্ন প্রম্পটে চালানো হয়, কোনো প্রতি-মডেল টিউনিং ছাড়াই, তাই কোনো মডেলকে এমন চেরি-পিকড সেটিং দেওয়া হয় না যা অন্যরা পায় না। এবং কোনো সেল একটি খসড়ার উপর নির্ভর করে না: প্রতিটি মডেলকে প্যানেলের প্রতিটি অন্য মডেল দ্বারা সম্পূর্ণ বিট সেট জুড়ে নম্বর দেওয়া হয়, তারপর নিরপেক্ষ বেসলাইনের দিকে সংকুচিত করা হয় যতক্ষণ না যথেষ্ট পরিমাপ জমা হয় — তাই একক-খসড়ার ভাগ্য একটি সংখ্যা প্রকাশিত হওয়ার অনেক আগেই ধুয়ে যায়।
কেন স্কোর আস্থার অনুপাতে সংকুচিত করা হয়
কয়েকটি অনুচ্ছেদ থেকে একটি কাঁচা গড় হলো শব্দ, এবং স্কোর হিসেবে সাজানো শব্দ কোনো স্কোর না থাকার চেয়েও খারাপ। তাই প্রতিটি প্রকাশিত সংখ্যা এর পেছনে কতটুকু ডেটা আছে তার অনুপাতে একটি নিরপেক্ষ ৭০ বেসলাইনের দিকে সংকুচিত করা হয় — আনুষ্ঠানিকভাবে, পাঁচটি পর্যবেক্ষণের মূল্যের একটি প্রাইয়র। তিনটি ভাগ্যবান নমুনার উপর ভিত্তি করে একটি সেল যথেষ্ট পরিমাপ না হওয়া পর্যন্ত প্রায় গড় হিসেবে পড়ে; শতাধিক নমুনার উপর ভিত্তি করে একটি সেল তার প্রকৃত পরিমাপ মান হিসেবে পড়ে।
প্রতিটি সংখ্যার পেছনের নমুনার আকার দেখানো হয়, এবং ছয়টিরও কম পর্যবেক্ষণের উপর নির্ভরশীল যেকোনো সেল অস্থায়ী হিসেবে চিহ্নিত করা হয়। এই কারণেই পাতলা ডেটা সহ একটি মডেল একটি ভাগ্যবান ঘটনায় কখনো শীর্ষে উঠে যায় না — পদ্ধতিটি এটি হতে দেবে না।
গ্রিড কীভাবে আপডেট থাকে
বেঞ্চমার্কটি একটি একবারের পরীক্ষা নয় যা চালানো হয়েছিল এবং জমে গেছে। এটি প্ল্যাটফর্মের চলমান স্কোরিং স্টোরের একটি লাইভ প্রজেকশন: নতুন বিচারকের পর্যবেক্ষণগুলো একটি চলমান গড়ে যুক্ত হয়, এবং প্রতিটি সেলের নমুনার সংখ্যা সময়ের সাথে বৃদ্ধি পায়, তাই গ্রিড পুরানো হওয়ার পরিবর্তে তীক্ষ্ণ হয়। পৃষ্ঠাটি সর্বদা সর্বশেষ পুনর্ক্যালিব্রেশনের তারিখ দেখায়।
নির্ভুলতার জন্য একটি সুরক্ষা গুরুত্বপূর্ণ। যখন একটি স্থায়ী উপনাম (একটি "latest" পয়েন্টার) নীরবে একটি নতুন অন্তর্নিহিত মডেলের দিকে পুনরায় নির্দেশ করে, সেই মডেলের সেলগুলো শূন্য থেকে পুনরায় সেট এবং পুনরায় পরিমাপ করা হয় বরং এটি যে মডেলটি প্রতিস্থাপন করেছে তার সাথে মিশ্রিত করার পরিবর্তে — তাই একটি সংস্করণ পরিবর্তন কখনো চুপচাপ একটি কলাম দূষিত করে না। এই কারণেই বেঞ্চমার্ক একটি জেনেরিক লেবেলের পরিবর্তে যে নির্দিষ্ট সংস্করণ পরিমাপ করেছে তার নাম দেয়।
সীমাবদ্ধতা
স্কোরগুলো শুধুমাত্র ফিকশন বিটে গদ্য বর্ণনা করে, এই সেটের মডেল এবং প্রম্পটের বিপরীতে বিচার করা হয়। এগুলো মডেল প্রদানকারীদের দ্বারা অনুমোদিত আনুষ্ঠানিক রেটিং নয়, এবং লেখার প্রসঙ্গের বাইরে একটি মডেলের যুক্তি, নির্ভুলতা বা নিরাপত্তা সম্পর্কে কিছু বলে না। মডেলের নাম এবং ট্রেডমার্কগুলো তাদের নিজস্ব মালিকদের অন্তর্গত; এটি একটি স্বাধীন পরিমাপ।
দুটি পড়া সহজেই ভুল হয়ে যেতে পারে। একটি কম eroticism স্কোর সাধারণত ইচ্ছাশক্তি প্রতিফলিত করে — একটি মডেল অস্বীকার করছে বা ক্লিনিকাল হয়ে যাচ্ছে — কারুকাজের ব্যর্থতা নয়। এবং একটি কম-আস্থার স্কোর মানে "এখনো প্রমাণিত নয়", "দুর্বল প্রমাণিত" নয়। সর্বদা একটি সংখ্যা তার নমুনার আকারের সাথে মিলিয়ে পড়ুন, এবং মনে রাখবেন যে আপনার বইয়ের জন্য সেরা মডেল নির্ভর করে আপনার বই কোন অক্ষের উপর নির্ভর করে — এবং এই কারণেই গ্রিড সেগুলো আলাদা রাখে।