পদ্ধতি

ফিকশন মডেল বেঞ্চমার্ক কীভাবে কাজ করে

Updated July 23, 2026 · ৬ মিনিটের পড়া

এই বেঞ্চমার্ক সেই একটি জিনিস পরিমাপ করে যা মডেল কার্ড কখনো করে না: একটি মডেল এমন দৃশ্য লিখতে পারে কিনা যা পাঠক এড়িয়ে যাবেন না। এই পৃষ্ঠায় সংখ্যাগুলো ঠিক কীভাবে তৈরি হয় তা ব্যাখ্যা করা হয়েছে — কী পরিমাপ করা হয়, মডেলগুলো কীভাবে বিচার করা হয়, কেন স্কোরগুলো কনফিডেন্স দ্বারা সংকুচিত হয়, এবং গ্রিড কীভাবে আপডেট থাকে — যাতে আপনি নিজে ফলাফলগুলো মূল্যায়ন করতে এবং সঠিকভাবে উদ্ধৃত করতে পারেন।

Key takeaways

  • ফ্রন্টিয়ার মডেলগুলো একই ব্রিফড নভেল বিট লেখে, এবং একটি ব্লাইন্ড, প্রোভাইডার-বৈচিত্র্যময় বিচারক প্যানেল প্রোজকে নয়টি মানদণ্ডে ০–১০০ স্কোর দেয় — কোন মডেল লিখেছে তা না জেনেই।
  • দুটি পরিবারে নয়টি মানদণ্ড: চারটি কারুকাজ (সাহিত্যিক, সংলাপ, বিশ্বস্ততা, গতি) পরিমাপ করে মডেল কতটা ভালো লেখে; পাঁচটি বিষয়বস্তু (আবেগ, দৈহিকতা, দ্বন্দ্ব, রোমান্স, ইরোটিসিজম) পরিমাপ করে এটি কোন ধরনের দৃশ্য ভালো লেখে। এগুলো কখনো একসাথে গড় করা হয় না।
  • প্রতিটি স্কোর একটি নিরপেক্ষ ৭০ বেসলাইনের দিকে সংকুচিত হয় — ডেটা কতটা কম আছে তার অনুপাতে (পাঁচটি পর্যবেক্ষণ সমান একটি পূর্ববর্তী মান), যাতে ভাগ্যক্রমে ছোট স্যাম্পল শীর্ষে পৌঁছাতে না পারে। স্যাম্পল সাইজ দেখানো হয়; পাতলা সেলগুলো চিহ্নিত করা থাকে।
  • গ্রিডটি লাইভ — নতুন বিচারকের পর্যবেক্ষণগুলো সময়ের সাথে একটি চলমান গড়ে যুক্ত হয়, এবং একটি ভার্সন পরিবর্তন একটি মডেলকে পূর্ববর্তী সংস্করণের সাথে মিশ্রিত করার পরিবর্তে রিসেট করে পুনরায় পরিমাপ করে।
  • স্কোরগুলো শুধুমাত্র ফিকশন বিটের প্রোজ বর্ণনা করে; এগুলো একটি স্বাধীন পরিমাপ, কোনো অফিসিয়াল প্রোভাইডার রেটিং নয়, এবং কম ইরোটিসিজম স্কোর সাধারণত কারুকাজ নয়, ইচ্ছুকতা প্রতিফলিত করে।

Novelmint ফিকশন বেঞ্চমার্ক এমন একটি বিষয় পরিমাপ করে যা মডেল কার্ডগুলো কখনো করে না: একটি মডেল এমন কোনো দৃশ্য লিখতে পারে কি না যা পাঠক এড়িয়ে যাবে না। এটি গণিত বা কোডিং পরীক্ষা থেকে ধার করা কোনো লিডারবোর্ড নয় — এটি প্রকৃত উপন্যাসের গদ্যকে নম্বর দেয়। এখানে ঠিক কীভাবে এই সংখ্যাগুলো তৈরি হয় তা বিস্তারিত বলা হয়েছে, যাতে আপনি নিজে বিচার করতে পারেন এবং আত্মবিশ্বাসের সঙ্গে উদ্ধৃত করতে পারেন।

এটি কী পরিমাপ করে

বেঞ্চমার্কটি পরিমাপ করে যে ফ্রন্টিয়ার মডেলগুলো — Anthropic, OpenAI, Google এবং xAI-এর — কতটা ভালো ফিকশন লিখতে পারে। তারা কীভাবে যুক্তি দেয় নয়, কীভাবে কোড করে নয়, বহুনির্বাচনী পরীক্ষায় কেমন করে নয়। প্রতিটি মডেলকে একই সংক্ষিপ্ত উপন্যাসের বিটগুলো দেওয়া হয় — এমন দৃশ্য যেখানে প্রয়োজনীয় উপাদান, নিষিদ্ধ জ্ঞান, একটি দৃষ্টিভঙ্গি এবং একটি নাটকীয় লক্ষ্য থাকে — এবং যা লেখা হয় তা ফিকশন হিসেবে বিচার করা হয়, যেভাবে একজন সম্পাদক পড়েন।

সবকিছু প্রতিটি অক্ষে একটি একক ০–১০০ স্কেলে প্রকাশ করা হয়, তাই সংখ্যাগুলো মডেলগুলোর মধ্যে এবং একটি বইয়ে সত্যিকারের যে ধরনের দৃশ্য থাকে তার মধ্যে সরাসরি তুলনীয়।

নয়টি অক্ষ

ফিকশন একটিমাত্র দক্ষতা নয়, তাই বেঞ্চমার্ক এটিকে একটি সংখ্যায় সংকুচিত করে না। এটি নয়টি অক্ষে নম্বর দেয়, যা দুটি পরিবারে বিভক্ত যাদের অর্থ আলাদা।

চারটি কারুকাজ অক্ষ পরিমাপ করে একটি মডেল কতটা ভালো লেখে, বিষয় নির্বিশেষে: literary (বাক্য-স্তরের চিত্র, ছন্দ, সাব-টেক্সট, সংযম), dialogue (চরিত্রগুলো আলাদা মানুষের মতো শোনায় কি না), fidelity (এটি ঠিক কতটা বিশ্বস্তভাবে সংক্ষিপ্ত বিটটি উপস্থাপন করে, প্রয়োজনীয় উপাদান রেখে এবং নিষিদ্ধ জ্ঞান বাদ দিয়ে), এবং pacing (গতির নিয়ন্ত্রণ — কখন সংকুচিত করতে হবে, কখন থামতে হবে)।

পাঁচটি বিষয়বস্তু অক্ষ পরিমাপ করে একটি মডেল কী ধরনের দৃশ্য ভালো লেখে: emotion, physicality (অ্যাকশন এবং মহাকাশে শরীর), conflict, romance, এবং eroticism (স্পষ্ট প্রাপ্তবয়স্ক বিষয়বস্তু)। এগুলো ভালো-বা-খারাপের র‌্যাংকিং নয় — এগুলো বলে একটি মডেল কীসের উপযুক্ত। একটি মডেলের সুন্দর বাক্য থাকতে পারে এবং তবুও সমতল যুদ্ধের দৃশ্য লিখতে পারে, এই কারণেই কারুকাজ এবং বিষয়বস্তু আলাদাভাবে নম্বর দেওয়া হয় এবং রিপোর্ট করা হয় এবং কখনো একটি বিভ্রান্তিকর একক সংখ্যায় গড় করা হয় না।

প্রতিটি মডেল কীভাবে নম্বর পায়

নম্বর দেওয়া হয় অন্ধ পিয়ার রিভিউ পদ্ধতিতে। প্রতিটি মডেল একই সেটের সংক্ষিপ্ত বিট লেখে, এবং শক্তিশালী, প্রদানকারী-বৈচিত্র্যময় বিচারক মডেলের একটি প্যানেল প্রতিটি অনুচ্ছেদকে প্রতিটি অক্ষে ০–১০০ নম্বর দেয় — কোন মডেল এটি লিখেছে তা না জেনে, এবং নিজের কাজ কখনো বিচার না করে। একটি প্রদানকারী-বৈচিত্র্যময় প্যানেল গুরুত্বপূর্ণ: একটি মডেলের নিজস্ব পরিবারের বাইরের বিচারক সেই লক্ষণগুলো ধরে যা সেই পরিবার পুরস্কৃত করে।

যেহেতু বিচার প্রক্রিয়া অন্ধ এবং ক্রস-মডেল, একটি মডেল নিজেকে তোষামোদ করতে পারে না, এবং কোনো একক হাউস স্টাইল মান নির্ধারণ করে না।

বিচারকের পক্ষপাত নিয়ন্ত্রণ

মডেলগুলো দিয়ে মডেল বিচার করালে চারটি সুপরিচিত ব্যর্থতার ধরন তৈরি হয়, এবং পদ্ধতিটি প্রতিটি বন্ধ করতে তৈরি।

নিজেকে প্রাধান্য দেওয়া — একটি মডেল তার নিজস্ব হাউস স্টাইলকে পুরস্কৃত করার প্রবণতা দেখায়। দুটি নিয়ম এটি দূর করে: একটি মডেল কখনো তার নিজের অনুচ্ছেদে নম্বর দেয় না, এবং বিচারক প্যানেলটি প্রদানকারী-বৈচিত্র্যময়, তাই কোনো একক পরিবারের রুচি মান নির্ধারণ করে না। একটি হাউস যে লক্ষণকে পুরস্কৃত করে তা অন্য একজন বিচারক ধরে ফেলে, এবং বিপরীতভাবেও।

বাচালতা — বিচারকরা নির্ভরযোগ্যভাবে দৈর্ঘ্যকে বেশি পুরস্কৃত করেন। প্রতিটি বিট একই লক্ষ্যমাত্রায় সংক্ষিপ্ত করা হয়, প্রায় ২২০ শব্দে, তাই সমস্ত অনুচ্ছেদ প্রায় একই আকারে আসে এবং প্যাডিং কিছু অর্জন করে না। একটি মডেল সেই শব্দগুলো দিয়ে কী করে তার উপর নম্বর অর্জন করে, কতগুলো খরচ করে তার উপর নয়।

অবস্থান — অনুচ্ছেদগুলো যে ক্রমে আসে তা স্কোরকে যা প্রথমে এসেছিল তার দিকে ঠেলে দিতে পারে। তাই প্রতিটি বিটের জন্য অনুচ্ছেদগুলো পুনরায় লেবেল করা হয় এবং এলোমেলো করা হয়, এবং প্রতিটিকে একটি নির্দিষ্ট রুব্রিকের বিপরীতে আলাদাভাবে নম্বর দেওয়া হয় না কি মাথায়-মাথায় র‌্যাংক করা হয়। ক্রমটি কোনো সংকেত বহন করে না, এবং যেকোনো অবশিষ্ট পরিবর্তন অনেক বিট এবং অনেক বিচারক জুড়ে গড়ে যায়।

স্যাম্পলিং — একটি একক ভাগ্যবান খসড়া একটি মডেলকে তোষামোদ করতে পারে। জেনারেশন প্রতিটি মডেলের ডিফল্ট তাপমাত্রায় একটি অভিন্ন প্রম্পটে চালানো হয়, কোনো প্রতি-মডেল টিউনিং ছাড়াই, তাই কোনো মডেলকে এমন চেরি-পিকড সেটিং দেওয়া হয় না যা অন্যরা পায় না। এবং কোনো সেল একটি খসড়ার উপর নির্ভর করে না: প্রতিটি মডেলকে প্যানেলের প্রতিটি অন্য মডেল দ্বারা সম্পূর্ণ বিট সেট জুড়ে নম্বর দেওয়া হয়, তারপর নিরপেক্ষ বেসলাইনের দিকে সংকুচিত করা হয় যতক্ষণ না যথেষ্ট পরিমাপ জমা হয় — তাই একক-খসড়ার ভাগ্য একটি সংখ্যা প্রকাশিত হওয়ার অনেক আগেই ধুয়ে যায়।

কেন স্কোর আস্থার অনুপাতে সংকুচিত করা হয়

কয়েকটি অনুচ্ছেদ থেকে একটি কাঁচা গড় হলো শব্দ, এবং স্কোর হিসেবে সাজানো শব্দ কোনো স্কোর না থাকার চেয়েও খারাপ। তাই প্রতিটি প্রকাশিত সংখ্যা এর পেছনে কতটুকু ডেটা আছে তার অনুপাতে একটি নিরপেক্ষ ৭০ বেসলাইনের দিকে সংকুচিত করা হয় — আনুষ্ঠানিকভাবে, পাঁচটি পর্যবেক্ষণের মূল্যের একটি প্রাইয়র। তিনটি ভাগ্যবান নমুনার উপর ভিত্তি করে একটি সেল যথেষ্ট পরিমাপ না হওয়া পর্যন্ত প্রায় গড় হিসেবে পড়ে; শতাধিক নমুনার উপর ভিত্তি করে একটি সেল তার প্রকৃত পরিমাপ মান হিসেবে পড়ে।

প্রতিটি সংখ্যার পেছনের নমুনার আকার দেখানো হয়, এবং ছয়টিরও কম পর্যবেক্ষণের উপর নির্ভরশীল যেকোনো সেল অস্থায়ী হিসেবে চিহ্নিত করা হয়। এই কারণেই পাতলা ডেটা সহ একটি মডেল একটি ভাগ্যবান ঘটনায় কখনো শীর্ষে উঠে যায় না — পদ্ধতিটি এটি হতে দেবে না।

গ্রিড কীভাবে আপডেট থাকে

বেঞ্চমার্কটি একটি একবারের পরীক্ষা নয় যা চালানো হয়েছিল এবং জমে গেছে। এটি প্ল্যাটফর্মের চলমান স্কোরিং স্টোরের একটি লাইভ প্রজেকশন: নতুন বিচারকের পর্যবেক্ষণগুলো একটি চলমান গড়ে যুক্ত হয়, এবং প্রতিটি সেলের নমুনার সংখ্যা সময়ের সাথে বৃদ্ধি পায়, তাই গ্রিড পুরানো হওয়ার পরিবর্তে তীক্ষ্ণ হয়। পৃষ্ঠাটি সর্বদা সর্বশেষ পুনর্ক্যালিব্রেশনের তারিখ দেখায়।

নির্ভুলতার জন্য একটি সুরক্ষা গুরুত্বপূর্ণ। যখন একটি স্থায়ী উপনাম (একটি "latest" পয়েন্টার) নীরবে একটি নতুন অন্তর্নিহিত মডেলের দিকে পুনরায় নির্দেশ করে, সেই মডেলের সেলগুলো শূন্য থেকে পুনরায় সেট এবং পুনরায় পরিমাপ করা হয় বরং এটি যে মডেলটি প্রতিস্থাপন করেছে তার সাথে মিশ্রিত করার পরিবর্তে — তাই একটি সংস্করণ পরিবর্তন কখনো চুপচাপ একটি কলাম দূষিত করে না। এই কারণেই বেঞ্চমার্ক একটি জেনেরিক লেবেলের পরিবর্তে যে নির্দিষ্ট সংস্করণ পরিমাপ করেছে তার নাম দেয়।

সীমাবদ্ধতা

স্কোরগুলো শুধুমাত্র ফিকশন বিটে গদ্য বর্ণনা করে, এই সেটের মডেল এবং প্রম্পটের বিপরীতে বিচার করা হয়। এগুলো মডেল প্রদানকারীদের দ্বারা অনুমোদিত আনুষ্ঠানিক রেটিং নয়, এবং লেখার প্রসঙ্গের বাইরে একটি মডেলের যুক্তি, নির্ভুলতা বা নিরাপত্তা সম্পর্কে কিছু বলে না। মডেলের নাম এবং ট্রেডমার্কগুলো তাদের নিজস্ব মালিকদের অন্তর্গত; এটি একটি স্বাধীন পরিমাপ।

দুটি পড়া সহজেই ভুল হয়ে যেতে পারে। একটি কম eroticism স্কোর সাধারণত ইচ্ছাশক্তি প্রতিফলিত করে — একটি মডেল অস্বীকার করছে বা ক্লিনিকাল হয়ে যাচ্ছে — কারুকাজের ব্যর্থতা নয়। এবং একটি কম-আস্থার স্কোর মানে "এখনো প্রমাণিত নয়", "দুর্বল প্রমাণিত" নয়। সর্বদা একটি সংখ্যা তার নমুনার আকারের সাথে মিলিয়ে পড়ুন, এবং মনে রাখবেন যে আপনার বইয়ের জন্য সেরা মডেল নির্ভর করে আপনার বই কোন অক্ষের উপর নির্ভর করে — এবং এই কারণেই গ্রিড সেগুলো আলাদা রাখে।

Questions

Frequently asked

Novelmint কীভাবে ফিকশনের জন্য AI মডেল বেঞ্চমার্ক করে?
প্রতিটি ফ্রন্টিয়ার মডেল একই ব্রিফড নভেল বিট লেখে, এবং শক্তিশালী বিচারক মডেলের একটি ব্লাইন্ড, প্রোভাইডার-বৈচিত্র্যময় প্যানেল লেখক না জেনেই ফলাফলের প্রোজকে নয়টি মানদণ্ডে ০–১০০ স্কোর দেয়। স্কোরগুলো কতটা ডেটা সমর্থন করে তার অনুযায়ী একটি নিরপেক্ষ বেসলাইনের দিকে সংকুচিত হয়, এবং পর্যবেক্ষণগুলো সময়ের সাথে একটি চলমান গড়ে যুক্ত হয়।
নয়টি মানদণ্ড কী কী?
চারটি কারুকাজ মানদণ্ড — সাহিত্যিক, সংলাপ, বিশ্বস্ততা (ব্রিফের প্রতি নিষ্ঠা), এবং গতি — পরিমাপ করে মডেল কতটা ভালো লেখে। পাঁচটি বিষয়বস্তু মানদণ্ড — আবেগ, দৈহিকতা (অ্যাকশন), দ্বন্দ্ব, রোমান্স এবং ইরোটিসিজম — পরিমাপ করে এটি কোন ধরনের দৃশ্য ভালো লেখে। কারুকাজ এবং বিষয়বস্তু আলাদাভাবে রিপোর্ট করা হয়, কখনো গড় করা হয় না।
কেন স্কোরগুলো কনফিডেন্সের জন্য সামঞ্জস্য করা হয়?
কয়েকটি অনুচ্ছেদ থেকে একটি কাঁচা গড় মাত্র শব্দ। প্রতিটি স্কোর একটি নিরপেক্ষ ৭০ বেসলাইনের দিকে সংকুচিত হয় — এর পেছনে কতটা কম ডেটা আছে তার অনুপাতে — পাঁচটি পর্যবেক্ষণ সমান একটি পূর্ববর্তী মান — যাতে ভাগ্যক্রমে ছোট স্যাম্পল শীর্ষে না পৌঁছায়। স্যাম্পল সাইজ দেখানো হয়, এবং ছয়টির কম পর্যবেক্ষণযুক্ত সেলগুলো অস্থায়ী হিসেবে চিহ্নিত।
এটি কি OpenAI, Anthropic, Google বা xAI-এর অফিসিয়াল র‍্যাংকিং?
না। এটি Novelmint-এর একটি স্বাধীন পরিমাপ, শুধুমাত্র ফিকশন প্রোজের উপর, এই মডেল ও প্রম্পটের সেটের বিপরীতে বিচার করা হয়েছে। এটি যুক্তি, নির্ভুলতা বা অন্যান্য সক্ষমতা সম্পর্কে কিছু বলে না, এবং মডেলের নামগুলো তাদের নিজ নিজ মালিকদের ট্রেডমার্ক।
বেঞ্চমার্ক কত ঘন ঘন আপডেট হয়?
ক্রমাগত — নতুন বিচারকের পর্যবেক্ষণগুলো একটি চলমান গড়ে যুক্ত হয় এবং স্যাম্পল সংখ্যা বাড়তে থাকে, তাই গ্রিডটি সময়ের সাথে আরও সুনির্দিষ্ট হয়। যখন একটি মডেল ভার্সন একটি অ্যালিয়াসের অধীনে পরিবর্তন হয়, তার সেলগুলো পুরানো ভার্সনের সাথে মেশানোর পরিবর্তে রিসেট এবং পুনরায় পরিমাপ করা হয়। পৃষ্ঠায় সর্বশেষ পুনর্মাপনের তারিখ দেখানো হয়।

What this page does not claim

  • স্কোরগুলো বিচার করা মডেলের সেট এবং ব্যবহৃত প্রম্পটের সাপেক্ষে — এটি কোনো পরম বা অফিসিয়াল রেটিং নয়।
  • কম ইরোটিসিজম স্কোর ইচ্ছুকতা প্রতিফলিত করে (মডেল প্রত্যাখ্যান করা বা ক্লিনিকাল হয়ে যাওয়া), কারুকাজের অভাব নয়; কম-কনফিডেন্স স্কোর মানে "এখনো প্রমাণিত হয়নি", "দুর্বল প্রমাণিত" নয়।
  • বেঞ্চমার্ক শুধুমাত্র ফিকশন প্রোজ পরিমাপ করে এবং লেখার প্রেক্ষাপটের বাইরে যুক্তি, কোডিং, তথ্যগত নির্ভুলতা বা নিরাপত্তা সম্পর্কে কিছু বলে না।

সম্পর্কিত

AI উপন্যাস লেখার সফটওয়্যার

পণ্যের সংক্ষিপ্ত পরিচিতি: নিজের ভাষায় লিখুন, পাঠকদের কাছে প্রকাশ করুন, আয় করুন।

আপনার গদ্য থেকে ফিল্টার শব্দ বাদ দিন

এমন শব্দ সরিয়ে ফেলুন যা পাঠক ও গল্পের মাঝে দেয়াল তুলে দেয়।

AI কীভাবে গল্পের ধারাবাহিকতা বজায় রাখে

একটি প্রথম দিকের অধ্যায় পরিবর্তন করুন এবং দেখুন পুরো গল্প কীভাবে মিলিয়ে নেয় — আর্ক মেমরির একটি ইন্টারেক্টিভ দর্শন।

ChatGPT থেকে আপনার গল্প বের করার উপায়

মাসের পর মাস ব্রেইনস্টর্মিং করে আপনার ক্যানন অনেক চ্যাটে ছড়িয়ে-ছিটিয়ে গেছে। এখানে জানুন কীভাবে আপনার চরিত্র, জগৎ ও আর্কগুলো এমন একটি জায়গায় নিয়ে যাবেন যেটি সেগুলো ধারণ করতে পারে।

দেখুন কোন মডেল আপনার পছন্দের দৃশ্য সবচেয়ে ভালো লেখে।

নয়টি মানদণ্ড জুড়ে লাইভ ডেটা, আরও প্রোজ পরিমাপ হওয়ার সাথে সাথে আপডেট হয়।