ফিকশন মডেল বেঞ্চমার্ক

কোন AI মডেল আসলে সেরা ফিকশন লেখে?

Live data · measured as of July 24, 2026

প্রতিটি মডেল কার্ড গণিত, কোডিং ও যুক্তিতর্ক পরিমাপ করে। কিন্তু কোনোটিই পরিমাপ করে না যে একটি মডেল এমন দৃশ্য লিখতে পারে কি না যা পাঠক এড়িয়ে যাবে না। তাই আমরা সেই বেঞ্চমার্ক তৈরি করেছি। একটি অন্ধ বিচারক প্যানেল ফ্রন্টিয়ার মডেলগুলোর আসল জেনারেট করা উপন্যাসের গদ্যকে নয়টি অক্ষে মূল্যায়ন করে — চারটি দক্ষতার জন্য, পাঁচটি বিভিন্ন দৃশ্যের ধরনের জন্য — এবং নিচের সংখ্যাগুলো হলো সরাসরি ফলাফল। এটি কোনো মার্কেটিং চার্ট নয়: এটি সেই গ্রিড যা Novelmint আপনার বইয়ের প্রতিটি বিটের জন্য মডেল বেছে নিতে ব্যবহার করে।

Key takeaways

  • বেঞ্চমার্কটি Anthropic, OpenAI, Google ও xAI-এর ফ্রন্টিয়ার মডেলগুলোকে আসল জেনারেট করা উপন্যাসের গদ্যে — মাল্টিপল চয়েস পরীক্ষায় নয় — নয়টি অক্ষে মূল্যায়ন করে: চারটি দক্ষতা (সাহিত্যিক, সংলাপ, বিশ্বস্ততা, গতি) এবং পাঁচটি বিষয়বস্তু (আবেগ, দৈহিকতা, দ্বন্দ্ব, রোমান্স, কামোদ্দীপনা)।
  • দক্ষতা অক্ষগুলো পরিমাপ করে একটি মডেল কতটা ভালো লেখে; বিষয়বস্তু অক্ষগুলো পরিমাপ করে কোন ধরনের দৃশ্য এটি ভালো লেখে। একটি মডেল সুন্দর বাক্য লিখতে পারে কিন্তু তবুও সমতল লড়াইয়ের দৃশ্য লিখতে পারে, তাই দুটি আলাদা রাখা হয়েছে এবং কখনো একটি বিভ্রান্তিকর একক সংখ্যায় গড় করা হয় না।
  • প্রতিটি স্কোরকে ডেটার পরিমাণের অনুপাতে একটি নিরপেক্ষ ৭০ বেসলাইনের দিকে সংকুচিত করা হয়, যাতে তিনটি নমুনার একটি ভাগ্যবান ফলাফল কখনো প্রতিষ্ঠিত সত্য বলে দেখাতে না পারে। প্রতিটি সংখ্যার পেছনে নমুনার আকার দেখানো হয়।
  • একটি মডেল সবকিছুতে জেতে না। সবচেয়ে শক্তিশালী সামগ্রিক সাহিত্যিক দক্ষতা, সবচেয়ে স্থির বিশ্বস্ততা, সেরা অ্যাকশন এবং সবচেয়ে সক্রিয় রোমান্স ও পরিণত লেখা ভিন্ন কলামে থাকে — যা একটি বই বিভিন্ন মডেলে রাউট করার পক্ষে মূল যুক্তি।
  • এটি সেই গ্রিড যা Novelmint একটি অধ্যায় তৈরির সময় প্রতিটি বিটের জন্য মডেল বেছে নিতে ব্যবহার করে — এবং যে বিচারক একটি বিল্ডের সময় একটি অনুচ্ছেদ স্কোর করেন তিনিই এটি আপডেট করেন, তাই লেখকরা ইঞ্জিন দিয়ে লেখার সাথে সাথে সংখ্যাগুলো আপডেট হতে থাকে। এটি একটি সরাসরি প্রক্রিয়া, পূর্ববর্তী দাবি নয়।

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

এটি সরাসরি ডেটা, একবারের পরীক্ষা নয়

নিচের টেবিলটি একটি বেঞ্চমার্ক নয় যা আমরা একবার চালিয়ে জমিয়ে রেখেছি। এটি প্ল্যাটফর্ম যে স্কোরিং স্টোরে চলে তার একটি সরাসরি প্রজেকশন: একই বিচারক যিনি একটি বিল্ডের সময় একটি অনুচ্ছেদ রেট করেন তিনি এই গ্রিড আপডেট করেন, তাই Novelmint-এ লেখা প্রতিটি অধ্যায় পর্যবেক্ষণ যোগ করে, নমুনার আকার বাড়ে এবং সংখ্যাগুলো তীক্ষ্ণ হয়। আরো বেশি লেখক ইঞ্জিন দিয়ে তৈরি করার সাথে সাথে বেঞ্চমার্ক আপডেট হতে থাকে — উপরের তারিখটি কেবল সাম্প্রতিকতম পুনর্ক্যালিব্রেশন।

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

গ্রিড কীভাবে পড়বেন

হেডলাইন সংখ্যাটি হলো সামগ্রিক দক্ষতা — একটি মডেলের চারটি কার্যকরী অক্ষের গড়, যা "এর গদ্য কতটা ভালো" এর সবচেয়ে কাছের জিনিস। ডানদিকের বিষয়বস্তু অক্ষগুলো ভালো-বা-খারাপ র‍্যাংকিং নয়; এগুলো বলে মডেলটি কীসের জন্য উপযুক্ত। উচ্চ দৈহিকতা স্কোর মানে পরিষ্কার অ্যাকশন; কম কামোদ্দীপনা স্কোর সাধারণত দুর্বল লেখার চেয়ে প্রত্যাখ্যান বা ক্লিনিকাল ফ্ল্যাটনেস — ইচ্ছা, দক্ষতা নয়। মডেলগুলো তুলনা করতে কলাম বরাবর দক্ষতা পড়ুন, এবং একটি মডেল কোথায় শক্তিশালী ও কোথায় নয় দেখতে সারি বরাবর বিষয়বস্তু পড়ুন।

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

আসল গদ্য তৈরি করুন, পরীক্ষার উত্তর নয়

প্রতিটি মডেল একই বিটগুলো লেখে — প্রয়োজনীয় উপাদান, নিষিদ্ধ জ্ঞান, একটি দৃষ্টিভঙ্গি এবং একটি নাটকীয় লক্ষ্যসহ ব্রিফ করা দৃশ্য — অভিন্ন পরিস্থিতিতে। আমরা এটি ফিকশন হিসেবে মূল্যায়ন করি, যেভাবে একজন সম্পাদক পড়েন, কোনো কুইজে এটি কতটা ভালো করে তা নয়।

02

নয়টি অক্ষে অন্ধভাবে স্কোর করুন

একটি বিচারক প্যানেল প্রতিটি অনুচ্ছেদকে চারটি দক্ষতা অক্ষে (সাহিত্যিক, সংলাপ, বিশ্বস্ততা, গতি) এবং পাঁচটি বিষয়বস্তু অক্ষে (আবেগ, দৈহিকতা, দ্বন্দ্ব, রোমান্স, কামোদ্দীপনা) ০–১০০ রেটিং দেয়, কোন মডেল লিখেছে তা না জেনে। দক্ষতা হলো কার্যকরী মান; বিষয়বস্তু হলো একটি দৃশ্যের ধরনের জন্য উপযুক্ততা।

03

নিরপেক্ষ পূর্বানুমানের দিকে সংকুচিত করুন

কয়েকটি নমুনা থেকে কাঁচা গড় হলো শুধু শোরগোল। প্রতিটি সেল তার প্রমাণ কতটা পাতলা তার অনুপাতে একটি নিরপেক্ষ ৭০ বেসলাইনের দিকে টানা হয়, তাই একটি প্রাথমিক, ভাগ্যবান পরিমাপ যথেষ্ট পর্যবেক্ষণ না হওয়া পর্যন্ত প্রায় গড় হিসেবে পড়া যায়। প্রকাশিত সংখ্যা এই সংকুচিত মান; পাশে নমুনার আকার দেখানো হয়।

04

ভাঁজ করতে থাকুন, হাতে কখনো ওভাররাইট করবেন না

নতুন বিচারকের পর্যবেক্ষণগুলো একটি চলমান গড়ে যুক্ত হয় এবং নমুনার সংখ্যা বাড়তে থাকে, তাই গ্রিড সময়ের সাথে তীক্ষ্ণ হয়। সংখ্যাগুলো পর্যবেক্ষণ থেকে পুনরায় তৈরি হয়, কখনো হাতে টাইপ করা হয় না, এবং যখন কোনো মডেল সংস্করণ পরিবর্তন হয় তখন তার সেলগুলো একটি পরিষ্কার পুনর্পরিমাপে রিসেট হয়, দুটি ভিন্ন মডেল মিশিয়ে না।

Where this leads

কেন এই ধরনের বেঞ্চমার্ক আদৌ ব্যবহারযোগ্য

একটি দৃশ্যের জন্য ভিন্ন মডেল বেছে নেওয়া তখনই কাজ করে যখন একটি বই পৃথক, ব্রিফ করা ইউনিটে তৈরি হয়, একটানা জেনারেট হয় না। সেই ইউনিট হলো বিট, এবং বিভিন্ন মডেল বিভিন্ন বিট লেখার সময় গল্পের সংগতি বজায় রাখা হলো আর্ক-ও-এন্টিটি মেমরির কাজ যা বিল্ডের সাথে চলে। বেঞ্চমার্ক হলো স্কোরবোর্ড; বিট এবং আর্ক মেমরি হলো যা একটি বইকে এটি আসলে ব্যবহার করতে দেয়।

Questions

Frequently asked

কোন AI মডেল সেরা ফিকশন লেখে?
সামগ্রিক দক্ষতায় — আসল উপন্যাসের গদ্যে সাহিত্যিক, সংলাপ, বিশ্বস্ততা এবং গতি অক্ষের গড় — Claude Opus 4.8 বর্তমানে এগিয়ে, GPT-5.6 Sol ঠিক পিছনে। কিন্তু "সেরা" নির্ভর করে দৃশ্যের উপর: অ্যাকশন, রোমান্স এবং পরিণত বিষয়বস্তুর সর্বোচ্চ স্কোর ভিন্ন মডেলে। এই পেজের গ্রিড বর্তমান অবস্থান এবং প্রতিটি সংখ্যার পেছনে নমুনার আকার দেখায়।
এই বেঞ্চমার্ক কীভাবে পরিমাপ করা হয়?
প্রতিটি মডেল অভিন্ন পরিস্থিতিতে একই ব্রিফ করা বিটগুলো লেখে, এবং একটি অন্ধ বিচারক প্যানেল ফলাফলের গদ্যকে নয়টি অক্ষে ০–১০০ স্কোর করে — চারটি দক্ষতার জন্য (সাহিত্যিক, সংলাপ, বিশ্বস্ততা, গতি) এবং পাঁচটি বিষয়বস্তুর ধরনের জন্য (আবেগ, দৈহিকতা, দ্বন্দ্ব, রোমান্স, কামোদ্দীপনা)। স্কোরগুলো একটি নিরপেক্ষ ৭০ বেসলাইনের দিকে সংকুচিত হয় যাতে পাতলা ডেটা সংখ্যা দোলাতে না পারে, এবং প্রতিটি স্কোরের পাশে নমুনার সংখ্যা দেখানো হয়।
দক্ষতা অক্ষ ও বিষয়বস্তু অক্ষের মধ্যে পার্থক্য কী?
দক্ষতা অক্ষগুলো পরিমাপ করে একটি মডেল বিষয় নির্বিশেষে কতটা ভালো লেখে — বাক্যের মান, চরিত্রের কণ্ঠস্বর, ব্রিফের প্রতি বিশ্বস্ততা এবং গতির নিয়ন্ত্রণ। বিষয়বস্তু অক্ষগুলো একটি দৃশ্যের ধরনের জন্য উপযুক্ততা পরিমাপ করে: আবেগ, শারীরিক অ্যাকশন, দ্বন্দ্ব, রোমান্স এবং পরিণত বিষয়বস্তু। একটি মডেল সুন্দর বাক্য লিখতে পারে কিন্তু তবুও লড়াইয়ের দৃশ্য দুর্বলভাবে পরিচালনা করতে পারে, তাই দুটি পরিবার আলাদাভাবে স্কোর করা ও দেখানো হয়।
কেন শুধু একটি সেরা মডেল বেছে সবকিছুর জন্য ব্যবহার করবেন না?
কারণ কোনো মডেল সব অক্ষে জেতে না। সবচেয়ে শক্তিশালী সাহিত্যিক দক্ষতা, সেরা অ্যাকশন এবং সবচেয়ে সক্ষম রোমান্স বা পরিণত লেখা ভিন্ন মডেলে। Novelmint বিট বাই বিট বিভিন্ন মডেলে একটি বই রাউট করে — সংগতির জন্য বেশিরভাগ একটি সিরিজ ভয়েসে রেখে এবং নির্দিষ্ট বিটে একটি শক্তিশালী মডেলে পরিবর্তন করে — যা কেবল সম্ভব কারণ এই গ্রিড আছে।
কম স্কোর মানে কি মডেলটি খারাপ?
অগত্যা নয়। কম বিষয়বস্তু স্কোর মানে হতে পারে মডেলটি সক্ষম কিন্তু অনিচ্ছুক — বেশিরভাগ মডেল কামোদ্দীপনায় কম স্কোর পায় কারণ তারা প্রত্যাখ্যান করে বা ক্লিনিকাল হয়, দক্ষতার অভাবে নয়। এবং কম-আত্মবিশ্বাস স্কোর (কম নমুনা) নিরপেক্ষ বেসলাইনের দিকে সংকুচিত, তাই এটি "এখনো প্রমাণিত নয়" হিসেবে পড়া যায়, "প্রমাণিতভাবে দুর্বল" নয়। সবসময় স্কোর এবং নমুনার আকার একসাথে পড়ুন।
বেঞ্চমার্ক কত ঘন ঘন আপডেট হয়?
ক্রমাগত। গ্রিডটি প্ল্যাটফর্মের স্কোরিং স্টোরের একটি সরাসরি প্রজেকশন: একই বিচারক যিনি Novelmint একটি অধ্যায় তৈরি করার সময় একটি অনুচ্ছেদ রেট করেন তার পর্যবেক্ষণগুলো ফিরিয়ে দেন, তাই লেখকরা ইঞ্জিন ব্যবহার করার সাথে সাথে এবং নমুনার আকার বাড়ার সাথে সাথে সংখ্যাগুলো পরিবর্তন হয়। পেজটি সাম্প্রতিকতম পুনর্ক্যালিব্রেশনের তারিখ দেখায়। নতুন মডেল সংস্করণগুলো শুরু থেকে পুনরায় পরিমাপ করা হয়, প্রতিস্থাপিত মডেলের সাথে মিশিয়ে নয়, তাই একটি সংস্করণ পরিবর্তন কখনো চুপচাপ একটি কলাম নষ্ট করে না।

What this page does not claim

  • এই বেঞ্চমার্ক শুধুমাত্র ফিকশনের জন্য গদ্যের মান ও বিষয়বস্তুর উপযুক্ততা পরিমাপ করে। একটি মডেলের যুক্তিতর্ক, কোডিং, গণিত, তথ্যগত নির্ভুলতা বা লেখার প্রসঙ্গের বাইরে নিরাপত্তা সম্পর্কে কিছু বলে না।
  • স্কোরগুলো বিচারিত সেট ও ব্যবহৃত প্রম্পটের সাপেক্ষে — মডেল প্রদানকারীদের দ্বারা অনুমোদিত কোনো পরম বা অফিসিয়াল রেটিং নয়। মডেলের নাম ও ট্রেডমার্ক তাদের নিজ নিজ মালিকদের।
  • উচ্চতর সামগ্রিক দক্ষতা স্কোর মানে এই নয় যে একটি মডেল প্রতিটি বইয়ের জন্য সঠিক পছন্দ — ভয়েস, ঘরানা, বিষয়বস্তুর প্রয়োজন এবং খরচ সবই গুরুত্বপূর্ণ, এবং এই কারণেই Novelmint মডেলগুলো জুড়ে রাউট করে, একটিকে মুকুট পরায় না।
  • কম-নমুনা সেলগুলো অস্থায়ী। যেখানে একটি সংখ্যায় কম পর্যবেক্ষণ আছে সেটি নিরপেক্ষ বেসলাইনের দিকে সংকুচিত ও চিহ্নিত, এবং আরো পরিমাপ যোগ হলে এটি পরিবর্তন হবে।

কোন মডেল ব্যবহার করবেন তা অনুমান করা বন্ধ করুন। বইটিকে বেছে নিতে দিন।

Novelmint প্রতিটি বিটকে সেই মডেলে রাউট করে যা এই গ্রিড বলে সবচেয়ে উপযুক্ত। আপনার প্রথম অধ্যায় বিনামূল্যে।