কোন AI মডেল আসলে সেরা ফিকশন লেখে?
Live data · measured as of July 24, 2026
প্রতিটি মডেল কার্ড গণিত, কোডিং ও যুক্তিতর্ক পরিমাপ করে। কিন্তু কোনোটিই পরিমাপ করে না যে একটি মডেল এমন দৃশ্য লিখতে পারে কি না যা পাঠক এড়িয়ে যাবে না। তাই আমরা সেই বেঞ্চমার্ক তৈরি করেছি। একটি অন্ধ বিচারক প্যানেল ফ্রন্টিয়ার মডেলগুলোর আসল জেনারেট করা উপন্যাসের গদ্যকে নয়টি অক্ষে মূল্যায়ন করে — চারটি দক্ষতার জন্য, পাঁচটি বিভিন্ন দৃশ্যের ধরনের জন্য — এবং নিচের সংখ্যাগুলো হলো সরাসরি ফলাফল। এটি কোনো মার্কেটিং চার্ট নয়: এটি সেই গ্রিড যা Novelmint আপনার বইয়ের প্রতিটি বিটের জন্য মডেল বেছে নিতে ব্যবহার করে।
Key takeaways
- বেঞ্চমার্কটি Anthropic, OpenAI, Google ও xAI-এর ফ্রন্টিয়ার মডেলগুলোকে আসল জেনারেট করা উপন্যাসের গদ্যে — মাল্টিপল চয়েস পরীক্ষায় নয় — নয়টি অক্ষে মূল্যায়ন করে: চারটি দক্ষতা (সাহিত্যিক, সংলাপ, বিশ্বস্ততা, গতি) এবং পাঁচটি বিষয়বস্তু (আবেগ, দৈহিকতা, দ্বন্দ্ব, রোমান্স, কামোদ্দীপনা)।
- দক্ষতা অক্ষগুলো পরিমাপ করে একটি মডেল কতটা ভালো লেখে; বিষয়বস্তু অক্ষগুলো পরিমাপ করে কোন ধরনের দৃশ্য এটি ভালো লেখে। একটি মডেল সুন্দর বাক্য লিখতে পারে কিন্তু তবুও সমতল লড়াইয়ের দৃশ্য লিখতে পারে, তাই দুটি আলাদা রাখা হয়েছে এবং কখনো একটি বিভ্রান্তিকর একক সংখ্যায় গড় করা হয় না।
- প্রতিটি স্কোরকে ডেটার পরিমাণের অনুপাতে একটি নিরপেক্ষ ৭০ বেসলাইনের দিকে সংকুচিত করা হয়, যাতে তিনটি নমুনার একটি ভাগ্যবান ফলাফল কখনো প্রতিষ্ঠিত সত্য বলে দেখাতে না পারে। প্রতিটি সংখ্যার পেছনে নমুনার আকার দেখানো হয়।
- একটি মডেল সবকিছুতে জেতে না। সবচেয়ে শক্তিশালী সামগ্রিক সাহিত্যিক দক্ষতা, সবচেয়ে স্থির বিশ্বস্ততা, সেরা অ্যাকশন এবং সবচেয়ে সক্রিয় রোমান্স ও পরিণত লেখা ভিন্ন কলামে থাকে — যা একটি বই বিভিন্ন মডেলে রাউট করার পক্ষে মূল যুক্তি।
- এটি সেই গ্রিড যা Novelmint একটি অধ্যায় তৈরির সময় প্রতিটি বিটের জন্য মডেল বেছে নিতে ব্যবহার করে — এবং যে বিচারক একটি বিল্ডের সময় একটি অনুচ্ছেদ স্কোর করেন তিনিই এটি আপডেট করেন, তাই লেখকরা ইঞ্জিন দিয়ে লেখার সাথে সাথে সংখ্যাগুলো আপডেট হতে থাকে। এটি একটি সরাসরি প্রক্রিয়া, পূর্ববর্তী দাবি নয়।
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
এটি সরাসরি ডেটা, একবারের পরীক্ষা নয়
নিচের টেবিলটি একটি বেঞ্চমার্ক নয় যা আমরা একবার চালিয়ে জমিয়ে রেখেছি। এটি প্ল্যাটফর্ম যে স্কোরিং স্টোরে চলে তার একটি সরাসরি প্রজেকশন: একই বিচারক যিনি একটি বিল্ডের সময় একটি অনুচ্ছেদ রেট করেন তিনি এই গ্রিড আপডেট করেন, তাই Novelmint-এ লেখা প্রতিটি অধ্যায় পর্যবেক্ষণ যোগ করে, নমুনার আকার বাড়ে এবং সংখ্যাগুলো তীক্ষ্ণ হয়। আরো বেশি লেখক ইঞ্জিন দিয়ে তৈরি করার সাথে সাথে বেঞ্চমার্ক আপডেট হতে থাকে — উপরের তারিখটি কেবল সাম্প্রতিকতম পুনর্ক্যালিব্রেশন।
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
গ্রিড কীভাবে পড়বেন
হেডলাইন সংখ্যাটি হলো সামগ্রিক দক্ষতা — একটি মডেলের চারটি কার্যকরী অক্ষের গড়, যা "এর গদ্য কতটা ভালো" এর সবচেয়ে কাছের জিনিস। ডানদিকের বিষয়বস্তু অক্ষগুলো ভালো-বা-খারাপ র্যাংকিং নয়; এগুলো বলে মডেলটি কীসের জন্য উপযুক্ত। উচ্চ দৈহিকতা স্কোর মানে পরিষ্কার অ্যাকশন; কম কামোদ্দীপনা স্কোর সাধারণত দুর্বল লেখার চেয়ে প্রত্যাখ্যান বা ক্লিনিকাল ফ্ল্যাটনেস — ইচ্ছা, দক্ষতা নয়। মডেলগুলো তুলনা করতে কলাম বরাবর দক্ষতা পড়ুন, এবং একটি মডেল কোথায় শক্তিশালী ও কোথায় নয় দেখতে সারি বরাবর বিষয়বস্তু পড়ুন।
Best AI for…
A straight answer for one kind of scene — or one genre
By what your scene needs
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
আসল গদ্য তৈরি করুন, পরীক্ষার উত্তর নয়
প্রতিটি মডেল একই বিটগুলো লেখে — প্রয়োজনীয় উপাদান, নিষিদ্ধ জ্ঞান, একটি দৃষ্টিভঙ্গি এবং একটি নাটকীয় লক্ষ্যসহ ব্রিফ করা দৃশ্য — অভিন্ন পরিস্থিতিতে। আমরা এটি ফিকশন হিসেবে মূল্যায়ন করি, যেভাবে একজন সম্পাদক পড়েন, কোনো কুইজে এটি কতটা ভালো করে তা নয়।
নয়টি অক্ষে অন্ধভাবে স্কোর করুন
একটি বিচারক প্যানেল প্রতিটি অনুচ্ছেদকে চারটি দক্ষতা অক্ষে (সাহিত্যিক, সংলাপ, বিশ্বস্ততা, গতি) এবং পাঁচটি বিষয়বস্তু অক্ষে (আবেগ, দৈহিকতা, দ্বন্দ্ব, রোমান্স, কামোদ্দীপনা) ০–১০০ রেটিং দেয়, কোন মডেল লিখেছে তা না জেনে। দক্ষতা হলো কার্যকরী মান; বিষয়বস্তু হলো একটি দৃশ্যের ধরনের জন্য উপযুক্ততা।
নিরপেক্ষ পূর্বানুমানের দিকে সংকুচিত করুন
কয়েকটি নমুনা থেকে কাঁচা গড় হলো শুধু শোরগোল। প্রতিটি সেল তার প্রমাণ কতটা পাতলা তার অনুপাতে একটি নিরপেক্ষ ৭০ বেসলাইনের দিকে টানা হয়, তাই একটি প্রাথমিক, ভাগ্যবান পরিমাপ যথেষ্ট পর্যবেক্ষণ না হওয়া পর্যন্ত প্রায় গড় হিসেবে পড়া যায়। প্রকাশিত সংখ্যা এই সংকুচিত মান; পাশে নমুনার আকার দেখানো হয়।
ভাঁজ করতে থাকুন, হাতে কখনো ওভাররাইট করবেন না
নতুন বিচারকের পর্যবেক্ষণগুলো একটি চলমান গড়ে যুক্ত হয় এবং নমুনার সংখ্যা বাড়তে থাকে, তাই গ্রিড সময়ের সাথে তীক্ষ্ণ হয়। সংখ্যাগুলো পর্যবেক্ষণ থেকে পুনরায় তৈরি হয়, কখনো হাতে টাইপ করা হয় না, এবং যখন কোনো মডেল সংস্করণ পরিবর্তন হয় তখন তার সেলগুলো একটি পরিষ্কার পুনর্পরিমাপে রিসেট হয়, দুটি ভিন্ন মডেল মিশিয়ে না।
Where this leads
কেন এই ধরনের বেঞ্চমার্ক আদৌ ব্যবহারযোগ্য
একটি দৃশ্যের জন্য ভিন্ন মডেল বেছে নেওয়া তখনই কাজ করে যখন একটি বই পৃথক, ব্রিফ করা ইউনিটে তৈরি হয়, একটানা জেনারেট হয় না। সেই ইউনিট হলো বিট, এবং বিভিন্ন মডেল বিভিন্ন বিট লেখার সময় গল্পের সংগতি বজায় রাখা হলো আর্ক-ও-এন্টিটি মেমরির কাজ যা বিল্ডের সাথে চলে। বেঞ্চমার্ক হলো স্কোরবোর্ড; বিট এবং আর্ক মেমরি হলো যা একটি বইকে এটি আসলে ব্যবহার করতে দেয়।
Questions
Frequently asked
- কোন AI মডেল সেরা ফিকশন লেখে?
- সামগ্রিক দক্ষতায় — আসল উপন্যাসের গদ্যে সাহিত্যিক, সংলাপ, বিশ্বস্ততা এবং গতি অক্ষের গড় — Claude Opus 4.8 বর্তমানে এগিয়ে, GPT-5.6 Sol ঠিক পিছনে। কিন্তু "সেরা" নির্ভর করে দৃশ্যের উপর: অ্যাকশন, রোমান্স এবং পরিণত বিষয়বস্তুর সর্বোচ্চ স্কোর ভিন্ন মডেলে। এই পেজের গ্রিড বর্তমান অবস্থান এবং প্রতিটি সংখ্যার পেছনে নমুনার আকার দেখায়।
- এই বেঞ্চমার্ক কীভাবে পরিমাপ করা হয়?
- প্রতিটি মডেল অভিন্ন পরিস্থিতিতে একই ব্রিফ করা বিটগুলো লেখে, এবং একটি অন্ধ বিচারক প্যানেল ফলাফলের গদ্যকে নয়টি অক্ষে ০–১০০ স্কোর করে — চারটি দক্ষতার জন্য (সাহিত্যিক, সংলাপ, বিশ্বস্ততা, গতি) এবং পাঁচটি বিষয়বস্তুর ধরনের জন্য (আবেগ, দৈহিকতা, দ্বন্দ্ব, রোমান্স, কামোদ্দীপনা)। স্কোরগুলো একটি নিরপেক্ষ ৭০ বেসলাইনের দিকে সংকুচিত হয় যাতে পাতলা ডেটা সংখ্যা দোলাতে না পারে, এবং প্রতিটি স্কোরের পাশে নমুনার সংখ্যা দেখানো হয়।
- দক্ষতা অক্ষ ও বিষয়বস্তু অক্ষের মধ্যে পার্থক্য কী?
- দক্ষতা অক্ষগুলো পরিমাপ করে একটি মডেল বিষয় নির্বিশেষে কতটা ভালো লেখে — বাক্যের মান, চরিত্রের কণ্ঠস্বর, ব্রিফের প্রতি বিশ্বস্ততা এবং গতির নিয়ন্ত্রণ। বিষয়বস্তু অক্ষগুলো একটি দৃশ্যের ধরনের জন্য উপযুক্ততা পরিমাপ করে: আবেগ, শারীরিক অ্যাকশন, দ্বন্দ্ব, রোমান্স এবং পরিণত বিষয়বস্তু। একটি মডেল সুন্দর বাক্য লিখতে পারে কিন্তু তবুও লড়াইয়ের দৃশ্য দুর্বলভাবে পরিচালনা করতে পারে, তাই দুটি পরিবার আলাদাভাবে স্কোর করা ও দেখানো হয়।
- কেন শুধু একটি সেরা মডেল বেছে সবকিছুর জন্য ব্যবহার করবেন না?
- কারণ কোনো মডেল সব অক্ষে জেতে না। সবচেয়ে শক্তিশালী সাহিত্যিক দক্ষতা, সেরা অ্যাকশন এবং সবচেয়ে সক্ষম রোমান্স বা পরিণত লেখা ভিন্ন মডেলে। Novelmint বিট বাই বিট বিভিন্ন মডেলে একটি বই রাউট করে — সংগতির জন্য বেশিরভাগ একটি সিরিজ ভয়েসে রেখে এবং নির্দিষ্ট বিটে একটি শক্তিশালী মডেলে পরিবর্তন করে — যা কেবল সম্ভব কারণ এই গ্রিড আছে।
- কম স্কোর মানে কি মডেলটি খারাপ?
- অগত্যা নয়। কম বিষয়বস্তু স্কোর মানে হতে পারে মডেলটি সক্ষম কিন্তু অনিচ্ছুক — বেশিরভাগ মডেল কামোদ্দীপনায় কম স্কোর পায় কারণ তারা প্রত্যাখ্যান করে বা ক্লিনিকাল হয়, দক্ষতার অভাবে নয়। এবং কম-আত্মবিশ্বাস স্কোর (কম নমুনা) নিরপেক্ষ বেসলাইনের দিকে সংকুচিত, তাই এটি "এখনো প্রমাণিত নয়" হিসেবে পড়া যায়, "প্রমাণিতভাবে দুর্বল" নয়। সবসময় স্কোর এবং নমুনার আকার একসাথে পড়ুন।
- বেঞ্চমার্ক কত ঘন ঘন আপডেট হয়?
- ক্রমাগত। গ্রিডটি প্ল্যাটফর্মের স্কোরিং স্টোরের একটি সরাসরি প্রজেকশন: একই বিচারক যিনি Novelmint একটি অধ্যায় তৈরি করার সময় একটি অনুচ্ছেদ রেট করেন তার পর্যবেক্ষণগুলো ফিরিয়ে দেন, তাই লেখকরা ইঞ্জিন ব্যবহার করার সাথে সাথে এবং নমুনার আকার বাড়ার সাথে সাথে সংখ্যাগুলো পরিবর্তন হয়। পেজটি সাম্প্রতিকতম পুনর্ক্যালিব্রেশনের তারিখ দেখায়। নতুন মডেল সংস্করণগুলো শুরু থেকে পুনরায় পরিমাপ করা হয়, প্রতিস্থাপিত মডেলের সাথে মিশিয়ে নয়, তাই একটি সংস্করণ পরিবর্তন কখনো চুপচাপ একটি কলাম নষ্ট করে না।
What this page does not claim
- এই বেঞ্চমার্ক শুধুমাত্র ফিকশনের জন্য গদ্যের মান ও বিষয়বস্তুর উপযুক্ততা পরিমাপ করে। একটি মডেলের যুক্তিতর্ক, কোডিং, গণিত, তথ্যগত নির্ভুলতা বা লেখার প্রসঙ্গের বাইরে নিরাপত্তা সম্পর্কে কিছু বলে না।
- স্কোরগুলো বিচারিত সেট ও ব্যবহৃত প্রম্পটের সাপেক্ষে — মডেল প্রদানকারীদের দ্বারা অনুমোদিত কোনো পরম বা অফিসিয়াল রেটিং নয়। মডেলের নাম ও ট্রেডমার্ক তাদের নিজ নিজ মালিকদের।
- উচ্চতর সামগ্রিক দক্ষতা স্কোর মানে এই নয় যে একটি মডেল প্রতিটি বইয়ের জন্য সঠিক পছন্দ — ভয়েস, ঘরানা, বিষয়বস্তুর প্রয়োজন এবং খরচ সবই গুরুত্বপূর্ণ, এবং এই কারণেই Novelmint মডেলগুলো জুড়ে রাউট করে, একটিকে মুকুট পরায় না।
- কম-নমুনা সেলগুলো অস্থায়ী। যেখানে একটি সংখ্যায় কম পর্যবেক্ষণ আছে সেটি নিরপেক্ষ বেসলাইনের দিকে সংকুচিত ও চিহ্নিত, এবং আরো পরিমাপ যোগ হলে এটি পরিবর্তন হবে।
সম্পর্কিত
অ্যাকশন দৃশ্যের জন্য সেরা AI
কোন AI একটি লড়াই বা তাড়া স্পষ্ট এবং বাস্তবসম্মত রাখে বদলে অস্পষ্ট না করে। শারীরিকতার উপর র্যাঙ্কড।
দ্বন্দ্ব দৃশ্যের জন্য সেরা AI
কোন AI একটি তর্ক বা মুখোমুখি পরিস্থিতি টানটান ও ঊর্ধ্বমুখী রাখে। পরিমাপ করা দ্বন্দ্বের উপর র্যাঙ্কড।
আবেগময় দৃশ্যের জন্য সেরা AI
কোন AI অনুভূতি-নির্ভর দৃশ্যকে শুধু বর্ণনা না করে সত্যিকার প্রভাব ফেলতে পারে। আবেগের উপর র্যাঙ্কড।
স্পষ্ট দৃশ্যের জন্য সেরা AI
কোন AI আসলে স্পষ্ট প্রাপ্তবয়স্ক বিষয়বস্তু লিখবে — আর কোনটা অস্বীকার করে। ইচ্ছায় র্যাংক করা।
কোন মডেল ব্যবহার করবেন তা অনুমান করা বন্ধ করুন। বইটিকে বেছে নিতে দিন।
Novelmint প্রতিটি বিটকে সেই মডেলে রাউট করে যা এই গ্রিড বলে সবচেয়ে উপযুক্ত। আপনার প্রথম অধ্যায় বিনামূল্যে।