کون سا AI ماڈل واقعی بہترین فکشن لکھتا ہے؟
Live data · measured as of July 24, 2026
ہر ماڈل کارڈ ریاضی، کوڈنگ اور استدلال ناپتا ہے۔ کوئی بھی یہ نہیں ناپتا کہ آیا ماڈل ایسا منظر لکھ سکتا ہے جسے قاری نہ چھوڑے۔ تو ہم نے وہ بینچ مارک بنایا جو یہ ناپتا ہے۔ ایک بلائنڈ جج پینل فرنٹیئر ماڈلز کی حقیقی تخلیق شدہ ناول نثر کو نو محوروں پر اسکور کرتا ہے — چار فن کے لیے، پانچ کتاب میں موجود مناظر کی اقسام کے لیے — اور نیچے دیے گئے اعداد لائیو نتائج ہیں۔ یہ کوئی مارکیٹنگ چارٹ نہیں: یہ وہی گرڈ ہے جسے Novelmint آپ کی کتاب کے ہر موڑ کے لیے ماڈل چنتے وقت استعمال کرتا ہے۔
Key takeaways
- یہ بینچ مارک Anthropic، OpenAI، Google اور xAI کے فرنٹیئر ماڈلز کو حقیقی تخلیق شدہ ناول نثر پر — نہ کہ ملٹیپل چوائس ٹیسٹوں پر — نو محوروں میں اسکور کرتا ہے: چار فنی (ادبی، مکالمہ، وفاداری، رفتار) اور پانچ مواد (جذبات، جسمانیت، تنازع، رومانس، ایروٹزم)۔
- فنی محور یہ ناپتے ہیں کہ ماڈل کتنا اچھا لکھتا ہے؛ مواد محور یہ ناپتے ہیں کہ وہ کس قسم کا منظر اچھا لکھتا ہے۔ ایک ماڈل خوبصورت جملے لکھ سکتا ہے اور پھر بھی بے جان لڑائی کے مناظر لکھے، اس لیے دونوں الگ رکھے گئے ہیں اور کبھی کسی گمراہ کن واحد نمبر میں اوسط نہیں لیے جاتے۔
- ہر اسکور کو اس کے پیچھے موجود ڈیٹا کی مقدار کے تناسب سے 70 کی غیرجانبدار بیس لائن کی طرف اعتماد سے سکیڑا جاتا ہے، تاکہ تین نمونوں کا خوش قسمت نتیجہ کبھی کسی طے شدہ حقیقت کا بھیس نہ اختیار کر سکے۔ ہر نمبر کے پیچھے نمونوں کی تعداد دکھائی جاتی ہے۔
- کوئی ایک ماڈل سب کچھ نہیں جیتتا۔ سب سے مضبوط ادبی فن، سب سے مستقل وفاداری، بہترین ایکشن، اور سب سے زیادہ تیار رومانس اور صریح تحریر مختلف کالموں میں ہے — یہی پوری دلیل ہے کہ کتاب کو ایک ماڈل چننے کی بجائے ماڈلز میں تقسیم کیا جائے۔
- یہ وہی گرڈ ہے جسے Novelmint کسی باب کی تعمیر کے دوران ہر موڑ کے لیے ماڈل منتخب کرنے میں استعمال کرتا ہے — اور جو جج تعمیر کے دوران کسی اقتباس کو اسکور کرتا ہے وہ اسے فیڈ کرتا ہے، تو جیسے جیسے مصنفین انجن سے لکھتے ہیں نمبر اپ ڈیٹ ہوتے رہتے ہیں۔ یہ ایک لائیو میکانزم ہے، کوئی پرانا دعویٰ نہیں۔
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
یہ لائیو ڈیٹا ہے، ایک بار کا ٹیسٹ نہیں
نیچے دی گئی ٹیبل کوئی بینچ مارک نہیں جو ہم نے ایک بار چلایا اور منجمد کر دیا۔ یہ اسکورنگ اسٹور کا لائیو عکس ہے جس پر پلیٹ فارم چلتا ہے: جو جج تعمیر کے دوران کسی اقتباس کو اسکور کرتا ہے وہ اس گرڈ کو فیڈ کرتا ہے، تو Novelmint پر لکھا ہر باب مشاہدات شامل کرتا ہے، نمونہ سائز بڑھتا ہے، اور نمبر تیز ہوتے جاتے ہیں۔ جیسے جیسے زیادہ مصنفین انجن سے تعمیر کرتے ہیں، بینچ مارک اپ ڈیٹ ہوتا رہتا ہے — اوپر دی گئی تاریخ صرف سب سے حالیہ ری کیلیبریشن ہے۔
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
گرڈ کیسے پڑھیں
سرخی نمبر مجموعی فن ہے — ماڈل کے چار عمل محوروں کی اوسط، جو "اس کی نثر کتنی اچھی ہے" کے سب سے قریب ہے۔ دائیں جانب کے مواد محور بہتر یا بدتر رینکنگ نہیں ہیں؛ یہ بتاتے ہیں کہ ماڈل کس چیز کے لیے موزون ہے۔ جسمانیت کا اعلیٰ اسکور صاف ایکشن کا مطلب ہے؛ ایروٹزم کا کم اسکور عام طور پر لکھائی کی کمزوری نہیں بلکہ انکار یا طبی بے رنگی ہے — ہنر نہیں، آمادگی۔ ماڈلز کا موازنہ کرنے کے لیے کالم نیچے پڑھیں، اور ایک ماڈل کی طاقت اور کمزوری دیکھنے کے لیے قطار میں پار پڑھیں۔
Best AI for…
A straight answer for one kind of scene — or one genre
By what your scene needs
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
حقیقی نثر تخلیق کریں، ٹیسٹ کے جوابات نہیں
ہر ماڈل ایک جیسے موڑ لکھتا ہے — مختصر بریف شدہ مناظر جن میں ضروری عناصر، ممنوعہ معلومات، نقطہ نظر اور ڈرامائی ہدف ہوتا ہے — ایک جیسے حالات میں۔ ہم اسے فکشن کی طرح اسکور کرتے ہیں، جیسے کوئی ایڈیٹر پڑھتا ہے، نہ کہ کسی کوئز کی کارکردگی کی طرح۔
بلائنڈ اسکوریگ، نو محوروں پر
ایک جج پینل ہر اقتباس کو چار فنی محوروں (ادبی، مکالمہ، وفاداری، رفتار) اور پانچ مواد محوروں (جذبات، جسمانیت، تنازع، رومانس، ایروٹزم) پر 0–100 پر اسکور کرتا ہے، بغیر یہ جانے کہ اسے کس ماڈل نے لکھا۔ فن عمل کا معیار ہے؛ مواد کسی منظر کی قسم کے لیے موزونیت ہے۔
غیرجانبدار پیشگی کی طرف سکیڑیں
چند نمونوں سے خام اوسط محض شور ہے۔ ہر سیل کو اس کے ثبوت کی کمزوری کے تناسب سے 70 کی غیرجانبدار بیس لائن کی طرف کھینچا جاتا ہے، تاکہ ابتدائی خوش قسمت پیمائش تقریباً اوسط لگے جب تک کافی مشاہدات اسے جگہ نہ دلوائیں۔ شائع شدہ نمبر یہی سکڑا ہوا قدر ہے؛ نمونے کی تعداد اس کے ساتھ دکھائی جاتی ہے۔
جوڑتے رہیں، ہاتھ سے کبھی نہ لکھیں
نئے جج مشاہدات چلتی اوسط میں شامل ہوتے ہیں اور نمونہ گنتی بڑھتی ہے، تو وقت کے ساتھ گرڈ تیز ہوتا جاتا ہے۔ اعداد مشاہدات سے دوبارہ تیار کیے جاتے ہیں، کبھی ہاتھ سے نہیں ٹائپ کیے جاتے، اور جب کسی عرفی نام کے پیچھے ماڈل کا ورژن بدلتا ہے تو اس کے سیل صاف دوبارہ پیمائش پر ری سیٹ ہو جاتے ہیں نہ کہ دو مختلف ماڈلز کو ملایا جاتا ہے۔
Where this leads
اس قسم کا بینچ مارک استعمال کیوں کیا جا سکتا ہے
کسی ایک منظر کے لیے مختلف ماڈل چننا تبھی کام کرتا ہے جب کتاب الگ الگ بریف شدہ اکائیوں میں بنائی جائے نہ کہ ایک ہی پاس میں تخلیق ہو۔ وہ اکائی موڑ ہے، اور کہانی کو مربوط رکھنا جب مختلف ماڈل مختلف موڑ لکھتے ہیں ایک آرک اور ہستی میموری کا کام ہے جو تعمیر کے ساتھ چلتی ہے۔ بینچ مارک اسکور بورڈ ہے؛ موڑ اور آرک میموری وہ ہیں جو کتاب کو اسے اصل میں خرچ کرنے دیتے ہیں۔
Questions
Frequently asked
- کون سا AI ماڈل بہترین فکشن لکھتا ہے؟
- مجموعی فن کے لحاظ سے — حقیقی ناول نثر پر ادبی، مکالمہ، وفاداری اور رفتار محوروں کی اوسط — Claude Opus 4.8 فی الحال آگے ہے، GPT-5.6 Sol قریب ہے۔ لیکن "بہترین" منظر پر منحصر ہے: ایکشن، رومانس اور صریح مواد کے لیے سب سے اعلیٰ اسکور مختلف ماڈلز کے پاس ہیں۔ اس صفحے کا گرڈ موجودہ حیثیت اور ہر نمبر کے پیچھے نمونہ سائز دکھاتا ہے۔
- یہ بینچ مارک کیسے ناپا جاتا ہے؟
- ہر ماڈل ایک جیسے حالات میں ایک جیسے بریف شدہ موڑ لکھتا ہے، اور ایک بلائنڈ جج پینل نتیجے میں آنے والی نثر کو نو محوروں پر 0–100 اسکور کرتا ہے — چار فن کے لیے (ادبی، مکالمہ، وفاداری، رفتار) اور پانچ مواد کی قسم کے لیے (جذبات، جسمانیت، تنازع، رومانس، ایروٹزم)۔ اسکورز کو غیرجانبدار 70 بیس لائن کی طرف اعتماد سے سکیڑا جاتا ہے تاکہ کم ڈیٹا کوئی نمبر نہ ہلا سکے، اور ہر اسکور کے ساتھ نمونہ گنتی دکھائی جاتی ہے۔
- فنی محوروں اور مواد محوروں میں کیا فرق ہے؟
- فنی محور یہ ناپتے ہیں کہ ماڈل موضوع سے قطع نظر کتنا اچھا لکھتا ہے — جملے کا معیار، کردار کی آواز، بریف کی وفاداری، اور رفتار پر قابو۔ مواد محور کسی منظر کی قسم کے لیے موزونیت ناپتے ہیں: جذبات، جسمانی ایکشن، تنازع، رومانس اور صریح مواد۔ ایک ماڈل خوبصورت جملے لکھ سکتا ہے اور پھر بھی لڑائی کا منظر خراب لکھے، اس لیے دونوں خاندان الگ الگ اسکور کیے اور دکھائے جاتے ہیں۔
- سب سے اچھا ماڈل چن کر ہر چیز کے لیے استعمال کیوں نہ کریں؟
- کیونکہ کوئی ایک ماڈل ہر محور نہیں جیتتا۔ سب سے مضبوط ادبی فن، بہترین ایکشن، اور سب سے قابل رومانس یا صریح تحریر مختلف ماڈلز کے پاس ہے۔ Novelmint کتاب کو موڑ بہ موڑ ماڈلز میں تقسیم کرتا ہے — بڑی تعداد کو ایک سیریز آواز میں رکھ کر اور مخصوص موڑوں پر مضبوط ماڈل کی طرف جا کر — جو صرف اس لیے ممکن ہے کیونکہ یہ گرڈ موجود ہے۔
- کم اسکور کا مطلب کیا ماڈل خراب ہے؟
- ضروری نہیں۔ کم مواد اسکور کا مطلب یہ ہو سکتا ہے کہ ماڈل قابل ہے لیکن آمادہ نہیں — زیادہ تر ماڈلز ایروٹزم پر کم اسکور کرتے ہیں کیونکہ وہ انکار کرتے ہیں یا طبی انداز اختیار کرتے ہیں، ہنر کی کمی کی وجہ سے نہیں۔ اور کم اعتماد اسکور (کم نمونے) کو غیرجانبدار بیس لائن کی طرف سکیڑا جاتا ہے، تو یہ "ابھی ثابت نہیں" پڑھا جاتا ہے، "ثابتاً کمزور" نہیں۔ ہمیشہ اسکور کو اس کے نمونہ سائز کے ساتھ پڑھیں۔
- بینچ مارک کتنی بار اپ ڈیٹ ہوتا ہے؟
- مسلسل۔ گرڈ پلیٹ فارم کے اسکورنگ اسٹور کا لائیو عکس ہے: جو جج Novelmint کے باب بناتے وقت کسی اقتباس کو اسکور کرتا ہے وہ اپنے مشاہدات واپس جوڑتا ہے، تو نمبر مصنفین کے انجن استعمال کرنے کے ساتھ ساتھ بدلتے ہیں اور نمونے کا سائز بڑھتا ہے۔ صفحہ سب سے حالیہ ری کیلیبریشن کی تاریخ دکھاتا ہے۔ نئے ماڈل ورژنز کو شروع سے دوبارہ ناپا جاتا ہے نہ کہ ان کے پیشرو کے ساتھ ملایا جاتا ہے، تاکہ ورژن تبدیلی کبھی خاموشی سے کالم کو خراب نہ کرے۔
What this page does not claim
- یہ بینچ مارک صرف فکشن کے لیے نثر کے معیار اور مواد کی موزونیت ناپتا ہے۔ یہ ماڈل کی استدلال، کوڈنگ، ریاضی، حقائق کی درستگی، یا تحریر کے سیاق سے باہر حفاظت کے بارے میں کچھ نہیں کہتا۔
- اسکورز جانچے گئے سیٹ اور استعمال شدہ پرامپٹس کے نسبتی ہیں، کوئی مطلق یا ماڈل فراہم کنندگان کی طرف سے تسلیم شدہ سرکاری درجہ بندی نہیں۔ ماڈل کے نام اور ٹریڈ مارک ان کے متعلقہ مالکان کے ہیں۔
- مجموعی فن کا اعلیٰ اسکور یہ نہیں کہتا کہ ماڈل ہر کتاب کے لیے درست انتخاب ہے — آواز، صنف، مواد کی ضروریات اور لاگت سب اہم ہیں، یہی وجہ ہے کہ Novelmint ایک کو فاتح قرار دینے کی بجائے ماڈلز میں تقسیم کرتا ہے۔
- کم نمونوں والے سیل عارضی ہیں۔ جہاں کسی نمبر کے پیچھے کم مشاہدات ہیں اسے غیرجانبدار بیس لائن کی طرف سکیڑا اور نشان لگایا جاتا ہے، اور یہ مزید پیمائشیں شامل ہونے کے ساتھ بدل جائے گا۔
متعلقہ
ایکشن مناظر کے لیے بہترین AI
کون سا AI لڑائی یا تعاقب کو واضح اور ٹھوس رکھتا ہے بجائے مبہم کے۔ جسمانیت کی بنیاد پر درجہ بند۔
تنازع کے مناظر کے لیے بہترین AI
کون سا AI بحث یا تعطل کو تناؤ بھرا اور بڑھتا ہوا رکھتا ہے۔ ناپے گئے تنازع کی بنیاد پر درجہ بند۔
جذباتی مناظر کے لیے بہترین AI
کون سا AI احساس پر مبنی منظر کو محض بیان کرنے کی بجائے دل میں اتارتا ہے۔ جذبے کی بنیاد پر درجہ بند۔
واضح مناظر کے لیے بہترین AI
کون سا AI دراصل واضح بالغ مواد لکھے گا — اور کون انکار کرے گا۔ آمادگی پر درجہ بندی۔
اندازہ لگانا چھوڑیں۔ کتاب کو خود چنے دیں۔
Novelmint ہر موڑ کو اس ماڈل کی طرف بھیجتا ہے جسے یہ گرڈ سب سے موزون کہتا ہے۔ آپ کا پہلا باب مفت ہے۔