کدام مدل هوش مصنوعی واقعاً بهترین داستان را مینویسد؟
Live data · measured as of July 24, 2026
هر کارت مدل ریاضیات، کدنویسی و استدلال را میسنجد. هیچکدام نمیسنجند که آیا مدل میتواند صحنهای بنویسد که خواننده از آن رد نشود. پس ما این معیار را ساختیم. یک هیئت داوران کور، متن واقعی تولیدشده از مدلهای پیشرفته را بر اساس نه محور امتیاز میدهد — چهار محور تخصصی و پنج محور برای انواع صحنههای یک کتاب — و اعداد زیر نتیجه زنده این سنجش است. این یک نمودار تبلیغاتی نیست: این همان جدول دقیقی است که Novelmint برای انتخاب مدل در هر بخش از کتاب شما از آن استفاده میکند.
Key takeaways
- این معیار، مدلهای پیشرفته Anthropic، OpenAI، Google و xAI را بر روی متن واقعی تولیدشده رمان — نه آزمونهای چندگزینهای — در نه محور میسنجد: چهار محور تخصصی (ادبی، دیالوگ، وفاداری، ریتم) و پنج محور محتوایی (احساسات، جسمانیت، تعارض، رمانس، اروتیسم).
- محورهای تخصصی میسنجند که مدل چقدر خوب مینویسد؛ محورهای محتوایی میسنجند که چه نوع صحنهای را خوب مینویسد. یک مدل میتواند جملات زیبایی داشته باشد و در عین حال صحنههای درگیری کسلکننده بنویسد، پس این دو از هم جدا نگه داشته میشوند و هرگز در یک عدد گمراهکننده ادغام نمیشوند.
- هر امتیاز با توجه به میزان داده پشت آن به سمت پایه بیطرف ۷۰ کشیده میشود، پس یک نتیجه خوششانس با سه نمونه نمیتواند خود را بهعنوان واقعیتی قطعی نشان دهد. حجم نمونه پشت هر عدد نمایش داده میشود.
- هیچ مدل واحدی در همه چیز برنده نیست. قویترین تخصص ادبی، ثابتترین وفاداری، بهترین اکشن، و بیشترین تمایل در رمانس و نوشتار بزرگسالان در ستونهای مختلف قرار دارند — که این خود دلیلی است برای تقسیم یک کتاب بین مدلهای مختلف به جای انتخاب یکی.
- این همان جدولی است که Novelmint برای انتخاب مدل در هر بخش هنگام ساخت فصل استفاده میکند — و همان داوری که در حین ساخت یک متن امتیاز میدهد داده را تغذیه میکند، پس اعداد با نوشتن نویسندگان با موتور بهروز میمانند. این یک مکانیزم زنده است، نه ادعایی گذشتهنگر.
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
این داده زنده است، نه یک آزمون یکبار
جدول زیر معیاری نیست که یکبار اجرا کردهایم و منجمد کردهایم. این یک تصویر زنده از مخزن امتیازدهی پلتفرم است: همان داوری که در حین ساخت یک متن آن را ارزیابی میکند، این جدول را تغذیه میکند، پس هر فصل نوشتهشده در Novelmint مشاهدات جدید اضافه میکند، حجم نمونه رشد میکند و اعداد دقیقتر میشوند. با نوشتن نویسندگان بیشتر با موتور، معیار بهروزرسانی میشود — تاریخ بالا صرفاً آخرین کالیبراسیون است.
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
نحوه خواندن جدول
عدد اصلی، تخصص کلی است — میانگین چهار محور اجرایی مدل، که نزدیکترین چیز به «متن آن چقدر خوب است» میباشد. محورهای محتوایی در سمت راست رتبهبندی بهتر-یا-بدتر نیستند؛ آنها نشان میدهند مدل برای چه کاری مناسب است. امتیاز بالای جسمانیت یعنی اکشن روشن؛ امتیاز پایین اروتیسم معمولاً یعنی امتناع یا سردی، نه نوشتار ضعیف — تمایل، نه مهارت. تخصص را در ستونها بخوانید تا مدلها را مقایسه کنید، و محتوا را در ردیفها بخوانید تا ببینید یک مدل کجا قوی و کجا ضعیف است.
Best AI for…
A straight answer for one kind of scene — or one genre
By what your scene needs
- بهترین هوش مصنوعی برای نوشتار ادبی
- بهترین هوش مصنوعی برای نوشتن دیالوگ
- بهترین هوش مصنوعی برای پیروی از دستورالعملها
- بهترین هوش مصنوعی برای ریتمپردازی
- بهترین هوش مصنوعی برای صحنههای احساسی
- بهترین هوش مصنوعی برای صحنههای اکشن
- بهترین هوش مصنوعی برای صحنههای تعارض
- بهترین هوش مصنوعی برای نوشتن عاشقانه
- بهترین هوش مصنوعی برای صحنههای صریح
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
تولید متن واقعی، نه پاسخ آزمون
هر مدل همان بخشها را مینویسد — صحنههای توضیحدادهشده با عناصر الزامی، دانش ممنوعه، دیدگاه روایی و هدف دراماتیک — تحت شرایط یکسان. ما آنچه تولید میکند را بهعنوان داستان امتیاز میدهیم، همانطور که یک ویراستار میخواند، نه اینکه چگونه در یک آزمون عمل میکند.
امتیازدهی کور، در نه محور
یک هیئت داور هر متن را در مقیاس ۰ تا ۱۰۰ بر روی چهار محور تخصصی (ادبی، دیالوگ، وفاداری، ریتم) و پنج محور محتوایی (احساسات، جسمانیت، تعارض، رمانس، اروتیسم) امتیاز میدهد، بدون اینکه بداند کدام مدل آن را نوشته. تخصص یعنی کیفیت اجرا؛ محتوا یعنی تناسب برای نوع صحنه.
تقریب به سمت پیشفرض بیطرف
میانگین خام از تعداد کمی نمونه، صرفاً نویز است. هر خانه به نسبت کمبود شواهدش به سمت پایه بیطرف ۷۰ کشیده میشود، پس یک اندازهگیری اولیه خوششانس تا زمانی که مشاهدات کافی جمع نشود، تقریباً میانگین خوانده میشود. عدد منتشرشده این مقدار تعدیلشده است؛ حجم نمونه در کنارش نمایش داده میشود.
ادغام مداوم، بدون تغییر دستی
مشاهدات جدید داور در میانگین جاری ادغام میشوند و تعداد نمونه رشد میکند، پس جدول با گذشت زمان دقیقتر میشود. اعداد از مشاهدات بازتولید میشوند، هرگز دستی وارد نمیشوند، و وقتی نسخه مدل زیر یک نام مستعار تغییر کند، خانههایش بازنشینی شده و از صفر اندازهگیری میشوند، نه اینکه دو مدل مختلف با هم ترکیب شوند.
Where this leads
چرا اساساً میتوان از چنین معیاری استفاده کرد
انتخاب مدل متفاوت برای یک صحنه تنها زمانی ممکن است که کتاب در واحدهای جداگانه و توضیحدادهشده ساخته شود نه در یک پاس. آن واحد، بیت (beat) است، و حفظ انسجام داستان در حالی که مدلهای مختلف بیتهای مختلف مینویسند، وظیفه یک حافظه قوس-و-موجودیت است که همراه با ساخت حرکت میکند. معیار تابلوی امتیاز است؛ بیتها و حافظه قوس آن چیزی هستند که به یک کتاب اجازه میدهند واقعاً از آن استفاده کند.
Questions
Frequently asked
- کدام مدل هوش مصنوعی بهترین داستان را مینویسد؟
- از نظر تخصص کلی — میانگین محورهای ادبی، دیالوگ، وفاداری و ریتم بر روی متن واقعی رمان — Claude Opus 4.8 در حال حاضر پیشتاز است و GPT-5.6 Sol نزدیک به دنبال آن قرار دارد. اما «بهترین» به صحنه بستگی دارد: بالاترین امتیاز برای اکشن، رمانس و محتوای بزرگسالان متعلق به مدلهای مختلف است. جدول این صفحه وضعیت فعلی و حجم نمونه پشت هر عدد را نشان میدهد.
- این معیار چگونه اندازهگیری میشود؟
- هر مدل همان بیتهای توضیحدادهشده را تحت شرایط یکسان مینویسد، و یک هیئت داور کور متن حاصل را در مقیاس ۰ تا ۱۰۰ در نه محور امتیاز میدهد — چهار محور تخصصی (ادبی، دیالوگ، وفاداری، ریتم) و پنج محور نوع محتوا (احساسات، جسمانیت، تعارض، رمانس، اروتیسم). امتیازها به سمت پایه بیطرف ۷۰ تعدیل میشوند تا دادههای کم نتوانند یک عدد را جابهجا کنند، و تعداد نمونه در کنار هر امتیاز نمایش داده میشود.
- تفاوت بین محورهای تخصصی و محورهای محتوایی چیست؟
- محورهای تخصصی میسنجند که یک مدل چقدر خوب مینویسد، مستقل از موضوع — کیفیت جملات، صدای شخصیت، وفاداری به توضیح، و کنترل ریتم. محورهای محتوایی تناسب برای نوع صحنه را میسنجند: احساسات، اکشن جسمانی، تعارض، رمانس و محتوای بزرگسالان. یک مدل میتواند جملات زیبایی بنویسد و هنوز هم صحنههای درگیری را ضعیف مدیریت کند، پس این دو دسته جداگانه امتیازدهی و نمایش داده میشوند.
- چرا یک مدل بهترین را انتخاب نکنیم و برای همه چیز از آن استفاده نکنیم؟
- چون هیچ مدلی در همه محورها برنده نیست. قویترین تخصص ادبی، بهترین اکشن و توانمندترین رمانس یا نوشتار بزرگسالان به مدلهای مختلف تعلق دارند. Novelmint یک کتاب را بیت به بیت بین مدلها توزیع میکند — حجم اصلی را در یک صدای سریال برای انسجام نگه میدارد و برای بیتهای خاصی که ارزشش را دارند به مدل قویتر منحرف میشود — که تنها به این دلیل ممکن است که این جدول وجود دارد.
- آیا امتیاز پایین یعنی مدل بد است؟
- نه لزوماً. امتیاز پایین محتوا میتواند یعنی مدل توانا اما بیمیل است — اکثر مدلها در اروتیسم امتیاز پایینی دارند چون امتناع میکنند یا بیش از حد رسمی میشوند، نه بهخاطر کمبود مهارت. و یک امتیاز با اطمینان پایین (نمونههای کم) به سمت پایه بیطرف کشیده میشود، پس بهصورت «هنوز اثبات نشده» خوانده میشود، نه «ضعیف اثباتشده». همیشه امتیاز را همراه با حجم نمونهاش بخوانید.
- معیار چند وقت یکبار بهروزرسانی میشود؟
- بهطور مداوم. جدول یک تصویر زنده از مخزن امتیازدهی پلتفرم است: همان داوری که در حین ساخت یک فصل توسط Novelmint متنی را امتیاز میدهد، مشاهداتش را برمیگرداند، پس اعداد با استفاده نویسندگان از موتور حرکت میکنند و حجم نمونه رشد میکند. صفحه تاریخ آخرین کالیبراسیون را نشان میدهد. نسخههای جدید مدل از ابتدا اندازهگیری میشوند نه با مدلی که جایگزین کردهاند ترکیب، پس تغییر نسخه هرگز بهطور پنهانی یک ستون را خراب نمیکند.
What this page does not claim
- این معیار صرفاً کیفیت متن و تناسب محتوا برای داستاننویسی را میسنجد. درباره استدلال، کدنویسی، ریاضیات، دقت واقعی یا ایمنی مدل خارج از زمینه نوشتاری چیزی نمیگوید.
- امتیازها نسبت به مجموعه داوریشده و دستورالعملهای استفادهشده هستند، نه یک رتبهبندی مطلق یا رسمی تأییدشده توسط ارائهدهندگان مدل. نامها و علائم تجاری مدلها متعلق به صاحبان مربوطه آنها هستند.
- امتیاز بالاتر تخصص کلی به این معنا نیست که یک مدل برای هر کتابی انتخاب درستی است — صدا، ژانر، نیازهای محتوا و هزینه همه اهمیت دارند، که دقیقاً به همین دلیل Novelmint بین مدلها توزیع میکند نه اینکه یکی را تاجگذاری کند.
- خانههای با نمونه کم موقتی هستند. جایی که یک عدد مشاهدات کمی دارد به سمت پایه بیطرف کشیده و علامتگذاری میشود، و با اضافه شدن اندازهگیریهای بیشتر تغییر خواهد کرد.
مرتبط
بهترین هوش مصنوعی برای صحنههای اکشن
کدام هوش مصنوعی یک نبرد یا تعقیب را واضح و واقعگرایانه نگه میدارد. رتبهبندی بر اساس جسمانیت.
بهترین هوش مصنوعی برای صحنههای تعارض
کدام هوش مصنوعی یک بحث یا رویارویی را پرتنش و رو به رشد نگه میدارد. رتبهبندی بر اساس تعارض اندازهگیریشده.
بهترین هوش مصنوعی برای صحنههای احساسی
کدام هوش مصنوعی صحنه احساسی را به جای توصیف، واقعاً منتقل میکند. رتبهبندی بر اساس احساس.
بهترین هوش مصنوعی برای صحنههای صریح
کدام هوش مصنوعی واقعاً محتوای صریح بزرگسالان را مینویسد — و کدامها نه. رتبهبندی بر اساس تمایل.
دست از حدس زدن برای انتخاب مدل بردار. بگذار کتاب انتخاب کند.
Novelmint هر بیت را به مدلی هدایت میکند که این جدول میگوید برای آن مناسبترین است. اولین فصل شما رایگان است.