معیار مدل داستان‌نویسی

کدام مدل هوش مصنوعی واقعاً بهترین داستان را می‌نویسد؟

Live data · measured as of July 24, 2026

هر کارت مدل ریاضیات، کدنویسی و استدلال را می‌سنجد. هیچ‌کدام نمی‌سنجند که آیا مدل می‌تواند صحنه‌ای بنویسد که خواننده از آن رد نشود. پس ما این معیار را ساختیم. یک هیئت داوران کور، متن واقعی تولیدشده از مدل‌های پیشرفته را بر اساس نه محور امتیاز می‌دهد — چهار محور تخصصی و پنج محور برای انواع صحنه‌های یک کتاب — و اعداد زیر نتیجه زنده این سنجش است. این یک نمودار تبلیغاتی نیست: این همان جدول دقیقی است که Novelmint برای انتخاب مدل در هر بخش از کتاب شما از آن استفاده می‌کند.

Key takeaways

  • این معیار، مدل‌های پیشرفته Anthropic، OpenAI، Google و xAI را بر روی متن واقعی تولیدشده رمان — نه آزمون‌های چندگزینه‌ای — در نه محور می‌سنجد: چهار محور تخصصی (ادبی، دیالوگ، وفاداری، ریتم) و پنج محور محتوایی (احساسات، جسمانیت، تعارض، رمانس، اروتیسم).
  • محورهای تخصصی می‌سنجند که مدل چقدر خوب می‌نویسد؛ محورهای محتوایی می‌سنجند که چه نوع صحنه‌ای را خوب می‌نویسد. یک مدل می‌تواند جملات زیبایی داشته باشد و در عین حال صحنه‌های درگیری کسل‌کننده بنویسد، پس این دو از هم جدا نگه داشته می‌شوند و هرگز در یک عدد گمراه‌کننده ادغام نمی‌شوند.
  • هر امتیاز با توجه به میزان داده پشت آن به سمت پایه بی‌طرف ۷۰ کشیده می‌شود، پس یک نتیجه خوش‌شانس با سه نمونه نمی‌تواند خود را به‌عنوان واقعیتی قطعی نشان دهد. حجم نمونه پشت هر عدد نمایش داده می‌شود.
  • هیچ مدل واحدی در همه چیز برنده نیست. قوی‌ترین تخصص ادبی، ثابت‌ترین وفاداری، بهترین اکشن، و بیشترین تمایل در رمانس و نوشتار بزرگسالان در ستون‌های مختلف قرار دارند — که این خود دلیلی است برای تقسیم یک کتاب بین مدل‌های مختلف به جای انتخاب یکی.
  • این همان جدولی است که Novelmint برای انتخاب مدل در هر بخش هنگام ساخت فصل استفاده می‌کند — و همان داوری که در حین ساخت یک متن امتیاز می‌دهد داده را تغذیه می‌کند، پس اعداد با نوشتن نویسندگان با موتور به‌روز می‌مانند. این یک مکانیزم زنده است، نه ادعایی گذشته‌نگر.

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

این داده زنده است، نه یک آزمون یک‌بار

جدول زیر معیاری نیست که یک‌بار اجرا کرده‌ایم و منجمد کرده‌ایم. این یک تصویر زنده از مخزن امتیازدهی پلتفرم است: همان داوری که در حین ساخت یک متن آن را ارزیابی می‌کند، این جدول را تغذیه می‌کند، پس هر فصل نوشته‌شده در Novelmint مشاهدات جدید اضافه می‌کند، حجم نمونه رشد می‌کند و اعداد دقیق‌تر می‌شوند. با نوشتن نویسندگان بیشتر با موتور، معیار به‌روزرسانی می‌شود — تاریخ بالا صرفاً آخرین کالیبراسیون است.

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

نحوه خواندن جدول

عدد اصلی، تخصص کلی است — میانگین چهار محور اجرایی مدل، که نزدیک‌ترین چیز به «متن آن چقدر خوب است» می‌باشد. محورهای محتوایی در سمت راست رتبه‌بندی بهتر-یا-بدتر نیستند؛ آنها نشان می‌دهند مدل برای چه کاری مناسب است. امتیاز بالای جسمانیت یعنی اکشن روشن؛ امتیاز پایین اروتیسم معمولاً یعنی امتناع یا سردی، نه نوشتار ضعیف — تمایل، نه مهارت. تخصص را در ستون‌ها بخوانید تا مدل‌ها را مقایسه کنید، و محتوا را در ردیف‌ها بخوانید تا ببینید یک مدل کجا قوی و کجا ضعیف است.

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

تولید متن واقعی، نه پاسخ آزمون

هر مدل همان بخش‌ها را می‌نویسد — صحنه‌های توضیح‌داده‌شده با عناصر الزامی، دانش ممنوعه، دیدگاه روایی و هدف دراماتیک — تحت شرایط یکسان. ما آنچه تولید می‌کند را به‌عنوان داستان امتیاز می‌دهیم، همان‌طور که یک ویراستار می‌خواند، نه اینکه چگونه در یک آزمون عمل می‌کند.

02

امتیازدهی کور، در نه محور

یک هیئت داور هر متن را در مقیاس ۰ تا ۱۰۰ بر روی چهار محور تخصصی (ادبی، دیالوگ، وفاداری، ریتم) و پنج محور محتوایی (احساسات، جسمانیت، تعارض، رمانس، اروتیسم) امتیاز می‌دهد، بدون اینکه بداند کدام مدل آن را نوشته. تخصص یعنی کیفیت اجرا؛ محتوا یعنی تناسب برای نوع صحنه.

03

تقریب به سمت پیش‌فرض بی‌طرف

میانگین خام از تعداد کمی نمونه، صرفاً نویز است. هر خانه به نسبت کمبود شواهدش به سمت پایه بی‌طرف ۷۰ کشیده می‌شود، پس یک اندازه‌گیری اولیه خوش‌شانس تا زمانی که مشاهدات کافی جمع نشود، تقریباً میانگین خوانده می‌شود. عدد منتشرشده این مقدار تعدیل‌شده است؛ حجم نمونه در کنارش نمایش داده می‌شود.

04

ادغام مداوم، بدون تغییر دستی

مشاهدات جدید داور در میانگین جاری ادغام می‌شوند و تعداد نمونه رشد می‌کند، پس جدول با گذشت زمان دقیق‌تر می‌شود. اعداد از مشاهدات بازتولید می‌شوند، هرگز دستی وارد نمی‌شوند، و وقتی نسخه مدل زیر یک نام مستعار تغییر کند، خانه‌هایش بازنشینی شده و از صفر اندازه‌گیری می‌شوند، نه اینکه دو مدل مختلف با هم ترکیب شوند.

Where this leads

چرا اساساً می‌توان از چنین معیاری استفاده کرد

انتخاب مدل متفاوت برای یک صحنه تنها زمانی ممکن است که کتاب در واحدهای جداگانه و توضیح‌داده‌شده ساخته شود نه در یک پاس. آن واحد، بیت (beat) است، و حفظ انسجام داستان در حالی که مدل‌های مختلف بیت‌های مختلف می‌نویسند، وظیفه یک حافظه قوس-و-موجودیت است که همراه با ساخت حرکت می‌کند. معیار تابلوی امتیاز است؛ بیت‌ها و حافظه قوس آن چیزی هستند که به یک کتاب اجازه می‌دهند واقعاً از آن استفاده کند.

Questions

Frequently asked

کدام مدل هوش مصنوعی بهترین داستان را می‌نویسد؟
از نظر تخصص کلی — میانگین محورهای ادبی، دیالوگ، وفاداری و ریتم بر روی متن واقعی رمان — Claude Opus 4.8 در حال حاضر پیشتاز است و GPT-5.6 Sol نزدیک به دنبال آن قرار دارد. اما «بهترین» به صحنه بستگی دارد: بالاترین امتیاز برای اکشن، رمانس و محتوای بزرگسالان متعلق به مدل‌های مختلف است. جدول این صفحه وضعیت فعلی و حجم نمونه پشت هر عدد را نشان می‌دهد.
این معیار چگونه اندازه‌گیری می‌شود؟
هر مدل همان بیت‌های توضیح‌داده‌شده را تحت شرایط یکسان می‌نویسد، و یک هیئت داور کور متن حاصل را در مقیاس ۰ تا ۱۰۰ در نه محور امتیاز می‌دهد — چهار محور تخصصی (ادبی، دیالوگ، وفاداری، ریتم) و پنج محور نوع محتوا (احساسات، جسمانیت، تعارض، رمانس، اروتیسم). امتیازها به سمت پایه بی‌طرف ۷۰ تعدیل می‌شوند تا داده‌های کم نتوانند یک عدد را جابه‌جا کنند، و تعداد نمونه در کنار هر امتیاز نمایش داده می‌شود.
تفاوت بین محورهای تخصصی و محورهای محتوایی چیست؟
محورهای تخصصی می‌سنجند که یک مدل چقدر خوب می‌نویسد، مستقل از موضوع — کیفیت جملات، صدای شخصیت، وفاداری به توضیح، و کنترل ریتم. محورهای محتوایی تناسب برای نوع صحنه را می‌سنجند: احساسات، اکشن جسمانی، تعارض، رمانس و محتوای بزرگسالان. یک مدل می‌تواند جملات زیبایی بنویسد و هنوز هم صحنه‌های درگیری را ضعیف مدیریت کند، پس این دو دسته جداگانه امتیازدهی و نمایش داده می‌شوند.
چرا یک مدل بهترین را انتخاب نکنیم و برای همه چیز از آن استفاده نکنیم؟
چون هیچ مدلی در همه محورها برنده نیست. قوی‌ترین تخصص ادبی، بهترین اکشن و توانمندترین رمانس یا نوشتار بزرگسالان به مدل‌های مختلف تعلق دارند. Novelmint یک کتاب را بیت به بیت بین مدل‌ها توزیع می‌کند — حجم اصلی را در یک صدای سریال برای انسجام نگه می‌دارد و برای بیت‌های خاصی که ارزشش را دارند به مدل قوی‌تر منحرف می‌شود — که تنها به این دلیل ممکن است که این جدول وجود دارد.
آیا امتیاز پایین یعنی مدل بد است؟
نه لزوماً. امتیاز پایین محتوا می‌تواند یعنی مدل توانا اما بی‌میل است — اکثر مدل‌ها در اروتیسم امتیاز پایینی دارند چون امتناع می‌کنند یا بیش از حد رسمی می‌شوند، نه به‌خاطر کمبود مهارت. و یک امتیاز با اطمینان پایین (نمونه‌های کم) به سمت پایه بی‌طرف کشیده می‌شود، پس به‌صورت «هنوز اثبات نشده» خوانده می‌شود، نه «ضعیف اثبات‌شده». همیشه امتیاز را همراه با حجم نمونه‌اش بخوانید.
معیار چند وقت یک‌بار به‌روزرسانی می‌شود؟
به‌طور مداوم. جدول یک تصویر زنده از مخزن امتیازدهی پلتفرم است: همان داوری که در حین ساخت یک فصل توسط Novelmint متنی را امتیاز می‌دهد، مشاهداتش را برمی‌گرداند، پس اعداد با استفاده نویسندگان از موتور حرکت می‌کنند و حجم نمونه رشد می‌کند. صفحه تاریخ آخرین کالیبراسیون را نشان می‌دهد. نسخه‌های جدید مدل از ابتدا اندازه‌گیری می‌شوند نه با مدلی که جایگزین کرده‌اند ترکیب، پس تغییر نسخه هرگز به‌طور پنهانی یک ستون را خراب نمی‌کند.

What this page does not claim

  • این معیار صرفاً کیفیت متن و تناسب محتوا برای داستان‌نویسی را می‌سنجد. درباره استدلال، کدنویسی، ریاضیات، دقت واقعی یا ایمنی مدل خارج از زمینه نوشتاری چیزی نمی‌گوید.
  • امتیازها نسبت به مجموعه داوری‌شده و دستورالعمل‌های استفاده‌شده هستند، نه یک رتبه‌بندی مطلق یا رسمی تأیید‌شده توسط ارائه‌دهندگان مدل. نام‌ها و علائم تجاری مدل‌ها متعلق به صاحبان مربوطه آنها هستند.
  • امتیاز بالاتر تخصص کلی به این معنا نیست که یک مدل برای هر کتابی انتخاب درستی است — صدا، ژانر، نیازهای محتوا و هزینه همه اهمیت دارند، که دقیقاً به همین دلیل Novelmint بین مدل‌ها توزیع می‌کند نه اینکه یکی را تاج‌گذاری کند.
  • خانه‌های با نمونه کم موقتی هستند. جایی که یک عدد مشاهدات کمی دارد به سمت پایه بی‌طرف کشیده و علامت‌گذاری می‌شود، و با اضافه شدن اندازه‌گیری‌های بیشتر تغییر خواهد کرد.

دست از حدس زدن برای انتخاب مدل بردار. بگذار کتاب انتخاب کند.

Novelmint هر بیت را به مدلی هدایت می‌کند که این جدول می‌گوید برای آن مناسب‌ترین است. اولین فصل شما رایگان است.