روش‌شناسی

نحوه کارکرد معیار مدل داستان‌نویسی

Updated July 23, 2026 · ۶ دقیقه مطالعه

این معیار چیزی را اندازه می‌گیرد که هیچ کارت مدلی نمی‌گوید: آیا یک مدل می‌تواند صحنه‌ای بنویسد که خواننده از آن نگذرد. این صفحه توضیح می‌دهد اعداد دقیقاً چگونه تولید می‌شوند — چه چیزی اندازه‌گیری می‌شود، مدل‌ها چگونه داوری می‌شوند، چرا امتیازها بر اساس اطمینان کاهش می‌یابند، و جدول چگونه به‌روز می‌ماند — تا بتوانید خودتان نتایج را ارزیابی و به درستی به آن‌ها استناد کنید.

Key takeaways

  • مدل‌های پیشرفته همان نقاط عطف داستانی را می‌نویسند، و یک پنل داور کور و متنوع، نثر را بدون اطلاع از نویسنده، روی نه محور از ۰ تا ۱۰۰ امتیاز می‌دهد.
  • نه محور در دو دسته: چهار محور هنری (ادبی، دیالوگ، وفاداری، ریتم) نشان می‌دهند مدل چقدر خوب می‌نویسد؛ پنج محور محتوایی (احساس، جسمانیت، تعارض، رمانس، اروتیک) نشان می‌دهند چه نوع صحنه‌ای را خوب می‌نویسد. این دو هرگز با هم میانگین گرفته نمی‌شوند.
  • هر امتیازی به نسبت کمبود داده پشتیبان، به سمت خط پایه خنثی ۷۰ کاهش می‌یابد (معادل پنج مشاهده قبلی)، تا یک نمونه کوچک شانسی نتواند به صدر برسد. حجم نمونه نمایش داده می‌شود؛ سلول‌های کم‌داده علامت‌گذاری می‌شوند.
  • جدول زنده است — مشاهدات جدید داوران به صورت تجمعی در میانگین ادغام می‌شوند، و تغییر نسخه یک مدل باعث بازنشانی و اندازه‌گیری مجدد آن می‌شود، نه ترکیب با نسخه قبلی.
  • امتیازها تنها نثر داستانی را توصیف می‌کنند؛ یک اندازه‌گیری مستقل هستند، نه رتبه‌بندی رسمی ارائه‌دهنده، و امتیاز پایین اروتیک معمولاً نشان‌دهنده تمایل است، نه کیفیت نوشتاری.

معیار داستانی Novelmint چیزی را می‌سنجد که کارت‌های مشخصات مدل هرگز نمی‌سنجند: اینکه آیا یک مدل می‌تواند صحنه‌ای بنویسد که خواننده از آن نگذرد. این یک جدول رتبه‌بندی قرض‌گرفته از آزمون‌های ریاضی یا برنامه‌نویسی نیست — این معیار نثر واقعی رمان را امتیازدهی می‌کند. در اینجا دقیقاً توضیح داده شده که این اعداد چگونه تولید می‌شوند، تا بتوانید خودتان آن‌ها را ارزیابی کنید و با اطمینان به آن‌ها استناد کنید.

چه چیزی می‌سنجد

این معیار ارزیابی می‌کند که مدل‌های پیشرفته — از Anthropic، OpenAI، Google و xAI — چقدر خوب داستان می‌نویسند. نه اینکه چطور استدلال می‌کنند، نه اینکه چطور کد می‌نویسند، نه اینکه در آزمون‌های چندگزینه‌ای چه عملکردی دارند. به هر مدل همان مجموعه‌ی صحنه‌های داستانی توجیه‌شده داده می‌شود — صحنه‌هایی با عناصر الزامی، دانش‌های ممنوع، یک دیدگاه روایی، و یک هدف دراماتیک — و آنچه می‌نویسد به‌عنوان داستان قضاوت می‌شود، همان‌طور که یک ویراستار می‌خواند.

همه چیز روی یک مقیاس ۰ تا ۱۰۰ برای هر محور بیان می‌شود، بنابراین اعداد به‌طور مستقیم در میان مدل‌ها و در میان انواع صحنه‌هایی که یک کتاب واقعاً از آن‌ها ساخته شده قابل مقایسه‌اند.

نه محور ارزیابی

داستان‌نویسی یک مهارت واحد نیست، پس این معیار همه چیز را در یک عدد خلاصه نمی‌کند. نه محور را امتیازدهی می‌کند که به دو خانواده با معانی متفاوت تقسیم می‌شوند.

چهار محور صنایع نویسندگی اندازه می‌گیرند که یک مدل چقدر خوب می‌نویسد، مستقل از موضوع: ادبی (تصویر در سطح جمله، ریتم، زیرمتن، خویشتن‌داری)، دیالوگ (آیا شخصیت‌ها مانند افراد متمایز به نظر می‌رسند)، وفاداری (تا چه اندازه دقیقاً صحنه‌ی توجیه‌شده را بازمی‌آفریند، عناصر الزامی را نگه می‌دارد و دانش‌های ممنوع را کنار می‌گذارد)، و ریتم‌بندی (کنترل حرکت روایی — کجا فشرده کند، کجا درنگ کند).

پنج محور محتوا اندازه می‌گیرند که یک مدل چه نوع صحنه‌ای را خوب می‌نویسد: احساس، جسمانیت (اکشن و حضور بدن در فضا)، تعارض، عاشقانه، و اروتیک (محتوای صریح بزرگسالان). این‌ها رتبه‌بندی‌های بهتر-یا-بدتر نیستند — می‌گویند یک مدل برای چه چیزی مناسب است. یک مدل می‌تواند جملات زیبایی داشته باشد و در عین حال صحنه‌های درگیری کسل‌کننده‌ای بنویسد، به همین دلیل است که صنایع نویسندگی و محتوا جداگانه امتیازدهی و گزارش می‌شوند و هرگز در یک عدد گمراه‌کننده‌ی واحد میانگین گرفته نمی‌شوند.

چگونه هر مدل امتیازدهی می‌شود

امتیازدهی داوری کور همتا است. هر مدل همان مجموعه صحنه‌های توجیه‌شده را می‌نویسد، و یک هیئت از مدل‌های داور قوی و متنوع از نظر ارائه‌دهنده، هر متن را از ۰ تا ۱۰۰ در هر محور ارزیابی می‌کند — بدون اینکه بداند کدام مدل آن را نوشته، و هرگز کار خودش را قضاوت نمی‌کند. هیئت متنوع از نظر ارائه‌دهنده اهمیت دارد: یک داور از خارج از خانواده‌ی یک مدل، نشانه‌هایی را که آن خانواده تمایل به پاداش‌دادن به آن‌ها دارد کشف می‌کند.

چون داوری کور و بین‌مدلی است، یک مدل نمی‌تواند خود را تملق بگوید، و هیچ سبک خانگی واحدی معیار را تعیین نمی‌کند.

کنترل سوگیری داوران

استفاده از مدل‌ها برای قضاوت مدل‌ها چهار حالت شناخته‌شده‌ی شکست را دعوت می‌کند، و روش به گونه‌ای طراحی شده که هر یک را مسدود کند.

خودترجیحی — یک مدل تمایل دارد سبک خانگی خودش را پاداش دهد. دو قانون آن را حذف می‌کنند: یک مدل هرگز متن خودش را امتیاز نمی‌دهد، و هیئت داوران از نظر ارائه‌دهنده متنوع است، بنابراین سلیقه‌ی هیچ خانواده‌ای معیار را تعیین نمی‌کند. نشانه‌ای که یک خانه به آن پاداش می‌دهد توسط داوری از خانه‌ی دیگر کشف می‌شود، و بالعکس.

پرحرفی — داوران به‌طور قابل اعتماد به طول بیش از حد پاداش می‌دهند. هر صحنه همان هدف را توجیه می‌کند، تقریباً ۲۲۰ کلمه، بنابراین همه‌ی متن‌ها با اندازه‌ای تقریباً یکسان می‌رسند و پرکردن فضا سودی ندارد. یک مدل امتیازش را بر اساس آنچه با آن کلمات انجام می‌دهد به دست می‌آورد، نه بر اساس تعداد کلماتی که صرف می‌کند.

موقعیت — ترتیب ظاهر شدن متن‌ها می‌تواند امتیازها را به سمت آنچه اول آمده سوق دهد. بنابراین متن‌ها برای هر صحنه برچسب‌گذاری مجدد و به‌هم‌ریخته می‌شوند، و هر یک به‌تنهایی در برابر یک معیار ثابت امتیازدهی می‌شود نه در مقایسه‌ی مستقیم با دیگران. ترتیب هیچ سیگنالی ندارد، و هرگونه انحراف باقی‌مانده در طول صحنه‌های بسیار و داوران بسیار به میانگین می‌رسد.

نمونه‌برداری — یک پیش‌نویس خوش‌شانس واحد می‌تواند یک مدل را بیش از حد تحت تأثیر قرار دهد. تولید با دمای پیش‌فرض هر مدل روی یک پرامپت یکسان اجرا می‌شود، بدون تنظیم خاص برای هیچ مدلی، پس هیچ مدلی تنظیمات دلخواه از پیش انتخاب‌شده‌ای که دیگران ندارند به دست نمی‌آورد. و هیچ سلولی فقط بر یک پیش‌نویس متکی نیست: هر مدل در طول کل مجموعه صحنه توسط هر مدل دیگری در هیئت امتیازدهی می‌شود، سپس به سمت خط پایه‌ی خنثی کوچک می‌شود تا اندازه‌گیری‌های کافی انباشته شوند — بنابراین شانس یک پیش‌نویس واحد قبل از انتشار عدد از بین می‌رود.

چرا امتیازها به اندازه‌ی اطمینان کوچک می‌شوند

میانگین خام از چند متن محدود نویز است، و نویزی که به‌شکل امتیاز نمایش داده شود از نداشتن هیچ امتیازی بدتر است. بنابراین هر عدد منتشرشده به نسبت کمبود داده‌های پشتیبان، به سمت خط پایه‌ی خنثی ۷۰ کوچک می‌شود — به‌طور رسمی، یک پیش‌فرض معادل پنج مشاهده. سلولی که با سه نمونه‌ی خوش‌شانس پشتیبانی می‌شود تقریباً متوسط خوانده می‌شود تا زمانی که اندازه‌گیری‌های کافی برای آن جایگاه کسب کنند؛ سلولی که با صدها نمونه پشتیبانی می‌شود به‌عنوان مقدار واقعی اندازه‌گیری‌شده خوانده می‌شود.

اندازه‌ی نمونه پشت هر عدد نشان داده می‌شود، و هر سلولی که هنوز بر کمتر از شش مشاهده متکی است به‌عنوان موقت علامت‌گذاری می‌شود. به همین دلیل است که یک مدل با داده‌های کم هرگز با شانس به صدر جدول نمی‌رود — روش اجازه‌ی آن را نمی‌دهد.

چگونه جدول به‌روز می‌ماند

این معیار یک آزمون یک‌باره نیست که اجرا شده و منجمد شده باشد. این یک پروژکشن زنده از ذخیره‌ی امتیازدهی است که پلتفرم روی آن اجرا می‌شود: مشاهدات جدید داور در یک میانگین متحرک ادغام می‌شوند، و تعداد نمونه‌ی هر سلول با گذشت زمان رشد می‌کند، بنابراین جدول به‌جای کهنه شدن تیزتر می‌شود. این صفحه همیشه تاریخ آخرین کالیبراسیون مجدد را نشان می‌دهد.

یک حفاظ برای دقت اهمیت دارد. وقتی یک نام مستعار پایدار (یک اشاره‌گر "latest") به‌طور پنهان به مدل زیرین جدیدی اشاره می‌کند، سلول‌های آن مدل از صفر بازنشانی و مجدداً اندازه‌گیری می‌شوند به‌جای اینکه با مدلی که جایگزین کرده‌اند ترکیب شوند — بنابراین تغییر نسخه هرگز به‌طور پنهان یک ستون را خراب نمی‌کند. به همین دلیل است که این معیار نسخه‌ی خاص اندازه‌گیری‌شده را نام می‌برد نه یک برچسب عمومی.

محدودیت‌ها

امتیازها نثر روی صحنه‌های داستانی را توصیف می‌کنند، که در برابر این مجموعه از مدل‌ها و پرامپت‌ها قضاوت شده‌اند. این‌ها رتبه‌بندی‌های رسمی تأییدشده توسط ارائه‌دهندگان مدل نیستند، و در مورد استدلال، دقت، یا ایمنی یک مدل خارج از زمینه‌ی نوشتاری چیزی نمی‌گویند. نام‌های تجاری و علائم تجاری مدل‌ها به صاحبان مربوطه تعلق دارند؛ این یک اندازه‌گیری مستقل است.

دو قرائت به‌آسانی اشتباه‌ گرفته می‌شوند. امتیاز پایین اروتیک معمولاً تمایل را نشان می‌دهد — مدلی که امتناع می‌کند یا رویکردی بالینی می‌گیرد — نه شکست در صنایع نویسندگی. و امتیاز با اطمینان پایین به معنای «هنوز ثابت نشده» است، نه «ضعیف بودن ثابت شده». همیشه یک عدد را همراه با اندازه‌ی نمونه‌اش بخوانید، و به یاد داشته باشید که بهترین مدل برای کتاب شما به این بستگی دارد که کتابتان بیشتر روی کدام محورها تکیه دارد — و این دقیقاً همان دلیلی است که جدول آن‌ها را جدا نگه می‌دارد.

Questions

Frequently asked

Novelmint چگونه مدل‌های هوش مصنوعی را برای داستان‌نویسی ارزیابی می‌کند؟
هر مدل پیشرفته همان نقاط عطف داستانی را می‌نویسد، و یک پنل کور از مدل‌های داور قوی و متنوع، نثر حاصل را بدون اطلاع از نویسنده روی نه محور از ۰ تا ۱۰۰ امتیاز می‌دهد. امتیازها بر اساس حجم داده به سمت خط پایه خنثی کاهش می‌یابند و مشاهدات به صورت تجمعی در میانگین ادغام می‌شوند.
نه محور چیستند؟
چهار محور هنری — ادبی، دیالوگ، وفاداری (پایبندی به توضیحات)، و ریتم — نشان می‌دهند مدل چقدر خوب می‌نویسد. پنج محور محتوایی — احساس، جسمانیت (اکشن)، تعارض، رمانس، و اروتیک — نشان می‌دهند چه نوع صحنه‌ای را خوب می‌نویسد. هنری و محتوایی جداگانه گزارش می‌شوند و هرگز با هم میانگین گرفته نمی‌شوند.
چرا امتیازها برای اطمینان تنظیم می‌شوند؟
میانگین خام از چند متن، سروصدا است. هر امتیاز به نسبت کمبود داده پشتیبان به سمت خط پایه خنثی ۷۰ کاهش می‌یابد — معادل پنج مشاهده قبلی — تا یک نمونه کوچک شانسی نتواند به صدر برسد. حجم نمونه نمایش داده می‌شود و سلول‌هایی با کمتر از شش مشاهده به عنوان موقت علامت‌گذاری می‌شوند.
آیا این رتبه‌بندی رسمی OpenAI، Anthropic، Google یا xAI است؟
خیر. این یک اندازه‌گیری مستقل توسط Novelmint است، تنها روی نثر داستانی، و در مقابل این مجموعه از مدل‌ها و پرامپت‌ها داوری شده. هیچ چیزی درباره استدلال، دقت، یا سایر قابلیت‌ها نمی‌گوید، و نام مدل‌ها علامت تجاری صاحبان مربوطه‌شان هستند.
معیار هر چند وقت یک‌بار به‌روزرسانی می‌شود؟
به‌صورت مداوم — مشاهدات جدید داوران در میانگین تجمعی ادغام می‌شوند و تعداد نمونه‌ها رشد می‌کنند، پس جدول با گذر زمان دقیق‌تر می‌شود. وقتی نسخه مدلی تحت یک نام مستعار تغییر می‌کند، سلول‌هایش بازنشانی و مجدداً اندازه‌گیری می‌شوند، نه اینکه با نسخه قدیمی‌تر ترکیب شوند. صفحه تاریخ آخرین کالیبراسیون را نشان می‌دهد.

What this page does not claim

  • امتیازها نسبت به مجموعه مدل‌های داوری‌شده و پرامپت‌های استفاده‌شده هستند — نه یک رتبه‌بندی مطلق یا رسمی.
  • امتیاز پایین اروتیک نشان‌دهنده تمایل است (مدلی که امتناع می‌کند یا سرد می‌نویسد)، نه فقدان مهارت؛ امتیاز کم‌اطمینان یعنی «هنوز اثبات نشده»، نه «اثبات شده ضعیف».
  • این معیار تنها نثر داستانی را اندازه می‌گیرد و هیچ چیزی درباره استدلال، کدنویسی، دقت واقعی، یا ایمنی خارج از زمینه نوشتاری نمی‌گوید.

ببینید کدام مدل نوع صحنه‌ای که می‌خواهید را بهتر می‌نویسد.

داده‌های زنده روی نه محور، که با اندازه‌گیری نثر بیشتر به‌روزرسانی می‌شوند.