أي نموذج ذكاء اصطناعي يكتب الروايات بشكل أفضل فعلاً؟
Live data · measured as of July 24, 2026
كل بطاقة نموذج تقيس الرياضيات والبرمجة والمنطق. لا أيٌّ منها يقيس ما إذا كان النموذج قادراً على كتابة مشهد لن يتخطاه القارئ. لهذا بنينا هذا المعيار. تُقيّم لجنة تحكيم عمياء نثراً روائياً حقيقياً تنتجه النماذج المتقدمة عبر تسعة محاور — أربعة للحرفة، وخمسة لأنواع المشاهد الروائية — والأرقام أدناه هي النتيجة المباشرة. هذا ليس مخططاً تسويقياً: إنه الجدول الذي تعتمده Novelmint لاختيار نموذج لكل مقطع في كتابك.
Key takeaways
- يُصنّف المعيار النماذج المتقدمة من Anthropic وOpenAI وGoogle وxAI على نثر روائي حقيقي — لا اختبارات متعددة الخيارات — عبر تسعة محاور: أربعة للحرفة (الأدبي، الحوار، الأمانة، الإيقاع) وخمسة للمحتوى (العاطفة، الجسدية، الصراع، الرومانسية، الإيروسية).
- تقيس محاور الحرفة مدى جودة الكتابة؛ وتقيس محاور المحتوى نوع المشهد الذي يُتقنه النموذج. قد يمتلك النموذج جُملاً رائعة ومع ذلك يكتب مشاهد قتال مملة، لذا تُعامَل الفئتان بشكل منفصل ولا تُدمجان في رقم واحد مضلل.
- كل درجة تُسحب نحو خط أساس محايد يبلغ 70 بنسبة تتناسب مع قلة البيانات خلفها، فلا يمكن لنتيجة محظوظة من ثلاث عينات أن تتظاهر بأنها حقيقة راسخة. حجم العينة خلف كل رقم معروض.
- لا نموذج واحد يفوز في كل شيء. أقوى حرفة أدبية، وأثبت أمانة، وأفضل إثارة، وأكثر استعداداً للرومانسية والكتابة الصريحة — كل هذه تقع في أعمدة مختلفة، وهذا هو الحجة الكاملة لتوزيع الكتاب عبر نماذج بدلاً من الاختيار الواحد.
- هذا هو الجدول نفسه الذي تستخدمه Novelmint لاختيار نموذج لكل مقطع أثناء بناء فصل — والمُحكِّم ذاته الذي يُصنّف المقطع أثناء البناء يُغذّيه، فالأرقام تتحدث باستمرار كلما كتب المؤلفون مع المحرك. إنه آلية حية، لا ادعاء بأثر رجعي.
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
هذه بيانات حية، لا اختبار لمرة واحدة
الجدول أدناه ليس معياراً أجريناه مرة واحدة ثم جمّدناه. إنه إسقاط حي لمخزن التصنيف الذي تعمل عليه المنصة: المُحكِّم ذاته الذي يُقيّم المقطع أثناء البناء يُغذّي هذا الجدول، فكل فصل يُكتب على Novelmint يضيف ملاحظات وتزداد أحجام العينات وتتحسن الأرقام. كلما زاد عدد المؤلفين الذين يستخدمون المحرك، كلما ظل المعيار محدَّثاً — والتاريخ أعلاه هو ببساطة آخر إعادة معايرة.
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
كيف تقرأ الجدول
الرقم الرئيسي هو الحرفة الإجمالية — متوسط محاور التنفيذ الأربعة للنموذج، وهو أقرب شيء إلى \"ما مدى جودة نثره\". محاور المحتوى على اليمين ليست تصنيفات أفضل أو أسوأ؛ بل تُشير إلى ما يُناسبه النموذج. درجة جسدية عالية تعني إثارة نظيفة؛ ودرجة إيروسية منخفضة عادةً تعني رفضاً أو جفافاً لا ضعف كتابة — الاستعداد لا المهارة. اقرأ الحرفة في العمود لمقارنة النماذج، واقرأ المحتوى في الصف لرؤية مواطن القوة والضعف في نموذج واحد.
Best AI for…
A straight answer for one kind of scene — or one genre
By what your scene needs
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
توليد نثر حقيقي، لا إجابات اختبار
يكتب كل نموذج المقاطع ذاتها — مشاهد موجَّهة بعناصر مطلوبة ومعرفة محظورة ووجهة نظر وهدف درامي — في ظروف متطابقة. نُقيّم ما ينتجه بوصفه خيالاً روائياً، كما يقرأ المحرر، لا كأداء في اختبار.
تصنيف أعمى عبر تسعة محاور
تُقيّم لجنة التحكيم كل مقطع من 0 إلى 100 على أربعة محاور للحرفة (الأدبي، الحوار، الأمانة، الإيقاع) وخمسة محاور للمحتوى (العاطفة، الجسدية، الصراع، الرومانسية، الإيروسية)، دون معرفة أي نموذج كتبه. الحرفة هي جودة التنفيذ؛ والمحتوى هو الملاءمة لنوع المشهد.
السحب نحو مسبق محايد
المتوسط الخام من حفنة عينات مجرد ضجيج. كل خلية تُسحب نحو خط أساس محايد 70 بنسبة تتناسب مع ضعف أدلتها، فقياس مبكر محظوظ يُقرأ كمتوسط تقريباً حتى تكفي الملاحظات لإثبات مكانته. الرقم المنشور هو هذه القيمة المُسحَبة؛ وحجم العينة معروض بجانبه.
استمر في الدمج، لا تعدّل يدوياً أبداً
الملاحظات الجديدة للمحكمين تنضم إلى المتوسط الجاري وعدد العينات يزداد، فالجدول يزداد دقةً بمرور الوقت. الأرقام مُولَّدة من الملاحظات ولا تُكتب يدوياً، وعند تغيير إصدار النموذج تحت الاسم المستعار تُعاد قياساته من الصفر بدلاً من مزجه بنموذج آخر.
Where this leads
لماذا يمكن الاستفادة من معيار كهذا أصلاً
اختيار نموذج مختلف لمشهد واحد لا يعمل إلا إذا بُني الكتاب في وحدات منفصلة وموجَّهة لا في تمريرة واحدة. تلك الوحدة هي المقطع، والحفاظ على تماسك القصة بينما تكتب نماذج مختلفة مقاطع مختلفة هو مهمة ذاكرة القوس والكيانات التي ترافق البناء. المعيار هو لوحة النتائج؛ والمقاطع وذاكرة القوس هي ما يُمكّن الكتاب من الاستفادة منه فعلاً.
Questions
Frequently asked
- أي نموذج ذكاء اصطناعي يكتب أفضل الروايات؟
- من حيث الحرفة الإجمالية — متوسط محاور الأدبي والحوار والأمانة والإيقاع على نثر روائي حقيقي — يتصدر Claude Opus 4.8 حالياً، وGPT-5.6 Sol قريب منه. لكن \"الأفضل\" يعتمد على المشهد: أعلى درجات الإثارة والرومانسية والمحتوى الصريح تعود لنماذج مختلفة. الجدول في هذه الصفحة يُظهر الترتيب الحالي وحجم العينة خلف كل رقم.
- كيف يُقاس هذا المعيار؟
- يكتب كل نموذج المقاطع الموجَّهة ذاتها في ظروف متطابقة، وتُصنّف لجنة تحكيم عمياء النثر الناتج من 0 إلى 100 عبر تسعة محاور — أربعة للحرفة (الأدبي، الحوار، الأمانة، الإيقاع) وخمسة لنوع المحتوى (العاطفة، الجسدية، الصراع، الرومانسية، الإيروسية). تُسحب الدرجات نحو خط أساس محايد 70 لمنع البيانات القليلة من التأثير على الرقم، وعدد العينات معروض بجانب كل درجة.
- ما الفرق بين محاور الحرفة ومحاور المحتوى؟
- تقيس محاور الحرفة مدى جودة كتابة النموذج بغض النظر عن الموضوع — جودة الجمل وصوت الشخصية والأمانة للموجز والتحكم في الإيقاع. تقيس محاور المحتوى الملاءمة لنوع مشهد بعينه: العاطفة والإثارة الجسدية والصراع والرومانسية والمحتوى الصريح. قد يكتب النموذج جملاً رائعة ومع ذلك يُعالج مشهد قتال بشكل رديء، لذا تُصنَّف الفئتان وتُعرضان بشكل منفصل.
- لماذا لا تختار النموذج الأفضل وتستخدمه في كل شيء؟
- لأن لا نموذج يفوز في كل محور. أقوى حرفة أدبية وأفضل إثارة وأكثر قدرة في الرومانسية والكتابة الصريحة تنتمي لنماذج مختلفة. Novelmint توزع الكتاب عبر النماذج مقطعاً بمقطع — مع إبقاء الجزء الأكبر في صوت سرد واحد للتماسك والانتقال لنموذج أقوى في المقاطع المحددة التي تستحق ذلك — وهذا ممكن فقط لأن هذا الجدول موجود.
- هل تعني الدرجة المنخفضة أن النموذج رديء؟
- ليس بالضرورة. قد تعني درجة المحتوى المنخفضة أن النموذج قادر لكنه غير راغب — معظم النماذج تحصل على درجة منخفضة في الإيروسية لأنها ترفض أو تتحول للجفاء، لا لضعف مهارتها. وتُسحب الدرجة المنخفضة الثقة (عينات قليلة) نحو خط الأساس المحايد، فتُقرأ كـ\"لم يثبت بعد\"، لا \"ثبت ضعفه\". اقرأ دائماً الدرجة مع حجم عينتها.
- كم مرة يُحدَّث المعيار؟
- باستمرار. الجدول إسقاط حي لمخزن التصنيف في المنصة: المُحكِّم ذاته الذي يُقيّم المقطع بينما تبني Novelmint فصلاً يُدمج ملاحظاته، فالأرقام تتحرك كلما استخدم المؤلفون المحرك وتزداد أحجام العينات. تعرض الصفحة تاريخ آخر إعادة معايرة. الإصدارات الجديدة من النماذج تُقاس من الصفر لا تُمزج مع سابقتها، فتغيير الإصدار لا يُفسد عموداً بصمت.
What this page does not claim
- يقيس هذا المعيار جودة النثر وملاءمة المحتوى للخيال الروائي فحسب. لا يقول شيئاً عن منطق النموذج أو برمجته أو رياضياته أو دقته الواقعية أو سلامته خارج سياق الكتابة.
- الدرجات نسبية بالنسبة للمجموعة المُحكَّمة والمطالبات المستخدمة، وليست تقييماً مطلقاً أو رسمياً معتمداً من مزودي النماذج. أسماء النماذج والعلامات التجارية ملك لأصحابها.
- درجة حرفة إجمالية أعلى لا تعني أن النموذج هو الاختيار الصحيح لكل كتاب — الصوت والنوع ومتطلبات المحتوى والتكلفة كلها مهمة، وهذا بالضبط سبب توزيع Novelmint عبر النماذج بدلاً من تتويج واحد.
- خلايا العينات الصغيرة مؤقتة. عندما يحمل رقم ما ملاحظات قليلة يُسحب نحو خط الأساس المحايد ويُوضع عليه علامة، وسيتغير كلما أُضيفت قياسات جديدة.
ذات صلة
أفضل ذكاء اصطناعي لمشاهد الأكشن
أي ذكاء اصطناعي يُبقي المعركة أو المطاردة واضحة وملموسة بدلاً من الغموض؟ مصنّف بناءً على الجسدية.
أفضل ذكاء اصطناعي لمشاهد الصراع
أي ذكاء اصطناعي يُبقي المشادة أو المواجهة متوترة ومتصاعدة؟ مصنّف بناءً على الصراع المقيس.
أفضل ذكاء اصطناعي للمشاهد العاطفية
أي ذكاء اصطناعي يُحوّل المشهد العاطفي إلى تجربة حقيقية لا مجرد وصف؟ مصنّف بناءً على العاطفة.
أفضل ذكاء اصطناعي للمشاهد الصريحة
أيّ ذكاء اصطناعي سيكتب فعلاً المحتوى البالغ الصريح — وأيّها يرفض. مُصنَّف على الاستعداد.
توقف عن التخمين وأيّ نموذج تستخدم. دع الكتاب يختار.
Novelmint توجّه كل مقطع للنموذج الأنسب له وفق هذا الجدول. فصلك الأول مجاني.