Key takeaways
- 本基准测试对来自 Anthropic、OpenAI、Google 和 xAI 的前沿模型,以真实生成的小说散文(而非选择题)为依据,从九个维度打分:四个技巧维度(文学性、对话、忠实度、节奏)和五个内容维度(情感、肢体感、冲突、浪漫、情色)。
- 技巧维度衡量模型写得有多好;内容维度衡量它擅长写哪类场景。一个模型可以句子优美,却写不好打斗场景,因此两类维度分开评分,绝不合并为一个误导性的综合数字。
- 每项得分都会向中性基准70进行可信度收缩,样本越少收缩越大,因此三个样本的幸运结果永远不会伪装成确定结论。每个数字背后的样本量均有显示。
- 没有一款模型全面称霸。最强文学技巧、最稳定的忠实度、最佳动作场景、最开放的浪漫与露骨写作分属不同模型——这正是将一部书跨模型分段写作而非只选一款的核心理由。
- 这也是 Novelmint 在构建章节时逐节拍选择模型所用的同一评分表——构建过程中对段落打分的评委会将数据实时回馈,因此随着作者使用引擎写作,数字也在持续更新。这是一个实时机制,而非事后声明。
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
这是实时数据,而非一次性测试
下方表格并非一次性运行后冻结的基准测试,而是平台评分库的实时投影:在构建过程中对段落打分的同一评委会持续向评分表输送数据,因此每一章在 Novelmint 上写就,都会新增观测、扩大样本、让数字更精准。随着越来越多的作者使用引擎写作,基准测试持续更新——页面上的日期仅表示最近一次重新校准的时间。
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
如何阅读评分表
标题数字是综合技巧分——模型四个执行维度的平均值,最接近"散文质量如何"的答案。右侧的内容维度不是好坏排名,而是说明该模型适合写哪类场景。肢体感高分意味着动作干净利落;情色低分通常意味着拒绝或平铺直叙,而非写作水平差——是意愿问题,不是技巧问题。纵向比较技巧分可对比模型优劣,横向阅读一行可看出单个模型的优势与短板。
Best AI for…
A straight answer for one kind of scene — or one genre
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
生成真实散文,而非测试答案
每个模型在相同条件下写相同的节拍——有必要元素、禁止内容、叙事视角和戏剧目标的简报场景。我们以编辑阅读小说的方式评分,而非测验成绩。
盲评,九个维度
评委小组在不知晓作者模型的情况下,对每段文字从四个技巧维度(文学性、对话、忠实度、节奏)和五个内容维度(情感、肢体感、冲突、浪漫、情色)各打0至100分。技巧衡量执行质量;内容衡量对场景类型的适配性。
向中性先验收缩
少量样本的原始平均值不过是噪音。每个格子都会按证据的薄弱程度向中性基准70收缩,早期的幸运数据在积累足够观测之前只会接近平均水平。公布的数字是收缩后的值,样本量显示在旁边。
持续折叠更新,从不手动覆盖
新的评委观测数据折叠进滚动均值,样本数随之增长,评分表随时间愈发精准。数字由观测数据自动生成,从不手动录入;当模型版本在别名下更新时,其格子会重置为全新测量,而不是将两个不同版本的数据混合。
Where this leads
为什么这样的基准测试有实际价值
为某个场景单独选用不同模型,前提是书以离散的、有简报的单元构建,而非一次性生成。这个单元就是节拍,而在不同模型写不同节拍的情况下保持故事连贯,则依赖于随构建过程传递的弧线与实体记忆。基准测试是记分牌;节拍和弧线记忆才是让书真正用上它的机制。
Questions
Frequently asked
- 哪款AI模型最会写小说?
- 从综合技巧分(文学性、对话、忠实度、节奏四个维度在真实小说散文上的平均值)来看,Claude Opus 4.8 目前领先,GPT-5.6 Sol 紧随其后。但"最好"取决于场景:动作、浪漫和露骨内容的最高分属于不同模型。本页的评分表显示当前排名及每个数字背后的样本量。
- 这个基准测试是如何测量的?
- 每个模型在相同条件下写相同的简报节拍,盲评委小组对生成的散文从九个维度(四个技巧维度:文学性、对话、忠实度、节奏;五个内容维度:情感、肢体感、冲突、浪漫、情色)各打0至100分。得分经可信度收缩向中性基准70调整,以防少量数据左右结果,样本数显示在每个分数旁边。
- 技巧维度和内容维度有什么区别?
- 技巧维度衡量模型的写作水准,与题材无关——句子质量、人物声音、对简报的忠实度和节奏控制。内容维度衡量对特定场景类型的适配性:情感、肢体动作、冲突、浪漫和露骨内容。一个模型可以写出优美的句子,却处理不好打斗场景,因此两类维度分开评分展示。
- 为什么不直接选最好的模型用到底?
- 因为没有任何一款模型全面领先。最强文学技巧、最佳动作场景、最出色的浪漫或露骨写作分属不同模型。Novelmint 逐节拍跨模型路由——大部分保持一个主线声音以保证连贯,在特定节拍上切换更强的模型——而这一切的前提正是这张评分表的存在。
- 低分意味着模型很差吗?
- 不一定。内容低分可能意味着模型有能力但不愿意——大多数模型情色分低是因为拒绝或流于平铺,而非写作水平差。低可信度分(样本少)会收缩向中性基准,读作"尚未证明",而非"已证明较弱"。读分数时,请始终结合样本量一起判断。
- 基准测试多久更新一次?
- 持续更新。评分表是平台评分库的实时投影:Novelmint 构建章节时对段落打分的同一评委会将观测数据实时回馈,随着作者使用引擎、样本量增长,数字也在移动。页面显示最近一次重新校准的日期。新模型版本从头重新测量,而不与被替换的旧版本混合,因此版本更迭不会悄悄污染某一列数据。
What this page does not claim
- 本基准测试仅衡量小说散文质量和内容适配性,对模型的推理、编程、数学、事实准确性或写作场景以外的安全性不作评价。
- 得分是相对于评判集和所用提示的相对评级,并非模型提供商认可的绝对或官方评分。模型名称及商标归各自所有者所有。
- 综合技巧分高并不意味着该模型适合所有书——风格、类型、内容需求和成本都很重要,这正是 Novelmint 跨模型路由而非奉一款为圭臬的原因。
- 低样本格子为暂定值。观测数较少的数字会收缩向中性基准并标注,随着更多测量数据折入,数字将持续变化。