小说模型基准测试

哪款AI模型真正最会写小说?

Live data · measured as of July 24, 2026

所有模型评分卡都在测数学、代码和推理,却没有一张衡量模型能否写出读者不会跳过的场景。于是我们建立了这个基准测试。盲评委小组对前沿模型生成的真实小说散文从九个维度打分——四个衡量写作技巧,五个衡量小说场景类型——以下数据是实时结果。这不是营销图表,而是 Novelmint 在为你的每一个故事节拍选择模型时所依据的真实评分表。

Key takeaways

  • 本基准测试对来自 Anthropic、OpenAI、Google 和 xAI 的前沿模型,以真实生成的小说散文(而非选择题)为依据,从九个维度打分:四个技巧维度(文学性、对话、忠实度、节奏)和五个内容维度(情感、肢体感、冲突、浪漫、情色)。
  • 技巧维度衡量模型写得有多好;内容维度衡量它擅长写哪类场景。一个模型可以句子优美,却写不好打斗场景,因此两类维度分开评分,绝不合并为一个误导性的综合数字。
  • 每项得分都会向中性基准70进行可信度收缩,样本越少收缩越大,因此三个样本的幸运结果永远不会伪装成确定结论。每个数字背后的样本量均有显示。
  • 没有一款模型全面称霸。最强文学技巧、最稳定的忠实度、最佳动作场景、最开放的浪漫与露骨写作分属不同模型——这正是将一部书跨模型分段写作而非只选一款的核心理由。
  • 这也是 Novelmint 在构建章节时逐节拍选择模型所用的同一评分表——构建过程中对段落打分的评委会将数据实时回馈,因此随着作者使用引擎写作,数字也在持续更新。这是一个实时机制,而非事后声明。

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

这是实时数据,而非一次性测试

下方表格并非一次性运行后冻结的基准测试,而是平台评分库的实时投影:在构建过程中对段落打分的同一评委会持续向评分表输送数据,因此每一章在 Novelmint 上写就,都会新增观测、扩大样本、让数字更精准。随着越来越多的作者使用引擎写作,基准测试持续更新——页面上的日期仅表示最近一次重新校准的时间。

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

如何阅读评分表

标题数字是综合技巧分——模型四个执行维度的平均值,最接近"散文质量如何"的答案。右侧的内容维度不是好坏排名,而是说明该模型适合写哪类场景。肢体感高分意味着动作干净利落;情色低分通常意味着拒绝或平铺直叙,而非写作水平差——是意愿问题,不是技巧问题。纵向比较技巧分可对比模型优劣,横向阅读一行可看出单个模型的优势与短板。

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

生成真实散文,而非测试答案

每个模型在相同条件下写相同的节拍——有必要元素、禁止内容、叙事视角和戏剧目标的简报场景。我们以编辑阅读小说的方式评分,而非测验成绩。

02

盲评,九个维度

评委小组在不知晓作者模型的情况下,对每段文字从四个技巧维度(文学性、对话、忠实度、节奏)和五个内容维度(情感、肢体感、冲突、浪漫、情色)各打0至100分。技巧衡量执行质量;内容衡量对场景类型的适配性。

03

向中性先验收缩

少量样本的原始平均值不过是噪音。每个格子都会按证据的薄弱程度向中性基准70收缩,早期的幸运数据在积累足够观测之前只会接近平均水平。公布的数字是收缩后的值,样本量显示在旁边。

04

持续折叠更新,从不手动覆盖

新的评委观测数据折叠进滚动均值,样本数随之增长,评分表随时间愈发精准。数字由观测数据自动生成,从不手动录入;当模型版本在别名下更新时,其格子会重置为全新测量,而不是将两个不同版本的数据混合。

Where this leads

为什么这样的基准测试有实际价值

为某个场景单独选用不同模型,前提是书以离散的、有简报的单元构建,而非一次性生成。这个单元就是节拍,而在不同模型写不同节拍的情况下保持故事连贯,则依赖于随构建过程传递的弧线与实体记忆。基准测试是记分牌;节拍和弧线记忆才是让书真正用上它的机制。

Questions

Frequently asked

哪款AI模型最会写小说?
从综合技巧分(文学性、对话、忠实度、节奏四个维度在真实小说散文上的平均值)来看,Claude Opus 4.8 目前领先,GPT-5.6 Sol 紧随其后。但"最好"取决于场景:动作、浪漫和露骨内容的最高分属于不同模型。本页的评分表显示当前排名及每个数字背后的样本量。
这个基准测试是如何测量的?
每个模型在相同条件下写相同的简报节拍,盲评委小组对生成的散文从九个维度(四个技巧维度:文学性、对话、忠实度、节奏;五个内容维度:情感、肢体感、冲突、浪漫、情色)各打0至100分。得分经可信度收缩向中性基准70调整,以防少量数据左右结果,样本数显示在每个分数旁边。
技巧维度和内容维度有什么区别?
技巧维度衡量模型的写作水准,与题材无关——句子质量、人物声音、对简报的忠实度和节奏控制。内容维度衡量对特定场景类型的适配性:情感、肢体动作、冲突、浪漫和露骨内容。一个模型可以写出优美的句子,却处理不好打斗场景,因此两类维度分开评分展示。
为什么不直接选最好的模型用到底?
因为没有任何一款模型全面领先。最强文学技巧、最佳动作场景、最出色的浪漫或露骨写作分属不同模型。Novelmint 逐节拍跨模型路由——大部分保持一个主线声音以保证连贯,在特定节拍上切换更强的模型——而这一切的前提正是这张评分表的存在。
低分意味着模型很差吗?
不一定。内容低分可能意味着模型有能力但不愿意——大多数模型情色分低是因为拒绝或流于平铺,而非写作水平差。低可信度分(样本少)会收缩向中性基准,读作"尚未证明",而非"已证明较弱"。读分数时,请始终结合样本量一起判断。
基准测试多久更新一次?
持续更新。评分表是平台评分库的实时投影:Novelmint 构建章节时对段落打分的同一评委会将观测数据实时回馈,随着作者使用引擎、样本量增长,数字也在移动。页面显示最近一次重新校准的日期。新模型版本从头重新测量,而不与被替换的旧版本混合,因此版本更迭不会悄悄污染某一列数据。

What this page does not claim

  • 本基准测试仅衡量小说散文质量和内容适配性,对模型的推理、编程、数学、事实准确性或写作场景以外的安全性不作评价。
  • 得分是相对于评判集和所用提示的相对评级,并非模型提供商认可的绝对或官方评分。模型名称及商标归各自所有者所有。
  • 综合技巧分高并不意味着该模型适合所有书——风格、类型、内容需求和成本都很重要,这正是 Novelmint 跨模型路由而非奉一款为圭臬的原因。
  • 低样本格子为暂定值。观测数较少的数字会收缩向中性基准并标注,随着更多测量数据折入,数字将持续变化。

别再猜该用哪个模型了,让书自己来选。

Novelmint 根据这张评分表,将每个节拍路由到最合适的模型。第一章免费。