方法论

小说模型基准测试的运作方式

Updated July 23, 2026 · 阅读约需 6 分钟

该基准测试衡量的是模型卡从不涉及的一件事:模型能否写出读者不会跳过的场景。本页详细说明数字的生成方式——测量内容、评判方式、分数为何经置信度收缩,以及如何保持数据更新——供你自行权衡结果并准确引用。

Key takeaways

  • 前沿模型基于相同的简报撰写小说情节,由盲测多提供商评委团在不知晓作者身份的情况下,对文本的九个维度打分(0–100)。
  • 九个维度分为两类:四个写作技巧维度(文学性、对话、忠实度、节奏)衡量模型写得好不好;五个内容维度(情感、肢体感、冲突、浪漫、情色)衡量模型擅长写什么类型的场景。两类维度不合并平均。
  • 每项分数均向中性基准 70 收缩,收缩幅度与数据量成反比(先验相当于五条观测值),因此小样本的幸运表现无法冲到顶部。样本量均有显示,数据稀少的格子会被标记。
  • 数据实时更新——新的评委观测持续并入累计均值,模型版本变更时会重置并重新测量,而非与前版混合。
  • 分数仅描述小说情节中的文本表现,是独立测量结果而非官方提供商评级;情色维度低分通常反映的是模型的意愿限制,而非写作能力不足。

Novelmint 小说基准测试衡量的是模型卡片从未涉及的一件事:模型是否能写出读者不会跳过的场景。它不是从数学或编程测试中借用的排行榜——它评分的是真实的小说散文。以下是数据生成的完整方式,供你自行权衡并放心引用。

测量内容

该基准测试评分衡量前沿模型——来自 Anthropic、OpenAI、Google 和 xAI——写作小说的能力。不是推理能力,不是编程能力,也不是多项选择题的表现。每个模型接受相同的简报式小说节拍——包含必要元素、禁止信息、叙事视角和戏剧目标的场景——其写作内容将以编辑阅读小说的方式被评判。

所有内容均以每个维度 0–100 的单一量表表示,因此各模型之间以及书籍实际涵盖的各类场景之间的数据可直接比较。

九个维度

小说不是一项单一技能,因此基准测试不会将其压缩为一个数字。它对九个维度进行评分,分为两个含义不同的类别。

四个技艺维度衡量模型写作的质量,与题材无关:文学性(句子层面的意象、节奏、弦外之音、克制),对话(角色是否听起来像各具特色的人),忠实度(对简报节拍的还原程度——保留必要元素、排除禁止信息),以及节奏(动势的把控——何时压缩,何时展开)。

五个内容维度衡量模型擅长写作哪类场景:情感肢体感(动作与身体在空间中的呈现)、冲突浪漫,以及情色(明确的成人内容)。这些不是优劣排名——它们说明模型适合哪类内容。一个模型可以拥有优美的句子,却写出平淡的打斗场景,这正是技艺与内容分开评分和报告、从不平均为单一误导性数字的原因。

每个模型的评分方式

评分采用盲审同行评议。每个模型写作同一组简报节拍,由一组强大的、供应商多元化的评判模型对每段文字按每个维度评 0–100 分——不知道是哪个模型写的,也绝不评判自己的作品。供应商多元化的评审团至关重要:来自模型自身家族之外的评判者能够识别该家族倾向于奖励的写作风格特征。

由于评判是盲审且跨模型的,模型无法自我奉承,也没有任何单一的写作风格能左右标准。

控制评判偏差

以模型评判模型会带来四种已知的失效模式,该方法的设计旨在逐一消除。

自我偏好——模型倾向于奖励自己的写作风格。两条规则消除这一问题:模型永远不为自己的段落评分,且评审团供应商多元化,因此没有任何单一家族的偏好能设定标准。一个家族倾向奖励的写作特征会被来自另一家族的评判者识别,反之亦然。

冗长偏好——评判者会系统性地过度奖励篇幅。每个节拍简报的目标长度大致相同,约 220 字,因此所有段落字数几乎一致,堆砌内容毫无益处。模型凭借用这些字数做了什么来获得评分,而不是花了多少字数。

位置效应——段落出现的顺序可能会使评分偏向最先出现的内容。因此,每个节拍的段落都会重新标注并随机打乱,每段文字依据固定评分标准单独评分,而非相互比较排名。顺序不携带任何信号,任何残余偏差都会在大量节拍和大量评判者中平均消除。

采样运气——单次幸运草稿可能会美化模型表现。生成过程在每个模型的默认温度下以相同提示运行,不进行任何针对特定模型的调优,因此没有任何模型获得其他模型没有的精心挑选设置。每个单元格也不依赖单次草稿:每个模型由评审团中的所有其他模型跨完整节拍集评分,然后向中性基线收缩,直到积累足够多的测量数据——因此单次草稿的运气在数字发布之前早已被稀释。

为何评分要按置信度收缩

少数几段文字得出的原始平均值只是噪声,而伪装成评分的噪声比没有评分更糟糕。因此,每个已发布的数字都按其背后数据量的多少向中性 70 基线收缩——正式而言,这是一个相当于五次观测的先验。由三次幸运样本支撑的单元格读数约为平均水平,直到积累足够的测量数据才能获得一席之地;由数百次测量支撑的单元格读数则反映其真实测量值。

每个数字背后的样本量均会显示,任何仍依赖少于六次观测的单元格都会被标记为暂定。这就是为什么数据稀薄的模型永远不会凭运气冲到榜首——该方法不会允许这种情况发生。

如何保持网格时效性

该基准测试不是一次性运行后冻结的测试。它是平台运行的评分库的实时投影:新的评判观测数据会折入滚动均值,每个单元格的样本数量随时间增长,因此网格会不断精细化而非老化。页面始终显示最近一次重新校准的日期。

有一项保障措施对准确性至关重要。当一个持久别名("latest"指针)悄然指向新的底层模型时,该模型的单元格会被重置并从头重新测量,而非与其替换的模型数据混合——因此版本更新永远不会悄悄损坏某一列的数据。这也是为什么基准测试标注的是具体测量版本而非通用标签。

局限性

这些评分仅描述小说节拍上的散文表现,以当前这组模型和提示词为评判依据。它们不是模型提供商官方认可的评级,也不涉及模型在写作背景之外的推理、准确性或安全性。模型名称和商标归各自所有者所有;这是一项独立测量。

有两种解读容易出错。低情色评分通常反映的是意愿问题——模型拒绝或处理方式过于临床——而非技艺上的失败。低置信度评分意味着"尚未得到证明",而非"已被证明较弱"。始终将数字与其样本量一起阅读,并记住最适合你书籍的模型取决于你的书倚重哪些维度——这正是网格将它们分开呈现的全部原因。

Questions

Frequently asked

Novelmint 如何对 AI 模型进行小说基准测试?
每个前沿模型基于相同的简报撰写小说情节,由盲测多提供商的强力评委模型组成评委团,在不知晓作者身份的情况下对文本九个维度打分(0–100)。分数根据数据量向中性基准收缩,观测值持续并入累计均值。
九个评测维度是什么?
四个写作技巧维度——文学性、对话、忠实度(对简报的忠实程度)、节奏——衡量模型写得好不好。五个内容维度——情感、肢体感(动作)、冲突、浪漫、情色——衡量模型擅长写什么类型的场景。技巧维度与内容维度分开报告,不合并平均。
为什么分数要进行置信度调整?
少量段落的原始平均值噪声较大。每项分数都按数据量的多少向中性基准 70 收缩——先验相当于五条观测值——以防小样本的幸运结果冲到顶部。样本量会显示出来,观测值少于六条的格子会被标记为暂定数据。
这是 OpenAI、Anthropic、Google 或 xAI 的官方排名吗?
不是。这是 Novelmint 对小说文本进行的独立测量,仅基于当前模型集和提示词进行评判,不涉及推理能力、准确性或其他能力,模型名称均为各自所有者的商标。
基准测试多久更新一次?
持续更新——新的评委观测持续并入累计均值,样本量不断增长,数据随时间愈加精准。当某一模型别名下的版本发生变化时,相关格子会重置并重新测量,而非与旧版混合。页面会显示最近一次重新校准的日期。

What this page does not claim

  • 分数是相对于当前评测模型集和所用提示词而言的,并非绝对评级或官方评级。
  • 情色维度低分反映的是模型的意愿(拒绝或态度趋于保守),而非写作能力不足;置信度低的分数意味着"尚未得到验证",而非"已被证明较弱"。
  • 基准测试仅衡量小说文本表现,不涉及推理、编程、事实准确性或写作场景以外的安全性。

看看哪个模型最擅长写你想要的场景。

覆盖九个维度的实时数据,随文本测量持续更新。