方法論

フィクションモデルベンチマークの仕組み

Updated July 23, 2026 · 6分で読めます

このベンチマークは、モデルカードが決して測らない一点を測定します——読者がスキップしないシーンをモデルが書けるかどうか。このページでは、数値の算出方法、評価対象、信頼度によるスコア補正の理由、そしてグリッドの最新化の仕組みを正確に説明します。結果を自分で判断し、正確に引用するために役立ててください。

Key takeaways

  • フロンティアモデルが同一のブリーフに沿って小説シーンを執筆し、プロバイダー多様なブラインド審査パネルが9軸を0〜100で採点します——どのモデルが書いたかは伏せた状態で。
  • 9軸は2つのファミリーに分かれます:クラフト4軸(文学性、対話、忠実度、ペーシング)はモデルの文章力を、コンテンツ5軸(感情、身体性、葛藤、ロマンス、エロティシズム)はどんなシーンを得意とするかを測ります。両者を平均することはありません。
  • すべてのスコアは、データの少なさに比例して中立的な70のベースラインへ補正されます(事前分布は5観測分)。幸運な小サンプルがトップに達することはできません。サンプルサイズは表示され、データが薄いセルはフラグが立てられます。
  • グリッドはライブです——新しい審査観測値が継続的に加重平均に反映され、モデルのバージョンが変わった場合は前バージョンとブレンドせずリセットして再測定します。
  • スコアはフィクションビートの文章のみを対象としており、独立した測定値です。公式のプロバイダー評価ではなく、エロティシズムのスコアが低い場合は通常、文章力ではなく生成意欲の問題を反映しています。

Novelmintのフィクションベンチマークは、モデルカードが決して測定しない一点を評価する:読者が読み飛ばさないシーンをモデルが書けるかどうか、だ。これは数学やコーディングテストから借用したリーダーボードではなく、実際の小説散文を採点する。数字がどのように算出されるかをここで正確に説明するので、自分自身で判断し、自信を持って引用できる。

何を測定するのか

このベンチマークは、Anthropic、OpenAI、Google、xAIのフロンティアモデルがフィクションをどれほどうまく書けるかを採点する。推論能力ではなく、コーディング能力でもなく、多肢選択式テストの成績でもない。各モデルには同じ内容のノベルビートが与えられる――必須要素、禁止知識、視点、そして劇的な目標を持つシーンだ――そしてモデルが書いたものは、編集者が読むように、フィクションとして評価される。

すべての結果は軸ごとに0〜100の単一スケールで表現されるため、モデル間でも、実際の本を構成するシーンの種類間でも、数字を直接比較できる。

9つの軸

フィクションは単一のスキルではないため、ベンチマークはそれを一つの数字に集約しない。9つの軸で採点し、意味の異なる2つのファミリーに分けられる。

4つのクラフト軸は、題材に関わらずモデルがどれほどうまく書けるかを測定する:literary(文レベルのイメージ、リズム、サブテキスト、抑制)、dialogue(登場人物がそれぞれ個性的な人物として聞こえるか)、fidelity(指定されたビートを忠実に再現し、必須要素を含め、禁止知識を除外しているか)、そしてpacing(勢いのコントロール――いつ圧縮し、いつ留まるか)。

5つのコンテンツ軸は、モデルがどのようなシーンをうまく書けるかを測定する:emotionphysicality(アクションと空間における身体)、conflictromance、そしてeroticism(明示的な成人向けコンテンツ)。これらは優劣のランキングではなく、モデルが何に適しているかを示すものだ。美しい文章を持つモデルでも、戦闘シーンが平板になることがある。だからこそ、クラフトとコンテンツは別々に採点・報告され、一つの誤解を招く数字に平均化されることは決してない。

各モデルの採点方法

採点はブラインドのピアレビューで行われる。各モデルは同じセットの指定ビートを書き、プロバイダーが多様な審査員モデルのパネルが、どのモデルが書いたかを知らず、かつ自分自身の作品を評価することなく、各軸について0〜100で全パッセージを評価する。プロバイダーが多様なパネルであることは重要だ:モデルの自社ファミリー外の審査員は、そのファミリーが評価しがちな癖を見抜く。

採点がブラインドかつクロスモデルで行われるため、モデルは自分自身を持ち上げることができず、単一の家風がスタンダードを設定することもない。

審査員バイアスのコントロール

モデルを使ってモデルを評価する場合、4つのよく知られた失敗モードが存在し、この手法はそれぞれを解消するように設計されている。

自己優先 ――モデルは自分の家風に点数を与えがちだ。2つのルールがこれを除去する:モデルは自分のパッセージを採点しない、そして審査員パネルはプロバイダーが多様であるため、単一のファミリーの好みがスタンダードを設定しない。あるハウスが評価する癖は別のハウスの審査員に捕捉され、逆もまた然りだ。

冗長性 ――審査員は長さを過剰に評価する傾向がある。すべてのビートは同じターゲット(おおよそ220語)を指定するため、すべてのパッセージはほぼ同じサイズで提出され、水増しは何も得をしない。モデルは使った語数ではなく、それらの語で何をするかで点数を稼ぐ。

順序 ――パッセージが表示される順序が、最初に来たものへのスコアを押し上げることがある。そのため、パッセージはビートごとにラベルを変えてシャッフルされ、それぞれは固定されたルーブリックに対して単独で採点される(順位付けではない)。順序はシグナルを持たず、残余のドリフトは多くのビートと多くの審査員を通じて平均化される。

サンプリング ――一つの運の良い草稿がモデルを美化することがある。生成は各モデルのデフォルト温度で同一のプロンプトで実行され、モデルごとのチューニングは行われないため、他のモデルが得られない都合の良い設定を渡されるモデルはない。また、どのセルも一つの草稿に基づくことはない:すべてのモデルはパネル上の他のすべてのモデルによってビートセット全体で採点され、十分な測定値が蓄積されるまで中立ベースラインに向けて縮小される――そのため、数字が公表される前に単一草稿の運は洗い流される。

スコアが信頼度によって縮小される理由

少数のパッセージからの生の平均はノイズであり、スコアに見せかけたノイズはスコアなしよりも悪い。そのため、すべての公表数字は背後にあるデータが少ないほど、中立の70ベースラインに向けて縮小される――正式には、5つの観測値に相当する事前分布だ。3つの運の良いサンプルに基づくセルは、十分な測定値がそれに値する場所を確立するまで、ほぼ平均として読まれる;数百に基づくセルは、真の測定値として読まれる。

すべての数字の背後にあるサンプルサイズが表示され、まだ6つ未満の観測値に基づくセルは暫定的なものとして示される。これが、薄いデータを持つモデルが偶然でトップに躍り出ることが決してない理由だ――この手法がそれを許さない。

グリッドを最新に保つ方法

このベンチマークは、一度実行されて凍結された単発のテストではない。プラットフォームが稼働している採点ストアのライブ投影だ:新しい審査員の観測値が実行中の平均に折り込まれ、各セルのサンプル数は時間とともに増加するため、グリッドは老化するのではなく精度が増す。ページには常に最新の再キャリブレーションの日付が表示される。

精度のために重要なセーフガードが一つある。耐久性のあるエイリアス(「latest」ポインタ)が静かに新しい基盤モデルに向け直された場合、そのモデルのセルは置き換えられたモデルとブレンドされるのではなく、リセットされてゼロから再測定される――そのため、バージョン変更が静かに列を破損することはない。これがまた、ベンチマークが汎用ラベルではなく測定した特定バージョンを名指しする理由でもある。

制限事項

スコアは、このモデルとプロンプトのセットで評価された、フィクションビートのみの散文を記述する。これらはモデルプロバイダーが承認した公式評価ではなく、執筆コンテキスト外でのモデルの推論、正確性、または安全性については何も示さない。モデル名および商標はそれぞれの所有者に帰属する;これは独立した測定である。

二つの読み方は誤りやすい。eroticismの低いスコアは通常、クラフトの失敗ではなく、意欲を反映している――モデルが断ったり、臨床的な表現になったりすることだ。そして低信頼度のスコアは「まだ証明されていない」を意味し、「弱いと証明された」ではない。常に数字をそのサンプルサイズと合わせて読み、あなたの本にとって最良のモデルは、あなたの本がどの軸に依拠しているかによって異なることを忘れないでほしい――それこそが、グリッドがそれらを分けて保持している理由のすべてだ。

Questions

Frequently asked

NovelmintはどのようにしてAIモデルをフィクション向けにベンチマークしますか?
各フロンティアモデルが同一のブリーフに沿って小説シーンを執筆し、プロバイダー多様なブラインド審査パネルが9軸を0〜100で採点します(著者不明の状態で)。スコアはデータ量に応じてベースラインへ補正され、観測値は継続的に加重平均に反映されます。
9つの評価軸とは何ですか?
クラフト4軸——文学性、対話、忠実度(ブリーフへの忠実さ)、ペーシング——はモデルの文章力を測ります。コンテンツ5軸——感情、身体性(アクション)、葛藤、ロマンス、エロティシズム——はどんなシーンを得意とするかを測ります。クラフトとコンテンツは別々に報告され、平均されることはありません。
スコアはなぜ信頼度で調整されるのですか?
少数のパッセージからの単純平均はノイズに過ぎません。各スコアは、背後にあるデータの少なさに比例して中立的な70のベースラインへ補正されます(事前分布は5観測分)。幸運な小サンプルがトップに達することはできません。サンプルサイズは表示され、6観測未満のセルは暫定値としてフラグが立てられます。
これはOpenAI、Anthropic、Google、xAIによる公式ランキングですか?
いいえ。Novelmintによる独立した測定であり、フィクション文章のみを対象とし、特定のモデルセットとプロンプトに基づいて審査されます。推論能力、正確性、その他の能力については何も言及しておらず、モデル名はそれぞれの所有者の商標です。
ベンチマークはどのくらいの頻度で更新されますか?
継続的に更新されます——新しい審査観測値が加重平均に反映され、サンプル数が増えるにつれてグリッドの精度が向上します。エイリアス下のモデルバージョンが変わった場合、そのセルは古いバージョンとブレンドせずリセットして再測定されます。ページには最新の再調整日が表示されます。

What this page does not claim

  • スコアは、審査されたモデルセットと使用されたプロンプトに対する相対的な評価であり、絶対的または公式な評価ではありません。
  • エロティシズムのスコアが低い場合は文章力の欠如ではなく生成意欲(拒否または無機質な表現)を反映しており、信頼度の低いスコアは「弱さが証明された」のではなく「まだ証明されていない」ことを意味します。
  • このベンチマークはフィクション文章のみを測定しており、推論、コーディング、事実精度、または執筆文脈外の安全性については何も言及しません。

あなたのシーンを最もうまく書けるモデルを探しましょう。

9軸のライブデータ。文章の測定が増えるたびに更新されます。