実際に最高の小説を書くAIモデルはどれか?
Live data · measured as of July 24, 2026
どのモデルカードも数学・コーディング・推論を測定する。しかし、読者がスキップしないシーンを書けるかどうかを測るものは存在しない。そこで私たちがそのベンチマークを作った。ブラインド審査パネルが、フロンティアモデルが生成した実際の小説散文を9つの軸——クラフト4軸、小説を構成するシーンの種類5軸——で採点する。以下の数値がそのライブ結果だ。これはマーケティング用のグラフではない:Novelmintが本の各ビートにモデルを選ぶために実際に参照しているグリッドそのものだ。
Key takeaways
- このベンチマークはAnthropicやOpenAI、Google、xAIのフロンティアモデルを、選択式テストではなく実際に生成した小説散文で採点する。9軸:クラフト4軸(文学性・対話・忠実度・ペーシング)とコンテンツ5軸(感情・身体性・葛藤・ロマンス・エロティシズム)。
- クラフト軸は「いかに書くか」を測り、コンテンツ軸は「どんなシーンを書けるか」を測る。美しい文章を書けても戦闘シーンが平板なモデルもあるため、両者は分けて管理し、誤解を招く単一数値に平均化しない。
- 各スコアは、データ量に応じてニュートラルな基準値70に向けて信頼度補正される。サンプル数わずか3件の幸運な結果が確定した事実であるかのように見えることはない。各数値の背後にあるサンプル数は表示される。
- すべての軸で勝つモデルは存在しない。最高の文学的クラフト、最も安定した忠実度、最高のアクション、最も積極的なロマンス・官能表現はそれぞれ異なるモデルにある——それこそが、一つのモデルに固定するのではなく本をモデル間でルーティングすべき理由だ。
- これはNovelmintがチャプター制作時に各ビートのモデル選択に使っているグリッドそのものだ。ビルド中に文章を採点する審査員がデータを供給するため、著者がエンジンで執筆するたびに数値は更新され続ける。事後的な主張ではなく、生きた仕組みだ。
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
これは一度限りのテストではなくライブデータだ
下の表は一度実施して固定したベンチマークではない。プラットフォームが稼働するスコアリングストアのライブな投影だ:ビルド中に文章を評価する審査員が同じグリッドにデータを供給するため、Novelmintで書かれる章ごとに観測が加わり、サンプル数が増え、数値が精緻化される。より多くの著者がエンジンを使うほどベンチマークは更新され続ける——上部の日付は単に最新の再調整日を示している。
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
グリッドの読み方
見出し数値は総合クラフト——4つの実行軸の平均で、「散文の質がどれだけ高いか」に最も近い指標だ。右側のコンテンツ軸は優劣のランキングではなく、そのモデルが何に「適しているか」を示す。身体性スコアが高ければアクション描写がクリーンで、エロティシズムスコアが低い場合は多くの場合、技術の低さではなくモデルの拒否や無機質な表現を意味する——技術ではなく意欲の問題だ。モデルを比較するには列を縦に読み、単一モデルの強みと弱みを把握するには行を横に読む。
Best AI for…
A straight answer for one kind of scene — or one genre
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
テスト回答ではなく実際の散文を生成する
各モデルは同一条件下で同じビート——必須要素・禁止情報・視点・劇的目標を備えたブリーフされたシーン——を執筆する。採点は、クイズの正答率ではなく編集者が読むように、小説として評価する。
9つの軸でブラインド採点する
審査パネルは各文章を、どのモデルが書いたか知らない状態で、クラフト4軸(文学性・対話・忠実度・ペーシング)とコンテンツ5軸(感情・身体性・葛藤・ロマンス・エロティシズム)それぞれ0〜100点で評価する。クラフトは表現品質、コンテンツはシーンタイプへの適性だ。
ニュートラルな事前値に向けて補正する
少数サンプルの単純平均はノイズに過ぎない。各セルは証拠の薄さに応じてニュートラルな基準値70に引き寄せられるため、初期の幸運な測定値は十分な観測数を得るまでおよそ平均値として読まれる。公開される数値はこの補正済みの値であり、サンプル数も合わせて表示される。
折り畳み続け、手動で上書きしない
新しい審査結果は累積平均に折り込まれ、サンプル数が増えてグリッドは精度を増す。数値は観測データから再生成されるため、手入力されることはない。モデルのバージョンが変わった場合、そのセルは二つの異なるモデルを混在させることなくクリーンに再測定される。
Where this leads
このようなベンチマークが活用できる理由
あるシーンに別のモデルを選ぶことが機能するのは、本が一括生成ではなく個別のブリーフ付き単位で構築されている場合に限る。その単位がビートであり、異なるモデルが異なるビートを書く中でストーリーの一貫性を保つのが、ビルドに伴って移動するアーク&エンティティメモリの役割だ。ベンチマークはスコアボードであり、ビートとアークメモリが本でそれを実際に活かす手段だ。
Questions
Frequently asked
- 最高の小説を書くAIモデルはどれか?
- 総合クラフト(文学性・対話・忠実度・ペーシング軸の平均、実際の小説散文を使用)では、現在Claude Opus 4.8がトップで、GPT-5.6 Solが僅差で続く。ただし「最高」はシーンによって異なる:アクション・ロマンス・成人向けコンテンツの最高スコアはそれぞれ別のモデルが持つ。このページのグリッドに現在の順位と各数値のサンプル数が表示されている。
- このベンチマークはどのように測定されるか?
- 各モデルは同一条件下で同じブリーフ済みビートを執筆し、ブラインド審査パネルが生成された散文を9軸(クラフト4軸:文学性・対話・忠実度・ペーシング、コンテンツ5軸:感情・身体性・葛藤・ロマンス・エロティシズム)で0〜100点評価する。スコアはニュートラルな基準値70に向けて信頼度補正されるため、データが少ないと数値が大きくブレることはなく、各スコアの横にサンプル数が表示される。
- クラフト軸とコンテンツ軸の違いは何か?
- クラフト軸はテーマに関わらずモデルの「書き方の質」を測る——文章品質、キャラクターの声、ブリーフへの忠実度、ペース管理。コンテンツ軸はシーンの種類への適性を測る:感情・身体的アクション・葛藤・ロマンス・成人向けコンテンツ。美しい文章を書けても戦闘シーンの扱いが苦手なモデルもあるため、両者は分けて採点・表示される。
- なぜ最良の単一モデルを選んですべてに使わないのか?
- すべての軸で勝つモデルが存在しないからだ。最高の文学的クラフト、最高のアクション、最も優れたロマンス・官能表現はそれぞれ異なるモデルに属する。Novelmintはビートごとにモデルをルーティングする——一貫した声のために大部分を一つのモデルに保ちつつ、それに見合う特定のビートでは優れたモデルに切り替える——それがこのグリッドがあるからこそ可能なことだ。
- 低スコアはモデルが劣っていることを意味するか?
- 必ずしもそうではない。コンテンツスコアが低い場合、技術がないのではなくモデルが「意欲的でない」ことを意味することがある——多くのモデルがエロティシズムで低スコアなのは、技術不足ではなく拒否や無機質な表現によるものだ。また信頼度の低いスコア(サンプル数少)はニュートラルな基準値に補正されるため、「弱いと証明された」ではなく「まだ未確定」と読む。スコアは常にサンプル数とセットで確認すること。
- ベンチマークはどのくらいの頻度で更新されるか?
- 継続的に更新される。グリッドはプラットフォームのスコアリングストアのライブな投影だ:Novelmintがチャプターを構築する際に文章を評価する審査員が観測を折り込み続けるため、著者がエンジンを使いサンプル数が増えるにつれて数値は動く。ページには最新の再調整日が表示される。新しいモデルバージョンは置き換えたモデルとブレンドされることなくゼロから再測定されるため、バージョン変更によって列のデータが密かに汚染されることはない。
What this page does not claim
- このベンチマークは散文品質と小説コンテンツへの適性のみを測定する。推論・コーディング・数学・事実の正確さ、または執筆以外の安全性については何も示さない。
- スコアは審査対象セットおよび使用プロンプトに対する相対評価であり、モデル提供者が公認した絶対的・公式評価ではない。モデル名および商標は各所有者に帰属する。
- 総合クラフトスコアが高いからといって、すべての本にそのモデルが最適とは限らない——声質・ジャンル・コンテンツニーズ・コストはどれも重要だ。Novelmintがモデルを一つに絞らず横断してルーティングする理由はまさにここにある。
- サンプル数が少ないセルは暫定値だ。観測数が少ない数値はニュートラルな基準値に補正されフラグが立てられ、測定が積み重なるにつれて変化する。