Novelmintのフィクションベンチマークは、モデルカードが決して測定しない一点を評価する:読者が読み飛ばさないシーンをモデルが書けるかどうか、だ。これは数学やコーディングテストから借用したリーダーボードではなく、実際の小説散文を採点する。数字がどのように算出されるかをここで正確に説明するので、自分自身で判断し、自信を持って引用できる。
何を測定するのか
このベンチマークは、Anthropic、OpenAI、Google、xAIのフロンティアモデルがフィクションをどれほどうまく書けるかを採点する。推論能力ではなく、コーディング能力でもなく、多肢選択式テストの成績でもない。各モデルには同じ内容のノベルビートが与えられる――必須要素、禁止知識、視点、そして劇的な目標を持つシーンだ――そしてモデルが書いたものは、編集者が読むように、フィクションとして評価される。
すべての結果は軸ごとに0〜100の単一スケールで表現されるため、モデル間でも、実際の本を構成するシーンの種類間でも、数字を直接比較できる。
9つの軸
フィクションは単一のスキルではないため、ベンチマークはそれを一つの数字に集約しない。9つの軸で採点し、意味の異なる2つのファミリーに分けられる。
4つのクラフト軸は、題材に関わらずモデルがどれほどうまく書けるかを測定する:literary(文レベルのイメージ、リズム、サブテキスト、抑制)、dialogue(登場人物がそれぞれ個性的な人物として聞こえるか)、fidelity(指定されたビートを忠実に再現し、必須要素を含め、禁止知識を除外しているか)、そしてpacing(勢いのコントロール――いつ圧縮し、いつ留まるか)。
5つのコンテンツ軸は、モデルがどのようなシーンをうまく書けるかを測定する:emotion、physicality(アクションと空間における身体)、conflict、romance、そしてeroticism(明示的な成人向けコンテンツ)。これらは優劣のランキングではなく、モデルが何に適しているかを示すものだ。美しい文章を持つモデルでも、戦闘シーンが平板になることがある。だからこそ、クラフトとコンテンツは別々に採点・報告され、一つの誤解を招く数字に平均化されることは決してない。
各モデルの採点方法
採点はブラインドのピアレビューで行われる。各モデルは同じセットの指定ビートを書き、プロバイダーが多様な審査員モデルのパネルが、どのモデルが書いたかを知らず、かつ自分自身の作品を評価することなく、各軸について0〜100で全パッセージを評価する。プロバイダーが多様なパネルであることは重要だ:モデルの自社ファミリー外の審査員は、そのファミリーが評価しがちな癖を見抜く。
採点がブラインドかつクロスモデルで行われるため、モデルは自分自身を持ち上げることができず、単一の家風がスタンダードを設定することもない。
審査員バイアスのコントロール
モデルを使ってモデルを評価する場合、4つのよく知られた失敗モードが存在し、この手法はそれぞれを解消するように設計されている。
自己優先 ――モデルは自分の家風に点数を与えがちだ。2つのルールがこれを除去する:モデルは自分のパッセージを採点しない、そして審査員パネルはプロバイダーが多様であるため、単一のファミリーの好みがスタンダードを設定しない。あるハウスが評価する癖は別のハウスの審査員に捕捉され、逆もまた然りだ。
冗長性 ――審査員は長さを過剰に評価する傾向がある。すべてのビートは同じターゲット(おおよそ220語)を指定するため、すべてのパッセージはほぼ同じサイズで提出され、水増しは何も得をしない。モデルは使った語数ではなく、それらの語で何をするかで点数を稼ぐ。
順序 ――パッセージが表示される順序が、最初に来たものへのスコアを押し上げることがある。そのため、パッセージはビートごとにラベルを変えてシャッフルされ、それぞれは固定されたルーブリックに対して単独で採点される(順位付けではない)。順序はシグナルを持たず、残余のドリフトは多くのビートと多くの審査員を通じて平均化される。
サンプリング ――一つの運の良い草稿がモデルを美化することがある。生成は各モデルのデフォルト温度で同一のプロンプトで実行され、モデルごとのチューニングは行われないため、他のモデルが得られない都合の良い設定を渡されるモデルはない。また、どのセルも一つの草稿に基づくことはない:すべてのモデルはパネル上の他のすべてのモデルによってビートセット全体で採点され、十分な測定値が蓄積されるまで中立ベースラインに向けて縮小される――そのため、数字が公表される前に単一草稿の運は洗い流される。
スコアが信頼度によって縮小される理由
少数のパッセージからの生の平均はノイズであり、スコアに見せかけたノイズはスコアなしよりも悪い。そのため、すべての公表数字は背後にあるデータが少ないほど、中立の70ベースラインに向けて縮小される――正式には、5つの観測値に相当する事前分布だ。3つの運の良いサンプルに基づくセルは、十分な測定値がそれに値する場所を確立するまで、ほぼ平均として読まれる;数百に基づくセルは、真の測定値として読まれる。
すべての数字の背後にあるサンプルサイズが表示され、まだ6つ未満の観測値に基づくセルは暫定的なものとして示される。これが、薄いデータを持つモデルが偶然でトップに躍り出ることが決してない理由だ――この手法がそれを許さない。
グリッドを最新に保つ方法
このベンチマークは、一度実行されて凍結された単発のテストではない。プラットフォームが稼働している採点ストアのライブ投影だ:新しい審査員の観測値が実行中の平均に折り込まれ、各セルのサンプル数は時間とともに増加するため、グリッドは老化するのではなく精度が増す。ページには常に最新の再キャリブレーションの日付が表示される。
精度のために重要なセーフガードが一つある。耐久性のあるエイリアス(「latest」ポインタ)が静かに新しい基盤モデルに向け直された場合、そのモデルのセルは置き換えられたモデルとブレンドされるのではなく、リセットされてゼロから再測定される――そのため、バージョン変更が静かに列を破損することはない。これがまた、ベンチマークが汎用ラベルではなく測定した特定バージョンを名指しする理由でもある。
制限事項
スコアは、このモデルとプロンプトのセットで評価された、フィクションビートのみの散文を記述する。これらはモデルプロバイダーが承認した公式評価ではなく、執筆コンテキスト外でのモデルの推論、正確性、または安全性については何も示さない。モデル名および商標はそれぞれの所有者に帰属する;これは独立した測定である。
二つの読み方は誤りやすい。eroticismの低いスコアは通常、クラフトの失敗ではなく、意欲を反映している――モデルが断ったり、臨床的な表現になったりすることだ。そして低信頼度のスコアは「まだ証明されていない」を意味し、「弱いと証明された」ではない。常に数字をそのサンプルサイズと合わせて読み、あなたの本にとって最良のモデルは、あなたの本がどの軸に依拠しているかによって異なることを忘れないでほしい――それこそが、グリッドがそれらを分けて保持している理由のすべてだ。