어떤 AI 모델이 실제로 소설을 가장 잘 쓸까?
Live data · measured as of July 24, 2026
모든 모델 카드는 수학, 코딩, 추론을 측정합니다. 독자가 건너뛰지 않을 장면을 쓸 수 있는지는 아무도 측정하지 않습니다. 그래서 저희가 직접 만들었습니다. 블라인드 심사단이 프론티어 모델이 생성한 실제 소설 산문을 9가지 축 — 기술 4가지, 실제 책을 구성하는 장면 유형 5가지 — 으로 채점하며, 아래 수치는 그 실시간 결과입니다. 마케팅 차트가 아닙니다: Novelmint가 책의 각 비트에 맞는 모델을 선택할 때 실제로 읽는 그리드입니다.
Key takeaways
- 이 벤치마크는 Anthropic, OpenAI, Google, xAI의 프론티어 모델을 실제 생성된 소설 산문으로(객관식 테스트가 아닌) 9가지 축에 걸쳐 채점합니다: 기술 4가지(문학성, 대화, 충실도, 페이싱)와 콘텐츠 5가지(감정, 신체성, 갈등, 로맨스, 에로티시즘).
- 기술 축은 모델이 얼마나 잘 쓰는지를, 콘텐츠 축은 어떤 종류의 장면을 잘 쓰는지를 측정합니다. 아름다운 문장을 쓰는 모델도 싸움 장면이 밋밋할 수 있으므로, 두 영역은 분리하여 측정하며 오해를 부르는 단일 수치로 합산하지 않습니다.
- 모든 점수는 데이터 부족 정도에 비례해 중립 기준점 70을 향해 신뢰 수축됩니다. 운 좋은 3개 샘플 결과가 확정된 사실처럼 보일 수 없습니다. 각 수치 뒤의 표본 크기가 함께 표시됩니다.
- 단일 모델이 모든 것을 이기지는 않습니다. 최고의 문학적 기술, 가장 안정적인 충실도, 최고의 액션, 가장 적극적인 로맨스와 성인 묘사는 각기 다른 모델에 있습니다 — 한 모델을 고르는 것이 아니라 책 전체에 걸쳐 모델을 라우팅해야 한다는 핵심 근거입니다.
- 이 그리드는 Novelmint가 챕터를 구성할 때 비트별로 모델을 선택하는 데 실제로 사용하는 것과 동일하며, 빌드 중 단락을 채점하는 심사관이 데이터를 공급하므로 작가들이 엔진으로 글을 쓸수록 수치가 계속 업데이트됩니다. 소급 주장이 아닌 살아있는 메커니즘입니다.
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
일회성 테스트가 아닌 실시간 데이터
아래 표는 한 번 실행하고 고정한 벤치마크가 아닙니다. 플랫폼이 운영하는 채점 저장소의 실시간 투영입니다: 빌드 중 단락을 채점하는 심사관이 이 그리드에 데이터를 공급하므로, Novelmint에서 챕터를 쓸 때마다 관측값이 추가되고 표본이 늘어나며 수치가 정교해집니다. 더 많은 작가가 엔진을 사용할수록 벤치마크는 계속 업데이트됩니다 — 위의 날짜는 단순히 가장 최근 재보정 시점입니다.
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
그리드 읽는 법
헤드라인 수치는 전체 기술 — 모델의 4가지 실행 축 평균으로, '산문이 얼마나 좋은가'에 가장 가까운 지표입니다. 오른쪽의 콘텐츠 축은 우열 순위가 아니라 모델의 적합성을 나타냅니다. 신체성 점수가 높으면 깔끔한 액션을, 에로티시즘 점수가 낮으면 보통 기술 부족이 아니라 거부 또는 임상적 평탄함을 의미합니다 — 실력이 아닌 의지의 문제입니다. 모델을 비교하려면 열을 따라 기술 점수를, 한 모델의 강점과 약점을 보려면 행을 따라 콘텐츠 점수를 읽으세요.
Best AI for…
A straight answer for one kind of scene — or one genre
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
정답이 아닌 실제 산문 생성
각 모델은 동일한 조건에서 같은 비트를 씁니다 — 필수 요소, 금지 지식, 시점, 극적 목표가 담긴 브리핑된 장면. 저희는 퀴즈 성적이 아닌, 편집자가 읽는 방식으로 픽션으로서의 산문을 채점합니다.
블라인드로, 9가지 축에서 채점
심사단은 어떤 모델이 썼는지 모르는 상태에서 각 단락을 기술 4가지(문학성, 대화, 충실도, 페이싱)와 콘텐츠 5가지(감정, 신체성, 갈등, 로맨스, 에로티시즘) 축으로 0–100 점 채점합니다. 기술은 실행 품질, 콘텐츠는 장면 유형 적합성입니다.
중립 사전값을 향해 수축
소수 샘플의 단순 평균은 노이즈입니다. 각 셀은 증거가 얇을수록 중립 기준점 70을 향해 당겨지며, 초기의 운 좋은 측정은 충분한 관측이 쌓이기 전까지 대략 평균으로 읽힙니다. 게시된 수치는 이 수축값이며, 표본 크기가 옆에 표시됩니다.
계속 누적하고, 수동 수정 없음
새로운 심사 관측값은 누적 평균에 반영되고 표본 수가 늘어나면서 그리드가 정교해집니다. 수치는 관측값에서 자동 생성되며 수동 입력하지 않고, 별칭 아래 모델 버전이 바뀌면 두 모델을 혼합하는 대신 해당 셀이 초기화되어 새로 측정됩니다.
Where this leads
이런 벤치마크를 실제로 활용할 수 있는 이유
특정 장면에 다른 모델을 선택하는 것은 책이 한 번에 생성되는 것이 아니라 개별적으로 브리핑된 단위로 구성될 때만 가능합니다. 그 단위가 비트이며, 서로 다른 모델이 다른 비트를 쓰면서도 이야기를 일관되게 유지하는 것은 빌드와 함께 이동하는 아크-앤-엔티티 메모리의 역할입니다. 벤치마크는 점수판이고, 비트와 아크 메모리는 그 점수를 실제로 활용할 수 있게 해주는 것입니다.
Questions
Frequently asked
- 어떤 AI 모델이 소설을 가장 잘 쓰나요?
- 전체 기술 — 실제 소설 산문에서 문학성, 대화, 충실도, 페이싱 축의 평균 — 기준으로 현재 Claude Opus 4.8이 선두이며, GPT-5.6 Sol이 바로 뒤를 잇고 있습니다. 하지만 '최고'는 장면에 따라 다릅니다: 액션, 로맨스, 성인 콘텐츠 최고 점수는 각기 다른 모델에 있습니다. 이 페이지의 그리드에서 현재 순위와 각 수치 뒤의 표본 크기를 확인하세요.
- 이 벤치마크는 어떻게 측정되나요?
- 각 모델은 동일한 조건에서 같은 브리핑된 비트를 쓰고, 블라인드 심사단이 결과 산문을 9가지 축 — 기술 4가지(문학성, 대화, 충실도, 페이싱)와 콘텐츠 5가지(감정, 신체성, 갈등, 로맨스, 에로티시즘) — 으로 0–100 점 채점합니다. 점수는 얇은 데이터가 수치를 왜곡하지 않도록 중립 기준점 70을 향해 신뢰 수축되며, 각 점수 옆에 표본 수가 표시됩니다.
- 기술 축과 콘텐츠 축의 차이는 무엇인가요?
- 기술 축은 주제와 무관하게 모델이 얼마나 잘 쓰는지를 측정합니다 — 문장 품질, 인물 목소리, 브리프 충실도, 페이스 조절. 콘텐츠 축은 특정 장면 유형에 대한 적합성을 측정합니다: 감정, 신체적 액션, 갈등, 로맨스, 성인 콘텐츠. 아름다운 문장을 쓰는 모델도 싸움 장면은 어설플 수 있으므로, 두 영역은 별도로 채점하고 표시합니다.
- 가장 좋은 단일 모델을 골라 모든 것에 쓰면 안 되나요?
- 어떤 모델도 모든 축에서 이기지 않기 때문입니다. 최고의 문학적 기술, 최고의 액션, 가장 뛰어난 로맨스나 성인 묘사는 각기 다른 모델에 있습니다. Novelmint는 비트별로 모델을 라우팅합니다 — 일관성을 위해 대부분을 한 시리즈 목소리로 유지하면서, 그럴 가치가 있는 특정 비트에서는 더 강한 모델로 전환합니다 — 이 그리드가 있기에 가능한 일입니다.
- 낮은 점수는 모델이 나쁘다는 의미인가요?
- 반드시 그렇지는 않습니다. 낮은 콘텐츠 점수는 모델이 능숙하지만 의지가 없음을 의미할 수 있습니다 — 대부분의 모델이 에로티시즘에서 낮은 점수를 받는 이유는 기술 부족이 아니라 거부하거나 임상적으로 변하기 때문입니다. 또한 신뢰도가 낮은 점수(표본 적음)는 중립 기준점으로 수축되므로 '아직 증명되지 않음'으로 읽히며, '약하다고 증명됨'이 아닙니다. 항상 점수와 표본 크기를 함께 읽으세요.
- 벤치마크는 얼마나 자주 업데이트되나요?
- 지속적으로 업데이트됩니다. 그리드는 플랫폼 채점 저장소의 실시간 투영입니다: Novelmint가 챕터를 구성하는 동안 단락을 채점하는 심사관이 관측값을 반영하므로, 작가들이 엔진을 사용하고 표본이 늘어날수록 수치가 변합니다. 페이지에는 가장 최근 재보정 날짜가 표시됩니다. 새 모델 버전은 이전 모델과 혼합되지 않고 처음부터 다시 측정하므로, 버전 변경이 조용히 열을 오염시키는 일이 없습니다.
What this page does not claim
- 이 벤치마크는 픽션에 한정한 산문 품질과 콘텐츠 적합성만 측정합니다. 모델의 추론, 코딩, 수학, 사실 정확도, 또는 글쓰기 맥락 외의 안전성에 대해서는 어떠한 주장도 하지 않습니다.
- 점수는 사용된 심사 세트와 프롬프트를 기준으로 한 상대적 수치이며, 모델 제공사가 공인한 절대적 또는 공식 평가가 아닙니다. 모델 이름과 상표는 각 소유자에게 귀속됩니다.
- 전체 기술 점수가 높다고 해서 모든 책에 적합한 모델이 되는 것은 아닙니다 — 목소리, 장르, 콘텐츠 요구사항, 비용 모두 중요합니다. 바로 그렇기 때문에 Novelmint는 하나의 모델을 선정하는 것이 아니라 모델 간 라우팅을 합니다.
- 표본이 적은 셀은 잠정적 수치입니다. 관측값이 적은 수치는 중립 기준점으로 수축되어 표시되며, 더 많은 측정값이 반영될수록 변동됩니다.
어떤 모델을 써야 할지 더 이상 추측하지 마세요. 책이 스스로 선택하게 하세요.
Novelmint는 이 그리드를 기반으로 각 비트에 가장 적합한 모델로 라우팅합니다. 첫 챕터는 무료입니다.