지시 사항 이행에 최적인 AI
Live data · ranked by Fidelity · measured as of August 31, 2026
개요를 기반으로 글을 쓴다면, 모델이 할 수 있는 가장 중요한 일은 정확히 요청한 대로 하는 것입니다 — 필수 요소를 유지하고, 숨겨둔 정보는 제외하며, 임의로 만들어낸 배경으로 벗어나지 않는 것입니다. 이 순위는 그 충실도를 기준으로 프론티어 모델들을 평가합니다. 장편 소설에서 이는 화려함보다 조용히 더 중요한 기준입니다: 매 비트마다 이탈하는 모델은 계속 수정이 필요한 원고를 만들어냅니다.
Key takeaways
- 모델은 실제 소설 산문에서 측정된 충실도 — 브리핑된 비트를 얼마나 충실하게 구현하는지 — 를 기준으로 순위가 매겨집니다.
- Claude Opus 4.8이 충실도에서 명확한 차이로 선두를 차지하며, 이것이 책의 주요 목소리로 잘 작동하는 핵심 이유입니다.
- 높은 충실도는 소설 전반에 걸쳐 누적됩니다: 매 비트마다 조금씩 이탈하는 대신, 계획한 구조가 실제로 유지될 수 있도록 합니다.
- 순위는 실시간으로 업데이트되며, 더 많은 산문이 측정될수록 갱신됩니다.
The ranking
Ranked by Fidelity
측정된 충실도 기준 높은 순서로 정렬되었습니다. 점수는 충실도 축에서 각 모델의 신뢰도 조정 값으로, 0–100 범위입니다.
- Claude Opus 4.8Anthropic91
충실도에서 크게 앞서 있습니다. 주어진 비트를 거의 정확하게 수행합니다 — 믿을 수 있는 주요 목소리에 가장 중요한 특성입니다.
- Claude Opus 5Anthropic · Novelmint Lead89
- GPT-5.6 SolOpenAI83
브리프를 탄탄하고 안정적으로 수행하며, 액션과 갈등에서도 선두를 달립니다.
- GPT-5.6 TerraOpenAI80
- Gemini 3.5 FlashGoogle80
가장 많이 샘플링된 강점이 충실도여서, 이 빠르고 저렴한 모델은 대량 초안 작성에 안정적인 모델입니다.
- Claude Sonnet 5Anthropic79
- Gemini 3.6 FlashGoogle78
- Gemini 3.1 ProGoogle77
- Grok 4.5xAI75
- Grok 4.3xAI74
- Fable 5Anthropic73
스토리텔링 모델은 브리프를 느슨하게 해석하는 편입니다 — 종종 페이지 위의 생동감의 원천이 되기도 하지만, 연속성이 중요한 비트에서는 더 명확한 프롬프트가 필요할 수 있습니다.
- GPT-4.1OpenAI70
- Claude Haiku 4.5Anthropic64
How this ranking is made
브리프 정확 이행 평가
각 모델은 동일한 브리프된 비트를 작성합니다 — 필수 요소, 금지된 정보, 시점이 포함됩니다 — 그리고 블라인드 심사단이 작가를 모른 채 문장이 그 계약을 얼마나 충실히 따르는지 평가합니다. 샘플이 적은 경우 중립 기준점으로 축소됩니다. 이 페이지는 바로 그 하나의 축을 기준으로 모델을 정렬합니다.
See the full nine-axis benchmark and methodologyQuestions
Frequently asked
- 어떤 AI가 글쓰기 브리프를 가장 충실하게 따르나요?
- Claude Opus 4.8이 Novelmint 벤치마크에서 측정된 충실도 부문 선두를 명확한 차이로 유지하며 — 브리핑된 비트를 가장 적은 이탈과 임의 창작으로 구현합니다. 실시간 순위에서 전체 순서를 확인하세요.
- 소설에서 충실도가 중요한 이유는 무엇인가요?
- 매 비트마다 조금씩 이탈하는 모델은 계속 수정이 필요한 원고를 만들어냅니다. 높은 충실도는 계획한 구조가 유지되도록 하여, 수정 사항이 반영되고 연속성이 살아남습니다.
- 충실도가 높은 모델은 창의성이 떨어지나요?
- 반드시 그런 것은 아닙니다 — 충실도는 브리프에 대한 충실함을 측정하는 것이지, 밋밋함을 의미하지 않습니다. Opus는 충실도와 문학적 역량을 동시에 선도합니다. Fable처럼 느슨한 모델은 더 자유로워 보일 수 있는데, 이것이 장점이 될 때도 있고 이탈이 될 때도 있습니다.
What this page does not claim
- 이 순위는 소설 비트에서 측정된 충실도만을 기준으로 합니다.
- 브리프 충실도는 9개 축 중 하나입니다; 여러분의 책에 필요한 다른 축도 확인하세요.
- 모델 이름은 각 소유자의 상표이며, 이 평가는 독립적인 측정입니다.