방법론

픽션 모델 벤치마크 작동 방식

Updated July 23, 2026 · 6분 읽기

이 벤치마크는 모델 카드가 절대 측정하지 않는 한 가지를 측정합니다: 독자가 건너뛰지 않을 장면을 모델이 쓸 수 있는가. 이 페이지는 숫자가 어떻게 만들어지는지 — 무엇을 측정하는지, 모델이 어떻게 평가되는지, 점수가 왜 신뢰도에 따라 보정되는지, 그리드가 어떻게 최신 상태를 유지하는지 — 정확히 설명하므로, 결과를 직접 판단하고 정확하게 인용할 수 있습니다.

Key takeaways

  • 최신 모델들이 동일한 소설 비트를 작성하면, 블라인드·공급사 다양성 심사단이 어떤 모델이 썼는지 모르는 상태에서 산문을 9개 축에 걸쳐 0–100으로 채점합니다.
  • 9개 축은 두 계열로 나뉩니다: 기교 4개(문학성, 대화, 충실도, 페이싱)는 모델이 얼마나 잘 쓰는지를, 콘텐츠 5개(감정, 신체성, 갈등, 로맨스, 에로티시즘)는 어떤 종류의 장면을 잘 쓰는지를 측정합니다. 두 계열은 절대 평균 내지 않습니다.
  • 모든 점수는 데이터가 얼마나 적게 뒷받침되는지에 비례해 중립 기준선 70으로 보정됩니다(5개 관측치 상당의 사전 확률). 운 좋은 소규모 샘플이 최상위에 오를 수 없습니다. 샘플 크기는 표시되며, 데이터가 얇은 셀은 표시됩니다.
  • 그리드는 실시간으로 운영됩니다 — 새로운 심사 관측치가 시간이 지남에 따라 누적 평균에 반영되고, 버전 변경 시 이전 버전과 혼합하지 않고 해당 모델을 초기화하여 재측정합니다.
  • 점수는 픽션 비트의 산문만을 기술하며, 공식적인 공급사 등급이 아닌 독립적인 측정값입니다. 에로티시즘 점수가 낮다면 대개 기교가 아닌 의향(모델의 거부 여부)을 반영합니다.

Novelmint 픽션 벤치마크는 모델 카드가 결코 측정하지 않는 단 한 가지를 측정합니다: 독자가 건너뛰지 않을 장면을 모델이 쓸 수 있는지 여부입니다. 수학이나 코딩 테스트에서 빌려온 리더보드가 아니라, 실제 소설 산문을 채점합니다. 수치가 어떻게 산출되는지 정확히 설명하므로, 직접 판단하고 자신 있게 인용하실 수 있습니다.

측정 대상

이 벤치마크는 Anthropic, OpenAI, Google, xAI의 최신 모델들이 픽션을 얼마나 잘 쓰는지 채점합니다. 추론 능력이 아니라, 코딩 능력이 아니라, 객관식 시험 성적이 아닙니다. 각 모델에게는 동일한 소설 비트 브리핑이 주어집니다 — 필수 요소, 금지된 지식, 시점, 극적 목표가 담긴 장면 — 그리고 모델이 쓴 글은 편집자가 읽듯이 픽션으로서 평가됩니다.

모든 결과는 축별 0–100 단일 척도로 표현되므로, 모델 간 및 실제 소설을 구성하는 장면 유형 간 수치를 직접 비교할 수 있습니다.

아홉 가지 축

픽션은 하나의 기술이 아니므로, 벤치마크는 이를 하나의 수치로 압축하지 않습니다. 서로 다른 의미를 지닌 두 계열로 나뉜 아홉 가지 축을 채점합니다.

네 가지 craft 축은 주제와 무관하게 모델이 얼마나 잘 쓰는지를 측정합니다: literary(문장 수준의 이미지, 리듬, 서브텍스트, 절제), dialogue(등장인물이 각기 다른 사람처럼 들리는지), fidelity(브리핑된 비트를 얼마나 충실하게 재현하는지, 필수 요소를 포함하고 금지된 지식을 배제하는지), pacing(모멘텀 조절 — 언제 압축하고 언제 머물 것인지).

다섯 가지 content 축은 모델이 어떤 종류의 장면을 잘 쓰는지를 측정합니다: emotion, physicality(액션과 공간 속 신체), conflict, romance, eroticism(명시적 성인 콘텐츠). 이는 우열을 가리는 순위가 아니라, 모델이 어떤 용도에 적합한지를 나타냅니다. 아름다운 문장을 구사하면서도 싸움 장면이 밋밋할 수 있으며, 그렇기 때문에 craft와 content는 별도로 채점·보고되고 결코 하나의 오해 소지 있는 수치로 평균화되지 않습니다.

각 모델의 채점 방식

채점은 블라인드 동료 심사 방식입니다. 각 모델이 동일한 브리핑 비트 세트를 작성하면, 다양한 제공자로 구성된 심사 모델 패널이 어떤 모델이 썼는지 알지 못한 채, 그리고 자신의 작품은 절대 심사하지 않으면서 각 구절에 축별로 0–100점을 매깁니다. 다양한 제공자로 구성된 패널이 중요한 이유는, 모델 자신과 다른 계열의 심사자가 해당 계열이 편향적으로 보상하는 특징을 포착하기 때문입니다.

채점이 블라인드이고 교차 모델 방식이므로, 어떤 모델도 스스로를 치켜세울 수 없고, 어느 한 집필 스타일이 기준을 독점하지 않습니다.

심사자 편향 통제

모델로 모델을 심사하면 네 가지 잘 알려진 실패 모드가 생길 수 있으며, 이 방법은 각각을 차단하도록 설계되었습니다.

자기 선호 — 모델은 자신의 집필 스타일을 편향적으로 보상하는 경향이 있습니다. 두 가지 규칙이 이를 제거합니다: 모델은 자신의 구절을 채점하지 않으며, 심사 패널은 다양한 제공자로 구성되어 어느 한 계열의 취향이 기준을 설정하지 않습니다. 한 계열이 보상하는 특징은 다른 계열의 심사자에게 포착되고, 그 반대도 마찬가지입니다.

장황함 — 심사자는 길이에 과도한 점수를 주는 경향이 있습니다. 모든 비트는 약 220단어라는 동일한 목표를 브리핑하므로 모든 구절이 거의 같은 분량으로 제출되며, 내용을 채우는 것으로는 이득을 볼 수 없습니다. 모델은 단어를 얼마나 많이 쓰느냐가 아니라 그 단어로 무엇을 하느냐로 점수를 얻습니다.

순서 — 구절이 등장하는 순서가 먼저 나온 것에 유리하게 점수를 편향시킬 수 있습니다. 그래서 구절은 각 비트마다 레이블을 새로 붙이고 섞으며, 각 구절은 상호 순위 비교가 아닌 고정된 루브릭을 기준으로 독립적으로 채점됩니다. 순서는 어떠한 신호도 담지 않으며, 잔류 편차는 수많은 비트와 수많은 심사자에 걸쳐 평균화됩니다.

샘플링 — 운 좋은 단일 초안이 모델을 실제보다 좋게 보이게 할 수 있습니다. 생성은 동일한 프롬프트에서 각 모델의 기본 온도로 실행되며, 모델별 튜닝이 없으므로 어떤 모델도 다른 모델에게 없는 유리한 설정을 받지 않습니다. 그리고 어떤 셀도 하나의 초안에만 의존하지 않습니다: 모든 모델은 패널의 다른 모든 모델에 의해 전체 비트 세트에 걸쳐 채점된 후, 충분한 측정치가 쌓일 때까지 중립 기준선을 향해 수축됩니다 — 따라서 단일 초안의 운은 수치가 공개되기 훨씬 전에 희석됩니다.

신뢰도에 따른 점수 수축 이유

소수의 구절에서 얻은 단순 평균은 노이즈이며, 점수로 포장된 노이즈는 점수가 없는 것보다 오히려 해롭습니다. 그래서 공개된 모든 수치는 뒤에 있는 데이터가 얼마나 적은지에 비례하여 중립 기준선 70을 향해 수축됩니다 — 공식적으로는 다섯 번의 관측값에 해당하는 사전 분포입니다. 세 번의 운 좋은 샘플로 뒷받침된 셀은 충분한 측정치가 자리를 확보할 때까지 대략 평균으로 읽히며, 수백 번의 측정으로 뒷받침된 셀은 실제로 측정된 값으로 읽힙니다.

모든 수치 뒤의 샘플 크기가 표시되며, 여섯 번 미만의 관측값에 아직 의존하는 셀은 잠정적으로 표시됩니다. 이것이 데이터가 부족한 모델이 요행으로 상위권에 오르지 못하는 이유입니다 — 방법 자체가 그것을 허용하지 않습니다.

그리드의 최신 상태 유지 방법

벤치마크는 한 번 실행되고 고정된 일회성 테스트가 아닙니다. 플랫폼이 기반으로 운영하는 채점 저장소의 실시간 투영입니다: 새로운 심사 관측값이 누적 평균에 반영되고 각 셀의 샘플 수가 시간이 지남에 따라 증가하므로, 그리드는 낡아가는 것이 아니라 점점 선명해집니다. 페이지에는 항상 가장 최근 재보정 날짜가 표시됩니다.

정확성을 위한 한 가지 안전장치가 중요합니다. 지속적인 별칭("latest" 포인터)이 새로운 기반 모델을 조용히 가리키게 될 경우, 해당 모델의 셀은 이전 모델과 혼합되는 대신 처음부터 재설정되고 재측정됩니다 — 따라서 버전 변경이 열을 조용히 오염시키지 않습니다. 이것이 또한 벤치마크가 일반적인 레이블이 아닌 측정한 특정 버전의 이름을 명시하는 이유입니다.

한계

이 점수는 해당 모델 및 프롬프트 세트를 기준으로 픽션 비트에서의 산문만을 설명합니다. 모델 제공자가 공식적으로 인증한 등급이 아니며, 글쓰기 맥락 외의 추론, 정확성, 안전성에 대해서는 어떠한 것도 말하지 않습니다. 모델 이름과 상표는 각 소유자에게 귀속되며, 이는 독립적인 측정입니다.

두 가지 해석 오류가 발생하기 쉽습니다. 낮은 eroticism 점수는 대개 의향을 반영합니다 — 모델이 거부하거나 임상적으로 묘사하는 것 — 표현 기술의 실패가 아닙니다. 그리고 낮은 신뢰도 점수는 "아직 입증되지 않음"을 의미하며, "약하다는 것이 입증됨"을 의미하지 않습니다. 수치는 항상 샘플 크기와 함께 읽으세요. 그리고 당신의 책에 가장 적합한 모델은 당신의 책이 어떤 축에 기대느냐에 달려 있음을 기억하세요 — 그것이 바로 그리드가 축을 별도로 유지하는 전체 이유입니다.

Questions

Frequently asked

Novelmint는 AI 모델을 픽션 기준으로 어떻게 벤치마킹하나요?
각 최신 모델이 동일한 소설 비트를 작성하면, 블라인드·공급사 다양성 심사단이 작성자를 모르는 상태에서 산문을 9개 축에 걸쳐 0–100으로 채점합니다. 점수는 뒷받침하는 데이터 양에 따라 중립 기준선으로 보정되고, 관측치는 시간이 지남에 따라 누적 평균에 반영됩니다.
9개 축은 무엇인가요?
기교 축 4개 — 문학성, 대화, 충실도(브리프 충실도), 페이싱 — 는 모델이 얼마나 잘 쓰는지를 측정합니다. 콘텐츠 축 5개 — 감정, 신체성(액션), 갈등, 로맨스, 에로티시즘 — 는 어떤 종류의 장면을 잘 쓰는지를 측정합니다. 기교와 콘텐츠는 별도로 표시되며, 절대 평균 내지 않습니다.
점수는 왜 신뢰도 기준으로 보정되나요?
적은 수의 단락에서 나온 단순 평균은 노이즈에 불과합니다. 각 점수는 뒷받침하는 데이터가 얼마나 적은지에 비례해 중립 기준선 70으로 보정됩니다(5개 관측치 상당의 사전 확률). 따라서 운 좋은 소규모 샘플이 최상위를 차지할 수 없습니다. 샘플 크기는 표시되며, 6개 미만의 관측치를 가진 셀은 잠정 수치로 표시됩니다.
이것이 OpenAI, Anthropic, Google, 또는 xAI의 공식 순위인가요?
아닙니다. Novelmint가 픽션 산문에 한해 이 모델 및 프롬프트 세트를 기준으로 독립적으로 측정한 결과입니다. 추론, 정확도, 또는 다른 역량에 대해서는 아무것도 말하지 않으며, 모델 이름은 각 소유자의 상표입니다.
벤치마크는 얼마나 자주 업데이트되나요?
지속적으로 업데이트됩니다 — 새로운 심사 관측치가 누적 평균에 반영되고 샘플 수가 늘어나면서 그리드가 점점 정밀해집니다. 별칭 아래에서 모델 버전이 바뀌면, 이전 버전과 혼합하지 않고 해당 셀을 초기화하여 재측정합니다. 페이지에는 가장 최근 재보정 날짜가 표시됩니다.

What this page does not claim

  • 점수는 평가된 모델 세트와 사용된 프롬프트를 기준으로 한 상대적 수치이며, 절대적이거나 공식적인 등급이 아닙니다.
  • 에로티시즘 점수가 낮다면 기교 부족이 아닌 의향(거부하거나 건조하게 처리하는 모델)을 반영하며, 신뢰도가 낮은 점수는 "아직 미검증"을 의미하지 "약하다고 검증됨"을 의미하지 않습니다.
  • 벤치마크는 픽션 산문만을 측정하며, 추론, 코딩, 사실 정확도, 또는 글쓰기 외 맥락의 안전성에 대해서는 아무것도 말하지 않습니다.

내가 원하는 장면을 가장 잘 쓰는 모델을 찾아보세요.

9개 축에 걸친 실시간 데이터, 더 많은 산문이 측정될수록 업데이트됩니다.