Bảng xếp hạng mô hình viết văn

Mô hình AI nào thực sự viết truyện hay nhất?

Live data · measured as of July 24, 2026

Mọi thẻ mô hình đều đo toán, lập trình và lý luận. Không ai đo xem mô hình có viết được một cảnh mà độc giả không muốn bỏ qua hay không. Vì thế chúng tôi xây dựng bảng xếp hạng này. Một hội đồng giám khảo ẩn danh chấm điểm văn xuôi tiểu thuyết thực tế do các mô hình hàng đầu tạo ra, theo chín tiêu chí — bốn tiêu chí nghệ thuật và năm tiêu chí loại cảnh — và các con số bên dưới là kết quả trực tiếp. Đây không phải biểu đồ marketing: đây là bảng chính xác mà Novelmint sử dụng để chọn mô hình cho từng nhịp trong cuốn sách của bạn.

Key takeaways

  • Bảng xếp hạng chấm điểm các mô hình hàng đầu từ Anthropic, OpenAI, Google và xAI trên văn xuôi tiểu thuyết thực tế — không phải bài trắc nghiệm — theo chín tiêu chí: bốn nghệ thuật (văn học, hội thoại, độ trung thành, nhịp điệu) và năm nội dung (cảm xúc, thể chất, xung đột, lãng mạn, gợi cảm).
  • Tiêu chí nghệ thuật đo mức độ VIẾT TỐT của mô hình; tiêu chí nội dung đo mô hình viết LOẠI CẢNH nào tốt. Một mô hình có thể có câu văn đẹp nhưng vẫn viết cảnh chiến đấu nhạt nhẽo, vì vậy hai nhóm này được giữ riêng biệt và không bao giờ cộng chung thành một con số gây hiểu lầm.
  • Mỗi điểm số được thu hẹp về mức cơ sở trung tính 70 theo tỷ lệ thuận với lượng dữ liệu đứng sau nó, để một kết quả may mắn với ba mẫu không thể giả làm sự thật đã được kiểm chứng. Cỡ mẫu đứng sau mỗi con số đều được hiển thị.
  • Không có mô hình nào thắng tất cả. Nghệ thuật văn học tổng thể mạnh nhất, độ trung thành ổn định nhất, hành động hay nhất, và khả năng viết lãng mạn, nội dung người lớn tốt nhất nằm ở các cột khác nhau — đó chính là lý do để điều phối cuốn sách qua nhiều mô hình thay vì chọn một cái duy nhất.
  • Đây là bảng mà Novelmint sử dụng để chọn mô hình cho từng nhịp khi xây dựng chương — và giám khảo chấm điểm một đoạn văn trong quá trình xây dựng cũng đưa dữ liệu vào đây, vì vậy các con số tiếp tục cập nhật khi tác giả viết với công cụ này. Đây là cơ chế sống, không phải một tuyên bố nhìn lại.

The benchmark

Frontier models on real novel prose

Live data · updated July 24, 2026

Đây là dữ liệu trực tiếp, không phải bài kiểm tra một lần

Bảng bên dưới không phải bảng xếp hạng chúng tôi chạy một lần rồi đóng băng. Đây là dữ liệu chiếu trực tiếp từ kho điểm số mà nền tảng vận hành: cùng giám khảo chấm điểm một đoạn văn trong quá trình xây dựng sẽ đưa dữ liệu vào bảng này, vì vậy mỗi chương được viết trên Novelmint đều bổ sung quan sát, cỡ mẫu tăng và các con số trở nên sắc nét hơn. Khi nhiều tác giả hơn xây dựng với công cụ này, bảng xếp hạng tiếp tục cập nhật — ngày ở trên chỉ là lần hiệu chỉnh gần nhất.

Novelmint fiction-model benchmark — measured craft and content-fitness scores (0–100) for frontier AI models on real novel prose. Click a column heading to sort.
Craft — how well it writesContent — what it writes well
Claude Opus 5LeadAnthropic85848786838784848278
Claude Opus 4.8Anthropic82877287848677798157
Fable 5Anthropic75797973708273738454
GPT-5.6 SolOpenAI84878483848593898332
Claude Sonnet 5Anthropic74697679728278757550
Claude Haiku 4.5Anthropic65726064637163686851
GPT-5.6 TerraOpenAI80798280798186848135
GPT-4.1OpenAI68716470686770627063
Gemini 3.1 ProGoogle73657277807481777677
Gemini 3.5 FlashGoogle78767680796871807374
Gemini 3.6 FlashGoogle74717378747480717273
Grok 4.5xAI67665275766479737383
Grok 4.3xAI65676174607378717378
0–100 confidence-adjusted score* = fewer than 6 samples (provisional)Click a column heading to sort · hover a cell for its sample size

Cách đọc bảng

Con số tiêu đề là nghệ thuật tổng thể — trung bình bốn trục thực hiện của mô hình, gần nhất với "văn xuôi của nó tốt đến đâu". Các trục nội dung bên phải không phải xếp hạng hơn-kém; chúng cho biết mô hình PHÙ HỢP với loại cảnh nào. Điểm thể chất cao nghĩa là hành động rõ nét; điểm gợi cảm thấp thường có nghĩa là từ chối hoặc khô khan hơn là viết kém — là sự sẵn sàng, không phải kỹ năng. Đọc nghệ thuật theo cột để so sánh các mô hình, và đọc nội dung theo hàng để thấy mô hình mạnh ở đâu và yếu ở đâu.

Not sure which to use?

Tell us what your book leans on

Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.

Choose one or more above to see your best-fit models.

Methodology

How the numbers are produced

01

Tạo văn xuôi thực tế, không phải câu trả lời bài kiểm tra

Mỗi mô hình viết cùng các nhịp — các cảnh được tóm lược với các yếu tố bắt buộc, kiến thức bị cấm, điểm nhìn và mục tiêu kịch tính — trong cùng điều kiện. Chúng tôi chấm điểm sản phẩm tạo ra như văn học, theo cách một biên tập viên đọc, không phải theo cách thực hiện bài quiz.

02

Chấm điểm ẩn danh theo chín tiêu chí

Hội đồng giám khảo đánh giá mỗi đoạn 0–100 theo bốn tiêu chí nghệ thuật (văn học, hội thoại, độ trung thành, nhịp điệu) và năm tiêu chí nội dung (cảm xúc, thể chất, xung đột, lãng mạn, gợi cảm), mà không biết mô hình nào đã viết. Nghệ thuật là chất lượng thực hiện; nội dung là sự phù hợp với loại cảnh.

03

Thu hẹp về mức cơ sở trung tính

Trung bình thô từ một nhúm mẫu chỉ là nhiễu. Mỗi ô được kéo về mức cơ sở trung tính 70 theo tỷ lệ thuận với mức độ mỏng của bằng chứng, để một phép đo sớm may mắn được đọc là xấp xỉ trung bình cho đến khi đủ quan sát để có chỗ đứng. Con số được công bố là giá trị đã thu hẹp này; cỡ mẫu được hiển thị bên cạnh.

04

Tiếp tục tích lũy, không ghi đè thủ công

Các quan sát giám khảo mới được tích lũy vào trung bình liên tục và số lượng mẫu tăng dần, giúp bảng trở nên sắc nét hơn theo thời gian. Các con số được tái tạo từ quan sát, không bao giờ nhập tay, và khi phiên bản mô hình thay đổi dưới một bí danh, các ô của nó được đặt lại để đo lại từ đầu thay vì pha trộn hai mô hình khác nhau.

Where this leads

Tại sao bảng xếp hạng như thế này có thể dùng được

Chọn mô hình khác nhau cho từng cảnh chỉ khả thi nếu cuốn sách được xây dựng theo từng đơn vị rời rạc, có tóm lược, thay vì tạo ra một lần. Đơn vị đó là nhịp, và việc giữ cho câu chuyện mạch lạc khi nhiều mô hình viết các nhịp khác nhau là nhiệm vụ của bộ nhớ cung-và-thực-thể đi kèm với quá trình xây dựng. Bảng xếp hạng là bảng điểm; nhịp và bộ nhớ cung là thứ cho phép cuốn sách thực sự tận dụng nó.

Questions

Frequently asked

Mô hình AI nào viết truyện hay nhất?
Xét về nghệ thuật tổng thể — trung bình của các trục văn học, hội thoại, độ trung thành và nhịp điệu trên văn xuôi tiểu thuyết thực tế — Claude Opus 4.8 hiện đang dẫn đầu, với GPT-5.6 Sol theo sát. Nhưng "hay nhất" phụ thuộc vào cảnh: điểm cao nhất về hành động, lãng mạn và nội dung người lớn thuộc về các mô hình khác nhau. Bảng trên trang này hiển thị thứ hạng hiện tại và cỡ mẫu đứng sau mỗi con số.
Bảng xếp hạng này được đo như thế nào?
Mỗi mô hình viết cùng các nhịp được tóm lược trong điều kiện giống nhau, và hội đồng giám khảo ẩn danh chấm điểm văn xuôi kết quả 0–100 theo chín trục — bốn cho nghệ thuật (văn học, hội thoại, độ trung thành, nhịp điệu) và năm cho loại nội dung (cảm xúc, thể chất, xung đột, lãng mạn, gợi cảm). Điểm được thu hẹp về mức cơ sở trung tính 70 để dữ liệu mỏng không thể làm lệch con số, và cỡ mẫu được hiển thị bên cạnh mỗi điểm.
Sự khác biệt giữa trục nghệ thuật và trục nội dung là gì?
Trục nghệ thuật đo mức độ viết tốt của mô hình, bất kể chủ đề — chất lượng câu văn, giọng điệu nhân vật, sự trung thành với tóm lược và kiểm soát nhịp độ. Trục nội dung đo sự phù hợp với loại cảnh: cảm xúc, hành động thể chất, xung đột, lãng mạn và nội dung người lớn. Một mô hình có thể viết câu văn đẹp nhưng xử lý cảnh chiến đấu kém, vì vậy hai nhóm được chấm điểm và hiển thị riêng biệt.
Tại sao không chỉ chọn một mô hình tốt nhất và dùng cho tất cả mọi thứ?
Vì không có mô hình nào thắng mọi trục. Nghệ thuật văn học mạnh nhất, hành động hay nhất, và khả năng viết lãng mạn hoặc nội dung người lớn tốt nhất thuộc về các mô hình khác nhau. Novelmint điều phối cuốn sách qua các mô hình theo từng nhịp — giữ phần lớn trong một giọng văn nhất quán để đảm bảo tính liền mạch và chuyển sang mô hình mạnh hơn cho các nhịp cụ thể xứng đáng — điều này chỉ khả thi vì bảng này tồn tại.
Điểm thấp có nghĩa là mô hình tệ không?
Không nhất thiết. Điểm nội dung thấp có thể có nghĩa là mô hình có khả năng nhưng không sẵn sàng — hầu hết các mô hình điểm thấp về gợi cảm vì họ từ chối hoặc viết khô khan, không phải vì thiếu kỹ năng. Và điểm độ tin cậy thấp (ít mẫu) được thu hẹp về mức cơ sở, vì vậy nó được đọc là "chưa được chứng minh", không phải "đã được chứng minh là yếu". Luôn đọc điểm cùng với cỡ mẫu của nó.
Bảng xếp hạng được cập nhật bao lâu một lần?
Liên tục. Bảng là dữ liệu chiếu trực tiếp từ kho điểm của nền tảng: cùng giám khảo chấm điểm một đoạn trong khi Novelmint xây dựng chương sẽ đưa quan sát trở lại, vì vậy các con số thay đổi khi tác giả sử dụng công cụ và cỡ mẫu tăng. Trang hiển thị ngày hiệu chỉnh gần nhất. Các phiên bản mô hình mới được đo lại từ đầu thay vì pha trộn với mô hình họ thay thế, vì vậy một thay đổi phiên bản không bao giờ âm thầm làm hỏng một cột.

What this page does not claim

  • Bảng xếp hạng này chỉ đo chất lượng văn xuôi và sự phù hợp nội dung cho văn học. Nó không nói gì về khả năng lý luận, lập trình, toán học, độ chính xác thực tế hay an toàn của mô hình ngoài ngữ cảnh viết lách.
  • Điểm số có tính tương đối so với bộ được chấm và các prompt được sử dụng, không phải xếp hạng tuyệt đối hoặc chính thức được chứng nhận bởi nhà cung cấp mô hình. Tên mô hình và nhãn hiệu thuộc về chủ sở hữu tương ứng.
  • Điểm nghệ thuật tổng thể cao hơn không có nghĩa là mô hình là lựa chọn đúng đắn cho mọi cuốn sách — giọng văn, thể loại, nhu cầu nội dung và chi phí đều quan trọng, đó chính xác là lý do tại sao Novelmint điều phối qua nhiều mô hình thay vì tôn một mô hình lên ngôi.
  • Các ô ít mẫu là tạm thời. Khi một con số có ít quan sát, nó được thu hẹp về mức cơ sở trung tính và được đánh dấu, và nó sẽ thay đổi khi thêm nhiều phép đo được tích lũy vào.

Thôi đoán xem nên dùng mô hình nào. Để cuốn sách tự chọn.

Novelmint điều phối mỗi nhịp đến mô hình mà bảng này cho là phù hợp nhất. Chương đầu tiên của bạn miễn phí.