Mô hình AI nào thực sự viết truyện hay nhất?
Live data · measured as of July 24, 2026
Mọi thẻ mô hình đều đo toán, lập trình và lý luận. Không ai đo xem mô hình có viết được một cảnh mà độc giả không muốn bỏ qua hay không. Vì thế chúng tôi xây dựng bảng xếp hạng này. Một hội đồng giám khảo ẩn danh chấm điểm văn xuôi tiểu thuyết thực tế do các mô hình hàng đầu tạo ra, theo chín tiêu chí — bốn tiêu chí nghệ thuật và năm tiêu chí loại cảnh — và các con số bên dưới là kết quả trực tiếp. Đây không phải biểu đồ marketing: đây là bảng chính xác mà Novelmint sử dụng để chọn mô hình cho từng nhịp trong cuốn sách của bạn.
Key takeaways
- Bảng xếp hạng chấm điểm các mô hình hàng đầu từ Anthropic, OpenAI, Google và xAI trên văn xuôi tiểu thuyết thực tế — không phải bài trắc nghiệm — theo chín tiêu chí: bốn nghệ thuật (văn học, hội thoại, độ trung thành, nhịp điệu) và năm nội dung (cảm xúc, thể chất, xung đột, lãng mạn, gợi cảm).
- Tiêu chí nghệ thuật đo mức độ VIẾT TỐT của mô hình; tiêu chí nội dung đo mô hình viết LOẠI CẢNH nào tốt. Một mô hình có thể có câu văn đẹp nhưng vẫn viết cảnh chiến đấu nhạt nhẽo, vì vậy hai nhóm này được giữ riêng biệt và không bao giờ cộng chung thành một con số gây hiểu lầm.
- Mỗi điểm số được thu hẹp về mức cơ sở trung tính 70 theo tỷ lệ thuận với lượng dữ liệu đứng sau nó, để một kết quả may mắn với ba mẫu không thể giả làm sự thật đã được kiểm chứng. Cỡ mẫu đứng sau mỗi con số đều được hiển thị.
- Không có mô hình nào thắng tất cả. Nghệ thuật văn học tổng thể mạnh nhất, độ trung thành ổn định nhất, hành động hay nhất, và khả năng viết lãng mạn, nội dung người lớn tốt nhất nằm ở các cột khác nhau — đó chính là lý do để điều phối cuốn sách qua nhiều mô hình thay vì chọn một cái duy nhất.
- Đây là bảng mà Novelmint sử dụng để chọn mô hình cho từng nhịp khi xây dựng chương — và giám khảo chấm điểm một đoạn văn trong quá trình xây dựng cũng đưa dữ liệu vào đây, vì vậy các con số tiếp tục cập nhật khi tác giả viết với công cụ này. Đây là cơ chế sống, không phải một tuyên bố nhìn lại.
The benchmark
Frontier models on real novel prose
Live data · updated July 24, 2026
Đây là dữ liệu trực tiếp, không phải bài kiểm tra một lần
Bảng bên dưới không phải bảng xếp hạng chúng tôi chạy một lần rồi đóng băng. Đây là dữ liệu chiếu trực tiếp từ kho điểm số mà nền tảng vận hành: cùng giám khảo chấm điểm một đoạn văn trong quá trình xây dựng sẽ đưa dữ liệu vào bảng này, vì vậy mỗi chương được viết trên Novelmint đều bổ sung quan sát, cỡ mẫu tăng và các con số trở nên sắc nét hơn. Khi nhiều tác giả hơn xây dựng với công cụ này, bảng xếp hạng tiếp tục cập nhật — ngày ở trên chỉ là lần hiệu chỉnh gần nhất.
| Craft — how well it writes | Content — what it writes well | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Claude Opus 5LeadAnthropic | 85 | 84 | 87 | 86 | 83 | 87 | 84 | 84 | 82 | 78 |
| Claude Opus 4.8Anthropic | 82 | 87 | 72 | 87 | 84 | 86 | 77 | 79 | 81 | 57 |
| Fable 5Anthropic | 75 | 79 | 79 | 73 | 70 | 82 | 73 | 73 | 84 | 54 |
| GPT-5.6 SolOpenAI | 84 | 87 | 84 | 83 | 84 | 85 | 93 | 89 | 83 | 32 |
| Claude Sonnet 5Anthropic | 74 | 69 | 76 | 79 | 72 | 82 | 78 | 75 | 75 | 50 |
| Claude Haiku 4.5Anthropic | 65 | 72 | 60 | 64 | 63 | 71 | 63 | 68 | 68 | 51 |
| GPT-5.6 TerraOpenAI | 80 | 79 | 82 | 80 | 79 | 81 | 86 | 84 | 81 | 35 |
| GPT-4.1OpenAI | 68 | 71 | 64 | 70 | 68 | 67 | 70 | 62 | 70 | 63 |
| Gemini 3.1 ProGoogle | 73 | 65 | 72 | 77 | 80 | 74 | 81 | 77 | 76 | 77 |
| Gemini 3.5 FlashGoogle | 78 | 76 | 76 | 80 | 79 | 68 | 71 | 80 | 73 | 74 |
| Gemini 3.6 FlashGoogle | 74 | 71 | 73 | 78 | 74 | 74 | 80 | 71 | 72 | 73 |
| Grok 4.5xAI | 67 | 66 | 52 | 75 | 76 | 64 | 79 | 73 | 73 | 83 |
| Grok 4.3xAI | 65 | 67 | 61 | 74 | 60 | 73 | 78 | 71 | 73 | 78 |
Cách đọc bảng
Con số tiêu đề là nghệ thuật tổng thể — trung bình bốn trục thực hiện của mô hình, gần nhất với "văn xuôi của nó tốt đến đâu". Các trục nội dung bên phải không phải xếp hạng hơn-kém; chúng cho biết mô hình PHÙ HỢP với loại cảnh nào. Điểm thể chất cao nghĩa là hành động rõ nét; điểm gợi cảm thấp thường có nghĩa là từ chối hoặc khô khan hơn là viết kém — là sự sẵn sàng, không phải kỹ năng. Đọc nghệ thuật theo cột để so sánh các mô hình, và đọc nội dung theo hàng để thấy mô hình mạnh ở đâu và yếu ở đâu.
Best AI for…
A straight answer for one kind of scene — or one genre
By what your scene needs
Not sure which to use?
Tell us what your book leans on
Pick what matters most for your story. We’ll rank the models for exactly that — the same way the build router chooses.
Choose one or more above to see your best-fit models.
Methodology
How the numbers are produced
Tạo văn xuôi thực tế, không phải câu trả lời bài kiểm tra
Mỗi mô hình viết cùng các nhịp — các cảnh được tóm lược với các yếu tố bắt buộc, kiến thức bị cấm, điểm nhìn và mục tiêu kịch tính — trong cùng điều kiện. Chúng tôi chấm điểm sản phẩm tạo ra như văn học, theo cách một biên tập viên đọc, không phải theo cách thực hiện bài quiz.
Chấm điểm ẩn danh theo chín tiêu chí
Hội đồng giám khảo đánh giá mỗi đoạn 0–100 theo bốn tiêu chí nghệ thuật (văn học, hội thoại, độ trung thành, nhịp điệu) và năm tiêu chí nội dung (cảm xúc, thể chất, xung đột, lãng mạn, gợi cảm), mà không biết mô hình nào đã viết. Nghệ thuật là chất lượng thực hiện; nội dung là sự phù hợp với loại cảnh.
Thu hẹp về mức cơ sở trung tính
Trung bình thô từ một nhúm mẫu chỉ là nhiễu. Mỗi ô được kéo về mức cơ sở trung tính 70 theo tỷ lệ thuận với mức độ mỏng của bằng chứng, để một phép đo sớm may mắn được đọc là xấp xỉ trung bình cho đến khi đủ quan sát để có chỗ đứng. Con số được công bố là giá trị đã thu hẹp này; cỡ mẫu được hiển thị bên cạnh.
Tiếp tục tích lũy, không ghi đè thủ công
Các quan sát giám khảo mới được tích lũy vào trung bình liên tục và số lượng mẫu tăng dần, giúp bảng trở nên sắc nét hơn theo thời gian. Các con số được tái tạo từ quan sát, không bao giờ nhập tay, và khi phiên bản mô hình thay đổi dưới một bí danh, các ô của nó được đặt lại để đo lại từ đầu thay vì pha trộn hai mô hình khác nhau.
Where this leads
Tại sao bảng xếp hạng như thế này có thể dùng được
Chọn mô hình khác nhau cho từng cảnh chỉ khả thi nếu cuốn sách được xây dựng theo từng đơn vị rời rạc, có tóm lược, thay vì tạo ra một lần. Đơn vị đó là nhịp, và việc giữ cho câu chuyện mạch lạc khi nhiều mô hình viết các nhịp khác nhau là nhiệm vụ của bộ nhớ cung-và-thực-thể đi kèm với quá trình xây dựng. Bảng xếp hạng là bảng điểm; nhịp và bộ nhớ cung là thứ cho phép cuốn sách thực sự tận dụng nó.
Questions
Frequently asked
- Mô hình AI nào viết truyện hay nhất?
- Xét về nghệ thuật tổng thể — trung bình của các trục văn học, hội thoại, độ trung thành và nhịp điệu trên văn xuôi tiểu thuyết thực tế — Claude Opus 4.8 hiện đang dẫn đầu, với GPT-5.6 Sol theo sát. Nhưng "hay nhất" phụ thuộc vào cảnh: điểm cao nhất về hành động, lãng mạn và nội dung người lớn thuộc về các mô hình khác nhau. Bảng trên trang này hiển thị thứ hạng hiện tại và cỡ mẫu đứng sau mỗi con số.
- Bảng xếp hạng này được đo như thế nào?
- Mỗi mô hình viết cùng các nhịp được tóm lược trong điều kiện giống nhau, và hội đồng giám khảo ẩn danh chấm điểm văn xuôi kết quả 0–100 theo chín trục — bốn cho nghệ thuật (văn học, hội thoại, độ trung thành, nhịp điệu) và năm cho loại nội dung (cảm xúc, thể chất, xung đột, lãng mạn, gợi cảm). Điểm được thu hẹp về mức cơ sở trung tính 70 để dữ liệu mỏng không thể làm lệch con số, và cỡ mẫu được hiển thị bên cạnh mỗi điểm.
- Sự khác biệt giữa trục nghệ thuật và trục nội dung là gì?
- Trục nghệ thuật đo mức độ viết tốt của mô hình, bất kể chủ đề — chất lượng câu văn, giọng điệu nhân vật, sự trung thành với tóm lược và kiểm soát nhịp độ. Trục nội dung đo sự phù hợp với loại cảnh: cảm xúc, hành động thể chất, xung đột, lãng mạn và nội dung người lớn. Một mô hình có thể viết câu văn đẹp nhưng xử lý cảnh chiến đấu kém, vì vậy hai nhóm được chấm điểm và hiển thị riêng biệt.
- Tại sao không chỉ chọn một mô hình tốt nhất và dùng cho tất cả mọi thứ?
- Vì không có mô hình nào thắng mọi trục. Nghệ thuật văn học mạnh nhất, hành động hay nhất, và khả năng viết lãng mạn hoặc nội dung người lớn tốt nhất thuộc về các mô hình khác nhau. Novelmint điều phối cuốn sách qua các mô hình theo từng nhịp — giữ phần lớn trong một giọng văn nhất quán để đảm bảo tính liền mạch và chuyển sang mô hình mạnh hơn cho các nhịp cụ thể xứng đáng — điều này chỉ khả thi vì bảng này tồn tại.
- Điểm thấp có nghĩa là mô hình tệ không?
- Không nhất thiết. Điểm nội dung thấp có thể có nghĩa là mô hình có khả năng nhưng không sẵn sàng — hầu hết các mô hình điểm thấp về gợi cảm vì họ từ chối hoặc viết khô khan, không phải vì thiếu kỹ năng. Và điểm độ tin cậy thấp (ít mẫu) được thu hẹp về mức cơ sở, vì vậy nó được đọc là "chưa được chứng minh", không phải "đã được chứng minh là yếu". Luôn đọc điểm cùng với cỡ mẫu của nó.
- Bảng xếp hạng được cập nhật bao lâu một lần?
- Liên tục. Bảng là dữ liệu chiếu trực tiếp từ kho điểm của nền tảng: cùng giám khảo chấm điểm một đoạn trong khi Novelmint xây dựng chương sẽ đưa quan sát trở lại, vì vậy các con số thay đổi khi tác giả sử dụng công cụ và cỡ mẫu tăng. Trang hiển thị ngày hiệu chỉnh gần nhất. Các phiên bản mô hình mới được đo lại từ đầu thay vì pha trộn với mô hình họ thay thế, vì vậy một thay đổi phiên bản không bao giờ âm thầm làm hỏng một cột.
What this page does not claim
- Bảng xếp hạng này chỉ đo chất lượng văn xuôi và sự phù hợp nội dung cho văn học. Nó không nói gì về khả năng lý luận, lập trình, toán học, độ chính xác thực tế hay an toàn của mô hình ngoài ngữ cảnh viết lách.
- Điểm số có tính tương đối so với bộ được chấm và các prompt được sử dụng, không phải xếp hạng tuyệt đối hoặc chính thức được chứng nhận bởi nhà cung cấp mô hình. Tên mô hình và nhãn hiệu thuộc về chủ sở hữu tương ứng.
- Điểm nghệ thuật tổng thể cao hơn không có nghĩa là mô hình là lựa chọn đúng đắn cho mọi cuốn sách — giọng văn, thể loại, nhu cầu nội dung và chi phí đều quan trọng, đó chính xác là lý do tại sao Novelmint điều phối qua nhiều mô hình thay vì tôn một mô hình lên ngôi.
- Các ô ít mẫu là tạm thời. Khi một con số có ít quan sát, nó được thu hẹp về mức cơ sở trung tính và được đánh dấu, và nó sẽ thay đổi khi thêm nhiều phép đo được tích lũy vào.
Liên quan
AI tốt nhất cho cảnh hành động
AI nào giữ cho một trận đấu hay cảnh rượt đuổi rõ ràng và chắc chắn thay vì mờ nhạt. Được xếp hạng theo tính vật lý.
AI tốt nhất cho cảnh xung đột
AI nào giữ cho một cuộc tranh cãi hay đối đầu căng thẳng và leo thang. Được xếp hạng theo xung đột đo được.
AI tốt nhất cho cảnh cảm xúc
AI nào làm cho một cảnh dẫn dắt bởi cảm xúc thực sự chạm tới lòng người, thay vì chỉ miêu tả. Được xếp hạng theo cảm xúc.
AI tốt nhất cho cảnh người lớn
AI nào thực sự sẽ viết nội dung người lớn — và AI nào từ chối. Được xếp hạng theo mức độ sẵn lòng.
Thôi đoán xem nên dùng mô hình nào. Để cuốn sách tự chọn.
Novelmint điều phối mỗi nhịp đến mô hình mà bảng này cho là phù hợp nhất. Chương đầu tiên của bạn miễn phí.