Phương pháp luận

Cách thức hoạt động của benchmark mô hình tiểu thuyết

Updated July 23, 2026 · Đọc 6 phút

Benchmark đo lường điều mà các thẻ mô hình không bao giờ làm: liệu một mô hình có thể viết một cảnh mà độc giả sẽ không bỏ qua hay không. Trang này giải thích chính xác cách các con số được tạo ra — cái gì được đo, mô hình được đánh giá như thế nào, tại sao điểm số bị thu nhỏ theo độ tin cậy, và cách bảng dữ liệu được cập nhật — để bạn tự đánh giá kết quả và trích dẫn chính xác.

Key takeaways

  • Các mô hình hàng đầu viết cùng một nhịp tiểu thuyết đã được phác thảo, và một hội đồng giám khảo mù đa nhà cung cấp chấm điểm văn xuôi từ 0–100 trên chín trục — mà không biết mô hình nào đã viết.
  • Chín trục thuộc hai nhóm: bốn trục kỹ năng (văn học, hội thoại, độ trung thực, nhịp điệu) đo mức độ viết tốt của mô hình; năm trục nội dung (cảm xúc, thể chất, xung đột, lãng mạn, gợi cảm) đo loại cảnh mà mô hình viết tốt. Chúng không bao giờ được tính trung bình cùng nhau.
  • Mọi điểm số đều được thu nhỏ về mức cơ sở trung lập 70 tương ứng với lượng dữ liệu đứng sau nó (một prior tương đương năm quan sát), do đó một mẫu nhỏ may mắn không thể đạt đỉnh. Cỡ mẫu được hiển thị; các ô mỏng được đánh dấu.
  • Bảng dữ liệu là trực tiếp — các quan sát từ giám khảo mới được tích hợp vào trung bình tích lũy theo thời gian, và khi phiên bản mô hình thay đổi thì các ô được đặt lại và đo lại thay vì pha trộn với phiên bản trước.
  • Điểm số chỉ mô tả văn xuôi trên các nhịp tiểu thuyết; đây là phép đo độc lập, không phải xếp hạng chính thức từ nhà cung cấp, và điểm gợi cảm thấp thường phản ánh mức độ sẵn sàng, không phải kỹ năng.

Bộ tiêu chuẩn đánh giá văn xuôi của Novelmint đo lường điều mà thẻ thông tin mô hình chưa bao giờ đề cập: liệu một mô hình có thể viết ra một cảnh mà người đọc sẽ không bỏ qua hay không. Đây không phải bảng xếp hạng vay mượn từ các bài kiểm tra toán học hay lập trình — nó chấm điểm văn xuôi tiểu thuyết thực sự. Dưới đây là chính xác cách các con số được tạo ra, để bạn có thể tự đánh giá và trích dẫn chúng một cách tự tin.

Đo lường điều gì

Bộ tiêu chuẩn chấm điểm mức độ viết văn xuôi hư cấu của các mô hình tiên phong — từ Anthropic, OpenAI, Google và xAI. Không phải khả năng suy luận, không phải lập trình, không phải hiệu suất trên các bài kiểm tra trắc nghiệm. Mỗi mô hình được giao cùng một tập hợp các nhịp tiểu thuyết đã được phác thảo — các cảnh với các yếu tố bắt buộc, kiến thức bị cấm, điểm nhìn và mục tiêu kịch tính — và những gì nó viết ra được đánh giá như văn xuôi hư cấu, theo cách một biên tập viên đọc.

Tất cả được thể hiện trên thang điểm 0–100 cho từng trục, vì vậy các con số có thể so sánh trực tiếp giữa các mô hình và giữa các loại cảnh mà một cuốn sách thực sự được tạo nên.

Chín trục đánh giá

Văn xuôi hư cấu không phải là một kỹ năng duy nhất, vì vậy bộ tiêu chuẩn không thu gọn nó thành một con số. Nó chấm điểm chín trục, chia thành hai nhóm mang ý nghĩa khác nhau.

Bốn trục kỹ thuật đo lường mức độ tốt của văn xuôi mô hình viết, độc lập với chủ đề: literary (hình ảnh ở cấp độ câu văn, nhịp điệu, hàm ý, sự kiềm chế), dialogue (liệu các nhân vật có nghe như những con người riêng biệt), fidelity (mức độ trung thực khi tái hiện chính xác nhịp đã phác thảo, giữ nguyên các yếu tố bắt buộc và loại trừ kiến thức bị cấm), và pacing (kiểm soát đà câu chuyện — khi nào cần dồn nén, khi nào cần khai triển).

Năm trục nội dung đo lường loại cảnh mà mô hình viết tốt: emotion, physicality (hành động và cơ thể trong không gian), conflict, romance, và eroticism (nội dung người lớn rõ ràng). Đây không phải là thứ hạng tốt hơn hay kém hơn — chúng cho biết mô hình phù hợp với điều gì. Một mô hình có thể có những câu văn đẹp nhưng vẫn viết cảnh chiến đấu nhạt nhẽo, đó là lý do tại sao kỹ thuật và nội dung được chấm điểm và báo cáo riêng biệt, không bao giờ được tính trung bình thành một con số đơn lẻ gây hiểu lầm.

Cách mỗi mô hình được chấm điểm

Chấm điểm là đánh giá đồng nghiệp mù. Mỗi mô hình viết cùng một tập hợp các nhịp đã phác thảo, và một hội đồng gồm các mô hình giám khảo mạnh, đa dạng nhà cung cấp đánh giá mọi đoạn văn từ 0–100 trên từng trục — mà không biết mô hình nào đã viết nó, và không bao giờ tự đánh giá tác phẩm của mình. Hội đồng đa dạng nhà cung cấp rất quan trọng: một giám khảo đến từ ngoài gia đình của mô hình sẽ nhận ra những dấu hiệu mà gia đình đó thường khen thưởng.

Vì việc chấm điểm là mù và liên mô hình, một mô hình không thể tự tâng bốc mình, và không một phong cách nhà duy nhất nào đặt ra tiêu chuẩn.

Kiểm soát độ lệch của giám khảo

Sử dụng mô hình để đánh giá mô hình dẫn đến bốn kiểu thất bại nổi tiếng, và phương pháp này được xây dựng để khắc phục từng cái.

Thiên vị bản thân — một mô hình có xu hướng khen thưởng phong cách nhà của chính mình. Hai quy tắc loại bỏ điều này: một mô hình không bao giờ chấm điểm đoạn văn của chính mình, và hội đồng giám khảo đa dạng nhà cung cấp, vì vậy sở thích của không một gia đình nào đặt ra tiêu chuẩn. Một dấu hiệu mà một nhà khen thưởng sẽ bị giám khảo từ nhà khác phát hiện, và ngược lại.

Độ dài — các giám khảo thường xuyên khen thưởng quá mức cho độ dài. Mỗi nhịp đều hướng đến cùng một mục tiêu, khoảng 220 từ, vì vậy tất cả các đoạn văn đều có kích thước gần như nhau và việc thêm phần đệm không mang lại lợi ích. Một mô hình giành điểm dựa trên những gì nó làm với những từ đó, không phải dựa trên số lượng từ nó sử dụng.

Vị trí — thứ tự các đoạn văn xuất hiện có thể làm lệch điểm số về phía những gì xuất hiện đầu tiên. Vì vậy các đoạn văn được đặt nhãn lại và xáo trộn cho mỗi nhịp, và mỗi đoạn được chấm điểm độc lập theo một tiêu chí cố định thay vì xếp hạng trực tiếp. Thứ tự không mang tín hiệu, và bất kỳ sự trôi dạt còn lại nào đều được triệt tiêu qua nhiều nhịp và nhiều giám khảo.

Lấy mẫu — một bản thảo may mắn duy nhất có thể làm đẹp kết quả của một mô hình. Quá trình tạo văn bản chạy ở nhiệt độ mặc định của từng mô hình trên cùng một lời nhắc, không có điều chỉnh riêng cho từng mô hình, vì vậy không mô hình nào được trao một cài đặt được chọn lọc kỹ mà những mô hình khác không có. Và không ô nào dựa trên một bản thảo duy nhất: mọi mô hình đều được chấm điểm trên toàn bộ tập nhịp bởi mọi mô hình khác trong hội đồng, sau đó được kéo về đường cơ sở trung tính cho đến khi đủ phép đo tích lũy — vì vậy sự may mắn từ bản thảo đơn lẻ sẽ tan biến trước khi một con số được công bố.

Tại sao điểm số được co về mức độ tin cậy

Trung bình thô từ một số ít đoạn văn là nhiễu, và nhiễu được trình bày như điểm số thậm chí còn tệ hơn không có điểm số. Vì vậy mọi con số được công bố đều được co về đường cơ sở trung tính 70 theo tỷ lệ với lượng dữ liệu ít ỏi đứng sau nó — về mặt hình thức, một mức ưu tiên trị giá năm quan sát. Một ô được hỗ trợ bởi ba mẫu may mắn sẽ được đọc là gần trung bình cho đến khi đủ phép đo giúp nó có chỗ đứng; một ô được hỗ trợ bởi hàng trăm phép đo sẽ đọc là giá trị thực sự đã được đo.

Kích thước mẫu đằng sau mỗi con số được hiển thị, và bất kỳ ô nào vẫn dựa trên ít hơn sáu quan sát đều được đánh dấu là tạm thời. Đây là lý do tại sao một mô hình với dữ liệu mỏng không bao giờ vọt lên đầu vì may mắn — phương pháp sẽ không cho phép điều đó.

Cách lưới điểm được cập nhật

Bộ tiêu chuẩn không phải là một bài kiểm tra một lần được thực hiện rồi đóng băng. Đây là một phép chiếu trực tiếp của kho dữ liệu chấm điểm mà nền tảng vận hành: các quan sát giám khảo mới được gộp vào trung bình liên tục, và số lượng mẫu của mỗi ô tăng theo thời gian, vì vậy lưới điểm ngày càng sắc nét hơn thay vì lão hóa. Trang luôn hiển thị ngày hiệu chỉnh gần nhất.

Một biện pháp bảo vệ quan trọng cho độ chính xác. Khi một bí danh bền vững (con trỏ "latest") âm thầm trỏ đến một mô hình cơ bản mới, các ô của mô hình đó được đặt lại và đo lại từ đầu thay vì kết hợp với mô hình mà chúng thay thế — vì vậy một thay đổi phiên bản không bao giờ âm thầm làm hỏng một cột. Đây cũng là lý do tại sao bộ tiêu chuẩn đặt tên phiên bản cụ thể được đo thay vì nhãn chung chung.

Giới hạn

Các điểm số mô tả văn xuôi trên các nhịp hư cấu, được đánh giá theo tập hợp mô hình và lời nhắc này. Chúng không phải là xếp hạng chính thức được các nhà cung cấp mô hình chứng thực, và chúng không nói gì về khả năng suy luận, độ chính xác hay an toàn của mô hình ngoài ngữ cảnh viết lách. Tên mô hình và thương hiệu thuộc về chủ sở hữu tương ứng; đây là một phép đo độc lập.

Hai cách đọc dễ bị nhầm lẫn. Điểm eroticism thấp thường phản ánh sự sẵn lòng — một mô hình từ chối hoặc trở nên lâm sàng — không phải là thất bại của kỹ thuật. Và điểm tin cậy thấp có nghĩa là "chưa được chứng minh", không phải "đã được chứng minh là yếu". Luôn đọc một con số cùng với kích thước mẫu của nó, và nhớ rằng mô hình tốt nhất cho cuốn sách của bạn phụ thuộc vào các trục mà cuốn sách của bạn dựa vào — đó chính là lý do tại sao lưới điểm giữ chúng riêng biệt.

Questions

Frequently asked

Novelmint đánh giá benchmark các mô hình AI cho tiểu thuyết như thế nào?
Mỗi mô hình hàng đầu viết cùng một nhịp tiểu thuyết đã được phác thảo, và một hội đồng mù đa nhà cung cấp gồm các mô hình giám khảo mạnh chấm điểm văn xuôi kết quả từ 0–100 trên chín trục mà không biết tác giả là ai. Điểm số được thu nhỏ về mức cơ sở trung lập theo lượng dữ liệu đứng sau, và các quan sát được tích hợp vào trung bình tích lũy theo thời gian.
Chín trục đánh giá là gì?
Bốn trục kỹ năng — văn học, hội thoại, độ trung thực (bám sát phác thảo) và nhịp điệu — đo mức độ viết tốt của mô hình. Năm trục nội dung — cảm xúc, thể chất (hành động), xung đột, lãng mạn và gợi cảm — đo loại cảnh mà mô hình viết tốt. Kỹ năng và nội dung được báo cáo riêng, không bao giờ tính trung bình cùng nhau.
Tại sao điểm số được điều chỉnh theo độ tin cậy?
Trung bình thô từ vài đoạn văn chỉ là nhiễu. Mỗi điểm số được thu nhỏ về mức cơ sở trung lập 70 tương ứng với lượng dữ liệu đứng sau nó — một prior tương đương năm quan sát — để một mẫu nhỏ may mắn không thể đạt đỉnh. Cỡ mẫu được hiển thị, và các ô có ít hơn sáu quan sát được đánh dấu là tạm thời.
Đây có phải xếp hạng chính thức từ OpenAI, Anthropic, Google hay xAI không?
Không. Đây là phép đo độc lập của Novelmint, chỉ trên văn xuôi tiểu thuyết, được đánh giá dựa trên tập hợp mô hình và câu lệnh này. Nó không nói gì về khả năng lập luận, độ chính xác hay các năng lực khác, và tên mô hình là nhãn hiệu của chủ sở hữu tương ứng.
Benchmark được cập nhật bao lâu một lần?
Liên tục — các quan sát từ giám khảo mới được tích hợp vào trung bình tích lũy và số lượng mẫu tăng dần, do đó bảng dữ liệu ngày càng chính xác hơn theo thời gian. Khi phiên bản mô hình thay đổi dưới một bí danh, các ô của nó được đặt lại và đo lại thay vì pha trộn với phiên bản cũ hơn. Trang hiển thị ngày hiệu chỉnh gần nhất.

What this page does not claim

  • Điểm số có tính tương đối so với tập mô hình được đánh giá và các câu lệnh được sử dụng — không phải xếp hạng tuyệt đối hay chính thức.
  • Điểm gợi cảm thấp phản ánh mức độ sẵn sàng (mô hình từ chối hoặc trở nên cứng nhắc), không phải thiếu kỹ năng; điểm tin cậy thấp có nghĩa là "chưa được chứng minh", không phải "đã được chứng minh là yếu".
  • Benchmark chỉ đo văn xuôi tiểu thuyết và không nói gì về khả năng lập luận, lập trình, độ chính xác thực tế hay an toàn ngoài bối cảnh viết lách.

Xem mô hình nào viết loại cảnh của bạn tốt nhất.

Dữ liệu trực tiếp trên chín trục, được cập nhật khi có thêm văn xuôi được đo lường.