Bộ tiêu chuẩn đánh giá văn xuôi của Novelmint đo lường điều mà thẻ thông tin mô hình chưa bao giờ đề cập: liệu một mô hình có thể viết ra một cảnh mà người đọc sẽ không bỏ qua hay không. Đây không phải bảng xếp hạng vay mượn từ các bài kiểm tra toán học hay lập trình — nó chấm điểm văn xuôi tiểu thuyết thực sự. Dưới đây là chính xác cách các con số được tạo ra, để bạn có thể tự đánh giá và trích dẫn chúng một cách tự tin.
Đo lường điều gì
Bộ tiêu chuẩn chấm điểm mức độ viết văn xuôi hư cấu của các mô hình tiên phong — từ Anthropic, OpenAI, Google và xAI. Không phải khả năng suy luận, không phải lập trình, không phải hiệu suất trên các bài kiểm tra trắc nghiệm. Mỗi mô hình được giao cùng một tập hợp các nhịp tiểu thuyết đã được phác thảo — các cảnh với các yếu tố bắt buộc, kiến thức bị cấm, điểm nhìn và mục tiêu kịch tính — và những gì nó viết ra được đánh giá như văn xuôi hư cấu, theo cách một biên tập viên đọc.
Tất cả được thể hiện trên thang điểm 0–100 cho từng trục, vì vậy các con số có thể so sánh trực tiếp giữa các mô hình và giữa các loại cảnh mà một cuốn sách thực sự được tạo nên.
Chín trục đánh giá
Văn xuôi hư cấu không phải là một kỹ năng duy nhất, vì vậy bộ tiêu chuẩn không thu gọn nó thành một con số. Nó chấm điểm chín trục, chia thành hai nhóm mang ý nghĩa khác nhau.
Bốn trục kỹ thuật đo lường mức độ tốt của văn xuôi mô hình viết, độc lập với chủ đề: literary (hình ảnh ở cấp độ câu văn, nhịp điệu, hàm ý, sự kiềm chế), dialogue (liệu các nhân vật có nghe như những con người riêng biệt), fidelity (mức độ trung thực khi tái hiện chính xác nhịp đã phác thảo, giữ nguyên các yếu tố bắt buộc và loại trừ kiến thức bị cấm), và pacing (kiểm soát đà câu chuyện — khi nào cần dồn nén, khi nào cần khai triển).
Năm trục nội dung đo lường loại cảnh mà mô hình viết tốt: emotion, physicality (hành động và cơ thể trong không gian), conflict, romance, và eroticism (nội dung người lớn rõ ràng). Đây không phải là thứ hạng tốt hơn hay kém hơn — chúng cho biết mô hình phù hợp với điều gì. Một mô hình có thể có những câu văn đẹp nhưng vẫn viết cảnh chiến đấu nhạt nhẽo, đó là lý do tại sao kỹ thuật và nội dung được chấm điểm và báo cáo riêng biệt, không bao giờ được tính trung bình thành một con số đơn lẻ gây hiểu lầm.
Cách mỗi mô hình được chấm điểm
Chấm điểm là đánh giá đồng nghiệp mù. Mỗi mô hình viết cùng một tập hợp các nhịp đã phác thảo, và một hội đồng gồm các mô hình giám khảo mạnh, đa dạng nhà cung cấp đánh giá mọi đoạn văn từ 0–100 trên từng trục — mà không biết mô hình nào đã viết nó, và không bao giờ tự đánh giá tác phẩm của mình. Hội đồng đa dạng nhà cung cấp rất quan trọng: một giám khảo đến từ ngoài gia đình của mô hình sẽ nhận ra những dấu hiệu mà gia đình đó thường khen thưởng.
Vì việc chấm điểm là mù và liên mô hình, một mô hình không thể tự tâng bốc mình, và không một phong cách nhà duy nhất nào đặt ra tiêu chuẩn.
Kiểm soát độ lệch của giám khảo
Sử dụng mô hình để đánh giá mô hình dẫn đến bốn kiểu thất bại nổi tiếng, và phương pháp này được xây dựng để khắc phục từng cái.
Thiên vị bản thân — một mô hình có xu hướng khen thưởng phong cách nhà của chính mình. Hai quy tắc loại bỏ điều này: một mô hình không bao giờ chấm điểm đoạn văn của chính mình, và hội đồng giám khảo đa dạng nhà cung cấp, vì vậy sở thích của không một gia đình nào đặt ra tiêu chuẩn. Một dấu hiệu mà một nhà khen thưởng sẽ bị giám khảo từ nhà khác phát hiện, và ngược lại.
Độ dài — các giám khảo thường xuyên khen thưởng quá mức cho độ dài. Mỗi nhịp đều hướng đến cùng một mục tiêu, khoảng 220 từ, vì vậy tất cả các đoạn văn đều có kích thước gần như nhau và việc thêm phần đệm không mang lại lợi ích. Một mô hình giành điểm dựa trên những gì nó làm với những từ đó, không phải dựa trên số lượng từ nó sử dụng.
Vị trí — thứ tự các đoạn văn xuất hiện có thể làm lệch điểm số về phía những gì xuất hiện đầu tiên. Vì vậy các đoạn văn được đặt nhãn lại và xáo trộn cho mỗi nhịp, và mỗi đoạn được chấm điểm độc lập theo một tiêu chí cố định thay vì xếp hạng trực tiếp. Thứ tự không mang tín hiệu, và bất kỳ sự trôi dạt còn lại nào đều được triệt tiêu qua nhiều nhịp và nhiều giám khảo.
Lấy mẫu — một bản thảo may mắn duy nhất có thể làm đẹp kết quả của một mô hình. Quá trình tạo văn bản chạy ở nhiệt độ mặc định của từng mô hình trên cùng một lời nhắc, không có điều chỉnh riêng cho từng mô hình, vì vậy không mô hình nào được trao một cài đặt được chọn lọc kỹ mà những mô hình khác không có. Và không ô nào dựa trên một bản thảo duy nhất: mọi mô hình đều được chấm điểm trên toàn bộ tập nhịp bởi mọi mô hình khác trong hội đồng, sau đó được kéo về đường cơ sở trung tính cho đến khi đủ phép đo tích lũy — vì vậy sự may mắn từ bản thảo đơn lẻ sẽ tan biến trước khi một con số được công bố.
Tại sao điểm số được co về mức độ tin cậy
Trung bình thô từ một số ít đoạn văn là nhiễu, và nhiễu được trình bày như điểm số thậm chí còn tệ hơn không có điểm số. Vì vậy mọi con số được công bố đều được co về đường cơ sở trung tính 70 theo tỷ lệ với lượng dữ liệu ít ỏi đứng sau nó — về mặt hình thức, một mức ưu tiên trị giá năm quan sát. Một ô được hỗ trợ bởi ba mẫu may mắn sẽ được đọc là gần trung bình cho đến khi đủ phép đo giúp nó có chỗ đứng; một ô được hỗ trợ bởi hàng trăm phép đo sẽ đọc là giá trị thực sự đã được đo.
Kích thước mẫu đằng sau mỗi con số được hiển thị, và bất kỳ ô nào vẫn dựa trên ít hơn sáu quan sát đều được đánh dấu là tạm thời. Đây là lý do tại sao một mô hình với dữ liệu mỏng không bao giờ vọt lên đầu vì may mắn — phương pháp sẽ không cho phép điều đó.
Cách lưới điểm được cập nhật
Bộ tiêu chuẩn không phải là một bài kiểm tra một lần được thực hiện rồi đóng băng. Đây là một phép chiếu trực tiếp của kho dữ liệu chấm điểm mà nền tảng vận hành: các quan sát giám khảo mới được gộp vào trung bình liên tục, và số lượng mẫu của mỗi ô tăng theo thời gian, vì vậy lưới điểm ngày càng sắc nét hơn thay vì lão hóa. Trang luôn hiển thị ngày hiệu chỉnh gần nhất.
Một biện pháp bảo vệ quan trọng cho độ chính xác. Khi một bí danh bền vững (con trỏ "latest") âm thầm trỏ đến một mô hình cơ bản mới, các ô của mô hình đó được đặt lại và đo lại từ đầu thay vì kết hợp với mô hình mà chúng thay thế — vì vậy một thay đổi phiên bản không bao giờ âm thầm làm hỏng một cột. Đây cũng là lý do tại sao bộ tiêu chuẩn đặt tên phiên bản cụ thể được đo thay vì nhãn chung chung.
Giới hạn
Các điểm số mô tả văn xuôi trên các nhịp hư cấu, được đánh giá theo tập hợp mô hình và lời nhắc này. Chúng không phải là xếp hạng chính thức được các nhà cung cấp mô hình chứng thực, và chúng không nói gì về khả năng suy luận, độ chính xác hay an toàn của mô hình ngoài ngữ cảnh viết lách. Tên mô hình và thương hiệu thuộc về chủ sở hữu tương ứng; đây là một phép đo độc lập.
Hai cách đọc dễ bị nhầm lẫn. Điểm eroticism thấp thường phản ánh sự sẵn lòng — một mô hình từ chối hoặc trở nên lâm sàng — không phải là thất bại của kỹ thuật. Và điểm tin cậy thấp có nghĩa là "chưa được chứng minh", không phải "đã được chứng minh là yếu". Luôn đọc một con số cùng với kích thước mẫu của nó, và nhớ rằng mô hình tốt nhất cho cuốn sách của bạn phụ thuộc vào các trục mà cuốn sách của bạn dựa vào — đó chính là lý do tại sao lưới điểm giữ chúng riêng biệt.