Chấm điểm tự động hoạt động thế nào và có giới hạn gì?
- Chấm điểm tự động biến câu trả lời thành điểm như thế nào?
- Phạm vi đánh giá phụ thuộc rất mạnh vào loại câu hỏi
- Điểm máy giống điểm người chưa đủ để chứng minh hệ thống đánh giá đúng
- Giới hạn lớn nhất nằm ở những gì mô hình không quan sát hoặc không hiểu đầy đủ
- Chấm điểm tự động còn bị giới hạn bởi dữ liệu, rubric và bối cảnh sử dụng
- Khi nào điểm tự động nên được kết hợp với đánh giá của con người?
Điểm quan trọng là máy không mặc nhiên “hiểu bài” theo cách một giám khảo hiểu bài. Hệ thống chỉ có thể đánh giá những tín hiệu mà thiết kế chấm điểm, dữ liệu và mô hình của nó cho phép nhận diện. Vì vậy, câu hỏi quan trọng không chỉ là máy và người chấm có cho điểm giống nhau hay không, mà còn là điểm tự động có phản ánh đúng năng lực mà bài kiểm tra muốn đo hay không. Đây cũng là lý do nghiên cứu về chấm điểm tự động thường tách độ nhất quán của điểm khỏi tính giá trị của phép đánh giá.
Chấm điểm tự động biến câu trả lời thành điểm như thế nào?
Ở mức tổng quát, một hệ thống chấm điểm tự động thực hiện ba việc liên tiếp: nhận câu trả lời, xác định các tín hiệu liên quan đến tiêu chí chấm và chuyển những tín hiệu đó thành điểm.
Đối với câu hỏi trắc nghiệm, điền số hoặc dạng bài có tập đáp án xác định, cơ chế có thể hoàn toàn dựa trên quy tắc. Hệ thống kiểm tra câu trả lời có khớp đáp án hay không, đôi khi thêm các điều kiện như sai số cho phép, đơn vị hoặc nhiều phương án tương đương. Trong trường hợp này, khoảng cách giữa tiêu chí chấm và thao tác của máy khá nhỏ.
Với câu trả lời mở, vấn đề phức tạp hơn. Hệ thống có thể phân tích độ dài, cấu trúc, từ vựng, ngữ pháp, tổ chức ý, mức độ liên quan đến chủ đề hoặc những đặc trưng nội dung khác. Các đặc trưng này sau đó được đưa vào mô hình đã được thiết kế hoặc huấn luyện để tạo điểm.
Trong các hệ thống dựa trên học máy, dữ liệu bài làm đã được con người chấm thường đóng vai trò quan trọng. Mô hình học mối liên hệ giữa những đặc trưng của bài làm và điểm tham chiếu, sau đó áp dụng mối liên hệ đó cho bài mới. Điều này giải thích tại sao chất lượng của rubric, dữ liệu chấm mẫu và quy trình kiểm định đều tác động trực tiếp đến chất lượng điểm tự động.
Nghiên cứu quy mô khoảng 2.500 học sinh tại Đức và Thụy Sĩ cho thấy các mô hình chấm bài viết tự động theo từng đề có thể được xây dựng và đánh giá bằng những chỉ số như tương quan điểm số và quadratic weighted kappa, đồng thời phải được kiểm tra cùng các thước đo bên ngoài thay vì chỉ nhìn vào điểm máy.

Phạm vi đánh giá phụ thuộc rất mạnh vào loại câu hỏi
Không phải mọi nhiệm vụ đánh giá đều khó tự động hóa như nhau.
Câu hỏi có đáp án xác định thường phù hợp nhất với chấm tự động vì tiêu chí đúng hoặc sai có thể biểu diễn trực tiếp thành quy tắc. Nếu phép tính đúng, đáp án đúng và định dạng nằm trong phạm vi cho phép, hệ thống có thể chấm với tính lặp lại rất cao.
Câu trả lời ngắn nằm ở mức trung gian. Máy có thể nhận diện từ khóa, khái niệm hoặc các cách diễn đạt tương đương, nhưng vấn đề bắt đầu xuất hiện khi cùng một ý có nhiều cách trình bày hoặc khi câu trả lời chỉ đúng trong một điều kiện cụ thể.
Bài tự luận khó hơn vì chất lượng bài viết thường không nằm trong một tín hiệu đơn lẻ. Người chấm có thể phải xem xét lập luận, bằng chứng, tính logic, mức độ phát triển ý, độ chính xác của nội dung, khả năng nhận biết người đọc và nhiều yếu tố khác cùng lúc.
Các hệ thống chấm bài viết đã chứng minh khả năng xử lý khá tốt những đặc trưng như ngữ pháp, cơ học viết, tổ chức, cách sử dụng từ hoặc một số dấu hiệu phát triển nội dung. Nhưng những yếu tố nhận thức cao hơn như chất lượng lập luận, tư duy phản biện, sáng tạo và nhận thức về đối tượng đọc khó được suy ra một cách đáng tin cậy chỉ từ các đặc trưng bề mặt.
Do đó, “chấm được” không đồng nghĩa với “đánh giá đầy đủ”. Một hệ thống có thể tạo ra điểm cho gần như mọi bài viết nếu được buộc phải làm vậy, nhưng câu hỏi quan trọng hơn là điểm đó đại diện cho phần nào của năng lực cần đo.
Điểm máy giống điểm người chưa đủ để chứng minh hệ thống đánh giá đúng
Một trong những cách phổ biến nhất để kiểm tra hệ thống chấm tự động là so sánh điểm máy với điểm của giám khảo. Có thể sử dụng tương quan, tỷ lệ trùng điểm, tỷ lệ chênh một mức, quadratic weighted kappa hoặc các thước đo sai số.
Các chỉ số này rất cần thiết, nhưng chúng chủ yếu cho biết mức độ hai phương pháp chấm cho kết quả tương tự nhau. Chúng chưa chứng minh rằng cả hai đang đo đúng năng lực cần đánh giá.
Ví dụ, nếu một mô hình học rất tốt những đặc điểm mà người chấm thường vô tình sử dụng để cho điểm, máy có thể đạt mức tương đồng cao với người chấm nhưng vẫn bỏ sót một thành phần quan trọng của năng lực. Vì vậy, validation cần xem xét thêm mối quan hệ giữa điểm và những bằng chứng độc lập về năng lực.
Một nghiên cứu ETS với khoảng 1.700 người dự thi đã so sánh điểm bài viết với các chỉ báo bên ngoài về khả năng viết. Kết quả cho thấy phương án kết hợp một người chấm với e-rater có quan hệ với các tiêu chí bên ngoài gần tương đương phương án sử dụng hai người chấm. Chính thiết kế này cho thấy validation không dừng ở việc hỏi “máy có đồng ý với người không”, mà phải hỏi điểm số có liên hệ hợp lý với năng lực cần đo hay không.
Nói cách khác, reliability và validity là hai câu hỏi khác nhau. Một hệ thống có thể rất nhất quán nhưng vẫn nhất quán trong việc đo sai thứ cần đo.
Giới hạn lớn nhất nằm ở những gì mô hình không quan sát hoặc không hiểu đầy đủ
Máy chỉ suy luận từ những thông tin mà nó có thể xử lý. Nếu một tiêu chí quan trọng không được biểu diễn đầy đủ trong dữ liệu hoặc đặc trưng đầu vào, điểm số có nguy cơ trở thành một đại diện không hoàn chỉnh cho năng lực thật.
Điều này đặc biệt rõ với bài viết. Một văn bản dài, trôi chảy và ít lỗi có thể mang nhiều đặc trưng thường đi cùng điểm cao, nhưng vẫn có thể chứa lập luận yếu, bằng chứng không phù hợp hoặc kết luận không được chứng minh.
Sự phát triển của AI tạo sinh làm giới hạn này dễ quan sát hơn. ETS báo cáo năm 2026 rằng e-rater có xu hướng cho một số bài do AI tạo sinh điểm cao hơn người chấm. Một nguyên nhân được nêu là bài AI có thể thể hiện rất tốt các đặc trưng ngôn ngữ vốn từng có quan hệ mạnh với chất lượng bài viết của con người, trong khi chiều sâu lập luận, sử dụng bằng chứng hoặc tư duy phân tích không nhất thiết tương ứng.
Đây là ví dụ điển hình của vấn đề proxy: hệ thống đo một tín hiệu có tương quan với năng lực, rồi sử dụng tín hiệu đó thay cho chính năng lực. Khi mối quan hệ giữa proxy và năng lực thay đổi, chất lượng phép chấm có thể giảm dù thuật toán vẫn hoạt động đúng như được lập trình.
Ngoài ra, hệ thống có thể gặp các câu trả lời bất thường, lặp lại, cố tình tối ưu theo đặc trưng máy hoặc khác đáng kể so với dữ liệu mà mô hình từng gặp. Nghiên cứu về e-rater đã phát hiện những trường hợp bài viết có thể khai thác điểm yếu của hệ thống; các phiên bản sau phải bổ sung cờ phát hiện để chuyển một số trường hợp sang người chấm.
Chấm điểm tự động còn bị giới hạn bởi dữ liệu, rubric và bối cảnh sử dụng
Sai số không chỉ sinh ra từ thuật toán. Một hệ thống chấm tự động nằm trong cả một chuỗi đánh giá gồm định nghĩa năng lực, thiết kế nhiệm vụ, rubric, dữ liệu chấm mẫu, mô hình, quy tắc xử lý trường hợp bất thường và cách sử dụng điểm.
Nếu rubric không thể hiện đúng năng lực cần đo, tự động hóa rubric đó không khắc phục được vấn đề. Nếu người chấm trong dữ liệu huấn luyện có thiên lệch hoặc thiếu nhất quán, mô hình cũng có thể học lại một phần các mẫu đó. ETS từng lưu ý rằng hệ thống tự động có thể kế thừa sai lệch hoặc lỗi từ điểm của con người dùng làm cơ sở phát triển hệ thống.
Khả năng khái quát hóa cũng là một giới hạn. Hiệu quả trên một đề, một nhóm người học hoặc một kiểu câu trả lời không tự động chứng minh hiệu quả tương đương với đề khác hay nhóm khác. Vì thế, kiểm định trên dữ liệu tách biệt, nhiều nhiệm vụ và các nhóm người học khác nhau quan trọng hơn việc chỉ báo cáo hiệu suất trên dữ liệu dùng để phát triển mô hình.
Nghiên cứu phương pháp về automated scoring cũng cảnh báo những cách đánh giá dễ tạo cảm giác hệ thống hoạt động tốt hơn thực tế, chẳng hạn kiểm tra trên chính mẫu huấn luyện, chỉ sử dụng một đề hoặc chỉ nhìn vào mức đồng thuận máy-người.
Bởi vậy, chất lượng của một hệ thống chấm tự động không phải một thuộc tính cố định của thuật toán. Nó luôn gắn với nhiệm vụ nào, người học nào, rubric nào, dữ liệu nào và mục đích sử dụng điểm nào.
Khi nào điểm tự động nên được kết hợp với đánh giá của con người?
Giá trị lớn nhất của chấm tự động là khả năng xử lý số lượng lớn bài làm nhanh, áp dụng cùng một logic nhiều lần và tạo phản hồi hoặc điểm số với độ trễ thấp. Những đặc tính này đặc biệt hữu ích khi tiêu chí có thể mô tả rõ và hậu quả của một sai số đơn lẻ không quá lớn.
Nhưng khi quyết định có hệ quả cao hoặc nhiệm vụ yêu cầu đánh giá những đặc tính khó mô hình hóa, việc sử dụng người chấm như một lớp kiểm soát trở nên quan trọng hơn.
Một thiết kế kết hợp có thể để máy xử lý các trường hợp thông thường và chuyển bài bất thường, điểm không chắc chắn hoặc trường hợp có dấu hiệu vượt phạm vi mô hình sang người chấm. Một cách khác là sử dụng điểm máy như một nguồn bằng chứng bên cạnh điểm người thay vì coi nó là nguồn duy nhất.
Điều này không có nghĩa điểm người luôn chính xác tuyệt đối. Người chấm cũng có thể gặp sai lệch về độ nghiêm khắc, hiệu ứng hào quang, drift hoặc khác biệt trong cách diễn giải rubric. Điểm mạnh của mô hình kết hợp là hai phương pháp có những kiểu sai số khác nhau và có thể được thiết kế để kiểm soát lẫn nhau.
Đặc biệt với đánh giá có hệ quả cao, nguyên tắc hợp lý không phải là “máy hay người tốt hơn”, mà là xác định bằng chứng nào cần thiết để bảo vệ ý nghĩa của điểm số và trường hợp nào cần cơ chế kiểm tra bổ sung.
Chấm điểm tự động hoạt động bằng cách chuyển câu trả lời thành những tín hiệu có thể xử lý rồi ánh xạ các tín hiệu đó sang tiêu chí hoặc điểm số. Cơ chế này có thể rất chính xác với nhiệm vụ có đáp án xác định và hữu ích với những đặc trưng có thể quan sát ổn định ở câu trả lời mở.
Giới hạn xuất hiện khi điểm số đòi hỏi hiểu những khía cạnh mà mô hình chỉ quan sát gián tiếp, khi dữ liệu phát triển không đại diện cho tình huống thực tế hoặc khi người sử dụng nhầm sự tương đồng giữa điểm máy và điểm người với bằng chứng về tính giá trị của phép đánh giá.
Vì thế, chấm điểm tự động nên được hiểu là một cơ chế đo lường có phạm vi, không phải một giám khảo toàn năng. Hệ thống đáng tin cậy nhất là hệ thống xác định rõ mình đo gì, kiểm định điểm số bằng nhiều loại bằng chứng và có cơ chế chuyển sang đánh giá của con người khi câu trả lời vượt khỏi phạm vi mà mô hình có thể xử lý an toàn.
Hỏi đáp về chấm điểm tự động
Chấm điểm tự động có khách quan hơn người chấm không?
Hệ thống có thể áp dụng cùng một quy tắc nhất quán hơn và không chịu một số biến động tâm lý của người chấm. Tuy nhiên, điều đó không đồng nghĩa với trung lập tuyệt đối, vì rubric, dữ liệu huấn luyện và thiết kế mô hình vẫn có thể mang theo những sai lệch có hệ thống.
Điểm máy trùng với điểm người cao có nghĩa là hệ thống chính xác không?
Không đủ. Mức đồng thuận máy-người là bằng chứng quan trọng về hoạt động của hệ thống, nhưng tính giá trị còn đòi hỏi chứng minh rằng điểm số thực sự đại diện cho năng lực cần đánh giá và duy trì ý nghĩa đó trong nhóm người học cũng như tình huống sử dụng cụ thể.
Vì sao bài viết trôi chảy vẫn có thể bị đánh giá sai?
Vì chất lượng ngôn ngữ chỉ là một phần của chất lượng bài viết. Một bài có thể đúng ngữ pháp và tổ chức tốt nhưng lập luận yếu, dùng bằng chứng kém hoặc thiếu chiều sâu. Nếu mô hình đặt trọng số lớn vào các tín hiệu ngôn ngữ, điểm có thể cao hơn mức mà đánh giá toàn diện của con người cho là phù hợp.
