Cách kết hợp dữ liệu học tập từ nhiều nguồn
- Xác định câu hỏi đánh giá trước khi ghép dữ liệu
- Phân vai từng nguồn dữ liệu theo loại bằng chứng
- Chuẩn hóa và liên kết dữ liệu trước khi phân tích
- Kết hợp bằng chứng bằng đối chiếu thay vì cộng điểm cơ học
- Kiểm tra độ tin cậy, dữ liệu thiếu và thiên lệch
- Triển khai quy trình kết hợp dữ liệu theo vòng kiểm chứng
Một nguyên tắc quan trọng là không coi mọi dữ liệu đều có giá trị đánh giá như nhau. Điểm bài kiểm tra có thể cung cấp bằng chứng trực tiếp về mức độ đạt một mục tiêu học tập, trong khi số lần đăng nhập chủ yếu phản ánh hành vi truy cập. Hai nguồn này có thể bổ sung cho nhau nhưng không thể thay thế nhau.
Vì vậy, kết hợp dữ liệu học tập nên được hiểu như quá trình liên kết, chuẩn hóa, đối chiếu và diễn giải nhiều loại bằng chứng theo cùng một câu hỏi đánh giá. Mục tiêu cuối cùng không phải tạo ra một cơ sở dữ liệu lớn hơn, mà tạo ra kết luận có độ tin cậy cao hơn về kết quả, quá trình và bối cảnh học tập.
Xác định câu hỏi đánh giá trước khi ghép dữ liệu
Sai lầm phổ biến là bắt đầu bằng câu hỏi: “Hệ thống đang có những dữ liệu nào?”. Cách làm này dễ khiến tổ chức đo những gì thuận tiện thu thập thay vì những gì thực sự cần biết về người học.
Điểm xuất phát nên là một câu hỏi đánh giá cụ thể, chẳng hạn: người học đã đạt năng lực mục tiêu chưa, đang gặp khó khăn ở giai đoạn nào, có duy trì quá trình học ổn định không, hay kết quả thấp xuất phát từ thiếu kiến thức hay thiếu cơ hội tham gia?
Sau đó mới xác định nguồn dữ liệu nào có khả năng tạo bằng chứng cho câu hỏi đó.
Ví dụ, để đánh giá mức độ làm chủ một năng lực, điểm bài kiểm tra hoặc sản phẩm thực hành thường mang bằng chứng trực tiếp hơn số lượt truy cập tài liệu. Nhật ký LMS vẫn hữu ích, nhưng chủ yếu giúp giải thích quá trình dẫn đến kết quả: người học có luyện tập, xem lại nội dung, nộp bài nhiều lần hoặc dừng ở một bước cụ thể hay không.
Có thể hình dung quá trình này theo chuỗi:
Câu hỏi đánh giá → Chỉ báo cần quan sát → Nguồn dữ liệu → Quy tắc diễn giải → Kết luận
Nếu đảo chiều chuỗi trên và để dữ liệu có sẵn quyết định câu hỏi đánh giá, hệ thống rất dễ nhầm giữa “dữ liệu quan sát được” với “năng lực thực sự của người học”.

Phân vai từng nguồn dữ liệu theo loại bằng chứng
Các nguồn dữ liệu nên được phân theo vai trò thay vì được đưa vào cùng một bảng rồi xử lý giống nhau. Một cấu trúc hữu ích là xem xét ba lớp bằng chứng: kết quả, quá trình và bối cảnh.
Dữ liệu kết quả cho biết người học đạt được gì
Nhóm này bao gồm điểm kiểm tra, kết quả bài tập, sản phẩm dự án, rubric chấm năng lực, kết quả thực hành hoặc mức độ hoàn thành mục tiêu học tập.
Đây thường là nguồn bằng chứng gần nhất với câu hỏi “người học có biết hoặc làm được điều cần học hay không”. Tuy nhiên, một điểm số đơn lẻ vẫn có giới hạn. Nó cho thấy kết quả tại một thời điểm nhưng có thể không giải thích được vì sao người học đạt hoặc không đạt.
Dữ liệu quá trình cho biết người học đã học như thế nào
Nhật ký LMS, lịch sử làm bài, số lần thử, thời gian thực hiện, hoạt động đọc, xem video, thảo luận hoặc sử dụng công cụ có thể mô tả quá trình học.
Các tiêu chuẩn dữ liệu học tập như Caliper Analytics 1.2 cung cấp các nhóm sự kiện cho hoạt động đánh giá, bài tập, diễn đàn, chấm điểm, đọc, media và phiên sử dụng; xAPI 2.0 cũng cho phép biểu diễn trải nghiệm dưới dạng các bản ghi hoạt động có tác nhân, hành động, đối tượng, kết quả, ngữ cảnh và thời gian. Những mô hình này giúp dữ liệu từ nhiều công cụ được mô tả nhất quán hơn.
Dù vậy, hành vi số không đồng nghĩa trực tiếp với học tập. Một người mở tài liệu lâu chưa chắc đã hiểu sâu hơn; người khác có thể học ngoại tuyến và chỉ vào hệ thống khi nộp bài. Vì thế, dữ liệu quá trình chủ yếu nên được dùng để giải thích hoặc bổ sung cho bằng chứng kết quả.
Dữ liệu bối cảnh giúp tránh kết luận sai
Bối cảnh có thể gồm thời điểm học, cấu trúc khóa học, nhiệm vụ được giao, điều kiện truy cập, công cụ sử dụng hoặc các yếu tố liên quan trực tiếp đến cơ hội tham gia hoạt động học tập.
Lớp dữ liệu này đặc biệt quan trọng khi hai người có cùng kết quả nhưng trải qua những điều kiện học khác nhau. Nếu bỏ qua bối cảnh, hệ thống có thể quy một khác biệt do thiết kế khóa học hoặc khả năng truy cập thành khác biệt về năng lực cá nhân.
Chuẩn hóa và liên kết dữ liệu trước khi phân tích
Dữ liệu từ nhiều hệ thống chỉ có thể kết hợp có ý nghĩa khi chúng cùng trả lời được ba câu hỏi: đây là ai, đang thực hiện hoạt động nào và hoạt động xảy ra trong ngữ cảnh nào.
Trước hết cần thống nhất định danh người học. Một cá nhân có thể xuất hiện dưới mã sinh viên trong hệ thống quản lý, email trong LMS và một định danh khác trong công cụ bên thứ ba. Nếu các định danh này không được ánh xạ chính xác, dữ liệu của một người có thể bị tách thành nhiều hồ sơ hoặc dữ liệu của hai người bị ghép nhầm.
Tiếp theo là chuẩn hóa hoạt động và thời gian. “Hoàn thành bài”, “submit”, “completed” hoặc một sự kiện riêng của từng nền tảng có thể biểu thị những hành động gần giống nhau nhưng không hoàn toàn tương đương. Cần xây dựng từ điển dữ liệu xác định rõ ý nghĩa, đơn vị đo, thời điểm ghi nhận và điều kiện phát sinh của từng trường.
Cuối cùng là giữ ngữ cảnh. Một lần xem video trước bài kiểm tra khác về ý nghĩa với một lần xem lại sau khi đã nhận phản hồi. Ba lượt làm bài trong một hoạt động cho phép luyện tập cũng không nên được hiểu giống ba lượt làm trong một kỳ kiểm tra chính thức.
Các chuẩn tương tác như Caliper được thiết kế chính vì môi trường học tập thường trải rộng trên nhiều ứng dụng và cần một ngôn ngữ chung để gom hoạt động từ nhiều nhà cung cấp vào cùng hệ phân tích.
Chuẩn hóa vì thế không chỉ là xử lý định dạng dữ liệu. Nó là điều kiện để bảo đảm rằng các biến được ghép lại vẫn giữ đúng ý nghĩa giáo dục ban đầu.
Kết hợp bằng chứng bằng đối chiếu thay vì cộng điểm cơ học
Sau khi dữ liệu được chuẩn hóa, bước quan trọng nhất là quyết định cách các nguồn hỗ trợ hoặc phản biện lẫn nhau.
Một cách tiếp cận phù hợp là tam giác hóa bằng chứng: một kết luận quan trọng được kiểm tra qua nhiều nguồn có bản chất khác nhau.
Ví dụ, giả sử người học có điểm kiểm tra thấp. Nhật ký học tập cho thấy họ ít hoàn thành bài luyện tập và thường dừng trước các nội dung liên quan đến chủ đề được kiểm tra. Hai nguồn đang cùng chỉ về một giả thuyết: người học có thể chưa đạt mức luyện tập cần thiết.
Nhưng nếu người học có điểm thấp trong khi hoạt động luyện tập ổn định và các bài tập trước đó có kết quả tốt, dữ liệu lại phát tín hiệu khác. Lúc này cần xem xét độ phù hợp của bài kiểm tra, điều kiện thực hiện hoặc những bằng chứng bổ sung trước khi kết luận rằng người học yếu về năng lực.
Không nên mặc định mọi nguồn có trọng số bằng nhau
Việc lấy điểm kiểm tra, số lần đăng nhập, số bài viết diễn đàn và thời gian xem video rồi chuẩn hóa thành bốn điểm số để tính trung bình có vẻ khách quan, nhưng có thể tạo ra một chỉ số không có ý nghĩa đánh giá rõ ràng.
Trọng số phải phụ thuộc vào mức độ trực tiếp của bằng chứng đối với mục tiêu cần đánh giá.
Nếu mục tiêu là năng lực giải quyết vấn đề, sản phẩm thực hành hoặc rubric chấm năng lực có thể đóng vai trò bằng chứng chính. Hoạt động truy cập, thời gian học hoặc tương tác diễn đàn là bằng chứng hỗ trợ. Nếu mục tiêu chuyển sang mức độ tham gia học tập, vai trò của các nguồn sẽ thay đổi.
Vì vậy không tồn tại một công thức trọng số chung phù hợp cho mọi khóa học.
Khi các nguồn mâu thuẫn, không nên ép chúng thành một kết luận
Dữ liệu mâu thuẫn không nhất thiết là dữ liệu xấu. Nó thường là tín hiệu cần điều tra.
Một người có điểm cao nhưng gần như không để lại dấu vết học tập số có thể đã học qua kênh khác. Một người hoạt động rất nhiều nhưng kết quả vẫn thấp có thể đang nỗ lực nhưng sử dụng chiến lược chưa hiệu quả. Một người làm bài nhanh và đạt điểm cao có thể đã làm chủ kiến thức, nhưng cũng có thể bài đánh giá chưa đủ sức phân hóa.
Giá trị của việc kết hợp nhiều nguồn nằm chính ở khả năng phát hiện những trường hợp mà một nguồn đơn lẻ không giải thích được.
Kiểm tra độ tin cậy, dữ liệu thiếu và thiên lệch
Nhiều dữ liệu hơn không tự động tạo ra đánh giá chính xác hơn. Nếu các nguồn cùng có lỗi hoặc cùng phản ánh một thiên lệch, việc ghép chúng chỉ làm kết luận có vẻ chắc chắn hơn.
Trước khi sử dụng một nguồn dữ liệu cho đánh giá, cần kiểm tra ít nhất bốn vấn đề: dữ liệu có đầy đủ không, chỉ báo có thực sự đại diện cho khái niệm muốn đánh giá không, quá trình thu thập có nhất quán không và có nhóm người học nào bị ghi nhận ít hơn một cách có hệ thống hay không.
Jisc nhấn mạnh rằng learning analytics cần kiểm soát độ chính xác, dữ liệu không đầy đủ, lựa chọn phạm vi nguồn dữ liệu phù hợp và các tương quan giả; thuật toán hoặc chỉ số dùng cho dự đoán và can thiệp cũng cần được hiểu, kiểm định và rà soát.
Đặc biệt, thiếu dữ liệu không nên tự động được hiểu là thiếu tham gia. Không có log xem video có thể có nghĩa người học không xem, nhưng cũng có thể video được truy cập ngoài hệ thống theo dõi hoặc nền tảng không ghi nhận đầy đủ sự kiện.
Một hiểu nhầm khác là xem tương quan như quan hệ nhân quả. Nếu nhóm đạt điểm cao thường truy cập LMS nhiều hơn, chưa thể kết luận rằng tăng số lần đăng nhập sẽ làm điểm tăng. Người học có động lực cao có thể vừa đăng nhập nhiều vừa học tốt vì một nguyên nhân khác.
Do đó, các dashboard hoặc chỉ số tổng hợp nên thể hiện được mức độ chắc chắn và nguồn dữ liệu phía sau thay vì biến một mô hình phức tạp thành nhãn tuyệt đối như “tốt”, “yếu” hay “có nguy cơ”.
Triển khai quy trình kết hợp dữ liệu theo vòng kiểm chứng
Trong thực tế, một quy trình có thể bắt đầu ở quy mô nhỏ thay vì tích hợp ngay mọi hệ thống.
Trước hết, chọn một quyết định đánh giá có giá trị rõ ràng, chẳng hạn xác định người học cần hỗ trợ thêm ở một năng lực. Sau đó xác định một nguồn bằng chứng kết quả và một hoặc hai nguồn giải thích quá trình. Khi đã biết chính xác mỗi nguồn phục vụ kết luận nào, mới tiến hành liên kết và chuẩn hóa.
Một chu trình thực hành có thể gồm:
1. Xác định câu hỏi đánh giá và kết luận cần hỗ trợ
2. Chọn nguồn dữ liệu có quan hệ trực tiếp với câu hỏi
3. Phân biệt bằng chứng kết quả, quá trình và bối cảnh
4. Chuẩn hóa định danh, hoạt động, thời gian và ngữ cảnh
5. Đối chiếu nhiều nguồn và xác định quy tắc diễn giải
6. Kiểm tra dữ liệu thiếu, mâu thuẫn, sai lệch và ngoại lệ
7. Đưa kết quả về cho giảng viên hoặc người học để kiểm chứng trước khi dùng cho quyết định quan trọng
Song song với giá trị phân tích là giới hạn về quyền riêng tư. Ghép nhiều nguồn làm tăng khả năng xây dựng hồ sơ chi tiết về một cá nhân, đồng thời tăng nguy cơ tái nhận dạng ngay cả khi từng tập dữ liệu riêng lẻ đã được xử lý. Jisc lưu ý rằng việc tổng hợp nhiều nguồn có thể tạo nguy cơ tái nhận dạng và quyền truy cập dữ liệu học tập cần được giới hạn theo nhu cầu hợp pháp.
Vì vậy, nên chỉ thu thập dữ liệu cần thiết cho mục tiêu đánh giá đã xác định, phân quyền truy cập, giải thích minh bạch cách dữ liệu được sử dụng và duy trì khả năng kiểm tra lại kết luận. Một hệ thống đánh giá tốt không chỉ tạo được chỉ số; nó còn phải cho phép con người hiểu chỉ số đó hình thành từ bằng chứng nào.
Kết hợp dữ liệu học tập từ nhiều nguồn hiệu quả nhất khi coi mỗi nguồn là một mảnh bằng chứng có chức năng riêng. Kết quả đánh giá cho biết người học đạt được gì, dữ liệu quá trình giúp giải thích họ học như thế nào, còn dữ liệu bối cảnh giúp xác định điều kiện khiến những dấu vết đó có ý nghĩa.
Do đó, mục tiêu không phải hợp nhất càng nhiều trường dữ liệu càng tốt hay tạo một điểm số tổng hợp duy nhất. Giá trị thực sự đến từ việc xác định đúng câu hỏi đánh giá, chuẩn hóa đúng ngữ cảnh, đối chiếu các nguồn độc lập, xử lý mâu thuẫn và kiểm tra giới hạn của từng bằng chứng. Khi thực hiện được các bước này, dữ liệu số có thể hỗ trợ một đánh giá toàn diện hơn mà không biến hành vi có thể đo lường thành sự thay thế máy móc cho năng lực học tập.
