Phiếu trả lời không hợp lệ: cách nhận diện và làm sạch dữ liệu khảo sát

Khảo sát··17 phút đọc

Phiếu trả lời không hợp lệ là gì trong nghiên cứu định lượng

Bạn có thể mở file Excel và thấy đủ 300 dòng trả lời, nhưng con số đó chưa chắc là cỡ mẫu được phép dùng để chạy SPSS. Một số người trả lời bỏ dở bảng hỏi, chọn cùng một phương án cho gần như mọi biến quan sát, hoàn thành trong thời gian quá ngắn hoặc trả lời mâu thuẫn với câu hỏi sàng lọc. Những bản ghi như vậy được xem là phiếu trả lời không hợp lệ nếu chúng không còn cung cấp dữ liệu đáng tin cậy cho mục tiêu nghiên cứu.

Phiếu không hợp lệ cần được phát hiện trước khi tính Cronbach's Alpha, chạy EFA, hồi quy hoặc SmartPLS. Nếu giữ lại quá nhiều bản ghi có chất lượng thấp, kết quả có thể bị lệch, chẳng hạn độ lệch chuẩn rất nhỏ, tương quan bất thường hoặc mô hình có hệ số tải không ổn định. Ngược lại, nếu loại phiếu theo cảm tính chỉ vì một vài câu trả lời khác với kỳ vọng, bạn có thể làm giảm tính đại diện của mẫu.

Bạn nên đặt tiêu chí loại trước khi xem kết quả kiểm định chính. Tiêu chí phải dựa trên câu trả lời thực tế, thời gian hoàn thành, câu hỏi kiểm tra và logic của bảng hỏi. Cách tiếp cận này phù hợp với nguyên tắc minh bạch trong đạo đức nghiên cứu, vì mỗi bản ghi bị loại đều cần có lý do có thể giải trình.

Cách xác định phiếu trả lời không hợp lệ

Không có một con số duy nhất áp dụng cho mọi bảng hỏi. Bạn cần kết hợp nhiều dấu hiệu thay vì loại phiếu chỉ vì một câu trả lời khác biệt. Một người có thể thực sự có quan điểm cực đoan, nên câu trả lời cực đoan tự nó chưa đủ để kết luận phiếu đó không hợp lệ.

Trước hết, hãy tạo một bảng theo dõi riêng với mã phiếu, lý do kiểm tra, quyết định giữ hoặc loại, và ghi chú. Không xóa dòng ngay trong file gốc. Bạn nên lưu một bản dữ liệu thô bất biến, sau đó tạo bản sao để làm sạch. Cách này giúp bạn khôi phục dữ liệu nếu giảng viên hỏi vì sao cỡ mẫu giảm.

Dấu hiệu kiểm traCách xác địnhQuyết định gợi ýNguồn hoặc căn cứ
Bỏ trống quá nhiều biến quan sátĐếm ô trống trên từng dòng, đối chiếu tỷ lệ thiếu đã đặt trướcLoại nếu phiếu không đủ thông tin để tính thang đoQuy tắc xử lý dữ liệu đã nêu trong đề cương nghiên cứu
Chọn cùng một phương án liên tụcKiểm tra chuỗi giá trị giống nhau trên các nhóm LikertĐánh dấu để kiểm tra thêm thời gian và câu hỏi đảo chiềuDấu hiệu chất lượng dữ liệu, cần kết hợp với bối cảnh
Thời gian hoàn thành quá ngắnSo sánh với thời gian thử nghiệm bảng hỏi và phân phối thời gian thực tếKiểm tra thủ công, không loại chỉ dựa vào một ngưỡng tùy ýTiêu chí được xác định từ pilot và nhật ký thu thập
Sai câu hỏi sàng lọcNgười trả lời không thuộc đối tượng nghiên cứuLoại phiếuĐiều kiện chọn mẫu trong phương pháp nghiên cứu
Mâu thuẫn logicTrả lời “chưa từng sử dụng” nhưng lại đánh giá nhiều thuộc tính sau sử dụngLoại nếu mâu thuẫn không thể giải thíchLogic thiết kế bảng hỏi
Trùng bản ghiCùng mã, email, số điện thoại hoặc mẫu trả lời trùng hoàn toànGiữ bản ghi phù hợp hơn, ghi rõ lý doQuy tắc kiểm soát trùng lặp của nghiên cứu

Cột cuối trong bảng là căn cứ để bạn ghi lại nguồn hoặc quy tắc đã dùng. Với các ngưỡng thống kê như số biến quan sát tối thiểu trên mỗi phiếu, không nên trộn lẫn tiêu chí làm sạch với tiêu chí kiểm định. Chẳng hạn, quy tắc 5 đến 10 quan sát cho mỗi biến quan sát được dùng để tham khảo cỡ mẫu, không phải bằng chứng tự động cho thấy một phiếu riêng lẻ là hợp lệ hay không (Hair và cộng sự, 2010).

Nếu bạn có 25 biến quan sát và thu được 250 phiếu, tỷ lệ mẫu trên biến là 10:1. Con số này giúp đánh giá quy mô mẫu tổng thể, còn quyết định giữ từng phiếu vẫn phải dựa trên mức độ hoàn chỉnh và tính nhất quán của bản ghi. Với hồi quy, công thức tham khảo thường được nêu là n từ 50 + 8m trở lên, trong đó m là số biến độc lập (Tabachnick và Fidell, 2013). Đây cũng là tiêu chí về cỡ mẫu, không phải giấy phép giữ các phiếu trả lời rõ ràng kém chất lượng.

Thiết kế bảng hỏi phục vụ mục tiêu này

Việc lọc phiếu bắt đầu từ lúc thiết kế phiếu khảo sát online, không phải đến khi bạn mở SPSS. Một bảng hỏi có hướng dẫn rõ, câu hỏi sàng lọc hợp lý và cấu trúc ngắn gọn sẽ giảm số bản trả lời phải loại.

Ở đầu bảng hỏi, hãy nêu đối tượng được mời trả lời, mục đích nghiên cứu, thời gian dự kiến và điều kiện tham gia. Ví dụ, nếu nghiên cứu hành vi mua sắm trên sàn thương mại điện tử, câu hỏi sàng lọc có thể hỏi người trả lời đã mua hàng trên sàn trong khoảng thời gian nghiên cứu hay chưa. Người không đáp ứng điều kiện nên được kết thúc bảng hỏi bằng nhánh logic, thay vì tiếp tục tạo ra một phiếu đầy đủ nhưng sai đối tượng.

Các biến nhân khẩu học nên đặt ở cuối hoặc vị trí phù hợp với mạch câu hỏi. Với nhóm thang đo, dùng cùng một hướng diễn giải cho các mức Likert. Thang Likert có thể có 5 hoặc 7 mức, nhưng bạn phải ghi rõ ý nghĩa từ mức thấp đến mức cao. Khái niệm thang đo thái độ bắt nguồn từ kỹ thuật đo của Likert (Likert, 1932).

Nếu có biến quan sát đảo chiều, hãy đánh dấu riêng trong codebook. Chẳng hạn, các biến X1, X2, X3 đo mức đồng ý với dịch vụ, trong khi X4 diễn đạt theo hướng tiêu cực. Người trả lời chọn cùng một mức cho toàn bộ nhóm có thể là người làm nhanh, nhưng cũng có thể đang thể hiện một quan điểm nhất quán. Chỉ khi kết hợp thêm câu đảo chiều, thời gian và câu kiểm tra chú ý, bạn mới có cơ sở mạnh hơn để xem xét loại.

Một biểu mẫu khảo sát nên có mã biến rõ ràng ngay từ đầu. Dùng X1, X2, X3 hoặc PU1, PU2, PU3 thay vì đặt tên dài có dấu cách. Tên biến ngắn giúp bạn kiểm tra dữ liệu, viết syntax và đọc output dễ hơn. Nội dung tiếng Việt của biến vẫn có thể giữ trong bảng mã hóa riêng.

Triển khai thu dữ liệu

Trước khi phát rộng, hãy thử bảng hỏi với một nhóm nhỏ để đo thời gian hoàn thành, phát hiện câu khó hiểu và kiểm tra các nhánh logic. Bạn ghi lại thời gian thấp nhất, trung vị và các trường hợp bỏ dở. Những thông tin này hữu ích hơn một ngưỡng thời gian lấy từ một bảng hỏi khác, vì độ dài và độ khó của mỗi công cụ khác nhau.

Khi triển khai chính thức, bạn cần kiểm soát nguồn phát phiếu. Hãy ghi nhận kênh thu thập, khoảng thời gian, nhóm đối tượng và số lượng phản hồi theo từng kênh. Nếu một nhóm trả lời có tỷ lệ phiếu không hợp lệ cao bất thường, hãy kiểm tra lại lời mời, đường dẫn và cách người thu thập hướng dẫn đối tượng.

DoThesis có form khảo sát tại fillform.info, công cụ của chúng tôi dành cho việc tạo biểu mẫu và thu câu trả lời tiếng Việt. Bạn cũng có thể dùng Google Forms nếu phù hợp với quy trình của đề tài. Dù dùng công cụ nào, hãy xuất dữ liệu gốc trước khi chỉnh sửa và giữ lại thông tin thời gian, mã phản hồi hoặc các trường kiểm tra mà bảng hỏi cung cấp.

Không nên tự điền thêm câu trả lời để đủ cỡ mẫu. Cũng không nên nhờ cùng một người trả lời nhiều lần rồi giữ bản ghi có kết quả thuận lợi hơn. Những hành động này làm yếu tính trung thực của dữ liệu và rất khó giải trình khi hội đồng hỏi về nguồn mẫu. Nếu có ưu đãi cho người tham gia, hãy mô tả điều kiện áp dụng trong phần phương pháp.

Làm sạch dữ liệu trước khi nhập SPSS

Bạn có thể làm sạch trong Excel, Google Sheets hoặc ngay trong SPSS. Quy trình nên đi từ lỗi hiển nhiên đến dấu hiệu cần phán đoán, theo thứ tự sau.

Giữ nguyên file dữ liệu thô

Đổi tên file gốc thành dạng có ngày xuất, chẳng hạn khaosat_raw_2026-09-08.xlsx. Tạo bản sao khaosat_clean_v01.xlsx để xử lý. Trong sheet codebook, ghi tên biến, nhãn biến, loại thang đo, giá trị mã hóa và trạng thái biến. Không đặt mã thiếu dữ liệu tùy tiện như 99 nếu 99 có thể bị hiểu là một mức trả lời hợp lệ.

Kiểm tra phiếu bỏ dở và câu hỏi sàng lọc

Lọc các dòng có nhiều ô trống ở nhóm biến chính. Một phiếu bỏ dở ngay trước phần thang đo thường không thể dùng để kiểm định độ tin cậy. Với phiếu thiếu một ô, bạn cần xem kế hoạch xử lý missing data và tỷ lệ thiếu của biến đó. Đừng tự động thay mọi ô trống bằng giá trị trung bình khi chưa thống nhất cách làm.

Kiểm tra các câu sàng lọc trước khi xem điểm thang đo. Nếu điều kiện tham gia là đã sử dụng dịch vụ trong 6 tháng qua nhưng người trả lời chọn “chưa từng”, hãy ghi nhận phiếu không đạt điều kiện. Đây là lý do loại dựa trên thiết kế mẫu, thường dễ giải thích hơn việc loại vì Cronbach's Alpha tăng.

Kiểm tra straight-lining và thời gian

Straight-lining là hiện tượng chọn cùng một phương án cho một chuỗi biến quan sát. Bạn có thể tạo cột đếm số giá trị khác nhau trong nhóm Likert. Nếu nhóm có 8 biến mà chỉ xuất hiện một giá trị duy nhất, hãy đánh dấu. Sau đó xem câu đảo chiều, câu kiểm tra chú ý, thời gian hoàn thành và phần trả lời mở nếu có.

Thời gian quá ngắn là tín hiệu cần xem xét, nhưng không nên biến thành quy tắc máy móc. Một người quen với chủ đề có thể trả lời nhanh. Hãy so sánh với thời gian pilot và phân phối toàn bộ mẫu, sau đó ghi rõ cách chọn ngưỡng trong nhật ký làm sạch.

Kiểm tra trùng lặp và giá trị ngoài phạm vi

Dùng chức năng Remove Duplicates trong Excel hoặc kiểm tra mã phản hồi trong SPSS. Với biến Likert 1 đến 5, các giá trị 0, 6, 99 hoặc ký tự cần được rà soát. Bạn có thể dùng Analyze > Descriptive Statistics > Frequencies để xem tần số từng mã trước khi chạy kiểm định.

Sau khi loại phiếu, xuất một bảng gồm mã phiếu, lý do loại và người thực hiện kiểm tra. Tệp phân tích chỉ giữ các biến cần thiết cho nghiên cứu. Các cột email, số điện thoại hoặc thông tin định danh nên được tách khỏi tệp chạy SPSS nếu không cần cho phân tích, nhằm giảm rủi ro lộ dữ liệu cá nhân.

Kiểm tra lại sau khi làm sạch

Lưu số phiếu ban đầu, số phiếu loại theo từng lý do và số phiếu cuối cùng. Chạy Frequencies để chắc chắn không còn mã ngoài phạm vi, kiểm tra missing value và xem lại thống kê mô tả. Sau đó mới chuyển sang làm sạch dữ liệu ở mức biến và chuẩn bị file .sav hoặc .csv.

Bảng dưới đây là một dạng output minh họa để bạn hình dung cách theo dõi. Các con số chỉ phục vụ minh họa, không phải kết quả của một nghiên cứu cụ thể.

Chỉ số theo dõisố liệu minh họaCách diễn giải
Số phiếu thu ban đầu312Tổng số bản ghi xuất từ công cụ khảo sát
Phiếu bỏ dở phần thang đo18Loại vì thiếu phần dữ liệu chính
Phiếu sai điều kiện sàng lọc9Loại vì không thuộc đối tượng nghiên cứu
Phiếu trùng bản ghi4Giữ một bản ghi sau khi đối chiếu
Phiếu cần kiểm tra straight-lining13Chưa loại ngay, kiểm tra thêm thời gian và câu đảo chiều
Số phiếu đưa vào phân tích281Cỡ mẫu cuối cùng sau quy tắc đã công bố

Cách trình bày trong chương 3

Trong chương 3, bạn trình bày tiêu chí chọn mẫu, cách phát bảng hỏi, thời gian thu thập và quy trình kiểm tra dữ liệu. Cần phân biệt số phiếu thu được với số phiếu hợp lệ dùng cho phân tích. Nếu có 312 phản hồi nhưng chỉ đưa 281 bản ghi vào SPSS, hai con số phải xuất hiện nhất quán ở phần phương pháp, kết quả mô tả mẫu và phụ lục nếu có.

Bạn nên mô tả tiêu chí trước khi nêu kết quả. Ví dụ, tiêu chí gồm: người trả lời không đạt điều kiện sàng lọc, bỏ trống phần thang đo chính, bản ghi trùng và câu trả lời ngoài phạm vi mã hóa. Với straight-lining, hãy nói rõ bạn dùng nó như dấu hiệu kiểm tra kết hợp, thay vì khẳng định mọi chuỗi trả lời giống nhau đều là gian lận.

Cách viết vào luận văn

“Sau khi thu được [N0] phiếu trả lời, nhóm nghiên cứu kiểm tra điều kiện sàng lọc, mức độ hoàn chỉnh, bản ghi trùng lặp và giá trị ngoài phạm vi. Có [N1] phiếu bị loại do [lý do 1], [N2] phiếu bị loại do [lý do 2], còn [N] phiếu hợp lệ được sử dụng cho các phân tích tiếp theo. Các tiêu chí loại phiếu được xác định trước khi thực hiện kiểm định giả thuyết.”

Bạn thay các placeholder bằng số thực tế trong file theo dõi. Nếu đã loại phiếu sau khi xem Cronbach's Alpha hoặc EFA, cần mô tả rõ lý do và tránh viết như thể tiêu chí đó đã được đặt từ đầu. Việc xóa phiếu chỉ để làm đẹp Alpha có thể khiến hội đồng hỏi về tính minh bạch của quy trình.

Lỗi thường gặp

Đặt ngưỡng thời gian tùy ý

Một số bạn loại tất cả phiếu dưới 3 phút mà không có pilot hoặc nhật ký thời gian. Cách này dễ bị hỏi ngược: bảng hỏi có bao nhiêu câu, mức độ phức tạp ra sao, và vì sao 3 phút là ranh giới. Hãy dùng dữ liệu thử nghiệm để xây dựng tiêu chí, đồng thời xem xét nhiều dấu hiệu cùng lúc.

Xóa phiếu vì làm Alpha giảm

Cronbach's Alpha dùng để đánh giá độ nhất quán nội tại của thang đo, không phải công cụ phát hiện người trả lời “sai”. Alpha từ 0.7 trở lên thường được xem là chấp nhận được (Nunnally, 1978), còn trong nghiên cứu khám phá có thể tham khảo mức 0.6 (Hair và cộng sự, 2010). Bạn có thể xem Item-Total Statistics, nhưng chỉ loại biến hoặc phiếu khi có cơ sở lý thuyết và dữ liệu rõ ràng.

Gộp dữ liệu thiếu với câu trả lời trung lập

Mã “không trả lời” không nên được nhập thành mức 3 của thang Likert 1 đến 5. Khi đó phần mềm sẽ hiểu người tham gia chọn mức trung lập. Hãy định nghĩa missing value riêng và thống nhất cách xử lý trước khi chạy phân tích.

Chỉ lưu file đã làm sạch

Nếu không có file raw và nhật ký loại phiếu, bạn sẽ khó trả lời khi giảng viên yêu cầu đối chiếu. Tối thiểu cần giữ ba thứ: dữ liệu gốc, dữ liệu phân tích và bảng log quyết định. Tên file có phiên bản giúp tránh việc ghi đè nhầm.

Đọc thêm: đạo đức nghiên cứu, làm sạch dữ liệu, phiếu khảo sát online, biểu mẫu khảo sát, form khảo sát, chủ đề khao sat.

Câu hỏi thường gặp

Phiếu trả lời không hợp lệ có phải là phiếu chọn cùng một đáp án không

Chưa chắc. Chọn cùng một đáp án có thể phản ánh quan điểm thật của người trả lời, đặc biệt khi các phát biểu gần nhau hoặc người đó có đánh giá nhất quán. Bạn chỉ nên xem đây là dấu hiệu cần kiểm tra thêm với thời gian hoàn thành, câu hỏi đảo chiều, câu sàng lọc và mức độ hoàn chỉnh.

Nên loại phiếu trước hay sau khi chạy SPSS

Bạn nên loại các phiếu chắc chắn không đạt điều kiện trước khi chạy SPSS, chẳng hạn phiếu bỏ dở, sai đối tượng hoặc trùng hoàn toàn. Sau đó mới kiểm tra dữ liệu trong SPSS bằng Frequencies, Descriptives và các bảng chẩn đoán phù hợp. Đừng dùng kết quả kiểm định để âm thầm xóa những bản ghi làm kết quả không như mong muốn.

Có cần ghi lại từng phiếu bị loại không

Có. Bạn không nhất thiết phải đưa mã cá nhân của người trả lời vào luận văn, nhưng nên lưu mã nội bộ, lý do loại và phiên bản dữ liệu. Trong luận văn, bạn trình bày số lượng theo từng nhóm lý do. Nếu dữ liệu có thông tin định danh, hãy tách thông tin đó khỏi file phân tích.

Loại nhiều phiếu không hợp lệ làm cỡ mẫu giảm thì phải làm sao

Trước hết, kiểm tra xem tiêu chí loại có được áp dụng nhất quán hay không. Sau đó đối chiếu cỡ mẫu còn lại với mô hình, số biến độc lập và kế hoạch phân tích. Nếu cỡ mẫu không còn đáp ứng kế hoạch, bạn cần báo giảng viên để quyết định thu bổ sung hoặc điều chỉnh phạm vi phân tích, thay vì giữ các phiếu kém chất lượng chỉ để đủ số lượng.

Có thể thay phiếu không hợp lệ bằng cách tự tạo dữ liệu không

Không. Bạn chỉ nên thu thêm câu trả lời từ đúng đối tượng và theo cùng quy trình đã mô tả. Dữ liệu tự tạo làm mất khả năng kiểm chứng và có thể ảnh hưởng toàn bộ kết luận của luận văn. Nếu phải thu bổ sung, hãy ghi lại thời gian, kênh thu và số phiếu mới trong phần phương pháp.

Mở file dữ liệu, tạo ngay một sheet data_cleaning_log và ghi ba cột đầu tiên gồm mã phiếu, dấu hiệu kiểm tra và quyết định giữ hoặc loại. Sau đó đối chiếu số phiếu cuối cùng với cỡ mẫu dự kiến, rồi dùng chủ đề Khảo sát để rà lại phần thiết kế mẫu trước khi chạy phân tích. Nếu cần chạy phân tích trên chính file .sav hoặc .csv của bạn, M4 phân tích của DoThesis có thể hỗ trợ bước này.