Làm sạch dữ liệu trong SPSS: quy trình và cách xử lý lỗi

SPSS··15 phút đọc

Bạn mở file .sav lên, chuẩn bị chạy Cronbach's Alpha hoặc hồi quy, rồi nhận ra có ô trống, mã trả lời sai và vài giá trị nằm ngoài thang Likert. Đó là lúc cần làm sạch dữ liệu trong SPSS. Công việc này là quá trình kiểm tra, sửa hoặc loại những bản ghi và giá trị không hợp lệ trước khi phân tích chính thức.

Một quy trình làm sạch thường đi qua các việc sau: kiểm tra cấu trúc biến, rà mã hóa, tìm dữ liệu thiếu, phát hiện giá trị ngoài phạm vi, kiểm tra bản ghi trùng, xem câu trả lời thiếu nghiêm túc và lưu lại từng quyết định. Bạn nên giữ một bản dữ liệu gốc chưa chỉnh sửa, sau đó làm việc trên bản sao. Nếu thu thập bằng bảng hỏi trực tuyến, hãy đối chiếu file SPSS với dữ liệu sơ cấp ban đầu để biết mỗi dòng tương ứng với một người trả lời.

Ý nghĩa của làm sạch dữ liệu trong nghiên cứu định lượng

Làm sạch dữ liệu quyết định liệu con số trong các bảng phân tích có phản ánh câu trả lời hợp lệ hay chỉ phản ánh lỗi nhập liệu. Một ký tự bị nhập thay cho số, một biến Likert bị mã hóa ngược hoặc một dòng bỏ trống quá nhiều câu đều có thể làm thay đổi Cronbach's Alpha, KMO, hệ số hồi quy và p-value.

Bạn cũng cần phân biệt làm sạch với việc cố tình chỉnh dữ liệu để kết quả đẹp hơn. Làm sạch hợp lệ là sửa lỗi nhập liệu có bằng chứng, loại bản ghi không đáp ứng tiêu chí đã đặt trước hoặc xử lý dữ liệu thiếu theo kế hoạch phương pháp. Bạn không nên xóa một người trả lời chỉ vì dòng đó làm giả thuyết không có ý nghĩa thống kê.

Nếu bạn đang làm đề tài với dữ liệu khảo sát, hãy xác định rõ dữ liệu đến từ bảng hỏi và đối tượng nào. Bài dữ liệu sơ cấp giải thích loại dữ liệu này, còn dữ liệu thứ cấp là gì phù hợp khi bạn dùng báo cáo, cơ sở dữ liệu hoặc tài liệu đã có sẵn.

Sau khi làm sạch, bạn mới chạy các phân tích tiếp theo. Các hướng dẫn và chủ đề liên quan đến phần mềm được tập hợp tại chủ đề SPSS. Nếu cần lặp lại các bước nhiều lần, bạn có thể xem thêm hướng dẫn chạy syntax SPSS để lưu lại lệnh và giảm thao tác thủ công.

Làm sạch dữ liệu trong SPSS bao nhiêu là đạt

Không có một con số duy nhất áp dụng cho mọi bộ dữ liệu. Mức đạt trước hết là mỗi biến có loại dữ liệu đúng, mã hợp lệ, giá trị thiếu được nhận diện và mọi bản ghi bị loại đều có lý do. Một số ngưỡng dưới đây giúp bạn kiểm tra nhất quán, nhưng cần đặt cạnh thiết kế nghiên cứu và hướng dẫn của giảng viên.

Hạng mục kiểm traQuy tắc hoặc ngưỡng tham khảoNguồnCách dùng trong SPSS
Số quan sát trên mỗi biến quan sátKhoảng 5 đến 10 quan sát cho một biến quan sát(Hair và cộng sự, 2010)Đối chiếu cỡ mẫu sau khi loại bản ghi với tổng số biến dùng cho EFA
Corrected Item-Total CorrelationTừ 0.3 trở lên thường được xem là đạt(Nunnally và Bernstein, 1994)Kiểm tra sau khi chạy Reliability Analysis, không dùng ngưỡng này để xóa dữ liệu thô tùy ý
Cronbach's AlphaTừ 0.7 trở lên thường được chấp nhận; thang đo khám phá có thể xem xét từ 0.6(Nunnally, 1978); (Hair và cộng sự, 2010)Đánh giá sau bước làm sạch và kiểm định thang đo
KMOTừ 0.5 trở lên(Kaiser, 1974)Kiểm tra trong bảng KMO and Bartlett's Test trước EFA
Total Variance ExplainedTừ 50% trở lên trong nhiều nghiên cứu định lượng(Hair và cộng sự, 2010)Đọc sau EFA, không dùng để quyết định một dòng dữ liệu có hợp lệ hay không
Factor loadingTừ 0.5 trở lên(Hair và cộng sự, 2010)Đánh giá biến quan sát sau khi dữ liệu đã được làm sạch

Bảng trên chứa các ngưỡng của phân tích thang đo, không phải tiêu chuẩn máy móc để xóa bản ghi. Chẳng hạn, một dòng có câu trả lời hợp lệ vẫn có thể làm Alpha giảm. Bạn cần xem nguyên nhân, thống kê mô tả và tiêu chí loại bản ghi đã đặt trước thay vì xóa dòng đó chỉ để đạt ngưỡng.

Bạn có thể xem thêm chuẩn hóa dữ liệu là gì nếu đề tài cần đưa các biến về cùng thang đo. Chuẩn hóa thường là bước biến đổi dữ liệu phục vụ mô hình, còn làm sạch là kiểm tra tính hợp lệ của dữ liệu trước phân tích. Hai việc này có thể liên quan nhưng không nên gọi thay cho nhau.

Cách đọc dữ liệu đã làm sạch trên output SPSS

SPSS không có một bảng duy nhất tên là “Cleaned Data”. Bạn cần kết hợp Data View, Variable View, Frequencies, Descriptives và Case Summaries. Với biến định lượng, hãy xem giá trị nhỏ nhất, lớn nhất, trung bình và độ lệch chuẩn. Với biến phân loại hoặc biến Likert, hãy xem tần suất từng mã.

Kiểm tra tần suất bằng Frequencies

Vào Analyze > Descriptive Statistics > Frequencies. Đưa các biến giới tính, độ tuổi, trình độ, nhóm thu nhập và các biến Likert cần rà soát vào ô Variables. Chọn Display frequency tables nếu muốn xem từng mã xuất hiện bao nhiêu lần. Trong Statistics, có thể chọn Minimum và Maximum cho biến số.

Kiểm tra giá trị nhỏ nhất và lớn nhất bằng Descriptives

Vào Analyze > Descriptive Statistics > Descriptives. Chọn các biến thang đo, bấm Options, đánh dấu Mean, Std. deviation, Minimum và Maximum. Nếu thang Likert có mã từ 1 đến 5 mà Minimum là 0 hoặc Maximum là 8, bạn cần quay lại dữ liệu gốc để xác minh.

Số liệu minh họa: bảng Frequencies và Descriptives

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột mô phỏng cách SPSS hiển thị để bạn biết cần đọc vị trí nào.

VariableN ValidN MissingMinimumMaximumMeanStd. DeviationDiễn giải minh họa
DV12184153.720.86Mã nằm trong thang 1 đến 5, có 4 giá trị thiếu
DV22220173.651.21Có giá trị 7, cần kiểm tra và xử lý
TUOI2220195827.846.40Khoảng tuổi cần đối chiếu tiêu chí chọn mẫu
GIOITINH2193141.580.52Cần kiểm tra mã 4 có được định nghĩa hay không

Trong ví dụ này, DV2 có Maximum bằng 7 dù bảng hỏi dùng Likert 1 đến 5. Bạn không nên sửa hàng loạt giá trị 7 thành 5 ngay. Hãy kiểm tra bảng hỏi gốc, file xuất từ nền tảng khảo sát và Variable View. Có thể người trả lời chọn sai, cũng có thể mã 7 đã được dùng cho “không biết” hoặc “không áp dụng”.

Trong Variable View, kiểm tra các cột Name, Type, Width, Decimals, Label, Values, Missing và Measure. Với biến Likert, Type thường là Numeric, Values cần có nhãn rõ ràng, Missing cần được khai báo nếu nghiên cứu dùng một mã riêng cho câu không trả lời. Bạn nên đặt tên biến ngắn, nhất quán như DV1, DV2, HL1, HL2, thay vì dùng tên có khoảng trắng hoặc ký tự đặc biệt.

Khi làm sạch dữ liệu trong SPSS không đạt thì xử lý thế nào

Hãy xử lý theo thứ tự từ lỗi chắc chắn đến quyết định cần cân nhắc. Mỗi lần sửa hoặc loại, ghi số dòng, tên biến, lý do, thao tác và số quan sát còn lại. Một file log_lam_sach.xlsx hoặc một sheet riêng trong Excel đủ để bạn giải trình khi giảng viên hỏi.

Sửa lỗi mã hóa có thể xác minh

Nếu bảng hỏi ghi giới tính nam là 1, nữ là 2 nhưng một số dòng có chữ “Nam” trong biến Numeric, hãy đối chiếu dữ liệu gốc. Nếu chỉ là lỗi nhập liệu rõ ràng, sửa theo quy tắc đã định và ghi lại. Nếu không xác minh được câu trả lời thật, để giá trị missing còn an toàn hơn việc đoán.

Xử lý giá trị ngoài phạm vi

Với thang Likert 1 đến 5, giá trị 0, 6 hoặc 7 là dấu hiệu cần kiểm tra. Nếu giá trị ngoài phạm vi do người trả lời chọn mã “không áp dụng”, bạn có thể khai báo mã đó là missing tùy thiết kế bảng hỏi. Nếu là lỗi nhập, sửa theo dữ liệu gốc. Nếu là câu trả lời không thể xác minh, không tự chuyển nó về giá trị trung bình.

Kiểm tra và xử lý dữ liệu thiếu

Trước tiên, xem tỷ lệ thiếu theo từng biến và từng dòng. Một người bỏ trống một câu có thể được xử lý khác với người bỏ trống gần như toàn bộ bảng hỏi. Với missing ít và rải rác, nghiên cứu có thể dùng cách loại theo phân tích hoặc thay thế theo quy tắc đã nêu trong phương pháp. Nếu một bản ghi thiếu quá nhiều thông tin cốt lõi, loại bản ghi có thể dễ giải trình hơn, nhưng bạn phải nêu tiêu chí trước hoặc giải thích rõ sau khi kiểm tra.

Trong SPSS, bạn có thể dùng Analyze > Missing Value Analysis nếu phiên bản có chức năng này, hoặc dùng Frequencies để đếm giá trị thiếu. Đừng nhầm ô trống với mã 99, 999 hoặc -1. SPSS chỉ xử lý chúng là missing khi bạn khai báo hoặc dùng quy tắc phù hợp.

Phát hiện câu trả lời thiếu nghiêm túc

Một số dấu hiệu gồm chọn cùng một mã cho mọi biến, thời gian hoàn thành bất thường nếu nền tảng khảo sát có ghi nhận, mẫu trả lời lặp lại và nội dung mâu thuẫn rõ ràng. Một dấu hiệu riêng lẻ chưa đủ để loại. Bạn nên kết hợp nhiều tiêu chí đã nêu trong kế hoạch làm sạch, rồi lưu danh sách các dòng bị loại.

Kiểm tra outlier sau khi xác định biến phân tích

Outlier là giá trị cách biệt so với phần lớn quan sát. Bạn có thể bắt đầu bằng Analyze > Descriptive Statistics > Explore, đưa biến vào Dependent List và chọn biểu đồ Boxplot. Outlier cần được xem cùng bối cảnh, đơn vị đo và dữ liệu gốc. Một người có thu nhập cao có thể là quan sát hợp lệ, không phải lỗi chỉ vì nằm xa trung tâm dữ liệu.

Không xóa biến chỉ vì một lần chạy chưa đẹp

Nếu Cronbach's Alpha thấp hoặc EFA có tải chéo, đó là vấn đề của thang đo và mô hình cần xem xét ở bước kiểm định. Bạn có thể đọc thêm về lỗi với biến định tính trong biến định tính chạy hồi quy phải làm sao, nhưng không dùng việc làm sạch để biến một kết quả không phù hợp thành kết quả đạt.

Phân biệt làm sạch dữ liệu với chuẩn hóa và xử lý thang đo

Làm sạch dữ liệu trả lời câu hỏi: “Giá trị này có hợp lệ và đúng định dạng không”. Chuẩn hóa trả lời câu hỏi: “Có cần biến đổi thang đo để các biến được so sánh hoặc đưa vào mô hình không”. Kiểm định thang đo trả lời câu hỏi: “Các biến quan sát có đo cùng khái niệm đủ ổn định không”.

Ví dụ, DV1 bằng 7 trong thang 1 đến 5 là vấn đề dữ liệu cần kiểm tra. Sau khi quyết định DV1 hợp lệ và nằm trong phạm vi, bạn mới chạy Cronbach's Alpha. Nếu Alpha thấp, bạn xem Reliability Statistics và Item-Total Statistics, chứ không quay lại sửa điểm của người trả lời.

Bạn cũng cần phân biệt dữ liệu thiếu với giá trị bằng 0. Trong một số biến như số lần mua, 0 là câu trả lời hợp lệ. Trong thang Likert, 0 thường nằm ngoài thiết kế. Ý nghĩa phụ thuộc vào bảng mã và câu hỏi, không phụ thuộc riêng vào việc SPSS hiển thị con số đó.

Lỗi thường gặp khi làm sạch dữ liệu trong SPSS

Lỗi đầu tiên là sửa trực tiếp trên file gốc. Hãy lưu file ban đầu với tên riêng, đặt một bản sao làm việc và dùng ngày tháng trong tên file, chẳng hạn khaosat_raw.sav, khaosat_clean_v01.sav. Cách này giúp bạn quay lại khi phát hiện một quyết định trước đó chưa phù hợp.

Lỗi thứ hai là xóa toàn bộ dòng có một ô trống. Cách này có thể làm giảm cỡ mẫu không cần thiết. Hãy xem missing ở biến nào, tỷ lệ bao nhiêu và phân tích nào cần biến đó.

Lỗi thứ ba là gộp mã ngay khi chưa kiểm tra nhãn. Nếu mã 1 là “nam” và mã 2 là “nữ”, bạn không được xem đây là biến liên tục để tính trung bình có ý nghĩa. Với biến phân loại, cần dùng mã và cách trình bày phù hợp.

Lỗi thứ tư là loại outlier chỉ vì muốn hồi quy có p-value nhỏ hơn. Đây là quyết định khó bảo vệ. Bạn chỉ nên loại khi có lý do về sai đơn vị, nhập sai, không thuộc đối tượng nghiên cứu hoặc vi phạm tiêu chí đã công bố.

Lỗi thứ năm là không ghi lại số lượng trước và sau làm sạch. Trong chương phương pháp, bạn nên nêu số phiếu thu được, số phiếu loại và nguyên nhân chính. Các con số phải khớp với file dữ liệu cuối cùng.

Câu hỏi thường gặp

Có cần làm sạch dữ liệu trước khi chạy Cronbach's Alpha không?

Có. Trước khi chạy, bạn nên kiểm tra kiểu biến, mã ngoài phạm vi, giá trị thiếu và bản ghi rõ ràng không hợp lệ. Cronbach's Alpha không thay thế cho bước kiểm tra dữ liệu thô.

Có nên xóa các dòng có dữ liệu thiếu không?

Chỉ xóa khi tiêu chí loại đã hợp lý và có thể giải thích. Một dòng thiếu một biến không tương đương với một dòng bỏ trống phần lớn bảng hỏi. Bạn cần xem ảnh hưởng đến cỡ mẫu và cách SPSS xử lý missing trong phân tích tiếp theo.

Giá trị Likert bằng 0 có phải luôn là lỗi không?

Không luôn luôn. Nếu bảng hỏi dùng thang 0 đến 5 thì 0 có thể hợp lệ. Nếu thang được thiết kế từ 1 đến 5, 0 là dấu hiệu cần đối chiếu bảng mã và dữ liệu gốc trước khi sửa hoặc khai báo missing.

Có thể dùng Replace Missing Values để điền dữ liệu thiếu không?

SPSS có chức năng thay thế giá trị thiếu, nhưng bạn không nên dùng tự động cho mọi biến. Cách thay thế phải phù hợp với thiết kế, tỷ lệ thiếu và loại biến. Hãy ghi rõ biến nào được xử lý, phương pháp nào được dùng và lý do chọn phương pháp đó.

Làm sạch dữ liệu có làm thay đổi kết quả hồi quy không?

Có thể. Khi bản ghi lỗi, mã sai hoặc giá trị ngoài phạm vi được xử lý, cỡ mẫu và phân phối biến có thể thay đổi. Vì vậy, bạn cần lưu phiên bản trước và sau làm sạch, đồng thời ghi lại các quyết định thay đổi dữ liệu.

Cách viết vào luận văn: “Sau khi thu thập [N] phiếu, nghiên cứu kiểm tra dữ liệu bằng SPSS dựa trên các tiêu chí [giá trị thiếu, mã ngoài phạm vi, bản ghi trùng và tiêu chí chất lượng]. Có [N1] phiếu bị loại do [lý do], còn [N2] phiếu hợp lệ được sử dụng cho phân tích tiếp theo. Các biến được kiểm tra phạm vi mã từ [min] đến [max] theo thiết kế bảng hỏi.” Bạn thay các phần trong ngoặc vuông bằng số liệu thật trong file của mình, rồi đối chiếu lại với bảng dữ liệu gốc.

Hãy mở bản sao .sav, chạy Frequencies cho các biến phân loại và Likert, chạy Descriptives cho biến số, lập một bảng ghi quyết định xử lý, sau đó lưu phiên bản dữ liệu cuối cùng trước khi chạy Cronbach's Alpha hoặc EFA. Nếu muốn kiểm tra cả quy trình phân tích trên chính file .sav hoặc .csv của mình, bạn có thể dùng module M4 phân tích của DoThesis.