Lỗi KMO nhỏ hơn 0.5 trong SPSS: nguyên nhân và cách xử lý

SPSS··15 phút đọc

Hiện tượng bạn đang gặp

Bạn chạy EFA trong SPSS, mở bảng KMO and Bartlett's Test và thấy dòng Kaiser-Meyer-Olkin Measure of Sampling Adequacy có giá trị nhỏ hơn 0.5. Chẳng hạn, KMO = 0.437. Đây là lỗi KMO nhỏ hơn 0.5 trong SPSS mà nhiều bạn gặp ngay ở vòng EFA đầu tiên.

Ở cùng bảng, Bartlett's Test of Sphericity có thể có Sig. = 0.000, nhưng kết quả đó chưa đủ để kết luận EFA phù hợp. KMO và Bartlett trả lời hai câu hỏi khác nhau. Bartlett xem ma trận tương quan có khác ma trận đơn vị hay không, còn KMO đánh giá mức độ phù hợp chung của các tương quan riêng phần để phân tích nhân tố.

Bạn cũng có thể thấy các biểu hiện đi kèm như lỗi ma trận xoay lộn xộn SPSS, ma trận xoay không hội tụ, một biến tải lên hai nhân tố, hoặc bảng Total Variance Explained có phương sai trích dưới 50%. Đừng vội xóa hàng loạt biến. Trước hết, hãy lưu file và ghi lại KMO, Bartlett, số biến quan sát, cỡ mẫu cùng phương pháp trích đang dùng. Hướng dẫn về EFA trong SPSS sẽ giúp bạn đối chiếu toàn bộ quy trình, còn bài về ma trận xoay tập trung vào bước đọc các nhóm nhân tố sau đó.

Nguyên nhân thường gặp

KMO nhỏ hơn 0.5 không chỉ xuất phát từ một biến xấu. Nó có thể do các biến quan sát không cùng đo một khái niệm, cỡ mẫu quá nhỏ, dữ liệu nhập sai hoặc các câu trả lời có quá ít biến thiên. Bảng dưới đây giúp bạn kiểm tra theo dấu hiệu thay vì thử xóa biến ngẫu nhiên.

Dấu hiệu trong output hoặc dữ liệuNguyên nhân có thể xảy raCách kiểm tra
KMO dưới 0.5, Bartlett có Sig. lớn hơn 0.05Các biến quan sát có tương quan yếu, EFA không phù hợp với tập biến hiện tạiXem Correlation Matrix, kiểm tra tương quan giữa từng cặp biến và rà lại nội dung thang đo
KMO dưới 0.5 nhưng Bartlett có Sig. nhỏ hơn 0.05Có tương quan tổng thể nhưng tương quan riêng phần vẫn chưa phù hợpXem Anti-image Matrices, tập trung vào đường chéo Anti-image Correlation
Một biến có diagonal anti-image thấpBiến đó ít chia sẻ phương sai với các biến còn lạiKiểm tra giá trị MSA trên đường chéo ma trận anti-image
Nhiều biến có tương quan gần 0Biến đo các nội dung khác nhau hoặc dữ liệu bị nhập sai mãKiểm tra bảng mã, thang Likert, biến đảo chiều và Correlation Matrix
Phương sai của một biến bằng 0 hoặc rất thấpNgười trả lời chọn gần như cùng một đáp ánChạy Analyze > Descriptive Statistics > Descriptives, xem minimum, maximum và standard deviation
KMO thay đổi bất thường sau mỗi lần chạyBạn đang xóa biến theo cảm tính hoặc có missing value chưa xử lýSo sánh số biến, số quan sát hợp lệ và syntax của từng vòng chạy
Ma trận xoay không hội tụ hoặc tải nhân tố lộn xộnSố nhân tố đặt trước không phù hợp, biến giao thoa hoặc thang đo yếuXem Communalities, Total Variance ExplainedRotated Component Matrix

Trong SPSS, giá trị MSA trên đường chéo của Anti-image Correlation thường là nơi bạn tìm biến có vấn đề. Tuy nhiên, một MSA thấp không tự động có nghĩa biến đó phải bị loại. Bạn cần xem biến có ý nghĩa lý thuyết hay không, tương quan với các biến khác ra sao, và việc loại biến có làm mất nội dung quan trọng của khái niệm hay không.

Một nguyên nhân rất thực tế là nhập nhầm mã. Ví dụ, thang đo dùng từ 1 đến 5 nhưng một biến được nhập 11 thay vì 1, hoặc biến đảo chiều chưa được recode. Hãy mở Variable View, xem Values, Measure và tên biến. Nếu bảng hỏi có biến phủ định, tạo biến mới bằng Transform > Recode into Different Variables, sau đó dùng biến đã đảo chiều trong EFA.

Cách xử lý theo thứ tự ưu tiên

Hãy xử lý từ nguyên nhân dễ kiểm tra và ít ảnh hưởng nhất đến mô hình. Mỗi vòng chỉ nên thay đổi một nhóm nhỏ biến, lưu một file mới và ghi lại kết quả. Bạn có thể xem thêm communality trong SPSS để hiểu vì sao một biến không chia sẻ đủ phương sai với các biến còn lại.

Kiểm tra lại dữ liệu và mã hóa biến

Trước khi chạy lại, kiểm tra missing value, giá trị ngoài khoảng Likert, biến đảo chiều và các dòng trả lời bất thường. Vào Analyze > Descriptive Statistics > Frequencies, đưa toàn bộ biến quan sát vào ô Variable(s). Nếu thang đo 1 đến 5 mà xuất hiện giá trị 0, 6 hoặc 99, hãy quay lại file gốc để xác định đó là mã thiếu hay lỗi nhập.

Với dữ liệu thiếu, không nên thay toàn bộ ô trống bằng một con số chỉ để SPSS chạy được. Xem số lượng missing của từng biến và cách bạn đã quy định trong phương pháp nghiên cứu. Nếu một respondent bỏ trống quá nhiều biến, cần xem xét loại respondent theo tiêu chí đã định trước. Hãy giữ bản gốc và tạo bản làm sạch riêng.

Xem ma trận tương quan và Anti-image Matrices

Chạy lại theo đường dẫn Analyze > Dimension Reduction > Factor. Đưa các biến quan sát vào Variables, chọn Descriptives, đánh dấu KMO and Bartlett's test of sphericity, Anti-imageCorrelation matrix. Trong Extraction, có thể chọn Scree plot; trong Rotation, chọn phương pháp phù hợp với mô hình của bạn.

Correlation Matrix, tìm những cặp biến có tương quan rất thấp với hầu hết biến còn lại. Ở Anti-image Matrices, nhìn đường chéo của ma trận Anti-image Correlation. Biến có MSA thấp là ứng viên cần xem xét, nhưng bạn vẫn phải đối chiếu với nội dung thang đo và các chỉ số khác.

Kiểm tra Item-Total Statistics trước khi xóa biến

Nếu KMO thấp xuất hiện ở một thang đo riêng, chạy Analyze > Scale > Reliability Analysis. Chọn Model: Alpha, bấm Statistics, đánh dấu Item, ScaleScale if item deleted. Bảng Item-Total Statistics cho bạn Corrected Item-Total CorrelationCronbach's Alpha if Item Deleted.

Corrected Item-Total Correlation từ 0.3 trở lên là một ngưỡng thường được sử dụng, theo (Nunnally và Bernstein, 1994). Alpha từ 0.7 trở lên thường được chấp nhận, còn thang đo khám phá có thể xem xét Alpha từ 0.6 theo (Nunnally, 1978) và (Hair và cộng sự, 2010). Đây là thông tin hỗ trợ quyết định, không phải lệnh tự động xóa biến.

Loại từng biến có lý do và chạy lại EFA

Nếu một biến có MSA thấp, tương quan thấp với các biến cùng khái niệm, corrected item-total correlation thấp và nội dung bị lệch, bạn có cơ sở để loại biến. Hãy xóa một biến trước, chạy lại EFA rồi so sánh KMO. Nếu KMO tăng nhưng ma trận xoay vẫn không hợp lý, dừng việc xóa và kiểm tra lại số nhân tố hoặc cấu trúc thang đo.

Đừng loại một lúc năm biến vì muốn KMO vượt 0.5. Cách đó có thể tạo ra kết quả đẹp nhưng làm thang đo mất nội dung, đặc biệt khi mỗi khái niệm ban đầu chỉ có ba hoặc bốn biến quan sát. Lưu tên file theo vòng, chẳng hạn EFA_v1, EFA_v2_loai_X3, để bạn giải trình được quá trình.

Xem lại phương pháp trích và số nhân tố

Trong Extraction, SPSS thường đặt Principal components theo mặc định. Nếu mục tiêu của bạn là rút gọn dữ liệu, Principal Component Analysis có thể phù hợp. Nếu mục tiêu là tìm các nhân tố tiềm ẩn, bạn cần trao đổi với giảng viên về phương pháp trích phù hợp với thiết kế nghiên cứu.

Không nên đặt số nhân tố chỉ vì muốn bảng Rotated Component Matrix có đúng số nhóm theo giả thuyết. Hãy xem Total Variance Explained, Scree Plot và ý nghĩa lý thuyết. Eigenvalue lớn hơn 1 là quy tắc thường được báo cáo theo (Kaiser, 1960), nhưng quyết định cuối cùng cần nhìn đồng thời vào mô hình và dữ liệu.

Đánh giá lại kết quả sau khi sửa

Sau mỗi vòng, ghi vào một bảng theo dõi gồm số biến, KMO, Bartlett Sig., tổng phương sai trích, số nhân tố và các biến bị loại. Với KMO từ 0.5 trở lên, Bartlett có ý nghĩa, tải nhân tố và cấu trúc nhân tố hợp lý, bạn mới chuyển sang đọc Rotated Component Matrix. Tải nhân tố từ 0.5 trở lên là ngưỡng thường được dùng theo (Hair và cộng sự, 2010).

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột được mô phỏng theo output SPSS để bạn biết cần ghi lại gì.

KMO and Bartlett's Test, số liệu minh họa

Chỉ số trong SPSSEFA vòng 1EFA vòng 2 sau khi loại X3
Kaiser-Meyer-Olkin Measure of Sampling Adequacy0.4370.612
Approx. Chi-Square118.294164.870
df4536
Sig.0.0180.000
Số biến quan sát109

Trong ví dụ minh họa này, việc KMO tăng sau khi loại X3 chỉ cho thấy kết quả của một tập dữ liệu giả định. Bạn không được chép các số này vào luận văn hoặc dự đoán rằng dữ liệu của mình cũng sẽ tăng tương tự. Với dữ liệu của bạn, hãy lấy đúng số từ bảng KMO and Bartlett's Test và lưu output của từng vòng.

Khi nào phải quay lại thu thêm dữ liệu

Nếu đã kiểm tra mã hóa, missing value, biến đảo chiều, tương quan và thang đo mà KMO vẫn dưới 0.5, phần mềm không thể sửa bản chất dữ liệu. Khi cỡ mẫu nhỏ, các tương quan có thể không ổn định. Khi người trả lời chọn cùng một mức cho hầu hết biến, dữ liệu cũng khó tạo ra cấu trúc nhân tố rõ ràng.

Bạn nên trao đổi với giảng viên để xác định có cần thu thêm dữ liệu hay không khi nhiều biến có MSA thấp, Bartlett không có ý nghĩa, hoặc sau khi loại biến thì khái niệm không còn đủ biến quan sát. Quy tắc 5 đến 10 quan sát cho mỗi biến quan sát thường được trích dẫn theo (Hair và cộng sự, 2010), nhưng đây không phải công thức bảo đảm KMO đạt.

Nếu respondent được chọn sai đối tượng nghiên cứu, bảng hỏi có quá nhiều câu trả lời thiếu, hoặc có nhiều mẫu trả lời theo một đường thẳng, thu thêm mẫu đúng đối tượng có thể hợp lý hơn việc tiếp tục chỉnh trong SPSS. Ngược lại, nếu chỉ một biến nhập sai mã, bạn chưa cần thu thêm dữ liệu. Hãy sửa dữ liệu và chạy lại với bản ghi rõ thay đổi.

Cách giải trình với giảng viên hướng dẫn

Khi giảng viên hỏi vì sao KMO ban đầu thấp, hãy đưa cả output trước và sau xử lý, không chỉ đưa bảng cuối cùng. Giải thích biến nào được kiểm tra, căn cứ nào khiến bạn loại hoặc giữ biến, và cấu trúc thang đo sau thay đổi còn phù hợp với mô hình nghiên cứu hay không.

Cách viết vào luận văn: “Kết quả EFA lần đầu cho thấy chỉ số KMO đạt [KMO vòng 1], thấp hơn ngưỡng 0.5. Sau khi kiểm tra ma trận tương quan, MSA, corrected item-total correlation và nội dung của biến [mã biến], nghiên cứu loại [mã biến] vì [lý do cụ thể]. EFA được thực hiện lại, KMO đạt [KMO vòng 2], Bartlett's Test có Sig. = [giá trị Sig.], cho thấy dữ liệu phù hợp hơn với phân tích nhân tố.”

Bạn có thể viết ngắn hơn nếu không loại biến: “KMO của tập biến đạt [giá trị], Bartlett's Test có Sig. = [giá trị]. Do KMO thấp và các biến có tương quan yếu, nghiên cứu không tiếp tục diễn giải cấu trúc nhân tố này, đồng thời báo cáo đây là giới hạn của dữ liệu.” Câu này trung thực hơn việc chọn một vòng chạy đẹp mà không nói cách xử lý.

Cách phòng từ bước thiết kế

Ngay từ bảng hỏi, mỗi khái niệm nên có các biến quan sát bám sát định nghĩa và nguồn thang đo. Tránh đưa nhiều câu hỏi chỉ khác cách diễn đạt nhưng không thật sự đo cùng nội dung. Trước khi thu chính thức, kiểm tra bảng mã, hướng của biến, số mức Likert và cách xử lý câu hỏi đảo chiều.

Khi nhập dữ liệu, đặt tên biến nhất quán như PU1, PU2, PU3, thay vì đặt tên dài có dấu hoặc tên khiến bạn không nhận ra nhóm khái niệm. Tạo một data dictionary gồm tên biến, nội dung, thang đo, giá trị hợp lệ và ghi chú đảo chiều. Việc này giúp bạn phát hiện lỗi trước khi mở EFA.

Bạn cũng nên kiểm tra một phần dữ liệu ngay trong quá trình thu thập, thay vì đợi đến khi đủ mẫu mới mở SPSS. Nếu nhiều respondent bỏ cùng một câu, có thể câu đó khó hiểu hoặc biểu mẫu đang cài sai. Sau khi làm sạch, lưu .sav riêng và giữ file dữ liệu thô để đối chiếu.

Lỗi thường gặp khi sửa

Lỗi phổ biến nhất là xóa biến cho đến khi KMO đạt mà không xem nội dung thang đo. Cách này dễ tạo ra lỗi biến bị loại khi xoay nhân tố, lỗi biến tải lên hai nhân tố SPSS hoặc thang đo chỉ còn một biến. Một nhân tố có chỉ số đẹp nhưng không còn đại diện đầy đủ cho khái niệm sẽ khó giải trình ở chương 3 và chương 4.

Lỗi thứ hai là nhầm KMO với Bartlett. Bartlett có Sig. = 0.000 chỉ cho thấy các biến có tương quan tổng thể đáng kể. Nếu KMO vẫn thấp, bạn cần xử lý tập biến hoặc dữ liệu, không thể dùng Bartlett để bỏ qua KMO.

Lỗi thứ ba là dùng ngưỡng máy móc cho mọi đề tài. KMO từ 0.5 trở lên và Bartlett có ý nghĩa thường được dùng để đánh giá khả năng tiếp tục EFA theo (Kaiser, 1974), nhưng cần báo cáo bối cảnh và toàn bộ chỉ số liên quan. Tổng phương sai trích từ 50% trở lên là tiêu chí thường được tham khảo theo (Hair và cộng sự, 2010), không phải lý do để xóa biến chỉ vì một bảng chưa đạt.

Cuối cùng, đừng đổi từ EFA sang CFA chỉ để tránh KMO. CFA có mục tiêu kiểm định mô hình đo lường đã chỉ định, còn EFA dùng để khám phá cấu trúc. Nếu đề tài của bạn thực sự cần CFA, hãy xem hướng dẫn CFA và trao đổi về mô hình đo lường trước khi chạy.

Câu hỏi thường gặp

KMO nhỏ hơn 0.5 có phải xóa toàn bộ dữ liệu không?

Không. KMO thấp cho thấy tập biến hiện tại chưa phù hợp để tiếp tục EFA, nhưng nguyên nhân có thể là nhập sai mã, biến đảo chiều, missing value, cỡ mẫu hoặc thang đo chưa đồng nhất. Hãy kiểm tra dữ liệu và từng biến trước khi quyết định.

Bartlett có Sig. = 0.000 nhưng KMO vẫn nhỏ hơn 0.5 thì kết luận thế nào?

Bạn chỉ có thể nói Bartlett's Test có ý nghĩa thống kê, còn mức độ phù hợp tổng thể theo KMO chưa đạt ngưỡng thường dùng. Hai kết quả này không thay thế cho nhau. Cần kiểm tra Anti-image Matrices, tương quan và thang đo trước khi chạy lại.

Có nên xóa biến có MSA thấp ngay lập tức không?

Chưa nên. MSA thấp là tín hiệu để xem xét, không phải quyết định tự động. Hãy đối chiếu với corrected item-total correlation, nội dung biến, tải nhân tố và vai trò của biến trong khái niệm. Nếu loại biến, hãy loại từng biến có lý do và lưu output từng vòng.

KMO đạt 0.5 nhưng ma trận xoay vẫn lộn xộn thì sao?

KMO đạt chỉ nói về mức độ phù hợp chung cho EFA. Bạn vẫn phải xem communalities, số nhân tố, factor loading và cross-loading trong Rotated Component Matrix. Có thể cần xem lại số nhân tố, phương pháp xoay hoặc một biến bị giao thoa giữa các khái niệm.

KMO thấp có phải do cỡ mẫu nhỏ không?

Có thể, nhưng không thể kết luận chỉ từ KMO. Cỡ mẫu nhỏ, dữ liệu ít biến thiên và tương quan yếu đều có thể góp phần tạo kết quả thấp. Hãy báo cáo số mẫu hợp lệ, số biến quan sát và cách chọn mẫu, sau đó hỏi giảng viên về khả năng thu thêm dữ liệu.

Bạn hãy mở lại file SPSS, kiểm tra mã hóa và Anti-image Matrices trước, sau đó tạo một bản EFA mới thay vì ghi đè output cũ. Nếu cần chạy phân tích trên chính file .sav hoặc .csv và lưu lại từng vòng xử lý, bạn có thể dùng M4 phân tích dữ liệu của DoThesis.