Exploratory Factor Analysis là gì? Cách đọc EFA trên SPSS

Thống kê··14 phút đọc

Exploratory Factor Analysis là gì

Exploratory Factor Analysis, viết tắt là EFA, là phân tích nhân tố khám phá dùng để kiểm tra các biến quan sát trong bảng hỏi đang gom thành những nhóm nhân tố nào. Bạn dùng EFA khi mô hình đo lường có nhiều biến quan sát và muốn xem cấu trúc thực tế của dữ liệu có phù hợp với các khái niệm dự kiến hay không.

Ví dụ, bạn có 20 biến quan sát đo chất lượng dịch vụ, sự tin cậy, sự thuận tiện và ý định tiếp tục sử dụng. EFA xem các biến nào cùng biến thiên với nhau, biến nào tải mạnh vào cùng một nhân tố, biến nào tải đồng thời lên nhiều nhân tố hoặc không đại diện rõ cho nhóm nào.

EFA không kiểm định trực tiếp giả thuyết kiểu “chất lượng dịch vụ tác động đến ý định mua”. Nó xử lý phần thang đo trước, giúp bạn xác định cấu trúc nhân tố để dùng tiếp trong Cronbach's Alpha, hồi quy hoặc mô hình PLS-SEM. Trong cách chạy phổ biến trên SPSS, EFA dựa trên ma trận tương quan giữa các biến quan sát, phương pháp trích nhân tố và phép xoay nhân tố.

Bạn nên đặt EFA trong quy trình sau khi kiểm tra dữ liệu và độ tin cậy sơ bộ, nhưng trước khi tạo biến đại diện để chạy hồi quy. Nếu đang xem toàn bộ chủ đề về thống kê, bạn có thể mở chuyên mục Thống kê để đối chiếu EFA với các bước phân tích khác.

Ý nghĩa của Exploratory Factor Analysis trong nghiên cứu định lượng

EFA trả lời ba câu hỏi thực tế. Thứ nhất, các biến quan sát có đủ liên hệ để phân tích nhân tố hay không. Thứ hai, dữ liệu hình thành bao nhiêu nhân tố. Thứ ba, mỗi biến quan sát thuộc về nhân tố nào và có cần loại khỏi thang đo hay không.

Kết quả EFA thường được dùng để đánh giá sơ bộ giá trị hội tụ và giá trị phân biệt của thang đo. Giá trị hội tụ thể hiện các biến được dự kiến đo cùng một khái niệm có xu hướng nằm cùng nhân tố. Giá trị phân biệt thể hiện các nhóm biến của những khái niệm khác nhau không bị trộn lẫn quá nhiều.

EFA cũng giúp phát hiện vấn đề của bảng hỏi. Một biến có thể được dịch chưa rõ, người trả lời hiểu theo nghĩa khác, hoặc hai khái niệm trong bối cảnh nghiên cứu của bạn quá gần nhau. Khi đó, bảng Rotated Component Matrix sẽ cho thấy biến tải lên nhiều nhân tố hoặc không đạt mức tải cần thiết.

Bạn cần phân biệt EFA với việc chỉ nhìn vào Cronbach's Alpha. Cronbach's Alpha kiểm tra mức nhất quán nội tại của một nhóm biến đã được xác định. EFA khám phá cấu trúc giữa nhiều biến và nhiều nhân tố. Hai bước bổ sung cho nhau, không thay thế cho nhau. Khái niệm scale là gì cũng liên quan trực tiếp đến việc xác định biến quan sát trước khi chạy EFA.

Exploratory Factor Analysis bao nhiêu là đạt

Không có một con số duy nhất quyết định EFA đạt hay không. Bạn cần đọc đồng thời KMO, Bartlett's Test, số nhân tố trích, Total Variance Explained và factor loading. Các ngưỡng dưới đây là mốc tham khảo thường dùng trong nghiên cứu định lượng, còn quyết định cuối cùng phải dựa vào mô hình lý thuyết, cỡ mẫu và cách đo lường.

Chỉ số hoặc tiêu chíMốc thường dùngCách hiểuNguồn
KMOTừ 0.5 trở lênDữ liệu có mức phù hợp tối thiểu để phân tích nhân tố(Kaiser, 1974)
Bartlett's Test of SphericitySig. dưới 0.05Ma trận tương quan giữa các biến khác ma trận đơn vị(Kaiser, 1974)
EigenvalueTrên 1Nhân tố được giữ lại theo quy tắc phổ biến(Kaiser, 1960)
Total Variance ExplainedTừ 50% trở lênCác nhân tố giữ lại giải thích phần đáng kể phương sai(Hair và cộng sự, 2010)
Factor loadingTừ 0.5 trở lênBiến quan sát có mức liên hệ đủ với nhân tố(Hair và cộng sự, 2010)
Corrected Item-Total CorrelationTừ 0.3 trở lênBiến có tương quan phù hợp với tổng thang đo khi kiểm tra độ tin cậy(Nunnally và Bernstein, 1994)

KMO càng gần 1 càng cho thấy dữ liệu phù hợp hơn, nhưng bạn không nên chỉ báo cáo KMO mà bỏ qua Bartlett's Test. Nếu Bartlett's Test có Sig. dưới 0.05, các biến có tương quan đủ để tiếp tục xem xét EFA. Quy tắc eigenvalue trên 1 là điểm bắt đầu để xác định số nhân tố, không phải bằng chứng duy nhất về số nhân tố đúng.

Factor loading từ 0.5 trở lên thường được xem là đạt theo mốc của (Hair và cộng sự, 2010). Một số tài liệu cũ dùng các mức diễn giải khác nhau tùy cỡ mẫu, vì vậy bạn cần thống nhất một tiêu chí trước khi loại biến. Đừng chọn ngưỡng có lợi nhất sau khi đã xem kết quả.

Cách đọc Exploratory Factor Analysis trên output

Trong SPSS, bạn vào Analyze > Dimension Reduction > Factor. Đưa các biến quan sát vào ô Variables, chọn Descriptives để đánh dấu KMO and Bartlett's test, chọn Extraction để xem Scree plot và phương pháp trích, sau đó chọn Rotation, thường là Varimax khi các nhân tố được giả định độc lập. Nếu các nhân tố có thể tương quan, bạn cần cân nhắc phép xoay xiên như Promax thay vì mặc định máy móc dùng Varimax.

Bảng đầu tiên cần xem là KMO and Bartlett's Test. KMO cho biết mức phù hợp của mẫu đối với EFA. Dòng Bartlett's Test of Sphericity có cột Approx. Chi-Square, dfSig.. Bạn quan tâm nhất đến KMO và Sig.

Tiếp theo là Total Variance Explained. Bảng này có các cột Total, % of VarianceCumulative %. Phần Initial Eigenvalues cho biết eigenvalue ban đầu. Phần Extraction Sums of Squared LoadingsRotation Sums of Squared Loadings cho biết phương sai được giải thích trước và sau khi xoay. Số nhân tố giữ lại thường được nhìn ở các dòng có eigenvalue lớn hơn 1, đồng thời kiểm tra thêm biểu đồ Scree Plot và lý thuyết.

Bảng quan trọng nhất để quyết định giữ hay loại biến là Rotated Component Matrix. Mỗi dòng là một biến quan sát, mỗi cột là một nhân tố. Bạn tìm factor loading lớn nhất trong từng dòng, xem loading có đạt ngưỡng không, rồi kiểm tra chênh lệch giữa loading lớn nhất và loading kế tiếp. Nếu một biến tải cao trên hai nhân tố, đó là cross-loading và cần được giải thích trước khi xử lý.

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột được trình bày theo dạng output SPSS để bạn biết cần nhìn vào đâu.

Kết quả SPSSChỉ số hoặc biếnGiá trị minh họaCách đọc
KMO and Bartlett's TestKaiser-Meyer-Olkin Measure of Sampling Adequacy0.812Vượt mốc 0.5, dữ liệu phù hợp ở mức tham khảo
KMO and Bartlett's TestBartlett's Test, Sig.0.000Có ý nghĩa thống kê, có thể xem xét EFA
Total Variance ExplainedComponent 1, Eigenvalue4.286Lớn hơn 1, được giữ theo quy tắc này
Total Variance ExplainedCumulative % sau xoay61.438Ba nhân tố giải thích 61.438% phương sai minh họa
Rotated Component MatrixTC1 trên Component 10.784Factor loading vượt 0.5
Rotated Component MatrixTC4 trên Component 1 và 20.536 và 0.512Có cross-loading, cần xem xét nội dung và tiêu chí loại

Với bảng minh họa này, bạn chưa thể kết luận chỉ vì KMO bằng 0.812. Cần xem toàn bộ các dòng trong Rotated Component Matrix, xác định mỗi nhóm nhân tố có đủ biến quan sát, sau đó đặt tên nhân tố dựa trên nội dung lý thuyết của các biến. Tên nhân tố không nên đặt chỉ vì SPSS đánh số Component 1, Component 2.

Khi Exploratory Factor Analysis không đạt thì xử lý thế nào

Nếu KMO dưới 0.5, trước tiên kiểm tra dữ liệu nhập, biến bị bỏ trống, mã hóa ngược và các biến có phương sai bằng 0. Bạn cũng nên kiểm tra các giá trị bất thường và câu trả lời không hợp lệ. Việc rà soát outliers có thể cần thiết nếu một số quan sát kéo tương quan theo hướng bất thường, nhưng không được xóa dữ liệu chỉ để làm KMO đẹp hơn.

Nếu Bartlett's Test không có Sig. dưới 0.05, hãy xem lại nhóm biến đưa vào EFA. Có thể các biến thuộc những khái niệm quá khác nhau, cỡ mẫu chưa phù hợp hoặc bảng hỏi tạo ra tương quan yếu. Bạn không nên gom mọi biến độc lập và biến phụ thuộc vào một lần chạy nếu mô hình lý thuyết yêu cầu các nhóm thang đo riêng.

Nếu một biến có factor loading thấp, kiểm tra lại nội dung biến và bảng Communalities. Bạn có thể loại biến theo tiêu chí đã đặt trước, chạy lại EFA và ghi lại từng vòng xử lý. EFA hiếm khi ra cấu trúc hoàn toàn đẹp ở lần chạy đầu, nhưng mỗi lần loại biến phải có lý do phương pháp và lý do nội dung.

Nếu một biến cross-loading, xem chênh lệch giữa hai loading, nội dung câu hỏi và sự ổn định của cấu trúc sau khi chạy lại. Loại biến có thể chấp nhận khi biến không đại diện rõ cho một khái niệm. Gộp hai nhân tố hoặc đổi tên nhân tố chỉ vì kết quả thống kê đẹp hơn thường khó giải trình với giảng viên.

Cuối cùng, kiểm tra lại cỡ mẫu. Một quy tắc thường được trích dẫn là cần khoảng 5 đến 10 quan sát cho mỗi biến quan sát (Hair và cộng sự, 2010). Đây là mốc tham khảo, không phải giấy phép để bỏ qua chất lượng mẫu. Nếu bạn đã chạy nhiều vòng, hãy lưu từng file output và ghi rõ biến nào bị loại, lý do gì, kết quả thay đổi ra sao.

Phân biệt Exploratory Factor Analysis với Cronbach's Alpha

EFA và Cronbach's Alpha cùng xuất hiện trong phần kiểm định thang đo nhưng trả lời hai câu hỏi khác nhau. EFA xem cấu trúc nhóm giữa nhiều biến quan sát. Cronbach's Alpha xem các biến trong một nhóm đã xác định có nhất quán với nhau không. Alpha được xây dựng từ mối liên hệ giữa các biến trong cùng thang đo, còn EFA xem toàn bộ mẫu tương quan giữa các biến được đưa vào phân tích.

Một thang đo có Alpha cao vẫn có thể gặp vấn đề trong EFA. Các biến có thể tương quan rất giống nhau nhưng lại tải lên nhân tố không đúng với mô hình lý thuyết, hoặc một nhóm có cross-loading. Ngược lại, Alpha chưa cao không tự động có nghĩa EFA thất bại.

Bạn cũng cần phân biệt EFA với CFA. EFA khám phá cấu trúc khi bạn chưa muốn áp đặt hoàn toàn số nhân tố và vị trí của biến. CFA kiểm định một cấu trúc đo lường đã được xác định trước. Nếu dùng SmartPLS, bạn sẽ thường xem Outer Loadings, CR, AVEHTMT trong mô hình đo lường, thay vì bê nguyên các chỉ số EFA của SPSS sang. Các khái niệm như mediator hoặc moderator thuộc phần mô hình quan hệ, không phải tên gọi khác của EFA.

Lỗi thường gặp khi đọc EFA

Lỗi đầu tiên là kết luận EFA đạt chỉ từ KMO. KMO đạt nhưng factor loading thấp, cross-loading hoặc số nhân tố không phù hợp thì thang đo vẫn cần xem xét. Hãy đọc tối thiểu các bảng KMO and Bartlett's Test, Total Variance ExplainedRotated Component Matrix.

Lỗi thứ hai là dùng Sig. = 0.000 để viết rằng xác suất bằng 0. Trong luận văn, bạn có thể viết Sig. < 0.001 nếu SPSS hiển thị 0.000 do làm tròn. Đồng thời, Sig. của Bartlett không nói rằng thang đo tốt, nó chỉ cho thấy ma trận tương quan đủ khác ma trận đơn vị để tiếp tục xem xét.

Lỗi thứ ba là giữ lại mọi biến có loading trên 0.5 mà không xem cross-loading. Một biến tải 0.55 ở nhân tố thứ nhất và 0.53 ở nhân tố thứ hai không rõ ràng như biến chỉ tải 0.78 ở một nhân tố. Bạn cần ghi tiêu chí chênh lệch loading nếu nghiên cứu có sử dụng tiêu chí đó.

Lỗi thứ tư là ép số nhân tố theo kết quả SPSS mà không đối chiếu mô hình. EFA có thể gợi ý cấu trúc khác với giả thuyết ban đầu, nhưng thay đổi mô hình cần được giải thích bằng nội dung thang đo và nền tảng nghiên cứu. Đừng đổi tên nhân tố sau mỗi lần chạy chỉ để khớp với bảng kết quả.

Câu hỏi thường gặp

Exploratory Factor Analysis có phải là phân tích nhân tố khám phá không?

Đúng. Exploratory Factor Analysis là tên tiếng Anh của phân tích nhân tố khám phá, thường viết tắt là EFA. Trong luận văn, bạn có thể ghi lần đầu là “phân tích nhân tố khám phá, Exploratory Factor Analysis, EFA”, sau đó dùng thống nhất một cách gọi.

EFA bao nhiêu mẫu là đạt?

Không có một cỡ mẫu duy nhất áp dụng cho mọi bộ dữ liệu. Một mốc thường dùng là 5 đến 10 quan sát cho mỗi biến quan sát (Hair và cộng sự, 2010), nhưng bạn còn phải xem số nhân tố, factor loading, mức tương quan và chất lượng câu trả lời. Cỡ mẫu nhiều không tự động sửa được bảng hỏi hoặc dữ liệu kém.

EFA có cần chạy trước Cronbach's Alpha không?

Thông thường bạn kiểm tra Cronbach's Alpha sơ bộ cho từng thang đo, sau đó chạy EFA để xem cấu trúc chung. Một số đề tài có thể thiết kế quy trình khác, nhưng bạn cần nêu rõ lý do và giữ nhất quán giữa chương phương pháp, chương kết quả và phần thảo luận.

Vì sao EFA bị cross-loading?

Cross-loading xảy ra khi một biến quan sát có loading đáng kể trên từ hai nhân tố trở lên. Nguyên nhân có thể nằm ở câu chữ chưa phân biệt rõ hai khái niệm, người trả lời hiểu biến theo nhiều nghĩa hoặc hai khái niệm thực sự gần nhau trong bối cảnh nghiên cứu. Kiểm tra nội dung biến, chênh lệch loading và cơ sở lý thuyết trước khi quyết định loại.

Có thể chạy EFA nhiều lần để đạt không?

Bạn có thể chạy lại sau khi loại biến có lý do rõ ràng, nhưng phải lưu lại từng vòng và báo cáo tiêu chí xử lý. Việc xóa biến liên tục chỉ để đạt KMO hoặc tăng Total Variance Explained làm kết quả khó bảo vệ. Hãy kiểm tra cả ý nghĩa nội dung, số biến còn lại trong mỗi nhân tố và sự phù hợp với mô hình ban đầu.

Mở file .sav của bạn, lập danh sách các biến quan sát, rồi kiểm tra lần lượt KMO, Bartlett's Test, Total Variance Explained và Rotated Component Matrix thay vì chỉ nhìn một con số. Nếu cần chạy EFA trên dữ liệu thật và chuyển output thành phần diễn giải trong luận văn, bạn có thể xem M4 phân tích dữ liệu của DoThesis.