Cách chạy EFA trong SPSS và đọc kết quả phân tích nhân tố

SPSS··16 phút đọc

Khi nào dùng EFA

EFA, viết đầy đủ là Exploratory Factor Analysis, được dùng để khám phá các biến quan sát đang tập hợp thành những nhân tố nào. Bạn thường chạy EFA sau khi kiểm tra độ tin cậy bằng Cronbach's Alpha và trước khi chạy hồi quy, SEM hoặc mô hình PLS-SEM. Nếu bảng hỏi có nhiều biến quan sát kế thừa từ các thang đo khác nhau, EFA giúp kiểm tra cấu trúc thực tế trên mẫu dữ liệu của bạn.

Hiểu ngắn gọn, EFA trả lời câu hỏi: các biến quan sát có thực sự gom về đúng nhóm khái niệm dự kiến hay không. Ví dụ, mô hình có ba khái niệm là Chất lượng dịch vụ, Sự tin cậy và Ý định mua. Bạn đưa các biến quan sát của những khái niệm này vào EFA để xem chúng có tạo thành ba nhân tố riêng biệt không.

EFA phù hợp khi cấu trúc nhân tố chưa chắc chắn hoặc bạn đang điều chỉnh thang đo cho bối cảnh mới. Nếu mô hình đã được xác lập rõ và bạn muốn kiểm định mức độ phù hợp của cấu trúc đo lường, CFA sẽ phù hợp hơn. Bạn có thể xem thêm sự khác nhau giữa hai hướng này trong bài CFA.

Cần phân biệt EFA với Principal Component Analysis. Trong SPSS, mục Extraction có cả Principal Components và các phương pháp Factor Analysis. Principal Components tập trung vào việc rút gọn dữ liệu, còn EFA theo nghĩa chặt hơn tìm các nhân tố tiềm ẩn đứng sau tương quan giữa các biến. Bài Principal Component Analysis giải thích riêng lựa chọn này.

Về mặt giả thuyết, EFA không kiểm định trực tiếp H1, H2 hay H3. Nó kiểm tra chất lượng và cấu trúc thang đo trước khi bạn dùng điểm nhân tố hoặc điểm trung bình để kiểm định các giả thuyết quan hệ giữa các biến.

Chuẩn bị dữ liệu trước khi chạy

Mở file .sav và kiểm tra từng cột trước khi vào Analyze. Mỗi biến quan sát phải là một biến số, chẳng hạn KT1, KT2, KT3 hoặc DV1, DV2, DV3. Các câu trả lời Likert cần được mã hóa bằng số nhất quán, thường từ 1 đến 5 hoặc từ 1 đến 7. Nhãn giá trị có thể là Rất không đồng ý đến Rất đồng ý, nhưng dữ liệu gốc vẫn phải là số.

Kiểm tra Missing Values bằng cách vào Analyze > Descriptive Statistics > Frequencies. Nếu một biến có nhiều ô trống, bạn cần xem lại phiếu gốc và quy tắc xử lý đã nêu trong phương pháp nghiên cứu. Đừng tự động thay toàn bộ ô trống bằng giá trị trung bình khi chưa có lý do phương pháp rõ ràng.

Các biến đảo chiều phải được recode trước khi chạy Cronbach's Alpha và EFA. Với thang Likert 1 đến 5, công thức đảo chiều thường là giá trị mới bằng 6 trừ giá trị cũ. Sau khi tạo biến mới, kiểm tra lại bảng tần số để chắc chắn mã 1 đã thành 5, mã 2 đã thành 4. Giữ lại biến gốc để có thể truy vết dữ liệu.

Bạn cũng cần loại các cột không phải biến quan sát, như mã người trả lời, thời gian gửi, nhóm khảo sát hoặc câu hỏi sàng lọc. Biến định danh không nên đưa vào EFA. Nếu bảng hỏi có các thang đo hoàn toàn khác bản chất, hãy xem xét cơ sở lý thuyết trước khi đưa tất cả vào cùng một lần chạy.

Cỡ mẫu cần đủ cho số biến quan sát. Một quy tắc thường được dùng là 5 đến 10 quan sát cho mỗi biến quan sát (Hair và cộng sự, 2010). Đây là hướng dẫn thiết kế, không phải bảo đảm rằng EFA sẽ đạt. Trong luận văn, bạn nên ghi rõ số biến, số phiếu hợp lệ và cách xác định cỡ mẫu.

Trước khi bắt đầu, lưu một bản sao dữ liệu và đặt tên file output theo từng vòng chạy, chẳng hạn EFA_v1.spv, EFA_v2.spv. EFA hiếm khi ra đúng cấu trúc ở lần đầu. Việc ghi lại biến bị loại, lý do loại và kết quả chạy lại giúp bạn giải trình với giảng viên.

Các bước chạy EFA trong SPSS

Mở hộp thoại Factor Analysis

Vào Analyze > Dimension Reduction > Factor. Chuyển toàn bộ biến quan sát dự kiến kiểm định vào ô Variables. Không đưa biến phụ thuộc dạng đơn biến, biến nhân khẩu học hoặc mã số người trả lời vào hộp này.

Nếu bạn chạy riêng cho từng nhóm thang đo theo thiết kế nghiên cứu, hãy ghi rõ lý do. Trong nhiều luận văn, các biến quan sát của những khái niệm độc lập được đưa vào EFA chung để kiểm tra giá trị phân biệt. Cách chọn phải nhất quán với mô hình và hướng dẫn của giảng viên.

Chọn Descriptives và kiểm tra điều kiện

Bấm Descriptives. Chọn KMO and Bartlett's test of sphericity để SPSS xuất bảng KMO and Bartlett's Test. Có thể chọn Anti-image để xem thêm chỉ số MSA của từng biến nếu cần chẩn đoán biến yếu.

Không cần chọn tất cả tùy chọn nếu output quá dài. Mục tiêu của bước này là kiểm tra dữ liệu có đủ tương quan để phân tích nhân tố hay không, chứ chưa phải kết luận số nhân tố cuối cùng.

Chọn Extraction

Bấm Extraction. Ở Method, nếu mục tiêu của bạn là EFA, có thể chọn Principal Axis Factoring hoặc một phương pháp Factor Analysis phù hợp với thiết kế. Nếu đề cương yêu cầu Principal Components, chọn Principal Components và ghi đúng tên phương pháp trong luận văn. Không gọi mọi kết quả Principal Components là EFA mà không nói rõ cách trích.

Chọn Scree plot để xem biểu đồ điểm gãy. Ở Extract, có thể để Eigenvalues greater than 1 khi đây là quy tắc đã được xác định trong nghiên cứu. Kaiser nêu quy tắc eigenvalue lớn hơn 1 trong lựa chọn số nhân tố (Kaiser, 1960). Bạn cũng nên đối chiếu với cơ sở lý thuyết, scree plot và khả năng diễn giải.

Chọn Rotation

Bấm Rotation. Varimax là lựa chọn thường gặp khi giả định các nhân tố không tương quan. Nếu các khái niệm có thể tương quan, Promax hoặc một phép xoay xiên sẽ phù hợp hơn. Phép xoay không làm dữ liệu tốt lên, nó chỉ giúp cấu trúc tải nhân tố dễ đọc hơn.

Chọn Rotated solution và Loading plot nếu cần. Sau khi chạy, bảng quan trọng thường là Rotated Component Matrix với Varimax, hoặc Pattern Matrix và Structure Matrix với phép xoay xiên. Cách đọc ma trận xoay cần dựa trên tên bảng thực tế trong output.

Chọn Options và chạy lần đầu

Bấm Options, chọn Sorted by size để các hệ số tải trong mỗi nhân tố được sắp xếp dễ đọc. Có thể chọn Suppress small coefficients và nhập 0.50 để output gọn hơn, nhưng nên thận trọng. Nếu ẩn mọi hệ số nhỏ, bạn có thể bỏ qua một biến bị tải chéo mà đáng lẽ phải kiểm tra.

Bấm Continue rồi bấm OK. Lưu output trước khi chỉnh dữ liệu. Lần chạy đầu giúp bạn nhìn toàn cảnh: KMO, Bartlett, số nhân tố, Total Variance Explained và ma trận tải.

Đọc kết quả output

Bảng KMO and Bartlett's Test có hai phần cần đọc. KMO cho biết mức độ phù hợp chung của dữ liệu cho phân tích nhân tố. Bartlett's Test of Sphericity kiểm tra giả thuyết ma trận tương quan là ma trận đơn vị. Bạn cần xem cả hai, không chỉ nhìn một con số KMO.

Bảng Total Variance Explained cho biết eigenvalue và phần trăm phương sai do từng nhân tố giải thích. Nếu chọn Eigenvalues greater than 1, SPSS thường giữ các nhân tố có eigenvalue lớn hơn 1. Tuy nhiên, số nhân tố cuối cùng vẫn cần phù hợp với mô hình lý thuyết và khả năng đặt tên.

Bảng Component Matrix xuất hiện nếu chưa xoay, còn Rotated Component Matrix xuất hiện sau khi xoay trực giao. Với phép xoay xiên, hãy đọc Pattern Matrix. Mỗi biến nên có tải cao trên nhân tố dự kiến và không tải cao đồng thời trên nhiều nhân tố.

Dưới đây là bảng số liệu minh họa, không phải kết quả của một nghiên cứu thật:

Bảng output SPSSChỉ số hoặc biếnNhân tố 1Nhân tố 2Nhân tố 3
KMO and Bartlett's TestKMO Measure0.812
KMO and Bartlett's TestSig. Bartlett0.000
Total Variance ExplainedEigenvalue nhân tố 14.126
Total Variance Explained% phương sai tích lũy sau 3 nhân tố58.437%
Rotated Component MatrixDV10.784
Rotated Component MatrixTC20.731
Rotated Component MatrixYD30.816

Trong ví dụ, KMO là 0.812 và Sig. của Bartlett là 0.000. Đây chỉ là số liệu minh họa để bạn nhận diện vị trí và cách đọc cột, không được chép thành kết quả của đề tài nếu file của bạn cho ra con số khác. Khi đọc ma trận, cần xem toàn bộ các biến, không kết luận chỉ từ ba dòng tiêu biểu.

Nếu một biến tải 0.54 ở nhân tố 1 và 0.51 ở nhân tố 2, đó là dấu hiệu tải chéo. Bạn cần xem nội dung biến, chênh lệch giữa hai tải, lý thuyết của thang đo và yêu cầu của giảng viên trước khi loại. Không nên loại biến chỉ vì muốn bảng kết quả đẹp.

Các khái niệm như communality và eigenvalue thường gây nhầm lẫn. Communality thể hiện phần phương sai của một biến được các nhân tố giữ lại giải thích, còn eigenvalue liên quan đến lượng phương sai mà một nhân tố giải thích. Bạn có thể xem thêm bài communality và bài eigenvalue khi hai cột này xuất hiện trong output.

Tiêu chí đánh giá

Bảng dưới đây dùng các ngưỡng thường gặp trong luận văn định lượng. Mỗi dòng ghi nguồn để bạn không tách một con số khỏi tài liệu gốc. Hãy thống nhất ngưỡng với đề cương và giảng viên, nhất là khi nghiên cứu khám phá hoặc mẫu có quy mô hạn chế.

Nội dung cần đánh giáNgưỡng tham khảoNguồn canonical
KMOTừ 0.5 trở lên(Kaiser, 1974)
Bartlett's TestSig. nhỏ hơn 0.05(Kaiser, 1974)
EigenvalueLớn hơn 1(Kaiser, 1960)
Factor loadingTừ 0.5 trở lên(Hair và cộng sự, 2010)
Tổng phương sai tríchTừ 50% trở lên(Hair và cộng sự, 2010)
Corrected Item-Total CorrelationTừ 0.3 trở lên, khi đánh giá Alpha(Nunnally và Bernstein, 1994)
Số quan sát trên mỗi biến quan sátKhoảng 5 đến 10(Hair và cộng sự, 2010)

KMO dưới 0.5 cho thấy dữ liệu chưa phù hợp với EFA theo ngưỡng tham khảo. KMO cao hơn không tự động chứng minh thang đo có giá trị tốt, vì bạn vẫn phải xem tải nhân tố, số nhân tố, tải chéo và khả năng diễn giải.

Bartlett có Sig. nhỏ hơn 0.05 cho thấy có bằng chứng về tương quan giữa các biến trong ma trận. Nếu Sig. lớn hơn 0.05, hãy kiểm tra lại việc chọn biến, cỡ mẫu, cách mã hóa và mức độ liên hệ giữa các biến trước khi cố chạy tiếp.

Factor loading từ 0.5 trở lên thường được xem là đạt theo Hair và cộng sự (Hair và cộng sự, 2010). Tuy nhiên, biến có tải thấp hoặc tải chéo cần được xem xét cùng nội dung lý thuyết. Sau mỗi lần loại, chạy lại EFA và ghi rõ phiên bản output.

Nếu nghiên cứu có thang đo mới hoặc bối cảnh khám phá, Cronbach's Alpha từ 0.6 có thể được chấp nhận theo (Hair và cộng sự, 2010), trong khi ngưỡng 0.7 thường được dẫn theo (Nunnally, 1978). Hai ngưỡng này thuộc bối cảnh khác nhau, vì vậy không nên dùng một cách máy móc.

Cách viết kết quả vào luận văn

Trong chương 4, bạn nên trình bày thứ tự: điều kiện chạy EFA, phương pháp trích và xoay, KMO và Bartlett, số nhân tố giữ lại, tổng phương sai trích, ma trận tải sau xoay và các biến bị loại nếu có. Ghi đúng tên bảng trong SPSS, số vòng chạy và lý do loại biến.

Bạn có thể điều chỉnh câu mẫu sau theo file của mình: “Kết quả EFA lần [số lần] cho thấy chỉ số KMO đạt [giá trị], kiểm định Bartlett có Sig. = [giá trị], cho thấy dữ liệu [phù hợp/chưa phù hợp] để phân tích nhân tố. Phân tích trích được [số nhân tố] nhân tố với tổng phương sai trích là [giá trị]%. Các biến quan sát có factor loading từ [giá trị thấp nhất] đến [giá trị cao nhất], do đó [kết luận theo tiêu chí đã chọn].”

Nếu có biến bị loại, viết cụ thể: “Biến [mã biến] được loại ở vòng [số] vì factor loading đạt [giá trị] và tải chéo trên [tên nhân tố] là [giá trị]. Sau khi loại biến, phân tích được chạy lại với [số biến] biến quan sát.” Câu này giúp hội đồng thấy bạn kiểm soát quy trình thay vì chỉ đưa ra bảng cuối.

Không viết rằng EFA đã chứng minh giả thuyết nghiên cứu. EFA cung cấp bằng chứng về cấu trúc thang đo. Việc kiểm định quan hệ giữa các khái niệm cần thực hiện bằng hồi quy, SEM, PROCESS hoặc PLS-SEM tùy mô hình.

Lỗi thường gặp khi chạy EFA

Lỗi đầu tiên là đưa cả biến nhân khẩu học vào Factor Analysis. Tuổi, giới tính, thu nhập hoặc nghề nghiệp thường là biến mô tả hoặc biến kiểm soát, không phải biến quan sát của thang đo. Hãy kiểm tra danh sách Variables trước khi bấm OK.

Lỗi thứ hai là chọn Principal Components nhưng viết trong luận văn rằng đã dùng Principal Axis Factoring. Hai phương pháp có mục tiêu và tên gọi khác nhau. Bạn cần ghi đúng Method đã chọn trong hộp thoại Extraction.

Lỗi thứ ba là ép SPSS giữ đúng số nhân tố dự kiến dù eigenvalue, scree plot và ma trận tải không ủng hộ. Có thể thử Fixed number of factors khi lý thuyết đủ rõ, nhưng phải báo cáo cách lựa chọn và kết quả thực tế.

Lỗi thứ tư là xóa liên tục các biến để đạt factor loading đẹp. Mỗi biến quan sát có nội dung lý thuyết. Nếu loại quá nhiều, thang đo có thể mất phạm vi khái niệm. Hãy ưu tiên biến có tải thấp, tải chéo rõ hoặc không phù hợp về mặt nội dung, rồi chạy lại từng vòng.

Lỗi thứ năm là nhầm EFA với CFA hoặc đọc nhầm bảng. EFA dùng để khám phá cấu trúc, còn CFA kiểm định cấu trúc đo lường đã giả định. Lỗi thứ sáu là chỉ báo cáo KMO mà bỏ qua Bartlett, Total Variance Explained và ma trận xoay.

Nếu SPSS báo không hội tụ hoặc output không có ma trận xoay, kiểm tra số biến, tương quan gần như bằng không, biến có phương sai bằng không và dữ liệu Missing. Đừng sửa trực tiếp file gốc. Lưu một bản sao, kiểm tra từng biến và ghi lại thay đổi.

Câu hỏi thường gặp

EFA là gì và dùng để làm gì?

EFA là phân tích nhân tố khám phá, dùng để xem nhiều biến quan sát đang gom thành bao nhiêu nhân tố và mỗi biến thuộc về nhân tố nào. Nó thường được dùng để đánh giá cấu trúc thang đo trước các phân tích quan hệ giữa biến.

EFA không thay thế kiểm định giả thuyết. Sau EFA, bạn vẫn cần chọn phương pháp phù hợp để kiểm định mô hình nghiên cứu.

Chạy EFA cho biến phụ thuộc có được không?

Có thể chạy EFA cho các biến quan sát của một khái niệm phụ thuộc nếu khái niệm đó được đo bằng nhiều biến. Mục tiêu là kiểm tra các biến quan sát có cùng hội tụ vào một nhân tố hay không.

Bạn không đưa một cột điểm phụ thuộc tổng hợp duy nhất vào EFA. Hãy dùng các biến quan sát gốc, chẳng hạn YD1, YD2 và YD3, rồi tính điểm đại diện sau khi thang đo đạt yêu cầu.

EFA bao nhiêu là đạt?

Các ngưỡng thường dùng gồm KMO từ 0.5, Bartlett có Sig. nhỏ hơn 0.05, eigenvalue lớn hơn 1, factor loading từ 0.5 và tổng phương sai trích từ 50% trở lên. Các ngưỡng này cần được đọc cùng nguồn, lần lượt có thể tham khảo (Kaiser, 1974), (Kaiser, 1960) và (Hair và cộng sự, 2010).

Không có một con số duy nhất quyết định toàn bộ EFA. Bạn còn phải xem tải chéo, nội dung biến, số nhân tố và sự phù hợp với mô hình lý thuyết.

EFA bị lỗi hoặc không có Rotated Component Matrix thì làm sao?

Trước hết, kiểm tra dữ liệu có đủ biến thiên, có quá nhiều Missing hay không và các biến có được mã hóa cùng chiều không. Sau đó kiểm tra lại Method, Rotation và danh sách Variables trong hộp thoại Factor.

Nếu một số biến gần như không tương quan, EFA có thể không tạo ra cấu trúc có ý nghĩa. Bạn nên xem ma trận tương quan, kiểm tra lại thang đo và trao đổi với giảng viên trước khi loại biến hàng loạt.

Có cần chạy EFA một lần cho tất cả biến không?

Câu trả lời phụ thuộc vào mô hình và cách xây dựng thang đo. Nếu các biến độc lập được kỳ vọng phân biệt thành nhiều nhân tố, chạy chung có thể giúp kiểm tra giá trị phân biệt. Nếu các nhóm biến có cơ sở lý thuyết và nội dung hoàn toàn khác nhau, cách chạy riêng có thể phù hợp hơn.

Hãy nêu rõ phạm vi biến đưa vào mỗi lần chạy và không trộn các lần chạy thành một kết luận duy nhất. File syntax, output và nhật ký loại biến sẽ giúp bạn giải thích lựa chọn.

Bạn mở lại file SPSS, lập danh sách biến quan sát, kiểm tra mã hóa rồi chạy EFA lần đầu theo đúng menu path ở trên; sau đó lưu output và ghi từng biến cần xem xét. Nếu cần chạy phân tích trên chính file .sav hoặc .csv của bạn, M4 phân tích dữ liệu hỗ trợ bước này.