Principal Component Analysis là gì? Cách đọc PCA trong SPSS
Principal Component Analysis là gì
Principal Component Analysis, thường viết tắt là PCA, là một kỹ thuật biến đổi nhiều biến quan sát có tương quan thành một số ít thành phần chính. Khi bạn có một bảng hỏi gồm nhiều biến quan sát, PCA giúp tóm tắt thông tin và nhận diện các nhóm biến có xu hướng biến thiên cùng nhau.
Trong SPSS, PCA thường xuất hiện trong quy trình phân tích nhân tố khám phá, gọi là Exploratory Factor Analysis hoặc EFA. Bạn đưa vào các biến quan sát, chọn phương pháp trích Principal Components, sau đó xem KMO and Bartlett's Test, Total Variance Explained và Rotated Component Matrix. Mỗi thành phần được tạo từ tổ hợp tuyến tính của các biến quan sát, với trọng số phản ánh mức đóng góp của từng biến.
Có một điểm cần phân biệt ngay từ đầu. PCA tập trung vào việc tóm tắt tổng phương sai của các biến, còn một số phương pháp factor extraction khác tập trung vào phần phương sai chung giữa các biến. Trong nhiều luận văn kinh tế, quản trị và marketing, PCA vẫn được chọn trong bước khám phá cấu trúc thang đo. Bạn nên ghi rõ phương pháp trích đã dùng thay vì chỉ viết chung chung là “chạy EFA”.
Nếu bạn đang nhìn bảng kết quả và chưa biết bắt đầu từ đâu, hãy xem thêm hướng dẫn về EFA trong SPSS. Bài này tập trung vào cách hiểu PCA, các ngưỡng thường được dùng và cách quyết định biến nào cần giữ lại.
Ý nghĩa của Principal Component Analysis trong nghiên cứu định lượng
PCA trả lời một câu hỏi thực tế: nhiều biến quan sát trong bảng hỏi có thể được gom thành bao nhiêu nhóm có ý nghĩa để dùng cho phân tích tiếp theo. Chẳng hạn, 20 biến quan sát ban đầu có thể được rút thành 4 thành phần. Mỗi thành phần sau đó có thể đại diện cho một khía cạnh của khái niệm nghiên cứu.
Trong một luận văn, PCA thường hỗ trợ ba quyết định. Thứ nhất, bạn kiểm tra dữ liệu có phù hợp để phân tích nhân tố hay không. Thứ hai, bạn xác định số thành phần được giữ lại. Thứ ba, bạn xem từng biến quan sát tải mạnh vào thành phần nào và có bị tải chéo vào nhiều thành phần hay không.
PCA không tự đặt tên khái niệm cho thành phần. Tên nhân tố phải dựa vào nội dung lý thuyết và ý nghĩa của các biến quan sát cùng nhóm. Nếu ba biến đều nói về sự thuận tiện khi sử dụng dịch vụ, bạn có thể đặt tên thành phần là “Sự thuận tiện”. Phần mềm chỉ cung cấp cấu trúc số liệu, còn việc diễn giải cần quay lại mô hình và thang đo của đề tài.
Kết quả PCA cũng không thay thế hoàn toàn cơ sở lý thuyết. Nếu mô hình ban đầu có bốn khái niệm, nhưng PCA tạo ra ba nhóm, bạn cần kiểm tra nguyên nhân. Có thể một số biến có nội dung gần nhau, cách diễn đạt chưa rõ, hoặc dữ liệu thực tế không ủng hộ cấu trúc dự kiến. Khi cần kiểm định cấu trúc đã xác lập, bạn có thể cân nhắc CFA, nhưng CFA thuộc logic kiểm định khác và không nên trộn lẫn với PCA trong cùng một kết luận.
Principal Component Analysis bao nhiêu là đạt
Không có một con số duy nhất quyết định toàn bộ PCA đạt hay không. Bạn cần đọc một chuỗi chỉ số theo đúng thứ tự: mức độ phù hợp của dữ liệu, số thành phần, tổng phương sai giải thích, factor loading và hiện tượng tải chéo. Các ngưỡng dưới đây là mốc tham khảo thường dùng, không phải giấy phép để giữ hoặc loại biến một cách máy móc.
| Nội dung kiểm tra | Ngưỡng thường dùng | Nguồn |
|---|---|---|
| KMO | Từ 0.5 trở lên | (Kaiser, 1974) |
| Bartlett's Test of Sphericity | Sig. dưới 0.05 | (Kaiser, 1974) |
| Eigenvalue khi chọn số thành phần | Lớn hơn 1 | (Kaiser, 1960) |
| Total Variance Explained | Từ 50% trở lên | (Hair và cộng sự, 2010) |
| Factor loading | Từ 0.5 trở lên | (Hair và cộng sự, 2010) |
| Số quan sát trên mỗi biến quan sát | Khoảng 5 đến 10 quan sát cho một biến | (Hair và cộng sự, 2010) |
KMO cho biết mức độ phù hợp tổng thể của tương quan giữa các biến với phân tích nhân tố. KMO càng thấp, dữ liệu càng khó tạo ra cấu trúc nhân tố rõ. Bartlett's Test kiểm tra ma trận tương quan có khác ma trận đơn vị hay không. Khi Sig. dưới 0.05, các biến có tương quan đủ để tiếp tục xem xét PCA.
Eigenvalue là lượng phương sai được một thành phần giải thích. Quy tắc eigenvalue lớn hơn 1 thường được SPSS dùng để đề xuất số thành phần, theo (Kaiser, 1960). Tuy nhiên, bạn không nên chỉ nhìn vào con số này. Hãy xem thêm Scree Plot và khả năng giải thích của các nhóm biến. Một thành phần chỉ có eigenvalue vừa đủ nhưng chỉ gồm một biến, hoặc không có ý nghĩa lý thuyết, cần được xem xét thận trọng.
Factor loading thể hiện mức liên hệ giữa biến quan sát và thành phần. Mốc 0.5 thường được dùng trong nghiên cứu định lượng, theo (Hair và cộng sự, 2010). Nếu đề tài đang ở giai đoạn khám phá, một số hướng dẫn có thể chấp nhận mốc thấp hơn, nhưng bạn cần thống nhất với giảng viên và giải thích rõ trong luận văn. Tải chéo cao, nghĩa là một biến tải gần tương đương trên nhiều thành phần, thường làm cho việc đặt tên nhân tố khó hơn.
Cách đọc Principal Component Analysis trên output
Bạn mở SPSS và vào Analyze > Dimension Reduction > Factor. Đưa các biến quan sát cần kiểm tra vào ô Variables. Trong Extraction, chọn Method là Principal components, bật Scree plot và giữ Eigenvalues over 1 nếu đó là quy tắc bạn đang sử dụng. Trong Rotation, chọn Varimax khi muốn các thành phần có tương quan thấp. Nếu mô hình lý thuyết cho phép các nhân tố tương quan, bạn có thể cân nhắc một phép quay xiên như Direct Oblimin.
Trong Descriptives, chọn KMO and Bartlett's test, Anti-image và Correlation matrix nếu cần kiểm tra sâu hơn. Trong Options, có thể chọn Sorted by size để bảng tải nhân tố dễ đọc, đồng thời đặt Suppress small coefficients ở mức phù hợp. Việc ẩn hệ số nhỏ giúp bảng gọn hơn, nhưng bạn vẫn cần kiểm tra cách lựa chọn này khi giải thích kết quả.
Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu cụ thể. Tên bảng và cột được mô phỏng theo output SPSS để bạn đối chiếu với file đang mở.
| Bảng output SPSS | Chỉ số hoặc dòng | Số liệu minh họa | Cách đọc |
|---|---|---|---|
| KMO and Bartlett's Test | Kaiser-Meyer-Olkin Measure of Sampling Adequacy | 0.812 | Dữ liệu đạt mốc KMO từ 0.5 |
| KMO and Bartlett's Test | Approx. Chi-Square | 624.371 | Giá trị kiểm định Bartlett |
| KMO and Bartlett's Test | Sig. | 0.000 | Có thể tiếp tục phân tích nhân tố |
| Total Variance Explained | Component 1, Initial Eigenvalues | 4.286 | Thành phần thứ nhất giải thích lượng phương sai lớn nhất |
| Total Variance Explained | Component 1, % of Variance | 35.717 | Tỷ lệ phương sai của thành phần 1 |
| Total Variance Explained | Cumulative % sau 4 thành phần | 67.438 | Bốn thành phần giải thích tổng cộng 67.438% |
| Rotated Component Matrix | TC1 trên Component 1 | 0.781 | Biến tải khá rõ vào thành phần 1 |
| Rotated Component Matrix | TC2 trên Component 1 | 0.214 | Tải thấp trên thành phần 1 |
| Rotated Component Matrix | TC2 trên Component 2 | 0.694 | TC2 phù hợp hơn với thành phần 2 |
Bạn đọc bảng KMO and Bartlett's Test trước. Trong ví dụ, KMO bằng 0.812 và Sig. bằng 0.000. Đây là dấu hiệu dữ liệu phù hợp để xem tiếp kết quả PCA theo các ngưỡng đã nêu.
Tiếp theo, đọc Total Variance Explained. Cột Cumulative % cho biết tổng tỷ lệ phương sai được giải thích bởi số thành phần đang giữ lại. Ví dụ, bốn thành phần giải thích 67.438% phương sai. Con số này vượt mốc 50% được đề cập trong (Hair và cộng sự, 2010), nhưng bạn vẫn cần kiểm tra bốn thành phần đó có phù hợp với mô hình nghiên cứu không.
Cuối cùng, mở Rotated Component Matrix. Bạn xem mỗi biến có loading cao nhất ở thành phần nào, loading đó có đạt mốc đã chọn hay không, và biến có tải đáng kể ở nhiều thành phần không. Đừng đọc một dòng riêng lẻ rồi quyết định ngay. Hãy lập danh sách gồm mã biến, loading cao nhất, loading cao thứ hai và chênh lệch giữa hai giá trị.
Nếu bạn đang bị rối ở bảng này, ma trận xoay sẽ giúp bạn tập trung vào đúng cột và nhận diện tải chéo. Còn eigenvalue giải thích riêng phần quyết định số thành phần được giữ lại.
Khi Principal Component Analysis không đạt thì xử lý thế nào
Bạn nên xử lý theo thứ tự từ dữ liệu gốc đến mô hình, thay vì xóa hàng loạt biến để bảng đẹp hơn. Trước hết, kiểm tra dữ liệu nhập vào. Một biến có thể bị nhập sai kiểu, toàn bộ câu trả lời bị giống nhau, có nhiều giá trị thiếu hoặc chưa đảo chiều đối với biến nghịch đảo. Các lỗi này làm tương quan giữa biến bị méo.
Kiểm tra tương quan và dữ liệu thiếu trước
Xem bảng Frequencies, Descriptives và Correlations. Nếu một biến gần như không có độ phân tán, biến đó khó đóng góp vào việc hình thành thành phần. Bạn cũng kiểm tra số lượng giá trị thiếu và các mã trả lời bất thường. Nếu bảng hỏi dùng thang Likert từ 1 đến 5 nhưng file có giá trị 99, hãy xử lý 99 thành missing trước khi chạy lại.
Xem xét biến có factor loading thấp
Nếu một biến có loading dưới ngưỡng bạn đã chọn, đọc lại nội dung biến và kiểm tra Corrected Item-Total Correlation trong bước Cronbach's Alpha. Loại biến có thể chấp nhận khi biến đó có cơ sở thống kê yếu và không bắt buộc về mặt nội dung. Bạn cần ghi lại biến nào bị loại, ở vòng chạy nào và lý do cụ thể.
Xử lý tải chéo
Một biến tải cao trên hai thành phần có thể có nội dung giao thoa hoặc cách diễn đạt chưa đủ rõ. Bạn xem chênh lệch giữa hai loading, số biến còn lại của mỗi thành phần và ý nghĩa lý thuyết. Xóa biến chỉ vì nó làm bảng xoay đẹp hơn là cách giải trình yếu. Nếu loại biến, chạy lại PCA và kiểm tra cả KMO, phương sai trích lẫn cấu trúc mới.
Kiểm tra số thành phần được giữ lại
Nếu quy tắc eigenvalue lớn hơn 1 tạo ra quá nhiều thành phần nhỏ và khó đặt tên, xem Scree Plot, số biến trên từng thành phần và mô hình lý thuyết. Bạn có thể thử một số thành phần cố định nếu có lý do phương pháp rõ ràng, sau đó so sánh tính diễn giải. Mọi thay đổi cần được ghi vào nhật ký xử lý dữ liệu để khi hội đồng hỏi, bạn không phải đoán lại các vòng chạy.
Không nên dùng PCA để ép dữ liệu xác nhận một giả thuyết đã thất bại. Nếu kết quả liên tục không phù hợp, nguyên nhân có thể nằm ở thang đo, mẫu khảo sát hoặc cách xây dựng mô hình. Phần mềm không thể sửa một biến quan sát có nội dung không đo đúng khái niệm.
Phân biệt Principal Component Analysis với EFA, CFA và communality
PCA là một phương pháp trích thành phần. EFA là một quy trình khám phá rộng hơn, bao gồm lựa chọn biến, phương pháp trích, phép quay và cách diễn giải cấu trúc. Vì vậy, nói “PCA và EFA hoàn toàn giống nhau” sẽ làm mất một phần thông tin phương pháp. Trong nhiều output SPSS, PCA được dùng bên trong quy trình EFA, nhưng bạn vẫn nên ghi rõ Extraction Method: Principal Component Analysis.
CFA dùng để kiểm định một cấu trúc đo lường đã được xác định trước. Bạn đưa vào mô hình các mối quan hệ giữa biến quan sát và biến tiềm ẩn, sau đó đánh giá mức độ phù hợp mô hình và giá trị đo lường. PCA và CFA có mục tiêu khác nhau, nên không thay thế trực tiếp cho nhau.
Communality là phần phương sai của một biến quan sát được các thành phần giữ lại giải thích. Trong SPSS, bạn thường thấy Initial và Extraction trong bảng Communalities. Nếu muốn đọc đúng chỉ số này, xem hướng dẫn về communality. Communality thấp có thể gợi ý biến chưa được các thành phần đại diện tốt, nhưng quyết định loại biến vẫn cần xem cùng loading và nội dung thang đo.
Cũng cần phân biệt PCA với phân tích hồi quy. PCA tạo ra cấu trúc tóm tắt từ nhóm biến tương quan, còn hồi quy kiểm tra quan hệ giữa biến độc lập và biến phụ thuộc. Bạn có thể dùng điểm nhân tố hoặc điểm trung bình sau bước đo lường để chạy hồi quy, nhưng hai bước trả lời hai câu hỏi khác nhau.
Lỗi thường gặp
Lỗi đầu tiên là viết “PCA đạt” chỉ vì KMO lớn hơn 0.5. KMO mới chỉ nói về mức độ phù hợp ban đầu. Bạn còn phải đọc Bartlett's Test, số thành phần, phương sai trích, loading và tải chéo.
Lỗi thứ hai là lấy mọi loading trên 0.5 làm bằng chứng thang đo hoàn hảo. Một biến có loading cao vẫn có thể tải chéo, thuộc sai nhóm lý thuyết hoặc làm giảm tính nhất quán của thang đo. Hãy xem toàn bộ ma trận xoay, không chỉ các ô được SPSS in đậm.
Lỗi thứ ba là xóa biến liên tục nhưng không lưu từng phiên bản file. Hãy lưu file dữ liệu và output theo vòng, chẳng hạn PCA_v1, PCA_v2, kèm bảng ghi lý do loại biến. Cách này giúp bạn khôi phục kết quả và giải trình minh bạch.
Lỗi thứ tư là dùng ngưỡng của CB-SEM để đánh giá PCA. Các chỉ số CFI, TLI, RMSEA và SRMR thuộc nhóm đánh giá mô hình phù hợp của CB-SEM, theo (Hu và Bentler, 1999), không phải tiêu chí chính để đọc PCA trong SPSS.
Cách viết vào luận văn
Bạn có thể điều chỉnh câu sau theo số liệu thật: “Kết quả PCA cho thấy chỉ số KMO đạt [KMO], kiểm định Bartlett's Test có Sig. = [Sig.], cho thấy dữ liệu phù hợp để phân tích nhân tố. [Số nhân tố] được giữ lại, giải thích [Cumulative %]% tổng phương sai; các biến quan sát có factor loading từ [loading thấp nhất] đến [loading cao nhất].” Chỉ điền số sau khi đối chiếu trực tiếp với output và ghi rõ biến nào đã bị loại, nếu có.
Câu hỏi thường gặp
Principal Component Analysis là gì trong SPSS?
Principal Component Analysis là phương pháp biến đổi một nhóm biến quan sát thành các thành phần có số lượng ít hơn. Trong SPSS, PCA thường được chạy tại Analyze > Dimension Reduction > Factor và được đọc qua các bảng KMO and Bartlett's Test, Total Variance Explained và Rotated Component Matrix.
PCA bao nhiêu là đạt?
Bạn cần xem nhiều tiêu chí cùng lúc. Mốc thường dùng là KMO từ 0.5, Bartlett's Test có Sig. dưới 0.05, eigenvalue lớn hơn 1, tổng phương sai giải thích từ 50% và factor loading từ 0.5, với các nguồn lần lượt gồm (Kaiser, 1974), (Kaiser, 1960) và (Hair và cộng sự, 2010).
PCA bị KMO thấp thì làm sao?
Kiểm tra biến có phương sai thấp, dữ liệu thiếu, mã nhập sai và tương quan giữa các biến. Bạn có thể xem Anti-image, nhưng chỉ loại biến khi có căn cứ thống kê và nội dung. Sau mỗi lần loại, chạy lại toàn bộ PCA và ghi nhận thay đổi của KMO, Bartlett's Test và cấu trúc nhân tố.
PCA có giống EFA không?
PCA là một phương pháp trích thành phần, còn EFA là quy trình khám phá cấu trúc nhân tố rộng hơn. Trong SPSS, PCA thường được chọn làm Extraction Method trong quy trình Factor Analysis, nên hai thuật ngữ xuất hiện cạnh nhau nhưng không hoàn toàn đồng nghĩa.
Có cần chạy PCA trước CFA không?
Điều này phụ thuộc thiết kế nghiên cứu và nguồn thang đo. Nếu bạn đang khám phá cấu trúc của thang đo đã điều chỉnh, PCA hoặc EFA có thể được dùng ở bước khám phá. CFA phù hợp khi bạn đã có cấu trúc đo lường cần kiểm định. Hãy nêu rõ mục tiêu của từng bước và tránh dùng kết quả PCA như bằng chứng thay thế cho CFA.
Bạn hãy mở lại file SPSS, kiểm tra lần lượt KMO and Bartlett's Test, Total Variance Explained và Rotated Component Matrix, sau đó lưu một bản output kèm danh sách biến đã xử lý. Nếu cần chạy PCA trên chính file .sav hoặc .csv và chuyển số liệu thành phần kết quả thành văn bản chương 4, xem M4 phân tích dữ liệu của DoThesis.