Mẫu quá nhỏ phải làm sao khi phân tích SPSS

SPSS··16 phút đọc

Bạn mở file SPSS lên và nhận ra số dòng hợp lệ thấp hơn nhiều so với kế hoạch. Có thể bảng khảo sát chỉ thu được eighty phiếu, trong khi mô hình có 25 biến quan sát. Cũng có thể sau khi lọc câu trả lời không đầy đủ, số quan sát còn lại giảm mạnh. Câu hỏi “mẫu quá nhỏ phải làm sao” lúc này cần được trả lời bằng việc kiểm tra thiết kế, chất lượng dữ liệu và loại phân tích, thay vì chỉ tìm một nút trong SPSS để làm cho kết quả đẹp hơn.

Hiện tượng bạn đang gặp

Mẫu quá nhỏ thường xuất hiện dưới vài dạng. Khi chạy Frequencies, bạn thấy số quan sát hợp lệ của từng biến không giống nhau. Khi chạy Reliability Analysis, Cronbach's Alpha có thể dao động mạnh nếu bỏ một biến. Khi chạy EFA, bảng KMO and Bartlett's Test báo KMO thấp, Bartlett không có ý nghĩa hoặc Rotated Component Matrix không tạo ra nhóm nhân tố rõ ràng.

Với hồi quy, SPSS vẫn có thể xuất bảng Model Summary, ANOVA và Coefficients dù số quan sát ít. Việc phần mềm chạy được không đồng nghĩa với việc mô hình đủ độ tin cậy. Mẫu nhỏ làm sai số chuẩn dễ lớn, khoảng tin cậy rộng và kết luận về p-value nhạy với từng quan sát.

Bạn nên ghi lại ba con số trước khi sửa: số phiếu thu về, số phiếu hợp lệ sau làm sạch và số biến độc lập hoặc biến quan sát đưa vào phân tích. Nếu chỉ nhìn vào thông báo “Valid N” ở một bảng, bạn có thể bỏ qua việc các biến khác đang có missing value.

Nếu chưa chắc dữ liệu của mình thuộc sơ cấp hay thứ cấp, xem lại dữ liệu sơ cấp và dữ liệu thứ cấp là gì. Hai loại dữ liệu này có cách kiểm soát nguồn và giới hạn mẫu khác nhau.

Nguyên nhân thường gặp

Đừng vội kết luận rằng chỉ cần nhập thêm vài dòng bất kỳ. Trước hết, đối chiếu dấu hiệu trên output với nguyên nhân có thể kiểm tra được.

Dấu hiệuNguyên nhân có thểCách kiểm tra
Số quan sát hợp lệ giảm sau khi chạy phân tíchMissing value được mã hóa là 0, 99 hoặc một chuỗi ký tựVào Variable View, xem Missing và chạy Frequencies cho từng biến
Nhiều phiếu bị loại cùng lúcBộ lọc, điều kiện sàng lọc hoặc câu trả lời chưa hoàn tấtKiểm tra Data > Select Cases, Filter và các biến screening
EFA báo KMO thấpMẫu ít, tương quan giữa biến quan sát yếu hoặc thang đo chưa phù hợpXem KMO and Bartlett's Test và Correlation Matrix
Hồi quy có R² cao nhưng hệ số thay đổi mạnhMẫu nhỏ, outlier hoặc mô hình có quá nhiều biến độc lậpKiểm tra Casewise Diagnostics, Cook's Distance và bảng Coefficients
Alpha thay đổi rất mạnh khi bỏ một biếnThang đo có ít biến hoặc một biến không cùng nội dungXem Item-Total Statistics và Corrected Item-Total Correlation
Mỗi lần chạy lại p-value khác đáng kểMột vài quan sát có ảnh hưởng lớnKiểm tra residual, leverage và chạy phân tích độ nhạy

Một nguyên nhân khác là bạn dùng sai đơn vị phân tích. Ví dụ, bảng hỏi thu từ 120 người nhưng nhập mỗi người thành nhiều dòng giao dịch, hoặc ngược lại, gộp nhiều người thành một dòng. Hãy xác định rõ một dòng trong Data View đại diện cho ai trước khi đánh giá cỡ mẫu.

Cũng cần phân biệt mẫu nhỏ với dữ liệu bị thiếu. Nếu bạn có 180 người trả lời nhưng chỉ còn 105 quan sát hợp lệ vì đặt chế độ loại cả dòng khi có một missing value, vấn đề đầu tiên là quy tắc làm sạch dữ liệu. Bạn có thể còn cứu được một phần mẫu bằng cách kiểm tra nguyên nhân missing, thay vì thu lại toàn bộ.

Cách xử lý theo thứ tự ưu tiên

Kiểm tra lại số quan sát hợp lệ

Mở Analyze > Descriptive Statistics > Frequencies. Chọn các biến nhân khẩu học, biến phụ thuộc và một số biến quan sát chính. Trong bảng Frequencies, so sánh Valid và Missing. Nếu các biến có Valid N khác nhau, hãy tìm mã dữ liệu bất thường trước khi chạy Cronbach's Alpha, EFA hoặc hồi quy.

Kiểm tra Data > Select Cases. Nếu đang chọn If condition is satisfied hoặc Filter out unselected cases, SPSS có thể đang loại các dòng mà bạn tưởng vẫn được phân tích. Sau đó vào Data > Weight Cases và bảo đảm dữ liệu không bị gán trọng số ngoài ý muốn. Lưu một bản sao file trước khi tắt bộ lọc để có thể quay lại.

Kiểm tra cách mã hóa missing value

Trong Variable View, xem cột Type, Values và Missing. Một ô trống, giá trị 99 và giá trị “Không biết” không được SPSS xử lý giống nhau. Nếu 99 là mã không trả lời nhưng bạn để nó như một giá trị số bình thường, trung bình, tương quan và hồi quy sẽ bị kéo lệch.

Bạn có thể dùng Transform > Recode into Different Variables để chuyển mã không trả lời thành System-missing. Tạo biến mới thay vì ghi đè ngay lên biến gốc. Cách này giúp bạn đối chiếu trước và sau khi làm sạch. Khi cần chạy nhiều thao tác lặp lại, tham khảo chạy syntax SPSS để lưu lại các lệnh và tránh thao tác thủ công không nhất quán.

Giảm phân tích về đúng mục tiêu nghiên cứu

Mẫu nhỏ không cho phép bạn giữ nguyên mọi phân tích đã dự định chỉ vì đề cương có ghi. Xem lại mô hình và câu hỏi nghiên cứu. Nếu giả thuyết chỉ cần kiểm tra tác động của vài biến độc lập lên một biến phụ thuộc, hồi quy có thể phù hợp hơn việc cố chạy thêm EFA, CFA, mediation và moderation trên cùng một mẫu.

Với thang đo đã được kế thừa rõ ràng, bạn có thể trình bày lý do sử dụng thang đo và kiểm tra độ tin cậy trước khi cân nhắc EFA. Tuy vậy, không được bỏ EFA chỉ để né kết quả không đẹp nếu đề tài yêu cầu khám phá cấu trúc thang đo mới. Hãy trao đổi với giảng viên về phạm vi phân tích, ghi rõ giới hạn và không gọi một phân tích khám phá là xác nhận mô hình.

Nếu mô hình có biến định tính, xem hướng dẫn biến định tính chạy hồi quy phải làm sao để kiểm tra cách mã hóa dummy. Mã hóa sai có thể làm bạn tưởng mẫu quá nhỏ gây lỗi, trong khi thực tế biến đang được đưa vào mô hình dưới dạng chuỗi.

Kiểm tra ngưỡng tối thiểu có căn cứ

Không có một con số duy nhất áp dụng cho mọi phân tích. Cỡ mẫu cần xét cùng số biến, mục tiêu kiểm định, chất lượng thang đo và thiết kế nghiên cứu. Bảng dưới đây chỉ nêu các mốc thường được trích dẫn, không phải giấy phép để giữ một mẫu yếu bằng mọi giá.

Nội dung cần kiểm traMốc tham khảoNguồn
Số quan sát cho mỗi biến quan sát trong thang đo5 đến 10 quan sát(Hair và cộng sự, 2010)
Cỡ mẫu cho phân tích nhân tố theo một số mức diễn giảiCần xem xét mức độ đầy đủ của mẫu, không chỉ một tỷ lệ cố định(Comrey và Lee, 1992)
Cỡ mẫu hồi quy với m biến độc lập50 + 8m trở lên(Tabachnick và Fidell, 2013)
Cronbach's Alpha cho thang đo mới hoặc khám pháTừ 0.6 có thể được cân nhắc(Hair và cộng sự, 2010)
Corrected Item-Total CorrelationTừ 0.3 trở lên(Nunnally và Bernstein, 1994)
KMO trước EFATừ 0.5 trở lên(Kaiser, 1974)
Total variance explained trong EFATừ 50% trở lên(Hair và cộng sự, 2010)

Ví dụ, mô hình có 6 biến độc lập thì quy tắc 50 + 8m cho ra 98 quan sát. Đây là mốc tham khảo cho hồi quy, không tự động chứng minh mẫu 98 là đủ cho EFA với hàng chục biến quan sát. Nếu phân tích của bạn là PLS-SEM, hãy đánh giá riêng measurement model và structural model, không lấy các ngưỡng của CB-SEM để thay thế.

Chạy lại từng bước và lưu output

Tạo một file dữ liệu làm việc mới, giữ nguyên file gốc. Chạy Frequencies, Reliability Analysis, EFA rồi hồi quy theo thứ tự. Sau mỗi lần loại biến, ghi mã biến, lý do loại và số quan sát còn lại. Bạn có thể chuẩn hóa cách ghi dữ liệu bằng hướng dẫn chuẩn hóa dữ liệu là gì, nhưng không dùng chuẩn hóa để che missing value hoặc outlier.

Dưới đây là một khối output minh họa. Các con số chỉ để bạn nhận diện vị trí và tên cột trong SPSS, không phải kết quả của một nghiên cứu thật.

số liệu minh họa

Bảng SPSSChỉ số hoặc biếnGiá trị minh họaCách đọc
Case Processing SummaryValid N96Có 96 dòng được đưa vào phân tích này
Reliability StatisticsCronbach's Alpha0.734Đối chiếu ngưỡng và bối cảnh thang đo
Reliability StatisticsN of Items5Có 5 biến quan sát trong lần chạy
KMO and Bartlett's TestKaiser-Meyer-Olkin Measure0.612KMO ở mức có thể xem xét theo nguồn đã chọn
KMO and Bartlett's TestApprox. Chi-Square184.527Đọc cùng df và Sig.
KMO and Bartlett's TestSig.0.000Bartlett có ý nghĩa ở mức thường dùng
Model SummaryR Square0.318Mô hình giải thích 31.8% phương sai trong ví dụ
CoefficientsB, biến X10.286Hệ số chưa chuẩn hóa của X1
CoefficientsSig., biến X10.041Đối chiếu với mức ý nghĩa đã chọn

Một bảng output không thể tự trả lời mẫu có đủ hay chưa. Chẳng hạn, KMO 0.612 không xóa được vấn đề mẫu nhỏ nếu thang đo có quá nhiều biến, còn R Square 0.318 không chứng minh mọi hệ số trong mô hình đều ổn định. Hãy báo cáo cả Valid N và cách bạn xử lý trường hợp bị loại.

Khi nào phải quay lại thu thêm dữ liệu

Bạn nên ưu tiên thu thêm dữ liệu khi số phiếu hợp lệ thấp hơn mục tiêu đã đăng ký, khi nhiều quan sát bị loại do thiếu dữ liệu, hoặc khi mô hình có nhiều tham số so với số dòng. Việc thu thêm đặc biệt cần thiết nếu dữ liệu hiện tại chỉ đến từ một nhóm rất hẹp, chẳng hạn một lớp học hoặc một phòng ban, trong khi câu hỏi nghiên cứu muốn nói đến một quần thể rộng hơn.

Thu thêm dữ liệu cũng hợp lý khi kiểm tra độ nhạy cho thấy một hoặc hai quan sát làm thay đổi dấu của hệ số, mức ý nghĩa hoặc kết luận giả thuyết. Hãy dùng cùng bảng hỏi, tiêu chí sàng lọc và cách tuyển chọn đã mô tả trong phương pháp. Không nên đổi đối tượng khảo sát giữa chừng chỉ để đạt đủ số lượng mà không ghi rõ thay đổi.

Có những trường hợp không thể sửa bằng phần mềm. Nếu đề tài cần phân tích EFA nhưng mẫu quá ít và cấu trúc thang đo chưa được kiểm chứng, bỏ một nửa biến hoặc chạy đi chạy lại không tạo ra bằng chứng mạnh hơn. Nếu không còn thời gian thu thêm, phương án trung thực là thu hẹp phạm vi kết luận, trình bày đây là hạn chế và xin điều chỉnh kế hoạch phân tích với giảng viên.

Cách giải trình với giảng viên hướng dẫn

Đừng gửi ảnh chụp một bảng p-value rồi hỏi “em có đạt không”. Hãy chuẩn bị một bảng theo dõi gồm số phiếu ban đầu, tiêu chí loại, số phiếu sau mỗi bước, phân tích dự kiến và vấn đề đang gặp. Cách này giúp giảng viên phân biệt lỗi nhập liệu với giới hạn thật của cỡ mẫu.

Cách viết vào luận văn: “Sau khi kiểm tra [tiêu chí làm sạch dữ liệu], nghiên cứu giữ lại [N] quan sát hợp lệ từ [N ban đầu] phiếu. Với [số biến độc lập] biến độc lập, cỡ mẫu này được đối chiếu với quy tắc [quy tắc hoặc nguồn]. Do giới hạn về [thời gian/phạm vi tiếp cận đối tượng], kết quả được diễn giải trong phạm vi [đối tượng và bối cảnh], đồng thời ghi nhận hạn chế về cỡ mẫu.”

Nếu kết quả không đạt một mốc tham khảo, đừng viết “cỡ mẫu đạt” chỉ vì SPSS không báo lỗi. Bạn có thể viết rõ chỉ số nào đạt, chỉ số nào chưa đạt, lý do giữ hoặc loại biến, và kết luận nào cần thận trọng. Một đoạn giải trình có giới hạn cụ thể thường đáng tin hơn việc che số quan sát.

Cách phòng từ bước thiết kế

Ngay khi lập bảng hỏi, đếm số biến quan sát của từng khái niệm và ước tính số phiếu cần thu. Quy tắc 5 đến 10 quan sát cho mỗi biến quan sát được trích dẫn trong (Hair và cộng sự, 2010), nhưng bạn vẫn cần tính thêm phiếu dự phòng cho câu trả lời không hợp lệ. Nếu có 20 biến quan sát và dự kiến tỷ lệ loại 15%, kế hoạch thu không nên dừng ở đúng 100 phiếu.

Thiết kế mã biến nhất quán, dùng cùng thang Likert và quy định rõ câu hỏi sàng lọc. Chạy thử bảng hỏi với một nhóm nhỏ để phát hiện biến khó hiểu, mã trả lời trùng và logic bỏ qua. Giai đoạn thử không thay thế mẫu chính, nhưng giúp giảm số phiếu phải loại sau này.

Khi thu dữ liệu trực tuyến, theo dõi số phản hồi theo nhóm đối tượng thay vì chỉ nhìn tổng số. Kiểm tra thời gian hoàn thành bất thường, các dãy trả lời giống hệt nhau và tỷ lệ bỏ dở. Đừng tự động xóa mọi phản hồi nhanh, hãy đặt tiêu chí trước và ghi lại cách áp dụng.

Lỗi thường gặp khi sửa

Lỗi đầu tiên là xóa biến liên tục cho đến khi KMO hoặc Alpha tăng. Cách này có thể làm thang đo mất nội dung và khiến mô hình không còn giống giả thuyết ban đầu. Mỗi biến bị loại cần có lý do thống kê và lý do về nội dung, sau đó được giảng viên chấp thuận nếu ảnh hưởng đến mô hình.

Lỗi thứ hai là sao chép thêm dòng dữ liệu để đủ cỡ mẫu. Đây là hành vi làm sai dữ liệu và không thể giải trình khi hội đồng hỏi nguồn phiếu. Tương tự, việc thay đổi câu trả lời, tạo phiếu giả hoặc dùng một mẫu trả lời lặp lại khiến mọi chỉ số sau đó không còn có giá trị.

Lỗi thứ ba là nhầm giữa mẫu nhỏ và mẫu không đại diện. Thu thêm nhiều phiếu từ cùng một nhóm có thể tăng số lượng nhưng chưa chắc sửa được vấn đề phạm vi. Hãy mô tả rõ đối tượng, cách chọn mẫu và giới hạn khái quát hóa.

Lỗi cuối là báo cáo ngưỡng mà không nêu nguồn. Khi đưa KMO, Alpha, factor loading hoặc quy tắc cỡ mẫu vào luận văn, ghi nguồn ngay trong câu và giữ cách diễn giải nhất quán. Nếu đang xem các chủ đề thao tác SPSS khác, bạn có thể mở chủ đề SPSS để đối chiếu menu và tên bảng output.

Câu hỏi thường gặp

Mẫu bao nhiêu thì được xem là quá nhỏ

Không có một con số duy nhất cho mọi đề tài. Bạn cần xét loại phân tích, số biến độc lập, số biến quan sát, chất lượng dữ liệu và mục tiêu suy luận. Với hồi quy, một mốc thường được trích dẫn là 50 + 8m, trong đó m là số biến độc lập, theo (Tabachnick và Fidell, 2013). Đây là mốc tham khảo, không phải kết luận tự động.

Mẫu nhỏ có chạy được SPSS không

SPSS thường vẫn chạy và xuất bảng khi mẫu nhỏ. Vấn đề nằm ở độ ổn định và khả năng diễn giải của kết quả, không chỉ ở việc phần mềm có hoàn thành lệnh hay không. Bạn cần báo cáo Valid N, kiểm tra giả định, xem outlier và nói rõ giới hạn cỡ mẫu.

Có nên bỏ bớt biến để đủ tỷ lệ mẫu không

Chỉ bỏ biến khi có căn cứ từ nội dung thang đo, độ tin cậy, cấu trúc nhân tố hoặc mô hình lý thuyết. Không nên xóa biến chỉ vì muốn đạt một tỷ lệ đẹp. Nếu việc bỏ biến làm thay đổi khái niệm nghiên cứu, hãy trao đổi với giảng viên trước khi chạy lại.

Mẫu nhỏ có được chạy EFA không

Có thể chạy về mặt thao tác, nhưng mức độ tin cậy cần được đánh giá cẩn thận. Xem KMO, Bartlett, communalities, factor loading và số biến trên mỗi nhân tố cùng lúc. Mốc KMO từ 0.5 trở lên thường được dẫn theo (Kaiser, 1974), còn factor loading từ 0.5 trở lên được dẫn theo (Hair và cộng sự, 2010). Các mốc này không biến một mẫu rất nhỏ thành mẫu đủ mạnh.

Thu thêm dữ liệu có làm kết quả chắc chắn đạt không

Không. Thu thêm giúp tăng thông tin và có thể làm ước lượng ổn định hơn, nhưng không bảo đảm Alpha, KMO, p-value hay R² sẽ đạt một mốc cụ thể. Bạn vẫn phải giữ đúng tiêu chí chọn mẫu, kiểm tra chất lượng phản hồi và báo cáo quy trình.

Bây giờ hãy mở bản sao dữ liệu, ghi lại Valid N của từng biến, kiểm tra Filter và Missing trước khi loại thêm bất kỳ dòng nào, rồi lập bảng theo dõi để trao đổi với giảng viên. Nếu bạn cần chạy phân tích trên chính file .sav hoặc .csv và giữ lại toàn bộ dấu vết xử lý, M4 phân tích của DoThesis thực hiện bước này cùng bạn.