Số quan sát trên một biến quan sát là gì?
Số quan sát trên một biến quan sát là gì
“Số quan sát trên một biến quan sát” là tỷ lệ giữa số phiếu hợp lệ dùng để phân tích và số biến quan sát trong bảng hỏi. Trong nhiều luận văn định lượng, bạn sẽ gặp cách viết “cỡ mẫu tối thiểu bằng 5 đến 10 lần số biến quan sát”. Chẳng hạn, bảng hỏi có 30 biến quan sát và bạn giữ lại 180 phiếu hợp lệ, tỷ lệ là 180 / 30 = 6 số quan sát trên một biến quan sát.
Công thức kiểm tra rất đơn giản:
Số quan sát trên một biến quan sát = số quan sát hợp lệ / tổng số biến quan sát đưa vào phân tích.
Ở đây, “số quan sát” thường là số người trả lời hoặc số dòng dữ liệu hợp lệ. “Biến quan sát” là các item đo lường những khái niệm như chất lượng dịch vụ, ý định mua, sự hài lòng hoặc perceived usefulness. Một biến nhân khẩu học như giới tính hay độ tuổi có thể xuất hiện trong file SPSS, nhưng không nhất thiết được tính vào số biến quan sát của thang đo nếu bạn không dùng nó để chạy EFA, hồi quy hoặc mô hình đo lường.
Bạn nên phân biệt số phiếu thu được với số quan sát hợp lệ. Nếu có 250 người trả lời nhưng 22 phiếu bị loại vì bỏ trống nhiều câu, số dùng trong công thức là 228. Khi kiểm tra cỡ mẫu, hãy xem số dòng thực sự được đưa vào phân tích, không lấy con số phát ra từ link khảo sát.
Ý nghĩa của số quan sát trên một biến quan sát trong nghiên cứu định lượng
Tỷ lệ này giúp bạn đánh giá nhanh dữ liệu có đủ nền tảng để phân tích thang đo hay chưa. Khi tỷ lệ quá thấp, kết quả EFA có thể thiếu ổn định, các nhóm nhân tố dễ thay đổi giữa những lần chạy, và hệ số tải nhân tố khó giải thích. Với hồi quy, số quan sát còn liên quan đến số biến độc lập và mức độ phức tạp của mô hình.
Tỷ lệ này không tự động chứng minh dữ liệu tốt. Một bộ dữ liệu có tỷ lệ 10 vẫn có thể gặp vấn đề do người trả lời chọn cùng một mức cho mọi item, có nhiều outlier, trả lời thiếu hoặc mẫu bị lệch quá mạnh so với đối tượng nghiên cứu. Bạn cần xem đồng thời chất lượng phiếu, cách chọn mẫu, missing values và mục tiêu phân tích.
Đối với EFA, quy tắc thường được dùng là có từ 5 đến 10 quan sát cho mỗi biến quan sát (Hair và cộng sự, 2010). Đây là quy tắc lập kế hoạch cỡ mẫu, không phải điều kiện duy nhất để phần mềm SPSS cho phép chạy. SPSS vẫn có thể chạy EFA với tỷ lệ thấp hơn, nhưng việc chạy được không đồng nghĩa kết quả đủ thuyết phục để đưa vào luận văn.
Nếu bạn đang xác định số phiếu cần thu, hãy xem thêm bài cỡ mẫu là gì, tính cỡ mẫu và phương pháp chọn mẫu. Ba khái niệm này liên quan với nhau nhưng không thể thay thế cho nhau. Cỡ mẫu là số lượng cần có, còn số quan sát trên một biến quan sát là một tỷ lệ kiểm tra sau khi bạn biết số biến và số phiếu hợp lệ.
Số quan sát trên một biến quan sát bao nhiêu là tốt
Không có một con số duy nhất phù hợp cho mọi đề tài. Mốc 5 đến 10 quan sát cho một biến quan sát thường được dùng trong nghiên cứu định lượng, đặc biệt khi bạn dự kiến chạy EFA. Mốc cụ thể cần được giải thích cùng với loại phân tích, số lượng biến, chất lượng dữ liệu và yêu cầu của giảng viên hướng dẫn.
Bảng dưới đây giúp bạn kiểm tra nhanh. Các ngưỡng trong bảng là quy tắc tham khảo và mỗi dòng đều ghi nguồn để bạn có thể đối chiếu khi viết chương 3.
| Nội dung cần kiểm tra | Ngưỡng hoặc cách hiểu | Nguồn |
|---|---|---|
| Số quan sát trên một biến quan sát | Từ 5 đến 10 quan sát cho mỗi biến quan sát | (Hair và cộng sự, 2010) |
| Cỡ mẫu hồi quy theo số biến độc lập | Từ 50 + 8m quan sát trở lên, trong đó m là số biến độc lập | (Tabachnick và Fidell, 2013) |
| Mức KMO khi chạy EFA | Từ 0.5 trở lên | (Kaiser, 1974) |
| Factor loading khi đánh giá EFA | Từ 0.5 trở lên | (Hair và cộng sự, 2010) |
| Total variance explained | Từ 50% trở lên | (Hair và cộng sự, 2010) |
| Cronbach's Alpha cho thang đo thông thường | Từ 0.7 trở lên | (Nunnally, 1978) |
| Cronbach's Alpha cho thang đo khám phá | Có thể từ 0.6 trở lên | (Hair và cộng sự, 2010) |
Ví dụ, bảng hỏi của bạn có 24 biến quan sát dùng cho EFA. Theo tỷ lệ 5 đến 10 lần, số phiếu hợp lệ nên nằm trong khoảng 120 đến 240. Nếu bạn có 156 phiếu hợp lệ, tỷ lệ là 6.5. Con số này nằm trong khoảng tham khảo, nhưng bạn vẫn phải kiểm tra KMO, Bartlett's Test, factor loading và Total Variance Explained trong output.
Nếu mô hình hồi quy có 6 biến độc lập, quy tắc 50 + 8m cho ra 98 quan sát. Tuy nhiên, nếu cùng bộ dữ liệu đó có 24 biến quan sát và bạn chạy EFA trước, yêu cầu theo tỷ lệ item có thể cao hơn. Khi nhiều quy tắc cùng áp dụng, bạn nên lập kế hoạch theo yêu cầu chặt hơn, đồng thời dự phòng phiếu không hợp lệ.
Cách đọc số quan sát trên một biến quan sát trong SPSS
Trong SPSS, bạn không tìm thấy một bảng có tên chính xác là “số quan sát trên một biến quan sát”. Bạn phải lấy số quan sát hợp lệ từ output hoặc từ số dòng dữ liệu, sau đó chia cho số biến quan sát thực sự đưa vào phân tích.
Giả sử bạn có 210 dòng dữ liệu ban đầu. Sau khi loại các phiếu trả lời thiếu quá nhiều, còn 192 dòng. Thang đo gồm 28 biến quan sát, ký hiệu từ HL1 đến HL8, CL1 đến CL10 và YD1 đến YD10. Tỷ lệ cần tính là 192 / 28 = 6.86.
Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu cụ thể. Tên cột được mô phỏng theo các bảng SPSS bạn thường gặp.
| Bảng output SPSS | Chỉ số hoặc dòng minh họa | Giá trị minh họa | Cách dùng |
|---|---|---|---|
| Case Processing Summary | Valid N | 192 | Số quan sát hợp lệ |
| Case Processing Summary | Excluded N | 18 | Số quan sát bị loại trong phép tính đó |
| Reliability Statistics | Cronbach's Alpha | 0.842 | Đánh giá độ tin cậy thang đo |
| Reliability Statistics | N of Items | 28 | Số biến quan sát được đưa vào thang đo |
| KMO and Bartlett's Test | Kaiser-Meyer-Olkin Measure | 0.781 | Kiểm tra mức phù hợp cho EFA |
| Total Variance Explained | Cumulative % | 61.438 | Phương sai trích lũy kế minh họa |
| Rotated Component Matrix | HL3, Component 1 | 0.724 | Factor loading của một biến |
Từ hai dòng Valid N = 192 và N of Items = 28, bạn tính 192 / 28 = 6.86. Trong trường hợp bạn chạy Cronbach's Alpha riêng cho từng thang đo, N of Items có thể chỉ là số item của thang đo đó. Vì vậy, hãy xác định bạn đang tính tỷ lệ cho toàn bộ bảng hỏi hay cho một nhóm biến dùng trong một phân tích cụ thể.
Khi chạy Cronbach's Alpha, vào Analyze > Scale > Reliability Analysis. Đưa các biến của cùng một thang đo vào ô Items, chọn Model: Alpha, rồi bấm Statistics và đánh dấu Scale if item deleted, Item và Scale. Bảng Reliability Statistics cho biết Alpha và số item. Bảng Item-Total Statistics giúp bạn xem Corrected Item-Total Correlation và Alpha nếu loại biến.
Khi chạy EFA, vào Analyze > Dimension Reduction > Factor. Đưa các biến cần phân tích vào ô Variables. Trong Descriptives, chọn KMO and Bartlett's test; trong Extraction, có thể chọn Eigenvalues greater than 1; trong Rotation, chọn phương pháp xoay phù hợp với thiết kế nghiên cứu. Output thường gồm KMO and Bartlett's Test, Total Variance Explained và Rotated Component Matrix.
Bạn không nên lấy số biến trong toàn bộ file Data View một cách máy móc. Nếu file có 40 cột nhưng chỉ 28 cột là item của các thang đo, tỷ lệ phục vụ EFA phải dựa trên 28 biến đó. Các cột mã phiếu, giới tính, tuổi, nghề nghiệp và thu nhập cần được tách khỏi phần biến quan sát nếu chúng không phải item đo lường khái niệm.
Khi số quan sát trên một biến quan sát không đạt thì xử lý thế nào
Trước hết, kiểm tra lại phép tính. Nhiều bạn chia số phiếu phát ra cho số item, hoặc đếm cả biến nhân khẩu học vào mẫu số. Hãy xác định số dòng hợp lệ trong file .sav hoặc .csv, sau đó lập danh sách các biến thật sự dùng trong Cronbach's Alpha và EFA.
Tiếp theo, kiểm tra phiếu không hợp lệ theo một tiêu chí đã được ghi trước. Bạn có thể xem các trường hợp bỏ trống hàng loạt, thời gian trả lời bất thường nếu có dữ liệu thời gian, hoặc kiểu trả lời một mức cho toàn bộ bảng hỏi. Việc loại phiếu cần có lý do và số lượng rõ ràng. Không nên xóa tùy tiện chỉ để tỷ lệ tăng lên.
Nếu còn thời gian thu thập dữ liệu, phương án dễ giải trình nhất là thu thêm đúng đối tượng nghiên cứu. Hãy giữ nguyên tiêu chí sàng lọc, cách mã hóa và phiên bản bảng hỏi, trừ khi bạn có lý do phương pháp rõ ràng để điều chỉnh. Bạn có thể dùng cỡ mẫu của mẫu số liệu là gì để rà lại cách phân biệt mẫu dự kiến với mẫu thực tế.
Nếu không thể thu thêm, hãy trao đổi với giảng viên về việc giảm phạm vi phân tích hoặc loại những biến quan sát có cơ sở lý thuyết yếu. Việc giảm item chỉ để đạt tỷ lệ 10 có thể làm thay đổi nội dung khái niệm. Trong EFA, bạn có thể xem xét loại biến có factor loading thấp hoặc tải chéo cao, nhưng quyết định phải dựa vào output và ý nghĩa đo lường, không chỉ dựa vào mong muốn tăng tỷ lệ.
Bạn cũng cần phân biệt thiếu cỡ mẫu với thang đo kém. Có đủ 300 phiếu không sửa được một item diễn đạt mơ hồ, và có 180 phiếu không làm cho dữ liệu tự động đạt KMO. Khi báo cáo, hãy ghi số phiếu phát ra, số phiếu thu về, số phiếu loại, số phiếu hợp lệ và số biến quan sát cuối cùng.
Phân biệt số quan sát trên một biến quan sát với cỡ mẫu và số biến quan sát
Cỡ mẫu là tổng số đơn vị được đưa vào nghiên cứu hoặc phân tích. Nếu có 192 người trả lời hợp lệ, cỡ mẫu thực tế có thể được báo cáo là 192. Bạn có thể đọc thêm về cỡ mẫu là gì để phân biệt cỡ mẫu tổng thể, cỡ mẫu dự kiến và cỡ mẫu hợp lệ.
Số biến quan sát là số item dùng để đo các biến tiềm ẩn. Ví dụ, khái niệm sự hài lòng có 4 item HL1 đến HL4, chất lượng dịch vụ có 5 item CL1 đến CL5. Tổng số biến quan sát của hai thang đo là 9, nếu cả 9 item đều được đưa vào phép tính.
Số quan sát trên một biến quan sát là tỷ lệ 192 / 9 = 21.33 trong ví dụ trên. Nó không phải một cột mới trong SPSS và không phải một loại biến. Đây là phép kiểm tra cỡ mẫu theo số item.
Cũng cần phân biệt tỷ lệ này với số biến độc lập trong hồi quy. Một thang đo có 5 item có thể được tính điểm trung bình thành một biến độc lập. Khi chạy hồi quy, mô hình có thể chỉ có 4 biến độc lập dù trước đó bảng hỏi có hàng chục biến quan sát. Vì vậy, khi áp dụng quy tắc 50 + 8m, m là số biến độc lập trong mô hình hồi quy, không phải tổng số item của bảng hỏi (Tabachnick và Fidell, 2013).
Lỗi thường gặp
Đếm sai mẫu số. Bạn đưa 28 item vào EFA nhưng lại chia cho 35 cột trong file, gồm cả mã đáp viên và biến nhân khẩu học. Hãy lập danh sách biến trước khi tính.
Dùng số phiếu thu về thay cho số phiếu hợp lệ. Một phiếu bị bỏ trống nhiều câu không nên được tính ngang với một phiếu đủ dữ liệu. Valid N trong output của từng phân tích có thể thay đổi nếu bạn có missing values.
Xem mốc 5 đến 10 như luật cứng. Đây là quy tắc tham khảo có nguồn, không phải bằng chứng duy nhất rằng mô hình đạt. Bạn vẫn phải đọc KMO, Bartlett's Test, factor loading và phương sai trích.
Loại item chỉ để tăng tỷ lệ. Xóa biến làm thay đổi nội dung thang đo. Nếu loại, bạn cần ghi rõ lý do, kết quả trước và sau khi loại, đồng thời kiểm tra ý nghĩa lý thuyết.
Trộn EFA với PLS-SEM. Nếu bạn dùng SmartPLS, quy trình đánh giá còn có outer loading, CR, AVE, HTMT và VIF. Không nên lấy một ngưỡng của EFA trong SPSS để kết luận toàn bộ mô hình PLS-SEM.
Không ghi lại các vòng chạy. Khi EFA phải loại hai hoặc ba item, hãy lưu output từng vòng và ghi lý do. Điều này giúp bạn trả lời khi giảng viên hỏi vì sao số biến quan sát trong chương 3 khác chương 4.
Câu hỏi thường gặp
Số quan sát trên một biến quan sát bao nhiêu là tốt?
Mốc thường được dùng là từ 5 đến 10 quan sát cho mỗi biến quan sát khi lập kế hoạch cho EFA (Hair và cộng sự, 2010). Bạn nên xem đây là khoảng tham khảo, sau đó kiểm tra thêm chất lượng dữ liệu và yêu cầu của mô hình.
Có 100 mẫu cho 20 biến quan sát có đủ không?
Tỷ lệ là 100 / 20 = 5, nằm ở ngưỡng thấp của quy tắc tham khảo. Bạn vẫn cần xem mục tiêu phân tích, số biến độc lập, KMO, Bartlett's Test và kết quả EFA. Nếu chạy hồi quy với nhiều biến độc lập, hãy kiểm tra thêm quy tắc 50 + 8m.
Số quan sát trên một biến quan sát trong SPSS xem ở đâu?
SPSS không có chỉ số riêng mang tên này. Bạn lấy Valid N từ Case Processing Summary hoặc số dòng hợp lệ, lấy số item từ N of Items hoặc danh sách biến trong phân tích, rồi chia hai số cho nhau.
Có được xóa biến quan sát để tỷ lệ đạt không?
Bạn có thể loại biến khi có lý do phương pháp như corrected item-total correlation thấp, factor loading thấp hoặc tải chéo không phù hợp. Không nên xóa chỉ vì muốn đạt tỷ lệ 5 đến 10. Mỗi lần loại cần được ghi lại và giải thích trong luận văn.
Dữ liệu có 200 phiếu nhưng output chỉ có 186 quan sát, dùng số nào?
Nếu 14 phiếu bị loại trong phép phân tích đó, bạn dùng 186. Hãy kiểm tra nguyên nhân chênh lệch, chẳng hạn missing values hoặc bộ lọc dữ liệu. Trong luận văn, báo cáo riêng số phiếu thu về, số phiếu hợp lệ và số quan sát được dùng ở từng phân tích nếu các con số khác nhau.
Mở file .sav hoặc .csv của bạn, lập hai con số ngay trên một tờ ghi chú: số dòng hợp lệ và tổng số biến quan sát thực sự đưa vào phân tích, rồi tính tỷ lệ trước khi chạy Cronbach's Alpha hoặc EFA; nếu cần chạy phân tích trên chính dữ liệu của bạn, bạn có thể dùng M4 phân tích của DoThesis.