Phương sai là gì? Cách tính, đọc kết quả và phân biệt với độ lệch chuẩn
Phương sai là gì
Phương sai là chỉ số mô tả mức độ phân tán của các giá trị quanh giá trị trung bình. Khi phương sai nhỏ, các quan sát thường nằm gần trung bình. Khi phương sai lớn, dữ liệu trải rộng hơn và có thể xuất hiện khoảng cách đáng kể giữa các quan sát.
Trong nghiên cứu định lượng, bạn thường gặp phương sai trong bảng Descriptive Statistics của SPSS, cùng với N, Minimum, Maximum, Mean và Std. Deviation. Đơn vị của phương sai là đơn vị đo ban đầu được bình phương. Chẳng hạn, nếu biến thu nhập đo bằng triệu đồng thì phương sai có đơn vị là triệu đồng bình phương. Vì vậy, phương sai hữu ích cho tính toán, nhưng độ lệch chuẩn thường dễ diễn giải hơn khi viết luận văn.
Với một tổng thể gồm N quan sát, công thức phương sai tổng thể là:
σ² = Σ(xᵢ - μ)² / N
Với một mẫu gồm n quan sát, công thức thường dùng là:
s² = Σ(xᵢ - x̄)² / (n - 1)
Trong đó, xᵢ là từng giá trị quan sát, x̄ là trung bình mẫu, μ là trung bình tổng thể, N là kích thước tổng thể và n là kích thước mẫu. Việc chia cho n - 1 giúp ước lượng phương sai tổng thể từ dữ liệu mẫu theo cách phù hợp hơn.
Ví dụ, với ba giá trị 2, 4 và 6, trung bình là 4. Tổng bình phương độ lệch so với trung bình là (2 - 4)² + (4 - 4)² + (6 - 4)² = 8. Phương sai tổng thể là 8 / 3, còn phương sai mẫu là 8 / 2. Bạn có thể xem thêm công thức tính phương sai nếu cần kiểm tra từng bước tính bằng tay.
Ý nghĩa của phương sai trong nghiên cứu định lượng
Phương sai cho biết dữ liệu có đồng đều hay phân tán. Đây là thông tin nền trước khi bạn chạy hồi quy, kiểm định trung bình hoặc đọc các chỉ số khác. Một biến có phương sai bằng 0 nghĩa là mọi người trả lời cùng một giá trị. Biến đó không cung cấp thông tin để phân biệt các quan sát.
Trong bảng hỏi Likert, phương sai giúp bạn phát hiện biến quan sát có câu trả lời quá tập trung. Ví dụ, gần như toàn bộ người trả lời chọn mức 5 cho một biến. Trung bình của biến có thể cao, nhưng phương sai rất nhỏ, cho thấy biến này ít tạo ra khác biệt giữa các đáp viên.
Phương sai cũng liên quan đến độ lệch chuẩn theo công thức độ lệch chuẩn = căn bậc hai của phương sai. Vì phép căn bậc hai đưa chỉ số trở về đơn vị ban đầu, độ lệch chuẩn thường được đưa vào bảng mô tả. Bạn không nên nhìn phương sai như một điểm đạt hoặc không đạt độc lập, mà cần đặt nó cạnh thang đo, trung bình, khoảng giá trị và mục tiêu phân tích.
Khi so sánh hai biến cùng thang đo, phương sai lớn hơn cho thấy mức độ phân tán lớn hơn. Tuy nhiên, nếu hai biến có đơn vị khác nhau, việc so sánh phương sai trực tiếp có thể gây hiểu nhầm. Một biến đo bằng nghìn đồng và một biến đo bằng điểm Likert có độ lớn phương sai ở hai hệ đơn vị khác nhau.
Phương sai còn xuất hiện trong nhiều khái niệm thống kê khác. Trong hồi quy, bạn quan tâm đến phần biến thiên của biến phụ thuộc được mô hình giải thích thông qua R². Trong phân tích nhân tố, tổng phương sai trích giúp mô tả lượng biến thiên được các nhân tố giữ lại, nhưng đây là một chỉ số khác với phương sai của từng biến. Bạn cần đọc đúng tên bảng và tên cột trong output trước khi kết luận.
Phương sai bao nhiêu là đạt
Câu hỏi “phương sai bao nhiêu là tốt” không có một ngưỡng chung dùng cho mọi đề tài. Phương sai phụ thuộc vào thang đo, khoảng giá trị, cách mã hóa và đặc điểm mẫu. Một phương sai lớn chưa tự động có nghĩa dữ liệu lỗi. Một phương sai nhỏ cũng chưa chứng minh thang đo tốt.
Bạn nên kiểm tra theo thứ tự: biến có đủ số giá trị khác nhau không, khoảng Minimum và Maximum có hợp lý không, trung bình có nằm trong phạm vi thang đo không, dữ liệu có giá trị nhập sai không, và có outlier chi phối hay không. Nếu biến Likert 1 đến 5 có phương sai rất nhỏ, hãy xem tần suất từng mức trả lời. Nếu biến liên tục có phương sai lớn, hãy kiểm tra đơn vị đo và phân phối trước khi loại quan sát.
Bảng dưới đây là các mốc liên quan thường được dùng khi đánh giá dữ liệu định lượng. Đây không phải bảng ngưỡng “đạt” riêng cho phương sai, vì nguồn phương pháp không quy định một giá trị phương sai chung cho mọi biến.
| Nội dung cần kiểm tra | Mốc tham khảo | Cách hiểu | Nguồn |
|---|---|---|---|
| Phương sai của một biến | Không có ngưỡng chung | Đánh giá theo thang đo, phạm vi giá trị và mục tiêu nghiên cứu | Không áp dụng ngưỡng cố định |
| Phương sai bằng 0 | 0 | Biến không có biến thiên, cần xem xét loại khỏi phân tích phù hợp | Không áp dụng ngưỡng cố định |
| Độ lệch chuẩn | Căn bậc hai của phương sai | Đưa mức phân tán về cùng đơn vị với biến | Không áp dụng ngưỡng cố định |
| Số quan sát trên mỗi biến quan sát khi thiết kế thang đo | 5 đến 10 quan sát cho một biến quan sát | Mốc tham khảo cho kế hoạch dữ liệu và phân tích nhân tố | (Hair và cộng sự, 2010) |
| Kích thước mẫu hồi quy | Từ 50 + 8m, với m là số biến độc lập | Mốc tham khảo khi lập kế hoạch hồi quy | (Tabachnick và Fidell, 2013) |
Hai dòng cuối là điều kiện về dữ liệu và cỡ mẫu, không phải ngưỡng của phương sai. Chúng được đặt cạnh nhau để bạn không nhầm câu hỏi “phương sai bao nhiêu là tốt” với câu hỏi “mẫu bao nhiêu là đủ”. Nếu cần xác định cỡ mẫu theo tổng thể hữu hạn, bạn có thể tham khảo trung vị cho phần thống kê mô tả và tách riêng việc chọn mẫu theo công thức phù hợp.
Cách đọc phương sai trên output
Trong SPSS, mở Analyze > Descriptive Statistics > Descriptives. Đưa biến cần kiểm tra vào ô Variable(s), chọn Options, tích Mean, Std. deviation, Variance, Minimum và Maximum, sau đó chọn Continue rồi OK. SPSS sẽ tạo bảng Descriptive Statistics.
Số liệu minh họa
Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột được trình bày theo cách SPSS thường hiển thị trong bảng Descriptive Statistics.
| Descriptive Statistics | N | Minimum | Maximum | Mean | Std. Deviation | Variance |
|---|---|---|---|---|---|---|
| SAT1 | 180 | 1.00 | 5.00 | 3.72 | 0.846 | 0.716 |
| SAT2 | 180 | 1.00 | 5.00 | 3.65 | 0.921 | 0.848 |
| SAT3 | 180 | 2.00 | 5.00 | 3.81 | 0.733 | 0.537 |
| Valid N (listwise) | 180 |
Cách đọc dòng SAT1 là có 180 quan sát hợp lệ. Giá trị nhỏ nhất là 1, lớn nhất là 5, trung bình là 3.72. Độ lệch chuẩn là 0.846 và phương sai là 0.716. Về mặt tính toán, 0.846² xấp xỉ 0.716.
Dòng Valid N (listwise) cần được đọc cẩn thận. Nếu bạn chạy nhiều biến và chọn loại bỏ theo danh sách, SPSS chỉ giữ những dòng có dữ liệu đầy đủ cho toàn bộ biến. Vì vậy, N trong từng dòng có thể khác nhau nếu bạn xử lý missing theo cách khác.
Nếu phương sai của SAT3 nhỏ hơn SAT2, câu trả lời cho SAT3 tập trung hơn quanh trung bình. Bạn chưa thể viết rằng SAT3 tốt hơn SAT2. Chỉ số này đang mô tả mức phân tán, không đánh giá độ tin cậy hay giá trị của thang đo.
Trong bảng Frequencies, bạn có thể xem thêm số lượng và tỷ lệ ở từng mức trả lời. Vào Analyze > Descriptive Statistics > Frequencies, đưa biến vào ô phân tích và chọn Display frequency tables. Đây là bước cần thiết khi phương sai quá nhỏ hoặc khi Minimum, Maximum không đúng với thang đo dự kiến.
Khi phương sai không đạt thì xử lý thế nào
Trước hết, đừng xóa biến chỉ vì phương sai lớn hoặc nhỏ hơn biến khác. Hãy kiểm tra dữ liệu gốc, mã hóa và bối cảnh thu thập theo trình tự dưới đây.
Kiểm tra lỗi nhập và mã hóa
Đối chiếu Minimum và Maximum với bảng hỏi. Nếu thang đo chỉ từ 1 đến 5 nhưng output có giá trị 55, 0 hoặc 99, có thể bạn đã nhập sai hoặc đang dùng mã cho câu trả lời thiếu. Cần sửa trong file dữ liệu gốc hoặc mã hóa missing đúng cách, sau đó chạy lại.
Bạn cũng kiểm tra các biến đảo chiều. Nếu một biến cần reverse coding mà chưa được đảo, phương sai của riêng biến đó chưa chắc bất thường, nhưng nó có thể làm sai Cronbach's Alpha và các phân tích tiếp theo. Ghi lại phiên bản dữ liệu trước và sau khi sửa để có thể giải trình.
Kiểm tra phân phối và outlier
Dùng Analyze > Descriptive Statistics > Explore để xem thêm biểu đồ, trung vị và các giá trị bất thường. Có thể mở outlier để rà lại cách nhận diện quan sát lệch khỏi phần lớn dữ liệu.
Một outlier chỉ nên bị loại khi bạn có lý do dữ liệu rõ ràng, chẳng hạn giá trị nằm ngoài phạm vi có thể xảy ra hoặc phiếu có dấu hiệu nhập sai. Không nên xóa hàng loạt quan sát chỉ để làm phương sai nhỏ hơn. Nếu giữ outlier, hãy ghi nhận cách nó ảnh hưởng đến mô tả và phân tích.
Xem lại cách chọn biến và thang đo
Nếu một biến gần như không có biến thiên vì toàn bộ đáp viên chọn cùng một mức, nguyên nhân có thể nằm ở cách đặt câu hỏi, đối tượng khảo sát hoặc bối cảnh thực tế. Khi đó, loại biến có thể là lựa chọn hợp lý trong một số phân tích, nhưng bạn cần nêu lý do và kiểm tra tác động đến mô hình.
EFA, Cronbach's Alpha và hồi quy có tiêu chí riêng. Phương sai không thay thế cho Corrected Item-Total Correlation, Factor Loading, VIF hay p-value. Ví dụ, Corrected Item-Total Correlation từ 0.3 trở lên là mốc thường được dùng theo (Nunnally và Bernstein, 1994), nhưng mốc này không phải ngưỡng phương sai.
Phân biệt phương sai với độ lệch chuẩn
Phương sai và độ lệch chuẩn đều đo mức độ phân tán quanh trung bình. Điểm khác nhau nằm ở đơn vị và cách diễn giải. Phương sai là trung bình của bình phương độ lệch, còn độ lệch chuẩn là căn bậc hai của phương sai.
Nếu biến SAT1 có phương sai 0.716 thì độ lệch chuẩn xấp xỉ 0.846. Phương sai thuận tiện khi tính toán và xây dựng các chỉ số thống kê. Độ lệch chuẩn dễ trình bày hơn vì vẫn dùng đơn vị của biến ban đầu.
Bạn cũng không nên nhầm phương sai với khoảng biến thiên. Khoảng biến thiên là Maximum - Minimum, chỉ dựa trên hai giá trị biên. Phương sai sử dụng toàn bộ các quan sát, nên phản ánh mức phân tán tổng thể tốt hơn, dù vẫn bị ảnh hưởng bởi outlier.
Trung bình và trung vị cũng là chỉ số khác. Trung bình mô tả vị trí trung tâm theo tổng giá trị chia cho số quan sát. Trung vị là giá trị ở giữa sau khi sắp xếp dữ liệu. Khi phân phối lệch hoặc có outlier, nên xem trung bình, trung vị, độ lệch chuẩn và phương sai cùng lúc.
Lỗi thường gặp
Lỗi đầu tiên là tìm một con số chung để kết luận phương sai “đạt”. Cách làm này bỏ qua đơn vị đo và phạm vi thang đo. Với thang Likert 1 đến 5, phương sai không thể được diễn giải giống biến thu nhập hoặc số lần mua hàng.
Lỗi thứ hai là đọc nhầm Std. Deviation thành Variance. Nếu cần phương sai, bạn phải xem đúng cột Variance. Nếu bảng chỉ có Std. Deviation, phương sai bằng bình phương độ lệch chuẩn, với sai số làm tròn do SPSS hiển thị số thập phân giới hạn.
Lỗi thứ ba là dùng phương sai để thay thế kiểm định độ tin cậy. Một biến có phương sai hợp lý vẫn có thể không phù hợp với các biến khác trong cùng thang đo. Bạn cần chạy quy trình phù hợp như Analyze > Scale > Reliability Analysis khi đánh giá Cronbach's Alpha.
Lỗi thứ tư là xóa outlier mà không lưu phiên bản dữ liệu ban đầu. Hội đồng có thể hỏi vì sao số quan sát thay đổi. Hãy tạo biến hoặc file phiên bản mới, ghi rõ tiêu chí kiểm tra và báo cáo số quan sát trước, sau khi xử lý.
Lỗi cuối là so sánh phương sai giữa các biến khác đơn vị. Khi đó, độ lớn tuyệt đối không còn nhiều ý nghĩa. Bạn cần chuyển sang chỉ số phù hợp hoặc trình bày từng biến trong bối cảnh đo lường của nó.
Câu hỏi thường gặp
Phương sai là gì trong thống kê?
Phương sai là mức độ phân tán của các giá trị quanh trung bình, được tính bằng trung bình của bình phương độ lệch so với trung bình. Phương sai càng lớn thì dữ liệu thường phân tán càng rộng, nhưng không có nghĩa biến đó tốt hơn.
Phương sai bao nhiêu là tốt?
Không có một ngưỡng phương sai chung cho mọi nghiên cứu. Bạn cần xem phương sai cùng Minimum, Maximum, Mean, độ lệch chuẩn, phân phối và thang đo. Với biến có phương sai bằng 0, dữ liệu không có biến thiên và cần được kiểm tra trước khi đưa vào phân tích.
Phương sai và độ lệch chuẩn khác nhau thế nào?
Độ lệch chuẩn là căn bậc hai của phương sai. Phương sai có đơn vị bình phương, còn độ lệch chuẩn cùng đơn vị với biến gốc, vì vậy độ lệch chuẩn thường dễ đọc hơn trong bảng mô tả.
Vì sao phương sai trong SPSS không bằng bình phương độ lệch chuẩn tuyệt đối?
Thông thường hai giá trị gần bằng nhau sau khi bình phương. Chênh lệch nhỏ có thể đến từ việc SPSS chỉ hiển thị độ lệch chuẩn đã làm tròn, trong khi phép tính phương sai dùng giá trị chính xác hơn ở phía sau.
Phương sai lớn có phải dữ liệu bị lỗi không?
Phương sai lớn chỉ cho thấy dữ liệu phân tán nhiều. Bạn cần kiểm tra đơn vị, phạm vi hợp lệ, outlier và cách nhập dữ liệu. Chỉ loại quan sát hoặc biến khi có lý do phương pháp và dữ liệu rõ ràng, không loại chỉ để làm chỉ số đẹp hơn.
Mở file SPSS của bạn, chạy Analyze > Descriptive Statistics > Descriptives, kiểm tra đồng thời Variance, Std. Deviation, Minimum, Maximum và N, rồi ghi lại những biến cần rà soát trước khi chạy phân tích tiếp theo; nếu bạn muốn xử lý số liệu .sav hoặc .csv theo đúng quy trình, M4 phân tích dữ liệu là module thực hiện bước này.