Công thức tính phương sai và cách đọc kết quả trong SPSS

Thống kê··14 phút đọc

Công thức tính phương sai là gì

Phương sai là chỉ số cho biết các giá trị trong một tập dữ liệu phân tán quanh giá trị trung bình đến mức nào. Nếu phương sai nhỏ, các quan sát thường nằm gần trung bình. Nếu phương sai lớn, dữ liệu phân tán rộng hơn. Trong file SPSS, bạn thường gặp phương sai với tên Variance, còn độ lệch chuẩn có tên Std. Deviation.

Bạn có thể xem thêm chủ đề Thống kê nếu đang xử lý nhiều chỉ số mô tả khác nhau. Với một dãy số x₁, x₂, ..., xₙ, trước hết cần tính trung bình cộng:

x̄ = (x₁ + x₂ + ... + xₙ) / n

Công thức phương sai tổng thể là:

σ² = Σ(xᵢ - μ)² / N

Trong đó, μ là trung bình của tổng thể và N là số phần tử của tổng thể. Khi dữ liệu chỉ là một mẫu lấy từ tổng thể lớn hơn, công thức phương sai mẫu là:

s² = Σ(xᵢ - x̄)² / (n - 1)

Điểm dễ nhầm nằm ở mẫu số. Phương sai tổng thể chia cho N, còn phương sai mẫu chia cho n - 1. Trong nghiên cứu luận văn, dữ liệu khảo sát thường được xem là một mẫu của nhóm đối tượng rộng hơn, vì vậy phần mềm thường báo cáo phương sai mẫu.

Ví dụ, với ba quan sát 2, 4 và 6, trung bình là 4. Tổng bình phương độ lệch là (2 - 4)² + (4 - 4)² + (6 - 4)² = 8. Phương sai tổng thể là 8 / 3 = 2,67, còn phương sai mẫu là 8 / 2 = 4. Hai kết quả khác nhau vì hai công thức trả lời hai câu hỏi khác nhau.

Nếu muốn xem riêng cách trình bày công thức, bạn có thể tham khảo bài công thức phương sai. Bài này tập trung vào cách hiểu chỉ số và cách dùng nó khi đọc dữ liệu định lượng.

Ý nghĩa của công thức tính phương sai trong nghiên cứu định lượng

Trong nghiên cứu định lượng, phương sai giúp bạn mô tả mức độ biến động của biến quan sát hoặc biến kết quả. Khi báo cáo một biến như thu nhập, mức độ hài lòng, ý định mua hoặc điểm trung bình thang đo, bạn thường trình bày trung bình đi cùng độ lệch chuẩn. Phương sai ít xuất hiện trong phần diễn giải cho người đọc vì đơn vị của nó bị bình phương, nhưng nó vẫn được dùng trong nhiều phép tính thống kê.

Phương sai có cùng vai trò nền tảng với độ lệch chuẩn. Chẳng hạn, trong hồi quy, mức độ biến thiên của biến phụ thuộc ảnh hưởng đến cách mô hình giải thích dữ liệu. Trong ANOVA, phương sai giữa các nhóm được so sánh với phương sai trong từng nhóm. Trong phân tích nhân tố, phương sai được dùng khi xem xét lượng biến thiên được các nhân tố giải thích.

Khi đọc dữ liệu khảo sát Likert, bạn không nên nhìn phương sai như một điểm đạt hoặc không đạt độc lập. Một biến có phương sai rất thấp nghĩa là phần lớn người trả lời chọn cùng một mức. Điều này có thể làm biến kém hữu ích trong việc phân biệt các đối tượng, nhưng chưa đủ để kết luận phải loại biến. Bạn cần xem thêm phân phối, nội dung biến quan sát, tương quan biến tổng và mục tiêu phân tích.

Phương sai cũng giúp phát hiện câu trả lời thiếu biến thiên. Nếu toàn bộ người trả lời chọn 4 hoặc 5, phương sai có thể bằng hoặc gần bằng 0. Ngược lại, phương sai lớn có thể xuất hiện vì nhóm trả lời có mức độ khác nhau thật, hoặc vì dữ liệu chứa outlier. Khi nghi ngờ giá trị bất thường, hãy xem hướng dẫn về outlier thay vì xóa quan sát chỉ vì phương sai lớn.

Công thức tính phương sai bao nhiêu là đạt

Phương sai không có một ngưỡng chung để kết luận đạt hay không đạt. Giá trị phù hợp phụ thuộc vào thang đo, đơn vị đo, khoảng biến thiên và mục tiêu nghiên cứu. Vì vậy, bạn không nên viết rằng phương sai phải lớn hơn một con số cố định nếu chưa có cơ sở lý thuyết hoặc quy định của đề tài.

Một vài tiêu chí liên quan thường được dùng để đánh giá dữ liệu và thang đo được trình bày dưới đây. Đây là các ngưỡng cho chỉ số liên quan, không phải ngưỡng phương sai trực tiếp.

Chỉ số hoặc tiêu chíCách hiểu trong thực hànhNguồn chính tắc
Phương saiKhông có ngưỡng đạt chung; cần diễn giải theo thang đo và phân phối dữ liệuKhông áp dụng ngưỡng cố định
Độ lệch chuẩnĐọc cùng giá trị trung bình và khoảng đo, không kết luận đạt chỉ từ một con sốKhông áp dụng ngưỡng cố định
Corrected Item-Total CorrelationTừ 0.3 trở lên thường được xem là phù hợp khi đánh giá biến quan sát(Nunnally và Bernstein, 1994)
Cronbach's AlphaTừ 0.7 trở lên thường được chấp nhận; thang đo khám phá có thể xem xét từ 0.6(Nunnally, 1978); (Hair và cộng sự, 2010)
KMOTừ 0.5 trở lên khi xem xét khả năng thực hiện EFA(Kaiser, 1974)
Total Variance ExplainedTổng phương sai trích từ 50% trở lên trong bối cảnh phù hợp(Hair và cộng sự, 2010)
Factor loadingTừ 0.5 trở lên thường được dùng làm mốc tham khảo(Hair và cộng sự, 2010)

Trong bảng trên, Total Variance Explained khác với phương sai của một biến. Total Variance Explained cho biết các nhân tố giữ lại giải thích bao nhiêu phần trăm biến thiên của tập biến quan sát. Bạn không được lấy con số 50% này làm ngưỡng cho cột Variance trong bảng thống kê mô tả.

Tương tự, phương sai lớn không tự động chứng minh dữ liệu tốt, còn phương sai nhỏ không tự động chứng minh dữ liệu xấu. Hãy xem trung bình, độ lệch chuẩn, min, max và biểu đồ. Nếu đang kiểm định thang đo, hãy chạy quy trình Cronbach's Alpha và EFA theo thứ tự phù hợp.

Cách đọc công thức tính phương sai trên output

Trong SPSS, mở Analyze > Descriptive Statistics > Descriptives. Đưa các biến cần mô tả vào ô Variable(s), chọn Options, đánh dấu Mean, Std. deviation, Variance, MinimumMaximum, sau đó chọn ContinueOK. SPSS sẽ tạo bảng Descriptive Statistics.

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Giả sử biến HL1 đo mức độ hài lòng trên thang Likert 1 đến 5 và có 120 quan sát hợp lệ.

Descriptive StatisticsNMinimumMaximumMeanStd. DeviationVariance
HL11201.005.003.620.8420.709
Valid N (listwise)120

Ở dòng HL1, Mean = 3.62 cho biết điểm trung bình của 120 câu trả lời. Std. Deviation = 0.842 cho biết mức phân tán theo đơn vị gốc của thang đo. Variance = 0.709 là bình phương gần đúng của độ lệch chuẩn, vì 0.842² xấp xỉ 0.709.

Bạn cũng có thể chạy Analyze > Descriptive Statistics > Frequencies. Chọn biến, bấm Statistics, đánh dấu các chỉ số cần xem rồi chọn ContinueOK. Cách này tạo thêm bảng tần số, hữu ích khi bạn muốn xem từng mức trả lời từ 1 đến 5.

Nếu biến có nhiều giá trị thiếu, hãy kiểm tra cột N trước khi diễn giải. Hai biến cùng có Mean bằng 3.6 nhưng một biến dựa trên 120 quan sát và biến kia chỉ dựa trên 87 quan sát thì mức độ tin cậy khi so sánh không giống nhau. Bạn cũng cần kiểm tra việc mã hóa giá trị thiếu, vì nếu nhập giá trị thiếu thành 0, phương sai và trung bình sẽ bị kéo lệch.

Công thức liên hệ giữa hai chỉ số là độ lệch chuẩn = căn bậc hai của phương sai. Vì vậy, phương sai có đơn vị bình phương, còn độ lệch chuẩn giữ nguyên đơn vị ban đầu. Trong chương kết quả, độ lệch chuẩn thường dễ đọc hơn và thường được báo cáo cùng Mean.

Khi công thức tính phương sai không đạt thì xử lý thế nào

Trước tiên, xác định bạn đang nói phương sai không đạt theo tiêu chí nào. Nếu chỉ thấy phương sai lớn hoặc nhỏ, chưa nên loại biến ngay. Bạn cần kiểm tra các bước theo thứ tự sau.

Kiểm tra dữ liệu và mã hóa

Mở Variable View để kiểm tra kiểu biến, nhãn giá trị và mã cho câu trả lời. Với thang Likert, các mức phải được mã hóa nhất quán. Nếu một biến dùng 1 đến 5 nhưng một số dòng lại có 99 để chỉ thiếu dữ liệu, bạn cần khai báo 99 là missing hoặc xử lý theo quy ước đã đặt ra.

Xem phân phối và giá trị bất thường

Chạy Analyze > Descriptive Statistics > Explore. Đưa biến vào Dependent List, mở Plots và chọn biểu đồ phù hợp. Kiểm tra min, max, boxplot và các quan sát có dấu hiệu bất thường. Chỉ loại một quan sát khi có lý do dữ liệu rõ ràng, chẳng hạn nhập sai hoặc không đáp ứng điều kiện khảo sát, rồi ghi lại quyết định đó.

Kiểm tra nội dung biến quan sát

Một biến có phương sai thấp có thể vì nội dung quá dễ đoán hoặc toàn bộ mẫu thật sự có cùng quan điểm. Hãy đối chiếu với bảng hỏi và giả thuyết. Không sửa dữ liệu để làm phương sai đẹp hơn. Nếu biến không phù hợp về mặt nội dung, trao đổi với giảng viên về việc loại biến và nêu rõ căn cứ.

Chạy lại chỉ số liên quan

Nếu mục tiêu là đánh giá thang đo, chạy Analyze > Scale > Reliability Analysis, đưa các biến cùng khái niệm vào Items, chọn Statistics, đánh dấu Scale if item deletedCorrelations. Xem Cronbach's Alpha, Corrected Item-Total Correlation và thay đổi của Alpha khi loại biến. Sau đó, nếu thiết kế nghiên cứu yêu cầu, mới chuyển sang EFA.

EFA hiếm khi ra đẹp ở lần chạy đầu. Loại biến, chạy lại, và ghi lại từng vòng loại là chuyện bình thường, nhưng quyết định phải dựa trên tiêu chí đã nêu trong phương pháp. Không nên xóa hàng loạt quan sát hoặc biến chỉ để biến phương sai về một khoảng mong muốn.

Phân biệt công thức tính phương sai với độ lệch chuẩn

Phương sai và độ lệch chuẩn đều đo mức độ phân tán, nhưng cách đọc khác nhau. Phương sai là trung bình của bình phương độ lệch so với trung bình. Độ lệch chuẩn là căn bậc hai của phương sai.

Với số liệu minh họa ở trên, phương sai là 0.709 và độ lệch chuẩn là 0.842. Nếu thang đo chạy từ 1 đến 5, độ lệch chuẩn 0.842 vẫn nằm trong đơn vị điểm Likert nên dễ diễn giải hơn. Bạn có thể xem bài độ lệch chuẩn để đối chiếu cách đọc hai chỉ số.

Trung vị lại là một khái niệm khác. Trung vị là giá trị đứng giữa sau khi sắp xếp dữ liệu, còn phương sai đo độ phân tán quanh trung bình. Khi dữ liệu lệch mạnh hoặc có outlier, trung vị có thể đại diện cho trung tâm tốt hơn trung bình, nhưng điều đó không biến trung vị thành một chỉ số phân tán. Xem thêm trung vị nếu bạn đang phân vân giữa Mean và Median.

Một nhầm lẫn khác là phương sai của một biến với Total Variance Explained trong EFA. Phương sai của một biến mô tả một cột dữ liệu. Total Variance Explained mô tả lượng biến thiên được các nhân tố trích giải thích cho cả nhóm biến. Hai con số này xuất hiện trong những bảng output khác nhau và không thể thay thế cho nhau.

Lỗi thường gặp

Lỗi đầu tiên là dùng công thức tổng thể cho dữ liệu mẫu mà không nói rõ cách chọn mẫu. Khi tự tính bằng Excel hoặc máy tính, hãy xác định dữ liệu của bạn là toàn bộ tổng thể hay một mẫu nghiên cứu. Trong luận văn khảo sát, cần thống nhất công thức với phần mềm và cách trình bày phương pháp.

Lỗi thứ hai là gọi Variance = 0.709 là độ lệch chuẩn. Độ lệch chuẩn trong ví dụ là 0.842. Bạn có thể kiểm tra nhanh bằng cách lấy căn bậc hai của phương sai.

Lỗi thứ ba là đặt một ngưỡng cứng cho phương sai. Phương sai không có mốc chung như Cronbach's Alpha hay KMO. Việc đánh giá phải gắn với khoảng đo, trung bình, phân phối và mục tiêu phân tích.

Lỗi thứ tư là bỏ qua giá trị thiếu. Nếu mã 99 được nhập như một giá trị hợp lệ, Mean và Variance sẽ không còn phản ánh thang đo 1 đến 5. Hãy kiểm tra N và bảng tần số trước khi sao chép kết quả vào chương 4.

Lỗi thứ năm là xóa outlier chỉ vì muốn độ lệch chuẩn thấp. Mọi điều chỉnh dữ liệu phải có căn cứ, được ghi lại và có thể giải trình. Nếu không có lý do dữ liệu, giữ nguyên quan sát và báo cáo giới hạn phù hợp thường an toàn hơn.

Câu hỏi thường gặp

Công thức tính phương sai mẫu và tổng thể khác nhau thế nào?

Phương sai tổng thể chia tổng bình phương độ lệch cho N, còn phương sai mẫu chia cho n - 1. Dùng công thức nào phụ thuộc vào việc dữ liệu bao phủ toàn bộ tổng thể hay chỉ là một mẫu được dùng để suy luận cho tổng thể lớn hơn.

Phương sai bao nhiêu là đạt?

Không có một ngưỡng phương sai áp dụng cho mọi đề tài. Bạn cần đọc phương sai cùng Mean, Std. Deviation, min, max và bối cảnh thang đo. Với đánh giá thang đo, hãy xem thêm Cronbach's Alpha, Corrected Item-Total Correlation và kết quả EFA thay vì chỉ nhìn Variance.

Vì sao phương sai bằng 0?

Phương sai bằng 0 khi mọi quan sát có cùng một giá trị. Trên thang Likert, điều này có thể xảy ra khi tất cả người trả lời chọn cùng một mức hoặc khi dữ liệu bị nhập sai, chẳng hạn công thức kéo nhầm một giá trị cho cả cột. Hãy kiểm tra bảng tần số và file dữ liệu gốc.

Phương sai có phải là độ lệch chuẩn không?

Hai chỉ số có liên hệ nhưng không giống nhau. Độ lệch chuẩn là căn bậc hai của phương sai, nên phương sai có đơn vị bình phương còn độ lệch chuẩn có cùng đơn vị với biến ban đầu. Khi viết mô tả dữ liệu, bạn thường trình bày Mean và Std. Deviation.

Có cần báo cáo phương sai trong luận văn không?

Điều này phụ thuộc vào hướng dẫn của khoa, giảng viên và loại phân tích. Với thống kê mô tả, Mean và Std. Deviation thường dễ diễn giải hơn. Nếu bảng kết quả hoặc phương pháp yêu cầu Variance, hãy báo cáo đúng tên cột và giải thích ngắn gọn cách tính.

SPSS tính phương sai theo công thức nào?

Trong thống kê mô tả cho dữ liệu mẫu, SPSS thường hiển thị phương sai mẫu, tức tổng bình phương độ lệch được chia cho n - 1. Bạn vẫn nên kiểm tra tài liệu phương pháp và số quan sát hợp lệ, nhất là khi dữ liệu có missing.

Với file của bạn, hãy mở Analyze > Descriptive Statistics > Descriptives, chọn Mean, Std. deviation, Variance, Minimum và Maximum, rồi đối chiếu cột N trước khi viết nhận xét. Nếu cần chạy và diễn giải trực tiếp dữ liệu .sav hoặc .csv, bạn có thể dùng M4 phân tích dữ liệu của DoThesis.