Phương sai trong SPSS là gì và đọc kết quả thế nào

Thống kê··15 phút đọc

Phương sai trong SPSS là gì

Bạn mở file dữ liệu lên, chạy thống kê mô tả và thấy một cột có tên Variance. Con số này cho biết các quan sát phân tán quanh giá trị trung bình của biến đến mức nào. Phương sai càng lớn, dữ liệu càng phân tán; phương sai càng nhỏ, các giá trị càng tập trung quanh mean.

Trong SPSS, phương sai thường được tính theo công thức mẫu:

s² = Σ(xᵢ - x̄)² / (n - 1)

Trong đó, xᵢ là từng quan sát, là mean, n là số quan sát và là phương sai mẫu. SPSS dùng mẫu số n - 1 trong thống kê mẫu, vì bạn thường phân tích một mẫu khảo sát để suy luận cho tổng thể. Nếu muốn xem cách tính bằng tay, bạn có thể tham khảo công thức tính phương sai.

Phương sai có đơn vị đo bị bình phương. Chẳng hạn, nếu điểm hài lòng được đo trên thang từ 1 đến 5 thì phương sai có đơn vị là điểm bình phương. Vì lý do này, khi trình bày mức độ phân tán cho người đọc, nhiều luận văn báo cáo thêm Std. Deviation, tức độ lệch chuẩn. Độ lệch chuẩn là căn bậc hai của phương sai và vẫn giữ cùng đơn vị với biến ban đầu.

Ý nghĩa của phương sai trong nghiên cứu định lượng

Phương sai giúp bạn biết biến đang phân tán thế nào trước khi chạy các phân tích tiếp theo. Khi kiểm tra dữ liệu khảo sát, bạn có thể dùng nó cùng với mean, min, max và độ lệch chuẩn để phát hiện một biến gần như không có sự thay đổi giữa các đáp viên.

Ví dụ, một biến quan sát có tất cả câu trả lời đều bằng 4 sẽ có phương sai bằng 0. Biến này không cung cấp thông tin phân biệt giữa các đáp viên. Trong dữ liệu thực tế, phương sai hiếm khi bằng đúng 0, nhưng một giá trị rất thấp có thể cho thấy người trả lời tập trung vào một mức Likert, hoặc câu hỏi chưa tạo ra đủ khác biệt trong nhận thức.

Phương sai cũng có mặt trong nhiều thủ tục khác của SPSS. Trong hồi quy, sai số và phần dư liên quan đến cách dữ liệu phân tán quanh giá trị dự đoán. Trong ANOVA, SPSS so sánh phương sai giữa các nhóm và phương sai bên trong từng nhóm. Trong EFA, tổng phương sai trích cho biết các nhân tố giữ lại giải thích được bao nhiêu phần biến thiên của các biến quan sát.

Bạn cần phân biệt hai cách dùng từ này. Variance trong bảng Descriptive Statistics là phương sai của một biến cụ thể. Total Variance Explained trong EFA là phần biến thiên được các nhân tố giải thích, thường được trình bày dưới dạng phần trăm. Hai con số cùng có chữ variance nhưng trả lời hai câu hỏi khác nhau.

Nếu đang kiểm tra một biến có giá trị quá khác biệt so với phần còn lại, hãy xem thêm outlier. Phương sai là nền tảng tính toán, còn độ lệch chuẩn thường thuận tiện hơn khi viết kết quả. Bạn có thể xem thêm các bài thuộc chủ đề Thống kê khi cần đối chiếu những chỉ số mô tả khác.

Phương sai trong SPSS bao nhiêu là đạt

Phương sai không có một ngưỡng chung để kết luận đạt hay không đạt cho mọi đề tài. Giá trị phù hợp phụ thuộc vào thang đo, khoảng giá trị của biến và mục tiêu phân tích. Một phương sai bằng 2 có thể lớn với biến Likert từ 1 đến 5, nhưng lại rất nhỏ với biến thu nhập tính bằng đồng.

Vì vậy, bạn không nên loại một biến chỉ vì phương sai lớn hoặc giữ một biến chỉ vì phương sai nhỏ. Hãy xem phương sai cùng với phân phối, min, max, outlier, nội dung thang đo và câu hỏi nghiên cứu.

Nội dung cần đọcQuy tắc hoặc diễn giảiNguồn
Phương sai của một biếnKhông có ngưỡng đạt chung; cần đối chiếu với khoảng đo và bối cảnh dữ liệuKhông có ngưỡng định lượng chung trong các nguồn được phép trích dẫn
Phương sai bằng 0Tất cả quan sát có cùng giá trị, biến không có biến thiên để phân tíchDiễn giải theo định nghĩa phương sai
Corrected Item-Total CorrelationTừ 0.3 trở lên thường được xem là phù hợp khi đánh giá biến quan sát(Nunnally và Bernstein, 1994)
Cronbach's AlphaTừ 0.7 trở lên thường được chấp nhận; thang đo khám phá có thể xem mức từ 0.6(Nunnally, 1978); (Hair và cộng sự, 2010)
KMO trong EFATừ 0.5 trở lên là mức tối thiểu thường được sử dụng(Kaiser, 1974)
Total Variance Explained trong EFATừ 50% trở lên thường được dùng làm mốc tham khảo(Hair và cộng sự, 2010)

Mốc 50% trong bảng chỉ áp dụng cho Total Variance Explained của EFA, không phải phương sai của từng biến trong bảng Descriptive Statistics. Đây là lỗi diễn giải khá phổ biến. Một bạn thấy phương sai của biến là 0.8 rồi cố so với 50%, trong khi hai chỉ số đang có thang đo và ý nghĩa khác nhau.

Nếu đề tài của bạn sử dụng thang Likert, hãy mô tả khoảng điểm và đặc điểm mẫu trước khi nhận xét phương sai. Một biến có variance thấp có thể xuất phát từ việc mẫu thực sự khá đồng nhất. Việc loại biến cần dựa thêm vào Cronbach's Alpha, nội dung lý thuyết và kết quả EFA hoặc mô hình đo lường, thay vì dựa vào một con số đơn lẻ.

Cách đọc phương sai trên output

Để lấy phương sai cho các biến, bạn mở SPSS và chọn Analyze > Descriptive Statistics > Descriptives. Đưa các biến cần xem vào ô Variable(s), bấm Options, chọn Mean, Std. deviation, Variance, MinimumMaximum, sau đó bấm Continue > OK.

SPSS tạo bảng Descriptive Statistics. Cột cần đọc là Variance. Nếu bạn muốn xem thêm trung vị hoặc percentiles, dùng Analyze > Descriptive Statistics > Frequencies. Tuy nhiên, với bảng mô tả cơ bản cho chương 4, Descriptives thường đủ để kiểm tra mean, độ lệch chuẩn và phương sai.

Số liệu minh họa

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên biến được đặt theo cách thường gặp trong file khảo sát. Khi đọc file của bạn, hãy thay bằng tên biến và con số thực tế trong output.

Descriptive StatisticsNMinimumMaximumMeanStd. DeviationVariance
HL11861.005.003.720.8840.781
HL21861.005.003.650.9410.885
HL31862.005.003.810.7920.627
Valid N (listwise)186

Trong ví dụ này, biến HL2 có variance bằng 0.885 và độ lệch chuẩn bằng 0.941. Có thể kiểm tra phép tính gần đúng bằng cách bình phương độ lệch chuẩn: 0.941², cho kết quả xấp xỉ 0.885. Chênh lệch nhỏ nếu có thể do SPSS làm tròn số hiển thị.

N = 186 cho biết SPSS sử dụng 186 quan sát hợp lệ cho bảng này. Minimum = 1Maximum = 5 cho thấy dữ liệu đang nằm trong toàn bộ khoảng của thang Likert 5 điểm đối với HL1 và HL2. HL3 có minimum bằng 2, nghĩa là trong mẫu minh họa không có người chọn mức 1 cho biến đó. Điều này không tự động chứng minh HL3 có vấn đề.

Khi viết kết quả, bạn có thể trình bày như sau: “Kết quả thống kê mô tả cho thấy biến HL1 có giá trị trung bình là [Mean], độ lệch chuẩn là [Std. Deviation] và phương sai là [Variance], với [N] quan sát hợp lệ. Các giá trị này được sử dụng để mô tả mức độ phân tán của dữ liệu trước khi thực hiện các phân tích tiếp theo.” Hãy thay toàn bộ phần trong ngoặc vuông bằng số trong output của bạn.

Ngoài bảng Descriptive Statistics, SPSS còn hiển thị Variance trong một số bảng khác. Khi chạy Analyze > Compare Means > Means, bạn có thể chọn thống kê mô tả theo nhóm. Khi chạy Analyze > Descriptive Statistics > Explore, bảng Descriptives cung cấp thêm thông tin về trung bình, khoảng tin cậy và các chỉ số phân tán.

Khi phương sai không đạt thì xử lý thế nào

Trước tiên, xác định bạn đang nói đến phương sai của biến, phương sai giữa các nhóm hay Total Variance Explained. Mỗi trường hợp có cách xử lý khác nhau. Không nên xóa biến ngay khi thấy một con số lớn hoặc nhỏ.

Kiểm tra lỗi nhập dữ liệu

Xem lại Variable ViewData View. Kiểm tra biến có bị nhập nhầm 1 thành 11, 5 thành 55, hoặc có mã thiếu dữ liệu như 99 và 999 hay không. Nếu dữ liệu được nhập từ file CSV, kiểm tra dấu phân cách và kiểu dữ liệu vì SPSS có thể đọc một cột số thành chuỗi.

Kiểm tra biến đảo chiều

Nếu bảng hỏi có biến đảo chiều, bạn cần recode trước khi tính điểm thang đo. Với thang Likert 1 đến 5, giá trị mới thường được tạo theo quy tắc 6 - giá trị cũ, nhưng chỉ áp dụng khi thiết kế nghiên cứu của bạn thực sự có biến đảo chiều. Chạy lại Cronbach's Alpha sau khi recode và lưu lại syntax để có thể giải trình.

Kiểm tra outlier và phân phối

Dùng Analyze > Descriptive Statistics > Explore, đưa biến vào Dependent List, mở Plots và chọn biểu đồ phù hợp. Xem boxplot, minimum, maximum và các giá trị cực đoan. Một outlier có thể làm phương sai tăng mạnh, nhưng bạn chỉ nên loại khi có lý do dữ liệu rõ ràng, chẳng hạn nhập sai hoặc đáp viên không thuộc đối tượng khảo sát.

Đối chiếu với mục tiêu phân tích

Nếu phương sai thấp nhưng biến vẫn cần thiết về mặt lý thuyết, hãy báo cáo hiện tượng và giữ biến nếu các kiểm định khác phù hợp. Nếu biến không có biến thiên, không thể dùng nó để giải thích khác biệt giữa các quan sát. Khi đó, việc loại biến có thể hợp lý hơn, nhưng cần ghi lại lý do và số liệu trước khi loại.

Không dùng biến đổi để làm đẹp kết quả

Bạn có thể gặp gợi ý log, căn bậc hai hoặc chuẩn hóa biến. Đây là các lựa chọn kỹ thuật chỉ nên dùng khi phù hợp với phân phối và mô hình, không phải cách để ép phương sai về một mức đẹp. Với biến Likert trong thang đo, tự ý biến đổi từng biến để sửa phương sai thường làm khó việc giải thích và bảo vệ.

Nếu đã kiểm tra lỗi nhập, biến đảo chiều và outlier mà dữ liệu vẫn không đạt kỳ vọng, hãy trao đổi với giảng viên về câu hỏi đo lường và thiết kế mẫu. Phần mềm không thể tạo ra biến thiên mà bảng hỏi hoặc mẫu khảo sát chưa có.

Phân biệt phương sai trong SPSS với độ lệch chuẩn

Phương sai và độ lệch chuẩn đều đo mức độ phân tán, nhưng cách đọc khác nhau. Phương sai là bình phương độ lệch của các quan sát so với mean. Độ lệch chuẩn là căn bậc hai của phương sai.

Ví dụ, nếu phương sai là 0.81 thì độ lệch chuẩn xấp xỉ 0.90. Phương sai phù hợp cho nhiều phép tính thống kê, còn độ lệch chuẩn dễ diễn giải hơn vì cùng đơn vị với biến. Khi biến là điểm hài lòng từ 1 đến 5, nói “độ lệch chuẩn là 0.90 điểm” tự nhiên hơn nói “phương sai là 0.81 điểm bình phương”.

Bạn có thể xem bài phương sai để phân biệt khái niệm tổng quát với cách lấy kết quả trong SPSS. Độ lệch chuẩn là chỉ số thường xuất hiện cạnh mean trong bảng mô tả và thường được chọn khi báo cáo đặc điểm biến.

Phương sai cũng khác với trung vị. Trung vị là giá trị đứng giữa sau khi sắp xếp dữ liệu, còn phương sai là chỉ số phân tán quanh mean. Một tập dữ liệu có cùng trung vị với tập khác vẫn có thể có phương sai rất khác. Bạn có thể xem thêm trung vị nếu output của bạn có cả Median và bạn chưa biết nên diễn giải cột nào.

Cuối cùng, đừng nhầm phương sai của biến với phương sai sai số trong hồi quy hoặc phương sai giữa nhóm trong ANOVA. Trong mỗi thủ tục, SPSS đặt chỉ số vào bảng khác nhau và dùng nó cho quyết định khác nhau. Hãy đọc tên bảng trước khi đọc con số.

Lỗi thường gặp

Lỗi đầu tiên là đi tìm một ngưỡng duy nhất cho phương sai, sau đó kết luận mọi biến dưới hoặc trên ngưỡng đều không đạt. Phương sai phụ thuộc vào thang đo và đơn vị đo, nên cách đọc cần dựa trên bối cảnh.

Lỗi thứ hai là lấy Total Variance Explained để thay cho phương sai của từng biến. Trong EFA, bạn cần đọc Initial Eigenvalues, Extraction Sums of Squared Loadings và phần trăm phương sai được giải thích. Đây là thông tin về các nhân tố, không phải variance của một biến HL1 hay HL2.

Lỗi thứ ba là báo cáo Variance nhưng bỏ qua N. Nếu số quan sát hợp lệ khác nhau giữa các biến, bạn cần kiểm tra missing values trước khi so sánh. Một biến có variance thấp dựa trên 180 quan sát và biến khác dựa trên 120 quan sát không nên được đọc một cách máy móc.

Lỗi thứ tư là xóa biến chỉ vì phương sai cao. Phương sai cao đôi khi cho thấy mẫu có sự khác biệt thực sự, nhất là với biến hành vi hoặc thu nhập. Hãy kiểm tra outlier, độ hợp lệ của khoảng giá trị và các kiểm định liên quan trước khi quyết định.

Lỗi thứ năm là dùng số liệu minh họa trong bài hướng dẫn để viết vào luận văn. Bảng ở trên chỉ giúp bạn nhận diện cột và cách đọc output. Luận văn phải dùng số liệu từ file .sav hoặc .csv của chính bạn.

Câu hỏi thường gặp

Phương sai trong SPSS nằm ở bảng nào?

Với thống kê mô tả cơ bản, phương sai nằm trong cột Variance của bảng Descriptive Statistics. Bạn chạy theo đường dẫn Analyze > Descriptive Statistics > Descriptives, chọn Options rồi đánh dấu Variance.

Nếu bạn chạy EFA, hãy tìm Total Variance Explained. Đây là bảng về phần phương sai được các nhân tố giải thích, không phải phương sai riêng của từng biến quan sát.

Phương sai bao nhiêu là đạt trong SPSS?

Không có một mốc chung để kết luận phương sai của mọi biến là đạt. Bạn cần xem khoảng đo, mean, độ lệch chuẩn, min, max, outlier và mục tiêu phân tích.

Các mốc như 50% thường được dùng cho Total Variance Explained trong EFA, theo (Hair và cộng sự, 2010). Không dùng mốc này để đánh giá cột Variance trong bảng Descriptive Statistics.

Phương sai bằng 0 có dùng được không?

Phương sai bằng 0 nghĩa là mọi quan sát có cùng một giá trị. Biến này không có biến thiên và thường không phù hợp để phân tích mối liên hệ hoặc so sánh giữa các quan sát.

Bạn cần kiểm tra lại dữ liệu trước khi loại. Có thể bạn nhập sai dữ liệu, đặt sai mã missing hoặc chọn nhầm biến tổng hợp. Nếu dữ liệu thực sự giống nhau ở tất cả quan sát, hãy trao đổi với giảng viên về việc loại biến.

Vì sao phương sai bằng độ lệch chuẩn bình phương không chính xác tuyệt đối?

SPSS thường làm tròn số khi hiển thị. Chẳng hạn, độ lệch chuẩn thật có thể dài hơn 0.941 nhưng output chỉ hiện ba chữ số thập phân. Khi bạn bình phương số đã làm tròn, kết quả có thể chênh lệch rất nhỏ so với Variance.

Bạn nên lấy trực tiếp cột Variance khi viết báo cáo. Không cần tự tính lại từ Std. Deviation, trừ khi bạn đang kiểm tra logic của bảng.

Có cần đưa phương sai vào bảng kết quả luận văn không?

Tùy yêu cầu của đề tài và giảng viên. Bảng thống kê mô tả thường có N, MeanStd. Deviation; Variance có thể được thêm nếu nghiên cứu tập trung vào phân tán hoặc cần kiểm tra dữ liệu.

Nếu không đưa vào bảng chính, bạn vẫn nên kiểm tra phương sai trong quá trình làm sạch dữ liệu. Khi có biến bất thường, ghi lại kiểm tra và lý do giữ hoặc loại biến để có thể giải trình.

Bạn hãy mở lại file SPSS, chạy Analyze > Descriptive Statistics > Descriptives, chọn Variance cùng Mean, Std. deviation, MinimumMaximum, rồi đối chiếu từng biến với bảng hỏi trước khi viết kết quả. Nếu cần chạy và diễn giải phân tích trên chính file .sav hoặc .csv, bạn có thể dùng M4 phân tích dữ liệu của DoThesis.