Cách tính độ lệch chuẩn và đọc kết quả trong SPSS

Thống kê··13 phút đọc

Độ lệch chuẩn là gì

Bạn mở bảng dữ liệu lên và thấy cột Std. Deviation, nhưng chưa biết con số đó đang nói gì về mẫu khảo sát. Độ lệch chuẩn, thường viết là SD hoặc Std. Deviation, đo mức độ các giá trị phân tán quanh giá trị trung bình. SD càng nhỏ, các quan sát càng tập trung gần Mean. SD càng lớn, dữ liệu càng phân tán rộng hơn.

Cách tính độ lệch chuẩn bắt đầu từ bốn bước: tính Mean, lấy từng giá trị trừ Mean, bình phương các độ lệch, rồi lấy trung bình theo công thức tương ứng trước khi khai căn bậc hai. Với tổng thể, công thức là:

σ = √[Σ(xᵢ - μ)² / N]

Với mẫu khảo sát, công thức thường dùng là:

s = √[Σ(xᵢ - x̄)² / (n - 1)]

Trong đó xᵢ là từng quan sát, là trung bình mẫu, n là số quan sát và n - 1 là bậc tự do. Khi bạn phân tích dữ liệu khảo sát của sinh viên bằng SPSS, phần mềm thường báo Std. Deviation theo cách tính cho mẫu. Bạn có thể xem thêm bài độ lệch chuẩn nếu cần đối chiếu khái niệm và ký hiệu.

Ví dụ, với bốn điểm số 2, 3, 4, 5, Mean bằng 3,5. Mỗi điểm lệch so với Mean lần lượt là -1,5; -0,5; 0,5; 1,5. Sau khi bình phương, cộng lại và chia cho n - 1, ta lấy căn bậc hai để có SD mẫu. Con số cuối cùng phản ánh độ phân tán của bốn điểm số, không phản ánh điểm trung bình cao hay thấp.

Ý nghĩa của độ lệch chuẩn trong nghiên cứu định lượng

Trong nghiên cứu định lượng, bạn dùng SD để mô tả mức độ khác biệt giữa các câu trả lời hoặc các quan sát. Mean cho biết xu hướng trung tâm, còn SD cho biết người trả lời có tập trung quanh xu hướng đó hay không. Hai biến có cùng Mean 3,8 vẫn có thể có SD rất khác nhau.

Chẳng hạn, biến Sự hài lòng có Mean 3,8 và SD 0,45 cho thấy câu trả lời khá tập trung quanh mức 3,8. Một biến khác cũng có Mean 3,8 nhưng SD 1,20 cho thấy người trả lời phân tán hơn, có thể gồm cả nhóm đánh giá thấp và nhóm đánh giá cao.

SD giúp bạn đọc bảng thống kê mô tả, kiểm tra dữ liệu trước khi hồi quy, nhận diện biến có mức phân tán thấp và so sánh sự ổn định tương đối giữa các biến được đo cùng thang điểm. Tuy nhiên, SD không tự nó kết luận thang đo tốt hay xấu. Độ tin cậy cần được kiểm tra bằng Cronbach's Alpha, còn mô hình cần các kiểm định phù hợp với mục tiêu nghiên cứu.

Nếu SD bằng 0, mọi quan sát có cùng một giá trị. Trường hợp này thường cho thấy biến không có biến thiên, chẳng hạn tất cả người trả lời đều chọn cùng một phương án. Biến không biến thiên thường không cung cấp thông tin cho các phân tích tương quan hoặc hồi quy.

Bạn cũng cần nhìn SD cùng với số lượng quan sát, Mean, Min và Max. SD lớn có thể xuất hiện vì mẫu thật sự đa dạng, vì có outlier, hoặc vì dữ liệu nhập sai. Khi nghi ngờ giá trị bất thường, hãy kiểm tra outlier thay vì vội vàng xóa dòng dữ liệu.

Độ lệch chuẩn bao nhiêu là đạt

Đây là chỗ nhiều bạn tìm một ngưỡng duy nhất, nhưng SD không có mức đạt chung cho mọi biến. SD phụ thuộc vào thang đo, cách mã hóa, phạm vi giá trị và đặc điểm mẫu. Với thang Likert 1 đến 5, SD 0,30 và SD 1,10 dẫn đến hai cách mô tả phân tán khác nhau, nhưng chưa thể chỉ từ đó kết luận một kết quả đạt hoặc không đạt.

Bảng dưới đây giúp bạn dùng SD đúng vai trò. Các ngưỡng được nêu trong bảng là quy tắc hoặc tiêu chí của nguồn tương ứng, không phải một ngưỡng chung để chấm điểm SD.

Điều bạn cần đánh giáMức hoặc cách đọcNguồnCách dùng trong luận văn
SD bằng 0Không có biến thiên giữa các quan sátDiễn giải trực tiếp từ công thứcKiểm tra lại mã hóa và khả năng biến không dùng được trong phân tích
SD lớn hoặc nhỏKhông có ngưỡng đạt chungCần diễn giải theo thang đo và mẫuSo sánh giữa các biến cùng thang đo, không kết luận chỉ từ SD
5 đến 10 quan sát cho mỗi biến quan sátQuy tắc tham khảo về cỡ mẫu(Hair và cộng sự, 2010)Dùng khi lập kế hoạch cỡ mẫu, không dùng làm ngưỡng SD
Corrected Item-Total Correlation từ 0,3 trở lênTiêu chí liên quan đến biến quan sát và thang đo(Nunnally và Bernstein, 1994)Không thay thế SD bằng tiêu chí này
Cronbach's Alpha từ 0,7 trở lênTiêu chí độ tin cậy phổ biến(Nunnally, 1978)Báo cáo riêng trong phân tích độ tin cậy

Vì vậy, câu hỏi “độ lệch chuẩn bao nhiêu chấp nhận được” cần được trả lời theo bối cảnh. Nếu tất cả biến đều đo bằng Likert 1 đến 5, bạn có thể mô tả biến nào có mức phân tán lớn hơn các biến còn lại. Bạn không nên viết rằng SD dưới một con số nào đó luôn đạt nếu không có cơ sở lý thuyết hoặc hướng dẫn cụ thể của đề tài.

Khi báo cáo, hãy nói rõ đơn vị đo. SD của thu nhập tính bằng đồng tiền sẽ có quy mô hoàn toàn khác SD của điểm Likert. So sánh SD giữa hai biến có đơn vị hoặc phạm vi khác nhau cũng dễ gây hiểu nhầm.

Cách đọc độ lệch chuẩn trên output

Trong SPSS, để tính độ lệch chuẩn, mở Analyze > Descriptive Statistics > Descriptives. Đưa các biến cần mô tả vào ô Variable(s), chọn Options, đánh dấu Mean, Std. deviation, MinimumMaximum, sau đó chọn ContinueOK. Nếu cần bảng chi tiết hơn theo nhóm, bạn có thể dùng Analyze > Descriptive Statistics > Explore.

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột được giữ theo output SPSS để bạn đối chiếu trực tiếp với file của mình.

Descriptive StatisticsNMinimumMaximumMeanStd. Deviation
HL1185153,760,82
HL2185153,690,91
HL3185253,880,67
Valid N (listwise)185

Trong bảng minh họa, HL1 có Mean 3,76 và SD 0,82. Bạn có thể viết rằng mức đánh giá trung bình của HL1 là 3,76, với độ phân tán 0,82. HL2 có Mean thấp hơn một chút và SD cao hơn, nghĩa là câu trả lời của mẫu phân tán hơn HL1 trong cùng thang đo.

N là số quan sát hợp lệ được dùng cho biến đó. Nếu N giữa các biến chênh lệch, hãy kiểm tra missing values. MinimumMaximum giúp bạn phát hiện mã ngoài phạm vi, chẳng hạn bảng hỏi dùng thang 1 đến 5 nhưng output lại có giá trị 7.

Nếu bạn tính bằng Excel, hàm thường gặp là STDEV.S cho mẫu và STDEV.P cho tổng thể. Đừng chọn hàm theo thói quen. Dữ liệu khảo sát của bạn thường là một mẫu từ tổng thể nghiên cứu, nên cần xác định rõ cách trình bày phương pháp trước khi tính.

Bạn có thể đối chiếu SD với phương sai, vì phương sai là bình phương của độ lệch chuẩn. Khi bảng output có Variance, hãy nhớ rằng phương sai giữ đơn vị bình phương, còn SD giữ nguyên đơn vị của biến nên thường dễ diễn giải hơn.

Khi độ lệch chuẩn không đạt thì xử lý thế nào

Trước hết, đừng xóa dữ liệu chỉ vì SD lớn. SD không có ngưỡng chung, nên bước đầu là kiểm tra dữ liệu gốc và bối cảnh đo lường.

Kiểm tra phạm vi và mã hóa

Xem Minimum, Maximum, tần số từng phương án và nhãn giá trị. Nếu thang đo chỉ từ 1 đến 5 mà có giá trị 0, 6 hoặc 99, bạn cần xác định đó là mã missing, lỗi nhập hay câu trả lời hợp lệ. Sửa mã hóa trong file dữ liệu và ghi lại thay đổi trước khi chạy lại.

Kiểm tra giá trị bất thường

Một vài quan sát rất khác phần còn lại có thể làm SD tăng. Hãy xem boxplot, bảng tần số và hồ sơ dữ liệu của dòng đó. Chỉ loại quan sát khi có lý do phương pháp rõ ràng, chẳng hạn nhập sai hoặc không đáp ứng tiêu chí sàng lọc. Không xóa outlier chỉ để làm SD đẹp hơn.

Kiểm tra cách xây dựng biến

Nếu bạn tính Mean của nhiều biến quan sát nhưng một biến được mã hóa ngược chưa xử lý, SD của biến tổng hợp có thể khó diễn giải. Với câu hỏi đảo chiều, cần recode đúng trước khi tính điểm thang đo. Bạn cũng cần chắc rằng các biến ghép vào cùng một khái niệm có cùng hướng đo.

Giữ kết quả và giải trình minh bạch

Nếu dữ liệu hợp lệ và SD lớn phản ánh đúng sự khác biệt trong mẫu, hãy giữ kết quả. Trong luận văn, bạn mô tả mức phân tán và giải thích theo bối cảnh nghiên cứu, thay vì tự đặt một ngưỡng rồi loại dữ liệu. Nếu giảng viên yêu cầu xử lý thêm, lưu cả file trước và sau xử lý để có thể truy lại từng bước.

Phân biệt độ lệch chuẩn với phương sai và trung bình

Độ lệch chuẩn và phương sai dùng cùng thông tin về khoảng cách giữa từng quan sát với Mean. Phương sai lấy trung bình của các độ lệch đã bình phương. Độ lệch chuẩn là căn bậc hai của phương sai, nên hai chỉ số có quan hệ SD = √Variance.

Ví dụ, nếu Variance bằng 0,64 thì SD bằng 0,8. Phương sai phù hợp cho các phép tính và mô hình thống kê, còn SD thường dễ trình bày trong bảng mô tả vì cùng đơn vị với biến gốc. Xem thêm công thức tính phương sai khi bạn cần kiểm tra từng bước tính.

Mean là giá trị trung bình, không phải độ phân tán. Một mẫu có Mean cao vẫn có SD cao nếu các câu trả lời trải rộng. Trung vị là giá trị ở vị trí giữa sau khi sắp xếp dữ liệu, thường hữu ích khi phân phối lệch hoặc có outlier. Bạn có thể đọc thêm về trung vị để chọn chỉ số trung tâm phù hợp.

Cũng cần phân biệt SD với Standard Error. SD mô tả mức phân tán của các quan sát trong mẫu. Standard Error mô tả mức không chắc chắn của ước lượng Mean và thường giảm khi cỡ mẫu tăng. Hai cột này không được thay thế cho nhau khi viết chương kết quả.

Lỗi thường gặp

Đọc SD như một điểm đánh giá. SD 0,7 không có nghĩa người trả lời đánh giá 0,7 điểm. Điểm đánh giá nằm ở Mean, còn SD cho biết mức phân tán quanh Mean.

Tự đặt ngưỡng SD để loại biến. Không có quy tắc chung nói mọi SD dưới 0,5 hoặc trên 1,0 đều không đạt. Hãy xem phạm vi thang đo, phân phối và mục tiêu phân tích.

Dùng sai công thức mẫu và tổng thể. Nếu dữ liệu là mẫu khảo sát, cần nêu rõ quy ước tính. Không nên trộn kết quả từ STDEV.SSTDEV.P rồi gọi chúng là cùng một chỉ số.

Bỏ qua N và missing values. Một SD được tính trên 80 quan sát không nên diễn giải giống SD tính trên 185 quan sát nếu tỷ lệ thiếu dữ liệu khác nhau.

Làm tròn quá sớm. Hãy giữ đủ chữ số trong quá trình tính và chỉ làm tròn ở bảng báo cáo, thường đến hai chữ số thập phân nếu quy định của khoa không yêu cầu khác.

Xóa dòng để giảm SD. Đây là cách xử lý khó giải trình nếu không có bằng chứng về lỗi dữ liệu. Lưu bản gốc, ghi tiêu chí loại và báo cáo số quan sát trước, sau khi xử lý nếu có thay đổi.

Câu hỏi thường gặp

Độ lệch chuẩn bao nhiêu là chấp nhận được?

Không có một con số chung áp dụng cho mọi biến. Bạn cần xem SD cùng với thang đo, Mean, Min, Max, N và phân phối dữ liệu. Với các biến cùng thang Likert, có thể so sánh tương đối biến nào phân tán hơn, nhưng không nên tự coi một mức SD là đạt nếu không có căn cứ.

Công thức tính độ lệch chuẩn mẫu và tổng thể khác nhau thế nào?

Độ lệch chuẩn tổng thể chia tổng bình phương độ lệch cho N. Độ lệch chuẩn mẫu chia cho n - 1 để ước lượng độ phân tán của tổng thể từ một mẫu. Dữ liệu khảo sát luận văn thường được xem là mẫu, vì vậy bạn cần ghi rõ cách tính hoặc công cụ đã sử dụng.

Vì sao độ lệch chuẩn trong Excel và SPSS khác nhau?

Nguyên nhân thường là bạn dùng STDEV.S ở một phần mềm và STDEV.P ở phần mềm kia, hoặc hai công cụ xử lý missing values khác nhau. Hãy kiểm tra cùng một tập quan sát, cùng phạm vi ô và cùng quy ước mẫu hoặc tổng thể. Sai khác nhỏ do làm tròn cũng có thể xuất hiện.

Độ lệch chuẩn bằng 0 có phải dữ liệu bị lỗi không?

Chưa chắc. SD bằng 0 nghĩa là mọi giá trị hợp lệ của biến giống nhau. Bạn cần kiểm tra tần số và mã hóa. Nếu tất cả người trả lời thật sự chọn cùng một phương án, biến không có biến thiên; nếu dữ liệu bị nhập một giá trị cho toàn bộ dòng, đó là lỗi cần sửa.

Có nên xóa biến khi độ lệch chuẩn quá lớn không?

Không nên xóa chỉ vì SD lớn. Kiểm tra phạm vi, outlier, missing values, mã hóa đảo chiều và bối cảnh khảo sát trước. Nếu biến hợp lệ nhưng phản ánh khác biệt thật giữa người trả lời, hãy giữ biến và trình bày kết quả minh bạch.

Cách viết độ lệch chuẩn vào luận văn thế nào?

Bạn có thể viết: “Biến [tên biến] có giá trị trung bình là [Mean] và độ lệch chuẩn là [SD], cho thấy mức độ phân tán của các quan sát quanh giá trị trung bình ở mức [mô tả phù hợp].” Hãy thay placeholder bằng số liệu thật trong bảng Descriptive Statistics, không dùng số minh họa trong bài này.

Mở file của bạn, chạy Analyze > Descriptive Statistics > Descriptives, kiểm tra đồng thời N, Mean, Std. Deviation, MinimumMaximum, rồi ghi lại các bước xử lý dữ liệu trước khi đưa bảng vào chương 4. Nếu cần chạy phân tích trên chính file .sav hoặc .csv, bạn có thể xem module M4 phân tích dữ liệu.