Deviation là gì? Cách đọc độ lệch chuẩn trong SPSS
Deviation là gì
Khi mở bảng thống kê mô tả trong SPSS, bạn có thể thấy các cột Mean, Std. Deviation, Minimum và Maximum. Trong ngữ cảnh này, deviation thường được dùng để nói đến độ lệch, còn Standard Deviation, viết tắt là SD hoặc Std. Deviation, là độ lệch chuẩn. Đây là chỉ số cho biết các giá trị trong một biến phân tán xa hay gần mức trung bình như thế nào.
Nếu các câu trả lời tập trung quanh giá trị trung bình, độ lệch chuẩn thường nhỏ. Nếu câu trả lời nằm rải rộng, độ lệch chuẩn thường lớn. Bạn cần đọc SD cùng với Mean, thang đo và khoảng giá trị hợp lệ, vì một con số đứng riêng không đủ để kết luận dữ liệu tốt hay xấu.
Với một biến có các quan sát (x_1, x_2, ..., x_n), trung bình mẫu là:
[ \bar{x} = \frac{x_1+x_2+...+x_n}{n} ]
Độ lệch chuẩn mẫu được tính từ khoảng cách giữa từng quan sát và giá trị trung bình:
[ s = \sqrt{\frac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1}} ]
Bạn không cần tự tính công thức này khi đã có file .sav. SPSS sẽ tính khi bạn chạy thống kê mô tả. Điều quan trọng là biết chỉ số đó mô tả mức độ phân tán của biến, chứ không phải mức độ tin cậy của thang đo hay ý nghĩa thống kê của một mối quan hệ.
Nếu bạn đang đọc các chỉ số thống kê khác trong cùng nhóm, có thể xem thêm chuyên mục Thống kê và bài scale là gì để phân biệt thang đo với kết quả mô tả dữ liệu.
Ý nghĩa của deviation trong nghiên cứu định lượng
Trong luận văn định lượng, deviation giúp bạn hiểu mẫu nghiên cứu trả lời có đồng nhất hay phân tán. Ví dụ, với biến đo mức độ hài lòng, Mean cao và SD nhỏ cho thấy phần lớn người trả lời có xu hướng đánh giá tương đối gần nhau ở mức cao. Mean cao nhưng SD lớn cho thấy điểm trung bình cao nhưng ý kiến giữa các cá nhân không giống nhau hoàn toàn.
SD cũng giúp bạn kiểm tra dữ liệu trước khi chạy các phân tích tiếp theo. Khi một biến có mức phân tán rất thấp, người trả lời có thể đã chọn gần như cùng một phương án. Tình trạng này làm giảm khả năng phân biệt giữa các cá nhân và có thể ảnh hưởng đến tương quan, hồi quy hoặc mô hình PLS-SEM.
Ngược lại, SD lớn chưa tự động có nghĩa là dữ liệu sai. Một biến có thể phân tán rộng vì mẫu gồm nhiều nhóm người có quan điểm khác nhau. Bạn cần xem thêm Minimum, Maximum, bảng tần số và dữ liệu gốc để biết sự phân tán đến từ khác biệt thực tế hay lỗi nhập liệu.
Deviation còn hỗ trợ việc phát hiện dấu hiệu bất thường. Nếu một biến có Mean nằm gần giữa khoảng đo nhưng SD lớn hơn dự kiến, hãy kiểm tra các giá trị cực thấp, cực cao và các dòng dữ liệu có câu trả lời thiếu nhất quán. Bạn có thể xem hướng xử lý riêng cho outliers, nhưng đừng xóa quan sát chỉ vì nó làm SD tăng.
Một điểm cần nhớ là SD không trả lời câu hỏi nhân tố nào tác động đến biến phụ thuộc. Nó cũng không chứng minh giả thuyết đúng hay sai. Để đánh giá quan hệ giữa các biến, bạn phải chọn phân tích phù hợp với mô hình nghiên cứu, chẳng hạn tương quan, hồi quy hoặc PLS-SEM.
Deviation bao nhiêu là đạt
Câu hỏi “độ lệch chuẩn bao nhiêu là đạt” thường không có một mức chung áp dụng cho mọi đề tài. SD phụ thuộc vào thang đo, cách mã hóa, nhóm mẫu và bản chất biến. Một biến Likert từ 1 đến 5 có phạm vi khác với biến thu nhập, tuổi hoặc số năm kinh nghiệm. Vì vậy, không nên loại biến chỉ vì SD lớn hoặc giữ biến chỉ vì SD nhỏ.
Bạn có thể dùng bảng dưới đây như một quy trình ra quyết định. Các con số trong cột “minh họa” chỉ để hướng dẫn cách đọc, không phải ngưỡng bắt buộc cho mọi nghiên cứu.
| Tình huống khi xem deviation | Cách diễn giải | Việc cần kiểm tra |
|---|---|---|
| SD nhỏ so với khoảng đo | Câu trả lời tập trung quanh Mean | Kiểm tra biến có bị chọn một phương án quá nhiều không |
| SD lớn so với khoảng đo | Câu trả lời phân tán rộng | Xem bảng tần số, Minimum, Maximum và các nhóm mẫu |
| SD gần bằng 0 | Các quan sát gần như giống nhau | Kiểm tra mã hóa, biến có bị nhập cùng một giá trị không |
| SD lớn kèm giá trị cực đoan | Có thể có outlier hoặc nhóm trả lời khác biệt | Đối chiếu với dữ liệu gốc, không xóa tự động |
| SD khác nhau giữa các biến trong cùng thang đo | Mức phân tán của từng biến quan sát không giống nhau | Xem thêm Cronbach's Alpha và Corrected Item-Total Correlation |
Với thang Likert, hãy đặt SD cạnh Mean và khoảng đo thực tế. Chẳng hạn, Mean bằng 4.10 trên thang 1 đến 5 cho biết mức đánh giá trung bình khá cao. Nếu SD bằng 0.30, câu trả lời tương đối tập trung. Nếu SD bằng 1.20, ý kiến phân tán hơn đáng kể. Cả hai kết quả đều có thể hợp lệ, tùy dữ liệu và bối cảnh.
Các ngưỡng dùng cho Cronbach's Alpha, KMO, factor loading hay VIF không phải là ngưỡng của độ lệch chuẩn. Bạn không nên lấy mốc 0.5, 0.7 hoặc 1.0 của một chỉ số khác rồi áp vào SD. Nếu giảng viên yêu cầu một mốc cụ thể, hãy ghi rõ đó là quy ước của đề tài hoặc hướng dẫn của khoa, thay vì trình bày như một quy luật thống kê phổ quát.
Cách đọc deviation trên output
Trong SPSS, bạn có thể chạy bảng cơ bản bằng cách chọn Analyze > Descriptive Statistics > Descriptives. Đưa các biến cần xem vào ô Variable(s), chọn Options nếu muốn hiển thị thêm các chỉ số, sau đó bấm Continue và OK. SPSS sẽ tạo bảng có tên Descriptive Statistics.
Nhìn đúng cột Std. Deviation
Bảng dưới đây là số liệu minh họa, được trình bày theo dạng output SPSS. Đây không phải kết quả của một nghiên cứu thật.
| Descriptive Statistics | N | Minimum | Maximum | Mean | Std. Deviation |
|---|---|---|---|---|---|
| HL1 | 180 | 1.00 | 5.00 | 3.94 | 0.78 |
| HL2 | 180 | 1.00 | 5.00 | 4.08 | 0.69 |
| HL3 | 180 | 2.00 | 5.00 | 4.16 | 0.61 |
| Valid N (listwise) | 180 |
Ở dòng HL1, N = 180 nghĩa là SPSS sử dụng 180 quan sát hợp lệ cho biến này. Minimum = 1.00 và Maximum = 5.00 cho biết dữ liệu đang nằm trong khoảng của thang đo. Mean = 3.94 là điểm trung bình, còn Std. Deviation = 0.78 là độ lệch chuẩn.
HL3 có Mean cao hơn HL1, đồng thời SD thấp hơn. Cách mô tả phù hợp là người trả lời đánh giá HL3 ở mức trung bình cao hơn và câu trả lời của họ tập trung hơn so với HL1 trong mẫu minh họa. Bạn không nên viết rằng HL3 “tốt hơn” HL1 nếu hai biến đo hai nội dung khác nhau.
Nếu thấy N của các biến không bằng nhau, hãy kiểm tra missing value. Khi chạy Descriptives, SPSS có thể tính từng biến dựa trên số quan sát hợp lệ khác nhau. Nếu dùng nhiều biến trong một phân tích tiếp theo, bạn cần biết phần mềm đang loại dòng theo từng biến hay theo danh sách.
Đọc thêm bằng Frequencies
Để xem phân bố từng phương án trả lời, chọn Analyze > Descriptive Statistics > Frequencies. Đưa biến vào ô bên phải, bấm Statistics nếu muốn có Mean và SD, sau đó chọn Charts nếu cần biểu đồ. Bảng Frequencies giúp bạn biết SD lớn vì dữ liệu thật sự trải rộng hay vì một vài giá trị bất thường.
Ví dụ, hai biến cùng có Mean bằng 3.50 và SD tương tự vẫn có thể có phân bố khác nhau. Một biến có thể tập trung ở mức 3 và 4, trong khi biến kia có nhiều người chọn 1 và 5. Vì vậy, khi số liệu có dấu hiệu lạ, đừng chỉ nhìn Std. Deviation.
Cách viết vào luận văn
Bạn có thể điều chỉnh đoạn sau theo output thật của mình: “Kết quả thống kê mô tả cho thấy biến [mã biến] có giá trị trung bình là [Mean] và độ lệch chuẩn là [Std. Deviation], với [N] quan sát hợp lệ. Giá trị nhỏ nhất và lớn nhất lần lượt là [Minimum] và [Maximum], cho thấy dữ liệu quan sát nằm trong khoảng [khoảng đo].”
Nếu muốn so sánh mức phân tán, có thể viết: “So với [mã biến 1], biến [mã biến 2] có độ lệch chuẩn [cao hơn/thấp hơn], cho thấy câu trả lời của mẫu đối với hai biến có mức độ phân tán khác nhau.” Chỉ dùng từ “cho thấy”, không suy diễn thành quan hệ nhân quả.
Khi deviation không đạt thì xử lý thế nào
Trước hết, xác định “không đạt” đang được hiểu theo tiêu chí nào. Nếu chỉ vì SD cao hơn một con số do bạn tự đặt, chưa có cơ sở để xóa biến. Hãy xử lý theo thứ tự từ kiểm tra dữ liệu đến xem xét mô hình.
Kiểm tra mã hóa và nhập liệu
Mở Variable View để xem Type, Values, Missing và khoảng mã hóa. Với thang Likert 1 đến 5, hãy kiểm tra có giá trị 0, 6 hoặc ký hiệu chữ lọt vào cột số không. Nếu có biến đảo chiều, cần recode trước khi diễn giải Mean và SD. Một biến chưa đảo chiều có thể làm kết quả thang đo bị sai, dù SD của riêng biến đó vẫn trông bình thường.
Kiểm tra giá trị bất thường
Dùng Analyze > Descriptive Statistics > Frequencies để xem các giá trị xuất hiện. Sau đó đối chiếu dòng dữ liệu trong Data View. Một giá trị cực đoan có thể là câu trả lời hợp lệ, cũng có thể là lỗi nhập. Chỉ loại quan sát khi bạn có lý do phương pháp rõ ràng và ghi lại số dòng, nguyên nhân, kết quả trước và sau xử lý.
Kiểm tra chất lượng bảng hỏi
Nếu nhiều người chọn một phương án cho toàn bộ biến, hãy xem thời gian trả lời, mẫu trả lời lặp lại và các câu hỏi kiểm tra trong bảng hỏi. Bạn cần phân biệt việc mẫu thật sự đồng nhất với lỗi thu thập dữ liệu. Không nên xóa hàng loạt chỉ để làm SD đẹp hơn.
Chạy lại phân tích theo đúng mô hình
Sau khi dữ liệu hợp lệ, hãy chạy Cronbach's Alpha, EFA, hồi quy hoặc SmartPLS theo quy trình của đề tài. SD chỉ là thống kê mô tả. Quyết định giữ hay loại biến phải dựa trên mục tiêu đo lường và kết quả của phân tích liên quan. Nếu mô hình có biến điều tiết, hãy tách khái niệm đó khỏi việc đọc SD, vì moderating là vấn đề về cách một biến làm thay đổi quan hệ giữa các biến khác.
Nếu mẫu có hai nhóm rất khác nhau, SD lớn có thể phản ánh cấu trúc mẫu chứ không phải lỗi. Bạn có thể kiểm tra thống kê theo nhóm nếu giả thuyết và thiết kế nghiên cứu cho phép. Khi phát hiện outlier, hãy giải trình bằng dữ liệu gốc, không chỉnh số thủ công trong file SPSS.
Phân biệt deviation với variance
Deviation và variance liên quan chặt chẽ nhưng không giống nhau. Variance là phương sai, được tính từ bình phương độ lệch của từng quan sát so với Mean. Standard Deviation là căn bậc hai của phương sai, nên đưa kết quả về cùng đơn vị với biến ban đầu.
Ví dụ, nếu biến là điểm đánh giá từ 1 đến 5, SD cũng được đọc theo đơn vị điểm của thang đo. Variance có đơn vị bình phương, vì vậy thường khó diễn giải trực tiếp hơn. SPSS có thể hiển thị cả hai nếu bạn chọn trong phần tùy chỉnh thống kê.
Cũng cần phân biệt SD với Standard Error of the Mean. SD mô tả mức phân tán của các quan sát trong mẫu. Standard Error phản ánh mức độ không chắc chắn của Mean mẫu khi dùng mẫu để ước lượng trung bình tổng thể. Hai chỉ số có mục đích khác nhau.
SD cũng không phải p-value, hệ số tương quan hay hệ số hồi quy. SD lớn không có nghĩa là giả thuyết bị bác bỏ. SD nhỏ cũng không chứng minh các biến có quan hệ với nhau. Nếu bạn đang phân tích biến trung gian, hãy xem đúng quy trình dành cho mediator, thay vì dùng deviation để kết luận về tác động gián tiếp.
Lỗi thường gặp
Gọi mọi deviation là độ lệch chuẩn
Trong tài liệu tiếng Anh, deviation có thể xuất hiện trong nhiều cụm khác nhau. Khi đọc output SPSS, cột cần chú ý là Std. Deviation. Bạn nên ghi đầy đủ “độ lệch chuẩn” trong luận văn để tránh nhầm với độ lệch của một quan sát riêng lẻ.
Tìm một mốc SD áp dụng cho mọi thang đo
Không có một mốc duy nhất để kết luận mọi SD đều đạt. Hãy xem phạm vi biến, Mean, Min, Max, phân bố tần số và mục tiêu phân tích. Nếu cần tiêu chí loại biến, hãy lấy từ thiết kế nghiên cứu hoặc hướng dẫn phương pháp được giảng viên chấp nhận.
Xóa dữ liệu chỉ vì SD cao
Xóa dữ liệu để giảm SD làm thay đổi mẫu và có thể tạo ra kết quả thiên lệch. Trước khi xóa, bạn phải xác định đó là lỗi nhập, phản hồi không hợp lệ hoặc một giá trị hợp lệ nhưng cực đoan. Lưu một bản dữ liệu gốc và ghi lại mọi thay đổi trong nhật ký xử lý.
Diễn giải SD như kết quả kiểm định
Bảng Descriptive Statistics chỉ mô tả mẫu. Nó không trả lời giả thuyết về ảnh hưởng, trung gian hay điều tiết. Khi viết chương 4, hãy tách phần thống kê mô tả khỏi phần kiểm định mô hình và báo cáo đúng bảng output tương ứng.
Câu hỏi thường gặp
Deviation là gì trong SPSS?
Trong output SPSS, deviation thường được người học dùng để chỉ Std. Deviation, tức độ lệch chuẩn. Chỉ số này cho biết các giá trị quan sát phân tán quanh Mean ở mức nào.
Bạn đọc nó cùng với N, Minimum, Maximum và Mean. Một SD riêng lẻ không đủ để kết luận dữ liệu đạt hay không đạt.
Độ lệch chuẩn bao nhiêu là chấp nhận được?
Không có một mức chung cho mọi biến và mọi thang đo. SD cần được đặt trong khoảng đo, bối cảnh biến, phân bố tần số và mục tiêu nghiên cứu.
Với thang Likert, bạn có thể mô tả SD nhỏ là câu trả lời tập trung hơn và SD lớn là câu trả lời phân tán hơn. Đừng biến mô tả này thành quy tắc loại biến nếu đề tài không quy định.
Deviation càng nhỏ có phải càng tốt không?
Không. SD nhỏ cho thấy câu trả lời gần nhau, nhưng nếu gần như mọi người chọn cùng một phương án, biến có thể thiếu khả năng phân biệt. SD lớn cũng không đồng nghĩa dữ liệu sai, vì nó có thể phản ánh sự khác biệt thật giữa người trả lời.
Hãy kiểm tra cả Mean, tần số, mã hóa và chất lượng dữ liệu trước khi đánh giá.
Vì sao Std. Deviation trong SPSS lại khác Excel?
Một nguyên nhân thường gặp là hai phần mềm đang dùng khác số dòng, cách xử lý ô trống hoặc công thức cho mẫu và tổng thể. Bạn cần kiểm tra số quan sát hợp lệ, các giá trị missing và công thức đã chọn.
Trong SPSS, hãy xem N của biến. Sau đó đối chiếu đúng cùng một tập giá trị trong Excel, thay vì copy cả cột gồm ô trống hoặc ký tự không hợp lệ.
Có cần báo cáo deviation trong luận văn không?
Thông thường, thống kê mô tả nên có Mean và SD khi bạn muốn trình bày mức đánh giá trung bình và độ phân tán của các biến. Bạn cũng có thể báo cáo N, Minimum và Maximum nếu chúng giúp người đọc hiểu dữ liệu.
Hãy dùng đúng tên biến, số chữ số thập phân thống nhất và ghi rõ đây là số liệu của mẫu nghiên cứu. Khi đã có file thật, việc tiếp theo là mở bảng Descriptive Statistics, đối chiếu từng dòng với mã biến trong bảng hỏi, rồi ghi kết quả vào chương 4 bằng mẫu câu phù hợp. Nếu cần chạy phân tích trên chính file .sav hoặc .csv, M4 phân tích dữ liệu hỗ trợ quy trình SPSS và SmartPLS theo số liệu thật của bạn.