Độ lệch chuẩn kí hiệu là gì trong máy tính

Thống kê··14 phút đọc

Độ lệch chuẩn kí hiệu là gì trong máy tính

Khi mở bảng dữ liệu hoặc output SPSS, bạn thường thấy độ lệch chuẩn được viết là SD, Std. Deviation, s hoặc σ. Các kí hiệu này đều liên quan đến mức độ phân tán của dữ liệu quanh giá trị trung bình. Trong đó, σ thường dùng cho độ lệch chuẩn của toàn bộ tổng thể, còn s thường dùng cho độ lệch chuẩn tính từ một mẫu khảo sát.

Nếu biến Thu nhập có Mean bằng 12,5 triệu đồng và SD bằng 3,2 triệu đồng, các quan sát trong mẫu có xu hướng cách giá trị trung bình khoảng 3,2 triệu đồng theo thang đo đang sử dụng. Đây là cách diễn giải khái quát, không có nghĩa mọi quan sát đều nằm chính xác trong khoảng đó.

Về công thức, độ lệch chuẩn là căn bậc hai của phương sai. Với mẫu, công thức thường được viết như sau:

s = √[Σ(xᵢ - x̄)² / (n - 1)]

Trong đó, xᵢ là từng giá trị quan sát, là giá trị trung bình của mẫu và n là số quan sát. Nếu bạn cần xem phần tính toán phía trước của chỉ số này, có thể đọc thêm bài công thức tính phương sai. Phương sai dùng đơn vị bình phương, còn độ lệch chuẩn trở về đúng đơn vị ban đầu nên dễ đọc hơn trong báo cáo.

Trên máy tính, phần mềm thường không hiện kí hiệu Hy Lạp σ trong bảng dữ liệu thông thường. SPSS chủ yếu dùng tên cột Std. Deviation. Excel dùng hàm STDEV.S cho mẫu và STDEV.P cho tổng thể. Vì vậy, khi tìm câu trả lời cho “độ lệch chuẩn kí hiệu là gì trong máy tính”, bạn nên đối chiếu cả kí hiệu toán học lẫn tên cột do phần mềm in ra.

Ý nghĩa của độ lệch chuẩn trong nghiên cứu định lượng

Độ lệch chuẩn cho biết dữ liệu tập trung hay phân tán quanh Mean. SD nhỏ cho thấy các câu trả lời tương đối gần nhau. SD lớn cho thấy người trả lời có sự khác biệt rõ hơn, hoặc biến đang chứa các nhóm quan sát có mức độ rất khác nhau.

Ví dụ, hai biến cùng có Mean bằng 4,0 trên thang Likert 5 điểm. Biến A có SD bằng 0,35, còn biến B có SD bằng 1,20. Người trả lời biến A có xu hướng đánh giá gần nhau. Biến B phân tán hơn, có thể gồm cả nhóm đánh giá thấp và nhóm đánh giá cao. Nhìn Mean một mình sẽ bỏ sót khác biệt này.

Trong nghiên cứu định lượng, bạn thường dùng SD ở ba vị trí. Thứ nhất, SD đi cùng Mean trong bảng thống kê mô tả để mô tả mẫu và các biến nghiên cứu. Thứ hai, SD giúp nhận diện những biến có câu trả lời quá đồng đều, chẳng hạn phần lớn người tham gia chọn cùng một mức. Thứ ba, SD hỗ trợ đọc các bảng phân tích tiếp theo, nhưng nó không tự quyết định một giả thuyết có được chấp nhận hay không.

Với bảng hỏi Likert, SD cũng giúp bạn nhìn xem thang đo có tạo ra đủ khác biệt giữa các đối tượng khảo sát hay chưa. Tuy nhiên, SD không thay thế Cronbach's Alpha, EFA, hồi quy hay PLS-SEM. Một biến có SD lớn chưa chắc là biến tốt. Một biến có SD nhỏ cũng chưa chắc cần loại bỏ. Bạn phải đặt chỉ số này cạnh mục tiêu nghiên cứu, phân phối dữ liệu và các kiểm định liên quan.

Nếu đang xem bảng thống kê mô tả trong đề tài, bạn có thể mở chuyên mục Thống kê để đối chiếu thêm Mean, trung vị và các chỉ số phân tán. Độ lệch chuẩn trả lời câu hỏi “dữ liệu cách trung bình bao xa”, còn trung vị trả lời câu hỏi “giá trị nằm ở giữa phân phối là bao nhiêu”.

Độ lệch chuẩn bao nhiêu là đạt

Độ lệch chuẩn không có một mức “đạt” chung áp dụng cho mọi biến và mọi luận văn. Con số này phụ thuộc vào đơn vị đo, khoảng điểm, đối tượng khảo sát và mục đích phân tích. SD bằng 2 có ý nghĩa khác nhau nếu biến được đo bằng số lượt mua, triệu đồng hoặc thang Likert 1 đến 5.

Với thang Likert 1 đến 5, SD thường nằm trong khoảng giới hạn theo chính khoảng điểm của thang đo. SD càng lớn thì câu trả lời càng phân tán, nhưng điều đó không tự động chứng minh dữ liệu tốt hơn. Ngược lại, SD rất nhỏ có thể cho thấy người trả lời chọn gần như cùng một mức, nhưng cũng có thể phản ánh một đặc điểm thật của mẫu.

Bạn nên dùng bảng dưới đây như hướng dẫn ra quyết định, không dùng như bảng cắt biến máy móc. Các ngưỡng trong bảng được gắn với nguồn khi nguồn đó thực sự hỗ trợ cho chỉ số liên quan.

Câu hỏi cần kiểm traCách xử lý trong luận vănNguồn tham khảo
SD có một ngưỡng đạt chung khôngKhông kết luận đạt hoặc không đạt chỉ từ SD; diễn giải theo thang đo và bối cảnh(Nguyễn Đình Thọ, 2011)
SD có bằng 0 khôngKiểm tra biến có chỉ một giá trị hay không; biến không có biến thiên thường không hữu ích cho phân tích tương quan hoặc hồi quy(Field, 2013)
Có dùng SD để kết luận thang đo đáng tin cậy khôngKhông; độ tin cậy cần xem Cronbach's Alpha và Corrected Item-Total Correlation(Cronbach, 1951); (Nunnally và Bernstein, 1994)
SD lớn có phải lỗi dữ liệu khôngKiểm tra outlier, nhập sai mã, đơn vị đo và phân phối trước khi quyết định(Tabachnick và Fidell, 2013)
SD có quyết định cỡ mẫu khôngKhông dùng SD đơn độc để kết luận cỡ mẫu; cỡ mẫu phải gắn với thiết kế và mô hình(Tabachnick và Fidell, 2013)

Một cách viết an toàn là: “Độ lệch chuẩn của biến X bằng [giá trị], cho thấy mức độ phân tán của các quan sát quanh giá trị trung bình [thấp/vừa/cao theo bối cảnh]. Chỉ số này được sử dụng để mô tả dữ liệu và được xem xét cùng các kiểm định tiếp theo.” Bạn cần thay phần trong ngoặc bằng nhận định có căn cứ từ bảng dữ liệu của mình.

Nếu giảng viên hỏi “độ lệch chuẩn bao nhiêu chấp nhận được”, bạn nên trả lời bằng thang đo và mục tiêu phân tích thay vì nêu một con số rời rạc. Chẳng hạn, SD bằng 0,40 trên thang Likert 1 đến 5 cho thấy câu trả lời khá tập trung. Nó không phải lý do đủ để loại biến nếu biến vẫn có ý nghĩa nội dung và đạt các kiểm định cần thiết.

Cách đọc độ lệch chuẩn trên output

Trong SPSS, bạn mở Analyze > Descriptive Statistics > Descriptives. Đưa các biến cần mô tả sang ô Variable(s), chọn Options, đánh dấu Mean, Std. deviation, MinimumMaximum, sau đó nhấn ContinueOK. Output thường xuất hiện bảng Descriptive Statistics.

Dòng N là số quan sát hợp lệ được dùng cho từng biến. MinimumMaximum cho biết hai giá trị nhỏ nhất và lớn nhất. Mean là giá trị trung bình. Cột Std. Deviation chính là độ lệch chuẩn mà bạn đang tìm. Nếu số lượng hợp lệ của các biến khác nhau, hãy kiểm tra missing value trước khi so sánh SD giữa các biến.

Dưới đây là bảng số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột được giữ theo cách SPSS in trong output để bạn đối chiếu với file đang mở.

Descriptive StatisticsNMinimumMaximumMeanStd. Deviation
HL12141.005.003.840.71
HL22141.005.003.910.66
HL32121.005.003.770.98
Valid N (listwise)212

Cách đọc dòng HL1 là: có 214 quan sát hợp lệ, giá trị thấp nhất là 1, cao nhất là 5, Mean bằng 3,84 và SD bằng 0,71. Bạn có thể nói các câu trả lời cho HL1 phân tán quanh Mean 3,84 với mức độ thể hiện qua SD 0,71. Dòng HL3 có N bằng 212, thấp hơn hai biến còn lại, nên cần kiểm tra vì có thể tồn tại missing value.

Khi báo cáo, đừng chép toàn bộ output nếu bảng kết quả quá dài. Bạn có thể lập bảng gồm mã biến, Mean và SD, đồng thời ghi rõ cỡ mẫu. Nếu các biến là các item của cùng một khái niệm, hãy cân nhắc báo cáo thêm điểm trung bình của nhân tố theo cách bạn đã quy định trong phương pháp.

Cách viết vào luận văn: “Kết quả thống kê mô tả cho thấy biến [mã biến] có Mean = [giá trị] và Std. Deviation = [giá trị], với [N] quan sát hợp lệ. Điều này cho thấy các câu trả lời có mức độ phân tán [mô tả phù hợp] quanh giá trị trung bình.” Số liệu trong câu phải lấy từ chính output của bạn, không lấy từ bảng minh họa.

Khi độ lệch chuẩn không đạt thì xử lý thế nào

Đầu tiên, xác định bạn đang gọi “không đạt” theo tiêu chí nào. Nếu chỉ vì SD nhỏ hoặc lớn hơn một con số được truyền miệng, chưa nên xóa biến. Hãy quay lại bảng câu hỏi, thang đo và mục tiêu của biến đó.

Kiểm tra mã hóa và đơn vị đo

Mở Variable View trong SPSS để xem Measure, Values, Missing và số chữ số thập phân. Một lỗi thường gặp là nhập thang Likert 1 đến 5 thành 1 đến 50, hoặc gán giá trị missing bằng 99 nhưng chưa khai báo 99 là missing. Những lỗi này làm Mean và SD bị kéo lệch.

Nếu có biến đảo chiều, hãy kiểm tra việc recode trước khi tính điểm nhân tố. Biến đảo chiều chưa xử lý có thể làm tương quan giữa các item giảm, nhưng nguyên nhân không nằm ở riêng SD.

Kiểm tra outlier và giá trị bất thường

Một vài quan sát rất khác phần còn lại có thể làm SD tăng. Bạn có thể dùng Analyze > Descriptive Statistics > Explore, đưa biến vào Dependent List, xem bảng Descriptives và biểu đồ Boxplot. Kiểm tra thêm file gốc để biết giá trị đó là lỗi nhập liệu hay phản ánh đúng đối tượng khảo sát.

Nếu quan sát là lỗi nhập liệu, sửa theo dữ liệu gốc và ghi lại lịch sử chỉnh sửa. Nếu quan sát là câu trả lời hợp lệ, không xóa chỉ để SD đẹp hơn. Hãy nêu cách xử lý và lý do trong phần phương pháp nếu outlier ảnh hưởng đáng kể đến kết quả.

Kiểm tra phân phối và phân tích tiếp theo

SD lớn không tự động làm hồi quy hoặc EFA thất bại. Bạn cần xem biểu đồ, skewness, kurtosis theo quy trình mà đề tài sử dụng, cùng với các giả định của mô hình. Với hồi quy, có thể kiểm tra thêm phần dư, VIF và Durbin-Watson. Với dữ liệu có điểm bất thường, bài outlier sẽ giúp bạn phân biệt một giá trị cực đoan với lỗi nhập.

Chỉ khi biến không có biến thiên, mã hóa sai, hoặc vi phạm tiêu chí đã được nêu trước trong thiết kế nghiên cứu, bạn mới cân nhắc sửa dữ liệu, loại quan sát hoặc loại biến. Mỗi lần loại cần có lý do và lưu lại số liệu trước, sau xử lý. Hội đồng thường hỏi quá trình này vì bảng kết quả cuối cùng không cho thấy các vòng kiểm tra đã diễn ra.

Phân biệt độ lệch chuẩn với phương sai

Độ lệch chuẩn và phương sai cùng mô tả độ phân tán, nhưng khác ở đơn vị đo. Phương sai là trung bình của các độ lệch bình phương so với Mean. Độ lệch chuẩn là căn bậc hai của phương sai, nên trở về đơn vị gốc.

Nếu thu nhập được đo bằng triệu đồng, phương sai có đơn vị là triệu đồng bình phương, trong khi SD có đơn vị là triệu đồng. Vì lý do này, SD thường được trình bày cạnh Mean trong bảng mô tả. Khi bạn thấy Variance trong output, đó chưa phải cột Std. Deviation.

Ví dụ, nếu phương sai của một biến bằng 0,49 thì SD bằng 0,70. Hai chỉ số có quan hệ toán học trực tiếp, nhưng không nên báo cáo thay thế cho nhau. Bạn có thể xem thêm bài phương sai để kiểm tra công thức và cách phần mềm tính chỉ số này.

Độ lệch chuẩn cũng khác trung vị. Trung vị là giá trị ở vị trí giữa sau khi sắp xếp dữ liệu, còn SD đo mức độ phân tán quanh Mean. Một bảng mô tả có thể báo cáo cả Mean, Median và SD khi phân phối lệch hoặc có outlier, nhưng mỗi con số trả lời một câu hỏi khác nhau.

Lỗi thường gặp

Nhầm SD với sai số chuẩn. Std. Deviation mô tả mức phân tán của các quan sát. Std. Error mô tả độ bất định của ước lượng trung bình. Hai cột này thường cùng xuất hiện trong một số bảng SPSS nhưng không thể dùng thay thế.

Tự đặt ngưỡng SD bằng một con số cố định. Thang đo 1 đến 5, thang đo 1 đến 7 và biến thu nhập có đơn vị khác nhau. Hãy giải thích SD trong bối cảnh của biến, sau đó dùng các kiểm định phù hợp để đánh giá chất lượng thang đo và mô hình.

Đọc SD mà bỏ qua N. Nếu một biến có 214 quan sát còn biến khác chỉ có 160, việc so sánh hai SD cần thận trọng. Kiểm tra missing value trước khi viết nhận xét.

Xóa biến vì SD lớn. SD lớn chỉ báo hiệu sự phân tán. Bạn cần kiểm tra nhập liệu, outlier, phân phối và vai trò của biến trong mô hình trước khi quyết định.

Chép kí hiệu σ vào luận văn nhưng không nói cách tính. Bạn có thể dùng SD hoặc Std. Deviation theo output SPSS. Quan trọng là chú thích rõ chỉ số được tính trên mẫu khảo sát và thống nhất cách trình bày trong toàn bộ chương kết quả.

Câu hỏi thường gặp

Độ lệch chuẩn bao nhiêu là chấp nhận được?

Không có một mức chung cho mọi nghiên cứu. Bạn cần xem khoảng đo, đơn vị của biến, đặc điểm mẫu và mục tiêu phân tích. Với thang Likert, hãy dùng SD để mô tả mức phân tán, sau đó đánh giá thang đo bằng các kiểm định được thiết kế cho mục tiêu đó.

Độ lệch chuẩn kí hiệu là SD hay σ?

Trong công thức, σ thường chỉ độ lệch chuẩn của tổng thể, còn s thường chỉ độ lệch chuẩn của mẫu. Trong output SPSS, tên bạn cần tìm là Std. Deviation, thường được viết tắt trong bài báo cáo là SD.

Độ lệch chuẩn bằng 0 có nghĩa gì?

Điều đó có nghĩa các giá trị được dùng để tính đều giống nhau. Bạn nên kiểm tra biến có bị nhập sai, mã hóa nhầm hoặc chỉ có một nhóm người trả lời hay không. Nếu biến thực sự không có biến thiên, nó thường không cung cấp nhiều thông tin cho các phân tích dựa trên tương quan.

Độ lệch chuẩn lớn có phải dữ liệu bị lỗi không?

Chưa thể kết luận như vậy. SD lớn có thể phản ánh mẫu có các mức trả lời khác nhau. Hãy kiểm tra giá trị tối thiểu, tối đa, boxplot, file gốc và mã hóa trước khi xử lý outlier hoặc loại quan sát.

Đọc độ lệch chuẩn ở đâu trong SPSS?

Vào Analyze > Descriptive Statistics > Descriptives, chọn biến, mở Options và đánh dấu Std. deviation. Trong bảng Descriptive Statistics, cột Std. Deviation là độ lệch chuẩn của từng biến.

Mở chính file .sav của bạn, chạy lại Descriptive Statistics, đối chiếu cột Std. Deviation với N, Mean và Min-Max, rồi ghi nhận xét vào bảng thống kê mô tả. Nếu bạn cần chạy và diễn giải phân tích trên dữ liệu thật của mình, M4 phân tích của DoThesis làm việc với file .sav hoặc .csv của bạn.