SD là gì? Cách đọc độ lệch chuẩn trong SPSS

Thống kê··15 phút đọc

SD là gì

Bạn mở output SPSS và thấy bảng Descriptive Statistics có các cột N, Minimum, Maximum, MeanStd. Deviation. Cột Std. Deviation chính là SD, viết tắt của Standard Deviation, tiếng Việt là độ lệch chuẩn. SD cho biết các giá trị quan sát phân tán xa hay gần giá trị trung bình như thế nào.

Nếu SD nhỏ, các câu trả lời hoặc giá trị dữ liệu thường tập trung quanh Mean. Nếu SD lớn, dữ liệu phân tán rộng hơn. SD không nói biến tốt hay xấu một cách độc lập, cũng không tự cho biết giả thuyết nghiên cứu có được chấp nhận hay không.

Về mặt kỹ thuật, SD là căn bậc hai của phương sai. Với một mẫu gồm n quan sát, công thức thường được viết như sau:

SD = √[Σ(xᵢ - x̄)² / (n - 1)]

Trong đó, xᵢ là từng giá trị quan sát, là Mean của mẫu và n là số quan sát. Mẫu số n - 1 được dùng khi tính độ lệch chuẩn của mẫu trong nghiên cứu. Khi bạn chạy thống kê mô tả bằng SPSS, phần mềm tính chỉ số này từ các giá trị hợp lệ của biến.

Ví dụ, nếu một biến có Mean bằng 3,80 và SD bằng 0,45 trên thang Likert 5 điểm, các câu trả lời tương đối tập trung quanh mức 3,80. Nếu Mean vẫn bằng 3,80 nhưng SD bằng 1,20, mức độ khác biệt giữa các đáp viên lớn hơn nhiều.

SD cũng có thể xuất hiện dưới tên Std. Deviation trong SPSS, Standard deviation trong Excel hoặc SD trong các bảng kết quả của luận văn. Khi đọc tài liệu, bạn nên xác định đúng cột này trước khi diễn giải.

Ý nghĩa của SD trong nghiên cứu định lượng

Trong nghiên cứu định lượng, SD giúp bạn mô tả mức độ phân tán của dữ liệu trước khi đi đến các phân tích như hồi quy, EFA, CFA hoặc PLS-SEM. Đây là một phần của thống kê mô tả, thường được trình bày cùng với tần số, tỷ lệ phần trăm, Mean, Minimum và Maximum. Bạn có thể xem thêm các bài thuộc chủ đề Thống kê để đặt SD đúng vào quy trình phân tích.

Với biến nhân khẩu học, SD có thể cho bạn hình dung mức độ phân tán của tuổi, thu nhập hoặc số năm kinh nghiệm. Với biến đo bằng Likert, SD phản ánh mức độ đồng thuận khác nhau giữa các đáp viên. Hai biến có cùng Mean vẫn có thể có SD rất khác nhau, vì vậy chỉ nhìn Mean là chưa đủ.

SD còn giúp bạn phát hiện dấu hiệu cần kiểm tra thêm. Một SD bằng 0 nghĩa là tất cả giá trị hợp lệ của biến giống nhau. Một SD rất nhỏ có thể xuất hiện khi đáp viên chọn gần như cùng một phương án. Ngược lại, SD lớn có thể phản ánh ý kiến phân tán, nhóm đáp viên khác nhau hoặc dữ liệu có outliers. Nếu nghi ngờ có giá trị bất thường, hãy kiểm tra thêm bài về outliers.

SD không phải tiêu chí loại biến quan sát trong mọi trường hợp. Bạn không nên thấy SD lớn rồi xóa biến ngay. Quyết định xử lý cần xem thêm thang đo, phân phối, bảng tần số, nội dung biến và mục tiêu phân tích. Nếu đang nhầm SD với một khái niệm đo lường, có thể xem scale là gì để phân biệt thang đo, biến quan sát và chỉ số thống kê.

Trong báo cáo, SD thường được dùng để trả lời ba câu hỏi: dữ liệu nằm quanh mức trung bình nào, mức độ phân tán ra sao và có dấu hiệu bất thường cần kiểm tra hay không. Nó là thông tin mô tả, không phải kết luận nhân quả.

SD bao nhiêu là đạt

Không có một ngưỡng SD chung áp dụng cho mọi biến, mọi thang đo và mọi đề tài. SD phụ thuộc vào khoảng đo, cách mã hóa, phân phối dữ liệu và đối tượng khảo sát. Vì vậy, câu hỏi “độ lệch chuẩn bao nhiêu là chấp nhận được” cần được trả lời theo bối cảnh thay vì áp một con số máy móc.

Với thang Likert 5 điểm, SD thường nằm trong khoảng từ 0 đến một mức tối đa lý thuyết phụ thuộc vào phân phối các lựa chọn. Một SD khoảng 0,4 và một SD khoảng 1,1 đều có thể hợp lý trong những tình huống khác nhau. Bạn cần nhìn cùng lúc Mean, Minimum, Maximum và bảng tần số.

Bảng dưới đây tóm tắt cách diễn giải thực hành. Các mức mô tả là hướng đọc dữ liệu, không phải ngưỡng đạt bắt buộc của một kiểm định. Các nguồn được nêu cho nguyên tắc kiểm tra liên quan, vì không có nguồn trong danh mục cho một ngưỡng SD chung của mọi thang Likert.

Tình huống khi đọc SDCách hiểu và việc cần kiểm traNguồn
SD bằng 0Mọi quan sát có cùng giá trị. Kiểm tra biến có bị nhập sai hoặc không có biến thiên không.(Field, 2013)
SD rất nhỏ so với khoảng đoCâu trả lời tập trung mạnh. Kiểm tra hiện tượng chọn một mức lặp lại, mã hóa và bảng tần số.(Field, 2013)
SD ở mức trung bìnhDữ liệu có biến thiên, thường phù hợp để tiếp tục mô tả và kiểm tra phân tích. Vẫn cần xem phân phối.(Field, 2013)
SD lớn gần với khoảng đoÝ kiến phân tán hoặc có thể có outliers. Kiểm tra Minimum, Maximum, histogram và giá trị bất thường.(Field, 2013)
SD không thể so sánh trực tiếp giữa hai biến khác thang đoCần xem đơn vị và khoảng đo trước khi kết luận biến nào phân tán hơn.(Field, 2013)
SD của biến quan sát thấp nhưng không có tiêu chí loại tự độngXem thêm nội dung biến, Mean, tần số và kết quả Reliability Analysis.(Nunnally và Bernstein, 1994)

Một số tài liệu hướng dẫn thống kê mô tả có thể đưa ra khoảng SD mang tính kinh nghiệm cho một loại thang đo cụ thể. Bạn chỉ nên sử dụng khoảng đó nếu giảng viên hoặc phương pháp nghiên cứu của đề tài yêu cầu rõ. Đừng biến một quy ước mô tả thành tiêu chí đạt có tính phổ quát.

SD không có ngưỡng đạt tương tự Cronbach's Alpha từ 0,7 hay KMO từ 0,5. Các ngưỡng đó thuộc về những chỉ số khác. Nếu một người hỏi “SD bao nhiêu là đạt”, câu trả lời thận trọng là cần xem thang đo và mục đích phân tích, sau đó kiểm tra dữ liệu thay vì chỉ đối chiếu một con số.

Cách đọc SD trên output

Bạn có thể chạy SD trong SPSS theo đường dẫn Analyze > Descriptive Statistics > Descriptives. Đưa các biến cần xem vào ô Variable(s), bấm Options, chọn Mean, Std. deviation, MinimumMaximum, rồi bấm ContinueOK. Nếu muốn xem tần số chi tiết, dùng Analyze > Descriptive Statistics > Frequencies.

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên bảng và tên cột được trình bày theo cách SPSS thường hiển thị trong output.

Descriptive StatisticsNMinimumMaximumMeanStd. Deviation
CL1214153,840,72
CL2214153,790,68
CL3214153,860,75
HL1214153,411,08
Valid N (listwise)214

Ở dòng CL1, Mean bằng 3,84 và Std. Deviation bằng 0,72. Điều đó cho thấy câu trả lời cho CL1 có xu hướng quanh mức 3,84 và có độ phân tán nhất định. Bạn có thể mô tả rằng CL1 có giá trị trung bình 3,84, SD 0,72, với 214 quan sát hợp lệ.

HL1 có Mean thấp hơn CL1 và SD cao hơn. Như vậy, đáp viên vừa có mức đánh giá trung bình thấp hơn, vừa có sự khác biệt trong câu trả lời lớn hơn. Bạn chưa nên kết luận HL1 là biến kém chất lượng chỉ vì SD bằng 1,08. Hãy xem thêm tần số, nội dung biến và các bước kiểm định tiếp theo.

Nếu bảng có N khác nhau giữa các biến, hãy kiểm tra missing values. SPSS có thể tính từng biến dựa trên số quan sát hợp lệ riêng, trong khi một phân tích khác có thể dùng Valid N (listwise), tức chỉ giữ các dòng đầy đủ dữ liệu cho toàn bộ biến. Sự khác biệt này cần được ghi nhận khi bạn báo cáo cỡ mẫu.

Bạn cũng nên mở Analyze > Descriptive Statistics > Frequencies để xem các mức 1, 2, 3, 4, 5 được chọn với tần suất bao nhiêu. SD chỉ là một con số tóm tắt. Hai bộ dữ liệu có cùng Mean và SD vẫn có thể có hình dạng phân phối khác nhau.

Khi SD không đạt thì xử lý thế nào

Vì SD không có một ngưỡng đạt chung, cách xử lý nên bắt đầu từ việc xác định bạn đang lo điều gì. Nếu SD bằng 0 hoặc gần 0, kiểm tra lại mã hóa và dữ liệu gốc trước. Có thể bạn đã nhập cùng một giá trị cho cả cột, đảo nhầm mã hoặc dùng sai biến trong hộp thoại SPSS.

Kiểm tra khoảng đo và mã hóa

Xác nhận biến có đúng thang đo không. Một biến Likert 1 đến 5 không nên đột nhiên có giá trị 0, 6 hoặc 99 nếu các mã này không được định nghĩa. Mở Variable View, kiểm tra Values, MissingMeasure, sau đó xem Frequencies để phát hiện mã lạ.

Nếu có biến đảo chiều, hãy tạo biến đã recode trước khi tính điểm thang đo. Đảo chiều sai có thể làm Mean và SD bị diễn giải sai, đồng thời ảnh hưởng Reliability Analysis và EFA.

Kiểm tra dữ liệu bất thường

Xem Minimum, Maximum, bảng tần số và biểu đồ. Với biến liên tục, có thể kiểm tra boxplot để nhận diện điểm cực đoan. Một outlier không mặc nhiên là lỗi. Bạn cần đối chiếu với phiếu trả lời hoặc quy tắc làm sạch dữ liệu đã nêu trong phương pháp nghiên cứu.

Nếu dữ liệu hợp lệ và đại diện cho một nhóm có quan điểm khác biệt, giữ lại có thể hợp lý hơn xóa. Nếu phát hiện lỗi nhập liệu, sửa theo dữ liệu gốc và lưu lại lịch sử chỉnh sửa.

Kiểm tra chất lượng bảng hỏi

SD rất nhỏ ở nhiều biến có thể là dấu hiệu đáp viên chọn cùng một mức cho gần như toàn bộ bảng hỏi. Kiểm tra thời gian trả lời, mẫu trả lời lặp lại và tỷ lệ hoàn thành. Bạn cần có quy tắc làm sạch được nêu trước, thay vì đặt ra quy tắc sau khi nhìn thấy kết quả không đẹp.

SD lớn ở một biến cũng có thể phản ánh câu chữ chưa rõ hoặc khái niệm được hiểu khác nhau. Khi đã thu thập dữ liệu xong, bạn không nên tự ý sửa nội dung biến để làm SD nhỏ hơn. Nếu cần loại biến, phải dựa trên lý thuyết, chất lượng đo lường và trao đổi với giảng viên.

Chạy lại thống kê sau khi xử lý có căn cứ

Sau mỗi thay đổi hợp lệ, chạy lại Analyze > Descriptive Statistics > Descriptives và lưu output theo từng phiên bản. Đừng chỉ giữ bảng cuối cùng nếu bạn đã loại dòng hoặc sửa mã. Hội đồng có thể hỏi vì sao cỡ mẫu thay đổi và bạn cần giải thích được.

Nếu vấn đề liên quan đến biến điều tiết hoặc biến trung gian, SD không phải chỉ số để kết luận vai trò đó. Bạn có thể xem thêm moderator, moderating hoặc mediator để phân biệt các khái niệm này với thống kê mô tả.

Phân biệt SD với Mean và SE

Mean là giá trị trung bình, cho biết trung tâm của dữ liệu. SD cho biết các quan sát phân tán quanh Mean. Hai chỉ số này thường đi cùng nhau trong bảng mô tả, nhưng trả lời hai câu hỏi khác nhau.

Standard Error, thường viết là SE hoặc Std. Error, phản ánh mức độ không chắc chắn của một ước lượng như Mean. SE thường giảm khi cỡ mẫu tăng, trong khi SD mô tả độ phân tán của chính các quan sát. Bạn không nên lấy SE thay cho SD khi báo cáo mức độ phân tán của đáp viên.

Variance là phương sai, bằng SD bình phương. Vì vậy, nếu SD bằng 0,72 thì phương sai xấp xỉ 0,5184. Trong luận văn, SD dễ diễn giải hơn vì giữ nguyên đơn vị của biến, còn variance dùng đơn vị bình phương.

Range là khoảng biến thiên, được tính từ Maximum trừ Minimum. Range chỉ dùng hai giá trị biên, còn SD sử dụng toàn bộ các quan sát. Một bộ dữ liệu có range giống nhau vẫn có thể có SD khác nhau nếu các giá trị nằm giữa hai biên được phân bố khác nhau.

SD cũng khác với Cronbach's Alpha. SD mô tả một biến hoặc điểm số phân tán thế nào, còn Alpha đánh giá mức độ nhất quán nội tại của các biến quan sát trong cùng một thang đo. Bạn có thể có SD hợp lý nhưng Alpha thấp, hoặc Alpha đạt nhưng một biến vẫn có phân phối cần kiểm tra.

Lỗi thường gặp

Lỗi đầu tiên là viết “SD đạt trên 0,5” như một tiêu chí bắt buộc. Con số này không phải ngưỡng chung trong danh sách tiêu chí được trích dẫn cho SD. Hãy mô tả SD theo thang đo và phân phối, đồng thời ghi nguồn cho các tiêu chí thật sự áp dụng.

Lỗi thứ hai là chỉ báo cáo Mean mà bỏ SD. Với nghiên cứu định lượng, người đọc cần biết cả trung tâm và mức phân tán. Bảng thống kê mô tả nên có ít nhất N, Mean và SD khi các chỉ số này phù hợp với biến.

Lỗi thứ ba là gọi Std. Error là độ lệch chuẩn. Trong output, hãy nhìn chính xác tên cột. Std. Deviation là SD, còn Std. Error là sai số chuẩn.

Lỗi thứ tư là xóa biến chỉ vì SD lớn. Trước khi quyết định, kiểm tra mã hóa, missing values, outliers, nội dung biến và kết quả của các phân tích liên quan. Mọi lần loại dữ liệu cần có lý do và được ghi lại.

Lỗi thứ năm là so sánh SD của các biến có khoảng đo khác nhau mà không chuẩn hóa cách hiểu. SD của tuổi tính theo năm không thể đọc giống SD của mức độ đồng ý từ 1 đến 5.

Bạn cũng không nên dùng SD để kết luận một giả thuyết có tác động hay không. Kết luận giả thuyết cần dựa trên mô hình và kiểm định tương ứng, chẳng hạn hệ số hồi quy, p-value, khoảng tin cậy hoặc path coefficient trong PLS-SEM.

Câu hỏi thường gặp

Độ lệch chuẩn bao nhiêu là chấp nhận được?

Không có một con số SD chung được xem là đạt cho mọi nghiên cứu. Bạn cần xem SD trong quan hệ với khoảng đo, Mean, tần số, cỡ mẫu và mục tiêu phân tích. Với thang Likert, hãy mô tả mức độ phân tán và kiểm tra dữ liệu thay vì loại biến theo một ngưỡng tự đặt.

SD bằng 0 có phải dữ liệu bị lỗi không?

SD bằng 0 nghĩa là các giá trị hợp lệ giống nhau. Đây có thể là dữ liệu thật, nhưng thường cần kiểm tra lại mã hóa, công thức tính và cột dữ liệu. Nếu biến không có biến thiên, nó thường không cung cấp nhiều thông tin cho các phân tích cần sự khác biệt giữa các quan sát.

SD càng nhỏ có phải càng tốt không?

SD nhỏ chỉ cho thấy câu trả lời tập trung quanh Mean. Nó không tự chứng minh thang đo tốt hay dữ liệu chất lượng cao. Nếu mọi đáp viên chọn cùng một mức do câu hỏi dễ đoán, cách thu thập hoặc cách lọc dữ liệu, SD nhỏ có thể che giấu vấn đề thay vì thể hiện chất lượng.

SD lớn có phải loại biến quan sát không?

Chưa đủ căn cứ để loại biến. Hãy kiểm tra thang đo, tần số, outliers, mã hóa và kết quả Reliability Analysis hoặc EFA. Nếu biến vẫn phù hợp về lý thuyết và dữ liệu hợp lệ, SD lớn có thể chỉ phản ánh sự khác biệt thật giữa các đáp viên.

Đọc SD ở cột nào trong SPSS?

Trong bảng Descriptive Statistics, đọc cột Std. Deviation. Đừng nhầm cột này với Std. Error. Nếu bảng không có cột SD, vào Analyze > Descriptive Statistics > Descriptives, chọn Options và đánh dấu Std. deviation trước khi chạy lại.

Bạn hãy mở file SPSS của mình, kiểm tra Std. Deviation cùng với N, Mean, Minimum, Maximum và bảng tần số, sau đó ghi rõ cách xử lý mọi giá trị bất thường trước khi chạy phân tích tiếp theo; nếu cần chạy thống kê trên chính file .sav hoặc .csv, M4 phân tích của DoThesis hỗ trợ bước này.

SD là gì? Cách đọc độ lệch chuẩn trong SPSS | DoThesis