STD là gì? Cách đọc độ lệch chuẩn trong SPSS

Thống kê··16 phút đọc

Bạn mở bảng Descriptive Statistics trong SPSS và thấy các cột Mean, Std. Deviation, N. Cột Std. Deviation chính là STD, viết đầy đủ là Standard Deviation, tiếng Việt gọi là độ lệch chuẩn. Chỉ số này cho biết các giá trị trong dữ liệu phân tán xa hay gần giá trị trung bình như thế nào.

STD không tự động cho biết dữ liệu tốt hay xấu. Bạn cần đọc nó cùng với thang đo, giá trị trung bình, khoảng giá trị hợp lệ và mục tiêu phân tích. Một STD bằng 2 có thể là rất lớn nếu biến được đo từ 1 đến 5, nhưng lại không đáng lo nếu biến có đơn vị đo từ 0 đến 100.

Nếu bạn đang rà lại các chỉ số trong output, có thể xem thêm chuyên mục Thống kê để phân biệt thống kê mô tả với kiểm định và mô hình suy luận.

STD là gì

STD đo mức độ phân tán của các quan sát quanh giá trị trung bình. Nếu các câu trả lời tập trung gần Mean, STD nhỏ. Nếu câu trả lời trải rộng giữa nhiều mức, STD lớn. Công thức ở cấp độ tổng thể thường được mô tả bằng căn bậc hai của phương sai, còn trong mẫu SPSS sử dụng độ lệch chuẩn mẫu với mẫu số là N - 1.

Có thể hình dung đơn giản như sau: một nhóm sinh viên có điểm lần lượt 7, 7, 8, 8, 7 sẽ có Mean gần 7,4 và STD nhỏ. Một nhóm khác có điểm 4, 5, 8, 9, 9 có thể có Mean tương tự, nhưng STD lớn hơn vì các điểm nằm xa Mean hơn.

Trong SPSS, STD thường xuất hiện với tên Std. Deviation. Đây không phải là một kiểm định giả thuyết và cũng không phải p-value. Nó là một thống kê mô tả, dùng để tóm tắt mức độ biến thiên của dữ liệu trước khi bạn chạy Cronbach's Alpha, EFA, hồi quy hoặc các mô hình khác.

Đơn vị của STD giống đơn vị của biến gốc. Nếu biến được đo bằng điểm Likert, STD cũng được tính theo đơn vị điểm Likert. Nếu biến là thu nhập tính bằng triệu đồng, STD cũng có đơn vị triệu đồng. Vì vậy, nhìn một con số mà không xem khoảng đo có thể dẫn đến kết luận sai.

Ý nghĩa của STD trong nghiên cứu định lượng

STD giúp bạn trả lời ba câu hỏi thực tế. Thứ nhất, người trả lời có xu hướng lựa chọn giống nhau hay phân tán giữa các mức. Thứ hai, biến có đủ biến thiên để tiếp tục phân tích hay phần lớn câu trả lời đang dồn vào một mức. Thứ ba, một giá trị quan sát có thể đang lệch xa phần lớn dữ liệu hay không.

Ví dụ, biến HL1 đo mức độ hài lòng theo Likert 1 đến 5 có Mean là 4,20 và STD là 0,45. Kết quả này cho thấy câu trả lời tương đối tập trung ở mức cao. Nếu Mean là 3,10 và STD là 1,35, người trả lời có quan điểm phân tán hơn. STD lớn trong trường hợp này chưa đủ để kết luận bảng hỏi có lỗi, vì nó có thể phản ánh sự khác nhau thật giữa các đáp viên.

Trong thống kê mô tả, bạn thường đọc STD cùng với Minimum, Maximum, MeanN. Nếu một biến có Minimum là 1, Maximum là 5 nhưng STD chỉ 0,10, gần như toàn bộ dữ liệu có thể đang tập trung vào một giá trị. Khi đó, thang đo có ít khả năng phân biệt giữa các đáp viên.

STD cũng liên quan đến việc nhận diện dữ liệu bất thường, nhưng không nên dùng STD như tiêu chí duy nhất để xóa dòng dữ liệu. Nếu nghi ngờ một đáp viên trả lời quá khác biệt, hãy kiểm tra mẫu trả lời, thời gian hoàn thành, quy luật chọn đáp án và các biến liên quan. Bạn có thể xem thêm hướng dẫn về outliers để tách vấn đề quan sát bất thường khỏi vấn đề phân phối chung của biến.

Với hồi quy, STD của biến phụ thuộc và biến độc lập giúp bạn hiểu thang đo dữ liệu trước khi diễn giải hệ số. Tuy nhiên, STD không quyết định một giả thuyết có được chấp nhận hay không. Quyết định đó dựa vào hệ số, p-value, khoảng tin cậy và các kiểm tra phù hợp với mô hình.

Nếu biến nằm trong một thang đo nhiều biến quan sát, bạn cũng cần hiểu cách mã hóa và bản chất của scale là gì. STD được tính từ dữ liệu đã thu thập, còn scale mô tả cách khái niệm được đo lường.

STD bao nhiêu là đạt

Không có một ngưỡng STD chung áp dụng cho mọi đề tài. Câu hỏi “độ lệch chuẩn bao nhiêu là chấp nhận được” phải được trả lời dựa trên khoảng đo của biến. Với thang Likert 1 đến 5, STD không thể vượt quá mức mà thang đo cho phép. Với biến thu nhập, tuổi hoặc doanh thu, STD có thể lớn hơn nhiều do đơn vị đo và phạm vi dữ liệu khác nhau.

Bảng dưới đây là cách đọc thực hành, không phải quy tắc để tự động loại biến. Những nhận định về Likert cần được hiểu theo khoảng đo của bảng hỏi, còn tiêu chí về cỡ mẫu và kiểm tra phân phối cần dựa trên nguồn phương pháp tương ứng.

Tình huốngCách diễn giải STDQuyết định nên làmNguồn hoặc căn cứ
STD gần 0Các câu trả lời tập trung rất sát MeanKiểm tra biến có bị chọn gần như một mức và thiếu biến thiên hay khôngThống kê mô tả của chính bộ dữ liệu
STD nhỏ so với khoảng 1 đến 5Câu trả lời tương đối đồng nhấtGiữ biến nếu nội dung và các kiểm định thang đo phù hợpKhoảng đo Likert của bảng hỏi
STD lớn so với khoảng 1 đến 5Câu trả lời phân tán rộngKiểm tra phân phối, dữ liệu nhập và nhóm đáp viênKhoảng đo Likert của bảng hỏi
STD lớn ở tuổi, thu nhập hoặc doanh thuDữ liệu phân tán theo đơn vị đo tự nhiênKhông xóa biến chỉ vì STD lớn; kiểm tra phân phối và outlierĐơn vị đo và mục tiêu nghiên cứu
Cần đánh giá cỡ mẫu theo số biến quan sátSTD không thay thế cho tiêu chí cỡ mẫuĐối chiếu số quan sát với số biến quan sát(Hair và cộng sự, 2010)
Cần kiểm tra phân phối trong hồi quySTD chỉ là một phần của mô tảKiểm tra thêm phần dư, outlier và các giả định của mô hình(Field, 2013)

Vì vậy, không nên viết trong luận văn rằng “STD dưới 1 là đạt” cho mọi biến. Con số 1 chỉ có ý nghĩa khi bạn đang đọc một thang đo có khoảng giá trị cụ thể, chẳng hạn Likert 1 đến 5. Ngay cả khi STD trên 1, dữ liệu vẫn có thể sử dụng được nếu không có lỗi nhập liệu, biến có ý nghĩa và các điều kiện của phân tích tiếp theo được đáp ứng.

Đối với thang Likert, cách báo cáo an toàn là nêu Mean và STD của từng biến hoặc từng nhóm biến, sau đó mô tả xu hướng trả lời. Bạn không cần biến một ngưỡng STD tự đặt thành điều kiện loại biến nếu tài liệu phương pháp của đề tài không yêu cầu.

Cách đọc STD trên output

Trong SPSS, bạn chạy thống kê mô tả bằng đường dẫn Analyze > Descriptive Statistics > Descriptives. Đưa các biến cần xem vào ô Variable(s), bấm Options, chọn Mean, Std. deviation, Minimum, Maximum, rồi bấm ContinueOK.

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột được giữ theo cách SPSS hiển thị để bạn đối chiếu với file đang mở.

Descriptive StatisticsNMinimumMaximumMeanStd. Deviation
HL1180153.840.76
HL2180253.910.68
HL3180153.471.02
HL4177153.620.91
Valid N (listwise)177

Cột N cho biết số quan sát được dùng cho từng biến. Trong ví dụ, HL4 có N bằng 177, thấp hơn các biến còn lại. Bạn cần kiểm tra missing value trước khi kết luận STD của HL4 cao hay thấp. Dòng Valid N (listwise) cho biết số dòng còn lại nếu chỉ giữ những đáp viên không thiếu dữ liệu ở toàn bộ biến được đưa vào bảng.

Cột MinimumMaximum cho biết giá trị nhỏ nhất và lớn nhất thực tế. Với thang Likert 1 đến 5, nếu Maximum bằng 7, bạn nên kiểm tra mã hóa hoặc nhập liệu. Nếu Minimum và Maximum đều nằm trong khoảng 1 đến 5, dữ liệu vẫn cần được kiểm tra thêm về phân phối, nhưng ít nhất không có lỗi phạm vi rõ ràng.

Ở dòng HL1, Mean là 3,84 và STD là 0,76. Bạn có thể mô tả rằng HL1 có mức đánh giá trung bình khá cao và mức phân tán 0,76 trên thang đo đang sử dụng. Cách viết này bám vào số liệu, không gán nhãn “đạt” cho STD một cách máy móc.

Bạn cũng có thể xem STD bằng đường dẫn Analyze > Descriptive Statistics > Frequencies. Trong hộp thoại Frequencies, bấm Statistics rồi chọn Mean, Std. deviation, MinimumMaximum. Nếu cần biểu đồ, chọn thêm Charts, nhưng biểu đồ không thay thế cho việc kiểm tra bảng dữ liệu gốc.

Cách viết vào luận văn

Bạn có thể điều chỉnh câu sau theo số liệu của mình: “Kết quả thống kê mô tả cho thấy biến [MÃ BIẾN] có giá trị trung bình là [MEAN] và độ lệch chuẩn là [STD], với giá trị nhỏ nhất [MIN] và lớn nhất [MAX] trên thang đo từ [MỨC THẤP] đến [MỨC CAO]. Điều này cho thấy mức độ phân tán của các câu trả lời ở mức [mô tả phù hợp], đồng thời dữ liệu nằm trong khoảng mã hóa của bảng hỏi.”

Nếu viết cho cả nhóm biến, bạn nên đưa bảng thống kê mô tả vào chương 4 và giải thích những biến nổi bật. Không cần lặp lại một câu giống nhau cho 20 biến nếu bảng đã cung cấp đầy đủ số liệu.

Khi STD không đạt thì xử lý thế nào

Trước hết, xác định “không đạt” đang có nghĩa gì. Nếu bạn chỉ thấy STD lớn hơn 1 trên thang Likert 1 đến 5, đó chưa phải lý do đủ để xóa biến. Nếu STD gần 0 và hầu hết đáp viên chọn cùng một phương án, vấn đề đáng xem xét hơn là biến thiếu khả năng phân biệt.

Kiểm tra khoảng giá trị và mã hóa

Mở Analyze > Descriptive Statistics > Frequencies để xem Minimum, Maximum và tần suất từng mức. Kiểm tra Value Labels, các mã missing và những biến đảo chiều. Một biến đáng lẽ từ 1 đến 5 nhưng xuất hiện 0, 6 hoặc 99 có thể làm STD sai.

Nếu bạn dùng mã 99 cho “không có ý kiến”, cần khai báo 99 là missing trong Variable View, cột Missing. Sau đó chạy lại thống kê. Không được thay 99 bằng Mean chỉ để làm STD đẹp hơn nếu chưa có lý do phương pháp rõ ràng.

Kiểm tra dữ liệu nhập và đáp viên bất thường

So sánh file gốc với file .sav hoặc .csv. Kiểm tra các dòng bị lệch cột, lỗi dấu thập phân, biến nhập ngược chiều và trường hợp nhập toàn bộ câu trả lời thành một mã. Nếu một vài dòng quá khác biệt, xem đó có phải outlier thật hay lỗi nhập.

Việc xóa outlier cần có tiêu chí và ghi lại quyết định. Bạn nên lưu bản dữ liệu ban đầu, bản dữ liệu sau xử lý và danh sách dòng bị loại. Hội đồng có thể hỏi vì sao một đáp viên bị xóa, trong khi không ai hỏi vì sao STD được làm tròn cho đẹp.

Kiểm tra lại bối cảnh của biến

STD cao đôi khi phản ánh sự khác nhau thực tế giữa người trả lời. Ví dụ, mức thu nhập của người mới đi làm và người có nhiều năm kinh nghiệm có thể phân tán mạnh. Trong trường hợp này, bạn có thể báo cáo STD, xem thêm trung vị hoặc phân nhóm phù hợp với câu hỏi nghiên cứu.

Chỉ loại biến khi có căn cứ tổng thể

Một biến quan sát chỉ nên bị loại khi có vấn đề được xác định từ nội dung, mã hóa, chất lượng dữ liệu hoặc kết quả kiểm định thang đo. Cronbach's Alpha, Corrected Item-Total Correlation và EFA có vai trò riêng. STD không thể thay thế các kiểm định đó.

Nếu bạn đang phân tích vai trò điều tiết, đừng nhầm STD cao với biến moderator. Khái niệm moderator liên quan đến việc một biến làm thay đổi độ mạnh hoặc hướng của mối quan hệ, không phải chỉ số phân tán. Xem thêm moderatormoderating khi đọc mô hình có tương tác.

Phân biệt STD với phương sai và SE

STD, phương sai và Standard Error đều liên quan đến độ biến thiên nhưng trả lời các câu hỏi khác nhau.

STD cho biết mức độ phân tán của các quan sát quanh Mean và có cùng đơn vị với biến gốc. Nếu biến đo bằng điểm Likert, STD cũng được tính theo đơn vị điểm đó. Đây là chỉ số bạn thường thấy trong bảng Descriptive Statistics.

Variance, hay phương sai, bằng bình phương của STD. Vì đơn vị bị bình phương nên phương sai thường khó diễn giải trực tiếp hơn. SPSS có thể hiển thị phương sai trong một số thủ tục, nhưng sinh viên thường báo cáo STD để người đọc dễ hiểu mức phân tán.

Standard Error of the Mean, thường viết là Std. Error, phản ánh độ không chắc chắn của Mean mẫu khi dùng để ước lượng Mean tổng thể. Standard Error giảm khi cỡ mẫu tăng, còn STD mô tả mức độ khác nhau giữa các cá thể trong mẫu. Hai cột này không được dùng thay thế cho nhau.

Bạn cũng cần phân biệt STD với p-value. STD lớn không đồng nghĩa với kết quả không có ý nghĩa thống kê, và STD nhỏ không bảo đảm một mối quan hệ có p-value nhỏ. Với biến trung gian, bạn cần đọc tác động gián tiếp và khoảng tin cậy, không dùng STD để kết luận mediator. Khái niệm này được giải thích thêm tại mediator.

Lỗi thường gặp

Gọi STD là hệ số hồi quy

Hệ số hồi quy nằm trong bảng Coefficients, thường có các cột B, Std. Error, Beta, tSig.. Std. Error ở đây không phải Std. Deviation. Bạn cần nhìn đúng tên bảng và tên cột trước khi diễn giải.

Đặt ngưỡng STD chung cho mọi biến

Biến Likert, tuổi, thu nhập và điểm thi có khoảng đo khác nhau. So sánh STD giữa các biến khác đơn vị có thể gây hiểu nhầm. Nếu cần so sánh mức phân tán tương đối, bạn phải nêu rõ cách chuẩn hóa và mục đích so sánh.

Xóa biến chỉ vì STD cao

STD cao có thể là đặc điểm thật của mẫu. Hãy kiểm tra mã hóa, missing, outlier và mục tiêu nghiên cứu trước. Việc xóa biến chỉ để bảng đẹp có thể làm mất thông tin và khiến phần giải trình ở chương 4 yếu đi.

Không kiểm tra N

Nếu N của các biến khác nhau, STD giữa chúng được tính trên các số quan sát khác nhau. Hãy xem missing value và ghi rõ cách xử lý. Đặc biệt, đừng bỏ qua dòng Valid N (listwise) khi chuẩn bị chạy hồi quy hoặc EFA.

Chỉ báo cáo Mean mà bỏ STD

Mean cho biết xu hướng trung tâm, còn STD cho biết mức phân tán. Hai chỉ số thường nên được đọc cùng nhau. Một Mean cao có thể đi kèm STD thấp hoặc cao, dẫn đến hai cách diễn giải về mức độ đồng thuận khác nhau.

Câu hỏi thường gặp

STD là gì trong SPSS

STD trong SPSS là viết tắt của Standard Deviation, được hiển thị phổ biến dưới tên Std. Deviation. Nó cho biết các giá trị quan sát phân tán quanh giá trị trung bình ở mức nào.

Bạn có thể xem STD qua Analyze > Descriptive Statistics > Descriptives, sau đó chọn Std. deviation trong phần Options.

Độ lệch chuẩn bao nhiêu là chấp nhận được

Không có một con số chung cho mọi biến. Với thang Likert 1 đến 5, bạn cần đọc STD trong tương quan với khoảng đo, Mean, Minimum, Maximum và mục tiêu nghiên cứu.

STD lớn hơn 1 không tự động có nghĩa là biến không đạt. Trước khi xử lý, hãy kiểm tra mã hóa, missing, outlier và kết quả của các kiểm định thang đo liên quan.

STD càng nhỏ có phải càng tốt không

STD nhỏ cho thấy câu trả lời tập trung, nhưng không phải lúc nào cũng tốt. Nếu gần như toàn bộ đáp viên chọn cùng một mức, biến có thể thiếu khả năng phân biệt giữa các đối tượng.

Bạn nên xem STD cùng với tần suất từng mức trả lời. Một STD vừa phải có thể phù hợp nếu nó phản ánh đúng sự khác nhau của mẫu nghiên cứu.

STD cao thì có cần loại biến không

Chưa cần. Hãy kiểm tra khoảng giá trị, mã missing, lỗi nhập liệu và outlier trước. Sau đó xem biến có vấn đề trong Corrected Item-Total Correlation, Cronbach's Alpha hoặc EFA hay không.

Nếu loại biến, bạn cần ghi lại lý do và chạy lại phân tích theo quy trình nhất quán. Không nên loại chỉ vì muốn STD nằm dưới một con số tự đặt.

STD và Standard Error có giống nhau không

Không giống nhau. STD mô tả mức độ phân tán giữa các quan sát trong mẫu, còn Standard Error mô tả độ không chắc chắn của Mean mẫu. Hai cột có tên gần nhau nhưng ý nghĩa và cách báo cáo khác nhau.

Khi đọc bảng Coefficients, hãy chú ý Std. Error. Khi đọc bảng Descriptive Statistics, cột cần tìm cho độ lệch chuẩn là Std. Deviation.

Bạn hãy mở đúng bảng Descriptive Statistics trong file của mình, kiểm tra N, Minimum, Maximum, MeanStd. Deviation, rồi ghi lại các biến có giá trị bất thường trước khi chạy bước tiếp theo. Nếu cần chạy phân tích trên chính file .sav hoặc .csv, M4 phân tích của DoThesis sẽ hỗ trợ bước này.