Skewness là gì? Cách đọc và diễn giải trong SPSS

Thống kê··14 phút đọc

Skewness là gì

Bạn mở SPSS, xem bảng Descriptive Statistics và thấy mỗi biến có một cột Skewness. Chỉ số này cho biết phân phối điểm quan sát lệch về bên trái hay bên phải so với dạng đối xứng. Nói đơn giản, skewness giúp bạn nhận ra phần lớn câu trả lời có đang tập trung về một phía của thang đo hay không.

Với một biến ngẫu nhiên, skewness thường được mô tả bằng moment trung tâm bậc ba chuẩn hóa:

Skewness = μ3 / σ³

Trong đó μ3 là moment trung tâm bậc ba và σ là độ lệch chuẩn. Bạn không cần tự tính công thức này khi đã có file .sav. SPSS sẽ tính dựa trên các giá trị hợp lệ của biến. Nếu skewness bằng 0, phân phối có dạng đối xứng về mặt lý thuyết. Giá trị dương cho thấy đuôi phân phối kéo dài về phía bên phải, còn giá trị âm cho thấy đuôi kéo dài về phía bên trái.

Skewness thường được xem cùng kurtosis, histogram, Q-Q plot và bối cảnh đo lường. Một con số riêng lẻ không đủ để kết luận dữ liệu của bạn có vấn đề hay không. Bạn có thể xem thêm chủ đề Thống kê nếu đang rà soát các chỉ số mô tả trước khi chạy hồi quy, EFA hoặc PLS-SEM.

Ý nghĩa của skewness trong nghiên cứu định lượng

Trong nghiên cứu định lượng, skewness chủ yếu giúp bạn đánh giá hình dạng phân phối của biến quan sát hoặc biến tổng hợp. Thông tin này có thể ảnh hưởng đến cách bạn kiểm tra giả định, lựa chọn phép kiểm định và giải thích các giá trị trung bình. Chẳng hạn, nếu gần như toàn bộ người trả lời chọn mức 5, biến có thể lệch trái vì điểm số tập trung ở phía cao của thang Likert.

Skewness dương thường xuất hiện khi nhiều quan sát nằm ở vùng điểm thấp nhưng một số ít quan sát có điểm rất cao. Skewness âm thường xuất hiện khi nhiều quan sát nằm ở vùng điểm cao và một số ít quan sát có điểm rất thấp. Dấu của skewness cho biết hướng lệch, còn độ lớn tuyệt đối cho biết mức lệch mạnh hay nhẹ.

Bạn nên phân biệt skewness với độ lệch chuẩn. Độ lệch chuẩn nói về mức độ phân tán quanh giá trị trung bình, còn skewness nói về sự bất đối xứng của hình dạng phân phối. Một biến có độ lệch chuẩn lớn chưa chắc có skewness lớn, và một biến có skewness gần 0 vẫn có thể phân tán rộng.

Skewness cũng hỗ trợ bước kiểm tra dữ liệu trước phân tích. Nếu chỉ số quá lệch, bạn cần xem lại mã hóa biến, các giá trị bất thường, câu hỏi đảo chiều và khả năng xuất hiện hiệu ứng trần hoặc hiệu ứng sàn. Tuy vậy, trong nhiều nghiên cứu xã hội học dùng thang Likert, một mức lệch vừa phải chưa tự động buộc bạn phải xóa biến hoặc biến đổi dữ liệu.

Skewness bao nhiêu là đạt

Câu hỏi skewness bao nhiêu là tốt không có một ngưỡng duy nhất áp dụng cho mọi thiết kế nghiên cứu. Ngưỡng phù hợp còn phụ thuộc vào cỡ mẫu, mục tiêu phân tích, loại biến và cách bạn kiểm tra phân phối. Khi báo cáo, bạn nên ghi rõ quy tắc đã chọn thay vì khẳng định dữ liệu đạt chỉ vì skewness nằm trong một khoảng quen thuộc.

Một số tài liệu sử dụng khoảng tuyệt đối của skewness để nhận xét mức lệch. Bảng dưới đây tóm tắt cách diễn giải thường gặp trong thực hành, đồng thời ghi nguồn cho từng quy tắc. Đây là mốc tham khảo để đọc output, không phải giấy phép bỏ qua biểu đồ hoặc các giả định khác.

Khoảng giá trị skewnessCách diễn giải thực hànhNguồn tham khảo
Gần 0Phân phối gần đối xứng(Field, 2013)
Tuyệt đối dưới 1Mức lệch thường được xem là nhỏ đến vừa trong nhiều phân tích(Field, 2013)
Tuyệt đối từ 1 đến dưới 2Cần kiểm tra thêm histogram, Q-Q plot và bối cảnh dữ liệu(Tabachnick và Fidell, 2013)
Tuyệt đối từ 2 trở lênPhân phối lệch đáng kể, cần xem nguyên nhân và độ nhạy của phân tích(Tabachnick và Fidell, 2013)

Các mốc trên không thay thế kiểm định cụ thể. Với hồi quy tuyến tính, bạn còn phải quan tâm phần dư, quan hệ tuyến tính, phương sai không đổi và outlier. Với EFA, việc đánh giá KMO, Bartlett, factor loading và tổng phương sai trích có vai trò riêng. Với SmartPLS, bạn không nên đưa các chỉ số fit của CB-SEM như CFI, TLI hoặc RMSEA vào phần đánh giá PLS-SEM.

Cỡ mẫu cũng làm thay đổi cách nhìn về skewness. Ở mẫu lớn, một lệch nhỏ có thể làm kiểm định phân phối cho p-value rất nhỏ dù biểu đồ nhìn không quá bất thường. Ở mẫu nhỏ, ngược lại, kiểm định có thể thiếu khả năng phát hiện lệch. Vì vậy, hãy kết hợp số liệu, biểu đồ và mục tiêu của mô hình.

Cách đọc skewness trên output SPSS

Để xem skewness trong SPSS, mở file dữ liệu và chọn Analyze > Descriptive Statistics > Descriptives. Đưa các biến cần kiểm tra vào ô Variable(s), bấm Options, chọn Mean, Std. deviation, Minimum, Maximum, SkewnessKurtosis, sau đó bấm Continue rồi OK.

Nếu muốn xem thêm biểu đồ, bạn có thể chọn Analyze > Descriptive Statistics > Explore. Đưa biến vào Dependent List, bấm Plots, chọn HistogramNormality plots with tests. SPSS sẽ tạo bảng Descriptives, biểu đồ histogram và Q-Q plot. Khi đọc, hãy kiểm tra xem số quan sát hợp lệ có bị giảm do missing value hay không.

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột được trình bày theo bảng Descriptive Statistics mà SPSS thường xuất ra.

VariableNMeanStd. DeviationSkewnessStd. Error of SkewnessKurtosisStd. Error of Kurtosis
CL12503.820.71-0.480.1540.210.307
CL22503.760.780.360.154-0.440.307
HL12502.911.121.270.1541.860.307

Ở dòng CL1, skewness bằng -0.48. Dấu âm cho thấy phân phối hơi lệch về phía điểm cao, còn độ lớn 0.48 cho thấy mức lệch không lớn theo quy tắc minh họa ở trên. Dòng CL2 có skewness dương 0.36, nghĩa là hướng lệch ngược lại nhưng cũng nhẹ.

Dòng HL1 có skewness 1.27. Bạn chưa nên xóa biến ngay. Hãy mở histogram để xem có một nhóm điểm thấp kéo đuôi sang phải hay không, kiểm tra bảng tần số để phát hiện mã sai, rồi xem biến này có phải câu hỏi khó khiến người trả lời chọn mức thấp hay không. Kurtosis 1.86 cũng gợi ý cần xem hình dạng phân phối, nhưng kurtosis không phải skewness và cần được diễn giải riêng.

Std. Error of Skewness cho biết sai số chuẩn của ước lượng skewness. Một cách kiểm tra bổ sung là tính z-skewness bằng Skewness / Std. Error of Skewness. Tuy nhiên, bạn không nên dùng một phép chia máy móc làm căn cứ duy nhất. Với dữ liệu khảo sát, hãy đặt kết quả cạnh histogram, Q-Q plot và lý thuyết của thang đo.

Khi skewness không đạt thì xử lý thế nào

Trước tiên, xác nhận giá trị đó là thật. Kiểm tra Variable View để xem Type, Decimals, ValuesMissing đã được khai báo đúng chưa. Một mã nhập 99 nhưng chưa khai báo là missing có thể làm trung bình, skewness và kurtosis sai đáng kể. Nếu biến là câu hỏi đảo chiều, hãy kiểm tra bạn đã recode trước khi tính điểm tổng hay chưa.

Kiểm tra dữ liệu gốc và giá trị bất thường

Chạy Analyze > Descriptive Statistics > Frequencies để xem từng mức trả lời và số lượng quan sát. Sau đó kiểm tra các trường hợp cực đoan bằng boxplot trong Analyze > Descriptive Statistics > Explore. Bạn có thể đọc thêm về outlier để phân biệt một giá trị hợp lệ nhưng hiếm với lỗi nhập liệu.

Nếu phát hiện lỗi nhập, sửa theo bảng hỏi hoặc dữ liệu gốc và ghi lại thay đổi. Nếu đó là câu trả lời hợp lệ, không được xóa chỉ vì nó làm skewness đẹp hơn. Khi loại một trường hợp, bạn cần có lý do phương pháp và lưu phiên bản dữ liệu trước khi chỉnh sửa.

Kiểm tra cách mã hóa và biến tổng hợp

Một biến quan sát có thể lệch mạnh nhưng điểm trung bình của nhiều biến quan sát lại có phân phối ổn định hơn. Bạn có thể tính biến tổng hợp sau khi kiểm tra độ tin cậy và cấu trúc thang đo, nhưng không được gộp các biến chỉ để kéo skewness về gần 0. Việc gộp phải phù hợp với mô hình khái niệm và cách chấm điểm đã xác định từ trước.

Nếu dữ liệu có hiệu ứng trần hoặc sàn do thiết kế bảng hỏi, hãy mô tả hiện tượng trong luận văn. Việc biến đổi log, căn bậc hai hoặc winsorize có thể làm thay đổi diễn giải và không phải lúc nào cũng phù hợp với biến Likert. Nếu dùng biến đổi, bạn phải nêu công thức, lý do và kiểm tra lại kết quả sau biến đổi.

Xem xét phương pháp phân tích thay thế

Khi mục tiêu là so sánh trung bình hoặc chạy hồi quy, mức lệch cần được đánh giá cùng với cỡ mẫu và phần dư của mô hình. Một skewness hơi cao không tự động làm toàn bộ phân tích vô hiệu. Nếu phân tích nhạy với phân phối hoặc có outlier nghiêm trọng, hãy trao đổi với giảng viên về phương án phù hợp thay vì tự xóa nhiều dòng dữ liệu.

Với PLS-SEM, trọng tâm đánh giá nằm ở measurement model và structural model, chẳng hạn outer loading, CR, AVE, HTMT, VIF, path coefficient và bootstrapping. Skewness không phải tiêu chí duy nhất quyết định mô hình PLS-SEM có được chấp nhận hay không. Bạn cần báo cáo đúng bộ chỉ số của phương pháp đã chọn.

Phân biệt skewness với kurtosis và độ lệch chuẩn

Skewness và kurtosis đều mô tả hình dạng phân phối, nhưng chúng trả lời hai câu hỏi khác nhau. Skewness tập trung vào sự bất đối xứng và hướng kéo dài của đuôi. Kurtosis liên quan đến độ nhọn hoặc độ nặng của đuôi so với dạng phân phối tham chiếu. Vì vậy, không thể dùng từ kurtosis để thay cho skewness khi diễn giải output.

Độ lệch chuẩn lại đo mức độ các quan sát phân tán quanh trung bình. Bạn có thể xem phương sai để hiểu quan hệ giữa phương sai và độ lệch chuẩn, hoặc xem công thức tính phương sai nếu cần trình bày phần phương pháp. Hai chỉ số này không cho biết phân phối lệch trái hay lệch phải.

Trung bình, trung vị và mode cũng giúp bạn nhận diện hình dạng phân phối. Khi phân phối đối xứng, các đại lượng này thường nằm gần nhau. Khi phân phối lệch, trung bình có thể bị kéo về phía đuôi dài hơn trung vị. Bạn có thể đọc thêm về trung vị, nhưng vẫn nên xem histogram thay vì suy luận chỉ từ ba số tóm tắt.

Một lỗi thường gặp là thấy skewness bằng -0.8 rồi kết luận biến có chất lượng thấp vì mang dấu âm. Dấu âm chỉ nói hướng lệch, không nói biến tốt hay xấu. Một lỗi khác là nhầm Std. Error of Skewness với skewness. Khi báo cáo, hãy ghi đúng giá trị ở cột Skewness và chỉ dùng sai số chuẩn nếu bạn có lý do phân tích rõ ràng.

Lỗi thường gặp

Chỉ nhìn một ngưỡng rồi kết luận phân phối chuẩn. Skewness gần 0 không chứng minh toàn bộ phân phối chuẩn. Hãy xem thêm kurtosis, histogram, Q-Q plot và mục tiêu phân tích.

Xóa biến hoặc xóa dòng để làm đẹp chỉ số. Một quan sát cực đoan có thể là dữ liệu thật. Bạn chỉ nên loại khi có tiêu chí được xác định, lỗi nhập liệu hoặc bằng chứng rõ ràng về chất lượng phản hồi.

Nhầm hướng lệch. Skewness dương là đuôi kéo dài về phía giá trị cao, còn phần lớn quan sát có thể nằm ở vùng thấp. Đừng mô tả đơn giản rằng đa số điểm cao chỉ vì bạn thấy dấu dương.

Dùng ngưỡng của skewness cho kurtosis. Hai chỉ số có ý nghĩa khác nhau. Nếu viết cả hai trong chương 4, hãy ghi tên cột và diễn giải từng chỉ số riêng.

Không kiểm tra mã missing. Các mã như 99, 999 hoặc 0 có thể được nhập để biểu thị không trả lời. Nếu chúng chưa được khai báo missing, output sẽ phản ánh cả những mã này.

Báo cáo số liệu không khớp với file. Sau mỗi lần sửa dữ liệu, lưu phiên bản mới với tên rõ ràng và ghi lại N, biến bị chỉnh sửa cùng lý do. Điều này giúp bạn giải trình khi giảng viên hỏi vì sao bảng output ở các chương khác nhau không giống nhau.

Câu hỏi thường gặp

Skewness là gì trong SPSS?

Skewness trong SPSS là chỉ số mô tả mức độ bất đối xứng của phân phối một biến. Trong bảng Descriptive Statistics, bạn đọc giá trị ở cột Skewness, không phải cột Std. Error of Skewness.

Skewness bao nhiêu là tốt?

Không có một mốc duy nhất cho mọi nghiên cứu. Bạn có thể dùng các khoảng tham khảo có nguồn, chẳng hạn khoảng tuyệt đối dưới 1 thường được xem là lệch nhẹ đến vừa (Field, 2013), rồi kiểm tra thêm biểu đồ và mục tiêu phân tích.

Skewness âm có phải dữ liệu bị lỗi không?

Skewness âm chỉ cho biết đuôi phân phối kéo dài về phía giá trị thấp. Nếu mức lệch phù hợp với bối cảnh trả lời và không có lỗi mã hóa, dữ liệu không tự động bị xem là sai. Hãy kiểm tra histogram và tần số trước khi quyết định xử lý.

Skewness và kurtosis dùng để làm gì?

Cả hai giúp mô tả hình dạng phân phối, nhưng skewness nói về sự bất đối xứng còn kurtosis nói về độ nhọn và đuôi phân phối. Chúng hỗ trợ kiểm tra dữ liệu, không thay thế toàn bộ việc kiểm tra giả định của hồi quy, EFA hoặc các mô hình khác.

Skewness cao có cần xóa biến không?

Bạn nên kiểm tra lỗi nhập liệu, missing, câu hỏi đảo chiều, outlier và hiệu ứng trần hoặc sàn trước. Nếu giá trị là hợp lệ, hãy cân nhắc mục tiêu phân tích và trao đổi phương án với giảng viên. Xóa biến chỉ vì muốn đưa skewness về một khoảng đẹp là cách giải trình yếu.

Cách viết skewness vào luận văn như thế nào?

Bạn có thể điều chỉnh câu sau theo file của mình: “Kết quả thống kê mô tả cho thấy biến [tên biến] có skewness bằng [giá trị], cho thấy phân phối [lệch trái/lệch phải/gần đối xứng]; kết quả này được đánh giá cùng histogram và Q-Q plot trước khi thực hiện [phân tích].”

Mở file SPSS của bạn ngay bây giờ, chạy Analyze > Descriptive Statistics > Explore, đối chiếu cột Skewness với histogram và ghi lại các biến cần kiểm tra trước khi chạy phân tích tiếp theo; nếu bạn muốn chạy trên chính file .sav hoặc .csv và chuyển kết quả thành phần viết phù hợp, xem M4 phân tích dữ liệu của DoThesis.