Skewed là gì? Cách đọc độ lệch và xử lý trong SPSS
Skewed là gì
Bạn mở file SPSS, chạy Descriptive Statistics và thấy hai cột Skewness với Kurtosis. Một biến có Skewness bằng 1.42, biến khác bằng -0.86. Câu hỏi thường xuất hiện ngay lúc này là: dữ liệu có bị lệch không, có được dùng để hồi quy hay EFA không, và có cần sửa số liệu không.
Skewed thường được dùng để mô tả dữ liệu có phân phối lệch khỏi dạng đối xứng. Chỉ số đo độ lệch được in trên output SPSS là Skewness. Giá trị dương cho thấy phần đuôi phân phối kéo dài về phía các giá trị lớn, còn giá trị âm cho thấy phần đuôi kéo dài về phía các giá trị nhỏ. Khi Skewness gần 0, phân phối có xu hướng đối xứng hơn.
Về mặt tính toán, Skewness được suy ra từ độ lệch của từng quan sát so với giá trị trung bình, sau đó chuẩn hóa theo độ phân tán của biến. Bạn không cần tự tính bằng tay khi đã có SPSS. Điều cần làm là hiểu dấu, độ lớn và bối cảnh của chỉ số này.
Kurtosis là chỉ số đi kèm, mô tả mức độ nhọn hoặc bẹt của phân phối so với dạng chuẩn. Hai chỉ số này là mô tả phân phối, không phải bằng chứng duy nhất để kết luận toàn bộ mô hình nghiên cứu đạt hay không đạt.
Nếu bạn đang đọc các chỉ số mô tả khác, có thể xem thêm nhóm nội dung Thống kê. Còn nếu giá trị cực đoan đang kéo phân phối lệch, phần outliers sẽ liên quan trực tiếp đến bước kiểm tra tiếp theo.
Ý nghĩa của skewed trong nghiên cứu định lượng
Trong nghiên cứu định lượng, Skewness giúp bạn biết dữ liệu của một biến đang phân bố như thế nào trước khi chạy các phân tích tiếp theo. Chẳng hạn, nếu phần lớn người trả lời chọn mức 4 hoặc 5 trên thang Likert, điểm số có thể dồn về phía cao và tạo ra skewness âm. Nếu phần lớn người trả lời chọn mức thấp, đuôi có thể kéo về phía cao và tạo ra skewness dương.
Thông tin này hữu ích ở bốn thời điểm. Thứ nhất, bạn kiểm tra dữ liệu sau khi nhập từ bảng hỏi. Một biến có phân phối bất thường có thể xuất phát từ cách đặt câu hỏi, nhóm mẫu quá đồng nhất, mã hóa sai hoặc một số quan sát cực đoan. Thứ hai, bạn đánh giá giả định của những phương pháp có liên quan đến phân phối, đặc biệt khi sử dụng các kiểm định tham số.
Thứ ba, Skewness giúp bạn giải thích vì sao Mean và Median cách xa nhau. Với phân phối lệch, Median đôi khi phản ánh vị trí trung tâm tốt hơn Mean. Thứ tư, chỉ số này hỗ trợ quyết định có cần kiểm tra thêm histogram, Q-Q plot, outlier hoặc phần dư của mô hình hay không.
Bạn cần phân biệt dữ liệu lệch với dữ liệu sai. Một phân phối lệch có thể phản ánh đúng hành vi của mẫu. Ví dụ, điểm chi tiêu thường có nhiều người ở mức thấp và một số ít người ở mức rất cao. Xóa các quan sát cao chỉ để làm Skewness đẹp hơn có thể khiến kết quả mất ý nghĩa thực tế.
Skewness cũng không trả lời câu hỏi nhân quả. Nó không cho biết biến độc lập có tác động lên biến phụ thuộc hay không, không thay thế p-value, hệ số hồi quy, R² hoặc kiểm định giả thuyết. Nếu đề tài có biến trung gian hay biến điều tiết, bạn vẫn phải kiểm tra mô hình riêng. Bạn có thể xem cách phân biệt mediator và moderator để không dùng Skewness cho sai mục đích.
Skewed bao nhiêu là đạt
Không có một con số duy nhất áp dụng cho mọi loại dữ liệu và mọi phương pháp. Trong luận văn, bạn nên nói rõ đây là ngưỡng tham khảo, chỉ ra nguồn, rồi kết hợp với biểu đồ và giả định của phân tích đang dùng. Bảng dưới đây tóm tắt các mốc liên quan để bạn không lấy nhầm ngưỡng của chỉ số khác áp cho Skewness.
| Chỉ số hoặc cách kiểm tra | Mốc tham khảo | Cách hiểu và nguồn |
|---|---|---|
| Skewness | Gần 0 | Phân phối có xu hướng đối xứng hơn, không phải điều kiện bắt buộc tuyệt đối |
| Kurtosis | Đọc cùng Skewness | Mô tả độ nhọn hoặc bẹt của phân phối, không có mốc chung trong bảng này |
| KMO khi chạy EFA | Từ 0.5 trở lên | Mức KMO từ 0.5 trở lên được dùng để xem xét tính thích hợp của dữ liệu (Kaiser, 1974) |
| Factor loading khi chạy EFA | Từ 0.5 trở lên | Hệ số tải nhân tố từ 0.5 trở lên là mốc thường tham khảo (Hair và cộng sự, 2010) |
| Cronbach's Alpha | Từ 0.7 trở lên | Mốc đánh giá độ tin cậy thang đo, không phải độ lệch phân phối (Nunnally, 1978) |
| Corrected Item-Total Correlation | Từ 0.3 trở lên | Mốc đánh giá tương quan biến tổng, không phải Skewness (Nunnally và Bernstein, 1994) |
| Durbin-Watson trong hồi quy | Từ 1 đến 3 | Kiểm tra tự tương quan phần dư trong bối cảnh hồi quy (Field, 2013) |
Bạn có thể gặp tài liệu nói rằng Skewness và Kurtosis nằm trong khoảng âm 2 đến dương 2 là chấp nhận được. Tuy nhiên, nếu nguồn của luận văn không nêu rõ căn cứ, bạn không nên biến khoảng đó thành quy tắc tuyệt đối. Cỡ mẫu, mục tiêu phân tích, loại biến và cách đánh giá phân phối đều ảnh hưởng đến diễn giải.
Với hồi quy tuyến tính, điều cần quan tâm thường là phân phối và phương sai của phần dư, quan hệ tuyến tính, outlier và đa cộng tuyến, chứ không chỉ là Skewness của từng biến quan sát. Nếu bạn dùng SmartPLS, đừng đem các chỉ số fit của CB-SEM sang kết luận mô hình PLS-SEM.
Cách đọc skewed trên output
Trong SPSS, bạn có thể chạy nhanh theo đường dẫn Analyze > Descriptive Statistics > Descriptives. Đưa các biến cần xem vào ô Variables, chọn Options, đánh dấu Mean, Std. deviation, Minimum, Maximum, Skewness và Kurtosis, rồi nhấn Continue và OK.
Một cách khác là vào Analyze > Descriptive Statistics > Explore. Đưa biến vào Dependent List, mở Plots, chọn Histogram và Normality plots with tests nếu cần kiểm tra trực quan và kiểm định bổ sung. Khi mẫu lớn, kiểm định normality có thể rất nhạy, vì vậy bạn nên đọc cùng biểu đồ và đặc điểm dữ liệu.
Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột được trình bày theo dạng thường thấy trong bảng Descriptives của SPSS.
| Variable | N | Mean | Std. Deviation | Skewness | Kurtosis |
|---|---|---|---|---|---|
| CL1 | 250 | 3.82 | 0.71 | -0.68 | 0.44 |
| CL2 | 250 | 3.77 | 0.76 | -0.91 | 1.12 |
| CL3 | 250 | 3.15 | 1.08 | 0.37 | -0.62 |
| CL4 | 247 | 4.21 | 0.59 | -1.42 | 2.36 |
Trong ví dụ này, CL1 có Skewness âm. Điểm số của người trả lời có xu hướng tập trung về phía cao hơn, nhưng dấu âm không có nghĩa là biến bị mã hóa sai. CL3 có Skewness dương nhẹ, cho thấy đuôi phân phối có xu hướng kéo về phía các giá trị cao hơn.
CL4 cần được kiểm tra kỹ hơn vì giá trị tuyệt đối của Skewness và Kurtosis lớn hơn các biến còn lại. Bạn mở Histogram để xem dữ liệu có bị dồn vào một vài mức Likert hay có quan sát bất thường. Sau đó kiểm tra Minimum, Maximum, missing value và mã hóa của biến. Nếu CL4 là biến đảo chiều, hãy chắc chắn bạn đã recode trước khi tính điểm thang đo.
Một lỗi dễ gặp là nhìn vào cột Std. Error của Skewness rồi tự kết luận biến đạt. Một số phiên bản hoặc thủ tục SPSS hiển thị thêm sai số chuẩn, cho phép tính z-score bằng cách lấy Skewness chia cho sai số chuẩn. Cách làm này chỉ nên dùng khi bạn có quy ước phương pháp rõ ràng. Với luận văn cấp trường, việc báo cáo mô tả, biểu đồ và giải thích hợp lý thường quan trọng hơn việc chọn một mốc máy móc.
Khi skewed không đạt thì xử lý thế nào
Hãy xử lý theo thứ tự từ kiểm tra dữ liệu đến cân nhắc phương pháp. Đừng bắt đầu bằng việc biến đổi toàn bộ biến chỉ vì một con số trên output.
Trước hết, kiểm tra mã hóa và phạm vi giá trị. Với thang Likert 1 đến 5, lệnh Analyze > Descriptive Statistics > Frequencies giúp bạn phát hiện giá trị 0, 6, 99 hoặc ký hiệu missing đã nhập thành một mức trả lời. Kiểm tra cả các biến đảo chiều. Một biến đáng lẽ có thang điểm 1 đến 5 nhưng xuất hiện giá trị ngoài phạm vi thường là vấn đề dữ liệu, không phải skewness tự nhiên.
Tiếp theo, xem missing value và các dòng trả lời thiếu quá nhiều. Bạn nên ghi lại số quan sát ban đầu, số bị loại và lý do loại. Nếu chỉ xóa những dòng làm chỉ số đẹp hơn mà không có tiêu chí trước, người đọc có thể hỏi bạn đã can thiệp vào dữ liệu như thế nào.
Sau đó, kiểm tra outlier bằng bảng tần số, boxplot hoặc điểm chuẩn hóa tùy thiết kế phân tích. Một outlier có thể là lỗi nhập liệu, nhưng cũng có thể là một người trả lời thật. Chỉ loại khi bạn có căn cứ về lỗi, tiêu chí thống kê phù hợp và ghi rõ trong phương pháp. Nếu vấn đề đến từ mẫu quá đồng nhất, phần mềm không thể tạo thêm độ phân tán cho dữ liệu.
Biến đổi dữ liệu như log, căn bậc hai hoặc đảo ngược thang đo có thể phù hợp với một số biến liên tục, nhưng phải giải thích được ý nghĩa và cách diễn giải sau biến đổi. Với dữ liệu Likert, bạn không nên tùy tiện log từng biến chỉ để Skewness tiến gần 0. Khi cần, hãy trao đổi với giảng viên về việc sử dụng phương pháp có độ bền vững hơn hoặc báo cáo hạn chế của dữ liệu.
Cuối cùng, chạy lại phân tích sau khi có quyết định rõ ràng. Lưu từng phiên bản output, đặt tên file theo ngày hoặc vòng phân tích, và ghi nhật ký biến nào đã được recode hoặc loại. EFA hiếm khi ra đẹp ở lần chạy đầu. Loại biến, chạy lại và ghi lại từng vòng là chuyện thường gặp, nhưng mỗi vòng phải có lý do phương pháp.
Phân biệt skewed với độ lệch chuẩn
Skewness và Standard Deviation đều xuất hiện trong bảng mô tả nhưng trả lời hai câu hỏi khác nhau. Skewness cho biết hình dạng phân phối có lệch khỏi đối xứng hay không. Standard Deviation cho biết các quan sát phân tán quanh Mean rộng đến mức nào.
Một biến có Standard Deviation nhỏ vẫn có thể có Skewness đáng kể nếu người trả lời tập trung sát một đầu của thang đo. Ngược lại, một biến có Standard Deviation lớn có thể tương đối đối xứng nếu các giá trị trải đều quanh trung bình. Vì vậy, không thể nói dữ liệu bị skewed chỉ vì độ lệch chuẩn lớn.
Bạn cũng cần phân biệt Skewness với outlier. Outlier là một hoặc một nhóm quan sát nằm xa phần lớn dữ liệu. Outlier có thể làm Skewness tăng, nhưng phân phối lệch không nhất thiết do một outlier duy nhất. Khi nghi ngờ, hãy xem boxplot và dữ liệu gốc thay vì chỉ nhìn vào chỉ số tổng hợp.
Skewness cũng khác với p-value của kiểm định normality. p-value giúp bạn đánh giá một giả thuyết thống kê cụ thể về phân phối, còn Skewness mô tả mức độ lệch. Hai thông tin nên được đọc cùng nhau, nhưng không được thay thế lẫn nhau.
Nếu bạn đang xử lý thang đo, hãy xem scale là gì để phân biệt biến quan sát, biến tổng hợp và thang đo. Skewness của từng biến quan sát có thể khác Skewness của điểm trung bình hoặc điểm tổng hợp của cả thang đo.
Lỗi thường gặp
Lỗi đầu tiên là viết “dữ liệu đạt chuẩn” chỉ vì Skewness nằm trong một khoảng quen thuộc. Bạn cần nói rõ đang kiểm tra biến nào, bằng thủ tục nào, và dùng căn cứ nào. Nếu không có nguồn phù hợp cho một ngưỡng cụ thể, hãy mô tả xu hướng và báo cáo thêm biểu đồ thay vì bịa nguồn.
Lỗi thứ hai là nhầm skewed với “sai số”. Dữ liệu lệch có thể là đặc điểm của hiện tượng nghiên cứu. Việc ép dữ liệu thành đối xứng bằng cách xóa quan sát hoặc sửa giá trị làm giảm khả năng bảo vệ kết quả khi hội đồng hỏi về dữ liệu gốc.
Lỗi thứ ba là chỉ xem biến độc lập và biến phụ thuộc, nhưng bỏ qua phần dư trong hồi quy. Sau khi chạy mô hình, bạn cần xem biểu đồ phần dư và các chẩn đoán liên quan. Skewness của một biến quan sát không thể thay thế toàn bộ quy trình kiểm tra giả định.
Lỗi thứ tư là báo cáo số liệu minh họa như phát hiện của đề tài. Khi viết bài hoặc luận văn, bảng kết quả phải lấy từ file .sav hoặc .csv thật của bạn. Bảng trong bài hướng dẫn chỉ giúp bạn nhận diện tên cột và cách đọc output.
Bạn có thể viết: “Kết quả thống kê mô tả cho thấy biến [tên biến] có Skewness bằng [giá trị] và Kurtosis bằng [giá trị]. Nhóm nghiên cứu tiếp tục kiểm tra Histogram, dữ liệu thiếu và outlier trước khi thực hiện [phân tích].” Câu này tách phần báo cáo số liệu khỏi quyết định xử lý, nên dễ giải trình hơn.
Câu hỏi thường gặp
Skewed là gì trong SPSS
Skewed nghĩa là phân phối của biến có xu hướng lệch khỏi dạng đối xứng. Trên output SPSS, bạn thường đọc giá trị Skewness; dấu dương và âm cho biết hướng của phần đuôi, còn độ lớn cho biết mức lệch tương đối.
Độ lệch chuẩn bao nhiêu là chấp nhận được
Câu hỏi này thường bị nhầm với Skewness. Standard Deviation không có một mốc chung để kết luận đạt hay không đạt, vì nó phụ thuộc vào thang đo và mức phân tán thực tế. Bạn nên xem Standard Deviation cùng Mean, Min, Max và mục tiêu phân tích.
Skewness âm có phải dữ liệu sai không
Skewness âm chỉ cho thấy phần đuôi phân phối có xu hướng kéo về phía các giá trị nhỏ, thường xảy ra khi nhiều người chọn mức điểm cao. Bạn cần kiểm tra thêm mã hóa, biến đảo chiều, Histogram và outlier trước khi gọi đó là lỗi.
Skewness bao nhiêu thì được chạy hồi quy
Không nên quyết định chạy hay dừng hồi quy chỉ từ một giá trị Skewness của biến. Hãy kiểm tra điều kiện của mô hình, đặc biệt là quan hệ tuyến tính, phần dư, outlier và đa cộng tuyến. Nếu có nghi ngờ, báo cáo rõ cách kiểm tra và trao đổi tiêu chí với giảng viên.
Dữ liệu bị skewed thì có cần log không
Log chỉ phù hợp trong một số trường hợp, chủ yếu khi biến liên tục có ý nghĩa và phép biến đổi vẫn giải thích được về mặt phương pháp. Với thang Likert, không nên log tùy tiện từng biến. Hãy kiểm tra lỗi nhập liệu trước, sau đó cân nhắc phương án phân tích phù hợp với dữ liệu.
Bây giờ bạn mở lại file SPSS, chạy Analyze > Descriptive Statistics > Explore, lưu bảng Descriptives cùng Histogram, rồi ghi riêng những biến có Skewness hoặc Kurtosis nổi bật để kiểm tra mã hóa và outlier trước khi chạy phân tích chính. Nếu cần chạy toàn bộ phân tích trên file .sav hoặc .csv thật của bạn, M4 phân tích của DoThesis thực hiện bước này theo đúng dữ liệu của bạn.