Kolmogorov Smirnov là gì? Cách đọc trong SPSS

Thống kê··15 phút đọc

Bạn mở SPSS, chạy kiểm định phân phối chuẩn và thấy bảng One-Sample Kolmogorov-Smirnov Test với một cột Asymp. Sig. (2-tailed). Con số này thường xuất hiện trước hồi quy, t-test hoặc ANOVA, nhưng nhiều bạn chỉ biết nhìn Sig. rồi kết luận máy móc. Bài viết này đi thẳng vào cách hiểu, cách đọc và cách xử lý Kolmogorov Smirnov trong SPSS trên chính file dữ liệu của bạn.

Kolmogorov Smirnov là gì

Kolmogorov Smirnov, thường viết tắt là K-S hoặc K-S test, là kiểm định dùng để xem một biến có phù hợp với một phân phối lý thuyết hay không. Trong luận văn định lượng, trường hợp thường gặp nhất là kiểm tra một biến số có gần phân phối chuẩn hay không trước khi dùng các phép kiểm định tham số.

Kiểm định này so sánh phân phối tích lũy quan sát được từ dữ liệu với phân phối chuẩn kỳ vọng. Chỉ số Z thể hiện mức độ khác biệt giữa hai phân phối. Phần bạn dùng để ra quyết định thường là Sig. hoặc p-value.

Về mặt giả thuyết, H0 cho rằng dữ liệu tuân theo phân phối chuẩn. H1 cho rằng dữ liệu không tuân theo phân phối chuẩn. Vì vậy, khi Sig. > 0,05, bạn chưa có đủ bằng chứng để bác bỏ H0. Khi Sig. ≤ 0,05, bạn bác bỏ H0 và ghi nhận dữ liệu có dấu hiệu lệch khỏi phân phối chuẩn.

K-S test có thể được chạy trên một biến quan sát, điểm trung bình của một thang đo, phần dư hồi quy hoặc biến phụ thuộc. Bạn cần xác định rõ mình đang kiểm tra đối tượng nào. Kiểm định trên từng biến quan sát không tự động chứng minh rằng phần dư của mô hình hồi quy cũng phân phối chuẩn.

Ý nghĩa của Kolmogorov Smirnov trong nghiên cứu định lượng

Kolmogorov Smirnov giúp bạn kiểm tra một giả định trước khi chọn cách phân tích. Nếu dữ liệu phù hợp với phân phối chuẩn ở mức chấp nhận được, bạn có thể tiếp tục cân nhắc các phân tích tham số như independent-samples t-test, paired-samples t-test, ANOVA hoặc hồi quy tuyến tính. Nếu dữ liệu lệch đáng kể, bạn cần xem thêm kích thước mẫu, biểu đồ và mục tiêu nghiên cứu trước khi quyết định.

K-S test không trả lời câu hỏi thang đo có đáng tin cậy hay không. Cronbach's Alpha và Corrected Item-Total Correlation mới liên quan đến độ tin cậy thang đo. K-S test cũng không cho biết các nhóm có bằng nhau về phương sai, hai biến có tương quan hay mô hình hồi quy có phù hợp hay không.

Trong một bài nghiên cứu, bạn có thể gặp K-S ở ba vị trí. Thứ nhất là kiểm tra biến định lượng trước khi chạy kiểm định t test. Thứ hai là kiểm tra phần dư trong hồi quy. Thứ ba là kiểm tra các nhóm trước ANOVA, dù với ANOVA bạn còn phải xem giả định đồng nhất phương sai bằng Levene's Test.

Bạn cũng nên phân biệt giữa kiểm định và quan sát dữ liệu. Với mẫu lớn, một sai lệch nhỏ có thể làm Sig. rất thấp. Với mẫu nhỏ, K-S có thể không đủ nhạy để phát hiện hình dạng lệch. Vì vậy, kết luận nên kết hợp Sig., histogram, Normal Q-Q Plot và kiến thức về biến đang đo, thay vì dùng một con số duy nhất.

Nếu mục tiêu của bạn là so sánh trung bình giữa hai nhóm, hãy xem thêm bài t test. Nếu có từ ba nhóm trở lên, quy trình thường liên quan đến ANOVA, trong đó kiểm tra phân phối chỉ là một phần của việc đánh giá điều kiện áp dụng.

Kolmogorov Smirnov bao nhiêu là đạt

Câu hỏi “Kolmogorov Smirnov bao nhiêu là tốt” thường đang nói đến cột Sig. trong output, không phải giá trị thống kê K-S Z. Quy tắc quyết định phổ biến là dùng mức ý nghĩa 0,05. Tuy nhiên, “đạt” ở đây chỉ có nghĩa là chưa có bằng chứng thống kê cho thấy dữ liệu lệch khỏi phân phối chuẩn. Nó không chứng minh dữ liệu hoàn toàn chuẩn.

Bảng dưới đây tóm tắt cách đọc. Mỗi dòng gắn với nguồn phù hợp trong danh mục tài liệu được phép trích dẫn.

Thành phần cần xemMốc hoặc cách đọcQuyết định thực hànhNguồn
Asymp. Sig. (2-tailed)Sig. > 0,05Chưa bác bỏ H0, dữ liệu không có bằng chứng lệch chuẩn theo kiểm định(Field, 2013)
Asymp. Sig. (2-tailed)Sig. ≤ 0,05Bác bỏ H0, dữ liệu có dấu hiệu không phân phối chuẩn(Field, 2013)
Mức ý nghĩa sử dụngα = 0,05Dùng làm mức cắt để ra quyết định thống kê(Field, 2013)
Phần dư hồi quyKiểm tra kết hợp biểu đồ và chẩn đoánKhông kết luận chỉ từ một kiểm định K-S(Field, 2013)

Một số giáo trình và giảng viên có thể yêu cầu Sig. > 0,05 mới ghi là dữ liệu đạt phân phối chuẩn. Bạn có thể dùng cách diễn đạt đó trong luận văn, nhưng nên viết chính xác hơn: “Kết quả kiểm định chưa cho thấy sự khác biệt có ý nghĩa thống kê so với phân phối chuẩn”. Cách viết này tránh khẳng định quá mạnh.

K-S không có mốc “Z càng lớn càng tốt”. K-S Z càng lớn thường cho thấy khoảng cách giữa phân phối quan sát và phân phối kỳ vọng lớn hơn, nhưng quyết định cuối cùng trong output SPSS vẫn dựa vào Sig. cùng với kiểm tra trực quan.

Cách đọc Kolmogorov Smirnov trong SPSS

Bạn có thể chạy K-S trong SPSS theo hai cách. Cách thứ nhất dùng Analyze > Descriptive Statistics > Explore, phù hợp khi muốn xem bảng kiểm định cùng histogram và Normal Q-Q Plot. Cách thứ hai dùng Analyze > Nonparametric Tests > Legacy Dialogs > 1-Sample K-S, phù hợp khi muốn chạy trực tiếp One-Sample Kolmogorov-Smirnov Test.

Bước 1: Chuẩn bị biến cần kiểm tra

Mở file .sav, kiểm tra biến cần phân tích đang ở dạng Numeric. Các ô trống, mã không trả lời như 99 hoặc 999 cần được xử lý trước. Nếu biến là một thang đo gồm nhiều biến quan sát, bạn thường tạo biến đại diện bằng điểm trung bình sau khi kiểm tra độ tin cậy và cấu trúc thang đo.

Vào Transform > Compute Variable, đặt tên biến mới, chẳng hạn Mean_SAT, rồi tính trung bình các biến SAT1 đến SAT5. Trước khi gộp, bạn cần chắc chắn các biến đảo chiều đã được reverse code. Nếu chưa làm bước này, hình dạng phân phối của điểm trung bình có thể không phản ánh đúng khái niệm.

Bước 2: Chạy Explore để có thêm biểu đồ

Chọn Analyze > Descriptive Statistics > Explore. Đưa biến cần kiểm tra vào ô Dependent List. Nếu muốn xem riêng từng nhóm, đưa biến phân nhóm vào Factor List, nhưng chỉ làm vậy khi câu hỏi nghiên cứu thực sự cần đánh giá theo nhóm.

Nhấn Plots, chọn HistogramNormality plots with tests, sau đó nhấn ContinueOK. SPSS thường xuất hiện bảng Tests of Normality, trong đó có Shapiro-Wilk và Kolmogorov-Smirnov. Bảng này cũng cung cấp biểu đồ để bạn không phải dựa hoàn toàn vào p-value.

Bước 3: Chạy One-Sample K-S trực tiếp

Chọn Analyze > Nonparametric Tests > Legacy Dialogs > 1-Sample K-S. Đưa biến vào ô Test Variable List, giữ lựa chọn Normal trong nhóm Test Distribution, rồi nhấn OK.

SPSS sẽ tạo bảng One-Sample Kolmogorov-Smirnov Test. Trong một số phiên bản, bảng có thể hiển thị N, Normal Parameters, Most Extreme Differences, Test StatisticAsymp. Sig. (2-tailed). Đừng nhầm Test Statistic với Sig.. Hai cột này trả lời hai câu hỏi khác nhau.

Bước 4: Kiểm tra bảng và biểu đồ cùng nhau

Đọc Sig. trước, sau đó quay lại histogram và Normal Q-Q Plot. Nếu các điểm trên Q-Q Plot nằm tương đối gần đường chéo, histogram có hình dạng không quá lệch và mẫu đủ lớn, kết luận sẽ có cơ sở hơn.

Nếu bạn đang kiểm tra phần dư, hãy lưu phần dư chuẩn hóa trước khi chạy kiểm định. Trong hồi quy tuyến tính, chọn Analyze > Regression > Linear, nhấn Save, chọn Standardized Residuals, rồi chạy K-S trên biến phần dư được SPSS tạo ra. Tên biến thường có dạng ZRESID, nhưng có thể khác tùy phiên bản và thứ tự thao tác.

Bảng số liệu minh họa

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột được trình bày theo dạng thường thấy trong output SPSS để bạn đối chiếu với file của mình.

Biến kiểm traNTest StatisticAsymp. Sig. (2-tailed)Cách đọc minh họa
Mean_SAT2140,0560,087Sig. > 0,05, chưa có bằng chứng lệch chuẩn
Mean_TRU2140,0710,011Sig. ≤ 0,05, có dấu hiệu lệch chuẩn
ZRESID2140,0490,200Sig. > 0,05, phần dư chưa cho thấy lệch chuẩn

Ở dòng Mean_SAT, bạn không viết rằng biến “chắc chắn có phân phối chuẩn”. Bạn có thể viết rằng kết quả K-S có Sig. = 0,087 > 0,05, do đó chưa có bằng chứng bác bỏ giả thuyết dữ liệu tuân theo phân phối chuẩn. Ở dòng Mean_TRU, cần xem tiếp biểu đồ, kích thước mẫu và độ lệch để chọn cách xử lý phù hợp.

Khi Kolmogorov Smirnov không đạt thì xử lý thế nào

Nếu Sig. ≤ 0,05, đừng xóa biến ngay. Hãy xử lý theo thứ tự từ kiểm tra dữ liệu đến cân nhắc phương pháp phân tích. Việc loại dữ liệu chỉ vì muốn Sig. lớn hơn 0,05 là cách làm dễ bị hỏi lại khi bảo vệ.

Kiểm tra lỗi nhập liệu và mã hóa

Mở Analyze > Descriptive Statistics > Frequencies hoặc Descriptives để xem Minimum, Maximum và các giá trị bất thường. Một biến Likert từ 1 đến 5 nhưng lại có giá trị 55 thường là lỗi nhập hoặc mã thiếu dữ liệu. Sửa nguồn lỗi rồi chạy lại kiểm định.

Kiểm tra outlier và hình dạng phân phối

Dùng Analyze > Descriptive Statistics > Explore, chọn Plots và xem boxplot. Một vài outlier có thể kéo đuôi phân phối, nhưng bạn chỉ loại quan sát khi có lý do phương pháp và có thể giải trình. Không xóa một dòng chỉ vì nó làm kết quả K-S đẹp hơn.

Kiểm tra cỡ mẫu và mục tiêu phân tích

K-S nhạy với cỡ mẫu. Khi mẫu lớn, sai lệch nhỏ cũng có thể tạo p-value thấp. Khi mẫu nhỏ, biểu đồ và hiểu biết về dữ liệu trở nên quan trọng hơn. Bạn cần xem phân tích chính là gì, biến nào thật sự cần giả định chuẩn và kết luận có ổn định hay không.

Cân nhắc biến đổi dữ liệu hoặc kiểm định thay thế

Nếu lý thuyết và dạng dữ liệu cho phép, bạn có thể cân nhắc log transformation hoặc một dạng biến đổi phù hợp. Ghi rõ công thức, lý do và kết quả sau biến đổi. Không biến đổi chỉ để ép Sig. vượt 0,05 mà không giải thích ý nghĩa của thang đo sau đó.

Nếu dữ liệu vẫn lệch và phân tích tham số không phù hợp, bạn có thể xem xét kiểm định phi tham số tương ứng. Với hai nhóm độc lập, có thể cân nhắc Mann-Whitney U; với hai mẫu ghép cặp, Wilcoxon; với từ ba nhóm độc lập, Kruskal-Wallis. Chọn phương án nào còn phụ thuộc vào thiết kế nghiên cứu, dạng biến và giả định khác.

Nếu đang làm ANOVA, hãy xem cả bảng ANOVA và kiểm định đồng nhất phương sai. K-S không thay thế Levene's Test, cũng không tự quyết định rằng bạn phải chuyển sang một kiểm định khác.

Phân biệt Kolmogorov Smirnov với Shapiro Wilk

K-S và Shapiro-Wilk đều có thể xuất hiện trong bảng Tests of Normality, nhưng chúng không phải cùng một kiểm định. K-S so sánh phân phối thực nghiệm với phân phối lý thuyết. Shapiro-Wilk đánh giá mức độ phù hợp với phân phối chuẩn bằng một thống kê khác.

Trong SPSS, bạn thường thấy hai cột Sig. nằm cạnh nhau. Nhiều hướng dẫn thực hành ưu tiên Shapiro-Wilk ở mẫu nhỏ, còn K-S thường được báo cáo trong nhiều luận văn do quen thuộc với quy trình. Dù chọn kiểm định nào, bạn cần nêu rõ tên kiểm định và đọc đúng cột tương ứng.

K-S cũng khác với Levene's Test. K-S hỏi dữ liệu có gần phân phối chuẩn không. Levene's Test hỏi phương sai giữa các nhóm có đồng nhất không. Một nghiên cứu có thể có dữ liệu gần chuẩn nhưng phương sai các nhóm không bằng nhau, hoặc ngược lại.

K-S còn khác với kiểm định t, ANOVA và hồi quy. K-S là bước kiểm tra giả định hoặc mô tả dữ liệu. T-test và ANOVA dùng để so sánh trung bình. Hồi quy đánh giá quan hệ giữa biến độc lập và biến phụ thuộc. Bạn có thể đọc thêm quy trình one factor ANOVA nếu đề tài có một biến phân nhóm với từ ba mức trở lên.

Lỗi thường gặp

Lỗi đầu tiên là đọc nhầm Test Statistic thành kết luận. Bạn cần nhìn cột Asymp. Sig. (2-tailed) hoặc Sig. rồi đối chiếu với 0,05. Một con số Test Statistic = 0,08 không có nghĩa dữ liệu đạt hay không đạt nếu chưa biết p-value.

Lỗi thứ hai là viết “Sig. nhỏ hơn 0,05 nên dữ liệu có phân phối chuẩn”. Kết luận này bị đảo ngược. Với H0 là dữ liệu phân phối chuẩn, Sig. ≤ 0,05 dẫn đến bác bỏ H0.

Lỗi thứ ba là chạy K-S trên từng biến quan sát rồi kết luận toàn bộ mô hình đạt chuẩn. Bạn cần nói rõ kiểm định được chạy trên biến nào. Nếu phân tích hồi quy, phần dư của mô hình mới là đối tượng cần xem trong phần giả định hồi quy.

Lỗi thứ tư là xóa biến hoặc xóa mẫu hàng loạt để tăng Sig. Hành động này làm thay đổi dữ liệu và có thể tạo thiên lệch. Hãy lưu phiên bản gốc, ghi lại tiêu chí xử lý và chỉ loại trường hợp có bằng chứng lỗi hoặc không hợp lệ.

Lỗi thứ năm là chỉ báo cáo K-S mà bỏ qua biểu đồ. Một kết quả có ý nghĩa thống kê không phải lúc nào cũng có ý nghĩa thực tiễn lớn. Hãy kết hợp p-value, histogram, Q-Q Plot, outlier và mục tiêu của phép phân tích.

Câu hỏi thường gặp

Kolmogorov Smirnov là gì trong SPSS?

Đó là kiểm định dùng để đánh giá dữ liệu có phù hợp với phân phối lý thuyết, thường là phân phối chuẩn, hay không. Trong SPSS, kết quả thường nằm ở bảng One-Sample Kolmogorov-Smirnov Test hoặc Tests of Normality.

Bạn đọc cột Sig. để ra quyết định, đồng thời xem thêm biểu đồ khi đánh giá giả định phân phối.

Kolmogorov Smirnov bao nhiêu là tốt?

Thông thường, Sig. > 0,05 được xem là chưa có bằng chứng bác bỏ giả thuyết dữ liệu phân phối chuẩn. Sig. ≤ 0,05 cho thấy dữ liệu có dấu hiệu lệch khỏi phân phối chuẩn.

Đây là quy tắc ra quyết định thống kê, không phải thước đo chất lượng tuyệt đối của dữ liệu. Bạn vẫn cần xét cỡ mẫu và hình dạng phân phối.

Kolmogorov Smirnov Sig. bằng 0,000 có phải dữ liệu sai không?

Không. Trong SPSS, 0,000 thường có nghĩa p-value nhỏ hơn 0,001, chứ không phải bằng đúng 0. Kết quả này cho thấy có bằng chứng mạnh chống lại giả thuyết dữ liệu phân phối chuẩn theo K-S.

Bạn nên kiểm tra lỗi nhập liệu, outlier và biểu đồ trước khi chọn biến đổi dữ liệu hoặc kiểm định thay thế.

Có bắt buộc chạy Kolmogorov Smirnov trước hồi quy không?

Bạn cần kiểm tra các giả định phù hợp với mô hình, nhưng không nên xem K-S như điều kiện duy nhất. Với hồi quy, cần xem phần dư, quan hệ tuyến tính, đa cộng tuyến, phương sai thay đổi và các điểm ảnh hưởng tùy thiết kế phân tích.

Nếu bạn chạy K-S trên từng biến độc lập rồi bỏ qua phần dư, phần kiểm tra giả định có thể chưa đúng đối tượng.

Nên dùng Kolmogorov Smirnov hay Shapiro Wilk?

Cả hai đều là kiểm định phân phối, nhưng có cách tính và đặc điểm khác nhau. Trong SPSS, bạn có thể xem cả hai cùng với histogram và Q-Q Plot. Việc chọn cách báo cáo nên thống nhất với hướng dẫn của khoa, giảng viên và cỡ mẫu của bạn.

Trong luận văn, hãy ghi rõ kiểm định đã dùng, biến được kiểm tra, giá trị Sig. và cách bạn kết hợp kết quả số với biểu đồ.

Bạn hãy mở lại output Tests of Normality hoặc One-Sample Kolmogorov-Smirnov Test, xác định đúng biến và cột Sig., rồi ghi kết quả vào bảng phân tích trước khi chạy bước tiếp theo. Nếu bạn cần chạy các kiểm định trên file .sav hoặc .csv của mình và chuyển output thành phần kết quả, M4 phân tích dữ liệu là module phù hợp.