Phân phối chuẩn là gì? Cách kiểm tra trên SPSS

Thống kê··15 phút đọc

Phân phối chuẩn là gì

Phân phối chuẩn là dạng phân phối xác suất có hình chuông, trong đó phần lớn quan sát tập trung quanh giá trị trung bình và số quan sát giảm dần khi đi xa trung bình về hai phía. Dạng phân phối này đối xứng quanh mean, nên mean, median và mode thường nằm gần nhau.

Bạn có thể hình dung một biến có phân phối chuẩn như sau: các giá trị thấp xuất hiện với tần suất vừa phải, các giá trị gần trung bình xuất hiện nhiều nhất, sau đó tần suất giảm dần ở nhóm giá trị cao. Trong dữ liệu khảo sát, điểm tổng hợp của một thang đo đôi khi có hình dạng gần chuẩn, nhưng từng biến quan sát riêng lẻ chưa chắc đã chuẩn.

Khi kiểm tra trên SPSS, bạn thường gặp ba nhóm thông tin liên quan đến hình dạng phân phối là Mean, Standard Deviation, Skewness và Kurtosis. Skewness mô tả độ lệch trái hoặc phải của phân phối. Kurtosis mô tả mức độ nhọn hoặc bẹt so với phân phối chuẩn. Hai chỉ số này không tự xác nhận toàn bộ dữ liệu có chuẩn hay không, mà cần được xem cùng Histogram, Q-Q Plot và bối cảnh phân tích.

Phân phối chuẩn cũng không giống độ lệch chuẩn. Độ lệch chuẩn đo mức độ phân tán của dữ liệu quanh mean, còn phân phối chuẩn mô tả hình dạng của toàn bộ phân phối. Phương sai cũng là chỉ số đo độ phân tán, bạn có thể xem thêm phương sai là gì nếu đang nhầm hai khái niệm này.

Ý nghĩa của phân phối chuẩn trong nghiên cứu định lượng

Bạn kiểm tra phân phối chuẩn để biết dữ liệu có phù hợp với một số thủ tục thống kê hay không. Những phương pháp như hồi quy tuyến tính, t-test, ANOVA và một số kiểm định tham số thường đi kèm giả định về phân phối hoặc phần dư. Tuy nhiên, giả định cần kiểm tra phụ thuộc vào phương pháp và loại dữ liệu, không phải cứ thấy một biến lệch chuẩn là phải loại ngay.

Trong hồi quy tuyến tính, điều thường được quan tâm là phân phối của phần dư và các giả định của mô hình, chẳng hạn tuyến tính, phương sai không đổi, độc lập và không có outlier ảnh hưởng quá mạnh. Vì vậy, bạn không nên chỉ nhìn vào Skewness của từng biến độc lập rồi kết luận mô hình hồi quy không dùng được.

Trong nghiên cứu dùng bảng hỏi Likert, một biến quan sát có 5 hoặc 7 mức trả lời thường là biến thứ bậc. Khi bạn tính điểm trung bình hoặc điểm tổng hợp của nhiều biến quan sát, phân phối của biến tổng hợp có thể ổn định hơn. Quyết định tiếp tục hay dừng phân tích cần dựa vào mục tiêu nghiên cứu, cỡ mẫu, biểu đồ và phương pháp bạn đang sử dụng.

Phân phối chuẩn còn giúp bạn phát hiện dữ liệu bất thường. Một Histogram bị kéo dài về một phía có thể cho thấy người trả lời tập trung quá nhiều ở một mức, câu hỏi có cách diễn đạt gây thiên lệch, hoặc dữ liệu có một số giá trị cực đoan. Đây là lúc bạn cần kiểm tra dữ liệu gốc thay vì sửa số liệu cho đẹp.

Nếu bạn đang thực hiện phân tích thống kê mô tả SPSS, hãy bắt đầu bằng Mean, Median, Standard Deviation, Min, Max, Skewness và Kurtosis. Với dữ liệu nhân khẩu học, bảng tần số và tỷ lệ phần trăm thường phù hợp hơn việc cố ép biến giới tính, nhóm tuổi hay trình độ học vấn thành một biến có phân phối chuẩn.

Phân phối chuẩn bao nhiêu là đạt

Câu hỏi “phân phối chuẩn bao nhiêu là tốt” thường được hiểu là Skewness và Kurtosis nằm trong khoảng nào. Một số tài liệu thực hành dùng khoảng -2 đến +2, một số hướng dẫn dùng khoảng -1 đến +1. Đây là các quy ước tham khảo, không phải tiêu chuẩn duy nhất áp dụng cho mọi nghiên cứu. Bạn cần ghi rõ quy tắc đã chọn trong chương phương pháp.

Bảng dưới đây tóm tắt các điểm cần đọc. Các ngưỡng được ghi kèm nguồn để bạn không chép một con số rời khỏi tài liệu phương pháp.

Nội dung kiểm traCách đọc thực hànhNguồn tham khảo
Skewness và KurtosisXem độ lớn tuyệt đối, càng gần 0 càng đối xứng; cần kết hợp biểu đồ và cỡ mẫu(Field, 2013)
Kiểm tra giả định thống kêKiểm tra theo đúng phương pháp đang dùng, không kết luận chỉ từ một chỉ số(Field, 2013)
Phân phối của biến trong phân tích nhân tốXem thêm KMO, Bartlett, factor loading và tổng phương sai trích, không dùng Skewness thay cho các tiêu chí này(Hair và cộng sự, 2010)
Kích thước mẫu cho hồi quyCó thể tham khảo quy tắc n từ 50 + 8m, trong đó m là số biến độc lập(Tabachnick và Fidell, 2013)
Durbin-Watson trong hồi quyKhoảng từ 1 đến 3 thường được dùng khi đọc độc lập của phần dư(Field, 2013)

Bạn có thể dùng khoảng tham khảo -2 đến +2 khi giảng viên hoặc đề cương nghiên cứu yêu cầu, nhưng nên trình bày nó như một quy ước đánh giá. Trường hợp Skewness bằng 1.8 không tự động có nghĩa là dữ liệu sai, cũng như Skewness bằng 0.2 không chứng minh mọi giả định của mô hình đều đạt.

Trong bảng mô tả, hãy báo cáo Mean, Standard Deviation, Skewness và Kurtosis của biến cần kiểm tra. Nếu dùng kiểm định Shapiro-Wilk hoặc Kolmogorov-Smirnov, hãy đọc p-value cùng với biểu đồ. Với cỡ mẫu lớn, một kiểm định có thể cho p-value nhỏ ngay cả khi sai lệch thực tế không đáng kể, nên quyết định cần có thêm đánh giá trực quan.

Cách đọc phân phối chuẩn trên output SPSS

Bạn có thể chạy kiểm tra bằng menu Analyze > Descriptive Statistics > Explore. Đưa biến cần kiểm tra vào ô Dependent List, bấm Plots, chọn HistogramNormality plots with tests, sau đó bấm ContinueOK. SPSS sẽ tạo các bảng Descriptives, Tests of Normality, Histogram và Normal Q-Q Plot.

Nếu chỉ cần bảng mô tả, vào Analyze > Descriptive Statistics > Descriptives, bấm Options rồi chọn Mean, Standard deviation, Minimum, Maximum, Skewness và Kurtosis. Nếu muốn xem cơ cấu giới tính, nhóm tuổi hoặc nghề nghiệp, dùng Analyze > Descriptive Statistics > Frequencies. Đây là cách phù hợp cho phân tích bảng tần số SPSS và phân tích thống kê nhân khẩu học SPSS.

Dưới đây là một khối kết quả giả lập để bạn nhận diện tên cột trong output. Các con số chỉ là số liệu minh họa, không phải kết quả của một nghiên cứu thật.

Số liệu minh họa, bảng Descriptives trong SPSS

NMeanStd. DeviationSkewnessKurtosis
2103.840.61-0.480.72

Với dòng minh họa này, Mean của biến là 3.84, độ phân tán quanh mean là 0.61, Skewness là -0.48 và Kurtosis là 0.72. Hai chỉ số hình dạng đều khá gần 0. Bạn có thể mô tả dữ liệu có xu hướng tương đối cân đối theo quy ước đã chọn, nhưng vẫn cần xem Histogram và Q-Q Plot.

Trong bảng Tests of Normality, SPSS thường hiển thị các cột Statistic, dfSig. cho Kolmogorov-Smirnov và Shapiro-Wilk. Nếu Sig. nhỏ hơn 0.05, kiểm định bác bỏ giả thuyết phân phối chuẩn theo cách đọc p-value. Tuy nhiên, với mẫu lớn, kết quả này rất nhạy. Bạn không nên viết một câu kết luận dài chỉ dựa vào Sig. mà bỏ qua hình dạng biểu đồ.

Histogram, hãy xem đường cong chuẩn được chồng lên cột dữ liệu có bám tương đối vào hình chuông hay không. Ở Normal Q-Q Plot, các điểm càng nằm gần đường chéo thì dữ liệu càng gần phân phối chuẩn. Một vài điểm lệch ở hai đầu có thể xuất hiện ở dữ liệu thực tế và cần được đánh giá cùng outlier, cỡ mẫu và mục tiêu phân tích.

Boxplot giúp bạn nhìn median, khoảng tứ phân vị và các điểm nằm xa phần còn lại. Scatterplot lại dùng để xem quan hệ giữa hai biến và dạng phân tán, không phải công cụ kết luận một biến có phân phối chuẩn. Vì vậy, phân tích biểu đồ boxplot SPSS và phân tích biểu đồ scatter SPSS phục vụ các câu hỏi khác nhau.

Khi phân phối chuẩn không đạt thì xử lý thế nào

Trước hết, kiểm tra dữ liệu gốc. Vào Analyze > Descriptive Statistics > Frequencies để xem giá trị nhỏ nhất, lớn nhất và các mã nhập liệu. Một giá trị 99 được dùng để biểu thị “không trả lời” nhưng chưa khai báo là missing có thể làm Histogram méo mạnh. Kiểm tra lại cả các ô trống, mã đảo chiều và kiểu dữ liệu của biến.

Kiểm tra lỗi nhập liệu và missing value

Đây là bước có tính thuyết phục cao nhất khi giải trình. Nếu bảng hỏi dùng thang Likert từ 1 đến 5 nhưng SPSS có giá trị 8 hoặc 99, bạn cần đối chiếu với phiếu trả lời và quy ước missing trước khi chạy lại. Không được tự thay giá trị cực đoan bằng mean chỉ để Skewness đẹp hơn.

Kiểm tra outlier bằng biểu đồ

Dùng Analyze > Descriptive Statistics > Explore, chọn Plots và bật Boxplot. Nếu có điểm bất thường, xem đó là lỗi nhập liệu hay câu trả lời hợp lệ. Bạn có thể đọc thêm về outlier trong dữ liệu để phân biệt một quan sát cực đoan với một giá trị nhập sai.

Nếu đó là câu trả lời hợp lệ, việc loại bỏ cần có lý do phương pháp và ghi lại mã quan sát đã xử lý. Không nên xóa hàng loạt chỉ vì các điểm đó làm trung bình hoặc phân phối thay đổi.

Kiểm tra biến tổng hợp và phương pháp phân tích

Nếu từng biến quan sát lệch nhưng điểm trung bình của một thang đo có hình dạng ổn định, bạn có thể kiểm tra biến tổng hợp theo mục tiêu nghiên cứu. Với PLS-SEM, trọng tâm đánh giá gồm outer loading, CR, AVE, HTMT, VIF và các chỉ số cấu trúc phù hợp với mô hình. Không đưa CFI, TLI hoặc RMSEA vào bài chỉ vì thấy chúng xuất hiện trong tài liệu về CB-SEM.

Nếu giả định của phương pháp vẫn không phù hợp, cân nhắc một phương pháp khác phù hợp với loại biến và thiết kế nghiên cứu. SPSS, JASP và R có thể hỗ trợ các phân tích khác nhau, nhưng R đòi hỏi bạn kiểm soát mã lệnh và gói phân tích, còn JASP có giao diện dễ tiếp cận hơn cho một số kiểm định. Thuê dịch vụ chạy SPSS có thể tiết kiệm thời gian thao tác, nhưng bạn vẫn phải hiểu file output để trả lời khi hội đồng hỏi. Tự chạy trên file .sav hoặc .csv giúp bạn truy vết từng bước, miễn là bạn lưu syntax, file dữ liệu gốc và bản dữ liệu đã làm sạch.

Phân biệt phân phối chuẩn với các chỉ số dễ nhầm

Phân phối chuẩn là hình dạng của phân phối. Mean là giá trị trung bình. Median là trung vị, tức giá trị nằm ở vị trí giữa khi dữ liệu được sắp xếp. Khi phân phối đối xứng, Mean và Median thường gần nhau, nhưng hai chỉ số này không đồng nghĩa với nhau. Bạn có thể xem giải thích riêng về trung vị khi đang đọc bảng Descriptives.

Độ lệch chuẩn cho biết các quan sát phân tán quanh mean nhiều hay ít. Một biến có độ lệch chuẩn nhỏ có thể vẫn lệch phải hoặc lệch trái, vì độ lệch chuẩn không mô tả hướng lệch. Phương sai là bình phương của độ lệch chuẩn, nên cũng không phải phép kiểm tra phân phối chuẩn. Nếu cần xem cách tính, tham khảo công thức tính phương sai.

Histogram là biểu đồ tần suất của một biến số. Boxplot tập trung vào median, khoảng tứ phân vị và điểm cực đoan. Q-Q Plot so sánh quantile quan sát với quantile kỳ vọng của phân phối chuẩn. Ba biểu đồ này bổ trợ cho nhau, không thay thế hoàn toàn cho việc hiểu thiết kế nghiên cứu.

Bảng tần số phù hợp với biến phân loại như giới tính, nhóm tuổi hoặc trình độ. Bảng chéo Crosstabs dùng để xem phân bố kết hợp của hai biến phân loại, chẳng hạn giới tính theo ý định mua. Cả phân tích bảng chéo Crosstabs SPSS và phân tích bảng tần số SPSS đều có thể nằm trong phần mô tả mẫu, nhưng chúng không phải phép kiểm tra phân phối chuẩn.

Lỗi thường gặp

Kết luận dữ liệu chuẩn chỉ vì p-value lớn

Một p-value lớn không chứng minh dữ liệu hoàn toàn chuẩn. Nó chỉ cho thấy kiểm định chưa có đủ bằng chứng để bác bỏ giả thuyết theo cách kiểm định đó. Bạn cần báo cáo thêm biểu đồ, Skewness, Kurtosis và lý do chọn tiêu chí.

Thấy p-value nhỏ là xóa dữ liệu

P-value nhỏ có thể xuất hiện vì cỡ mẫu lớn hoặc vì sai lệch nhỏ nhưng có tính hệ thống. Hãy kiểm tra mã nhập liệu, missing value và outlier trước. Việc xóa quan sát phải dựa trên lý do có thể giải trình, không dựa trên mong muốn làm cho bảng đẹp hơn.

Dùng phân phối chuẩn để thay cho mọi kiểm định

Phân phối chuẩn không thay thế Cronbach's Alpha, EFA, hồi quy hay kiểm định giả thuyết. Mỗi thủ tục có mục tiêu và điều kiện riêng. Khi viết chương 4, hãy nêu rõ bạn kiểm tra phân phối để phục vụ phân tích nào.

Nhầm biến nhân khẩu học phải có phân phối chuẩn

Giới tính, nhóm tuổi, nghề nghiệp và trình độ thường được trình bày bằng tần số và tỷ lệ phần trăm. Bạn không cần tính Skewness cho biến giới tính chỉ vì SPSS cho phép chạy lệnh đó. Hãy chọn thống kê theo bản chất của biến.

Chỉ chép một ngưỡng không có nguồn

Nếu đề tài yêu cầu ngưỡng cụ thể, ghi con số cùng nguồn và nêu đó là quy ước tham khảo. Câu viết có thể dùng trong luận văn là: “Kết quả cho thấy Skewness của biến [tên biến] là [giá trị] và Kurtosis là [giá trị], nằm trong khoảng [khoảng tham khảo] theo tiêu chí [tên tài liệu], do đó dữ liệu được xem là [mô tả thận trọng] để tiếp tục [phân tích].”

Câu hỏi thường gặp

Phân phối chuẩn là gì trong SPSS?

Trong SPSS, phân phối chuẩn được đánh giá qua hình dạng Histogram, Normal Q-Q Plot, các chỉ số Skewness và Kurtosis, cùng kiểm định trong bảng Tests of Normality. Không có một ô duy nhất trả lời dữ liệu của bạn chuẩn hay không chuẩn.

Phân phối chuẩn bao nhiêu là tốt?

Skewness và Kurtosis càng gần 0 thì phân phối càng đối xứng, nhưng khoảng đạt còn phụ thuộc quy ước trong đề tài và phương pháp phân tích. Bạn nên ghi rõ tiêu chí dùng, kết hợp biểu đồ và không xem một ngưỡng đơn lẻ là bằng chứng tuyệt đối.

Dữ liệu Likert có bắt buộc phân phối chuẩn không?

Không phải mọi dữ liệu Likert đều bắt buộc có phân phối chuẩn. Bạn cần phân biệt biến quan sát riêng lẻ với điểm tổng hợp của thang đo, đồng thời xem phương pháp phân tích đang dùng yêu cầu giả định nào. Quyết định xử lý cần dựa trên cỡ mẫu, biểu đồ và mô hình nghiên cứu.

Skewness lớn thì phải làm sao?

Hãy kiểm tra lỗi nhập liệu, mã missing, giá trị ngoài khoảng và outlier trước. Sau đó xem lại mục tiêu phân tích và giả định của phương pháp. Chỉ biến đổi dữ liệu hoặc loại quan sát khi có lý do phương pháp rõ ràng và bạn có thể ghi lại toàn bộ quyết định.

Có cần chạy Shapiro-Wilk khi mẫu lớn không?

Bạn có thể chạy, nhưng không nên đọc Shapiro-Wilk tách khỏi biểu đồ và các chỉ số mô tả. Mẫu lớn có thể khiến kiểm định phát hiện sai lệch nhỏ. Trong báo cáo, hãy nói rõ bạn đã dùng những bằng chứng nào để đánh giá phân phối.

Histogram và Boxplot khác nhau thế nào?

Histogram cho thấy tần suất của các khoảng giá trị và giúp bạn quan sát hình chuông. Boxplot tóm tắt median, khoảng tứ phân vị và các điểm nằm xa phần còn lại. Histogram phù hợp để xem hình dạng, còn Boxplot hữu ích khi kiểm tra outlier và so sánh nhóm.

Mở file SPSS của bạn, chạy Analyze > Descriptive Statistics > Explore, lưu bảng Descriptives, Tests of Normality, Histogram và Normal Q-Q Plot, sau đó ghi lại tiêu chí bạn dùng trong chương phương pháp. Nếu cần chạy trọn quy trình trên chính file .sav hoặc .csv, xem M4 phân tích dữ liệu của DoThesis.