Descriptive statistics là gì? Cách đọc kết quả trên SPSS

Thống kê··15 phút đọc

Descriptive statistics là gì

Bạn mở file SPSS lên, chạy xong bảng Frequencies hoặc Descriptives và thấy các cột Mean, Std. Deviation, Minimum, Maximum. Những con số này chưa kiểm định giả thuyết, cũng chưa cho biết biến độc lập có tác động đến biến phụ thuộc hay không. Chúng chỉ mô tả dữ liệu bạn đang có: dữ liệu tập trung ở đâu, phân tán nhiều hay ít, và khoảng giá trị quan sát nằm trong vùng nào.

Descriptive statistics, tiếng Việt là thống kê mô tả, là nhóm phương pháp dùng để tóm tắt một tập dữ liệu bằng các chỉ số như tần số, tỷ lệ phần trăm, Mean, Median, Mode, Standard Deviation, Variance, Minimum và Maximum. Với biến định tính như giới tính hoặc nhóm tuổi, bạn thường xem Frequency và Percent. Với biến định lượng hoặc điểm trung bình thang đo, bạn thường xem Mean, Standard Deviation, Minimum và Maximum.

Nếu gọi các quan sát của một biến là (x_1, x_2, ..., x_n), Mean được tính bằng tổng các giá trị chia cho số quan sát:

[ Mean = \frac{x_1 + x_2 + ... + x_n}{n} ]

Standard Deviation cho biết các quan sát lệch khỏi Mean nhiều hay ít. Độ lệch chuẩn càng lớn, dữ liệu càng phân tán quanh giá trị trung bình. Đây là mô tả về mẫu dữ liệu, không phải kết luận rằng một biến có ảnh hưởng đến biến khác.

Trong nghiên cứu định lượng, bạn có thể xem thêm các bài thuộc chủ đề Thống kê khi cần phân biệt thống kê mô tả với kiểm định, hồi quy hoặc phân tích nhân tố.

Ý nghĩa của descriptive statistics trong nghiên cứu định lượng

Thống kê mô tả thường nằm ở phần đầu của chương kết quả vì nó giúp bạn biết bộ dữ liệu thực tế đang có hình dạng như thế nào trước khi chạy các phân tích tiếp theo. Nếu bảng hỏi dùng thang Likert 5 điểm, Mean của biến có thể cho thấy người trả lời nghiêng về mức không đồng ý, trung lập hay đồng ý. Tuy nhiên, Mean chỉ là mức trung bình của câu trả lời, không tự động chứng minh rằng thang đo tốt hay giả thuyết đúng.

Với thông tin nhân khẩu học, Frequency và Percent giúp bạn mô tả mẫu nghiên cứu. Ví dụ, bạn có thể biết có bao nhiêu người trả lời thuộc nhóm nam, nữ, từng nhóm tuổi hoặc từng mức thu nhập. Khi báo cáo, nên ghi cả số lượng và tỷ lệ, vì chỉ nêu phần trăm sẽ khiến người đọc khó kiểm tra quy mô thực tế của mẫu.

Với biến quan sát, Mean và Standard Deviation giúp bạn phát hiện những biến có xu hướng trả lời khác biệt. Một biến có Mean thấp hơn hẳn các biến còn lại có thể phản ánh cách diễn đạt khó hiểu, nội dung chưa phù hợp bối cảnh hoặc một khía cạnh khác của khái niệm. Đây là tín hiệu để kiểm tra dữ liệu, chưa phải lý do đủ để xóa biến.

Minimum và Maximum giúp kiểm tra dữ liệu có nằm trong khoảng thiết kế hay không. Nếu bảng hỏi dùng Likert từ 1 đến 5 nhưng output có Minimum bằng 0 hoặc Maximum bằng 7, bạn cần quay lại kiểm tra mã hóa, nhập liệu và các giá trị thiếu. Nếu thấy một vài giá trị quá khác biệt so với phần còn lại, hãy kiểm tra outliers trước khi quyết định xử lý.

Descriptive statistics cũng giúp bạn trình bày mẫu trước khi chạy Cronbach's Alpha, EFA, hồi quy hoặc mô hình PLS-SEM. SPSS có thể tính rất nhiều chỉ số, nhưng luận văn chỉ nên giữ những chỉ số phục vụ câu hỏi nghiên cứu và giúp người đọc hiểu dữ liệu.

Descriptive statistics bao nhiêu là đạt

Đây là chỗ nhiều bạn tìm một con số để kết luận đạt hoặc không đạt. Thống kê mô tả không có một ngưỡng chung kiểu Mean phải lớn hơn 3 hay Standard Deviation phải nhỏ hơn 1 thì mới đạt. Một giá trị Mean phản ánh câu trả lời trong bối cảnh cụ thể. Mean bằng 2,8 có thể là kết quả hợp lý nếu người trả lời đánh giá thấp một thuộc tính, còn Mean bằng 4,2 không tự động chứng minh thang đo có độ tin cậy tốt.

Bạn nên đánh giá theo ba câu hỏi: giá trị có nằm trong khoảng của thang đo không, dữ liệu có bị mã hóa sai hoặc thiếu bất thường không, và các chỉ số có phù hợp với mục đích mô tả biến không. Các kiểm định chất lượng thang đo dùng tiêu chí riêng. Chẳng hạn, Cronbach's Alpha từ 0,7 trở lên thường được chấp nhận theo (Nunnally, 1978), còn Corrected Item-Total Correlation từ 0,3 trở lên theo (Nunnally và Bernstein, 1994). Hai ngưỡng này không phải ngưỡng của descriptive statistics.

Bảng dưới đây là cách diễn giải thực hành, không phải bảng ngưỡng đạt cho mọi đề tài. Nguồn được nêu ở những dòng có tiêu chí phương pháp cụ thể.

Thành phần outputBạn kiểm tra điều gìCách diễn giải thận trọng
Frequency, PercentSố lượng và tỷ lệ của từng nhómMô tả cơ cấu mẫu, không kết luận nhóm nào tốt hơn
MeanMức trung bình của biếnSo sánh với các mức của thang đo và mục tiêu nghiên cứu
Standard DeviationMức độ phân tán quanh MeanGiá trị lớn cho thấy câu trả lời phân tán hơn, cần xem cùng Mean
Minimum, MaximumKhoảng giá trị thực tếĐối chiếu với khoảng mã hóa trong bảng hỏi
Cronbach's AlphaĐộ tin cậy của thang đoTừ 0,7 trở lên thường được chấp nhận, theo (Nunnally, 1978)
Corrected Item-Total CorrelationMức liên hệ của biến với tổng thang đoTừ 0,3 trở lên thường được dùng, theo (Nunnally và Bernstein, 1994)
Kiểm tra giả định hồi quyCác vấn đề như phần dư và tự tương quanDurbin-Watson trong khoảng 1 đến 3 là tiêu chí được nêu trong (Field, 2013)

Trong luận văn, đừng viết rằng “Mean đạt” nếu bạn chỉ nhìn thấy một con số trung bình. Cách viết chính xác hơn là dữ liệu của biến nằm trong khoảng đo, có mức trung bình là bao nhiêu, độ phân tán ra sao, rồi chuyển sang kiểm định phù hợp để đánh giá thang đo hoặc giả thuyết.

Cách đọc descriptive statistics trên output

Có hai đường chạy phổ biến trong SPSS. Nếu bạn cần Mean, Standard Deviation, Minimum và Maximum cho nhiều biến, mở Analyze > Descriptive Statistics > Descriptives. Đưa các biến cần xem sang ô Variable(s), bấm Options, chọn Mean, Standard deviation, Minimum và Maximum, sau đó bấm Continue và OK.

Nếu cần thêm Median, Mode, Percentiles hoặc biểu đồ, dùng Analyze > Descriptive Statistics > Frequencies. Đưa biến vào ô Variable(s), chọn Statistics để đánh dấu các chỉ số cần tính. Bạn có thể chọn Charts nếu muốn xem biểu đồ, nhưng không nên đưa mọi biểu đồ vào luận văn chỉ vì SPSS tạo ra được.

Số liệu minh họa

Bảng dưới đây là số liệu minh họa, được dựng để giống bảng Descriptive Statistics của SPSS. Đây không phải kết quả của một nghiên cứu thật và không được chép vào chương 4 của bạn.

VariableNMinimumMaximumMeanStd. Deviation
DV11851,005,003,620,781
DV21851,005,003,480,864
DV31852,005,003,710,692
DV41851,005,003,550,823
Valid N (listwise)185

Cột Variable là tên biến trong file, không nhất thiết là tên đầy đủ của phát biểu trong bảng hỏi. N là số quan sát hợp lệ được SPSS dùng cho biến đó. Nếu một biến có N thấp hơn các biến còn lại, có thể biến đó có missing value hoặc bạn đã lọc dữ liệu trước khi chạy.

Minimum bằng 1 và Maximum bằng 5 phù hợp với thang Likert 5 mức trong ví dụ. Nếu tất cả người trả lời đều chọn cùng một mức, Minimum và Maximum sẽ bằng nhau. Trường hợp đó cần được xem xét vì biến có thể thiếu khả năng phân biệt giữa các quan sát, nhưng vẫn phải kiểm tra bối cảnh trước khi đưa ra quyết định.

Mean của DV1 bằng 3,62 nghĩa là mức trả lời trung bình của 185 quan sát là 3,62. Std. Deviation bằng 0,781 cho biết câu trả lời có mức phân tán nhất định quanh Mean. Bạn không nên biến con số này thành kết luận nhân quả, cũng không nên so sánh Mean giữa hai biến nếu nội dung, thang đo hoặc cách mã hóa của chúng khác nhau.

Nếu chạy Frequencies, output có thể hiện thêm bảng Statistics và bảng Frequency. Với biến giới tính, bạn đọc Frequency là số người trong từng nhóm và Percent là tỷ lệ phần trăm. Hãy kiểm tra tổng số quan sát hợp lệ, số missing và việc mã hóa nhãn trong Variable View trước khi viết.

Khi descriptive statistics không đạt thì xử lý thế nào

Vì descriptive statistics không có một ngưỡng đạt duy nhất, cách xử lý phải bắt đầu từ loại bất thường bạn nhìn thấy. Đừng xóa ngay những biến có Mean thấp hoặc Standard Deviation cao. Làm như vậy có thể khiến kết quả mất ý nghĩa nội dung và làm thay đổi mẫu một cách khó giải trình.

Bước 1: Kiểm tra mã hóa và loại biến

Mở Variable View và đối chiếu Type, Values, Missing với bảng mã dữ liệu. Xác nhận biến Likert đang được nhập bằng số, các giá trị đảo chiều đã được recode, và không có ký tự văn bản lẫn trong cột số. Nếu bạn dùng biến tổng hợp, kiểm tra công thức tính trung bình có lấy đúng các biến quan sát hay không.

Bước 2: Kiểm tra missing và quan sát bất thường

So sánh N giữa các biến, xem bảng Frequencies và kiểm tra các giá trị nằm ngoài khoảng bảng hỏi. Một dòng trả lời có quá nhiều ô trống hoặc chọn cùng một phương án cho toàn bộ bảng hỏi cần được xem xét theo tiêu chí đã đặt trước. Việc loại quan sát phải có lý do và nên ghi lại số dòng, điều kiện loại, số mẫu trước và sau xử lý.

Bước 3: Kiểm tra lại biến trước khi xóa

Nếu một biến có Mean khác biệt, hãy đọc lại nội dung biến và kiểm tra tương quan, độ tin cậy thang đo hoặc EFA theo mô hình nghiên cứu. Nếu Corrected Item-Total Correlation dưới 0,3, bạn có thể cân nhắc biến theo (Nunnally và Bernstein, 1994), nhưng quyết định cuối cùng cần xem cả cơ sở lý thuyết và tác động đến thang đo.

Bước 4: Chạy lại và lưu từng phiên bản

Lưu file dữ liệu gốc, file sau làm sạch và syntax hoặc output của từng vòng chạy. EFA, Cronbach's Alpha hay hồi quy thường cần quay lại dữ liệu khi phát hiện lỗi. Nếu một biến phải loại, hãy ghi rõ lý do thay vì chỉ nộp bảng kết quả cuối cùng.

Nếu Mean hoặc Standard Deviation trông bất thường do một vài câu trả lời cực đoan, đó là lúc kiểm tra outliers. Nếu vấn đề liên quan đến cách mô hình hóa biến điều tiết, hãy đọc thêm về moderating, vì descriptive statistics không thay thế được bước kiểm định tương tác.

Phân biệt descriptive statistics với inferential statistics

Descriptive statistics trả lời câu hỏi “dữ liệu mẫu của tôi trông như thế nào”. Inferential statistics trả lời các câu hỏi như “mối quan hệ quan sát được có đủ bằng chứng thống kê không” hoặc “kết quả từ mẫu có hỗ trợ giả thuyết nghiên cứu không”. T-test, ANOVA, correlation, regression và kiểm định p-value thuộc nhóm suy luận, dù chúng thường được trình bày cạnh bảng mô tả.

Ví dụ, Mean của biến ý định mua bằng 3,70 chỉ mô tả mức trung bình trong mẫu. Hệ số hồi quy mới giúp bạn đánh giá hướng và mức liên hệ giữa biến độc lập với ý định mua, còn p-value hoặc khoảng tin cậy giúp bạn kết luận về kiểm định. Không thể lấy Mean cao để viết rằng một nhân tố có tác động mạnh.

Descriptive statistics cũng khác với kiểm định độ tin cậy. Cronbach's Alpha đánh giá mức nhất quán nội tại của một nhóm biến quan sát, còn Mean mô tả mức trả lời trung bình của từng biến. Nếu bạn đang chuẩn bị thang đo, hãy phân biệt rõ scale là gì trước khi gộp các biến thành điểm đại diện.

Một nhầm lẫn khác là dùng descriptive statistics để kết luận moderator hoặc mediator. Moderator làm thay đổi mức độ hoặc hướng của mối quan hệ, còn mediator giải thích cơ chế truyền dẫn. Bảng Mean và Standard Deviation không kiểm định được hai vai trò này. Bạn có thể xem thêm moderatormediator để chọn đúng phân tích.

Lỗi thường gặp

Chỉ báo cáo Mean mà bỏ qua N. Người đọc cần biết Mean được tính từ bao nhiêu quan sát. Nếu số lượng hợp lệ khác nhau giữa các biến, hãy nêu rõ nguyên nhân missing.

Gọi Standard Deviation là sai số. Standard Deviation mô tả độ phân tán của các quan sát. Nó không phải Standard Error và cũng không phải khoảng tin cậy của Mean.

Kết luận thang đo đạt từ Mean cao. Mean cao chỉ cho biết xu hướng trả lời cao trong mẫu. Độ tin cậy và giá trị của thang đo cần được đánh giá bằng các phân tích tương ứng.

Không kiểm tra thang đo trước khi tính Mean tổng hợp. Nếu DV1 đến DV4 thuộc cùng một khái niệm, bạn cần xác định cách gộp chúng theo thiết kế nghiên cứu và kết quả kiểm định thang đo. Không nên tính trung bình các biến chỉ vì tên biến có cùng tiền tố.

Chép bảng SPSS nguyên trạng vào luận văn. Output có thể chứa nhiều chữ số thập phân, các dòng không dùng và tên biến khó đọc. Bạn nên chọn chỉ số cần thiết, đổi tên biến trong bảng theo quy ước của chương 3 và giữ file output gốc để đối chiếu.

Cách viết vào luận văn: “Kết quả thống kê mô tả cho thấy các biến quan sát của thang đo [tên thang đo] có giá trị Mean dao động từ [giá trị thấp nhất] đến [giá trị cao nhất], trong khi Standard Deviation dao động từ [giá trị thấp nhất] đến [giá trị cao nhất]. Các giá trị Minimum và Maximum nằm trong khoảng [khoảng đo], cho thấy dữ liệu được mã hóa phù hợp với thang đo sử dụng.” Bạn thay toàn bộ placeholder bằng số liệu thật trong output của mình.

Câu hỏi thường gặp

Descriptive statistics là gì trong SPSS?

Đó là nhóm lệnh trong SPSS dùng để tóm tắt dữ liệu bằng Frequency, Percent, Mean, Median, Mode, Standard Deviation, Minimum và Maximum. Hai đường dẫn thường dùng là Analyze > Descriptive Statistics > DescriptivesAnalyze > Descriptive Statistics > Frequencies.

Thống kê mô tả Mean bao nhiêu là đạt?

Mean không có ngưỡng đạt chung. Bạn đọc Mean trong mối liên hệ với khoảng của thang đo, nội dung biến và mục tiêu nghiên cứu. Mean cao hay thấp không thay thế cho kiểm định độ tin cậy, giá trị thang đo hoặc giả thuyết.

Descriptive statistics có cần p-value không?

Bảng thống kê mô tả cơ bản không cần p-value. p-value xuất hiện trong các kiểm định hoặc mô hình suy luận như t-test, ANOVA, correlation và regression. Không nên thêm p-value vào bảng chỉ để làm bảng có vẻ đầy đủ hơn.

Vì sao N trong bảng Descriptives bị thiếu?

N có thể thấp hơn do missing value, bộ lọc dữ liệu đang bật, hoặc bạn tính chỉ số trên một nhóm biến có số quan sát hợp lệ khác nhau. Kiểm tra Data > Select Cases, cột Missing trong Variable View và bảng Frequencies của biến đó.

Standard Deviation bao nhiêu là đạt?

Không có một mức Standard Deviation bắt buộc cho mọi thang đo. Bạn cần xem nó cùng Mean, khoảng đo và phân phối câu trả lời. Nếu Standard Deviation bằng 0, mọi quan sát có cùng giá trị, nên kiểm tra lại dữ liệu và khả năng biến không có độ phân biệt.

Có cần chạy descriptive statistics trước Cronbach's Alpha không?

Nên kiểm tra dữ liệu và mô tả mẫu trước khi chạy các phân tích tiếp theo. Tuy vậy, thứ tự trình bày trong luận văn có thể được sắp xếp theo phương pháp nghiên cứu, miễn bạn giải thích rõ dữ liệu, xử lý missing, kiểm định thang đo và mô hình.

Mở ngay file SPSS của bạn, chạy Analyze > Descriptive Statistics > Descriptives, đối chiếu N, Minimum, Maximum, Mean và Std. Deviation với bảng mã dữ liệu, rồi lưu output trước khi chuyển sang bước kiểm định. Nếu cần chạy phân tích trên chính file .sav hoặc .csv của mình, bạn có thể dùng M4 phân tích của DoThesis.