Mean là gì trong thống kê và cách đọc trên SPSS

Thống kê··16 phút đọc

Mean là gì trong thống kê

Mean là giá trị trung bình cộng của một biến định lượng. Trong nghiên cứu định lượng, bạn cộng tất cả giá trị quan sát rồi chia cho số lượng quan sát hợp lệ. Nếu có các điểm đánh giá lần lượt là 3, 4, 4, 5 và 4 thì Mean bằng (3 + 4 + 4 + 5 + 4) / 5 = 4.

Công thức tổng quát là:

Mean = Tổng các giá trị quan sát / Số lượng quan sát

Trong SPSS, Mean thường xuất hiện trong bảng Descriptive Statistics, cạnh các cột như N, Minimum, MaximumStd. Deviation. N là số quan sát được dùng để tính, còn Std. Deviation cho biết mức độ phân tán quanh Mean. Vì vậy, Mean không phải là toàn bộ kết quả thống kê. Bạn cần đọc nó cùng kích thước mẫu, độ lệch chuẩn và cách biến được đo.

Nếu bảng hỏi dùng thang Likert 5 mức, Mean thường được tính từ các câu hỏi hoặc biến quan sát đã mã hóa bằng số. Chẳng hạn, mức 1 có thể là hoàn toàn không đồng ý và mức 5 là hoàn toàn đồng ý. Cách gán số phải nhất quán từ đầu đến cuối bảng hỏi. Bạn có thể xem thêm scale là gì nếu chưa phân biệt được thang đo, biến quan sát và giá trị mã hóa.

Ý nghĩa của Mean trong nghiên cứu định lượng

Mean giúp bạn mô tả xu hướng trả lời điển hình của mẫu khảo sát. Khi một thang đo có Mean cao, dữ liệu minh họa cho thấy người trả lời có xu hướng chọn mức cao hơn trên thang đo đó. Khi Mean thấp, xu hướng trả lời nghiêng về các mức thấp hơn. Đây là mô tả của mẫu, chưa tự động chứng minh một giả thuyết nguyên nhân hay quan hệ giữa các biến.

Trong chương kết quả, bạn có thể dùng Mean để trả lời các câu hỏi như: khách hàng đánh giá chất lượng dịch vụ ở mức nào, nhân viên cảm nhận về sự hài lòng ra sao, hoặc người dùng đánh giá tính hữu ích của một hệ thống như thế nào. Nếu muốn kết luận một biến độc lập có ảnh hưởng đến biến phụ thuộc, bạn vẫn cần dùng tương quan, hồi quy, SEM hoặc PLS-SEM tùy mô hình nghiên cứu.

Mean cũng giúp bạn phát hiện vấn đề trong dữ liệu. Một biến có Mean gần sát mức cao nhất có thể cho thấy người trả lời đánh giá rất tích cực, nhưng cũng cần kiểm tra xem bảng hỏi có bị thiên lệch hay không. Nếu Mean và Median cách xa nhau, phân phối có thể bị lệch. Nếu độ lệch chuẩn rất nhỏ, các câu trả lời tập trung gần nhau. Nếu độ lệch chuẩn lớn, câu trả lời phân tán hơn và Mean cần được diễn giải thận trọng.

Bạn cũng nên kiểm tra các giá trị bất thường trước khi diễn giải. Một vài outlier có thể kéo Mean lên hoặc xuống, đặc biệt khi cỡ mẫu nhỏ. Hãy xem hướng dẫn outliers để kiểm tra trường hợp này trước khi xóa bất kỳ dòng dữ liệu nào. Xóa dữ liệu chỉ vì Mean chưa đẹp là cách giải quyết khó bảo vệ khi giảng viên hỏi lại.

Mean còn được dùng trong các bước tiếp theo. Bạn có thể tính điểm đại diện cho một khái niệm bằng cách lấy Mean của các biến quan sát thuộc cùng thang đo, sau khi kiểm tra độ tin cậy và giá trị của thang đo. Khi chạy mô hình, Mean của biến không phải là ngưỡng đạt hay không đạt cho toàn bộ nghiên cứu. Nó chỉ cho biết mức độ trung bình của dữ liệu được quan sát.

Mean bao nhiêu là đạt

Mean không có một ngưỡng đạt chung cho mọi đề tài. Giá trị được xem là cao hay thấp phụ thuộc vào số mức của thang Likert, cách mã hóa và mục tiêu phân tích. Với thang Likert 5 mức, một số luận văn chia khoảng diễn giải như 1.00 đến 1.80 là rất thấp, 1.81 đến 2.60 là thấp, 2.61 đến 3.40 là trung bình, 3.41 đến 4.20 là cao và 4.21 đến 5.00 là rất cao. Đây là cách diễn giải mô tả, không phải tiêu chuẩn kiểm định có thể áp dụng máy móc cho mọi nghiên cứu.

Bạn nên ghi rõ cách chia khoảng trong chương phương pháp nếu sử dụng. Khoảng lý thuyết của thang đo có thể tính bằng (Giá trị lớn nhất - Giá trị nhỏ nhất) / Số mức, nhưng việc đặt tên thấp, trung bình hay cao vẫn cần phù hợp với bối cảnh đề tài. Không nên viết rằng Mean từ 3.5 trở lên thì giả thuyết được chấp nhận. Giả thuyết thường được đánh giá bằng hệ số, p-value, khoảng tin cậy hoặc chỉ số phù hợp mô hình, chứ không bằng Mean đơn lẻ.

Tình huống đọc MeanCách diễn giải phù hợpNguồn hoặc căn cứ
Mean trên thang Likert 5 mứcMô tả mức trả lời trung bình theo khoảng diễn giải đã công bố trong phương phápCách chia khoảng do nghiên cứu quy định, cần nêu rõ công thức
Mean gần mức thấp nhấtMẫu có xu hướng chọn các mức thấp hơn trên biến đang xétDựa trên thang đo và mã hóa của bảng hỏi
Mean gần mức cao nhấtMẫu có xu hướng chọn các mức cao hơn trên biến đang xétDựa trên thang đo và mã hóa của bảng hỏi
Mean giữa thang đoCâu trả lời tập trung quanh mức giữa, cần đọc cùng Std. DeviationDựa trên thống kê mô tả của mẫu
Mean của biến quan sátDùng để mô tả từng biến, chưa đủ để kết luận thang đo đạtCần kiểm tra độ tin cậy và giá trị thang đo trước khi gộp
Mean dùng trong kiểm định giả thuyếtKhông dùng Mean đơn lẻ để kết luận quan hệ nhân quả hoặc chấp nhận giả thuyếtCần xem kiểm định phù hợp với mô hình nghiên cứu

Điểm cần nhớ là Mean “cao” chỉ có ý nghĩa trong phạm vi biến và thang đo cụ thể. Mean 4.1 trên biến “sự hài lòng” có thể được mô tả là mức cao theo khoảng bạn đã chọn, nhưng không cho biết sự hài lòng có tác động đến ý định mua hay không. Muốn trả lời câu hỏi đó, bạn phải xem kết quả của mô hình tương ứng.

Cách đọc Mean trên output

Trong SPSS, cách nhanh nhất để xem Mean là vào Analyze > Descriptive Statistics > Descriptives. Đưa các biến cần mô tả vào ô Variable(s), chọn Options, đánh dấu Mean, Std. deviation, MinimumMaximum, sau đó bấm ContinueOK. SPSS tạo bảng Descriptive Statistics.

Nếu muốn xem thống kê chi tiết hơn, bạn có thể vào Analyze > Descriptive Statistics > Frequencies. Chọn biến, bấm Statistics, đánh dấu Mean, Median, Mode, Std. deviation, MinimumMaximum. Cách này phù hợp khi bạn muốn so sánh Mean với Median hoặc xem phân phối tần suất. Với một nhóm biến, Analyze > Descriptive Statistics > Explore cho phép kiểm tra thêm biểu đồ và một số chỉ báo phân phối.

Số liệu minh họa

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột được trình bày theo bảng Descriptive Statistics thường thấy trong SPSS.

VariableNMinimumMaximumMeanStd. Deviation
HL1198153.860.742
HL2198153.720.801
HL3198254.010.655
HL4196153.580.934
Valid N (listwise)196

Với dòng HL1, Mean bằng 3.86. Nghĩa là điểm trả lời trung bình của 198 quan sát hợp lệ là 3.86 trên thang đo được mã hóa từ 1 đến 5. Std. Deviation bằng 0.742 cho biết dữ liệu có mức phân tán nhất định quanh Mean. Bạn không nên diễn giải con số này thành “198 người đều chọn gần mức 4”, vì Mean không cho biết chính xác từng người đã chọn mức nào.

Dòng HL4 chỉ có N = 196, thấp hơn các dòng còn lại. Bạn cần kiểm tra missing values trước khi gộp các biến HL1 đến HL4 thành điểm đại diện. Nếu lấy Mean theo từng dòng trong SPSS, hãy xác định quy tắc xử lý khi một người bỏ trống một biến quan sát. Quy tắc đó cần được ghi lại, thay vì âm thầm để phần mềm tự xử lý.

Nếu bảng Descriptive Statistics cho Mean bằng 0 hoặc một giá trị ngoài khoảng 1 đến 5, hãy kiểm tra mã hóa dữ liệu. Có thể bạn đang dùng mã missing như 99, 999 hoặc -1 nhưng chưa khai báo đó là giá trị thiếu. Khi đó, SPSS sẽ xem mã này là một giá trị thật và làm Mean bị sai.

Cách viết vào luận văn

Bạn có thể điều chỉnh câu sau theo số liệu trong file của mình: “Kết quả thống kê mô tả cho thấy biến [mã biến] có Mean = [giá trị], Std. Deviation = [giá trị], với [N] quan sát hợp lệ. Trên thang đo [số mức], kết quả này cho thấy người trả lời có xu hướng [đánh giá thấp, trung bình hoặc cao] đối với [nội dung biến].”

Nếu báo cáo nhiều biến, nên trình bày trong một bảng gồm mã biến, Mean và Std. Deviation. Phần văn bản chỉ nêu những điểm đáng chú ý, chẳng hạn biến có Mean cao nhất, thấp nhất hoặc có mức phân tán khác biệt rõ. Việc chép toàn bộ bảng vào đoạn văn khiến chương kết quả dài nhưng không làm rõ phát hiện.

Khi Mean không đạt thì xử lý thế nào

Trước tiên, xác định “không đạt” ở đây nghĩa là gì. Nếu Mean thấp hơn kỳ vọng của bạn, đó có thể là kết quả thực tế của mẫu, không phải lỗi dữ liệu. Nếu Mean nằm ngoài khoảng thang đo, đó mới là dấu hiệu cần kiểm tra mã hóa hoặc công thức tính.

Kiểm tra mã hóa và giá trị thiếu

Mở Variable View để kiểm tra cột Values, Missing, Measure và nhãn biến. Sau đó vào Analyze > Descriptive Statistics > Frequencies để xem các giá trị thực sự xuất hiện. Nếu có mã 99 hoặc 999, khai báo đúng missing hoặc recode theo quy trình đã định trước.

Kiểm tra biến đảo chiều

Một biến quan sát có nội dung phủ định cần được reverse code trước khi tính điểm thang đo. Với thang 1 đến 5, giá trị mới thường được quy đổi theo nguyên tắc 1 thành 5, 2 thành 4, 3 giữ nguyên, 4 thành 2 và 5 thành 1. Bạn phải kiểm tra hướng dẫn mã hóa của bảng hỏi trước khi thực hiện, vì không phải mọi biến có từ phủ định đều được đảo chiều.

Kiểm tra phân phối và outlier

Nếu một số ít quan sát có giá trị rất khác phần còn lại, Mean có thể bị kéo lệch. Dùng Analyze > Descriptive Statistics > Explore, đưa biến vào Dependent List, mở Plots và chọn biểu đồ phù hợp. Không xóa outlier chỉ để Mean tăng lên. Hãy xem đó là lỗi nhập liệu, câu trả lời hợp lệ hay trường hợp không phù hợp tiêu chí mẫu.

Giữ lại kết quả nếu Mean thấp phản ánh dữ liệu thật

Nếu dữ liệu đã được mã hóa đúng, không có lỗi nhập và mẫu phù hợp, Mean thấp vẫn là một phát hiện. Bạn có thể báo cáo rằng người trả lời đánh giá nội dung đó ở mức thấp hơn các biến khác. Cách viết này trung thực hơn việc loại biến chỉ vì kết quả không như kỳ vọng.

Nếu Mean thấp đi kèm độ tin cậy thang đo thấp, bạn mới xem thêm Item-Total Statistics, Cronbach's Alpha if Item Deleted và nội dung biến quan sát. Cronbach's Alpha từ 0.7 trở lên thường được xem là chấp nhận được (Nunnally, 1978), trong khi thang đo khám phá có thể được cân nhắc mức từ 0.6 theo (Hair và cộng sự, 2010). Các tiêu chí này đánh giá độ tin cậy, không phải ngưỡng Mean.

Phân biệt Mean với Median, Mode và Average

Mean là trung bình cộng, trong khi Median là trung vị, tức giá trị nằm ở giữa sau khi sắp xếp dữ liệu. Median thường ít bị ảnh hưởng bởi một vài giá trị cực đoan hơn Mean. Nếu thu nhập của một mẫu có một người có mức thu nhập rất cao, Mean có thể tăng mạnh nhưng Median có thể phản ánh nhóm quan sát điển hình hơn.

Mode là giá trị xuất hiện nhiều nhất. Một biến có thể có Mode bằng 4 nhưng Mean bằng 3.72. Hai kết quả này không mâu thuẫn, vì một chỉ số dựa trên tần suất phổ biến nhất và chỉ số còn lại dựa trên tổng các giá trị chia cho số quan sát.

Average thường được dùng trong giao tiếp như từ đồng nghĩa với Mean, nhưng trong file phân tích bạn vẫn cần nhìn tên chỉ số và công thức cụ thể. Weighted average có trọng số khác với trung bình cộng thông thường. Nếu mỗi quan sát có mức quan trọng khác nhau, không được tự động dùng Mean đơn giản.

Mean cũng khác với Std. Deviation. Mean cho biết trung tâm của dữ liệu, còn Std. Deviation cho biết mức phân tán. Mean cao với độ lệch chuẩn lớn có thể cho thấy người trả lời phân hóa mạnh. Mean vừa phải với độ lệch chuẩn nhỏ cho thấy câu trả lời tập trung hơn. Khi phân tích một mô hình có biến trung gian hoặc điều tiết, Mean mô tả dữ liệu đầu vào nhưng không thay thế cho việc kiểm định vai trò của các biến đó. Bạn có thể đọc thêm về mediator, moderatormoderating để tránh nhầm vai trò của biến trong mô hình.

Lỗi thường gặp khi đọc Mean

Lỗi đầu tiên là xem Mean như điểm đạt hay không đạt tuyệt đối. Một Mean bằng 3.2 không làm thang đo “hỏng”, cũng như Mean bằng 4.5 không chứng minh giả thuyết nghiên cứu đúng. Bạn cần quay về câu hỏi nghiên cứu và phương pháp kiểm định đã chọn.

Lỗi thứ hai là tính Mean trước khi xử lý biến đảo chiều. Khi một biến phủ định chưa được đảo mã, điểm trung bình của thang đo có thể thấp bất thường và tương quan giữa các biến bị ảnh hưởng. Hãy giữ một bản dữ liệu gốc, tạo biến mới khi recode và ghi lại tên biến đã xử lý.

Lỗi thứ ba là bỏ qua N. Hai biến cùng có Mean bằng 3.8 nhưng một biến được tính từ 200 quan sát và biến còn lại chỉ từ 150 quan sát thì mức độ ổn định không giống nhau. Luôn kiểm tra số quan sát hợp lệ trước khi so sánh.

Lỗi thứ tư là làm tròn quá sớm. Hãy giữ số lẻ trong file phân tích và chỉ làm tròn khi trình bày bảng, thường theo quy định của khoa hoặc giảng viên. Không chỉnh số bằng tay trong output gốc.

Lỗi cuối là gộp nhiều biến khác khái niệm vào một Mean chung. Chỉ tính điểm đại diện khi các biến thuộc cùng một cấu trúc lý thuyết và đã được kiểm tra phù hợp. Nếu đang đọc toàn bộ nội dung về Thống kê, hãy đặt Mean trong nhóm thống kê mô tả, tách khỏi các kiểm định suy luận.

Câu hỏi thường gặp

Mean trong SPSS là gì?

Mean trong SPSS là giá trị trung bình cộng của các quan sát hợp lệ cho một biến. Bạn thường thấy nó trong cột Mean của bảng Descriptive Statistics, cùng với N, Minimum, MaximumStd. Deviation.

Mean bao nhiêu là đạt trên thang Likert 5 mức?

Không có một ngưỡng đạt chung cho mọi đề tài. Bạn có thể chia khoảng từ 1 đến 5 để mô tả mức thấp, trung bình hoặc cao, nhưng phải nêu công thức và cách diễn giải trong chương phương pháp. Mean không được dùng một mình để chấp nhận hay bác bỏ giả thuyết.

Mean thấp thì có phải xóa biến không?

Không. Mean thấp có thể là kết quả thật của người trả lời. Trước khi cân nhắc xử lý, hãy kiểm tra mã hóa, missing values, biến đảo chiều, outlier và độ tin cậy của thang đo. Chỉ xóa biến khi có lý do phương pháp rõ ràng và có thể giải trình.

Vì sao Mean trên SPSS bị sai hoặc vượt quá thang đo?

Nguyên nhân thường gặp là mã missing như 99 hoặc 999 đang được SPSS xem là giá trị thật, dữ liệu nhập sai, hoặc công thức gộp biến chưa đúng. Hãy chạy Frequencies, xem bảng giá trị và kiểm tra lại Variable View trước khi tính lại.

Mean và Median nên dùng cái nào?

Mean phù hợp khi bạn muốn báo cáo trung bình cộng và dữ liệu không bị ảnh hưởng quá mạnh bởi giá trị cực đoan. Median hữu ích khi phân phối lệch hoặc có outlier. Trong nhiều báo cáo, bạn có thể xem cả hai rồi giải thích vì sao chọn chỉ số chính.

Có được dùng Mean để kết luận giả thuyết không?

Mean chỉ mô tả mức trả lời trung bình của mẫu. Để kết luận giả thuyết về quan hệ, tác động hoặc khác biệt, bạn cần dùng kiểm định phù hợp và báo cáo hệ số, p-value hoặc khoảng tin cậy theo thiết kế nghiên cứu.

Bạn hãy mở lại file SPSS, chạy Analyze > Descriptive Statistics > Descriptives, đối chiếu N, MeanStd. Deviation, rồi ghi riêng mọi biến có mã ngoài khoảng thang đo hoặc số quan sát thiếu. Nếu cần chạy phân tích trên chính file .sav hoặc .csv của mình, bạn có thể xem module M4 phân tích dữ liệu của DoThesis.