Trung vị trong SPSS là gì? Cách đọc và diễn giải đúng

Thống kê··15 phút đọc

Trung vị trong SPSS là gì

Trung vị trong SPSS là giá trị nằm ở chính giữa một dãy số sau khi các quan sát được sắp xếp từ nhỏ đến lớn. Trong bảng kết quả tiếng Anh của SPSS, trung vị có tên là Median. Nếu có 9 quan sát, Median là giá trị đứng thứ 5. Nếu có 10 quan sát, SPSS lấy trung bình của hai giá trị đứng ở vị trí thứ 5 và thứ 6.

Ví dụ, dãy điểm 4, 5, 6, 7, 8 có trung vị bằng 6. Với dãy 4, 5, 6, 7, 8, 20, trung vị vẫn là 6, trong khi Mean bị kéo lên do giá trị 20. Đây là lý do bạn thường xem Median khi dữ liệu có phân phối lệch hoặc xuất hiện giá trị quá lớn, quá nhỏ.

Về mặt tính toán, nếu số quan sát là số lẻ, trung vị là quan sát ở vị trí (n + 1) / 2. Nếu số quan sát là số chẵn, trung vị là trung bình của hai quan sát ở vị trí n / 2n / 2 + 1. SPSS thực hiện phép tính này từ dữ liệu hợp lệ của biến, đồng thời bỏ qua các giá trị missing theo cách bạn chọn trong hộp thoại phân tích.

Bạn có thể xem thêm chủ đề Thống kê nếu đang cần nối kết quả Median với các chỉ số mô tả khác trong chương 4.

Ý nghĩa của trung vị trong nghiên cứu định lượng

Median cho biết điểm giữa của dữ liệu, nghĩa là một nửa số quan sát có giá trị nhỏ hơn hoặc bằng trung vị và một nửa có giá trị lớn hơn hoặc bằng trung vị. Khi đọc kết quả khảo sát, bạn có thể dùng Median để mô tả xu hướng điển hình mà không để một vài quan sát cực đoan chi phối quá mạnh.

Chẳng hạn, bạn khảo sát số tiền khách hàng chi tiêu mỗi tháng. Phần lớn người trả lời chi từ 200.000 đến 500.000 đồng, nhưng có một số người chi vài triệu đồng. Mean có thể cao hơn mức mà phần lớn người trả lời thực sự trải nghiệm. Median khi đó giúp mô tả nhóm ở giữa sát hơn.

Median đặc biệt hữu ích trong ba tình huống. Thứ nhất, biến có phân phối lệch phải hoặc lệch trái. Thứ hai, dữ liệu có outlier cần được kiểm tra. Thứ ba, biến được đo trên thang thứ bậc, nơi khoảng cách giữa các mức không nhất thiết bằng nhau. Với biến Likert, bạn vẫn có thể báo cáo Mean và độ lệch chuẩn theo thiết kế nghiên cứu, nhưng Median có thể bổ sung góc nhìn về vị trí trung tâm.

Median không tự cho biết dữ liệu phân tán rộng hay hẹp. Hai nhóm có cùng Median bằng 4 nhưng một nhóm tập trung quanh 4, còn nhóm kia trải từ 1 đến 7. Vì vậy, bạn nên đọc Median cùng Minimum, Maximum, Percentiles, Mean và Standard Deviation khi mục tiêu là mô tả đầy đủ dữ liệu. Độ lệch chuẩn cho biết mức độ phân tán quanh giá trị trung bình, còn phương sai là bình phương của độ lệch chuẩn.

Trong kiểm định giả thuyết, Median cũng không phải là tiêu chí duy nhất để kết luận biến có tác động hay không. Nó chỉ mô tả dữ liệu. Kết luận về quan hệ giữa các biến phải dựa vào kiểm định phù hợp, hệ số ước lượng, khoảng tin cậy và p-value trong output tương ứng.

Trung vị trong SPSS bao nhiêu là đạt

Median không có một ngưỡng cố định để gọi là đạt hoặc không đạt. Đây là điểm khác với một số tiêu chí như Cronbach's Alpha, KMO hoặc hệ số tải nhân tố. Một Median bằng 3, 4 hay 5 chỉ có ý nghĩa khi đặt trong thang đo, cách mã hóa và câu hỏi nghiên cứu của bạn.

Nếu thang Likert có 5 mức từ 1 đến 5, Median bằng 4 thường cho thấy vị trí trung tâm của câu trả lời nằm ở mức 4 hoặc quanh mức 4. Tuy nhiên, bạn không nên kết luận rằng thang đo đạt chỉ vì Median cao. Một biến có Median bằng 4 vẫn có thể có nhiều câu trả lời ở mức 1 và 5, nghĩa là dữ liệu phân tán hoặc phân cực.

Bảng dưới đây giúp bạn quyết định cách diễn giải, thay vì tìm một ngưỡng đạt giả định cho Median.

Kết quả hoặc tình huốngCách đọc trong nghiên cứuNguồn hoặc căn cứ
Median là một giá trị cụ thểMô tả vị trí giữa của các quan sát hợp lệQuy tắc tính Median trong thống kê mô tả
Median gần MeanPhân phối có thể ít lệch, nhưng vẫn cần xem biểu đồ và độ lệchSo sánh các thống kê mô tả trong SPSS
Median thấp hơn Mean rõ rệtCó thể dữ liệu lệch phải hoặc có một số giá trị lớnKiểm tra Histogram, Boxplot và outlier
Median cao hơn Mean rõ rệtCó thể dữ liệu lệch trái hoặc có một số giá trị nhỏKiểm tra Histogram, Boxplot và outlier
Median bằng 3 trên thang Likert 1 đến 5Câu trả lời trung tâm nằm quanh mức giữaCăn cứ vào quy ước mã hóa của bảng hỏi
Median bằng 4 trên thang Likert 1 đến 5Câu trả lời trung tâm nghiêng về mức đồng ý hoặc đánh giá caoCăn cứ vào nhãn mức đo của bảng hỏi
Median bằng 5 trên thang Likert 1 đến 5Ít nhất một nửa quan sát có giá trị 5 hoặc cao hơn vị trí giữaCăn cứ vào phân phối tần số thực tế

Với dữ liệu khảo sát, bạn nên báo cáo cả số quan sát hợp lệ. Nếu có nhiều missing, Median được tính trên số dòng còn lại và có thể không đại diện cho toàn bộ mẫu. Hãy ghi rõ số lượng hợp lệ trong bảng Frequencies hoặc Statistics.

Cách đọc trung vị trên output SPSS

Bạn có thể chạy Median bằng nhiều đường dẫn trong SPSS. Cách dễ theo dõi nhất là dùng Frequencies khi muốn xem thêm tần số, phần trăm và các phân vị. Mở file .sav, kiểm tra tên biến và nhãn giá trị trước khi chạy.

Bước 1: Kiểm tra biến cần phân tích

Trong Variable View, xem biến có kiểu Numeric hay không, các mã missing có được khai báo đúng không và thang đo có phù hợp không. Nếu biến đang chứa chữ như “Đồng ý” hoặc “Không đồng ý”, Frequencies có thể không tính Median theo cách bạn cần. Bạn cần mã hóa thành số và giữ nhãn giá trị tương ứng.

Nếu biến là một biến quan sát Likert, hãy kiểm tra chiều của các câu hỏi đảo trước khi gộp biến. Median của một câu hỏi chưa đảo chiều có thể làm bạn đọc sai xu hướng của thang đo. Với biến tổng hợp, cần tạo điểm theo quy tắc đã nêu trong phương pháp nghiên cứu, chẳng hạn lấy trung bình các biến quan sát hợp lệ.

Bước 2: Mở Frequencies

Chọn Analyze > Descriptive Statistics > Frequencies. Đưa biến cần xem vào ô Variable(s). Nếu bạn muốn xem bảng phân phối, giữ lựa chọn Display frequency tables. Sau đó bấm Statistics, đánh dấu Median, có thể chọn thêm Mean, Mode, Standard deviation, Minimum, Maximum và các Percentiles nếu cần.

Bấm Continue, sau đó chọn Charts nếu muốn kiểm tra Histogram hoặc biểu đồ phù hợp. Cuối cùng bấm OK. SPSS sẽ đưa kết quả sang cửa sổ Output Viewer.

Bước 3: Đọc bảng Statistics

Trong bảng Statistics, tìm cột hoặc dòng có tên Median. Hãy đọc cùng các dòng N, Valid, Missing, Mean, Std. Deviation, MinimumMaximum. Nếu bảng hiển thị nhiều biến, đối chiếu đúng tên biến ở cột bên trái, tránh lấy Median của biến kế bên.

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật.

StatisticsMức độ hài lòngSố tiền chi tiêu thángĐiểm ý định mua
N Valid198198198
Missing222
Mean3.86642.503.71
Median4.00500.004.00
Std. Deviation0.83710.400.91
Minimum1.0050.001.00
Maximum5.006,000.005.00

Trong ví dụ này, Median của Mức độ hài lòng là 4.00. Bạn có thể nói vị trí trung tâm của 198 câu trả lời hợp lệ nằm ở mức 4 trên thang đo 1 đến 5. Với Số tiền chi tiêu tháng, Median là 500.00 nhưng Mean là 642.50. Khoảng cách này gợi ý một số người chi tiêu cao hơn phần lớn mẫu, vì vậy cần xem thêm Histogram và Boxplot trước khi mô tả phân phối.

Bước 4: Kiểm tra biểu đồ và outlier

Median chỉ là một con số. Chọn Graphs > Chart Builder để xem Histogram hoặc Boxplot, tùy phiên bản SPSS và loại biến. Trong Boxplot, các điểm nằm xa phần hộp có thể là outlier. Outlier không tự động đồng nghĩa với dữ liệu sai. Bạn phải kiểm tra lại bảng hỏi, mã hóa và hồ sơ trả lời trước khi loại dòng dữ liệu.

Bạn có thể xem hướng dẫn liên quan về outlier để phân biệt giá trị bất thường do nhập sai với một quan sát cực đoan nhưng hợp lệ. Nếu cần kiểm tra sâu hơn sự chênh lệch giữa các chỉ số, hãy xem công thức tính phương sai.

Khi trung vị không đạt thì xử lý thế nào

Vì Median không có ngưỡng đạt, cụm “Median không đạt” thường là cách gọi chưa chính xác. Vấn đề thực tế thường là Median quá thấp so với mục tiêu nghiên cứu, phân phối quá lệch, số missing cao hoặc Median không phù hợp với loại biến.

Kiểm tra mã hóa và nhãn giá trị

Nếu bạn kỳ vọng Median bằng 4 nhưng kết quả là 2, kiểm tra lại chiều mã hóa. Có thể bảng hỏi dùng 1 là “Hoàn toàn đồng ý” và 5 là “Hoàn toàn không đồng ý”, trong khi bạn đang diễn giải theo chiều ngược lại. Kiểm tra Value Labels, câu hỏi đảo chiều và dữ liệu gốc trước khi chỉnh sửa.

Kiểm tra missing và dữ liệu không hợp lệ

Xem N ValidMissing trong bảng Statistics. Nếu missing nhiều, hãy tìm nguyên nhân từ bước nhập dữ liệu, điều kiện lọc mẫu hoặc mã quy ước như 99, 999. Mã này cần được khai báo là missing nếu nó không phải giá trị thực của thang đo.

Bạn không nên tự động thay missing bằng Median chỉ để bảng đẹp hơn. Cách xử lý phải phù hợp với phương pháp đã đăng ký trong đề cương, tỷ lệ missing và cấu trúc biến. Nếu số dòng hợp lệ giảm mạnh, hãy báo cáo rõ thay vì che giấu.

Kiểm tra outlier trước khi loại dữ liệu

Nếu Mean cao hơn Median nhiều, xem Histogram và Boxplot. Đối chiếu các dòng nghi ngờ với bảng hỏi hoặc file thu thập. Chỉ loại một quan sát khi có căn cứ như nhập sai, trả lời ngoài điều kiện mẫu hoặc dữ liệu không thể sử dụng. Ghi lại mã dòng, lý do và kết quả trước sau để giải trình với giảng viên.

Chọn thống kê phù hợp với câu hỏi nghiên cứu

Nếu mục tiêu là mô tả xu hướng trung tâm của dữ liệu lệch, giữ Median và bổ sung khoảng tứ phân vị hoặc Percentiles. Nếu mục tiêu là kiểm định trung bình giữa các nhóm, Median không thay thế kiểm định cần dùng. Bạn cần xem thiết kế nghiên cứu, loại biến và giả định của phép kiểm định trước khi quyết định.

Phân biệt trung vị với Mean và Mode

Median, Mean và Mode đều mô tả xu hướng trung tâm nhưng trả lời các câu hỏi khác nhau. Mean là trung bình cộng của các giá trị hợp lệ. Median là vị trí giữa sau khi sắp xếp. Mode là giá trị xuất hiện nhiều nhất.

Mean sử dụng toàn bộ độ lớn của các quan sát nên dễ bị ảnh hưởng bởi outlier. Median ít nhạy với outlier hơn. Mode hữu ích khi bạn muốn biết mức trả lời phổ biến, kể cả với biến phân loại, nhưng có thể có nhiều Mode hoặc không có Mode duy nhất.

Ví dụ dãy 2, 3, 3, 4, 20 có Mean bằng 6.4, Median bằng 3 và Mode bằng 3. Nếu bạn mô tả nhóm trả lời điển hình, Median hoặc Mode có thể sát hơn Mean. Nếu bạn cần tính toán các mô hình sử dụng trung bình và sai số, Mean vẫn có vai trò riêng.

Đừng nhầm Median với Percentile 50. Trong cách diễn giải thông thường, Percentile 50 chính là vị trí tương ứng với Median. Tuy nhiên, cách nội suy có thể khác giữa phần mềm hoặc lệnh tính khi dữ liệu có số quan sát đặc biệt, vì vậy bạn nên dùng nhất quán một công cụ trong toàn bộ phân tích.

Lỗi thường gặp

Nhìn Median rồi kết luận giả thuyết

Median chỉ là thống kê mô tả. Bạn không thể nói một yếu tố tác động đến ý định mua chỉ vì Median của yếu tố đó cao. Hãy dùng kết quả hồi quy, SEM hoặc kiểm định đã được xác định trong mô hình nghiên cứu.

Gọi Median là trung bình

Trong chương 4, viết “giá trị trung bình Median” dễ gây nhầm với Mean. Hãy dùng “trung vị” cho Median và “giá trị trung bình” cho Mean. Giữ nguyên tên tiếng Anh trong ngoặc ở lần đầu để người đọc đối chiếu output.

Bỏ qua thang đo và mã hóa

Median bằng 4 chỉ có ý nghĩa khi người đọc biết 4 tương ứng với nhãn nào. Bảng kết quả nên ghi rõ thang đo, hướng mã hóa và số quan sát hợp lệ.

Xóa outlier chỉ vì Mean và Median khác nhau

Sự khác biệt giữa Mean và Median là dấu hiệu cần kiểm tra, không phải bằng chứng đủ để xóa dữ liệu. Hãy xem lại giá trị gốc, Boxplot, điều kiện mẫu và lý do quan sát đó xuất hiện.

Cách viết vào luận văn

Bạn có thể điều chỉnh câu sau theo output thật: “Kết quả thống kê mô tả cho thấy biến [tên biến] có trung vị (Median) bằng [giá trị], với [N] quan sát hợp lệ và [số] giá trị thiếu. Trên thang đo từ [mức thấp] đến [mức cao], vị trí trung tâm của dữ liệu nằm ở mức [nhãn mức đo].”

Nếu Mean và Median chênh lệch đáng kể, có thể viết thêm: “Mean bằng [giá trị] cao hơn Median bằng [giá trị], do đó nghiên cứu tiếp tục kiểm tra Histogram và Boxplot để đánh giá mức độ lệch và các quan sát bất thường.” Chỉ điền số sau khi bạn đã đọc đúng bảng Statistics của file mình.

Câu hỏi thường gặp

Trung vị trong SPSS nằm ở đâu?

Bạn vào Analyze > Descriptive Statistics > Frequencies, đưa biến vào ô Variable(s), chọn Statistics rồi đánh dấu Median. Sau khi bấm OK, kết quả nằm trong bảng Statistics của Output Viewer.

Trung vị bao nhiêu là đạt trong SPSS?

Median không có ngưỡng đạt chung. Bạn diễn giải nó dựa trên thang đo, nhãn giá trị, mục tiêu nghiên cứu và phân phối dữ liệu. Median bằng 4 trên thang Likert 1 đến 5 chỉ cho biết vị trí trung tâm nằm ở mức 4, không chứng minh thang đo đạt.

Vì sao Median trong SPSS khác với tính tay?

Các nguyên nhân thường gặp là bạn tính trên số dòng khác nhau, chưa xử lý missing, đưa nhầm biến hoặc sử dụng quy tắc nội suy khác. Hãy so sánh số quan sát hợp lệ, sắp xếp dữ liệu và kiểm tra các mã missing trước khi kết luận SPSS bị lỗi.

Có nên dùng Median thay cho Mean không?

Bạn dùng Median khi muốn mô tả vị trí giữa của dữ liệu, đặc biệt khi phân phối lệch hoặc có outlier. Mean vẫn cần thiết trong nhiều báo cáo và mô hình, nên lựa chọn phải dựa vào câu hỏi nghiên cứu, loại biến và cách trình bày đã thống nhất.

Median có dùng được cho biến Likert không?

Có thể dùng Median để mô tả vị trí trung tâm của biến Likert, nhất là khi bạn muốn báo cáo thêm thống kê thứ bậc. Tuy nhiên, hãy ghi rõ thang đo và cách mã hóa. Với thang đo gồm nhiều biến quan sát, cần nói rõ bạn đang báo cáo từng biến hay điểm tổng hợp.

Bạn hãy mở lại file SPSS, chạy Analyze > Descriptive Statistics > Frequencies, đối chiếu Median với N Valid, Missing, Mean và biểu đồ trước khi viết kết quả. Nếu cần chạy toàn bộ bước phân tích trên file .sav hoặc .csv của mình, bạn có thể xem M4 phân tích dữ liệu.