Tính trung vị là gì? Cách tính số trung vị trong thống kê

Thống kê··17 phút đọc

Tính trung vị là gì và cách tính số trung vị

Bạn mở bảng dữ liệu lên và thấy một dãy điểm, thu nhập hoặc thời gian trả lời bị lệch khá mạnh. Khi đó, số trung bình có thể bị kéo lên bởi một vài giá trị quá lớn. Tính trung vị giúp bạn tìm giá trị nằm ở vị trí giữa của dãy số sau khi đã sắp xếp theo thứ tự tăng dần hoặc giảm dần.

Trong tiếng Anh, trung vị là Median. Nếu có một nửa số quan sát nhỏ hơn hoặc bằng Median và một nửa số quan sát lớn hơn hoặc bằng Median, giá trị đó được xem là trung vị. Trung vị không được tìm bằng cách cộng toàn bộ số liệu rồi chia cho số quan sát. Đó là cách tính số trung bình.

Trường hợp có số quan sát lẻ

Trước tiên, bạn sắp xếp dữ liệu từ nhỏ đến lớn. Với n quan sát, vị trí của trung vị là:

Vị trí trung vị = (n + 1) / 2

Ví dụ, dãy điểm có 5 quan sát là 6, 8, 9, 12, 20. Vị trí trung vị là (5 + 1) / 2 = 3. Số ở vị trí thứ ba là 9, vì vậy Median bằng 9.

Trường hợp có số quan sát chẵn

Nếu số quan sát là số chẵn, sẽ có hai giá trị nằm ở giữa. Bạn lấy trung bình cộng của hai giá trị này.

Ví dụ, dãy thời gian xử lý gồm 6 giá trị: 4, 6, 7, 10, 12, 18. Hai giá trị giữa là 7 và 10. Trung vị bằng (7 + 10) / 2 = 8,5.

Công thức tổng quát có thể viết như sau:

  • Nếu n là số lẻ, Median là giá trị ở vị trí (n + 1) / 2.
  • Nếu n là số chẵn, Median là trung bình cộng của hai giá trị ở vị trí n / 2n / 2 + 1.

Khi làm luận văn, bạn không cần tự sắp xếp hàng nghìn dòng dữ liệu. SPSS, Excel, R hoặc Python đều có thể tính Median. Điều quan trọng là bạn biết chỉ số này đang mô tả điều gì và có nên dùng nó cho biến đang phân tích hay không.

Ý nghĩa của tính trung vị trong nghiên cứu định lượng

Trung vị cho biết vị trí trung tâm của dữ liệu theo thứ tự. Chỉ số này đặc biệt hữu ích khi dữ liệu có outlier, phân phối lệch hoặc biến được đo trên thang thứ bậc. Ví dụ, thu nhập của 100 người có thể tập trung ở mức 8 đến 15 triệu đồng, nhưng một vài người có thu nhập 100 triệu đồng. Số trung bình sẽ bị kéo lên đáng kể, còn trung vị thường phản ánh nhóm quan sát điển hình hơn.

Trong thống kê mô tả, bạn có thể báo cáo Median cùng với Minimum, Maximum, Mean và Standard Deviation nếu câu hỏi nghiên cứu hoặc đặc điểm dữ liệu yêu cầu. Median cũng thường được dùng khi mô tả thời gian chờ, số lần mua hàng, mức thu nhập, chi phí hoặc dữ liệu có nhiều giá trị lệch.

Bạn nên xem trung vị cùng với độ phân tán. Median chỉ cho biết vị trí giữa, chưa cho biết các quan sát nằm cách nhau xa hay gần. Với phần độ phân tán, bạn có thể xem thêm bài độ lệch chuẩnphương sai. Độ lệch chuẩn nhỏ thường cho thấy dữ liệu tập trung hơn quanh giá trị trung bình, nhưng cách diễn giải còn phụ thuộc phân phối của biến.

Trung vị cũng giúp bạn kiểm tra một nhận định trong bảng mô tả. Nếu Mean cao hơn Median rất nhiều, dữ liệu có thể bị lệch phải do một số giá trị lớn. Nếu Mean thấp hơn Median đáng kể, dữ liệu có thể bị lệch trái. Đây là dấu hiệu để bạn nhìn lại biểu đồ, Minimum, Maximum và các quan sát bất thường, chứ chưa đủ để kết luận rằng dữ liệu có lỗi.

Trong nghiên cứu định lượng, không nên chọn Median chỉ vì nó cho ra con số đẹp hơn Mean. Bạn cần căn cứ vào loại biến, mục tiêu mô tả và hình dạng dữ liệu. Với biến định danh như giới tính hoặc ngành học, Median không có ý nghĩa. Với biến thứ bậc, Median có thể phù hợp hơn Mean. Với biến định lượng liên tục, cả Mean và Median đều có thể được báo cáo nếu bạn giải thích rõ lý do.

Tính trung vị bao nhiêu là đạt

Trung vị không có ngưỡng đạt chung giống Cronbach's Alpha, KMO hay factor loading. Đây là một chỉ số mô tả, không phải một kiểm định để quyết định thang đo đạt hoặc không đạt. Một Median bằng 4,2 có thể phù hợp trong nghiên cứu này nhưng không có ý nghĩa nếu bạn chưa biết biến được đo theo thang nào và các mốc giá trị đại diện cho điều gì.

Bảng dưới đây giúp bạn quyết định cách sử dụng Median trong báo cáo. Các nguồn được nêu ở những dòng có tiêu chí phương pháp cụ thể. Với bản thân giá trị Median, bạn cần quay về thang đo và bối cảnh nghiên cứu thay vì áp một ngưỡng máy móc.

Tình huốngCách xem MedianQuyết định báo cáoNguồn
Biến định danhMedian không có ý nghĩa diễn giảiDùng tần số và tỷ lệ phần trămKhông áp dụng ngưỡng Median
Biến thứ bậcMedian thể hiện nhóm ở vị trí giữaCó thể báo cáo Median và các phân vịKhông có ngưỡng Median chung
Biến định lượng lệch mạnhMedian ít bị kéo bởi giá trị cực lớn hoặc cực nhỏBáo cáo Median cùng Minimum, Maximum và độ phân tán phù hợpKhông có ngưỡng Median chung
Thang Likert nhiều biến quan sátMedian mô tả xu hướng trung tâm của từng biến hoặc điểm tổng hợpGiải thích theo nhãn mức độ của thang đoLikert (1932)
Cỡ mẫu dùng cho phân tích nhân tốMedian không quyết định cỡ mẫuKiểm tra cỡ mẫu theo thiết kế nghiên cứu, không suy ra từ MedianHair và cộng sự (2010); Comrey và Lee (1992)

Với thang Likert 5 mức, Median bằng 3 thường được diễn giải quanh mức trung lập, Median bằng 4 nghiêng về đồng ý và Median bằng 5 thể hiện mức cao nhất. Tuy vậy, bạn cần kiểm tra nhãn cụ thể của bảng hỏi. Nếu thang đo của bạn dùng 1 là hoàn toàn đồng ý và 5 là hoàn toàn không đồng ý, hướng diễn giải sẽ ngược lại.

Median không cho biết mối quan hệ giữa các biến và cũng không chứng minh giả thuyết. Một biến có Median cao không đồng nghĩa biến đó có tác động tích cực đến biến phụ thuộc. Muốn kiểm định ảnh hưởng, bạn cần dùng tương quan, hồi quy, SEM hoặc PLS-SEM theo mô hình nghiên cứu.

Cách đọc số trung vị trên output SPSS

Nếu bạn đang dùng SPSS, cách dễ nhất để tính số trung vị là vào Analyze > Descriptive Statistics > Frequencies. Đưa biến cần xem vào ô Variable(s), chọn Statistics, đánh dấu Median, sau đó chọn ContinueOK. SPSS sẽ tạo bảng Statistics với các cột hoặc dòng mô tả số quan sát, giá trị nhỏ nhất, lớn nhất, trung bình và trung vị tùy lựa chọn của bạn.

Bạn cũng có thể dùng Analyze > Descriptive Statistics > Explore. Đưa biến vào Dependent List, chọn Statistics nếu cần chỉnh thông tin mô tả, rồi bấm OK. Lệnh Explore thường hữu ích hơn khi bạn muốn xem thêm biểu đồ Boxplot, outlier và phân phối dữ liệu.

Số liệu minh họa

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Giả sử bạn có 120 bảng trả lời hợp lệ cho biến SAT_MEAN, là điểm trung bình của một thang đo hài lòng từ 1 đến 5.

StatisticsSAT_MEAN
N Valid120
Missing3
Mean3.6842
Median3.7500
Std. Deviation0.7214
Minimum1.00
Maximum5.00

Dòng Median bằng 3,7500 có nghĩa là 50% quan sát có giá trị nhỏ hơn hoặc bằng 3,75 và 50% quan sát có giá trị lớn hơn hoặc bằng 3,75, theo cách xác định vị trí của phần mềm. Vì SAT_MEAN là điểm trung bình từ nhiều biến quan sát, Median có thể là số thập phân dù từng câu hỏi ban đầu dùng thang Likert 1 đến 5.

Dòng N Valid cho biết có 120 giá trị được SPSS sử dụng để tính. Dòng Missing cho biết có 3 giá trị thiếu. Bạn cần kiểm tra xem số thiếu này đến từ người trả lời bỏ trống, mã hóa sai hay quy tắc lọc dữ liệu. Nếu có nhiều biến, số quan sát hợp lệ có thể khác nhau giữa các dòng do SPSS xử lý missing theo từng biến.

Nếu bạn chạy Analyze > Descriptive Statistics > Frequencies, SPSS còn có thể hiển thị bảng Frequencies với từng giá trị, Frequency, Percent, Valid PercentCumulative Percent. Median của một biến thứ bậc có thể được xác định từ bảng tần số tích lũy. Khi tổng tần số tích lũy đạt 50% hoặc vượt qua 50%, bạn tìm giá trị tương ứng ở vị trí giữa.

Bạn không nên chép toàn bộ output vào chương 4. Hãy chọn những chỉ số phục vụ mục tiêu mô tả và đặt tên biến rõ ràng. Nếu bảng kết quả có quá nhiều chữ số thập phân, bạn có thể làm tròn còn hai chữ số, nhưng cần dùng thống nhất trong toàn bộ chương.

Cách viết vào luận văn

Bạn có thể điều chỉnh câu sau theo output thật của mình: “Kết quả thống kê mô tả cho thấy biến [TÊN BIẾN] có giá trị trung vị là [MEDIAN], trong đó [SỐ QUAN SÁT] quan sát hợp lệ được sử dụng để tính toán. Giá trị này cho thấy 50% quan sát có mức độ [NHỎ HƠN HOẶC BẰNG] [MEDIAN] và 50% quan sát có mức độ [LỚN HƠN HOẶC BẰNG] [MEDIAN].”

Nếu Median được dùng để mô tả thang Likert, bạn có thể viết: “Với thang đo từ [MỨC THẤP NHẤT] đến [MỨC CAO NHẤT], Median bằng [MEDIAN] cho thấy xu hướng trả lời tập trung quanh mức [NHÃN MỨC ĐỘ], theo quy ước mã hóa của bảng hỏi.” Chỉ giữ câu này khi nhãn mức độ và hướng mã hóa của bạn thật sự phù hợp.

Khi số trung vị không phù hợp thì xử lý thế nào

Trước tiên, kiểm tra loại biến. Nếu biến là mã số của nhóm, chẳng hạn 1 là nam và 2 là nữ, Median bằng 1 hoặc 2 không thể được diễn giải như mức trung tâm của giới tính. Hãy dùng bảng tần số và tỷ lệ phần trăm.

Tiếp theo, kiểm tra giá trị thiếu và mã đặc biệt. Một số file dùng 99, 999 hoặc -1 để chỉ “không biết” nhưng lại để SPSS nhận đó là giá trị hợp lệ. Các mã này có thể làm Median sai. Bạn cần khai báo missing hoặc sửa quy tắc mã hóa trước khi chạy lại thống kê.

Nếu Median khác xa kỳ vọng, xem lại dữ liệu gốc và các giá trị cực đoan. Mở Analyze > Descriptive Statistics > Explore, chọn Boxplot hoặc kiểm tra Minimum và Maximum. Một outlier không tự động là dữ liệu sai. Bạn chỉ nên loại khi có căn cứ, chẳng hạn nhập nhầm đơn vị, trả lời ngoài phạm vi bảng hỏi hoặc vi phạm tiêu chí làm sạch đã đặt trước.

Nếu phân phối lệch, bạn có thể báo cáo Median thay cho Mean hoặc báo cáo cả hai để người đọc thấy sự khác biệt. Khi cần dùng kiểm định, chọn phương pháp phù hợp với giả định và loại dữ liệu. Việc đổi sang Median không sửa được lỗi nhập dữ liệu, không làm biến định danh trở thành biến định lượng và không thay thế bước kiểm tra mô hình.

Nếu một câu hỏi Likert có Median quá thấp hoặc quá cao, hãy xem xét hiện tượng người trả lời dồn vào một mức, cách diễn đạt biến quan sát và hướng đảo mã. Biến đảo chiều cần được mã hóa đúng trước khi tính điểm tổng hợp. Bạn nên lưu từng phiên bản dữ liệu và ghi lại biến nào đã sửa, lý do sửa, thời điểm sửa.

Khi giảng viên hỏi vì sao bạn dùng Median, câu trả lời nên gắn với dữ liệu: “Tác giả báo cáo Median vì biến [TÊN BIẾN] có phân phối [LỆCH PHẢI/LỆCH TRÁI] và xuất hiện [MÔ TẢ OUTLIER], do đó Median phù hợp để mô tả vị trí trung tâm cùng với [IQR/MINIMUM VÀ MAXIMUM].” Chỉ dùng phần giải thích trong ngoặc khi nó đúng với output của bạn.

Phân biệt tính trung vị với số trung bình, phân vị và yếu vị

Trung vị, số trung bình, phân vị và yếu vị đều mô tả một khía cạnh của phân phối nhưng không thể thay thế lẫn nhau.

Số trung bình, thường hiển thị là Mean, bằng tổng các giá trị chia cho số quan sát. Mean sử dụng mọi giá trị nên dễ bị ảnh hưởng bởi outlier. Nếu dữ liệu gần đối xứng và không có giá trị cực đoan, Mean thường là chỉ số trung tâm quen thuộc.

Trung vị, hiển thị là Median, dựa vào thứ tự và vị trí giữa. Nó ít bị kéo bởi một vài giá trị rất lớn hoặc rất nhỏ. Khi dãy số có 5 giá trị, Median là giá trị đứng thứ ba sau khi sắp xếp. Khi có 6 giá trị, Median là trung bình của giá trị thứ ba và thứ tư.

Phân vị, hay Percentile, chia dữ liệu theo vị trí. Phân vị thứ 25, thường ký hiệu P25, là mốc mà một tỷ lệ quan sát nhất định nằm ở dưới hoặc bằng mốc đó theo quy tắc tính của phần mềm. Median tương ứng với phân vị thứ 50, nhưng trong báo cáo bạn vẫn nên gọi là Median khi mục tiêu là mô tả giá trị giữa.

Yếu vị, hay Mode, là giá trị xuất hiện thường xuyên nhất. Một biến có thể có một Mode, nhiều Mode hoặc không có Mode rõ ràng. Với dữ liệu Likert, Mode cho biết mức trả lời phổ biến nhất, còn Median cho biết vị trí giữa của thứ tự trả lời.

Bạn có thể dùng thêm bài outlier nếu cần kiểm tra các quan sát cực đoan. Nếu muốn xem công thức và cách diễn giải một chỉ số phân tán khác, tham khảo công thức tính phương sai. Các bài này bổ sung cho thống kê mô tả, nhưng không thay đổi nguyên tắc chọn chỉ số theo loại biến và mục tiêu nghiên cứu.

Lỗi thường gặp khi tính số trung vị

Lỗi đầu tiên là tính Median trên dãy số chưa sắp xếp rồi chọn một phần tử ở giữa. Khi làm thủ công, bạn phải sắp xếp dữ liệu trước. Khi dùng SPSS, phần mềm xử lý bước này, nhưng bạn vẫn phải kiểm tra biến đã được nhập đúng kiểu và đúng mã hay chưa.

Lỗi thứ hai là nhầm Median với Mean. Nhiều sinh viên nhìn cột Mean trong bảng Descriptive Statistics rồi ghi đó là trung vị. Hãy kiểm tra đúng tên dòng hoặc chọn Median trong hộp thoại Statistics trước khi bấm chạy.

Lỗi thứ ba là kết luận “Median đạt” chỉ vì nó lớn hơn 3 trên thang Likert 5 mức. Median không có ngưỡng đạt chung. Một giá trị cao hay thấp cần được giải thích theo nhãn thang đo, câu hỏi nghiên cứu và bối cảnh.

Lỗi thứ tư là bỏ qua giá trị thiếu. Nếu bạn tính bằng Excel mà có ô trống, công thức có thể cho kết quả khác cách bạn đang xử lý missing trong SPSS. Hãy thống nhất quy tắc làm sạch và số quan sát hợp lệ trước khi đưa kết quả vào luận văn.

Lỗi cuối là loại outlier chỉ để Mean và Median gần nhau hơn. Bạn cần lưu bằng chứng, kiểm tra bản ghi gốc và hỏi giảng viên hướng dẫn khi quyết định ảnh hưởng đến cỡ mẫu. Không nên sửa số liệu để tạo ra kết quả thuận lợi.

Câu hỏi thường gặp

Tính trung vị có phải là lấy số ở giữa không?

Đúng nếu dãy dữ liệu đã được sắp xếp và có số quan sát lẻ. Nếu số quan sát chẵn, bạn lấy trung bình cộng của hai số ở giữa. Vì vậy, không nên chọn phần tử giữa trước khi sắp xếp dữ liệu.

Số trung vị bao nhiêu là đạt?

Median không có mức đạt chung. Đây là chỉ số mô tả vị trí trung tâm, không phải tiêu chí đánh giá độ tin cậy hay giá trị của thang đo. Bạn cần diễn giải Median theo loại biến, nhãn thang đo và mục tiêu nghiên cứu.

Tính trung vị trong SPSS ở đâu?

Bạn vào Analyze > Descriptive Statistics > Frequencies, chọn biến, bấm Statistics, đánh dấu Median rồi chạy. Nếu muốn xem thêm Boxplot và outlier, dùng Analyze > Descriptive Statistics > Explore.

Vì sao Median và Mean khác nhau?

Mean sử dụng tổng của toàn bộ quan sát nên dễ bị ảnh hưởng bởi giá trị rất lớn hoặc rất nhỏ. Median dựa trên vị trí giữa nên thường ít nhạy với outlier. Khoảng cách lớn giữa hai chỉ số có thể là dấu hiệu dữ liệu lệch, nhưng bạn cần xem thêm biểu đồ và giá trị cực đoan.

Có thể dùng Median cho thang Likert không?

Có thể, đặc biệt khi bạn muốn mô tả xu hướng trung tâm của biến thứ bậc hoặc dữ liệu có phân phối lệch. Với thang Likert nhiều biến quan sát, cần ghi rõ cách mã hóa và không dùng Median như bằng chứng rằng giả thuyết đã được chấp nhận.

Bị thiếu dữ liệu khi tính trung vị thì làm sao?

Kiểm tra số lượng và nguyên nhân của giá trị thiếu trước. Bạn có thể dùng quy tắc loại bản ghi hoặc xử lý missing đã được xác định trong phương pháp nghiên cứu, nhưng phải ghi lại số quan sát hợp lệ và cách xử lý. Không tự động thay mọi ô trống bằng 0 vì 0 có thể là một giá trị mang ý nghĩa khác.

Bạn hãy mở file SPSS, chọn một biến cần mô tả, chạy Analyze > Descriptive Statistics > Frequencies và đối chiếu dòng Median với N Valid, Mean, MinimumMaximum, sau đó viết kết quả theo đúng nhãn thang đo của mình. Nếu cần chạy thống kê trên file .sav hoặc .csv và diễn giải output, xem module M4 phân tích dữ liệu.