Hệ số biến thiên là gì? Cách tính và đọc trong SPSS

Thống kê··14 phút đọc

Hệ số biến thiên là gì

Bạn mở bảng thống kê mô tả và thấy hai biến có độ lệch chuẩn khác nhau. Một biến có độ lệch chuẩn 8, biến còn lại là 2, nhưng chỉ nhìn hai con số này bạn chưa biết biến nào phân tán mạnh hơn nếu đơn vị đo hoặc mức trung bình của chúng khác nhau. Hệ số biến thiên, thường viết là CV, giúp đưa độ lệch chuẩn về dạng tương đối so với giá trị trung bình.

Công thức thường dùng là:

CV = Độ lệch chuẩn / Giá trị trung bình × 100%

Trong đó, độ lệch chuẩn cho biết dữ liệu lệch khỏi giá trị trung bình bao nhiêu theo đơn vị đo ban đầu. Bạn có thể xem thêm phần giải thích về độ lệch chuẩn nếu đang nhầm CV với chỉ số này. Giá trị trung bình nằm ở mẫu số, vì vậy cùng một độ lệch chuẩn sẽ tạo ra CV khác nhau khi mức trung bình thay đổi.

Ví dụ, một biến có Mean = 50 và Std. Deviation = 5 thì CV = 5 / 50 × 100% = 10%. Một biến khác có Mean = 10 và Std. Deviation = 5 thì CV = 50%. Độ lệch chuẩn giống nhau, nhưng biến thứ hai có mức phân tán tương đối lớn hơn nhiều so với trung bình của nó.

CV thường được dùng để so sánh mức độ biến động giữa các biến có thang đo khác nhau, hoặc giữa các nhóm có mức trung bình chênh lệch đáng kể. Chỉ số này không thay thế cho việc kiểm tra phân phối, outlier hay chất lượng thang đo.

Ý nghĩa của hệ số biến thiên trong nghiên cứu định lượng

Trong luận văn định lượng, CV thường xuất hiện ở bước thống kê mô tả. Bạn có thể dùng nó để trả lời câu hỏi: dữ liệu của biến này phân tán ít hay nhiều so với mức trung bình của chính nó.

CV càng lớn thì độ phân tán tương đối càng cao. Điều đó có thể cho thấy người trả lời có quan điểm không đồng nhất, dữ liệu có nhiều giá trị cực đoan, hoặc biến đang có trung bình khá thấp so với độ lệch chuẩn. CV nhỏ cho thấy các quan sát tập trung tương đối gần trung bình hơn, nhưng chưa đủ để kết luận dữ liệu tốt hay thang đo đáng tin cậy.

CV hữu ích nhất khi bạn so sánh các biến cùng bản chất nhưng khác đơn vị hoặc khác quy mô. Chẳng hạn, doanh thu tính bằng triệu đồng và số đơn hàng có thể có đơn vị rất khác nhau. So sánh trực tiếp độ lệch chuẩn trong hai trường hợp này dễ gây hiểu nhầm, còn CV cho một tỷ lệ tương đối dễ đối chiếu hơn.

Bạn cũng cần đặt CV cạnh Mean, Median và độ lệch chuẩn. Nếu Mean gần bằng 0, CV có thể tăng rất cao hoặc mất ý nghĩa vì mẫu số quá nhỏ. Nếu Mean bằng 0, công thức không thực hiện được. Với dữ liệu có giá trị trung bình âm, CV vẫn có thể tính về mặt số học, nhưng việc diễn giải cần thận trọng vì tỷ lệ có thể gây nhầm về mức độ biến động.

CV không dùng để quyết định trực tiếp một thang đo đạt hay không đạt. Cronbach's Alpha, Corrected Item-Total Correlation, EFA hoặc các chỉ số của mô hình PLS-SEM có mục đích khác. CV chỉ mô tả sự phân tán tương đối của một biến số.

Hệ số biến thiên bao nhiêu là đạt

Câu hỏi “hệ số biến thiên bao nhiêu là tốt” thường xuất hiện khi bạn muốn tìm một ngưỡng cứng để kết luận. Với CV, bạn cần thận trọng hơn các chỉ số có tiêu chuẩn rõ như KMO hoặc Cronbach's Alpha. Không có một mức CV duy nhất áp dụng cho mọi ngành, mọi biến và mọi thiết kế nghiên cứu.

Bảng dưới đây giúp bạn diễn giải theo hướng thăm dò, không phải quy tắc loại dữ liệu tự động. Các khoảng này là cách đọc thực hành dựa trên bản chất của tỷ lệ độ lệch chuẩn so với trung bình, không gắn với một ngưỡng bắt buộc trong danh mục nguồn được phép của bài viết.

Khoảng CV tham khảoCách đọc thận trọngViệc nên kiểm tra tiếp
Dưới 10%Mức phân tán tương đối thấp trong chính bộ dữ liệuXem Mean, độ lệch chuẩn và phạm vi giá trị
Từ 10% đến dưới 20%Mức phân tán tương đối vừa phảiSo sánh giữa các nhóm hoặc các biến cùng thang đo
Từ 20% đến dưới 30%Dữ liệu có độ phân tán tương đối đáng chú ýKiểm tra phân phối và outlier
Từ 30% trở lênĐộ phân tán tương đối cao, cần giải thích bối cảnhKiểm tra Mean nhỏ, giá trị cực đoan và cách nhập dữ liệu

Bạn không nên viết “CV dưới 20% là đạt” nếu đề cương hoặc giảng viên không quy định như vậy. Một CV cao có thể hợp lý khi mẫu khảo sát gồm các nhóm đối tượng rất khác nhau. Ngược lại, CV thấp không chứng minh dữ liệu không có sai sót hoặc người trả lời đã hiểu bảng hỏi.

Khi báo cáo CV, hãy nêu cả công thức và số liệu đầu vào. Ví dụ, CV của biến X bằng 18,4%, được tính từ Mean = 3,80 và Std. Deviation = 0,70. Cách viết này giúp người đọc kiểm tra được phép tính thay vì chỉ nhìn một tỷ lệ đứng riêng.

Cách đọc hệ số biến thiên trên output SPSS

SPSS thường không in sẵn một cột tên là Coefficient of Variation trong bảng Descriptives. Bạn sẽ thấy các cột như N, Minimum, Maximum, Mean và Std. Deviation. Sau đó bạn tính CV từ hai cột Mean và Std. Deviation, bằng máy tính, Excel hoặc biến tính toán trong SPSS.

Mở bảng thống kê mô tả

Trong SPSS, chọn Analyze > Descriptive Statistics > Descriptives. Đưa các biến cần xem vào ô Variables. Bấm Options, chọn Mean, Std. deviation, Minimum và Maximum, sau đó bấm Continue và OK.

Nếu bạn cần Median hoặc Percentiles, có thể dùng Analyze > Descriptive Statistics > Explore. Explore cũng cho bạn thêm biểu đồ, kiểm tra outlier và thông tin phân phối. Đừng lấy CV từ một bảng chỉ có Mean mà thiếu Std. Deviation.

Tạo biến CV bằng Compute Variable

Để tạo CV ngay trong SPSS, chọn Transform > Compute Variable. Ở ô Target Variable, nhập tên chẳng hạn CV_thu_nhap. Trong Numeric Expression, nhập công thức dựa trên biến gốc nếu bạn muốn tính CV ở cấp từng quan sát thì dừng lại, vì cách đó không đúng với CV mô tả toàn bộ mẫu.

CV cần Mean và Std. Deviation của cả biến. Bạn có thể lấy hai thống kê này từ output rồi tính riêng, hoặc dùng Analyze > Descriptive Statistics > Frequencies và xuất bảng sang Excel. Với một nghiên cứu có nhiều biến, cách thực tế là tạo một bảng tổng hợp gồm tên biến, Mean, Std. Deviation và công thức CV.

Đọc bảng số liệu minh họa

Bảng dưới đây mô phỏng cấu trúc output Descriptive Statistics của SPSS. Đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Cột CV được tính thêm từ Mean và Std. Deviation, vì SPSS không tự in cột này trong bảng Descriptives mặc định.

BiếnNMinimumMaximumMeanStd. DeviationCV tính thêm
SAT11801,005,003,800,7018,42%
SAT21801,005,003,201,0532,81%
INCOME1804,0045,0014,508,7060,00%
AGE18018,0055,0031,207,8025,00%

Cách tính dòng SAT1 là 0,70 / 3,80 × 100% = 18,42%. SAT2 có độ lệch chuẩn lớn hơn SAT1 và Mean thấp hơn, nên CV lên tới 32,81%. INCOME có CV cao nhất trong bảng, nhưng con số này có thể phản ánh đặc điểm tự nhiên của thu nhập, chưa thể xem là lỗi.

Khi đọc output, bạn nên kiểm tra N có giống nhau giữa các biến không. Nếu N chênh lệch, dữ liệu thiếu có thể làm việc so sánh CV trở nên kém ổn định. Hãy xem thêm Minimum và Maximum để phát hiện giá trị nhập sai, chẳng hạn tuổi bằng 250 hoặc mức Likert ngoài khoảng 1 đến 5.

Khi hệ số biến thiên không đạt thì xử lý thế nào

CV cao không phải tín hiệu để bạn xóa biến ngay. Việc xử lý cần đi theo thứ tự, từ kiểm tra lỗi rõ ràng đến giải thích bối cảnh nghiên cứu.

Kiểm tra lại công thức và đơn vị đo

Đảm bảo bạn dùng đúng Std. Deviation chia cho Mean, sau đó nhân 100%. Nhiều lỗi đến từ việc nhầm phương sai với độ lệch chuẩn. Phương sai là bình phương của độ lệch chuẩn, vì vậy lấy Variance chia Mean sẽ tạo ra một tỷ lệ khác hẳn CV.

Kiểm tra thêm đơn vị đo. Nếu một bảng dùng nghìn đồng và bảng khác dùng đồng, hãy chuẩn hóa cách ghi trước khi so sánh. Thay đổi đơn vị theo cùng một hệ số thường không làm CV đổi, nhưng giúp bạn tránh đọc nhầm Mean.

Kiểm tra Mean quá nhỏ

CV có mẫu số là Mean. Khi Mean gần 0, một độ lệch chuẩn nhỏ cũng tạo ra CV lớn. Trường hợp này cần báo cáo Mean và Std. Deviation cùng nhau, thay vì dùng CV như bằng chứng duy nhất về mức độ phân tán.

Nếu biến có cả giá trị âm và dương, Mean có thể gần 0 dù dữ liệu trải rộng. Bạn có thể dùng thêm Median, khoảng tứ phân vị hoặc biểu đồ phân phối để mô tả. Trung vị thường hữu ích khi Mean bị kéo bởi một vài giá trị cực đoan.

Kiểm tra outlier và dữ liệu nhập sai

Mở Analyze > Descriptive Statistics > Explore, đưa biến vào Dependent List và xem bảng Extreme Values cùng biểu đồ Boxplot. Nếu có giá trị bất thường, quay về phiếu trả lời hoặc file mã hóa để xác định đó là lỗi nhập liệu hay một quan sát thực sự.

Bạn chỉ nên loại một quan sát khi có lý do phương pháp rõ ràng, chẳng hạn giá trị nằm ngoài phạm vi mà bảng hỏi cho phép hoặc bản ghi vi phạm tiêu chí sàng lọc. Outlier cần được kiểm tra và ghi lại trước khi sửa, không nên xóa chỉ để CV giảm.

Báo cáo sự khác biệt thay vì ép CV về ngưỡng

Nếu dữ liệu hợp lệ và CV cao phản ánh đúng bối cảnh mẫu, hãy giữ lại và giải thích. Bạn có thể trình bày bảng Mean, Std. Deviation và CV, sau đó nói biến nào có mức phân tán tương đối cao hơn. Hội đồng thường quan tâm lý do xử lý dữ liệu hơn một con số được làm đẹp.

Phân biệt hệ số biến thiên với độ lệch chuẩn và phương sai

Ba chỉ số này đều liên quan đến độ phân tán, nhưng không trả lời cùng một câu hỏi. Độ lệch chuẩn cho biết mức lệch trung bình theo đơn vị gốc. Phương sai là độ lệch bình phương, thường được dùng trong các phép tính thống kê. CV là tỷ lệ giữa độ lệch chuẩn và Mean, thường biểu diễn bằng phần trăm.

Chỉ sốCông thức hoặc bản chấtĐơn vịCâu hỏi nó trả lời
Độ lệch chuẩnCăn bậc hai của phương saiGiống biến gốcQuan sát lệch khỏi Mean bao nhiêu theo đơn vị gốc
Phương saiBình phương độ lệch chuẩnBình phương đơn vị gốcMức biến thiên bình phương của dữ liệu là bao nhiêu
Hệ số biến thiênStd. Deviation / Mean × 100%Phần trămĐộ phân tán tương đối so với Mean là bao nhiêu

CV đặc biệt phù hợp khi so sánh tương đối. Độ lệch chuẩn phù hợp khi bạn cần mô tả dữ liệu trong đơn vị ban đầu. Phương sai thường ít trực quan khi viết cho người đọc không chuyên, nhưng vẫn có mặt trong nhiều công thức thống kê.

Bạn cũng không nên nhầm CV với Cronbach's Alpha. Alpha đánh giá mức nhất quán nội tại của các biến quan sát trong thang đo, còn CV mô tả độ phân tán của một biến số. Hai chỉ số có thể cùng xuất hiện trong một luận văn nhưng không thay thế cho nhau.

Lỗi thường gặp khi tính hệ số biến thiên

Lỗi đầu tiên là dùng nhầm Variance thay cho Std. Deviation. Hãy kiểm tra đúng tên cột trong output SPSS trước khi lấy số. Lỗi thứ hai là quên nhân 100%, khiến CV được ghi là 0,184 thay vì 18,4%.

Lỗi thứ ba là so sánh CV giữa các biến có bản chất hoàn toàn khác nhau rồi kết luận biến có CV cao là “kém”. CV chỉ cho biết mức phân tán tương đối. Nó không đánh giá độ tin cậy, độ chính xác của phép đo hay chất lượng câu trả lời.

Lỗi thứ tư là tính CV cho từng dòng dữ liệu. Công thức cần Mean và độ lệch chuẩn của một tập quan sát, nên CV thường là một chỉ số cho cả biến hoặc một nhóm. Nếu muốn so sánh nam và nữ, bạn cần chạy thống kê mô tả theo nhóm rồi tính CV riêng cho từng nhóm.

Lỗi cuối là bỏ qua dữ liệu thiếu. Hãy ghi rõ SPSS sử dụng bao nhiêu quan sát hợp lệ cho từng biến. CV dựa trên N rất nhỏ không nên được diễn giải với mức chắc chắn như CV dựa trên toàn bộ mẫu.

Đọc thêm: công thức tính phương sai, chủ đề thong ke.

Câu hỏi thường gặp

Hệ số biến thiên bao nhiêu là tốt

CV không có một ngưỡng đạt bắt buộc cho mọi đề tài. Khoảng dưới 10%, 10% đến dưới 20%, 20% đến dưới 30% và từ 30% trở lên có thể dùng như khung tham khảo để mô tả mức phân tán, nhưng bạn cần xem Mean, độ lệch chuẩn, đơn vị đo và bối cảnh biến.

Hệ số biến thiên trong SPSS nằm ở bảng nào

SPSS thường không hiển thị sẵn CV trong bảng Descriptive Statistics. Bạn lấy Mean và Std. Deviation từ Analyze > Descriptive Statistics > Descriptives, sau đó tính CV bằng công thức hoặc bổ sung cột trong Excel.

Có thể dùng CV khi Mean bằng 0 không

Không. Công thức CV chia cho Mean nên Mean bằng 0 làm phép tính không xác định. Khi Mean rất gần 0, CV có thể phóng đại và khó diễn giải. Bạn nên báo cáo thêm Median, độ lệch chuẩn, khoảng giá trị và biểu đồ phân phối.

CV cao có cần xóa biến không

CV cao không đủ căn cứ để xóa biến. Trước tiên hãy kiểm tra dữ liệu nhập, đơn vị đo, Mean quá nhỏ, outlier và số quan sát hợp lệ. Chỉ loại biến hoặc quan sát khi có lý do phương pháp phù hợp và ghi lại quyết định trong quá trình phân tích.

Hệ số biến thiên có thay thế độ lệch chuẩn không

Không. Độ lệch chuẩn mô tả mức phân tán theo đơn vị gốc, còn CV mô tả mức phân tán tương đối so với Mean. Hai chỉ số thường nên được báo cáo cùng nhau để người đọc thấy cả quy mô dữ liệu và tỷ lệ biến động.

Cách viết vào luận văn: “Kết quả thống kê mô tả cho thấy biến [TÊN BIẾN] có giá trị trung bình là [MEAN], độ lệch chuẩn là [SD] và hệ số biến thiên là [CV]%. So với [TÊN BIẾN SO SÁNH], biến [TÊN BIẾN] có mức phân tán tương đối [thấp hơn/cao hơn].” Bạn thay các phần trong ngoặc vuông bằng số liệu thật từ file của mình và nêu thêm lý do nếu CV cao do Mean nhỏ hoặc dữ liệu có outlier.

Mở output SPSS của bạn, lập một bảng gồm N, Mean, Std. Deviation và CV cho từng biến, sau đó kiểm tra các dòng có Mean gần 0 hoặc giá trị bất thường trước khi viết chương kết quả. Nếu cần chạy thống kê trên chính file .sav hoặc .csv, bạn có thể dùng module M4 phân tích dữ liệu của DoThesis.