Khoảng biến thiên là gì? Cách đọc trong SPSS và luận văn
Khoảng biến thiên là gì
Bạn mở bảng thống kê mô tả trong SPSS và thấy cột Range có một con số khác với Mean, Std. Deviation và Variance. Range chính là khoảng biến thiên, cho biết khoảng cách giữa giá trị lớn nhất và giá trị nhỏ nhất của một biến.
Công thức tính rất ngắn:
Khoảng biến thiên = Giá trị lớn nhất − Giá trị nhỏ nhất
Ví dụ, một biến có các giá trị từ 2 đến 5 trên thang Likert thì khoảng biến thiên bằng 5 − 2 = 3. Nếu một biến tuổi có giá trị nhỏ nhất là 19 và lớn nhất là 42 thì Range bằng 23 tuổi.
Khoảng biến thiên chỉ sử dụng hai quan sát ở hai đầu dữ liệu. Vì vậy, nó giúp bạn nhìn nhanh độ rộng của dữ liệu nhưng không mô tả đầy đủ cách các quan sát còn lại phân bố ở giữa. Khi cần xem mức độ phân tán ổn định hơn, bạn nên đọc thêm độ lệch chuẩn, phương sai, Mean và các giá trị Min, Max.
Ý nghĩa của khoảng biến thiên trong nghiên cứu định lượng
Trong nghiên cứu định lượng, khoảng biến thiên thường được dùng ở bước thống kê mô tả và kiểm tra dữ liệu ban đầu. Bạn có thể dùng nó để trả lời ba câu hỏi thực tế: dữ liệu có trải rộng không, người trả lời có sử dụng nhiều mức của thang đo không, và có giá trị nào nằm ngoài phạm vi thiết kế hay không.
Với biến quan sát đo bằng Likert 1 đến 5, Min và Max cho biết mẫu thực tế đã sử dụng những mức nào. Nếu Min = 1 và Max = 5, Range = 4, dữ liệu đã trải hết thang đo. Nếu Min = 3 và Max = 5, Range = 2, người trả lời chỉ sử dụng phần trên của thang đo. Trường hợp này không tự động chứng minh thang đo kém, vì mẫu có thể thật sự có xu hướng đánh giá cao. Bạn cần xem thêm Mean, độ lệch chuẩn và phân phối tần số.
Khoảng biến thiên cũng hữu ích khi phát hiện lỗi nhập liệu. Với biến giới tính được mã hóa 1 và 2, nếu Max = 99 thì Range tăng bất thường và có thể bạn đã nhập mã thiếu dữ liệu vào cùng một cột như một giá trị hợp lệ. Với biến tuổi, giá trị 999 hoặc 0 cũng cần được kiểm tra theo quy ước của bảng hỏi.
Trong báo cáo, Range không thay thế cho kiểm định độ tin cậy, EFA, hồi quy hay PLS-SEM. Nó chỉ là một chỉ số mô tả. Một khoảng biến thiên rộng không có nghĩa mô hình nghiên cứu tốt, cũng không có nghĩa biến đó có ảnh hưởng đến biến phụ thuộc.
Bạn có thể đặt Range cạnh trung vị để nhìn thêm vị trí trung tâm của dữ liệu. Nếu muốn kiểm tra mức độ phân tán bằng công thức, xem thêm bài công thức tính phương sai. Hai chỉ số này cung cấp thông tin khác nhau, nên không nên dùng chúng thay thế lẫn nhau.
Khoảng biến thiên bao nhiêu là đạt
Câu hỏi “khoảng biến thiên bao nhiêu là tốt” không có một ngưỡng chung cho mọi biến. Range phụ thuộc vào đơn vị đo, số mức của thang đo và mục tiêu phân tích. Một Range bằng 4 có thể là đầy đủ với thang Likert 1 đến 5, nhưng lại rất nhỏ nếu bạn đang phân tích thu nhập tính bằng triệu đồng.
Bảng dưới đây giúp bạn đọc theo phạm vi thiết kế của biến. Các tiêu chí về thang Likert và thống kê mô tả cần được đặt trong bối cảnh phương pháp nghiên cứu, không nên biến thành điều kiện loại biến tự động.
| Tình huống kiểm tra | Cách đọc khoảng biến thiên | Nguồn hoặc căn cứ |
|---|---|---|
| Thang Likert 1 đến 5 | Range tối đa theo lý thuyết là 4, khi Min = 1 và Max = 5 | Thang Likert được giới thiệu bởi (Likert, 1932) |
| Thang Likert 1 đến 7 | Range tối đa theo lý thuyết là 6, khi Min = 1 và Max = 7 | Thang Likert được giới thiệu bởi (Likert, 1932) |
| Biến định lượng bất kỳ | Không có ngưỡng Range chung, cần đối chiếu đơn vị và phạm vi hợp lệ của biến | Quyết định theo thiết kế bảng hỏi và dữ liệu nghiên cứu |
| Biến có mã thiếu dữ liệu | Min hoặc Max nằm ngoài phạm vi mã hóa là dấu hiệu cần kiểm tra | Nguyên tắc làm sạch dữ liệu trong quy trình phân tích của (Field, 2013) |
| Biến quan sát trong EFA | Range không phải tiêu chí kết luận đạt hay loại biến | Tiêu chí EFA dùng KMO, Bartlett, eigenvalue và factor loading theo (Hair và cộng sự, 2010) |
Với thang Likert 1 đến 5, bạn có thể xem Range = 4 là dữ liệu đã chạm cả hai đầu thang đo. Tuy nhiên, Range nhỏ hơn 4 chưa đủ để kết luận biến quan sát có vấn đề. Hãy mở bảng Frequencies để biết các mức bị thiếu vì không có người chọn, hay vì bạn nhập sai mã.
Nếu đề tài dùng thang đo mới hoặc mẫu có đặc điểm khá đồng nhất, độ phân tán có thể thấp. Khi đó, người đọc luận văn thường quan tâm đến cách bạn thiết kế thang đo, làm sạch dữ liệu và giải thích đặc điểm mẫu hơn là một con số Range riêng lẻ.
Cách đọc khoảng biến thiên trong SPSS
Trong SPSS, khoảng biến thiên thường xuất hiện trong bảng Descriptive Statistics sau khi bạn chọn thống kê mô tả. Bảng kết quả có thể gồm N, Minimum, Maximum, Mean và Std. Deviation. Tùy lựa chọn trong hộp thoại, cột Range có thể không hiện trong bảng này, vì vậy bạn cần chọn đúng mục thống kê.
Mở hộp thoại Descriptives
Mở file .sav, kiểm tra các biến cần phân tích trong Variable View, sau đó chọn Analyze > Descriptive Statistics > Descriptives. Đưa các biến định lượng hoặc biến quan sát đã mã hóa vào ô Variable(s).
Bấm Options, chọn Range, Minimum, Maximum, Mean và Std. deviation. Nếu bạn muốn xem thêm trung vị, độ lệch, độ nhọn hoặc phân vị, lệnh Analyze > Descriptive Statistics > Frequencies thường phù hợp hơn. Bấm Continue, sau đó bấm OK để tạo output.
Đọc cột Range và kiểm tra phép tính
Trong bảng Descriptive Statistics, đọc cùng lúc bốn cột Range, Minimum, Maximum và Mean. Range phải bằng Maximum trừ Minimum. Nếu thấy kết quả không khớp, hãy kiểm tra xem bạn đang đọc đúng dòng biến, đúng file dữ liệu và đúng nhóm lọc hay chưa.
Ví dụ dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật:
| Descriptive Statistics | N | Minimum | Maximum | Range | Mean | Std. Deviation |
|---|---|---|---|---|---|---|
| HL1 | 180 | 1.00 | 5.00 | 4.00 | 3.72 | 0.81 |
| HL2 | 180 | 2.00 | 5.00 | 3.00 | 3.88 | 0.74 |
| HL3 | 177 | 1.00 | 5.00 | 4.00 | 3.65 | 0.93 |
Ở dòng HL1, khoảng biến thiên là 5 − 1 = 4. Dữ liệu đã xuất hiện cả mức thấp nhất và cao nhất của thang Likert 1 đến 5. Ở dòng HL2, Range = 3 vì không có người chọn mức 1 trong nhóm quan sát hợp lệ. Ở dòng HL3, N = 177 thay vì 180, nên bạn cần kiểm tra ba trường hợp thiếu dữ liệu trước khi diễn giải.
Range không cho biết có bao nhiêu người nằm ở mỗi mức. Với HL1, hai bộ dữ liệu có thể cùng Range = 4 nhưng một bộ tập trung gần mức 5, còn bộ kia phân tán đều từ 1 đến 5. Muốn biết điều này, chạy Analyze > Descriptive Statistics > Frequencies và xem bảng tần số hoặc biểu đồ phù hợp.
Đối chiếu với dữ liệu gốc
Trong Data View, sắp xếp hoặc lọc biến để kiểm tra các giá trị ở hai đầu. Bạn cũng có thể dùng Analyze > Descriptive Statistics > Frequencies để xem Min, Max và số lượng từng mức. Nếu một biến Likert có giá trị 0, 6 hoặc 99, đừng vội sửa trực tiếp trong ô dữ liệu. Hãy đối chiếu bảng mã, phiếu trả lời và quy tắc mã hóa trước.
Với dữ liệu có outlier, Range có thể bị kéo rộng chỉ bởi một quan sát rất khác biệt. Xem hướng dẫn outlier để phân biệt lỗi nhập liệu với một quan sát cực trị nhưng hợp lệ. Không nên xóa quan sát chỉ vì nó làm Range lớn hơn mong muốn.
Khi khoảng biến thiên không đạt thì xử lý thế nào
Trước hết, xác định “không đạt” đang có nghĩa gì. Nếu Range không bao phủ toàn bộ thang Likert, đó thường là dấu hiệu mô tả cần giải thích, chưa phải lý do loại biến. Nếu Min hoặc Max nằm ngoài phạm vi hợp lệ, đó mới là vấn đề dữ liệu cần xử lý.
Kiểm tra mã hóa và giá trị thiếu
Mở Variable View, kiểm tra cột Values và Missing. Một số bảng hỏi dùng 99, 999 hoặc một mã riêng cho câu trả lời bỏ trống. Nếu mã này đang được SPSS đọc như giá trị số hợp lệ, hãy khai báo missing hoặc chuyển đổi theo quy tắc đã đặt trước.
Sau đó chạy lại Frequencies để xem Min, Max và bảng tần số. Ghi lại thay đổi trong một bản sao dữ liệu, không ghi đè file gốc. Đây là cách dễ giải trình hơn nếu giảng viên hỏi vì sao N hoặc Range thay đổi.
Kiểm tra giá trị nhập sai
Nếu thang đo chỉ có 1 đến 5 nhưng một dòng chứa 55, hãy quay lại bảng hỏi hoặc nguồn nhập liệu. Có thể lỗi xảy ra khi nhập hai chữ số liền nhau. Nếu giá trị ngoài phạm vi là câu trả lời thật do người tham gia ghi sai, bạn cần nêu quy tắc xử lý và áp dụng nhất quán.
Không loại biến chỉ vì Range nhỏ
Range nhỏ có thể xuất hiện vì mẫu có xu hướng trả lời giống nhau. Bạn nên xem thêm Mean, Std. Deviation, tần số và nội dung biến. Với thang đo, quyết định giữ hoặc loại biến thường dựa trên Cronbach's Alpha, Corrected Item-Total Correlation, EFA hoặc mô hình đo lường, tùy thiết kế nghiên cứu.
Khi chạy EFA, hãy đọc KMO and Bartlett's Test, Total Variance Explained và Rotated Component Matrix. Range không thể thay thế factor loading hay tổng phương sai trích. Các tiêu chí factor loading từ 0.5 và tổng phương sai trích từ 50% thường được tham chiếu theo (Hair và cộng sự, 2010).
Phân biệt khoảng biến thiên với độ lệch chuẩn và phương sai
Khoảng biến thiên là hiệu giữa hai đầu mút. Độ lệch chuẩn đo mức độ các quan sát phân tán quanh Mean. Phương sai là bình phương trung bình của độ lệch so với Mean. Vì cách tính khác nhau, ba chỉ số có thể cho những tín hiệu khác nhau trên cùng một biến.
Một outlier có thể làm Range tăng mạnh, trong khi phần lớn dữ liệu vẫn tập trung gần Mean. Độ lệch chuẩn và phương sai cũng bị ảnh hưởng bởi outlier, nhưng chúng sử dụng toàn bộ các quan sát thay vì chỉ Min và Max. Khi báo cáo thống kê mô tả, nên trình bày Min, Max, Mean và Std. Deviation cùng nhau nếu các chỉ số này phục vụ mục tiêu mô tả mẫu.
Ví dụ, hai biến đều có Min = 1 và Max = 5 nên cùng Range = 4. Biến A có Std. Deviation = 0.40, còn biến B có Std. Deviation = 1.20. Range giống nhau không có nghĩa mức phân tán giống nhau. Bạn có thể xem bài phương sai để hiểu quan hệ giữa Variance và Std. Deviation.
Lỗi thường gặp
Lỗi đầu tiên là tìm một ngưỡng Range chung rồi kết luận biến “không đạt”. Chỉ số này không có một mức tốt áp dụng cho tuổi, thu nhập, điểm Likert và số lần mua hàng cùng lúc.
Lỗi thứ hai là nhầm Range với khoảng tứ phân vị. Range dùng Min và Max, còn khoảng tứ phân vị tập trung vào phần giữa của dữ liệu. Nếu bạn cần mô tả dữ liệu ít bị ảnh hưởng bởi giá trị cực trị, hãy báo cáo thêm trung vị và các phân vị.
Lỗi thứ ba là bỏ qua N. Hai dòng có cùng Range nhưng một dòng có 200 quan sát, dòng kia chỉ có 150 quan sát do thiếu dữ liệu. N cần được đối chiếu trước khi viết nhận xét.
Lỗi thứ tư là xóa outlier tự động. Hãy kiểm tra giá trị trong dữ liệu gốc, điều kiện thu thập và quy tắc loại quan sát. Một quan sát khác biệt nhưng hợp lệ vẫn là một phần của mẫu.
Lỗi cuối cùng là đưa ảnh chụp output vào luận văn mà không giải thích. Bạn nên nêu biến, số quan sát hợp lệ, Min, Max, Range và ý nghĩa trong ngữ cảnh thang đo. Bảng kết quả cần khớp với file dữ liệu cuối cùng được sử dụng cho các phân tích tiếp theo.
Câu hỏi thường gặp
Khoảng biến thiên bao nhiêu là tốt với thang Likert 5 mức?
Với thang Likert từ 1 đến 5, Range tối đa theo lý thuyết là 4. Range = 4 cho biết dữ liệu có ít nhất một quan sát ở mức 1 và một quan sát ở mức 5. Range nhỏ hơn 4 chưa đủ để kết luận thang đo không đạt, bạn cần xem tần số và độ lệch chuẩn.
Khoảng biến thiên trong SPSS nằm ở đâu?
Bạn chọn Analyze > Descriptive Statistics > Descriptives, bấm Options, rồi chọn Range, Minimum và Maximum. Kết quả xuất hiện trong bảng Descriptive Statistics. Bạn có thể kiểm tra lại bằng phép tính Maximum trừ Minimum.
Vì sao SPSS không hiện cột Range?
Trong hộp thoại Descriptives, Range có thể chưa được chọn trong Options. Hãy mở lại lệnh và đánh dấu Range. Nếu bạn đang dùng Frequencies, kiểm tra phần Statistics để chọn các chỉ số cần hiển thị.
Range lớn có phải dữ liệu bị lỗi không?
Chưa chắc. Range lớn có thể hoàn toàn hợp lệ nếu biến có đơn vị đo rộng, chẳng hạn tuổi hoặc thu nhập. Bạn chỉ cần kiểm tra xem Min và Max có nằm trong phạm vi được thiết kế hay không, đồng thời xem outlier và mã thiếu dữ liệu.
Có cần báo cáo khoảng biến thiên trong chương 4 không?
Bạn nên báo cáo khi Range giúp mô tả phạm vi dữ liệu hoặc phát hiện vấn đề mã hóa. Với bảng thống kê mô tả, có thể trình bày N, Min, Max, Mean và Std. Deviation. Range không bắt buộc phải xuất hiện trong mọi bảng nếu nó không phục vụ câu hỏi nghiên cứu.
Có nên xóa biến khi khoảng biến thiên nhỏ không?
Không nên xóa biến chỉ vì Range nhỏ. Hãy kiểm tra phạm vi thang đo, tần số, Mean, Std. Deviation, độ tin cậy và giá trị thang đo theo quy trình của đề tài. Nếu dữ liệu sai do nhập liệu, sửa theo nguồn gốc và lưu lại lịch sử xử lý.
Mở file SPSS của bạn, chạy lại Analyze > Descriptive Statistics > Descriptives, đối chiếu Range với Minimum và Maximum, rồi ghi nhận xét theo đúng thang đo của từng biến; nếu cần chạy trọn quy trình trên dữ liệu .sav hoặc .csv, bạn có thể dùng M4 phân tích của DoThesis.