Biến giả là gì? Cách tạo và sử dụng biến giả trong SPSS
Biến giả là gì
Biến giả, tiếng Anh là dummy variable, là biến số dùng để đại diện cho một nhóm hoặc một đặc điểm phân loại trong mô hình định lượng. Bạn thường dùng biến giả khi dữ liệu gốc là dạng chữ hoặc có nhiều nhóm, chẳng hạn giới tính, khu vực sinh sống, loại hình doanh nghiệp, ngành học hoặc trạng thái có sử dụng dịch vụ hay không.
Cách mã hóa phổ biến nhất là dùng số 0 và 1. Ví dụ, biến GIOITINH_NAM nhận giá trị 1 nếu người trả lời là nam và nhận giá trị 0 nếu người trả lời là nữ. Khi đó, nữ là nhóm tham chiếu. Giá trị 0 không có nghĩa là người đó không thuộc tổng thể, mà chỉ có nghĩa là người đó thuộc nhóm tham chiếu trong cách mã hóa bạn đã chọn.
Với biến phân loại có k nhóm, bạn thường tạo k - 1 biến giả và giữ lại một nhóm làm nhóm tham chiếu. Nếu biến KHU VUC có ba nhóm là thành thị, nông thôn và vùng khác, bạn có thể tạo hai biến: KV_NONGTHON và KV_KHAC. Nhóm thành thị được giữ làm tham chiếu. Quy tắc k - 1 giúp mô hình tránh tình trạng các biến giải thích trùng thông tin hoàn toàn.
Biến giả không phải là một thang đo Likert. Bạn không cộng các mã 1, 2, 3 của ba nhóm rồi xem chúng như một biến liên tục, trừ khi có cơ sở lý thuyết rõ ràng cho thứ tự đó. Với biến chỉ có hai trạng thái, mã hóa 0 và 1 thường dễ đọc và dễ giải thích nhất.
Ý nghĩa của biến giả trong nghiên cứu định lượng
Biến giả giúp mô hình hồi quy so sánh sự khác biệt giữa các nhóm sau khi đã kiểm soát những biến khác trong mô hình. Trong hồi quy tuyến tính, nếu biến giả có hệ số dương và có ý nghĩa thống kê, nhóm được mã hóa 1 có giá trị trung bình dự đoán cao hơn nhóm tham chiếu một lượng bằng hệ số đó, trong điều kiện các biến khác không đổi.
Ví dụ, bạn nghiên cứu mức chi tiêu hàng tháng và đưa biến CO GIA DINH vào mô hình. Nếu CO GIA DINH = 1 cho người đã lập gia đình và 0 cho người độc thân, hệ số 2,4 có thể được đọc là nhóm đã lập gia đình có mức chi tiêu dự đoán cao hơn 2,4 đơn vị so với nhóm độc thân, khi các biến khác giữ nguyên. Cách diễn giải cụ thể còn phụ thuộc vào đơn vị của biến phụ thuộc.
Trong nghiên cứu định lượng, biến giả thường phục vụ bốn mục đích. Thứ nhất, nó đưa đặc điểm nhân khẩu học vào mô hình dưới dạng biến kiểm soát. Thứ hai, nó cho phép so sánh nhóm. Thứ ba, nó có thể đại diện cho một điều kiện chính sách hoặc trạng thái tham gia. Thứ tư, khi kết hợp với một biến liên tục, nó có thể kiểm tra sự khác nhau về tác động giữa các nhóm thông qua biến tương tác.
Nếu bạn đang xây dựng mô hình hồi quy, hãy xem thêm hướng dẫn về hồi quy tuyến tính và mô hình hồi quy tuyến tính. Biến giả là một phần của mô hình, không phải một kiểm định riêng thay thế cho việc kiểm tra độ phù hợp, ý nghĩa tổng thể hoặc các giả định hồi quy.
Với biến phụ thuộc chỉ có hai kết quả, chẳng hạn mua hoặc không mua, có hoặc không có ý định tiếp tục, hồi quy logistic thường phù hợp hơn hồi quy tuyến tính. Bạn có thể đối chiếu cách dùng biến trong hồi quy logistic trước khi chọn phương pháp.
Biến giả bao nhiêu là đạt
Câu hỏi “biến giả bao nhiêu là tốt” cần được hiểu đúng. Biến giả không có ngưỡng Cronbach's Alpha, KMO hay factor loading như một thang đo nhiều biến quan sát. Giá trị 0 và 1 là quy ước mã hóa, còn việc mã hóa có phù hợp hay không phụ thuộc vào cách định nghĩa nhóm và mô hình nghiên cứu.
Các tiêu chí dưới đây giúp bạn kiểm tra biến giả trước khi chạy hồi quy. Những ngưỡng có số liệu được gắn với nguồn tương ứng, còn các quy tắc về mã hóa được trình bày như yêu cầu kỹ thuật của mô hình.
| Nội dung cần kiểm tra | Cách đánh giá | Nguồn hoặc căn cứ |
|---|---|---|
| Số nhóm được mã hóa | Với biến có k nhóm, thường dùng k - 1 biến giả và một nhóm tham chiếu | Nguyên tắc đặc tả mô hình hồi quy |
| Giá trị của biến nhị phân | Dùng hai giá trị riêng biệt, phổ biến là 0 và 1 | Quy ước mã hóa biến phân loại |
| Nhóm tham chiếu | Phải được xác định trước và ghi rõ trong phương pháp nghiên cứu | Nguyên tắc diễn giải hệ số hồi quy |
| Cỡ mẫu cho mô hình có m biến giải thích | Có thể tham khảo n từ 50 + 8m trở lên | (Tabachnick và Fidell, 2013) |
| Durbin-Watson khi kiểm tra phần dư hồi quy | Có thể tham khảo khoảng từ 1 đến 3 | (Field, 2013) |
| VIF của biến giải thích | VIF dưới 5 là ngưỡng thường được báo cáo trong PLS-SEM | (Hair và cộng sự, 2019) |
Hàng VIF cần được đọc theo đúng phương pháp. Trong hồi quy tuyến tính bằng SPSS, bạn có thể báo cáo Tolerance và VIF để xem đa cộng tuyến. Trong PLS-SEM, VIF dưới 5 là tiêu chí được nêu trong (Hair và cộng sự, 2019). Không nên lấy một ngưỡng từ SmartPLS rồi áp nguyên xi cho mọi tình huống hồi quy.
Nếu biến có ba nhóm, tạo hai biến giả. Nếu biến có bốn nhóm, tạo ba biến giả. Khi bạn tạo đủ k biến cho k nhóm rồi đưa cả k biến cùng với hằng số vào hồi quy, mô hình có thể gặp bẫy biến giả. Một biến phải được bỏ ra làm tham chiếu.
Cách đọc biến giả trên output
Trong SPSS, biến giả xuất hiện như một biến độc lập bình thường trong các bảng Variables Entered/Removed, Model Summary, ANOVA và Coefficients. SPSS không tự ghi chú rằng đây là biến giả. Vì vậy, bạn phải đặt tên biến rõ ràng và ghi nhóm mã hóa trong bảng mô tả dữ liệu.
Dưới đây là bảng Coefficients dạng rút gọn. Đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Giả sử biến phụ thuộc là Y, nhóm tham chiếu của VUNG_NONGTHON là thành thị, còn nhóm tham chiếu của GIOITINH_NAM là nữ.
| Model | Unstandardized B | Std. Error | Standardized Beta | t | Sig. | Collinearity Statistics VIF |
|---|---|---|---|---|---|---|
| (Constant) | 3.120 | 0.410 | 7.610 | <0.001 | ||
| VUNG_NONGTHON | -0.280 | 0.120 | -0.110 | -2.333 | 0.021 | 1.180 |
| GIOITINH_NAM | 0.150 | 0.100 | 0.070 | 1.500 | 0.135 | 1.090 |
| THUNHAP | 0.360 | 0.080 | 0.310 | 4.500 | <0.001 | 1.240 |
Trong ví dụ này, VUNG_NONGTHON có B = -0.280 và Sig. = 0.021. Nếu các biến khác không đổi, nhóm nông thôn có giá trị Y dự đoán thấp hơn nhóm thành thị 0,280 đơn vị. Vì nhóm thành thị là nhóm tham chiếu, bạn không đọc hệ số này như mức thay đổi của nông thôn so với giá trị 0 tuyệt đối.
GIOITINH_NAM có Sig. = 0.135, lớn hơn 0,05. Với mức ý nghĩa 5%, bạn chưa có đủ bằng chứng để kết luận Y khác nhau giữa nam và nữ trong mô hình minh họa. Điều này không có nghĩa hai nhóm chắc chắn giống nhau, mà chỉ cho thấy kiểm định chưa đạt mức ý nghĩa đã chọn.
Unstandardized B thường là cột quan trọng nhất khi bạn muốn diễn giải chênh lệch theo đơn vị gốc. Standardized Beta hữu ích khi so sánh tương đối giữa các biến liên tục, nhưng không nên dùng nó để quên mất nhóm tham chiếu của biến giả. Sig. là p-value của kiểm định hệ số riêng lẻ. VIF giúp bạn kiểm tra dấu hiệu đa cộng tuyến.
Nếu bạn muốn luyện cách đọc bảng Coefficients, hãy đối chiếu với bài tập hồi quy tuyến tính có lời giải. Trong file thật, hãy kiểm tra cả nhãn giá trị, tần số từng nhóm và nhóm tham chiếu trước khi diễn giải dấu của hệ số.
Khi biến giả không đạt thì xử lý thế nào
Trước hết, xác định “không đạt” đang nói đến điều gì. Biến giả không có Alpha để đạt hoặc không đạt. Vấn đề thường nằm ở mã hóa sai, nhóm có quá ít quan sát, đưa thừa biến vào mô hình, hoặc hệ số không có ý nghĩa thống kê.
Kiểm tra lại mã hóa và nhãn giá trị
Mở Variable View trong SPSS. Kiểm tra cột Values, Missing, Measure và tên biến. Với biến nhị phân, kiểm tra bảng tần số bằng Analyze > Descriptive Statistics > Frequencies. Nếu bạn thấy giá trị 0, 1, 2 trong khi dự kiến chỉ có hai nhóm, cần quay lại dữ liệu gốc để xác định 2 có phải mã lỗi hay nhóm thứ ba.
Chọn lại nhóm tham chiếu
Nhóm tham chiếu nên có ý nghĩa nghiên cứu và đủ số quan sát. Bạn có thể đổi nhóm tham chiếu bằng cách tạo lại biến hoặc thay đổi quy ước mã hóa, nhưng phải ghi lại trong phương pháp. Đổi nhóm tham chiếu sẽ làm thay đổi hệ số và hằng số, còn bản chất so sánh giữa các nhóm không tự nhiên tốt hơn.
Gộp nhóm khi có cơ sở
Nếu một nhóm chỉ có rất ít người trả lời, ước lượng có thể không ổn định. Bạn chỉ nên gộp nhóm khi hai nhóm có cơ sở lý thuyết hoặc bối cảnh tương đồng, đồng thời ghi rõ quyết định này. Không gộp chỉ vì muốn p-value nhỏ hơn. Nếu không có cơ sở để gộp, hãy cân nhắc báo cáo hạn chế của dữ liệu hoặc thiết kế thu thập lại.
Bỏ biến khi mô hình không có lý do giữ lại
Nếu biến giả không có ý nghĩa thống kê, bạn không tự động xóa biến. Biến kiểm soát có thể được giữ vì câu hỏi nghiên cứu hoặc cơ sở lý thuyết. Nếu mục tiêu của bạn là mô hình dự báo tối giản, việc loại biến phải dựa trên chiến lược mô hình đã nêu trước, không chạy đi chạy lại đến khi có kết quả mong muốn.
Nếu VIF tăng bất thường sau khi thêm các biến giả, kiểm tra việc bạn có tạo đủ k - 1 biến hay không. Hướng dẫn về đa cộng tuyến sẽ giúp bạn phân biệt lỗi đặc tả biến với tương quan thông thường giữa các biến giải thích.
Phân biệt biến giả với biến định tính và biến thứ bậc
Biến định tính là loại dữ liệu gốc, chẳng hạn ngành học gồm kinh tế, kỹ thuật và ngôn ngữ. Biến giả là cách chuyển thông tin đó thành một hoặc nhiều biến số để mô hình sử dụng. Một biến định tính có thể tạo ra nhiều biến giả.
Biến thứ bậc có các mức có trật tự, chẳng hạn mức độ hài lòng từ rất thấp đến rất cao. Việc mã hóa 1 đến 5 có thể phù hợp trong một số mô hình, nhưng bạn cần xem xét giả định về khoảng cách giữa các mức. Nếu chỉ muốn so sánh từng nhóm với nhóm tham chiếu, có thể tạo biến giả cho biến thứ bậc. Cách nào phù hợp phải bám vào câu hỏi nghiên cứu.
Biến giả cũng khác biến liên tục. Thu nhập, tuổi hoặc số năm kinh nghiệm có thể mang nhiều giá trị số và thường được đưa vào mô hình dưới dạng số gốc. Nếu bạn chia tuổi thành nhóm rồi tạo biến giả, bạn đã thay đổi cách biểu diễn dữ liệu và có thể làm mất thông tin chi tiết.
Lỗi thường gặp
Lỗi đầu tiên là mã hóa giới tính bằng 1, 2 rồi diễn giải hệ số như mức tăng từ nữ lên nam. Với hai nhóm, mã 0 và 1 giúp diễn giải trực tiếp hơn. Nếu dùng 1 và 2, bạn cần hiểu rõ SPSS đang xử lý biến như một biến số và cách đặc tả đó có thể không phản ánh đúng mục tiêu so sánh nhóm.
Lỗi thứ hai là tạo đủ số biến giả cho tất cả nhóm rồi đưa tất cả vào hồi quy có hằng số. Hãy nhớ quy tắc k - 1. Lỗi thứ ba là không ghi nhóm tham chiếu, khiến người đọc không biết hệ số đang so sánh với ai.
Lỗi thứ tư là nhầm p-value của biến giả với tỷ lệ thuộc nhóm. Sig. trong bảng Coefficients trả lời câu hỏi về hệ số trong mô hình, không cho biết bao nhiêu phần trăm mẫu thuộc nhóm đó. Tỷ lệ nhóm phải xem ở bảng Frequencies hoặc thống kê mô tả.
Lỗi thứ năm là đổi mã sau khi chạy nhưng không cập nhật bảng dữ liệu và chương kết quả. Hãy lưu một bản dữ liệu gốc, một bản dữ liệu đã làm sạch, ghi chú cách tạo từng biến giả và dùng cùng quy ước trong toàn bộ luận văn. Các bài viết trong nhóm Thống kê có thể giúp bạn nối phần mã hóa với các bước phân tích tiếp theo.
Cách viết vào luận văn: “Biến X được mã hóa thành biến giả X_1, trong đó X_1 = 1 đối với [nhóm được xét] và X_1 = 0 đối với [nhóm tham chiếu]. Hệ số hồi quy của X_1 được diễn giải là chênh lệch của biến phụ thuộc giữa hai nhóm khi các biến khác không đổi.”
Câu hỏi thường gặp
Biến giả là gì trong SPSS
Trong SPSS, biến giả là một cột dữ liệu số, thường nhận giá trị 0 hoặc 1, đại diện cho một nhóm trong biến phân loại. SPSS không tự nhận biết cột đó là biến giả, nên bạn phải đặt tên, gắn nhãn và ghi nhóm tham chiếu rõ ràng.
Biến giả bao nhiêu là tốt
Không có ngưỡng Alpha hay điểm cắt chung cho biến giả. Với biến có k nhóm, thường tạo k - 1 biến giả và chọn một nhóm làm tham chiếu. Bạn cần kiểm tra tần số nhóm, cách mã hóa, ý nghĩa lý thuyết và các chỉ số chẩn đoán của mô hình.
Có nên mã hóa biến giả bằng 1 và 2 không
Bạn có thể lưu dữ liệu gốc bằng mã 1 và 2, nhưng khi đưa vào hồi quy, cách mã hóa 0 và 1 thường dễ diễn giải hơn. Nếu giữ mã 1 và 2, đừng mặc định rằng SPSS đang thực hiện một so sánh nhóm đúng như ý bạn. Hãy tạo lại biến theo thiết kế mô hình hoặc dùng quy trình mã hóa phù hợp.
Biến giả không có ý nghĩa thống kê có cần xóa không
Chưa cần xóa ngay. Nếu biến là biến kiểm soát hoặc được giả thuyết xác định trước, bạn có thể giữ và báo cáo p-value cùng khoảng tin cậy theo quy định của nghiên cứu. Chỉ xóa khi có lý do phương pháp rõ ràng, không xóa chỉ để làm bảng kết quả đẹp hơn.
Biến giả trong SPSS bị lỗi đa cộng tuyến phải làm sao
Kiểm tra bạn có đưa đủ k biến cho k nhóm hay không. Nếu có, bỏ một biến làm nhóm tham chiếu rồi chạy lại. Sau đó xem VIF, Tolerance và ma trận tương quan, đồng thời kiểm tra các biến giả có bị tạo trùng hoặc chứa mã lỗi hay không.
Mở file SPSS của bạn ngay lúc này, chạy Analyze > Descriptive Statistics > Frequencies cho các biến phân loại, ghi rõ nhóm tham chiếu và chỉ tạo k - 1 biến giả trước khi chạy hồi quy. Nếu cần hỗ trợ chạy phân tích trên chính file .sav hoặc .csv, bạn có thể dùng module M4 phân tích của DoThesis.