Dummy là gì? Cách tạo biến giả và đưa vào mô hình hồi quy

Thống kê··15 phút đọc

Dummy là gì

Dummy, hay dummy variable, là biến giả dùng để chuyển một biến phân loại thành dạng số để đưa vào mô hình hồi quy hoặc các phân tích định lượng khác. Cách mã hóa phổ biến nhất là dùng giá trị 0 và 1. Chẳng hạn, biến giới tính có thể được mã hóa Nam = 0 và Nữ = 1, hoặc ngược lại.

Giá trị 0 và 1 ở đây chỉ là mã đại diện, không có nghĩa nhóm được gán 1 nhiều hơn, tốt hơn hoặc có mức độ cao hơn nhóm được gán 0. Khi đọc kết quả, bạn cần biết nhóm nào là nhóm tham chiếu, tức nhóm được mã hóa 0. Hệ số của dummy cho biết sự khác biệt của nhóm mã hóa 1 so với nhóm tham chiếu, trong điều kiện các biến khác trong mô hình được giữ cố định.

Với biến phân loại chỉ có hai nhóm, bạn tạo một dummy là đủ. Với biến có k nhóm, nguyên tắc thường dùng là tạo k - 1 dummy và giữ lại một nhóm làm nhóm tham chiếu. Nếu biến khu vực có ba nhóm Bắc, Trung và Nam, bạn có thể tạo KV_TrungKV_Nam, còn Bắc làm nhóm tham chiếu.

Bạn có thể xem dummy như một cách làm cho phần mềm hiểu được thông tin phân loại. SPSS không thể xử lý trực tiếp chữ như “Nam”, “Nữ”, “Bắc” hoặc “Nam” trong phương trình hồi quy theo cách bạn mong muốn. Vì vậy, bạn cần mã hóa trước khi chạy mô hình. Nếu đang rà soát các biến bất thường trong file, hãy đọc thêm hướng dẫn về outliers để tránh nhầm lỗi mã hóa với dữ liệu ngoại lệ. Bạn cũng có thể xem các bài thuộc chủ đề Thống kê khi cần đối chiếu thêm quy trình phân tích.

Ý nghĩa của dummy trong nghiên cứu định lượng

Dummy giúp bạn trả lời các câu hỏi so sánh giữa các nhóm. Ví dụ, đề tài có thể muốn kiểm tra khách hàng ở khu vực thành thị có mức độ hài lòng khác khách hàng ở khu vực nông thôn hay không. Khi đó, khu vực được đưa vào mô hình dưới dạng dummy.

Trong phương trình hồi quy đơn giản:

Y = β0 + β1X1 + β2D + ε

D là dummy, nhận giá trị 0 hoặc 1. Y là biến phụ thuộc, X1 là một biến độc lập khác, β0 là hằng số, còn β2 là mức chênh lệch ước tính của nhóm D = 1 so với nhóm D = 0 khi X1 không đổi.

Nếu β2 dương và có ý nghĩa thống kê, nhóm D = 1 có giá trị Y cao hơn nhóm tham chiếu theo mô hình. Nếu β2 âm, nhóm D = 1 có giá trị Y thấp hơn nhóm tham chiếu. Nếu p-value không đạt mức ý nghĩa bạn đã chọn, bạn chưa có đủ bằng chứng để kết luận hai nhóm khác nhau trong tổng thể nghiên cứu.

Dummy cũng có thể dùng để kiểm soát đặc điểm mẫu. Ví dụ, bạn đưa giới tính, độ tuổi đã phân nhóm, tình trạng hôn nhân hoặc khu vực vào mô hình để xem tác động của biến chính sau khi đã kiểm soát các khác biệt này. Việc đưa dummy vào mô hình không tự động làm mô hình tốt hơn. Bạn chỉ nên thêm biến khi nó có cơ sở từ câu hỏi nghiên cứu, mô hình lý thuyết hoặc thiết kế nghiên cứu.

Đừng nhầm dummy với moderator. Một biến phân loại có thể chỉ là biến kiểm soát, nhưng cũng có thể đóng vai trò moderator nếu bạn kiểm tra việc nó làm thay đổi tác động của X lên Y. Khi đó, mô hình cần có biến tương tác, chẳng hạn X × D, chứ chỉ đưa riêng D vào là chưa đủ.

Dummy bao nhiêu là đạt

Dummy không có ngưỡng “đạt” giống Cronbach's Alpha, KMO hay factor loading. Một dummy được xem là phù hợp trước hết khi cách mã hóa phản ánh đúng nhóm trong dữ liệu, mỗi quan sát thuộc đúng một nhóm theo thiết kế, và nhóm tham chiếu được xác định rõ.

Bảng dưới đây giúp bạn kiểm tra các quyết định thường gặp. Các ngưỡng về cỡ mẫu và kiểm định trong bảng là tiêu chí của phân tích liên quan, không phải ngưỡng riêng của bản thân dummy.

Nội dung cần kiểm traCách quyết địnhNguồn
Biến có hai nhómDùng một dummy, mã 0 và 1Quy tắc mã hóa mô hình, không có ngưỡng riêng trong danh mục nguồn
Biến có k nhómThường dùng k - 1 dummy, giữ một nhóm tham chiếuQuy tắc mã hóa mô hình, không có ngưỡng riêng trong danh mục nguồn
Cỡ mẫu khi chạy hồi quyCó thể tham khảo n từ 50 + 8m, trong đó m là số biến độc lập(Tabachnick và Fidell, 2013)
Dummy trong mô hình PLS-SEMCần mã hóa nhất quán trước khi nhập dữ liệu và kiểm tra cấu trúc mô hình(Hair và cộng sự, 2022)
VIF của các biến trong mô hìnhVIF dưới 5 là mức thường được báo cáo(Hair và cộng sự, 2019)
Ý nghĩa hệ số dummyXem dấu hệ số và p-value hoặc khoảng tin cậy theo phương pháp phân tíchQuy tắc diễn giải kết quả, không có một ngưỡng dummy riêng trong danh mục nguồn

Vì vậy, câu hỏi “dummy bao nhiêu là đạt” cần được tách thành hai phần. Nếu bạn hỏi giá trị của biến, câu trả lời thường là 0 hoặc 1 theo quy ước mã hóa. Nếu bạn hỏi hệ số dummy bao nhiêu là tốt, không có một con số cố định. Hệ số phải được đọc cùng thang đo của biến phụ thuộc, sai số chuẩn, p-value và ý nghĩa thực tiễn.

Đừng tự đặt điều kiện rằng hệ số dummy phải lớn hơn 0.5 hoặc phải dương. Một hệ số âm vẫn có thể là kết quả đúng nếu nhóm mã hóa 1 có mức Y thấp hơn nhóm tham chiếu. Điều cần giải thích là nhóm nào đang được so sánh, chênh lệch có ý nghĩa thống kê hay không, và chênh lệch đó có ý nghĩa thực tế không.

Cách đọc dummy trên output

Trong SPSS, dummy thường xuất hiện trong bảng Coefficients sau khi bạn chạy hồi quy tại Analyze > Regression > Linear. Cột B là hệ số chưa chuẩn hóa, Std. Error là sai số chuẩn, Beta là hệ số chuẩn hóa, t là thống kê kiểm định và Sig. là p-value.

Ví dụ, giả sử bạn nghiên cứu mức độ hài lòng, trong đó KV_ThanhThi được mã hóa 1 nếu người trả lời ở khu vực thành thị và 0 nếu ở nông thôn. Nông thôn là nhóm tham chiếu. Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu cụ thể.

CoefficientsBStd. ErrorBetatSig.
(Constant)2.1840.2419.0630.000
Chất lượng dịch vụ0.5160.0610.5488.4590.000
KV_ThanhThi0.1730.0720.1262.4030.017

Ở dòng KV_ThanhThi, B = 0.173 nghĩa là, trong điều kiện chất lượng dịch vụ không đổi, nhóm thành thị có mức hài lòng dự đoán cao hơn nhóm nông thôn 0.173 điểm trên thang đo Y. Vì Sig. = 0.017, nếu nghiên cứu chọn mức ý nghĩa 5%, sự khác biệt này có ý nghĩa thống kê theo quy tắc ra quyết định của mô hình.

Nếu bạn đổi mã thành thị = 0 và nông thôn = 1, hệ số sẽ được diễn giải theo chiều ngược lại. Mức độ chênh lệch về bản chất không tự nhiên thay đổi, nhưng dấu hệ số và nhóm tham chiếu thay đổi. Vì vậy, hãy ghi cách mã hóa trong chương phương pháp, bảng mô tả biến hoặc chú thích bảng hồi quy.

Nếu biến có ba nhóm, bạn sẽ thấy hai dòng dummy nếu chọn nhóm thứ nhất làm tham chiếu. Ví dụ KV_MienTrung = 1 cho miền Trung và 0 cho các nhóm khác, KV_MienNam = 1 cho miền Nam và 0 cho các nhóm khác. Hệ số của mỗi dòng lần lượt so sánh miền Trung và miền Nam với miền Bắc. Không được đọc hai hệ số này như hai tác động độc lập lên một biến liên tục.

Khi đọc output, bạn nên kiểm tra thêm bảng Model Summary, ANOVACoefficients. Model Summary cho biết R Square và Adjusted R Square, bảng ANOVA hỗ trợ đánh giá ý nghĩa chung của mô hình, còn Coefficients cho biết dummy và các biến độc lập riêng lẻ. Nếu dummy là biến tương tác, tên biến có thể xuất hiện như X_D hoặc một tên do bạn tự tạo, khi đó không thể diễn giải giống dummy chính.

Khi dummy không đạt thì xử lý thế nào

Trước tiên, kiểm tra mã hóa trong file dữ liệu. Vào Variable View để xem Values, MissingMeasure, sau đó mở Data View để kiểm tra các giá trị thực tế. Một biến được dự kiến chỉ có 0 và 1 nhưng lại xuất hiện 2, 3, 9 hoặc ô trống có thể làm sai mô hình.

Kiểm tra nhóm tham chiếu

Xác nhận nhóm mã 0 là nhóm bạn muốn dùng để so sánh. Nếu nhóm tham chiếu có quá ít quan sát, hệ số có thể không ổn định và sai số chuẩn lớn. Bạn có thể dùng Analyze > Descriptive Statistics > Frequencies để xem số lượng và tỷ lệ của từng nhóm trước khi chạy hồi quy.

Kiểm tra nhóm có tần số quá thấp

Một nhóm rất ít quan sát có thể khiến kết quả khó giải thích. Trước khi gộp nhóm, bạn cần có lý do nội dung rõ ràng. Không nên gộp hai nhóm chỉ vì muốn p-value nhỏ hơn. Nếu gộp, ghi rõ nhóm nào được gộp, vì sao gộp và cách mã hóa mới.

Kiểm tra cách tạo k - 1 dummy

Nếu biến có k nhóm mà bạn tạo đủ k dummy cùng với hằng số, mô hình có thể gặp đa cộng tuyến hoàn hảo. Trong SPSS, hãy bỏ một dummy làm nhóm tham chiếu. Nếu sử dụng Transform > Recode into Different Variables, đặt tên riêng cho từng dummy và lập bảng đối chiếu mã cũ, mã mới để có thể giải trình.

Xem lại vai trò của biến trong mô hình

Nếu dummy không có ý nghĩa thống kê, bạn không nên xóa ngay. Biến có thể vẫn cần giữ vì nó là biến kiểm soát được xác định trước trong mô hình. Hãy dựa vào câu hỏi nghiên cứu và lập luận phương pháp, sau đó báo cáo kết quả trung thực. Chỉ loại biến khi có lý do phân tích hoặc lý thuyết rõ ràng, không loại chỉ để làm bảng kết quả đẹp hơn.

Phân biệt dummy với biến phân loại và moderator

Biến phân loại là khái niệm rộng hơn. Nó mô tả dữ liệu thuộc các nhóm như giới tính, nghề nghiệp hoặc khu vực. Dummy là dạng mã số được tạo ra từ biến phân loại để phần mềm có thể sử dụng trong mô hình. Một biến phân loại có hai nhóm thường cần một dummy, còn biến có nhiều nhóm cần nhiều dummy.

Dummy cũng khác với thang đo Likert. Thang Likert dùng các mức phản hồi có thứ tự, chẳng hạn từ 1 đến 5, và thường được tổng hợp thành biến đại diện cho một khái niệm. Bạn có thể đọc thêm scale là gì nếu đang phân vân giữa biến đơn, thang đo và biến giả.

Dummy lại càng không đồng nghĩa với mediator. Mediator giải thích cơ chế qua đó X ảnh hưởng đến Y, còn dummy chỉ mô tả nhóm hoặc điều kiện phân loại. Một dummy vẫn có thể được dùng trong mô hình mediator hoặc moderator, nhưng vai trò đó phụ thuộc vào giả thuyết và cấu trúc phương trình.

Nếu dummy được đưa vào để kiểm tra tác động khác nhau giữa hai nhóm, bạn cần tạo biến tương tác giữa biến độc lập và dummy. Ví dụ, để kiểm tra tác động của chất lượng dịch vụ có khác giữa thành thị và nông thôn không, mô hình cần có Chất lượng dịch vụ, KV_ThanhThiChất lượng dịch vụ × KV_ThanhThi. Chỉ nhìn vào hệ số của KV_ThanhThi chưa trả lời được câu hỏi về sự khác biệt trong tác động.

Lỗi thường gặp

Lỗi đầu tiên là mã hóa 1 và 2 thay vì 0 và 1 rồi diễn giải như dummy. Một số phần mềm vẫn chạy được mô hình, nhưng hệ số lúc đó không còn biểu diễn trực tiếp chênh lệch giữa hai nhóm theo cách dễ đọc. Hãy recode về 0 và 1, đồng thời ghi lại nhóm tham chiếu.

Lỗi thứ hai là tạo dummy cho tất cả nhóm và giữ cả hằng số. Đây là hiện tượng dummy variable trap. Khi tổng các dummy luôn bằng 1, các biến có quan hệ tuyến tính hoàn hảo. Cách xử lý thông dụng là bỏ một dummy hoặc chạy mô hình không có hằng số khi có lý do phương pháp phù hợp.

Lỗi thứ ba là gọi dummy là biến định lượng rồi so sánh trung bình của mã 0 và 1 như thể khoảng cách giữa các mã có ý nghĩa đo lường. Mã 0 và 1 chỉ đại diện cho nhóm. Ý nghĩa chênh lệch xuất hiện trong mô hình so sánh nhóm, không phải vì khoảng cách số học giữa hai mã.

Lỗi thứ tư là đổi nhóm tham chiếu sau nhiều lần chạy nhưng không cập nhật bảng kết quả. Khi đó dấu hệ số có thể bị hiểu sai. Bạn nên lưu một bản ghi gồm tên biến, mã hóa, nhóm tham chiếu, số quan sát mỗi nhóm và phiên bản file đã chạy.

Cuối cùng, đừng xóa dummy chỉ vì Sig. lớn hơn 0.05. Hãy phân biệt giữa biến không có bằng chứng về tác động, biến cần giữ để kiểm soát, và biến được đưa vào sai vai trò. Nếu cần trình bày nhiều mô hình, hãy báo cáo thứ tự đưa biến và lý do ở chương kết quả.

Câu hỏi thường gặp

Dummy là gì trong SPSS?

Dummy trong SPSS là biến giả được mã hóa bằng các giá trị như 0 và 1 để đưa biến phân loại vào hồi quy hoặc mô hình định lượng. Ví dụ, giới tính có thể được mã hóa Nam = 0 và Nữ = 1.

Khi chạy hồi quy, SPSS đọc hệ số của dummy như chênh lệch giữa nhóm mã 1 và nhóm mã 0, trong điều kiện các biến khác được giữ cố định.

Biến dummy nên mã hóa 0 và 1 hay 1 và 2?

Bạn nên mã hóa 0 và 1 khi tạo dummy. Giá trị 0 thường đại diện cho nhóm tham chiếu, còn 1 đại diện cho nhóm được so sánh. Cách này giúp hệ số trong bảng Coefficients dễ diễn giải hơn.

Nếu dữ liệu gốc đang là 1 và 2, hãy tạo biến mới bằng Transform > Recode into Different Variables thay vì ghi đè dữ liệu gốc ngay lập tức.

Biến có ba nhóm tạo mấy dummy?

Biến có ba nhóm thường tạo hai dummy và giữ một nhóm làm tham chiếu. Chẳng hạn, với Bắc, Trung và Nam, bạn có thể tạo KV_TrungKV_Nam, còn Bắc được mã 0 ở cả hai biến.

Mỗi hệ số sẽ so sánh một nhóm với Bắc. Bạn cần ghi rõ nhóm tham chiếu trong bảng kết quả để người đọc không hiểu nhầm.

Dummy không có ý nghĩa thống kê thì có cần xóa không?

Chưa cần xóa ngay. Trước hết, kiểm tra mã hóa, tần số nhóm, nhóm tham chiếu và vai trò của dummy trong mô hình. Nếu đây là biến kiểm soát được xác định trước, bạn có thể giữ và báo cáo rằng tác động chưa có ý nghĩa thống kê.

Việc xóa biến chỉ vì muốn p-value đạt có thể làm giảm tính minh bạch của nghiên cứu. Hãy trao đổi tiêu chí giữ hoặc loại biến với người hướng dẫn trước khi chạy lại mô hình.

Dummy có phải moderator không?

Dummy không tự động là moderator. Dummy chỉ là cách mã hóa một biến phân loại. Nó trở thành một phần của phân tích moderator khi bạn tạo và kiểm định biến tương tác giữa dummy với biến độc lập.

Nếu đang nghiên cứu biến điều tiết, hãy phân biệt hệ số của dummy, hệ số của biến độc lập và hệ số tương tác. Bạn có thể xem thêm bài về moderating để đọc đúng cấu trúc này.

Bạn hãy mở lại file .sav, kiểm tra bảng tần số của biến phân loại, ghi rõ nhóm tham chiếu và tạo k - 1 dummy trước khi chạy lại Analyze > Regression > Linear; nếu cần chạy toàn bộ phân tích trên dữ liệu thật và kiểm tra cách diễn giải, xem M4 phân tích của DoThesis.