Residuals là gì? Cách đọc phần dư trong hồi quy SPSS

Thống kê··14 phút đọc

Residuals là gì

Bạn chạy hồi quy tuyến tính trong SPSS, mở bảng Residuals Statistics hoặc biểu đồ Normal P-P Plot of Regression Standardized Residual, rồi thấy các cột residuals, standardized residual và studentized residual. Residuals, hay phần dư, là phần chênh lệch giữa giá trị thực tế của biến phụ thuộc và giá trị mà mô hình hồi quy dự đoán.

Công thức cơ bản là:

Residual = Giá trị quan sát thực tế - Giá trị dự đoán

Nếu ký hiệu giá trị quan sát là Y, giá trị dự đoán là Ŷ, phần dư của một quan sát là e = Y - Ŷ. Residual dương nghĩa là mô hình dự đoán thấp hơn giá trị thực tế. Residual âm nghĩa là mô hình dự đoán cao hơn giá trị thực tế. Residual bằng 0 nghĩa là dự đoán trùng với quan sát đó.

Residuals không phải là một biến độc lập mới để bạn đưa tùy ý vào mô hình. Đây là thông tin dùng để kiểm tra xem mô hình hồi quy có phù hợp với dữ liệu hay đang vi phạm các giả định như phân phối gần chuẩn, phương sai không đổi và quan sát bất thường. Bạn có thể xem thêm các chủ đề liên quan trong chuyên mục Thống kê nếu đang xử lý nhiều bảng output cùng lúc.

Ý nghĩa của residuals trong nghiên cứu định lượng

Trong hồi quy tuyến tính, mô hình chỉ giải thích được một phần biến thiên của biến phụ thuộc. Phần còn lại nằm trong sai số và được phản ánh qua residuals. Vì vậy, residuals giúp bạn trả lời một câu hỏi thực tế: sai số dự đoán của mô hình có phân bố hợp lý hay đang có quy luật bất thường.

Nếu residuals phân tán ngẫu nhiên quanh đường 0, không tạo thành hình phễu, đường cong hoặc cụm riêng biệt, mô hình thường có biểu hiện phù hợp hơn với giả định tuyến tính và phương sai không đổi. Bạn vẫn cần xem các kiểm định và biểu đồ liên quan, không nên kết luận chỉ từ một điểm residual riêng lẻ.

Residuals còn giúp phát hiện những quan sát có ảnh hưởng lớn đến mô hình. Một dòng dữ liệu có residual rất lớn có thể là outlier theo biến phụ thuộc, nhập sai dữ liệu, hoặc là một trường hợp hợp lệ nhưng khác biệt với phần lớn mẫu. Vì thế, khi thấy residual bất thường, bạn cần quay lại mã người trả lời và dữ liệu gốc. Hướng dẫn xử lý cần phân biệt với việc tìm outliers, vì outlier không phải lúc nào cũng được phép xóa.

Trong SPSS, residuals thường được dùng khi kiểm tra hồi quy, còn SmartPLS có cách đánh giá mô hình và chỉ số riêng. Bạn không nên lấy một ngưỡng của PLS-SEM áp vào output hồi quy OLS trong SPSS. Cũng cần tách residuals khỏi các khái niệm như mediator hoặc moderator. Bạn có thể xem cách phân biệt tại bài về mediatormoderator.

Residuals bao nhiêu là đạt

Residuals không có một ngưỡng tuyệt đối giống Cronbach's Alpha. Một residual bằng 12 có thể lớn hoặc nhỏ tùy thang đo, đơn vị đo và độ phân tán của biến phụ thuộc. Vì vậy, khi đánh giá, bạn thường xem standardized residual, biểu đồ và các thống kê chẩn đoán cùng nhau.

Bảng dưới đây là các mốc thường dùng trong thực hành hồi quy. Mỗi mốc cần được đọc trong đúng bối cảnh, không dùng như lý do tự động xóa dữ liệu.

Nội dung kiểm traCách đọc hoặc mốc tham khảoNguồn
Residual thôSo sánh với đơn vị đo và phạm vi của biến phụ thuộc, không có một ngưỡng chungKhông gán ngưỡng số khi chưa biết thang đo
Standardized residualQuan sát điểm có trị tuyệt đối lớn, thường xem khoảng ±3 là dấu hiệu cần kiểm tra thêmKhông có ngưỡng trong danh mục nguồn được phép
Phân phối phần dưHistogram và Normal P-P Plot nên không lệch bất thường khỏi dạng kỳ vọng(Field, 2013)
Phương sai phần dưScatterplot giữa ZPREDZRESID nên phân tán ngẫu nhiên, không tạo hình phễu(Field, 2013)
Durbin-WatsonGiá trị nằm trong khoảng từ 1 đến 3 thường được dùng để xem xét độc lập của phần dư(Field, 2013)
Điểm có ảnh hưởng mạnhCần kiểm tra thêm leverage, Cook's Distance và hồ sơ dữ liệu, không kết luận chỉ từ residual(Field, 2013)

Mốc ±3 trong bảng được dùng như dấu hiệu sàng lọc thực hành, không phải quy tắc đủ để loại quan sát. Danh mục nguồn được phép không đưa ra một ngưỡng standardized residual duy nhất. Khi viết luận văn, bạn nên nói rõ mình dùng chỉ số nào, kiểm tra bằng bảng hoặc biểu đồ nào và xử lý quan sát ra sao.

Với kiểm tra phân phối, biểu đồ gần chuẩn không có nghĩa mọi điểm phải nằm chính xác trên đường chéo. Dữ liệu khảo sát thực tế thường có mức lệch nhất định. Bạn cần xem xu hướng tổng thể, kích thước mẫu và các chẩn đoán khác trước khi yêu cầu dữ liệu phải hoàn hảo.

Cách đọc residuals trên output

Bạn có thể tạo residuals trong SPSS ngay khi chạy hồi quy. Mở Analyze > Regression > Linear, đưa biến phụ thuộc vào ô Dependent và các biến độc lập vào ô Independent(s). Sau đó chọn Save, đánh dấu Unstandardized hoặc Standardized trong nhóm Residuals, rồi chọn ContinueOK.

SPSS sẽ thêm biến mới vào cuối bảng dữ liệu, thường có tên như RES_1, ZRE_1, SRE_1 tùy lựa chọn và phiên bản. Bạn nên đổi tên hoặc ghi chú rõ biến nào là residual thô, biến nào là standardized residual, tránh nhầm với biến khảo sát ban đầu.

Để kiểm tra histogram, trong hộp thoại hồi quy chọn Plots. Đưa *ZPRED vào trục X và *ZRESID vào trục Y, sau đó chọn HistogramNormal probability plot nếu cần. SPSS sẽ tạo scatterplot của standardized predicted values và standardized residuals, cùng với biểu đồ phân phối.

Số liệu minh họa

Bảng sau mô phỏng dạng kết quả bạn có thể gặp. Đây là số liệu minh họa, không phải kết quả của một nghiên cứu cụ thể.

Case NumberPredicted ValueResidualStd. Predicted ValueStd. ResidualStudentized Deleted Residual
123.420.18-0.310.220.23
273.05-0.74-0.88-0.91-0.96
464.110.630.760.770.80
832.66-2.41-1.44-2.58-2.72
1193.870.090.420.110.11

Predicted Value là giá trị biến phụ thuộc do mô hình dự đoán. Residual là chênh lệch ở đơn vị gốc. Std. Residual đã được chuẩn hóa để các quan sát dễ so sánh hơn. Studentized Deleted Residual được tính theo cách loại quan sát đó khi đánh giá phần dư, nên có thể khác Std. Residual.

Trong bảng minh họa, Case Number 83 có Std. Residual = -2.58. Đây là điểm cần kiểm tra thêm, nhưng chưa đủ căn cứ để xóa. Bạn mở lại dòng dữ liệu, kiểm tra câu trả lời có bị nhập sai, có thiếu dữ liệu hay có vi phạm điều kiện sàng lọc không. Nếu đây là một người trả lời hợp lệ, bạn cần cân nhắc việc giữ lại và báo cáo cách kiểm tra.

Trong Residuals Statistics, hãy xem các cột Minimum, Maximum, MeanStd. Deviation cho residual. Với standardized residual, trung bình thường kỳ vọng ở gần 0. Nếu histogram và P-P Plot lệch mạnh, bạn cần xem lại toàn bộ mô hình thay vì chỉ nhìn một con số.

Khi residuals không đạt thì xử lý thế nào

Thứ tự xử lý nên bắt đầu từ dữ liệu và mô hình, sau đó mới cân nhắc biến đổi hoặc loại quan sát. Đây là cách giảm rủi ro bị hỏi tại sao bạn xóa một dòng dữ liệu chỉ vì nó làm bảng đẹp hơn.

Kiểm tra lỗi nhập và mã hóa

Mở dòng có residual lớn trong Data View, đối chiếu với bảng hỏi gốc và file thu thập. Kiểm tra các giá trị ngoài phạm vi Likert, biến đảo chiều chưa được mã hóa, mã thiếu dữ liệu và trường hợp nhập nhầm dấu thập phân. Nếu phát hiện lỗi rõ ràng, sửa từ dữ liệu gốc, lưu phiên bản trước và sau khi sửa, rồi chạy lại mô hình.

Kiểm tra điều kiện của mẫu

Xem người trả lời có đáp ứng câu hỏi sàng lọc và tiêu chí chọn mẫu không. Một bản trả lời không thuộc đối tượng nghiên cứu có thể cần loại theo tiêu chí đã nêu trong phương pháp, nhưng lý do phải là điều kiện nghiên cứu, không phải vì residual lớn.

Kiểm tra dạng mô hình

Residual có dạng cong hoặc tạo cụm có thể cho thấy quan hệ giữa biến độc lập và biến phụ thuộc không phù hợp với đường thẳng, thiếu biến quan trọng, hoặc có tương tác chưa được xem xét. Khi có cơ sở lý thuyết, bạn mới cân nhắc thêm biến, biến đổi hoặc mô hình khác. Không thêm biến chỉ để làm residual giảm.

Chạy lại sau khi có lý do hợp lệ

Nếu loại một quan sát, ghi rõ mã dòng, lý do, tiêu chí và kết quả trước, sau khi xử lý. Bạn có thể báo cáo phân tích độ nhạy nếu việc loại quan sát làm thay đổi đáng kể hệ số hoặc kết luận. Một hội đồng thường quan tâm quy trình có thể kiểm tra lại hơn là một bảng kết quả hoàn toàn đẹp.

Nếu nhiều residual cùng tạo hình phễu, hãy kiểm tra phương sai không đổi và cách đo biến. Có thể xem xét dạng biến đổi phù hợp, robust standard errors hoặc một phương pháp khác nếu mục tiêu và giả định cho phép. SPSS, JASP và R có các cách chẩn đoán khác nhau. Việc đổi phần mềm không tự sửa được vấn đề dữ liệu.

Phân biệt residuals với standardized residual

Residual thô giữ nguyên đơn vị của biến phụ thuộc. Nếu biến phụ thuộc được đo bằng điểm trung bình từ 1 đến 5, residual thô cũng ở đơn vị điểm đó. Chỉ số này dễ hiểu khi bạn muốn biết mô hình lệch bao nhiêu điểm so với giá trị thực tế.

Standardized residual là residual đã đưa về thang đo chuẩn hóa, thường có trung bình gần 0 và độ lệch chuẩn gần 1. Nó hữu ích khi so sánh mức độ bất thường tương đối giữa các quan sát. Tuy nhiên, standardized residual vẫn chỉ là một dấu hiệu chẩn đoán, không phải kết luận tự động về outlier.

Studentized residual dùng một cách ước lượng khác, thường nhằm phản ánh tốt hơn ảnh hưởng của từng quan sát đến sai số. Trong output, tên cột có thể thay đổi theo thủ tục và lựa chọn lưu biến. Bạn cần đọc đúng tên cột SPSS thay vì gọi tất cả là residual chuẩn hóa.

Residual plot cũng dễ bị hiểu nhầm. Đây là biểu đồ thể hiện residual theo predicted value hoặc theo một biến giải thích. Nó không phải một chỉ số duy nhất. Khi đọc scatterplot ZPREDZRESID, bạn tìm hình dạng phân tán, đường cong, phễu và cụm điểm. Một biểu đồ có vài điểm xa trung tâm chưa đủ để kết luận mô hình sai.

Residuals cũng khác với . cho biết tỷ lệ biến thiên của biến phụ thuộc được mô hình giải thích, còn residuals cho thấy sai số ở từng quan sát và hình dạng tổng thể của sai số. Một mô hình có khá vẫn có thể có vấn đề về phương sai hoặc vài quan sát ảnh hưởng mạnh.

Lỗi thường gặp

Lỗi đầu tiên là viết “residual phải bằng 0”. Trong dữ liệu khảo sát, mô hình hồi quy hiếm khi dự đoán đúng từng quan sát. Bạn cần đánh giá phân bố và quy luật của residual, không yêu cầu mọi phần dư biến mất.

Lỗi thứ hai là lấy residual thô để so sánh giữa các biến phụ thuộc có thang đo khác nhau. Hãy dùng standardized residual khi mục tiêu là so sánh tương đối, đồng thời ghi rõ chỉ số đã dùng.

Lỗi thứ ba là xóa ngay các dòng có residual lớn. Hành động này làm thay đổi dữ liệu và có thể tạo ra kết luận thiên lệch. Trước khi xóa, phải có lý do từ tiêu chí mẫu, lỗi nhập liệu hoặc bằng chứng chẩn đoán đầy đủ.

Lỗi thứ tư là chỉ nhìn bảng Coefficients rồi bỏ qua biểu đồ phần dư. Hệ số và p-value trả lời câu hỏi về quan hệ giữa các biến, còn residual giúp kiểm tra độ phù hợp của các giả định hồi quy.

Lỗi thứ năm là ghi ngưỡng không có nguồn. Nếu bạn nêu mốc Durbin-Watson từ 1 đến 3, hãy ghi (Field, 2013). Nếu bạn sử dụng một ngưỡng standardized residual khác, cần kiểm tra tài liệu phương pháp mà trường hoặc giảng viên yêu cầu, thay vì gắn một trích dẫn không phù hợp.

Một cách viết có thể điều chỉnh trong luận văn là: “Kết quả kiểm tra phần dư cho thấy các standardized residual phân tán quanh giá trị 0, biểu đồ Normal P-P Plot of Regression Standardized Residual không cho thấy độ lệch nghiêm trọng, và scatterplot giữa ZPREDZRESID không hình thành quy luật rõ rệt. Do đó, giả định về phần dư của mô hình [tên mô hình] được xem xét là phù hợp ở mức chấp nhận được.” Bạn thay phần trong ngoặc bằng đúng tên mô hình và mô tả từ output của mình.

Câu hỏi thường gặp

Residuals là gì trong hồi quy SPSS?

Residuals là phần chênh lệch giữa giá trị thực tế của biến phụ thuộc và giá trị dự đoán từ mô hình. Trong SPSS, bạn có thể lưu residual thô hoặc standardized residual qua nút Save trong hộp thoại Analyze > Regression > Linear.

Residuals bao nhiêu là đạt?

Residual thô không có một ngưỡng chung vì còn phụ thuộc vào đơn vị đo. Bạn nên xem standardized residual, histogram, Normal P-P Plot, scatterplot ZPREDZRESID, cùng các chẩn đoán khác. Mốc bất thường chỉ giúp sàng lọc, không quyết định tự động việc xóa dữ liệu.

Standardized residual có phải outlier không?

Một standardized residual lớn là dấu hiệu cần kiểm tra, chưa đồng nghĩa với outlier phải loại bỏ. Bạn cần đối chiếu dòng dữ liệu, tiêu chí mẫu, lỗi nhập và ảnh hưởng của quan sát đến mô hình. Nếu giữ lại, hãy ghi nhận cách bạn đã kiểm tra.

Residual plot là gì?

Residual plot là biểu đồ thể hiện phần dư theo giá trị dự đoán hoặc một biến liên quan. Trong hồi quy SPSS, scatterplot giữa ZPREDZRESID được dùng để xem phần dư có phân tán ngẫu nhiên hay tạo hình phễu, đường cong hoặc cụm.

Residuals không đạt thì phải làm sao?

Bạn kiểm tra dữ liệu gốc trước, sau đó xem lại mã hóa, điều kiện mẫu và dạng mô hình. Chỉ loại quan sát khi có lý do phương pháp rõ ràng, lưu lại các phiên bản dữ liệu và báo cáo tác động của việc xử lý. Đổi phần mềm không thay thế cho việc kiểm tra nguyên nhân.

Mở file .sav của bạn ngay bây giờ, chạy lại Analyze > Regression > Linear, lưu ZRESIDZPRED, rồi đối chiếu từng điểm bất thường với dòng dữ liệu gốc. Nếu cần chạy phân tích trên chính file của bạn và ghi lại quy trình xử lý, bạn có thể dùng M4 phân tích dữ liệu.