
Hệ số xác định là gì? Cách đọc R² trong SPSS
Hệ số xác định là gì
Bạn mở output SPSS, thấy bảng Model Summary có cột R Square và một con số như 0.462, nhưng chưa biết con số đó nói gì về mô hình. Hệ số xác định, thường ký hiệu là R², cho biết tỷ lệ biến thiên của biến phụ thuộc được giải thích bởi các biến độc lập trong mô hình hồi quy.
Cách hiểu ngắn gọn là: nếu R² = 0.462, mô hình giải thích được 46.2% sự biến thiên của biến phụ thuộc trong bộ dữ liệu đang phân tích. Phần còn lại, 53.8%, có thể đến từ các yếu tố chưa đưa vào mô hình, sai số đo lường, đặc điểm mẫu và biến động ngẫu nhiên.
Công thức thường được trình bày như sau:
R² = SSR / SST = 1 - SSE / SST
Trong đó, SSR là tổng bình phương phần hồi quy được mô hình giải thích, SST là tổng bình phương toàn bộ, còn SSE là tổng bình phương phần dư. Trong SPSS, bạn thường không cần tự tính công thức này. Chỉ cần nhìn vào cột R Square trong bảng Model Summary của hồi quy tuyến tính.
Hệ số xác định có giá trị từ 0 đến 1, hoặc có thể viết dưới dạng phần trăm từ 0% đến 100%. Chỉ số này không tự nó chứng minh quan hệ nhân quả và cũng không cho biết từng biến độc lập có ảnh hưởng có ý nghĩa thống kê hay không. Muốn kết luận từng giả thuyết, bạn còn phải xem bảng Coefficients, p-value và hệ số hồi quy.
Ý nghĩa của hệ số xác định trong nghiên cứu định lượng
R² trả lời một câu hỏi cụ thể: mô hình của bạn giải thích được bao nhiêu phần biến thiên của kết quả cần nghiên cứu. Ví dụ, đề tài xem xét tác động của chất lượng dịch vụ, giá trị cảm nhận và sự hài lòng đến ý định mua lại. Nếu R² của ý định mua lại là 0.58, ba biến trong mô hình giải thích 58% biến thiên của ý định mua lại trong mẫu khảo sát.
Bạn nên đọc R² cùng với câu hỏi nghiên cứu và bối cảnh ngành. Trong các nghiên cứu về hành vi người tiêu dùng, hành vi xã hội hoặc sự hài lòng, biến phụ thuộc thường chịu ảnh hưởng của nhiều yếu tố khó quan sát. Vì vậy, một R² không quá cao vẫn có thể cung cấp thông tin hữu ích nếu mô hình có cơ sở lý thuyết, thang đo phù hợp và các hệ số đường dẫn có ý nghĩa.
R² cũng giúp bạn so sánh mức độ giải thích giữa các biến phụ thuộc trong cùng một mô hình. Chẳng hạn, mô hình có R² của Sự hài lòng là 0.64 nhưng R² của Ý định giới thiệu là 0.31. Kết quả này gợi ý rằng các biến độc lập hiện tại giải thích sự hài lòng tốt hơn ý định giới thiệu. Bạn vẫn cần kiểm tra bối cảnh lý thuyết trước khi viết nhận xét, bởi hai biến phụ thuộc có thể vốn dĩ có mức độ khó giải thích khác nhau.
Hệ số xác định không thay thế cho kiểm định mô hình. Một R² cao có thể xuất hiện khi mô hình có quá nhiều biến độc lập, các biến có nội dung gần nhau hoặc mô hình bị overfitting. Khi chạy hồi quy, bạn nên xem thêm Adjusted R Square, F-test trong bảng ANOVA, hệ số VIF và các kiểm tra phần dư. Nếu đang phân tích mối liên hệ trước khi xây dựng hồi quy, bạn có thể xem thêm hướng dẫn về tương quan Pearson và ma trận tương quan là gì.
Hệ số xác định bao nhiêu là đạt
Câu hỏi “hệ số xác định bao nhiêu là tốt” không có một mốc chung áp dụng cho mọi luận văn. Một R² = 0.20 có thể thấp trong một số mô hình kỹ thuật nhưng vẫn có ý nghĩa trong nghiên cứu hành vi. Bạn cần báo cáo con số thực tế, giải thích theo lĩnh vực và tránh nâng R² bằng cách thêm biến chỉ để làm chỉ số đẹp hơn.
Trong PLS-SEM, các mức diễn giải thường được dùng cho R² là 0.75, 0.50 và 0.25, lần lượt theo cách gọi substantial, moderate và weak trong tài liệu của Hair và cộng sự. Đây là các mức tham khảo cho PLS-SEM, không phải quy tắc loại hoặc giữ mô hình hồi quy SPSS. (Hair và cộng sự, 2011) nêu các mức R² 0.75, 0.50 và 0.25 trong PLS-SEM.
| Mức R² tham khảo | Cách diễn giải trong PLS-SEM | Nguồn canonical |
|---|---|---|
| 0.75 trở lên | Mức giải thích substantial | (Hair và cộng sự, 2011) |
| 0.50 đến dưới 0.75 | Mức giải thích moderate | (Hair và cộng sự, 2011) |
| 0.25 đến dưới 0.50 | Mức giải thích weak | (Hair và cộng sự, 2011) |
| Dưới 0.25 | Khả năng giải thích thấp theo các mức tham khảo trên | (Hair và cộng sự, 2011) |
Bảng trên chỉ phù hợp khi bạn đang dùng logic đánh giá PLS-SEM. Với hồi quy tuyến tính trong SPSS, bạn không nên viết rằng R² dưới 0.50 là mô hình không đạt. Hãy xem thêm ý nghĩa của mô hình, p-value, kích thước mẫu, sai số chuẩn và mục tiêu nghiên cứu.
Nếu sử dụng SmartPLS, R² là một chỉ số của mô hình cấu trúc. Bạn có thể báo cáo R² cùng với path coefficient, t-value, p-value, VIF, f² và Q² khi các chỉ số này phù hợp với mô hình. (Hair và cộng sự, 2019) khuyến nghị trình bày kết quả PLS-SEM theo một quy trình gồm đánh giá mô hình đo lường và mô hình cấu trúc. Đừng đưa CFI, TLI hoặc RMSEA vào một bài giải thích R² của SmartPLS, vì các chỉ số đó thuộc nhóm CB-SEM.
Cách đọc hệ số xác định trên output
Tìm bảng Model Summary trong SPSS
Sau khi chạy hồi quy, vào Analyze > Regression > Linear. Đưa biến phụ thuộc vào ô Dependent, đưa các biến độc lập vào ô Independent(s), sau đó chọn Statistics và đánh dấu Estimates, Model fit, Collinearity diagnostics nếu cần. Trong output, tìm bảng Model Summary.
Cột R là tương quan bội giữa giá trị quan sát của biến phụ thuộc và giá trị dự đoán từ mô hình. Cột R Square là hệ số xác định. Cột Adjusted R Square là R² hiệu chỉnh, có tính đến số lượng biến độc lập và kích thước mẫu. Cột Std. Error of the Estimate là sai số chuẩn của ước lượng.
Đọc R Square và Adjusted R Square
Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột được giữ theo cách SPSS hiển thị trong bảng Model Summary.
| Model | R | R Square | Adjusted R Square | Std. Error of the Estimate |
|---|---|---|---|---|
| 1 | .681 | .464 | .452 | .587 |
Với dòng minh họa này, R Square = 0.464, tức mô hình giải thích 46.4% biến thiên của biến phụ thuộc. Adjusted R Square = 0.452 cho biết sau khi điều chỉnh theo số biến độc lập và cỡ mẫu, mức giải thích còn 45.2%.
Khoảng cách giữa R² và R² hiệu chỉnh trong ví dụ là 0.012, tương đối nhỏ. Bạn không nên tự đặt một ngưỡng cứng cho khoảng cách này. Hãy xem nó như tín hiệu để kiểm tra xem mô hình có đang đưa vào quá nhiều biến độc lập so với cỡ mẫu hay không.
Nếu chạy hồi quy bội, R² được tính cho toàn bộ nhóm biến độc lập trong mô hình. Muốn biết một biến riêng lẻ đóng góp thêm bao nhiêu khi được đưa vào sau các biến khác, bạn cần xem R Square Change trong bảng Model Summary khi chạy hồi quy theo từng block. R² không cho biết biến nào có tác động mạnh nhất. Thông tin đó thường được xem qua hệ số chuẩn hóa Beta, p-value và khoảng tin cậy trong bảng Coefficients.
Nếu bài của bạn dùng nhiều biến tiềm ẩn và SmartPLS, hãy mở phần kết quả mô hình cấu trúc để xem R² của từng biến nội sinh. Một biến độc lập không có R² vì nó không được mô hình giải thích bởi biến nào khác trong phương trình đó. Chỉ các biến nội sinh, tức biến được dự đoán, mới có R².
Khi hệ số xác định không đạt thì xử lý thế nào
Trước tiên, đừng xóa biến chỉ vì R² thấp. Làm vậy có thể khiến mô hình mất cơ sở lý thuyết và tạo ra một kết quả khó giải trình. Bạn nên xử lý theo thứ tự sau.
Kiểm tra lại cách nhập và mã hóa dữ liệu
Kiểm tra xem biến phụ thuộc có bị nhập ngược thang đo hay không, các biến reverse coded đã được đảo chiều chưa, và các giá trị thiếu có được xử lý đúng không. Một lỗi mã hóa có thể làm giảm tương quan giữa các biến và khiến R² thấp hơn thực tế của dữ liệu đã được chuẩn bị đúng.
Kiểm tra tương quan và đa cộng tuyến
Xem ma trận tương quan giữa các biến. Tương quan quá thấp có thể cho thấy biến độc lập không liên quan nhiều đến biến phụ thuộc trong mẫu. Tương quan quá cao giữa các biến độc lập lại có thể dẫn đến đa cộng tuyến, làm hệ số hồi quy không ổn định. Bạn có thể xem hướng dẫn phân tích tương quan Pearson trong SPSS trước khi diễn giải mô hình hồi quy.
Trong bảng Coefficients, kiểm tra Tolerance và VIF. (Hair và cộng sự, 2019) đề xuất VIF dưới 5 là một mốc tham khảo để đánh giá đa cộng tuyến trong PLS-SEM. Khi dùng hồi quy SPSS, bạn vẫn cần giải thích rõ phương pháp và nguồn tiêu chí mà khoa hoặc giảng viên yêu cầu.
Xem lại mô hình lý thuyết
Nếu R² thấp nhưng các biến có cơ sở lý thuyết, dữ liệu được làm sạch và một số giả thuyết vẫn có ý nghĩa, bạn có thể giữ mô hình và thảo luận giới hạn giải thích. R² thấp có thể phản ánh rằng biến phụ thuộc chịu ảnh hưởng của những yếu tố chưa được đưa vào nghiên cứu.
Bạn chỉ nên bổ sung biến khi có lập luận từ mô hình nghiên cứu và tài liệu, không thêm biến chỉ để tăng R². Sau mỗi thay đổi, hãy ghi lại mô hình, cỡ mẫu, biến được thêm hoặc loại và kết quả tương ứng. Hội đồng thường quan tâm đến logic ra quyết định hơn một con số R² được làm đẹp.
Kiểm tra outlier và giả định hồi quy
Một số quan sát bất thường có thể ảnh hưởng mạnh đến mô hình. Trong SPSS, bạn có thể xem phần dư chuẩn hóa, Cook's Distance và biểu đồ phần dư. Đồng thời kiểm tra tuyến tính, phân phối phần dư và phương sai không đổi. (Field, 2013) thường được dùng để tham khảo quy trình chẩn đoán và báo cáo hồi quy trong SPSS.
Nếu R² thấp vì dữ liệu thật sự có mức giải thích hạn chế, cách xử lý trung thực là báo cáo kết quả đó, nêu phạm vi của mô hình và không biến một kết quả không có ý nghĩa thành kết luận có tác động.
Phân biệt hệ số xác định với các chỉ số dễ nhầm
R² dễ bị nhầm với hệ số tương quan Pearson vì cả hai đều liên quan đến mức độ liên hệ giữa các biến. Trong hồi quy đơn, R² bằng bình phương của hệ số tương quan Pearson, nhưng trong hồi quy bội, R² phản ánh mức giải thích chung của toàn bộ tập biến độc lập.
Hệ số hồi quy B cho biết mức thay đổi dự kiến của biến phụ thuộc khi một biến độc lập tăng một đơn vị, trong điều kiện các biến khác được giữ cố định. Hệ số chuẩn hóa Beta giúp so sánh tương đối giữa các biến độc lập trong cùng mô hình. p-value cho biết bằng chứng thống kê cho một hệ số, còn R² nói về mức giải thích của toàn bộ mô hình.
Adjusted R Square không phải một mô hình khác. Đây là phiên bản R² có điều chỉnh theo số biến và cỡ mẫu, thường hữu ích hơn khi so sánh các mô hình có số lượng biến độc lập khác nhau. R Square Change là phần tăng thêm của R² khi bạn đưa một block biến mới vào mô hình.
Để kiểm tra mối liên hệ đơn giản giữa hai biến, bạn có thể tham khảo tương quan Spearman là gì. Spearman phù hợp với dữ liệu thứ bậc hoặc trường hợp giả định Pearson không phù hợp, nhưng hệ số Spearman bình phương không nên được bê nguyên sang cách diễn giải R² của hồi quy bội.
Lỗi thường gặp
Lỗi đầu tiên là viết “R² = 0.46 nên mô hình đạt” mà không nói mô hình giải thích 46% biến thiên của biến nào. Mỗi R² phải gắn với một biến phụ thuộc cụ thể và một mô hình cụ thể.
Lỗi thứ hai là dùng mốc 0.50 như điều kiện bắt buộc cho mọi nghiên cứu. Mốc diễn giải còn phụ thuộc vào lĩnh vực, loại mô hình và tài liệu phương pháp. Nếu dùng PLS-SEM, bạn có thể trình bày các mức tham khảo của (Hair và cộng sự, 2011). Nếu dùng hồi quy SPSS, hãy tránh gọi một mô hình là “không đạt” chỉ vì R² dưới 0.50.
Lỗi thứ ba là chỉ báo cáo R² mà bỏ qua Adjusted R Square, ANOVA và bảng Coefficients. Người đọc cần biết mô hình có ý nghĩa tổng thể hay không, biến nào có hệ số có ý nghĩa và các giả định chính có được kiểm tra hay chưa.
Lỗi thứ tư là nhầm R² với tỷ lệ tác động nhân quả. R² = 0.60 không có nghĩa một biến độc lập “tác động 60%” đến biến phụ thuộc. Nó chỉ mô tả phần biến thiên được mô hình giải thích trong mẫu và điều kiện phân tích hiện tại.
Cách viết vào luận văn: “Kết quả hồi quy cho thấy mô hình giải thích được [R² × 100]% sự biến thiên của [tên biến phụ thuộc], với R² = [giá trị] và Adjusted R² = [giá trị]. Phần biến thiên còn lại có thể liên quan đến các yếu tố chưa được đưa vào mô hình và sai số ngẫu nhiên. Kết luận về từng giả thuyết được dựa thêm trên hệ số hồi quy và p-value trong bảng Coefficients.”
Đọc thêm: chủ đề thong ke.
Câu hỏi thường gặp
Hệ số xác định R² có phải là phần trăm tác động không
Không. R² là tỷ lệ biến thiên của biến phụ thuộc được giải thích bởi toàn bộ mô hình. Nó không cho biết riêng từng biến độc lập tác động bao nhiêu phần trăm và cũng không tự chứng minh quan hệ nhân quả.
Hệ số xác định bao nhiêu là tốt
Không có một con số duy nhất cho mọi đề tài. Trong PLS-SEM, các mức 0.75, 0.50 và 0.25 thường được dùng làm mốc tham khảo theo (Hair và cộng sự, 2011). Với hồi quy SPSS, bạn cần xem lĩnh vực, cơ sở lý thuyết, p-value, cỡ mẫu và các kiểm tra giả định trước khi đánh giá.
Hệ số xác định trong SPSS nằm ở bảng nào
Bạn tìm bảng Model Summary trong output hồi quy. Cột R Square là hệ số xác định, còn Adjusted R Square là hệ số xác định hiệu chỉnh. Nếu chạy hồi quy theo block, phần thay đổi của R² có thể xuất hiện ở cột R Square Change.
R² thấp có phải loại mô hình ngay không
R² thấp chưa đủ để loại mô hình. Bạn cần kiểm tra mã hóa dữ liệu, thang đo, tương quan, đa cộng tuyến, outlier, giả định hồi quy và cơ sở lý thuyết. Nếu dữ liệu cho thấy khả năng giải thích hạn chế, hãy báo cáo đúng kết quả và nêu giới hạn thay vì chỉnh mô hình chỉ để tăng R².
R² và Adjusted R² nên báo cáo chỉ số nào
Bạn nên báo cáo cả hai khi trình bày hồi quy bội. R² giúp người đọc thấy mức giải thích trực tiếp của mô hình, còn Adjusted R² giúp đánh giá mức giải thích sau khi tính đến số biến độc lập và cỡ mẫu. Khi diễn giải, hãy ghi rõ mỗi chỉ số thuộc về biến phụ thuộc nào.
Mở file .sav của bạn, tìm bảng Model Summary, ghi lại R Square, Adjusted R Square, sau đó đối chiếu với bảng ANOVA và Coefficients trước khi viết nhận xét. Nếu cần chạy phân tích trên chính dữ liệu của bạn bằng SPSS hoặc SmartPLS, bạn có thể dùng module M4 phân tích dữ liệu của DoThesis.