Chuẩn hóa là gì? Phân biệt hệ số Beta chuẩn hóa và chưa chuẩn hóa

Thống kê··9 phút đọc

Chuẩn hóa là gì

Trong phân tích định lượng, chuẩn hóa là việc đưa các biến về cùng một thang đo để có thể so sánh chúng công bằng hơn. Với cách chuẩn hóa phổ biến bằng z-score, mỗi giá trị được trừ đi giá trị trung bình rồi chia cho độ lệch chuẩn:

Z = (X - X̄) / SD

Sau khi chuẩn hóa, biến thường có giá trị trung bình bằng 0 và độ lệch chuẩn bằng 1. Giá trị dương cho biết quan sát nằm trên mức trung bình, còn giá trị âm cho biết quan sát nằm dưới mức trung bình.

Khi bạn chạy hồi quy tuyến tính trong SPSS, từ “chuẩn hóa” thường xuất hiện trong hai ngữ cảnh. Thứ nhất là chuẩn hóa dữ liệu trước khi phân tích. Thứ hai là Standardized Coefficients Beta, tức hệ số hồi quy chuẩn hóa trong bảng Coefficients. Hai việc này liên quan với nhau nhưng không nên đồng nhất hoàn toàn.

Trong hồi quy, SPSS có thể báo cả B, thuộc nhóm Unstandardized Coefficients, và Beta, thuộc nhóm Standardized Coefficients. Hệ số B cho biết biến phụ thuộc thay đổi bao nhiêu đơn vị khi biến độc lập tăng một đơn vị, trong điều kiện các biến khác giữ nguyên. Hệ số Beta cho biết biến phụ thuộc thay đổi bao nhiêu độ lệch chuẩn khi biến độc lập tăng một độ lệch chuẩn.

Bạn có thể xem thêm các chủ đề về thống kê trong nghiên cứu định lượng nếu đang xử lý đồng thời Cronbach's Alpha, EFA và hồi quy trên cùng một bộ dữ liệu.

Ý nghĩa của chuẩn hóa trong nghiên cứu định lượng

Chuẩn hóa có ích nhất khi các biến độc lập đang được đo bằng những đơn vị khác nhau. Ví dụ, một mô hình có thể dùng thu nhập tính bằng triệu đồng, tuổi tính bằng năm và điểm cảm nhận đo bằng thang Likert từ 1 đến 5. So sánh trực tiếp các hệ số B trong trường hợp này dễ dẫn đến diễn giải sai, vì một đơn vị của mỗi biến có ý nghĩa rất khác nhau.

Hệ số Beta giải quyết phần nào vấn đề đó. Nếu biến A có Beta bằng 0,42 và biến B có Beta bằng 0,18, bạn có thể nói A có mức ảnh hưởng tương đối lớn hơn B trong mô hình, với điều kiện hai biến được đo và đưa vào cùng một mô hình hợp lý. Bạn không nên biến kết quả này thành kết luận rằng A “tăng 42%” kết quả, vì Beta không phải phần trăm tăng trưởng.

Dấu của hệ số cũng quan trọng. Beta dương cho thấy mối quan hệ cùng chiều trong mô hình. Beta âm cho thấy mối quan hệ ngược chiều. Tuy nhiên, chỉ nhìn dấu là chưa đủ. Bạn cần kiểm tra thêm Sig., khoảng tin cậy nếu có báo cáo, đa cộng tuyến và cách xây dựng giả thuyết.

Chuẩn hóa cũng xuất hiện trong các phân tích khác. Trong scale là gì, bạn sẽ gặp các biến quan sát được đo bằng cùng một thang Likert, nhưng việc các item cùng có thang 1 đến 5 không đồng nghĩa với việc mọi biến trong mô hình có cùng độ phân tán. Trong một số quy trình, dữ liệu còn cần được kiểm tra missing value, outlier và phân phối trước khi chạy mô hình. Nếu bạn đang nghi ngờ có giá trị quá khác biệt, hãy kiểm tra outliers trong dữ liệu trước khi quyết định xử lý.

Điểm cần nhớ là chuẩn hóa không tự động làm cho mô hình tốt hơn. Nó chủ yếu làm thay đổi đơn vị đo và cách diễn giải hệ số. R², mức ý nghĩa và nhiều kết quả kiểm định không nên được kết luận chỉ vì bạn đã chuẩn hóa biến.

Chuẩn hóa bao nhiêu là đạt

“Chuẩn hóa bao nhiêu là đạt” thường là câu hỏi bị đặt sai. Với z-score, không có một ngưỡng duy nhất mà mọi giá trị chuẩn hóa phải vượt qua. Một z-score bằng 0,3 hay âm 1,2 không phải là đạt hoặc không đạt theo cách đánh giá thang đo. Bạn cần phân biệt chuẩn hóa biến với các tiêu chí đánh giá mô hình.

Bảng dưới đây tóm tắt những con số thường xuất hiện khi đọc hồi quy và các phân tích liên quan. Các ngưỡng không thay thế cho lập luận phương pháp trong luận văn.

Chỉ số hoặc tiêu chíMức tham khảoCách hiểuNguồn
Hệ số Beta chuẩn hóaKhông có ngưỡng đạt chungDùng để so sánh mức ảnh hưởng tương đối giữa các biến trong cùng mô hình(Field, 2013)
Durbin-WatsonTừ 1 đến 3Khoảng tham khảo để xem xét tự tương quan phần dư trong hồi quy(Field, 2013)
VIFDưới 5Mức đa cộng tuyến cần kiểm tra trong mô hình PLS-SEM và có thể tham khảo khi báo cáo hồi quy(Hair và cộng sự, 2019)
Cronbach's AlphaTừ 0,7 trở lênĐộ tin cậy thường được xem là chấp nhận được(Nunnally, 1978)
Corrected Item-Total CorrelationTừ 0,3 trở lênMức tương quan biến tổng hiệu chỉnh thường được dùng khi sàng lọc biến quan sát(Nunnally và Bernstein, 1994)
Cỡ mẫu hồi quyTừ 50 + 8m trở lênm là số biến độc lập trong mô hình(Tabachnick và Fidell, 2013)

Bạn không nên viết “Beta từ 0,3 trở lên là đạt” nếu không có quy định riêng từ đề tài hoặc giảng viên. Một Beta bằng 0,12 vẫn có thể có ý nghĩa thống kê và có ý nghĩa lý thuyết, trong khi Beta bằng 0,60 có thể không đáng tin nếu mô hình gặp đa cộng tuyến nghiêm trọng hoặc biến đo lường không tốt.

Nếu đang làm PLS-SEM, các tiêu chí như outer loading, CR, AVE, HTMT, thuộc những nhóm đánh giá khác. Chẳng hạn, trong PLS-SEM có các mức tham khảo 0,75, 0,50 và 0,25 theo (Hair và cộng sự, 2011). Không nên lấy ngưỡng đó để đánh giá trực tiếp hệ số Beta trong hồi quy SPSS.

Cách đọc chuẩn hóa trên output

Bạn mở SPSS, chọn Analyze > Regression > Linear, đưa biến phụ thuộc vào ô Dependent và các biến độc lập vào ô Independent(s). Trong hộp thoại, bạn có thể chọn Statistics để bật Estimates, Model fit, Collinearity diagnosticsDurbin-Watson nếu phù hợp với thiết kế phân tích. Sau khi bấm OK, SPSS thường tạo các bảng Model Summary, ANOVACoefficients.

Bảng quan trọng để đọc Beta là Coefficients. Bạn tìm hai nhóm cột là Unstandardized CoefficientsStandardized Coefficients. Trong nhóm đầu có BStd. Error. Trong nhóm sau có Beta. Cột tSig. nằm tiếp theo để kiểm tra ý nghĩa của từng biến độc lập.

Số liệu minh họa

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Giả sử biến phụ thuộc là YD, còn ba biến độc lập là CL, GCDV.

BiếnBStd. ErrorBetatSig.VIF
(Constant)0,8420,2713,1070,002
CL0,3650,0810,4014,5060,0001,842
GC0,1420,0670,1762,1190,0361,563
DV-0,0980,044-0,129-2,2270,0272,104

Cách đọc dòng CL như sau. Khi CL tăng một đơn vị, YD tăng trung bình 0,365 đơn vị, nếu các biến khác không đổi. Đây là cách diễn giải hệ số B. Nếu so sánh tương đối, Beta của CL bằng 0,401, lớn hơn Beta của GC bằng 0,176 và trị tuyệt đối Beta của DV bằng 0,129. Trong ví dụ minh họa, CL có mức ảnh hưởng tương đối lớn nhất trong ba biến.

Cột Sig. của CL bằng 0,000 theo cách SPSS hiển thị. Khi viết luận văn, bạn nên ghi p < 0,001 thay vì diễn đạt rằng xác suất bằng 0 tuyệt đối. Với mức ý nghĩa 5%, dòng GC cũng có ý nghĩa vì Sig. bằng 0,036. Dòng DV có quan hệ ngược chiều và có ý nghĩa ở mức 5% trong số liệu minh họa.

VIF là thông tin chẩn đoán đa cộng tuyến, không phải hệ số chuẩn hóa. Bạn cần đọc nó cùng với mục tiêu phân tích và các chẩn đoán khác. Việc một Beta lớn không tự động chứng minh giả thuyết được chấp nhận. Kết luận giả thuyết còn phụ thuộc vào chiều tác động kỳ vọng, p-value và mô hình lý thuyết.

Cách viết vào luận văn

Bạn có thể điều chỉnh câu sau theo đúng số liệu trong bảng Coefficients: “Kết quả hồi quy cho thấy biến [TÊN BIẾN] tác động [cùng chiều/ngược chiều] đến [BIẾN PHỤ THUỘC] với hệ số Beta chuẩn hóa bằng [BETA], giá trị Sig. bằng [SIG], do đó giả thuyết [H] [được chấp nhận/không được chấp nhận] ở mức ý nghĩa [MỨC Ý NGHĨA].”

Khi muốn so sánh các biến, viết rõ “xét về mức ảnh hưởng tương đối trong mô hình” thay vì viết “tác động mạnh gấp [x] lần”. Beta của hai biến chỉ nên được so sánh khi chúng cùng nằm trong một mô hình và cách mã hóa, hướng đo lường đã được kiểm tra.

Khi chuẩn hóa không đạt thì xử lý thế nào

Trước tiên, hãy xác định bạn đang nói đến điều gì. Nếu bạn thấy giá trị z-score rất lớn hoặc rất nhỏ, đó có thể là dấu hiệu của outlier, nhưng không có nghĩa cứ vượt một con số nào đó là phải xóa ngay. Hãy xem lại bản ghi gốc, phạm vi hợp lệ của bảng hỏi và cách nhập dữ liệu.

Nếu SPSS không chạy được hồi quy, kiểm tra lần lượt kiểu dữ liệu, missing value, biến có phương sai bằng 0 và tên biến. Biến dạng chữ hoặc cột chứa cả số lẫn ký tự có thể khiến quy trình không hoạt động như bạn dự kiến. Bạn cũng cần xem các item đảo chiều đã được recode đúng chưa trước khi tính biến tổng hợp.

Nếu Beta không có ý nghĩa thống kê, đừng chuẩn hóa lại nhiều lần để tìm một kết quả đẹp hơn. Hãy kiểm tra giả thuyết, tương quan giữa các biến, VIF, kích thước mẫu và độ tin cậy của thang đo. Việc loại biến chỉ vì muốn Beta tăng là khó giải trình với giảng viên. Chỉ loại khi có lý do phương pháp rõ ràng, chẳng hạn biến nhập sai, không phù hợp với khái niệm hoặc vi phạm tiêu chí đã đặt trước.

Nếu các biến độc lập tương quan quá cao, bạn có thể xem xét vấn đề đa cộng tuyến và cách xây dựng mô hình. Không nên gộp hoặc xóa biến chỉ dựa trên một con số mà không đối chiếu với cơ sở lý thuyết. Nếu mô hình của bạn có moderator hoặc moderating, việc tạo biến tương tác và chuẩn hóa cần được trình bày riêng, vì cách diễn giải sẽ khác hồi quy trực tiếp.

Có trường hợp bạn không cần chuẩn hóa thủ công. Khi mục tiêu chỉ là so sánh Beta chuẩn hóa, SPSS đã cung cấp cột Beta trong bảng Coefficients. Chuẩn hóa thủ công thường hữu ích khi bạn cần tạo biến z-score để vẽ biểu đồ, tạo biến tương tác hoặc thực hiện một quy trình yêu cầu các biến cùng đơn vị.

Phân biệt chuẩn hóa với hệ số chưa chuẩn hóa

Hệ số chưa chuẩn hóa là B. Nó giữ nguyên đơn vị đo của biến. Nếu biến độc lập là điểm trung bình thang đo từ 1 đến 5, còn biến phụ thuộc cũng là điểm trung bình từ 1 đến 5, B cho biết khi điểm độc lập tăng một điểm trên thang đo thì điểm phụ thuộc thay đổi bao nhiêu điểm, trong điều kiện các biến khác giữ nguyên.

Hệ số chuẩn hóa là Beta. Nó chuyển cách diễn giải sang độ lệch chuẩn, nhờ đó phù hợp hơn khi bạn muốn so sánh mức ảnh hưởng tương đối giữa các biến có đơn vị khác nhau. Beta không dùng để thay thế hoàn toàn B. Trong nhiều luận văn, nên báo cáo cả hai để người đọc hiểu vừa mức thay đổi theo đơn vị gốc, vừa vị trí tương đối của biến trong mô hình.

Điểm so sánhB chưa chuẩn hóaBeta chuẩn hóa
Đơn vịGiữ đơn vị gốcĐộ lệch chuẩn
Cách diễn giảiX tăng 1 đơn vị thì Y thay đổi B đơn vịX tăng 1 độ lệch chuẩn thì Y thay đổi Beta độ lệch chuẩn
Dùng để so sánh mức ảnh hưởng giữa biếnHạn chế khi đơn vị đo khác nhauPhù hợp hơn trong cùng mô hình
Vị trí trên output SPSSUnstandardized Coefficients, cột BStandardized Coefficients, cột Beta
Có phải phần trăm khôngKhôngKhông

Ví dụ, nếu B của CL là 0,365, bạn không được viết “CL làm YD tăng 36,5%”. Cách viết đúng phải gắn với đơn vị của thang đo. Nếu Beta bằng 0,401, bạn cũng không được viết “CL giải thích 40,1% YD”. Tỷ lệ phương sai được giải thích ở cấp độ mô hình thường liên quan đến R Square trong Model Summary, không phải Beta của một biến riêng lẻ.

Nếu mô hình của bạn kiểm tra biến trung gian, cách đọc hệ số còn phụ thuộc vào từng phương trình và hiệu ứng gián tiếp. Bạn có thể xem thêm mediator để tránh trộn lẫn Beta của đường dẫn trực tiếp với tác động gián tiếp.

Lỗi thường gặp

Lỗi đầu tiên là nghĩ mọi biến đều phải được chuẩn hóa thủ công trước khi chạy hồi quy. Với hồi quy tuyến tính thông thường, SPSS tự báo Beta chuẩn hóa trong Coefficients. Bạn chỉ cần chuẩn hóa trước nếu có lý do phân tích cụ thể và phải ghi lại cách thực hiện.

Lỗi thứ hai là dùng Beta để nói về phần trăm. Beta 0,28 không có nghĩa biến độc lập làm biến phụ thuộc tăng 28%. Đây là cách diễn giải sai rất dễ xuất hiện khi bạn đọc nhanh bảng output.

Lỗi thứ ba là xếp hạng Beta mà bỏ qua dấu âm. Khi so sánh mức độ, có thể xem trị tuyệt đối của Beta, nhưng khi giải thích hướng tác động phải giữ dấu. Beta -0,35 và Beta 0,35 có độ lớn tương đối bằng nhau nhưng quan hệ theo hai hướng trái ngược.

Lỗi thứ tư là chỉ nhìn Sig. mà không xem B hoặc Beta. Một biến có p-value nhỏ cho biết bằng chứng thống kê về mối quan hệ trong mô hình, nhưng chưa cho bạn biết hướng và mức ảnh hưởng tương đối. Ngược lại, một Beta lớn nhưng p-value không đạt cũng không nên được trình bày như một tác động đã được xác nhận.

Lỗi cuối là chuẩn hóa sau khi đã thấy kết quả không như kỳ vọng rồi chạy lại nhiều phiên bản mà không ghi chép. Bạn nên lưu syntax, tên file dữ liệu, các biến bị loại và lý do loại. Quy trình này giúp bạn trả lời được câu hỏi của giảng viên về cách từ dữ liệu gốc đi đến bảng Coefficients.

Câu hỏi thường gặp

Chuẩn hóa là gì trong SPSS?

Trong SPSS, chuẩn hóa thường là chuyển biến sang z-score, với trung bình bằng 0 và độ lệch chuẩn bằng 1. Tuy nhiên, trong bảng hồi quy, từ “chuẩn hóa” thường chỉ cột Beta trong nhóm Standardized Coefficients.

Bạn có thể xem Beta mà không cần tự tạo cột z-score. Nếu cần tạo biến chuẩn hóa, vào Analyze > Descriptive Statistics > Descriptives, chọn Save standardized values as variables, sau đó SPSS tạo thêm biến z tương ứng.

Hệ số Beta bao nhiêu là đạt?

Không có một ngưỡng chung nói rằng Beta từ một giá trị cố định trở lên là đạt. Bạn cần xem dấu, Sig., độ phù hợp với giả thuyết, VIF và ý nghĩa lý thuyết của biến.

Beta càng lớn về trị tuyệt đối thường cho thấy ảnh hưởng tương đối càng lớn trong cùng mô hình, nhưng đây không phải quy tắc đủ để chấp nhận giả thuyết. Một Beta nhỏ vẫn có thể có ý nghĩa nếu kết quả phù hợp với mô hình và có ý nghĩa thống kê.

Có cần chuẩn hóa dữ liệu trước khi chạy hồi quy không?

Thông thường, bạn không bắt buộc phải chuẩn hóa thủ công chỉ để đọc hệ số Beta, vì SPSS đã tính và hiển thị Beta trong bảng Coefficients. Việc chuẩn hóa thủ công phù hợp khi bạn cần tạo biến tương tác, vẽ biểu đồ hoặc dùng một quy trình yêu cầu biến cùng thang đo.

Bạn vẫn phải làm sạch dữ liệu, kiểm tra missing value, biến đảo chiều và các giá trị bất thường trước khi chạy. Chuẩn hóa không sửa được lỗi nhập dữ liệu hay lỗi đo lường.

Beta chuẩn hóa và B chưa chuẩn hóa khác nhau thế nào?

B diễn giải thay đổi của biến phụ thuộc theo đơn vị gốc. Beta diễn giải thay đổi theo độ lệch chuẩn và thuận tiện hơn khi so sánh mức ảnh hưởng tương đối giữa các biến độc lập trong cùng mô hình.

Trong chương kết quả, bạn có thể báo cáo cả B và Beta. Cách này giúp người đọc hiểu tác động theo thang đo ban đầu, đồng thời biết biến nào có ảnh hưởng tương đối lớn hơn.

Chuẩn hóa rồi mà Beta vẫn không có ý nghĩa thì làm sao?

Bạn không nên chuẩn hóa lại liên tục để tìm p-value nhỏ hơn. Hãy kiểm tra lại chất lượng dữ liệu, cỡ mẫu, thang đo, tương quan giữa các biến, VIF và giả thuyết nghiên cứu.

Nếu kết quả không có ý nghĩa, hãy báo cáo trung thực kết quả đó và giải thích trong phạm vi dữ liệu, thiết kế và lý thuyết của đề tài. Việc một giả thuyết không được ủng hộ vẫn là một kết quả cần trình bày.

Mở file SPSS của bạn, vào bảng Coefficients, đánh dấu ba cột B, BetaSig. rồi đối chiếu với giả thuyết trước khi viết diễn giải; nếu cần chạy và đọc chính bộ dữ liệu .sav hoặc .csv của bạn, xem module M4 phân tích dữ liệu của DoThesis.