Hệ số Mardia là gì? Cách đọc và xử lý trong SEM

Thống kê··15 phút đọc

Hệ số Mardia là gì

Bạn mở output SEM lên và thấy các dòng liên quan đến multivariate skewness, multivariate kurtosis hoặc Mardia's coefficient. Hệ số Mardia là nhóm chỉ số dùng để đánh giá độ lệch và độ nhọn của phân phối đa biến, tức xem nhiều biến quan sát khi xét cùng nhau có gần với giả định phân phối chuẩn đa biến hay không.

Điểm cần nhớ là Mardia không phải là một chỉ số duy nhất trong mọi phần mềm. Output có thể tách thành multivariate skewness, multivariate kurtosis, critical ratio hoặc p-value. Tên cột và cách kết luận phụ thuộc vào phần mềm, bộ ước lượng và tài liệu hướng dẫn mà bạn đang dùng.

Trong SEM, kiểm tra này chủ yếu liên quan đến CB-SEM, chẳng hạn AMOS. CB-SEM thường dựa vào các giả định phân phối để ước lượng và kiểm định mô hình. Bạn có thể xem thêm CB-SEM là gì nếu đang phân vân giữa CB-SEM và PLS-SEM. Với PLS-SEM, trọng tâm đánh giá khác hơn, chẳng hạn outer loading, CR, AVE, HTMT và hệ số đường dẫn. PLS-SEM không nên được đọc bằng cùng một bộ tiêu chí fit của CB-SEM.

Về mặt ý tưởng, Mardia mở rộng cách nhìn từ từng biến riêng lẻ sang toàn bộ vector biến quan sát. Một biến có skewness thấp khi đứng riêng chưa đảm bảo cả bộ dữ liệu có multivariate normality. Vì vậy, bạn không nên chỉ nhìn vào bảng Descriptive Statistics của SPSS rồi kết luận dữ liệu đã chuẩn.

Ý nghĩa của hệ số Mardia trong nghiên cứu định lượng

Hệ số Mardia giúp bạn trả lời một câu hỏi thực tế: dữ liệu có phù hợp với giả định phân phối mà phương pháp SEM đang sử dụng hay không. Câu hỏi này ảnh hưởng đến lựa chọn estimator, cách tính standard error, cách diễn giải kiểm định và việc có cần báo cáo hạn chế của dữ liệu hay không.

Nếu dữ liệu gần với phân phối chuẩn đa biến, một số thủ tục CB-SEM có thể vận hành theo giả định thông thường của chúng. Nếu dữ liệu lệch hoặc nhọn nhiều, các thống kê kiểm định và standard error có thể bị ảnh hưởng. Khi đó, bạn cần xem phần mềm có cung cấp lựa chọn robust estimation, bootstrap hoặc phương án hiệu chỉnh phù hợp hay không.

Mardia cũng giúp bạn tránh một lỗi thường gặp: chạy mô hình xong mới tìm một con số để hợp thức hóa kết quả. Kiểm tra phân phối nên được thực hiện trước hoặc trong giai đoạn đánh giá dữ liệu, cùng với missing value, outlier và kiểu đo của biến. Biến tiềm ẩn là gì sẽ hữu ích nếu bạn chưa phân biệt được biến quan sát với construct mà SEM đang ước lượng.

Bạn cũng cần xác định mình đang làm loại SEM nào. Trong mô hình SEM, phần measurement model kiểm tra mối quan hệ giữa biến tiềm ẩn và biến quan sát, còn structural model kiểm tra các quan hệ giả thuyết. Mardia không thay thế cho đánh giá reliability, convergent validity, discriminant validity hay model fit. Nó chỉ trả lời một lát cắt về phân phối dữ liệu.

Một hệ số Mardia cao cũng không tự động có nghĩa mô hình bị loại. Bạn phải xem mức độ lệch, kích thước mẫu, estimator, outlier, thang đo Likert và mục tiêu phân tích. Với bảng hỏi Likert, dữ liệu thường có số mức hữu hạn nên việc diễn giải phân phối cần gắn với bối cảnh đo lường, không nên máy móc coi mọi sai lệch là lỗi nhập liệu.

Hệ số Mardia bao nhiêu là đạt

Đây là phần sinh viên thường tìm kiếm nhất, nhưng cũng là phần dễ bị trả lời quá đơn giản. Không có một ngưỡng duy nhất áp dụng cho mọi output Mardia, mọi phần mềm và mọi cách ước lượng. Bạn cần đọc đúng tên chỉ số, cột kết quả và tiêu chí được phần mềm hoặc tài liệu phương pháp của mô hình quy định.

Vì vậy, đừng lấy một con số trên blog khác rồi áp vào output của bạn nếu chưa biết đó là raw coefficient, normalized coefficient, critical ratio hay p-value. Hai output cùng ghi chữ Mardia vẫn có thể đang trình bày các đại lượng khác nhau.

Bảng dưới đây là cách phân loại để bạn quyết định bước tiếp theo. Các nguồn trong bảng chỉ được dùng cho những tiêu chí mà chúng thực sự hỗ trợ, không được dùng để tạo ra một ngưỡng Mardia giả.

Điều bạn cần kiểm traCách dùng trong quyết địnhNguồn hoặc căn cứ
Loại SEM đang chạyPhân biệt CB-SEM với PLS-SEM trước khi đọc giả định phân phối(Bollen, 1989)
Phân phối đa biếnĐọc đúng multivariate skewness, multivariate kurtosis, critical ratio hoặc p-value theo outputTài liệu hướng dẫn của phần mềm và estimator đang dùng
Measurement model và structural modelĐánh giá theo hai bước, không dùng Mardia thay cho kiểm định thang đo(Anderson và Gerbing, 1988)
CB-SEM fit indicesChỉ dùng CFI, TLI, RMSEA, SRMR trong bối cảnh CB-SEM, không chuyển sang SmartPLS(Hu và Bentler, 1999)
PLS-SEMĐánh giá outer loading, CR, AVE, HTMT, VIF, R² và Q² theo quy trình PLS-SEM(Hair và cộng sự, 2022)

Nếu giảng viên hỏi “Mardia bao nhiêu là tốt”, câu trả lời an toàn là: cần chỉ rõ bạn đang nói đến chỉ số nào trong output, dùng estimator nào và dựa vào quy tắc nào. Bạn có thể nêu rằng Mardia được dùng để đánh giá multivariate normality, sau đó giải thích cách xử lý khi dữ liệu không phù hợp. Đừng ghi một ngưỡng mà bạn không thể truy ngược về tài liệu phương pháp.

Trong bài luận, bạn cũng nên ghi rõ phần mềm và phiên bản. Một kết luận chỉ viết “hệ số Mardia đạt” thường quá ngắn, vì người đọc không biết bạn đã đọc cột nào, tiêu chí nào và tiêu chí đó có phù hợp với mô hình hay không.

Cách đọc hệ số Mardia trên output

Trước tiên, xác định output có thật sự là kết quả kiểm tra Mardia hay chỉ là một bảng mô tả phân phối đơn biến. Nếu bảng ghi Skewness và Kurtosis cho từng biến, đó là kiểm tra đơn biến. Nếu bảng ghi Multivariate hoặc Mardia, đó mới là phần liên quan đến phân phối đa biến.

Bước 1: Xác định tên chỉ số và cột kết quả

Đọc tiêu đề bảng, tên dòng và chú thích ở cuối output. Ghi lại chính xác các cột như Estimate, Critical Ratio, p-value hoặc những tên tương đương. Đừng tự đổi tên một cột thành “hệ số Mardia” nếu phần mềm đang gọi nó là multivariate kurtosis.

Bước 2: Kiểm tra bộ ước lượng

Xem mô hình dùng Maximum Likelihood hay một estimator khác. Cùng một dữ liệu nhưng estimator khác có thể yêu cầu cách diễn giải khác. Nếu bạn chạy AMOS, hãy kiểm tra phần Analysis Properties và các tùy chọn liên quan đến estimation.

Bước 3: Đọc cùng với dữ liệu gốc

Mở file .sav hoặc .csv và kiểm tra missing value, giá trị ngoài khoảng Likert, biến đảo chiều chưa recode và các bản trả lời bất thường. Mardia chỉ phản ánh dữ liệu đưa vào mô hình. Nếu file có lỗi nhập liệu, sửa ở output không giải quyết được nguyên nhân.

Bước 4: Ghi lại kết luận có điều kiện

Bạn cần kết luận theo dạng: dữ liệu có dấu hiệu phù hợp hoặc chưa phù hợp với giả định được kiểm tra, sau đó nêu cách xử lý. Tránh viết “dữ liệu đạt chuẩn tuyệt đối”. Trong nghiên cứu thực tế, phân phối hiếm khi hoàn hảo và quyết định còn phụ thuộc vào cỡ mẫu, estimator cùng các chẩn đoán khác.

Số liệu minh họa

Bảng sau chỉ là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột được trình bày theo dạng thường gặp trong output SEM để bạn biết cần tìm gì. Khi viết luận văn, hãy thay bằng đúng tên bảng và số liệu trong file của bạn.

Mardia's Test hoặc Multivariate TestEstimateCritical Ratiop-valueCách đọc minh họa
Multivariate skewness18.422.110.035Có dấu hiệu lệch đa biến theo tiêu chí của output
Multivariate kurtosis46.803.270.001Có dấu hiệu nhọn đa biến, cần xem estimator và xử lý robust
Univariate skewness, item Q10.41Không áp dụngKhông áp dụngĐây là chỉ số đơn biến, không phải Mardia đa biến
Univariate kurtosis, item Q1-0.36Không áp dụngKhông áp dụngChỉ đọc cùng với các chẩn đoán khác

Trong ví dụ trên, bạn không nên nhảy ngay đến kết luận “mô hình không dùng được”. Cần kiểm tra outlier, missing value, cách mã hóa biến và estimator. Nếu phần mềm hỗ trợ robust estimation hoặc bootstrap, hãy xem hướng dẫn phương pháp và trao đổi với giảng viên trước khi chọn. Bootstrap cũng không phải một nút bấm để xóa mọi vấn đề của dữ liệu.

Khi hệ số Mardia không đạt thì xử lý thế nào

Kiểm tra lỗi dữ liệu trước

Đây là bước ít tốn kém và dễ giải trình nhất. Dùng SPSS để xem Frequencies, Descriptives và các bảng kiểm tra missing. Tìm giá trị ngoài khoảng thang đo, chẳng hạn một biến Likert 1 đến 5 nhưng lại có giá trị 55. Kiểm tra cả những dòng bị lệch cột khi nhập từ Excel hoặc Google Forms.

Xem lại biến đảo chiều và mã hóa

Một biến đảo chiều chưa recode có thể làm tương quan giữa các biến bị sai, từ đó ảnh hưởng đến mô hình và phân phối. Đối chiếu codebook với bảng hỏi gốc. Nếu recode, lưu lại quy tắc và phiên bản dữ liệu đã xử lý, không ghi đè file dữ liệu thô.

Kiểm tra outlier có căn cứ

Một outlier không phải lúc nào cũng là dữ liệu sai. Bạn cần phân biệt người trả lời có giá trị thật nhưng hiếm với bản ghi do nhập nhầm hoặc trả lời thiếu nghiêm túc. Chỉ loại bản ghi khi có lý do phương pháp rõ ràng, ghi lại số dòng, tiêu chí và kết quả trước sau khi xử lý.

Chọn estimator hoặc phương án robust phù hợp

Nếu dữ liệu vẫn lệch sau khi kiểm tra, xem phần mềm có robust estimator, bootstrap hoặc cách hiệu chỉnh standard error phù hợp không. Lựa chọn này cần bám vào loại SEM và tài liệu phương pháp. Đừng chuyển một mô hình CB-SEM sang SmartPLS chỉ vì Mardia cao, nếu câu hỏi nghiên cứu và logic ước lượng ban đầu không phù hợp.

Báo cáo giới hạn thay vì che giấu

Nếu không thể làm cho dữ liệu gần chuẩn hơn mà không bóp méo dữ liệu, hãy báo cáo kết quả kiểm tra và cách bạn xử lý. Hội đồng thường quan tâm bạn hiểu giới hạn của phương pháp hay không. Một kết luận có điều kiện đáng tin hơn việc ghi rằng mọi giả định đều được đáp ứng.

Nếu sau các bước trên bạn vẫn chưa biết chọn phương án nào, hãy xuất cả bảng Mardia, mô tả dữ liệu và thông tin estimator để trao đổi với giảng viên. Không nên tự ý log-transform các biến Likert chỉ để làm đẹp một con số, vì phép biến đổi có thể làm thay đổi cách diễn giải thang đo.

Phân biệt hệ số Mardia với các chỉ số dễ nhầm

Mardia và skewness, kurtosis đơn biến đều nói về hình dạng phân phối, nhưng phạm vi khác nhau. Skewness hoặc kurtosis đơn biến xem từng biến riêng lẻ. Mardia xem đặc điểm đa biến của nhiều biến cùng lúc. Vì vậy, một bảng Descriptives đẹp không đủ để kết luận multivariate normality.

Mardia cũng khác Mahalanobis distance. Mahalanobis distance thường được dùng để phát hiện quan sát có vị trí bất thường khi xét đồng thời nhiều biến. Mardia là chỉ số tổng hợp về phân phối đa biến. Một bản ghi có Mahalanobis distance cao có thể cần xem xét, nhưng nó không đồng nghĩa với việc hệ số Mardia cao.

Mardia khác model fit. CFI, TLI, RMSEA và SRMR đánh giá mức độ phù hợp giữa mô hình và dữ liệu trong CB-SEM theo cách riêng. Chúng không thay thế kiểm tra phân phối. Các ngưỡng fit nêu trong (Hu và Bentler, 1999) chỉ dành cho CB-SEM, vì vậy không nên đưa nguyên bảng đó sang bài phân tích SmartPLS.

Mardia cũng không phải Cronbach's Alpha. Alpha đánh giá consistency của các biến quan sát trong thang đo, với nền tảng lý thuyết từ (Cronbach, 1951). Mardia đánh giá phân phối dữ liệu. Một thang đo có Alpha tốt vẫn có thể đi cùng dữ liệu lệch đa biến.

Lỗi thường gặp

Lỗi đầu tiên là tìm một con số duy nhất cho câu hỏi “hệ số Mardia bao nhiêu là tốt” mà không đọc tên cột. Cùng chữ Mardia nhưng raw estimate và critical ratio không thể được diễn giải như nhau.

Lỗi thứ hai là dùng tiêu chí của PLS-SEM cho CB-SEM hoặc ngược lại. Nếu bạn chạy SmartPLS, hãy tập trung vào quy trình PLS-SEM và những chỉ số phù hợp như CR, AVE, HTMT, VIF, R² và Q². Nếu bạn chạy AMOS, hãy mô tả estimator, kiểm tra dữ liệu và model fit theo đúng bối cảnh CB-SEM.

Lỗi thứ ba là xóa hàng loạt bản ghi vì thấy output không đẹp. Việc loại dữ liệu phải có tiêu chí trước, lý do cụ thể và số lượng được báo cáo. Xóa đến khi Mardia giảm là cách xử lý khó bảo vệ trước hội đồng.

Lỗi thứ tư là viết “dữ liệu có phân phối chuẩn” chỉ dựa trên một kiểm tra. Phân phối đơn biến, phân phối đa biến, outlier, cỡ mẫu và estimator cần được xem trong cùng một logic phân tích.

Lỗi cuối là không lưu output từng vòng. Hãy giữ file dữ liệu thô, file đã làm sạch, syntax hoặc lịch sử thao tác và output trước sau khi xử lý. Khi giảng viên hỏi vì sao một biến hoặc một dòng bị loại, bạn có thể trả lời bằng bằng chứng thay vì nhớ lại theo cảm tính.

Đọc thêm: sem là gì, chủ đề thong ke.

Câu hỏi thường gặp

Hệ số Mardia trong SPSS có sẵn không

SPSS cơ bản thường cung cấp skewness và kurtosis cho từng biến, nhưng không phải mọi quy trình trong SPSS đều tạo ra bảng Mardia đa biến. Nếu bạn chỉ thấy bảng Descriptives, đó chưa phải output Mardia. Mardia thường xuất hiện trong phần mềm hoặc module SEM phù hợp, chẳng hạn AMOS, tùy vào mô hình và tùy chọn phân tích.

Hệ số Mardia bao nhiêu là tốt

Không nên trả lời bằng một con số chung khi chưa biết output đang hiển thị raw coefficient, normalized coefficient, critical ratio hay p-value. Hãy ghi đúng tên chỉ số, estimator và tiêu chí được dùng trong tài liệu phương pháp của phần mềm.

Trong luận văn, bạn có thể giải thích rằng Mardia được dùng để đánh giá multivariate normality, sau đó báo cáo kết quả và phương án xử lý. Cách này chính xác hơn việc chép một ngưỡng từ nguồn không rõ.

Mardia cao có làm hỏng mô hình SEM không

Mardia cao cho thấy dữ liệu có dấu hiệu không phù hợp với giả định phân phối đa biến theo cách đọc của output. Điều đó không tự động làm mô hình vô giá trị. Bạn cần kiểm tra lỗi dữ liệu, outlier, estimator, cỡ mẫu và các chỉ số fit hoặc chất lượng đo lường liên quan.

Nếu dùng CB-SEM, hãy xem xét phương án robust được phần mềm hỗ trợ và giải trình rõ. Nếu dùng PLS-SEM, hãy đánh giá theo logic PLS-SEM thay vì cố áp toàn bộ tiêu chí phân phối của CB-SEM.

Có nên xóa dữ liệu để hệ số Mardia đạt không

Chỉ xóa bản ghi khi có căn cứ như nhập sai, giá trị ngoài thang đo hoặc mẫu trả lời không hợp lệ theo tiêu chí đã đặt trước. Không nên xóa chỉ vì một con số không đẹp. Bạn cần lưu lại danh sách bản ghi bị loại, lý do và kết quả phân tích trước sau khi loại.

Có thể dùng Mardia cho PLS-SEM không

Bạn có thể kiểm tra đặc điểm phân phối dữ liệu trong nghiên cứu PLS-SEM, nhưng vai trò của nó không giống trong CB-SEM. PLS-SEM thường được trình bày qua measurement model và structural model, cùng các chỉ số như outer loading, CR, AVE, HTMT, VIF, R² và Q². Hãy theo quy trình được nêu trong (Hair và cộng sự, 2022) thay vì dùng Mardia làm tiêu chí duy nhất.

Khi file của bạn đang mở, hãy xác định trước output đang hiển thị chỉ số nào, mô hình là CB-SEM hay PLS-SEM, rồi lưu bảng Mardia cùng thông tin estimator vào thư mục kết quả. Nếu cần chạy và đọc toàn bộ phân tích trên chính file .sav hoặc .csv, bạn có thể xem module M4 phân tích của DoThesis.