
Khoảng tin cậy bootstrap chứa 0 phải làm sao
Hiện tượng bạn đang gặp
Bạn chạy phân tích mediation trong SPSS, thường bằng PROCESS Macro, rồi nhìn vào bảng Indirect effect(s) of X on Y. Ở dòng hiệu ứng gián tiếp, cột BootLLCI có thể là -0.018 và BootULCI là 0.146. Khoảng này đi qua 0, nên bạn đang thắc mắc: khoảng tin cậy bootstrap chứa 0 phải làm sao.
Cách đọc cốt lõi là: với mức tin cậy đang chọn, dữ liệu chưa cung cấp đủ bằng chứng để kết luận hiệu ứng gián tiếp khác 0. Nếu bạn đang kiểm định biến trung gian, kết luận thường là hiệu ứng trung gian chưa được ủng hộ theo khoảng tin cậy bootstrap. Đây là kết quả thống kê, không phải bằng chứng rằng mô hình chắc chắn sai hoặc bạn phải xóa biến ngay.
Trước khi xử lý, hãy lưu file output hiện tại dưới một tên riêng, chẳng hạn mediation_lan1.spv. Bạn cần giữ lại số liệu của lần chạy đầu để giải trình nếu giảng viên hỏi vì sao kết quả thay đổi sau khi làm sạch dữ liệu.
Nếu cần xem lại khái niệm, bạn có thể đọc biến trung gian là gì, sau đó đối chiếu với hướng dẫn bootstrap trung gian trong SPSS. Hai việc này giúp bạn xác định mình đang kiểm định hiệu ứng trực tiếp, hiệu ứng gián tiếp hay tổng hiệu ứng.
Nguyên nhân thường gặp
Khoảng tin cậy chứa 0 có thể xuất hiện vì hiệu ứng thật trong tổng thể nhỏ, mẫu chưa đủ thông tin, các quan sát có độ phân tán lớn hoặc mô hình được chỉ định chưa phù hợp. Không nên quy toàn bộ vấn đề cho việc SPSS chạy sai. SPSS chỉ tính theo dữ liệu và mô hình bạn đưa vào.
Bảng dưới đây dùng để khoanh vùng trước khi bạn sửa dữ liệu hoặc chạy lại. Cột “cách kiểm tra” quan trọng hơn việc nhìn riêng p-value của từng đường hồi quy.
| Dấu hiệu trên output | Nguyên nhân có thể gặp | Cách kiểm tra |
|---|---|---|
| BootLLCI âm, BootULCI dương | Hiệu ứng gián tiếp chưa khác 0 rõ ràng | Đọc trọn dòng Indirect effect(s), không chỉ đọc hệ số a hoặc b |
| Khoảng tin cậy rất rộng | Mẫu nhỏ, dữ liệu phân tán hoặc có outlier | Kiểm tra cỡ mẫu, Descriptives, boxplot và độ lệch chuẩn |
| Đường X đến M có p-value lớn | Biến độc lập chưa giải thích được mediator | Xem bảng hồi quy đầu tiên và hệ số của X |
| Đường M đến Y thay đổi mạnh khi thêm X | Có tương quan cao hoặc đa cộng tuyến | Kiểm tra VIF, tolerance và tương quan giữa các biến |
| Kết quả đổi nhiều giữa các lần chạy | Dữ liệu chưa làm sạch hoặc seed khác nhau | Kiểm tra missing, bản ghi trùng, outlier và số bootstrap |
| Hiệu ứng trực tiếp có ý nghĩa nhưng gián tiếp chứa 0 | Mô hình có thể không có mediation | Tách riêng direct effect, indirect effect và total effect |
Một nguyên nhân hay bị bỏ qua là bạn diễn giải sai đơn vị phân tích. Nếu X, M và Y là điểm trung bình của các thang đo, hệ số gián tiếp đang được tính trên các điểm tổng hợp đó. Nếu bạn đưa từng biến quan sát vào thay cho biến tiềm ẩn hoặc điểm thang đo, mô hình có thể không còn đúng với giả thuyết ban đầu. Bạn có thể xem lại cách xác định biến độc lập là gì trước khi sửa cú pháp.
Cách xử lý theo thứ tự ưu tiên
1. Xác nhận đúng cột BootLLCI và BootULCI
Trong output PROCESS, tìm bảng Indirect effect(s) of X on Y. Xác định mức tin cậy, thường là 95%, rồi xem hai cận của bootstrap CI. Khoảng tin cậy chứa 0 khi một cận âm và cận còn lại dương, hoặc một cận bằng 0.
Không dùng quy tắc “p-value của X phải nhỏ hơn 0.05” để thay thế cho bootstrap CI của hiệu ứng gián tiếp. Với mediation, bạn cần báo cáo chính hiệu ứng gián tiếp và khoảng tin cậy của nó. Theo Preacher và Hayes (2008), hiệu ứng gián tiếp được xem là có ý nghĩa khi khoảng tin cậy bootstrap không chứa 0.
2. Kiểm tra bạn có đọc đúng loại hiệu ứng
PROCESS thường hiển thị Total effect of X on Y, Direct effect of X on Y và Indirect effect(s) of X on Y. Ba dòng này trả lời ba câu hỏi khác nhau. Khoảng tin cậy của direct effect chứa 0 không tự động có nghĩa indirect effect cũng chứa 0, và ngược lại.
Nếu mô hình của bạn có mediator M, hãy viết lại sơ đồ bằng lời: X tác động đến M, M tác động đến Y khi đã kiểm soát X, còn hiệu ứng gián tiếp là tích của hai đường này. Trường hợp direct effect không có ý nghĩa nhưng indirect effect có thể vẫn xảy ra, vì vậy không được loại mediator chỉ dựa vào một bảng.
3. Kiểm tra dữ liệu và mã hóa biến
Mở Analyze > Descriptive Statistics > Frequencies để xem giá trị bất thường, mã ngoài thang đo và số lượng missing. Với biến Likert, các giá trị như 0, 6 hoặc 99 thường báo hiệu lỗi nhập liệu nếu bảng hỏi chỉ dùng thang 1 đến 5.
Kiểm tra các biến đảo chiều trước khi tính điểm trung bình. Một biến quan sát chưa reverse code có thể làm giảm tương quan trong thang đo, tăng độ phân tán và khiến đường dẫn trong mediation yếu đi. Nếu bạn đã gộp biến, hãy ghi lại công thức tạo biến mới, số biến quan sát sử dụng và cách xử lý missing.
Bạn cũng nên kiểm tra bản ghi trả lời quá nhanh, trả lời cùng một mức cho toàn bộ biến quan sát và bản ghi thiếu quá nhiều câu. Tuy nhiên, không xóa bản ghi chỉ vì nó làm kết quả đẹp hơn. Mỗi bản ghi bị loại phải có tiêu chí được xác định trước hoặc có lý do dữ liệu rõ ràng.
4. Kiểm tra outlier và đa cộng tuyến
Chạy Analyze > Regression > Linear, đưa biến phụ thuộc phù hợp vào ô Dependent và các biến dự báo vào ô Independent(s). Trong Statistics, chọn Collinearity diagnostics. VIF dưới 5 là ngưỡng thường được báo cáo trong PLS-SEM theo Hair và cộng sự (2019); với hồi quy SPSS, bạn vẫn cần xem xét VIF cùng tương quan và bối cảnh mô hình thay vì coi một con số là phán quyết tuyệt đối.
Để kiểm tra outlier, xem standardized residual, Cook's distance và biểu đồ phù hợp. Một điểm cực đoan có thể làm khoảng tin cậy rộng, nhưng việc xóa nó cần có lý do về chất lượng dữ liệu. Hãy chạy phân tích nhạy cảm bằng cách giữ và loại điểm đó, lưu cả hai output, rồi báo cáo minh bạch nếu kết luận thay đổi.
5. Kiểm tra cỡ mẫu và độ biến thiên
Bootstrap tạo nhiều mẫu lặp từ dữ liệu hiện có. Nó không tạo thêm người trả lời thật. Vì vậy, nếu mẫu nhỏ hoặc các biến gần như không biến thiên, bootstrap không thể bù cho thiếu thông tin.
Với hồi quy có m biến độc lập, một quy tắc thường được trích dẫn là cỡ mẫu từ 50 + 8m trở lên (Tabachnick và Fidell, 2013). Đây là hướng dẫn cho hồi quy, không phải cam kết rằng mọi mediation đạt ý nghĩa khi đủ số quan sát. Bạn vẫn cần xem độ lớn hiệu ứng, sai số và chất lượng đo lường.
6. Chạy lại với số bootstrap phù hợp và lưu từng phiên bản
Trong PROCESS, đặt số bootstrap samples theo thiết kế nghiên cứu và ghi rõ con số trong phương pháp. Với PLS-SEM, Hair và cộng sự (2022) đề cập 5.000 bootstrap subsamples. Nếu bạn đang chạy mediation bằng PROCESS trong SPSS, đừng trộn lẫn hướng dẫn báo cáo của SmartPLS với output SPSS.
Chạy lại chỉ sau khi có một thay đổi được giải thích, chẳng hạn sửa mã đảo chiều hoặc loại bản ghi vi phạm tiêu chí làm sạch. Không chạy liên tục với nhiều cài đặt cho đến khi CI không còn chứa 0. Cách đó làm tăng rủi ro chọn kết quả có lợi sau khi đã xem dữ liệu.
7. Giữ nguyên kết luận nếu khoảng tin cậy vẫn chứa 0
Sau khi kiểm tra dữ liệu, nếu BootLLCI vẫn âm và BootULCI vẫn dương, hãy báo cáo rằng hiệu ứng gián tiếp chưa được hỗ trợ. Bạn có thể thảo luận khả năng hiệu ứng yếu, cỡ mẫu chưa đủ hoặc quan hệ lý thuyết không phù hợp với bối cảnh, nhưng không được viết rằng mediator “chắc chắn không tồn tại”.
Bảng minh họa dưới đây có dạng rút gọn của output PROCESS. Các con số chỉ để minh họa cách đọc, không phải kết quả của một nghiên cứu thật.
| Hiệu ứng | Effect | BootSE | BootLLCI | BootULCI | Diễn giải minh họa |
|---|---|---|---|---|---|
| Direct effect of X on Y | 0.284 | 0.091 | 0.108 | 0.467 | Khoảng không chứa 0 |
| Indirect effect of X on Y | 0.063 | 0.049 | -0.018 | 0.174 | Khoảng chứa 0 |
| Total effect of X on Y | 0.347 | 0.087 | 0.176 | 0.519 | Khoảng không chứa 0 |
Số liệu minh họa: trong dòng Indirect effect, BootLLCI = -0.018 và BootULCI = 0.174 nằm ở hai phía của 0. Vì vậy, với cách diễn giải bootstrap CI, hiệu ứng trung gian chưa có bằng chứng rõ ràng, dù direct effect và total effect trong ví dụ này có khoảng không chứa 0.
8. Cân nhắc mô hình thay thế có cơ sở lý thuyết
Nếu giả thuyết của bạn là moderation thay vì mediation, hãy dùng mô hình và cách đọc tương ứng. Biến trung gian giải thích cơ chế “X tác động qua M đến Y”, còn moderator trả lời “mối quan hệ X và Y thay đổi theo điều kiện nào”. Với moderation, có thể cần xem kỹ thuật Johnson Neyman là gì.
Bạn cũng có thể kiểm tra mô hình đo lường trước khi giữ mô hình cấu trúc. Thang đo có Cronbach's Alpha hoặc corrected item-total correlation thấp có thể khiến điểm tổng hợp kém ổn định. Alpha từ 0.7 trở lên thường được xem là chấp nhận được (Nunnally, 1978), còn corrected item-total correlation từ 0.3 trở lên được dùng như một mốc tham khảo (Nunnally và Bernstein, 1994). Đừng loại biến chỉ để ép CI vượt qua 0 nếu việc loại đó không có lý do nội dung và thống kê.
Khi nào phải quay lại thu thêm dữ liệu
Bạn nên cân nhắc thu thêm dữ liệu khi mẫu hiện tại thấp so với kế hoạch, nhiều bản ghi không hợp lệ, CI rất rộng và kết quả nhạy với một vài quan sát. Việc thu thêm phải tuân theo cùng tiêu chí chọn mẫu, cùng bảng hỏi và cùng quy trình làm sạch. Gộp hai nhóm người trả lời có đặc điểm khác nhau mà không kiểm tra tính tương thích có thể tạo ra vấn đề mới.
Thu thêm dữ liệu không phải cách bắt buộc để biến một giả thuyết thành có ý nghĩa. Nếu dữ liệu mới vẫn cho CI chứa 0, kết luận phù hợp vẫn là chưa có bằng chứng cho hiệu ứng gián tiếp. Khi deadline gần, bạn nên trao đổi với giảng viên về giới hạn cỡ mẫu và báo cáo kết quả hiện có thay vì thay đổi giả thuyết sau khi xem output.
Nếu bảng hỏi chưa thu đủ số lượng, hãy xem lại tỷ lệ trả lời hợp lệ và tiêu chí cỡ mẫu đã nêu trong đề cương. Dữ liệu bổ sung cần được ghi nhận thời điểm thu, kênh thu và điều kiện sàng lọc. Không tạo bản ghi giả, không nhân bản dòng dữ liệu và không dùng dữ liệu mô phỏng để thay cho người trả lời thật.
Cách giải trình với giảng viên hướng dẫn
Bạn có thể trình bày theo thứ tự: mục tiêu kiểm định, loại hiệu ứng, số bootstrap samples, hai cận CI, kết luận và bước kiểm tra dữ liệu đã thực hiện. Đưa cả bảng output gốc và bảng tóm tắt, để người đọc thấy bạn không chỉ chọn một con số có lợi.
Cách viết vào luận văn: “Kết quả phân tích bootstrap cho thấy hiệu ứng gián tiếp của [X] lên [Y] thông qua [M] có hệ số [Effect] = [giá trị]. Khoảng tin cậy bootstrap [95%]% từ [BootLLCI] đến [BootULCI] chứa 0, do đó giả thuyết về tác động trung gian của [M] chưa được ủng hộ.”
Nếu khoảng tin cậy chứa 0 nhưng direct effect có ý nghĩa, bạn có thể thêm: “Mặc dù tác động trực tiếp của [X] lên [Y] đạt ý nghĩa thống kê, kết quả chưa cung cấp bằng chứng cho hiệu ứng gián tiếp qua [M].” Chỉ dùng câu này khi số liệu thật trong output của bạn đúng với mô tả.
Cách phòng từ bước thiết kế
Ngay khi lập mô hình, hãy ghi rõ X, M, Y, hướng tác động và tiêu chí kết luận. Nếu dùng PROCESS, lưu syntax hoặc ghi lại model number, biến đưa vào, số bootstrap samples và mức tin cậy. Nếu dùng SmartPLS, tách bước đánh giá measurement model và structural model theo quy trình hai giai đoạn được trình bày trong Hair và cộng sự (2022).
Bảng hỏi cần có mã biến nhất quán, nhãn giá trị rõ ràng và hướng dẫn reverse code cho biến đảo chiều. Trước khi thu chính thức, kiểm tra đường dẫn từ bảng hỏi đến file .sav hoặc .csv, thử nhập một số bản ghi và xem các cột có đúng kiểu dữ liệu không.
Khi phân tích, tạo thư mục gồm dữ liệu gốc, dữ liệu đã làm sạch, syntax, output lần đầu và output lần cuối. Tên file nên có ngày hoặc số vòng chạy. Quy trình này giúp bạn trả lời được câu hỏi “bạn đã thay đổi gì giữa hai lần chạy” mà không phải đoán lại từ trí nhớ.
Nếu bạn đang tìm cách xử lý riêng thông báo này trong SPSS, có thể đối chiếu thêm bài lỗi khoảng tin cậy bootstrap chứa 0 trong SPSS và xem các chủ đề liên quan tại chuyên mục SPSS.
Lỗi thường gặp khi sửa
Lỗi đầu tiên là giảm mức tin cậy từ 95% xuống 90% chỉ vì muốn khoảng không còn chứa 0. Nếu mức tin cậy 90% được xác định trước trong thiết kế và có lý do phù hợp, bạn có thể báo cáo, nhưng không nên đổi sau khi đã xem kết quả rồi chỉ giữ lần chạy có ý nghĩa.
Lỗi thứ hai là tăng số bootstrap samples rồi khẳng định hiệu ứng đã mạnh hơn. Tăng số lần lấy mẫu lặp giúp ước lượng khoảng ổn định hơn, nhưng không tạo ra thông tin mới từ những người trả lời mới. Nó không biến một hiệu ứng yếu thành hiệu ứng có ý nghĩa một cách hợp lệ.
Lỗi thứ ba là xóa nhiều biến quan sát hoặc nhiều bản ghi liên tiếp mà không ghi lý do. Việc loại biến cần dựa trên độ tin cậy, tải nhân tố, nội dung thang đo và mô hình lý thuyết. Kết quả cuối cùng đẹp hơn nhưng không thể giải trình sẽ tạo rủi ro lớn hơn một CI chứa 0.
Lỗi thứ tư là viết “không có tác động” khi CI chứa 0. Cách viết thận trọng hơn là “chưa có đủ bằng chứng thống kê để kết luận hiệu ứng gián tiếp khác 0 trong mẫu nghiên cứu”. Kết luận này đúng với giới hạn của kiểm định và không phóng đại điều dữ liệu có thể nói.
Câu hỏi thường gặp
Khoảng tin cậy bootstrap chứa 0 có phải mô hình sai không?
Chưa thể kết luận mô hình sai chỉ từ dấu hiệu này. Nó cho biết hiệu ứng đang xét chưa khác 0 đủ rõ theo khoảng tin cậy đã chọn. Bạn cần kiểm tra dữ liệu, thang đo, cỡ mẫu và logic lý thuyết trước khi quyết định sửa mô hình.
Có nên chạy lại bootstrap nhiều lần đến khi khoảng không chứa 0?
Không. Việc chạy nhiều lần rồi chỉ chọn output có lợi làm kết quả thiếu minh bạch, đặc biệt nếu bạn thay đổi số bootstrap samples, mức tin cậy hoặc tiêu chí loại dữ liệu sau khi đã nhìn thấy kết quả. Hãy xác định quy trình, lưu từng phiên bản và chỉ chạy lại khi có lý do phương pháp được ghi rõ.
Direct effect có ý nghĩa nhưng indirect effect chứa 0 thì kết luận thế nào?
Bạn có thể kết luận tác động trực tiếp của X lên Y được hỗ trợ, trong khi chưa có bằng chứng cho tác động gián tiếp qua M. Hai hiệu ứng là hai đại lượng khác nhau, nên kết quả này không tự động xác nhận hoặc bác bỏ toàn bộ mô hình nghiên cứu.
Tăng cỡ mẫu có chắc chắn làm khoảng tin cậy không chứa 0 không?
Không chắc chắn. Cỡ mẫu lớn hơn thường cung cấp thêm thông tin và có thể làm ước lượng ổn định hơn, nhưng nếu hiệu ứng thật rất nhỏ hoặc quan hệ X, M, Y không phù hợp thì CI vẫn có thể chứa 0. Dữ liệu mới cũng phải được thu theo đúng tiêu chí và bối cảnh đã thiết kế.
Có thể báo cáo khoảng tin cậy 90% thay cho 95% không?
Có thể nếu mức tin cậy 90% đã được xác định phù hợp với thiết kế và được báo cáo minh bạch. Nếu bạn đổi mức tin cậy sau khi thấy CI 95% chứa 0, cần giải trình rõ và không nên trình bày như thể đây là lựa chọn ban đầu. Hãy hỏi giảng viên trước khi thay đổi tiêu chí kết luận.
Mở lại file dữ liệu, kiểm tra dòng Indirect effect(s) of X on Y, ghi BootLLCI và BootULCI vào bảng kết quả, rồi đối chiếu từng bước xử lý với output gốc. Nếu bạn cần chạy phân tích trên chính file .sav hoặc .csv và chuyển kết quả thành phần viết được, xem module M4 phân tích của DoThesis.