Nghiên cứu cắt ngang là gì? Cách chọn mẫu và phân tích SPSS

SPSS··15 phút đọc

Nghiên cứu cắt ngang là gì

Nghiên cứu cắt ngang là thiết kế thu thập dữ liệu của các đối tượng tại một thời điểm hoặc trong một khoảng thời gian thu thập ngắn, nhằm mô tả thực trạng hoặc xem xét mối liên hệ giữa các biến. Bạn có thể hình dung đây là một bức ảnh của mẫu nghiên cứu: bảng hỏi được phát, người tham gia trả lời, sau đó dữ liệu được phân tích để trả lời câu hỏi nghiên cứu.

Ví dụ, bạn khảo sát 250 sinh viên trong tháng 10 năm 2026 về chất lượng dịch vụ thư viện và ý định tiếp tục sử dụng. Tất cả biến được đo trong đợt khảo sát đó. Đây là nghiên cứu cắt ngang, dù bạn thu thập câu trả lời trong một ngày hay trong bốn tuần, miễn là thiết kế không theo dõi cùng một người qua nhiều thời điểm để đo sự thay đổi.

Trong nghiên cứu định lượng, thiết kế này thường đi cùng bảng hỏi Likert, dữ liệu sơ cấp và các phân tích như thống kê mô tả, Cronbach's Alpha, EFA, tương quan và hồi quy. Nếu bạn chưa phân biệt dữ liệu tự thu thập với dữ liệu có sẵn, có thể xem thêm dữ liệu sơ cấp và dữ liệu thứ cấp là gì.

Điểm cần ghi rõ là cắt ngang mô tả sự liên hệ tại thời điểm khảo sát. Nếu X và Y có tương quan, bạn có thể nói X có mối liên hệ với Y trong mẫu khảo sát, nhưng cần thận trọng khi viết rằng X gây ra Y. Thiết kế này thường không đủ để chứng minh thứ tự thời gian giữa nguyên nhân và kết quả.

Ý nghĩa của nghiên cứu cắt ngang trong nghiên cứu định lượng

Thiết kế cắt ngang giúp bạn trả lời ba nhóm câu hỏi. Thứ nhất, một đặc điểm xuất hiện ở mức nào trong mẫu, chẳng hạn mức độ hài lòng trung bình của khách hàng. Thứ hai, các nhóm có khác nhau hay không, chẳng hạn sinh viên năm cuối và sinh viên năm nhất có đánh giá khác nhau về trải nghiệm học trực tuyến. Thứ ba, các biến có liên hệ với nhau hay không, chẳng hạn perceived usefulness có liên hệ với ý định sử dụng ứng dụng.

Với luận văn sinh viên, cắt ngang có lợi thế về thời gian và chi phí. Bạn chỉ cần thiết kế bảng hỏi, xác định tiêu chí chọn người trả lời, thu thập dữ liệu một đợt, làm sạch file .sav hoặc .csv, rồi chạy phân tích. Bạn không phải liên hệ lại với cùng một người nhiều lần, cũng không phải duy trì mã định danh qua các đợt đo.

Tuy vậy, sự thuận tiện này đi kèm giới hạn. Nếu người có thái độ tích cực về dịch vụ cũng là người có ý định sử dụng cao hơn, dữ liệu cắt ngang cho thấy hai biến đi cùng nhau tại thời điểm đo. Dữ liệu đó chưa tự nó chứng minh thái độ tích cực là nguyên nhân duy nhất tạo ra ý định sử dụng. Các yếu tố khác như thu nhập, kinh nghiệm hoặc hoàn cảnh cá nhân có thể cùng liên quan.

Thiết kế cũng ảnh hưởng đến cách bạn chọn phân tích. Với một biến phụ thuộc liên tục hoặc được tạo từ nhiều biến quan sát, bạn có thể dùng hồi quy tuyến tính nếu câu hỏi nghiên cứu phù hợp. Với mô hình gồm biến tiềm ẩn, mediator hoặc nhiều quan hệ giữa các khái niệm, bạn có thể cân nhắc SmartPLS. Trang chủ đề SPSS có các hướng dẫn liên quan đến xử lý dữ liệu và chạy phân tích trong SPSS.

Nghiên cứu cắt ngang bao nhiêu là đạt

Không có một con số duy nhất biến mọi nghiên cứu cắt ngang thành đạt. Cỡ mẫu phải gắn với tổng thể, số biến quan sát, số biến độc lập, mô hình dự kiến và cách chọn mẫu. Một mẫu lớn nhưng thu từ một nhóm rất hẹp vẫn có thể không đại diện cho đối tượng bạn muốn nghiên cứu.

Bạn có thể dùng các mốc trong bảng dưới đây như tiêu chí kiểm tra thiết kế, không xem chúng là giấy thông hành tự động cho mọi đề tài.

Nội dung cần kiểm traMốc hoặc nguyên tắc có thể dùngNguồn
Số quan sát trên mỗi biến quan sát khi thiết kế thang đoKhoảng 5 đến 10 quan sát cho một biến quan sát(Hair và cộng sự, 2010)
Cỡ mẫu cho hồi quy theo số biến độc lậpN tối thiểu bằng 50 + 8m, trong đó m là số biến độc lập(Tabachnick và Fidell, 2013)
Cỡ mẫu theo tổng thể hữu hạnCó thể áp dụng công thức cỡ mẫu tổng thể hữu hạn khi biết quy mô tổng thể(Yamane, 1967)
KMO khi kiểm tra EFAKMO từ 0.5 trở lên(Kaiser, 1974)
Bartlett's Test trong EFAp-value dưới 0.05 cho thấy ma trận tương quan phù hợp để xem xét EFA(Kaiser, 1974)
Total Variance Explained trong EFATổng phương sai trích từ 50% trở lên(Hair và cộng sự, 2010)
Factor loading trong EFAFactor loading từ 0.5 trở lên(Hair và cộng sự, 2010)

Ví dụ, bảng hỏi của bạn có 25 biến quan sát. Quy tắc 5 đến 10 quan sát cho một biến gợi ý khoảng 125 đến 250 quan sát. Nếu mô hình hồi quy có 6 biến độc lập, công thức 50 + 8m cho kết quả 98 quan sát. Hai cách tính này chỉ là hai mốc tham khảo khác nhau, vì vậy bạn nên giải thích vì sao chọn cỡ mẫu cuối cùng thay vì chỉ chép con số lớn hơn vào chương 3.

Câu hỏi “nghiên cứu cắt ngang bao nhiêu là tốt” còn liên quan đến chất lượng thu thập. 300 phản hồi sao chép, trả lời quá nhanh hoặc chỉ đến từ một lớp học không chắc tốt hơn 180 phản hồi hợp lệ có tiêu chí chọn rõ ràng. Bạn cần lưu lại tổng số phản hồi, số bị loại, lý do loại và số dùng trong phân tích cuối cùng.

Cách đọc nghiên cứu cắt ngang trong output SPSS

Nghiên cứu cắt ngang không phải là tên của một bảng output trong SPSS. SPSS không hiện một dòng có nhãn “Cross-sectional study”. Bạn xác định thiết kế ở phần phương pháp, còn output cho biết dữ liệu tại thời điểm khảo sát có đặc điểm gì và các quan hệ thống kê có được ủng hộ hay không.

Giả sử bạn khảo sát ý định tiếp tục sử dụng một ứng dụng. Sau khi tính điểm trung bình cho các thang đo, bạn chạy hồi quy với BI là biến phụ thuộc, PU và PE là hai biến độc lập. Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu có thật.

ModelRR SquareAdjusted R SquareStd. Error of the Estimate
10.6120.3750.3700.548
ModelSum of SquaresdfMean SquareFSig.
Regression48.216224.10880.214<0.001
Residual80.5742680.301
Total128.790270
ModelUnstandardized BStd. ErrorStandardized BetatSig.VIF
Constant1.0240.2414.249<0.001
PU0.4210.0580.4867.259<0.0011.684
PE0.1760.0610.1922.8850.0041.684

Ở bảng Model Summary, R Square bằng 0.375 nghĩa là mô hình minh họa giải thích 37.5% biến thiên của BI trong mẫu. Đây không phải tỷ lệ tác động nhân quả và cũng không phải dự đoán chắc chắn cho tổng thể. Ở bảng ANOVA, Sig. dưới 0.05 cho thấy mô hình hồi quy tổng thể có ý nghĩa thống kê theo cách kiểm định đang dùng.

Trong bảng Coefficients, cột Standardized Beta giúp so sánh tương đối đóng góp của PU và PE trong cùng mô hình. Cột Sig. của PU và PE đều dưới 0.05 trong ví dụ, nhưng khi viết kết quả thật, bạn phải dùng số từ file của mình. VIF là chỉ số kiểm tra đa cộng tuyến; mốc VIF dưới 5 được nêu trong (Hair và cộng sự, 2019).

Nếu cần lặp lại một quy trình đã chạy, bạn có thể lưu và chạy syntax SPSS. Syntax giúp bạn ghi lại thứ tự xử lý, tên biến và tùy chọn trong từng lần chạy, nhất là khi phải loại một biến quan sát rồi chạy lại.

Khi nghiên cứu cắt ngang không đạt thì xử lý thế nào

Trước hết, xác định “không đạt” đang nói đến điều gì. Một nghiên cứu có thể gặp cỡ mẫu thấp, thang đo có Cronbach's Alpha thấp, EFA không phù hợp, hồi quy không có ý nghĩa hoặc tỷ lệ phản hồi không đại diện. Mỗi vấn đề có cách xử lý khác nhau, không nên xóa dữ liệu tùy ý chỉ vì output không đẹp.

Nếu thiếu cỡ mẫu, kiểm tra trước số phản hồi hợp lệ và số biến thực sự đưa vào mô hình. Sau đó xem bạn có loại nhầm các bản ghi thiếu dữ liệu hay không. Nếu vẫn thiếu, cách bảo vệ được với giảng viên thường là thu thêm dữ liệu theo đúng tiêu chí chọn mẫu hoặc thu hẹp câu hỏi nghiên cứu có lý do phương pháp rõ ràng. Việc nhân bản dòng dữ liệu không phải là xử lý thống kê hợp lệ.

Nếu Cronbach's Alpha thấp, mở bảng Item-Total Statistics và xem Corrected Item-Total Correlation, nội dung biến quan sát và hướng mã hóa. Corrected Item-Total Correlation từ 0.3 trở lên là mốc thường được dùng theo (Nunnally và Bernstein, 1994). Alpha từ 0.7 trở lên thường được chấp nhận, còn alpha từ 0.6 có thể được cân nhắc trong thang đo khám phá theo (Nunnally, 1978) và (Hair và cộng sự, 2010). Bạn cần ghi lý do loại biến, không loại liên tiếp nhiều biến chỉ để đẩy alpha lên.

Nếu EFA không đạt, kiểm tra biến đảo chiều, dữ liệu thiếu, biến có quá ít mức trả lời và cách trích nhân tố. Xem KMO and Bartlett's Test, Total Variance Explained và Rotated Component Matrix cùng nhau. EFA hiếm khi ra đúng cấu trúc ở lần chạy đầu. Loại một biến chỉ khi có cơ sở nội dung và thống kê, sau đó chạy lại và lưu từng phiên bản output.

Nếu hồi quy không có p-value dưới 0.05, hãy báo cáo kết quả đúng như vậy. Không đổi thiết kế cắt ngang thành nghiên cứu theo thời gian chỉ bằng cách đổi tên tiêu đề. Bạn có thể kiểm tra lại giả định, mã hóa, outlier và đặc tả mô hình, nhưng không được hứa trước rằng việc sửa dữ liệu sẽ làm giả thuyết có ý nghĩa.

Phân biệt nghiên cứu cắt ngang với nghiên cứu theo thời gian

Nghiên cứu theo thời gian, thường gọi là longitudinal study, thu thập dữ liệu ở từ hai thời điểm trở lên để quan sát thay đổi hoặc thứ tự xảy ra giữa các biến. Nếu bạn khảo sát cùng một nhóm nhân viên vào tháng 1, tháng 6 và tháng 12, đó là thiết kế theo thời gian. Nếu bạn khảo sát ba nhóm khác nhau ở ba thời điểm, cách diễn giải còn phụ thuộc việc bạn có theo dõi cùng cá nhân hay không.

Tiêu chíNghiên cứu cắt ngangNghiên cứu theo thời gian
Thời điểm đoMột đợt hoặc một khoảng thu thập ngắnTừ hai thời điểm trở lên
Đối tượngCó thể là một mẫu tại thời điểm khảo sátCó thể theo dõi cùng người hoặc các mẫu lặp lại
Câu hỏi phù hợpThực trạng và mối liên hệ hiện tạiThay đổi, xu hướng và thứ tự thời gian
Chi phí và thời gianThường thấp hơnThường cao hơn do phải duy trì các đợt đo
Giới hạn chínhKhó xác định quan hệ trước sau và nhân quảCó thể gặp mất mẫu giữa các đợt và hiệu ứng đo lặp

Vì vậy, “nghiên cứu theo thời gian bao nhiêu là tốt” không chỉ có nghĩa là bao nhiêu người. Bạn còn phải quyết định bao nhiêu đợt đo, khoảng cách giữa các đợt và cách giữ mã định danh. Không có mốc chung trong danh mục nguồn hiện có để khẳng định một số đợt cụ thể là đạt cho mọi đề tài.

Trong SPSS, nghiên cứu theo thời gian thường cần cấu trúc dữ liệu có biến thời điểm hoặc dạng long và wide phù hợp với phân tích. Nghiên cứu cắt ngang đơn giản hơn ở chỗ mỗi dòng thường đại diện cho một người trả lời và không có yêu cầu theo dõi lại. Dù dùng SPSS hay SmartPLS, thiết kế nghiên cứu phải được xác định trước khi xem output.

Lỗi thường gặp

Gọi mọi khảo sát là nghiên cứu cắt ngang

Một bảng hỏi phát online chưa đủ để mô tả toàn bộ thiết kế. Bạn cần nêu thời gian thu thập, đối tượng, tiêu chí chọn mẫu và việc mỗi người được đo một lần hay nhiều lần.

Viết kết luận nhân quả từ tương quan

Cụm “X ảnh hưởng đến Y” cần phù hợp với mô hình, giả thuyết và cách diễn giải. Với dữ liệu cắt ngang, dùng “có mối liên hệ” hoặc “có tác động thống kê theo mô hình hồi quy” thường thận trọng hơn, sau đó nêu giới hạn về thứ tự thời gian.

Dùng cỡ mẫu như một con số trang trí

Bạn không nên viết “thu được 250 mẫu nên đạt” mà không nói 250 là số phản hồi hợp lệ hay tổng số phản hồi, có bao nhiêu biến quan sát và vì sao mẫu phù hợp với mô hình.

Chọn mẫu thuận tiện nhưng kết luận cho toàn bộ tổng thể

Nếu bạn chỉ khảo sát người theo dõi một trang hoặc sinh viên một lớp, hãy mô tả đúng phạm vi mẫu. Đừng dùng các từ “tất cả”, “toàn bộ” hoặc “đại diện cho cả nước” khi thiết kế và dữ liệu không hỗ trợ.

Trộn nghiên cứu cắt ngang với nghiên cứu theo thời gian

Một khảo sát kéo dài ba tuần vẫn có thể là cắt ngang. Ngược lại, khảo sát nhiều đợt để đo thay đổi không nên mô tả như một đợt cắt ngang duy nhất.

Cách viết vào luận văn: “Nghiên cứu sử dụng thiết kế cắt ngang, trong đó dữ liệu được thu thập một lần từ [đối tượng nghiên cứu] trong khoảng thời gian [thời gian]. Thiết kế này phù hợp với mục tiêu xem xét [thực trạng/mối liên hệ] giữa [các biến], nhưng kết quả cần được diễn giải trong phạm vi mẫu và thời điểm khảo sát.”

Đọc thêm: biến định tính chạy hồi quy phải làm sao, chuẩn hóa dữ liệu là gì.

Câu hỏi thường gặp

Nghiên cứu cắt ngang có phải khảo sát online không?

Không. Khảo sát online chỉ là phương thức thu thập. Bạn có thể thu thập bằng bảng hỏi giấy hoặc biểu mẫu điện tử. Thiết kế cắt ngang nằm ở việc dữ liệu được đo trong một đợt, thay vì theo dõi sự thay đổi qua nhiều thời điểm.

Nghiên cứu cắt ngang có chạy hồi quy được không?

Có, nếu biến và câu hỏi nghiên cứu phù hợp với hồi quy, dữ liệu được làm sạch và các giả định cần thiết được kiểm tra. Kết quả hồi quy trên dữ liệu cắt ngang cho biết mối liên hệ hoặc mức giải thích trong mô hình, không tự động chứng minh quan hệ nhân quả.

Nghiên cứu cắt ngang bao nhiêu mẫu là đủ?

Bạn cần xem số biến quan sát, số biến độc lập, tổng thể và cách chọn mẫu. Có thể tham khảo tỷ lệ 5 đến 10 quan sát cho mỗi biến quan sát theo (Hair và cộng sự, 2010), hoặc công thức 50 + 8m cho hồi quy theo (Tabachnick và Fidell, 2013), rồi giải thích cách chọn số cuối cùng.

Nghiên cứu cắt ngang có cần kiểm định độ tin cậy thang đo không?

Nếu bạn dùng thang đo nhiều biến quan sát, thường cần kiểm tra độ tin cậy và giá trị của thang đo trước khi kiểm định mô hình. Cronbach's Alpha, Corrected Item-Total Correlation và EFA là các bước có thể phù hợp, tùy mô hình và kế hoạch phân tích.

Nghiên cứu theo thời gian trong SPSS có khó hơn không?

Phần khó nằm ở cấu trúc dữ liệu và việc giữ mã định danh qua các đợt, không chỉ ở thao tác menu. Bạn phải biết mỗi dòng là một người tại một thời điểm hay một người có nhiều cột đo lặp lại, rồi mới chọn thủ tục SPSS phù hợp.

Mở file dữ liệu của bạn, ghi riêng thiết kế cắt ngang, thời gian thu thập, số phản hồi hợp lệ và số biến đưa vào mô hình, sau đó đối chiếu từng bảng output với câu hỏi nghiên cứu; nếu cần chạy phân tích trên chính file .sav hoặc .csv, bạn có thể xem M4 phân tích dữ liệu của DoThesis.