Thu thập dữ liệu là gì? Cách làm cho luận văn định lượng

Thống kê··15 phút đọc

Thu thập dữ liệu là gì

Thu thập dữ liệu là quá trình bạn lấy các thông tin cần thiết từ một nhóm đối tượng, sau đó ghi nhận chúng theo cấu trúc đủ rõ để phân tích. Với luận văn định lượng, dữ liệu thường nằm trong bảng hỏi với các biến quan sát, thang đo Likert, câu hỏi nhân khẩu học và một số biến sàng lọc.

Quy trình này bắt đầu trước khi bạn mở SPSS. Bạn phải biết đề tài cần đo khái niệm nào, ai là đối tượng trả lời, mỗi biến được mã hóa ra sao và câu trả lời sẽ được đưa vào cột nào trong file .sav hoặc .csv. Nếu thu thập sai đối tượng hoặc đặt câu hỏi không đo đúng khái niệm, việc chạy Cronbach's Alpha hay EFA sau đó cũng không sửa được vấn đề gốc.

Có thể hình dung dữ liệu định lượng theo chuỗi: mô hình nghiên cứu, biến và thang đo, bảng hỏi, người trả lời, dữ liệu thô, dữ liệu sạch, kết quả phân tích. Một công thức riêng áp dụng cho mọi đề tài là điều không tồn tại. Cỡ mẫu và cách thu thập phụ thuộc vào tổng thể, số biến quan sát, mô hình và khả năng tiếp cận người trả lời.

Bạn nên xem chủ đề Thống kê nếu đang cần nối bước thu thập dữ liệu với Cronbach's Alpha, EFA, hồi quy hoặc SmartPLS.

Ý nghĩa của thu thập dữ liệu trong nghiên cứu định lượng

Thu thập dữ liệu quyết định ba việc trong luận văn. Thứ nhất, dữ liệu cho biết bạn có thể kiểm định các giả thuyết đã đặt ra hay không. Một giả thuyết về ảnh hưởng của chất lượng dịch vụ đến sự hài lòng cần các biến đo được cho cả hai khái niệm, cùng với câu trả lời của đúng nhóm khách hàng.

Thứ hai, dữ liệu ảnh hưởng đến độ tin cậy và giá trị của thang đo. Một bảng hỏi có nhiều câu nhưng người trả lời không hiểu, chọn cùng một mức cho mọi câu hoặc trả lời ngoài đối tượng sẽ tạo ra dữ liệu nhiễu. Bạn có thể thấy Cronbach's Alpha cao, nhưng điều đó chưa chứng minh bảng hỏi đã đo đúng khái niệm.

Thứ ba, dữ liệu quyết định khả năng giải trình. Khi giảng viên hỏi bạn lấy mẫu ở đâu, trong khoảng thời gian nào, có bao nhiêu phiếu hợp lệ và loại phiếu theo tiêu chí gì, câu trả lời phải khớp với file dữ liệu và phần phương pháp nghiên cứu. Đừng chỉ ghi rằng bạn đã thu thập đủ số lượng. Hãy lưu lại đường dẫn bảng hỏi, thời gian mở khảo sát, tiêu chí lọc và nhật ký làm sạch.

Trong nghiên cứu định lượng, dữ liệu thường được thu thập bằng bảng hỏi có cấu trúc. Bạn có thể phát bảng hỏi trực tuyến, gửi qua email, nhóm cộng đồng hoặc thu trực tiếp bằng biểu mẫu điện tử. Phương tiện phân phối chỉ là kênh. Chất lượng phương pháp nằm ở việc người trả lời có đúng tổng thể mục tiêu và câu hỏi có được thiết kế nhất quán hay không.

Thu thập dữ liệu bao nhiêu là đạt

Cụm “bao nhiêu là đạt” thường bị hiểu thành một con số cố định. Thực tế, bạn cần tách ít nhất bốn câu hỏi: có bao nhiêu phản hồi, bao nhiêu phản hồi hợp lệ, mỗi biến quan sát có đủ dữ liệu không, và mẫu có phù hợp với mô hình không.

Nếu dùng quy tắc theo số biến quan sát, Hair và cộng sự cho rằng có thể cân nhắc khoảng 5 đến 10 quan sát cho mỗi biến quan sát (Hair và cộng sự, 2010). Đây là cơ sở lập kế hoạch, không phải giấy phép để lấy một mẫu bất kỳ rồi gọi là đại diện. Nếu mô hình có 25 biến quan sát, khoảng tham khảo theo cách này là 125 đến 250 phản hồi, sau đó bạn vẫn phải xem xét số biến độc lập và kỹ thuật phân tích.

Nếu bạn chạy hồi quy với m biến độc lập, một quy tắc thường được trích dẫn là cỡ mẫu tối thiểu n từ 50 + 8m trở lên (Tabachnick và Fidell, 2013). Hai cách tính có thể cho kết quả khác nhau. Khi đó, hãy chọn mức phù hợp với mô hình và yêu cầu của giảng viên, đồng thời dự phòng các phiếu bị loại.

Tiêu chí cần kiểm traMức tham khảo hoặc cách quyết địnhNguồn và ghi chú
Số quan sát trên mỗi biến quan sátKhoảng 5 đến 10 quan sát cho một biến quan sát(Hair và cộng sự, 2010), dùng để lập kế hoạch mẫu
Hồi quy với m biến độc lậpn từ 50 + 8m trở lên(Tabachnick và Fidell, 2013)
Cỡ mẫu theo tổng thể hữu hạnDùng công thức cỡ mẫu hữu hạn khi biết quy mô tổng thể(Yamane, 1967)
Phân tích nhân tốXem đồng thời cỡ mẫu, số biến, communalities và chất lượng dữ liệu(Comrey và Lee, 1992), không nên dùng một ngưỡng duy nhất
Thang LikertChọn số mức nhất quán trong toàn bộ bảng hỏiThang đo Likert được giới thiệu bởi (Likert, 1932)

“Số liệu minh họa” dưới đây cho thấy cách bạn theo dõi quá trình thu thập. Các con số chỉ để minh họa cách ghi nhận, không phải kết quả của một nghiên cứu thật.

Giai đoạnSố phiếuGhi chú
Phản hồi nhận được286Tải xuống từ biểu mẫu
Loại do thiếu quá nhiều câu trả lời17Bỏ trống trên 20% mục hỏi
Loại do không đúng đối tượng9Không đáp ứng câu hỏi sàng lọc
Loại do trả lời quá nhanh6Cần đối chiếu thời gian và mẫu trả lời
Phiếu hợp lệ đưa vào SPSS254Dùng cho bước làm sạch và phân tích

Bạn nên dự phòng số phiếu cao hơn mức tối thiểu dự kiến. Tỷ lệ bị loại không giống nhau giữa các đề tài, nên đừng hứa trước rằng mọi phản hồi sẽ được giữ lại. Trong chương 3, bạn có thể trình bày số phiếu phát ra, số phản hồi nhận được, tiêu chí loại và số phiếu cuối cùng.

Cách đọc dữ liệu thu thập trên output

Sau khi xuất dữ liệu, SPSS chưa cho bạn một bảng tên là “chất lượng thu thập dữ liệu”. Bạn phải đọc qua nhiều vị trí. Trước hết là Data View để xem các dòng phản hồi và Variable View để kiểm tra tên biến, nhãn giá trị, loại dữ liệu, Missing và Measure.

Trong Variable View, một biến quan sát như PU1, PU2, PU3 có thể được khai báo dạng Numeric, Decimals bằng 0, Values từ 1 đến 5 và Measure là Scale. Các biến giới tính hoặc nhóm tuổi có thể được mã hóa bằng số nhưng bản chất là biến phân loại. Việc một cột chứa số không tự động biến nó thành biến Scale.

Bạn có thể chạy bảng tần số bằng Analyze > Descriptive Statistics > Frequencies. Chọn các biến sàng lọc và biến nhân khẩu học, sau đó xem Frequency, Percent, Valid Percent và Cumulative Percent. Nếu một nhóm có tần suất bằng 0, hãy kiểm tra lại mã hóa hoặc cách xuất biểu mẫu.

Bảng dưới đây là “số liệu minh họa” theo cách SPSS thường hiển thị. Đây không phải phát hiện từ luận văn nào.

VariableN hợp lệMissingMinimumMaximumMeanStd. Deviation
PU12540153.740.86
PU22522153.680.91
PU32540153.810.82
SAT12540153.590.95

Cột N cho biết có bao nhiêu giá trị được dùng trong thống kê của biến đó. Missing cho biết số giá trị trống. MinimumMaximum giúp bạn phát hiện mã ngoài phạm vi, chẳng hạn thang Likert chỉ cho phép từ 1 đến 5 nhưng một dòng lại có giá trị 7. MeanStd. Deviation giúp nhìn phân phối sơ bộ, nhưng không đủ để kết luận thang đo tốt hay xấu.

Bạn cũng nên kiểm tra dữ liệu trùng lặp. Nếu một người gửi biểu mẫu hai lần, việc giữ cả hai dòng có thể làm sai tỷ trọng nhóm và tạo cảm giác cỡ mẫu lớn hơn thực tế. Kiểm tra theo mã người trả lời nếu bạn có mã riêng. Nếu không có mã, chỉ được loại khi có căn cứ như thời gian gửi, mẫu trả lời hoặc thông tin trùng nhau, và phải ghi lại quyết định.

Nếu trong quá trình kiểm tra bạn thấy một vài giá trị rất lệch, đó có thể là outliers. Đừng xóa dòng chỉ vì giá trị làm kết quả “đẹp” hơn. Hãy xem đó là lỗi nhập liệu, câu trả lời hợp lệ nhưng cực trị, hay một phản hồi không đáng tin cậy.

Khi thu thập dữ liệu không đạt thì xử lý thế nào

Nếu số phản hồi thấp, bước đầu tiên là kiểm tra lại tiêu chí mẫu và kênh tiếp cận. Bạn có đang gửi bảng hỏi đến đúng nhóm mục tiêu không, hay chỉ gửi trong một nhóm thuận tiện. Một mẫu thuận tiện có thể sử dụng trong giới hạn của đề tài, nhưng bạn phải mô tả đúng cách lấy mẫu và không viết quá mức rằng mẫu đại diện cho toàn bộ dân số.

Nếu nhiều người bỏ trống câu hỏi, hãy xem câu đó có bắt buộc không, có khó hiểu không hoặc có yêu cầu thông tin khiến người trả lời ngại cung cấp không. Với dữ liệu đã thu, bạn có thể đặt quy tắc loại phiếu thiếu quá nhiều thông tin. Không nên tự điền câu trả lời trung bình vào hàng loạt ô trống khi chưa có lý do phương pháp rõ ràng.

Nếu các biến có một mức trả lời áp đảo, hãy kiểm tra câu hỏi có dẫn dắt hay không và đối tượng có thực sự trải nghiệm điều được hỏi không. Ví dụ, khảo sát trải nghiệm ứng dụng nhưng người trả lời chưa từng sử dụng ứng dụng sẽ làm dữ liệu mất ý nghĩa. Câu hỏi sàng lọc cần đặt trước nhóm thang đo để loại đúng đối tượng từ đầu.

Nếu phiếu hợp lệ chưa đủ, bạn có thể mở rộng thời gian hoặc kênh thu thập, nhưng phải giữ nguyên tiêu chí chọn mẫu và phiên bản bảng hỏi. Khi thay đổi câu chữ, số mức Likert hoặc thứ tự nhóm câu hỏi giữa chừng, hãy ghi lại thời điểm thay đổi. Dữ liệu từ hai phiên bản có thể không còn hoàn toàn tương đương.

Có những vấn đề không thể sửa bằng phần mềm. Không thể biến người trả lời sai đối tượng thành người thuộc tổng thể mục tiêu bằng cách đổi mã. Không thể làm cho một biến đo sai khái niệm trở nên hợp lệ bằng cách xóa vài dòng. Nếu lỗi nằm ở thiết kế bảng hỏi, trao đổi sớm với giảng viên để quyết định thu lại dữ liệu hoặc giới hạn kết luận.

Phân biệt thu thập dữ liệu với thiết kế thang đo

Thu thập dữ liệu là hành động lấy phản hồi từ đối tượng. Thiết kế thang đo là quyết định bạn dùng khái niệm nào, biến quan sát nào, cách diễn đạt nào và thang điểm nào để đo khái niệm đó. Hai việc đi cùng nhau nhưng không thay thế nhau.

Ví dụ, bạn có thể thu được 300 phản hồi cho một bảng hỏi về ý định sử dụng, nhưng nếu các biến quan sát chỉ hỏi về mức độ dễ sử dụng thì dữ liệu chưa đo đầy đủ ý định. Ngược lại, một scale là gì và được xây dựng tốt vẫn không tạo ra dữ liệu có giá trị nếu bảng hỏi được gửi sai đối tượng.

Cũng cần phân biệt biến kiểm soát, biến trung gian và biến điều tiết. Biến điều tiết làm thay đổi mức độ hoặc hướng của quan hệ giữa hai biến, còn biến trung gian giải thích cơ chế của quan hệ đó. Khi mô hình có moderator, bạn phải thu thập thêm thông tin cần thiết để phân nhóm hoặc kiểm định tương tác. Có thể xem thêm cách dùng moderatormoderating để tránh nhập nhầm vai trò biến vào bảng dữ liệu.

Cuối cùng, thu thập dữ liệu khác với nhập dữ liệu. Biểu mẫu có thể tự xuất một file, nhưng bạn vẫn phải kiểm tra mã hóa, tên biến, dữ liệu thiếu và các phản hồi không hợp lệ trước khi chạy phân tích.

Lỗi thường gặp

Lỗi đầu tiên là phát bảng hỏi trước khi chốt mô hình và thang đo. Khi đó, bạn dễ thiếu biến cho một giả thuyết hoặc dùng cùng một mã cho hai khái niệm khác nhau. Hãy lập danh sách mã biến trước, chẳng hạn PU1 đến PU4, SAT1 đến SAT4, rồi đối chiếu với bảng hỏi.

Lỗi thứ hai là đổi mã Likert giữa các nhóm câu. Nếu 1 có nghĩa “hoàn toàn không đồng ý” ở phần này nhưng lại có nghĩa “hoàn toàn đồng ý” ở phần khác, bạn sẽ tạo ra dữ liệu không nhất quán. Biến đảo chiều cần được ghi rõ và xử lý có chủ đích trước khi chạy độ tin cậy.

Lỗi thứ ba là chỉ nhìn số lượng phiếu mà bỏ qua chất lượng. Dòng dữ liệu đầy đủ vẫn có thể là câu trả lời theo một đường thẳng, gửi quá nhanh hoặc không qua câu hỏi sàng lọc. Hãy lưu một bản dữ liệu thô, một bản dữ liệu sau làm sạch và bảng nhật ký nêu rõ từng loại phiếu bị loại.

Lỗi thứ tư là loại dữ liệu theo kết quả kiểm định. Bạn không nên xóa một nhóm người trả lời chỉ vì họ làm Cronbach's Alpha giảm, trừ khi có tiêu chí phương pháp độc lập và được giải trình. Việc chạy lại nhiều lần để tìm kết quả đẹp làm tăng rủi ro bị hỏi ở buổi bảo vệ.

Lỗi cuối là viết số liệu trong chương 3 không khớp chương 4. Số phiếu hợp lệ, thời gian khảo sát, cách lấy mẫu và đặc điểm mẫu phải được đối chiếu với file cuối cùng bạn dùng phân tích.

Câu hỏi thường gặp

Thu thập dữ liệu là gì trong nghiên cứu định lượng?

Đó là quá trình lấy thông tin có cấu trúc từ đối tượng nghiên cứu để tạo thành dữ liệu số, thường thông qua bảng hỏi. Dữ liệu phải gắn với biến, thang đo, tiêu chí mẫu và kế hoạch phân tích đã xác định.

Thu thập dữ liệu bao nhiêu là đủ?

Không có một con số đúng cho mọi đề tài. Bạn có thể tham khảo 5 đến 10 quan sát cho mỗi biến quan sát (Hair và cộng sự, 2010), hoặc n từ 50 + 8m cho hồi quy với m biến độc lập (Tabachnick và Fidell, 2013), sau đó đối chiếu với mô hình và yêu cầu của giảng viên.

Có nên dùng Google Forms để thu thập dữ liệu không?

Google Forms có thể đáp ứng bảng hỏi cơ bản và xuất dữ liệu. fillform.info là công cụ biểu mẫu của DoThesis, phù hợp khi bạn muốn quản lý bảng hỏi và phản hồi trong quy trình riêng. Dù dùng công cụ nào, bạn vẫn phải kiểm tra đối tượng, dữ liệu thiếu, phản hồi trùng và mã hóa trước khi nhập SPSS.

Dữ liệu bị thiếu thì làm sao?

Trước tiên, xác định dữ liệu thiếu nằm ở vài ô hay cả phiếu. Với phiếu bỏ trống quá nhiều, bạn có thể loại theo tiêu chí đã đặt trước. Với vài ô thiếu, cách xử lý phụ thuộc vào tỷ lệ thiếu, loại biến và yêu cầu phân tích. Hãy ghi rõ quyết định, tránh tự thay toàn bộ bằng giá trị trung bình mà không giải thích.

Có được xóa phiếu để Cronbach's Alpha đẹp hơn không?

Bạn chỉ nên loại phiếu khi có tiêu chí độc lập như sai đối tượng, thiếu quá nhiều, trùng lặp hoặc có dấu hiệu không đáng tin cậy. Không nên xóa chỉ vì phiếu làm Alpha giảm. Nếu loại một biến sau khi chạy phân tích, hãy nêu căn cứ của biến đó và cập nhật lại bảng kết quả, bảng thang đo cùng phần thảo luận.

Bạn hãy mở file dữ liệu ngay bây giờ, tạo một bản sao dữ liệu thô, lập bảng mã biến và ghi lại số phiếu ở từng bước trước khi chạy thống kê. Nếu cần hỗ trợ chạy trên chính file .sav hoặc .csv và kiểm tra quy trình phân tích, xem M4 phân tích dữ liệu của DoThesis.