Dữ liệu sơ cấp là gì? Cách thu thập và sử dụng trong luận văn
Dữ liệu sơ cấp là gì
Dữ liệu sơ cấp là thông tin bạn trực tiếp thu thập từ đối tượng nghiên cứu để trả lời câu hỏi và kiểm định giả thuyết của đề tài. Ví dụ, bạn gửi bảng hỏi cho người đã sử dụng ví điện tử, thu về 320 phiếu trả lời, sau đó nhập các biến quan sát vào SPSS. Phần trả lời đó là dữ liệu sơ cấp của nghiên cứu.
Điểm cốt lõi nằm ở nguồn và mục đích thu thập. Dữ liệu được tạo ra trực tiếp cho đề tài hiện tại, theo đúng nhóm đối tượng, thời gian và biến số bạn đã xác định trong mô hình. Nó có thể tồn tại dưới dạng câu trả lời Likert, thông tin nhân khẩu học, số lần mua hàng, mức chi tiêu hoặc điểm đánh giá một dịch vụ.
Trong luận văn định lượng, dữ liệu sơ cấp thường được thu thập bằng bảng hỏi có cấu trúc. Bạn thiết kế các biến quan sát cho từng khái niệm, dùng thang Likert, thu thập phản hồi, mã hóa thành số rồi đưa vào file .sav hoặc .csv. Chẳng hạn, mức độ đồng ý có thể được mã hóa từ 1 đến 5 theo thang Likert, một kỹ thuật đo lường thái độ được giới thiệu từ (Likert, 1932).
Bạn có thể đọc thêm về nghiên cứu khoa học để đặt dữ liệu sơ cấp vào toàn bộ quy trình từ câu hỏi nghiên cứu, mô hình, bảng hỏi đến phân tích.
Ý nghĩa của dữ liệu sơ cấp trong nghiên cứu định lượng
Dữ liệu sơ cấp quyết định bạn có thể kiểm định mô hình nghiên cứu hay không. Nếu mô hình có giả thuyết về ảnh hưởng của perceived usefulness, trust và perceived ease of use đến ý định sử dụng, bảng hỏi phải tạo ra các biến quan sát tương ứng. Sau khi thu thập, bạn mới có dữ liệu để chạy Cronbach's Alpha, EFA, hồi quy hoặc PLS-SEM.
Dữ liệu này cũng giúp bạn kiểm soát bối cảnh nghiên cứu. Bạn có thể xác định rõ người trả lời thuộc nhóm nào, khảo sát trong khoảng thời gian nào, câu hỏi được diễn đạt ra sao và tiêu chí loại phiếu là gì. Mức độ kiểm soát đó thường cần thiết khi đề tài nghiên cứu một thị trường, trường đại học hoặc nhóm người dùng cụ thể.
Tuy nhiên, dữ liệu sơ cấp không tự động trở thành dữ liệu tốt chỉ vì bạn tự thu thập. Một bảng hỏi có biến quan sát trùng ý, câu trả lời bị bỏ trống nhiều hoặc mẫu chỉ gồm bạn bè của người nghiên cứu có thể làm yếu kết quả. Trước khi gửi bảng hỏi, bạn cần xác định tổng thể, đối tượng đủ điều kiện, cách chọn mẫu, cỡ mẫu và quy tắc làm sạch.
Hãy phân biệt bước này với dữ liệu thứ cấp là gì. Dữ liệu thứ cấp đã được người khác thu thập trước, chẳng hạn báo cáo ngành, niên giám thống kê hoặc dữ liệu công khai. Một luận văn có thể dùng cả hai, nhưng dữ liệu sơ cấp phải phù hợp trực tiếp với mô hình và biến đo lường của bạn.
Dữ liệu sơ cấp bao nhiêu là đạt
Không có một con số duy nhất áp dụng cho mọi đề tài. Cỡ mẫu cần dựa vào số biến quan sát, số biến độc lập, phương pháp phân tích và khả năng tiếp cận tổng thể. Với thang đo định lượng, (Hair và cộng sự, 2010) nêu quy tắc từ 5 đến 10 quan sát cho mỗi biến quan sát. Với hồi quy, (Tabachnick và Fidell, 2013) đưa ra quy tắc cỡ mẫu từ 50 + 8m, trong đó m là số biến độc lập.
Các tiêu chí dưới đây giúp bạn kiểm tra dữ liệu sau khi thu thập. Đây là ngưỡng tham khảo có nguồn, không phải giấy phép để giữ lại một bảng hỏi kém chất lượng chỉ nhằm đủ số lượng.
| Nội dung kiểm tra | Ngưỡng hoặc nguyên tắc | Nguồn |
|---|---|---|
| Số quan sát trên mỗi biến quan sát | Từ 5 đến 10 quan sát cho một biến quan sát | (Hair và cộng sự, 2010) |
| Cỡ mẫu cho hồi quy | Từ 50 + 8m trở lên | (Tabachnick và Fidell, 2013) |
| Cronbach's Alpha | Từ 0.7; thang đo khám phá có thể xem xét từ 0.6 | (Nunnally, 1978) và (Hair và cộng sự, 2010) |
| Corrected Item-Total Correlation | Từ 0.3 trở lên | (Nunnally và Bernstein, 1994) |
| KMO khi chạy EFA | Từ 0.5 trở lên | (Kaiser, 1974) |
| Bartlett's Test of Sphericity | Sig. nhỏ hơn 0.05 | (Kaiser, 1974) |
| Total Variance Explained | Từ 50% trở lên | (Hair và cộng sự, 2010) |
| Factor loading | Từ 0.5 trở lên | (Hair và cộng sự, 2010) |
Ví dụ, bảng hỏi có 28 biến quan sát thì quy tắc 5 đến 10 lần gợi ý khoảng 140 đến 280 quan sát. Nếu mô hình có 5 biến độc lập, quy tắc hồi quy cho mức tối thiểu 90 quan sát. Khi hai cách tính cho kết quả khác nhau, bạn cần xem phương pháp chính, yêu cầu của giảng viên và tỷ lệ phiếu có thể bị loại.
Cỡ mẫu đạt về số lượng vẫn chưa đủ. Bạn cần kiểm tra phiếu có hoàn thành, người trả lời có đúng tiêu chí sàng lọc, thời gian trả lời có bất thường và các câu trả lời có biểu hiện chọn một mức cho toàn bộ bảng hỏi hay không.
Cách đọc dữ liệu sơ cấp trên output
Dữ liệu sơ cấp không xuất hiện trong một bảng duy nhất trên SPSS. Nó đi qua nhiều output, mỗi bảng trả lời một câu hỏi khác nhau. Frequencies giúp xem mã hóa và phân bố ban đầu. Reliability Statistics và Item-Total Statistics kiểm tra độ tin cậy. KMO and Bartlett's Test, Total Variance Explained và Rotated Component Matrix phục vụ EFA.
Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Giả sử bạn có 220 phiếu hợp lệ cho thang đo chất lượng dịch vụ gồm bốn biến quan sát.
| Bảng SPSS | Cột hoặc chỉ số | Dòng minh họa | Cách đọc |
|---|---|---|---|
| Case Processing Summary | Valid N | 220 | Có 220 trường hợp được đưa vào phân tích |
| Reliability Statistics | Cronbach's Alpha | 0.842 | Độ tin cậy nội tại ở mức tốt theo ngưỡng đã chọn |
| Reliability Statistics | N of Items | 4 | Thang đo có 4 biến quan sát |
| Item-Total Statistics | Corrected Item-Total Correlation, DV2 | 0.516 | DV2 đạt ngưỡng 0.3 |
| KMO and Bartlett's Test | Kaiser-Meyer-Olkin Measure | 0.781 | Dữ liệu phù hợp để xem xét EFA |
| KMO and Bartlett's Test | Sig. | 0.000 | Bartlett có ý nghĩa thống kê theo quy tắc Sig. nhỏ hơn 0.05 |
| Total Variance Explained | Cumulative % | 62.418 | Nhân tố giữ lại giải thích 62.418% phương sai |
| Rotated Component Matrix | Factor loading, DV2 | 0.734 | DV2 có tải nhân tố trên 0.5 |
Khi đọc output, bạn nên giữ lại mã biến và số liệu theo từng vòng chạy. Nếu loại DV3, hãy lưu phiên bản trước và sau khi loại. Người hướng dẫn có thể hỏi tại sao biến bị loại, và câu trả lời cần dựa trên Corrected Item-Total Correlation, factor loading, tải chéo hoặc lý do nội dung của biến.
Dữ liệu sơ cấp cũng cần được đối chiếu với file gốc. Nếu số phiếu hợp lệ trong phần mô tả là 220 nhưng bảng Cronbach's Alpha chỉ có 198 trường hợp do missing value, bạn cần giải thích sự khác nhau. Đừng copy một con số từ output này sang bảng khác khi chưa kiểm tra mẫu phân tích.
Khi dữ liệu sơ cấp không đạt thì xử lý thế nào
Thứ nhất, kiểm tra lỗi nhập và mã hóa. Một biến Likert từ 1 đến 5 nhưng file lại có giá trị 0, 6 hoặc ký tự chữ có thể làm sai trung bình, độ lệch chuẩn và các kiểm định. Mở Variable View để kiểm tra Type, Values, Missing và cách đặt tên biến.
Làm sạch phiếu trước khi chạy
Loại các phiếu không đáp ứng tiêu chí sàng lọc, bỏ quá nhiều câu, có mẫu trả lời bất thường hoặc không hoàn thành phần chính của bảng hỏi. Bạn cần ghi lại số phiếu ban đầu, số phiếu loại và lý do loại. Việc này giúp phần phương pháp có thể kiểm tra lại.
Kiểm tra biến đảo chiều
Nếu một biến được diễn đạt theo chiều ngược, bạn phải recode trước khi tính điểm thang đo. Trong SPSS, có thể dùng Transform > Recode into Different Variables. Sau đó kiểm tra lại bảng tần số và tên biến mới. Một biến đảo chiều chưa recode thường làm Cronbach's Alpha giảm và tương quan item-total âm.
Xem xét loại biến có căn cứ
Nếu Corrected Item-Total Correlation dưới 0.3, bạn có thể xem xét loại biến theo (Nunnally và Bernstein, 1994). Nếu factor loading dưới 0.5, có tải chéo cao hoặc không phù hợp về mặt khái niệm, bạn có thể cân nhắc loại theo (Hair và cộng sự, 2010). Mỗi lần chỉ nên thay đổi có kiểm soát, chạy lại và lưu output.
Không nên xóa hàng loạt biến chỉ để Alpha tăng. Một thang đo có Alpha cao nhưng mất nội dung quan trọng vẫn có thể bị hỏi ở phần cơ sở lý thuyết. Nếu vấn đề nằm ở thiết kế bảng hỏi, dữ liệu đã thu thập không thể được sửa hoàn toàn bằng vài thao tác trong SPSS. Khi số phiếu hợp lệ thiếu nghiêm trọng hoặc nhóm trả lời không đúng tổng thể, phương án thuyết phục hơn có thể là thu bổ sung.
Phân biệt dữ liệu sơ cấp với dữ liệu thứ cấp
Dữ liệu sơ cấp được thu thập trực tiếp cho câu hỏi nghiên cứu hiện tại. Dữ liệu thứ cấp đã tồn tại trước khi bạn bắt đầu đề tài và thường được thu từ báo cáo, cơ sở dữ liệu, bài nghiên cứu hoặc cơ quan thống kê. Hai loại có thể cùng xuất hiện trong chương 2 và chương 3, nhưng vai trò của chúng khác nhau.
| Tiêu chí | Dữ liệu sơ cấp | Dữ liệu thứ cấp |
|---|---|---|
| Người thu thập | Chính nhóm nghiên cứu hoặc đơn vị được thuê theo thiết kế của bạn | Tổ chức hoặc tác giả đã thu thập trước |
| Mục đích | Phục vụ trực tiếp câu hỏi và mô hình hiện tại | Phục vụ mục đích ban đầu khác hoặc được tái sử dụng |
| Ví dụ | 320 phiếu khảo sát người dùng ngân hàng số | Báo cáo số lượng người dùng ngân hàng số |
| Mức kiểm soát | Kiểm soát được câu hỏi, đối tượng và thời điểm | Phụ thuộc định dạng, phạm vi và chất lượng nguồn có sẵn |
| Dạng file thường gặp | .sav, .csv, bảng trả lời trực tuyến | PDF, Excel, báo cáo, cơ sở dữ liệu công khai |
Đừng gọi một bảng số liệu lấy từ báo cáo doanh nghiệp là dữ liệu sơ cấp chỉ vì bạn tự tải nó về. Ngược lại, nếu bạn gửi bảng hỏi và lấy phản hồi từ người trả lời, đó là dữ liệu sơ cấp ngay cả khi việc thu thập diễn ra qua Google Forms hoặc một công cụ trực tuyến.
Lỗi thường gặp
Lỗi đầu tiên là bắt đầu thu thập khi mô hình và bảng hỏi chưa chốt. Nếu sau đó bạn thêm một khái niệm mới, dữ liệu cũ có thể không đo được khái niệm đó. Hãy xác định biến độc lập, biến phụ thuộc, biến trung gian hoặc biến điều tiết trước khi tạo bảng hỏi.
Lỗi thứ hai là dùng mẫu thuận tiện nhưng mô tả như mẫu đại diện cho toàn bộ dân số. Bạn có thể dùng convenience sampling nếu đó là lựa chọn thực tế, nhưng cần nói rõ phạm vi mẫu và giới hạn khái quát hóa.
Lỗi thứ ba là giữ toàn bộ phiếu vì sợ thiếu cỡ mẫu. Một phiếu trả lời nhanh bất thường hoặc chọn cùng một mức cho mọi biến có thể làm méo kết quả. Tiêu chí loại phải được đặt trước hoặc giải thích minh bạch, thay vì loại theo cảm tính sau khi xem kết quả.
Lỗi thứ tư là nhập dữ liệu không nhất quán. Tên biến GT, gioitinh và Gender cùng xuất hiện trong một file sẽ gây nhầm khi chạy lệnh. Hãy tạo codebook gồm mã biến, nội dung, loại thang đo, giá trị mã hóa và ghi chú biến đảo chiều.
Nếu bạn còn nhầm giữa nghiên cứu định lượng và các hướng tiếp cận khác, có thể xem phần giải thích NCKH là gì và định tính là gì để xác định đúng phạm vi phương pháp của đề tài. Bài viết này tập trung vào bảng hỏi, dữ liệu số và phân tích bằng SPSS hoặc SmartPLS.
Câu hỏi thường gặp
Dữ liệu sơ cấp là gì trong luận văn?
Đó là dữ liệu bạn trực tiếp thu thập từ đối tượng nghiên cứu để trả lời câu hỏi và kiểm định mô hình của đề tài. Trong luận văn định lượng, dạng phổ biến là các câu trả lời bảng hỏi được mã hóa thành biến số trong file .sav hoặc .csv.
Thu thập dữ liệu sơ cấp bằng cách nào?
Bạn có thể dùng bảng hỏi giấy hoặc bảng hỏi trực tuyến. Với bảng hỏi trực tuyến, DoThesis có công cụ fillform.info của mình để tạo và thu thập phản hồi tiếng Việt; Google Forms là một lựa chọn thay thế phổ biến. Dù dùng công cụ nào, bạn vẫn phải kiểm tra tiêu chí sàng lọc, thời gian trả lời và phiếu không hợp lệ.
Dữ liệu sơ cấp cần bao nhiêu mẫu là đạt?
Câu trả lời phụ thuộc vào số biến quan sát và phương pháp phân tích. Quy tắc 5 đến 10 quan sát cho một biến quan sát được nêu trong (Hair và cộng sự, 2010), còn hồi quy có thể tham khảo công thức 50 + 8m từ (Tabachnick và Fidell, 2013). Bạn nên chọn mức cao hơn khi hai cách tính cho kết quả khác nhau và dự phòng phiếu bị loại.
Dữ liệu sơ cấp không đạt Cronbach's Alpha thì làm sao?
Kiểm tra mã hóa, biến đảo chiều, missing value và Corrected Item-Total Correlation trước. Bạn có thể xem xét loại biến có tương quan item-total thấp, nhưng cần kết hợp với ý nghĩa lý thuyết và lưu lại output từng vòng chạy. Nếu thang đo mới hoặc mang tính khám phá, ngưỡng Alpha có thể được xem xét từ 0.6 theo (Hair và cộng sự, 2010).
Có thể dùng cả dữ liệu sơ cấp và dữ liệu thứ cấp không?
Có. Dữ liệu thứ cấp có thể cung cấp bối cảnh, quy mô thị trường hoặc thông tin nền, còn dữ liệu sơ cấp dùng để đo các biến và kiểm định giả thuyết của mô hình. Bạn cần ghi rõ nguồn, thời điểm và vai trò của từng loại trong chương phương pháp.
Mở file dữ liệu của bạn ngay bây giờ, lập một bảng codebook, đếm số biến quan sát và ghi lại số phiếu hợp lệ trước khi chạy bất kỳ phân tích nào; nếu cần kiểm tra quy trình trên chính file .sav hoặc .csv, bạn có thể dùng module M4 phân tích dữ liệu.