Dữ liệu thứ cấp là gì? Cách thu thập và sử dụng trong nghiên cứu
Dữ liệu thứ cấp là gì
Dữ liệu thứ cấp là dữ liệu đã được một cá nhân, tổ chức hoặc cơ quan thu thập trước đó cho một mục đích nhất định, sau đó được bạn sử dụng lại cho câu hỏi nghiên cứu của mình. Ví dụ gồm báo cáo tài chính doanh nghiệp, số liệu thống kê của cơ quan nhà nước, dữ liệu dân số, báo cáo ngành, bài nghiên cứu đã công bố, dữ liệu giao dịch hoặc hồ sơ nội bộ được cấp quyền sử dụng.
Điểm cần xác định là thời điểm và mục đích thu thập. Khi bạn tự phát bảng hỏi và nhận câu trả lời từ người tham gia, đó là dữ liệu sơ cấp. Khi bạn tải một bộ số liệu đã tồn tại từ nguồn công khai hoặc nhận dữ liệu lưu trữ của một tổ chức, đó là dữ liệu thứ cấp.
Dữ liệu thứ cấp có thể ở dạng định lượng hoặc định tính. Trong nghiên cứu định lượng, bạn thường gặp các cột số như doanh thu, số lượng khách hàng, tỷ lệ tăng trưởng, điểm đánh giá hoặc số lượt giao dịch theo tháng. Bạn có thể xử lý chúng bằng Excel, SPSS, R hoặc phần mềm khác, tùy thiết kế nghiên cứu. Nếu mới bắt đầu, bạn có thể đọc thêm về nghiên cứu khoa học và NCKH là gì.
Quy trình sử dụng dữ liệu thứ cấp thường gồm năm việc: xác định biến cần đo, tìm nguồn phù hợp, kiểm tra chất lượng, chuẩn hóa dữ liệu và ghi rõ nguồn trong luận văn. Có dữ liệu sẵn không đồng nghĩa với việc bạn có thể đưa ngay vào file .sav hoặc .csv. Bạn vẫn phải chứng minh dữ liệu đo đúng khái niệm và phù hợp với phạm vi nghiên cứu.
Ý nghĩa của dữ liệu thứ cấp trong nghiên cứu định lượng
Dữ liệu thứ cấp giúp bạn trả lời những câu hỏi mà việc phát bảng hỏi mới có thể tốn nhiều thời gian hoặc không khả thi. Nếu đề tài phân tích xu hướng doanh thu của một ngành trong 10 năm, báo cáo thống kê theo năm có thể phù hợp hơn việc hỏi người tiêu dùng nhớ lại toàn bộ hành vi trong quá khứ.
Trong nghiên cứu định lượng, loại dữ liệu này thường được dùng theo ba cách. Thứ nhất, bạn dùng nó để mô tả bối cảnh nghiên cứu, chẳng hạn quy mô thị trường, số lượng doanh nghiệp hoặc tốc độ tăng trưởng. Thứ hai, bạn dùng dữ liệu thứ cấp làm biến trong hồi quy, dữ liệu bảng hoặc phân tích chuỗi thời gian. Thứ ba, bạn kết hợp nó với dữ liệu sơ cấp để kiểm tra hoặc bổ sung cho kết quả từ bảng hỏi.
Trước khi chạy phân tích, hãy trả lời bốn câu hỏi: ai thu thập dữ liệu, dữ liệu được thu thập khi nào, định nghĩa biến có trùng với đề tài không, và đơn vị quan sát có nhất quán không. Một báo cáo ghi “tăng trưởng doanh số” chưa chắc tương đương với “doanh thu thực tế sau khi điều chỉnh lạm phát”. Hai khái niệm gần nhau nhưng có thể không thay thế được cho nhau.
Cấu trúc dữ liệu cũng ảnh hưởng đến phương pháp. Dữ liệu theo doanh nghiệp và theo năm có thể tạo thành dữ liệu panel. Dữ liệu theo tháng cần được kiểm tra tính liên tục của thời gian. Dữ liệu tổng hợp theo tỉnh chỉ cho phép bạn kết luận ở cấp tỉnh, không tự động cho phép kết luận về từng cá nhân.
Nếu bạn đang xây dựng đề tài, hãy đặt dữ liệu thứ cấp trong tổng thể chủ đề Nghiên cứu khoa học để xác định rõ phạm vi, đơn vị phân tích và nguồn lực có thể tiếp cận.
Dữ liệu thứ cấp bao nhiêu là đạt
Dữ liệu thứ cấp không có một ngưỡng duy nhất áp dụng cho mọi đề tài. “Đạt” trước hết có nghĩa là nguồn phù hợp với câu hỏi nghiên cứu, định nghĩa biến rõ ràng, đủ quan sát và có thể kiểm tra nguồn gốc. Các ngưỡng thống kê chỉ được dùng sau khi bạn đã xác định đúng biến và cấu trúc dữ liệu.
| Nội dung cần kiểm tra | Mốc tham khảo | Nguồn |
|---|---|---|
| Số quan sát trên mỗi biến quan sát trong thang đo | 5 đến 10 quan sát cho một biến quan sát | (Hair và cộng sự, 2010) |
| Cỡ mẫu hồi quy với m biến độc lập | Tối thiểu 50 + 8m | (Tabachnick và Fidell, 2013) |
| Cronbach's Alpha | Từ 0.7 trở lên; thang đo khám phá có thể xem xét từ 0.6 | (Nunnally, 1978); (Hair và cộng sự, 2010) |
| Corrected Item-Total Correlation | Từ 0.3 trở lên | (Nunnally và Bernstein, 1994) |
| KMO khi phân tích EFA | Từ 0.5 trở lên | (Kaiser, 1974) |
| Bartlett's Test trong EFA | p-value dưới 0.05 | (Kaiser, 1974) |
| Total variance explained trong EFA | Từ 50% trở lên | (Hair và cộng sự, 2010) |
| Durbin-Watson trong hồi quy | Trong khoảng 1 đến 3 | (Field, 2013) |
Nếu dữ liệu là một bộ chỉ số đã được tổng hợp sẵn, bạn không nên tự động chạy Cronbach's Alpha hoặc EFA. Hai kiểm định này phù hợp với thang đo gồm nhiều biến quan sát cùng đo một khái niệm. Một cột “chỉ số năng lực cạnh tranh” đã được cơ quan khác tính từ nhiều thành phần không giống một bảng hỏi Likert mà bạn tự thiết kế.
Với dữ liệu dân số hữu hạn và mục tiêu tính cỡ mẫu, công thức hữu hạn có thể được tham khảo từ (Yamane, 1967). Công thức này không biến một nguồn dữ liệu không phù hợp thành dữ liệu phù hợp. Chất lượng định nghĩa, phạm vi và cách chọn quan sát vẫn cần được giải trình riêng.
Cách đọc dữ liệu thứ cấp trên output
Khi mở file dữ liệu thứ cấp trong SPSS, bạn cần đọc cả phần mô tả biến và output phân tích. Trong Variable View, kiểm tra tên biến, nhãn biến, kiểu dữ liệu, số chữ số thập phân và mã giá trị. Trong Data View, kiểm tra dữ liệu thiếu, giá trị bất thường và sự thống nhất giữa các dòng.
Ví dụ dưới đây dùng một bộ dữ liệu giả định gồm 120 quan sát theo tháng. Đây là số liệu minh họa, không phải kết quả của một nghiên cứu thực tế.
| Descriptive Statistics | N | Minimum | Maximum | Mean | Std. Deviation |
|---|---|---|---|---|---|
| Doanh_thu_trieu | 120 | 82.00 | 245.00 | 146.38 | 34.71 |
| Chi_phi_marketing | 120 | 5.00 | 42.00 | 18.26 | 8.94 |
| Luot_khach | 120 | 1,240 | 8,950 | 4,816.25 | 1,732.40 |
| Valid N (listwise) | 120 |
Ở bảng Descriptive Statistics, N cho biết số quan sát hợp lệ được đưa vào tính toán. Nếu một biến có N thấp hơn đáng kể so với các biến còn lại, bạn cần kiểm tra dữ liệu thiếu trước khi chạy hồi quy. Minimum và Maximum giúp phát hiện mã sai, chẳng hạn doanh thu bằng âm trong khi định nghĩa biến chỉ cho phép giá trị dương.
Nếu chạy hồi quy tại Analyze > Regression > Linear, bảng Model Summary cho biết R Square và Adjusted R Square. Bảng ANOVA cho biết kiểm định tổng thể của mô hình, còn bảng Coefficients cho biết hệ số của từng biến. Các bảng này chỉ có ý nghĩa khi dữ liệu đã được sắp xếp đúng đơn vị quan sát và mô hình phù hợp với câu hỏi nghiên cứu.
Bạn nên tạo một bảng mã dữ liệu riêng, gồm tên biến, định nghĩa, đơn vị đo, nguồn, khoảng thời gian và cách xử lý giá trị thiếu. Khi giảng viên hỏi một con số lấy từ đâu, bạn có thể truy ngược từ output về cột dữ liệu và tài liệu gốc.
Khi dữ liệu thứ cấp không đạt thì xử lý thế nào
Bạn nên xử lý theo thứ tự từ vấn đề về nguồn đến vấn đề kỹ thuật. Cách làm này giúp tránh việc xóa hàng loạt dữ liệu chỉ để làm đẹp output.
Kiểm tra lại định nghĩa và phạm vi biến
Đọc tài liệu gốc và ghi lại định nghĩa của từng biến. Kiểm tra đơn vị tiền tệ, đơn vị thời gian, khu vực, nhóm đối tượng và phương pháp tổng hợp. Nếu biến trong nguồn không đại diện cho khái niệm trong mô hình, hãy tìm biến thay thế hoặc điều chỉnh câu hỏi nghiên cứu.
Kiểm tra dữ liệu thiếu và mã dữ liệu
Trong SPSS, dùng Analyze > Descriptive Statistics > Frequencies hoặc Analyze > Descriptive Statistics > Descriptives để xem phân bố cơ bản. Tìm các mã như 99, 999 hoặc -1, vì chúng có thể là mã “không biết” chứ không phải giá trị thật. Đọc tài liệu hướng dẫn của nguồn trước khi chuyển các mã này thành missing.
Chuẩn hóa định dạng
Đưa ngày tháng về cùng định dạng, thống nhất đơn vị đo và đặt tên biến không trùng nhau. Nếu gộp dữ liệu từ hai nguồn, lập bảng đối chiếu trước khi nối file. Việc đổi tên cột cần được ghi lại, vì tên mới trong SPSS phải truy ngược được về tên gốc.
Xử lý ngoại lệ có căn cứ
Một giá trị rất lớn chưa chắc là lỗi. Nó có thể phản ánh một doanh nghiệp lớn hoặc một tháng có sự kiện đặc biệt. Chỉ loại quan sát khi có căn cứ từ tài liệu nguồn, quy tắc thu thập hoặc kiểm tra logic rõ ràng. Ghi lại số dòng, lý do và thao tác đã thực hiện.
Tìm nguồn thay thế hoặc thu dữ liệu mới
Nếu nguồn không công bố phương pháp, thiếu nhiều năm quan trọng hoặc không cho phép kiểm tra độ tin cậy, việc sửa trong SPSS sẽ không giải quyết được vấn đề gốc. Bạn có thể tìm nguồn thay thế hoặc kết hợp với dữ liệu sơ cấp. Khi cần phân biệt hai quy trình, xem thêm hướng dẫn về dữ liệu sơ cấp.
Phân biệt dữ liệu thứ cấp với dữ liệu sơ cấp
Câu hỏi “dữ liệu sơ cấp và thứ cấp là gì” thường xuất hiện khi bạn viết chương phương pháp. Điểm phân biệt chính nằm ở người thu thập và mục đích ban đầu, không nằm ở việc dữ liệu có dạng số hay dạng chữ. Dữ liệu sơ cấp có thể là câu trả lời Likert bằng số, còn dữ liệu thứ cấp cũng có thể là hồ sơ văn bản.
| Tiêu chí | Dữ liệu sơ cấp | Dữ liệu thứ cấp |
|---|---|---|
| Người thu thập | Bạn hoặc nhóm nghiên cứu của bạn | Cơ quan, doanh nghiệp hoặc nhà nghiên cứu khác |
| Mục đích ban đầu | Được thiết kế cho câu hỏi hiện tại | Được tạo ra cho mục đích trước đó |
| Ví dụ | Bảng hỏi trực tuyến, thang đo Likert | Báo cáo ngành, số liệu thống kê, hồ sơ giao dịch |
| Quyền kiểm soát | Có thể thiết kế biến và quy trình thu thập | Bị giới hạn bởi định nghĩa và phạm vi nguồn |
| Rủi ro chính | Sai lệch người trả lời, tỷ lệ phản hồi thấp | Thiếu thông tin phương pháp, khác định nghĩa biến |
Dữ liệu thứ cấp và sơ cấp có thể dùng chung trong một nghiên cứu, nhưng bạn cần tách rõ nguồn và thời điểm thu thập. Số liệu ngành có thể dùng để mô tả bối cảnh, còn bảng hỏi dùng để đo nhận thức của người trả lời. Không nên gộp hai loại thành một biến duy nhất nếu chưa có cơ sở về đơn vị đo và khả năng so sánh.
Bạn cũng nên phân biệt dữ liệu thứ cấp với phương pháp định tính. Dữ liệu thứ cấp nói về nguồn gốc dữ liệu, còn định tính nói về dạng dữ liệu và cách phân tích. Một báo cáo văn bản đã công bố là dữ liệu thứ cấp, nhưng cách sử dụng phụ thuộc vào mục tiêu nghiên cứu. Có thể đọc thêm bài định tính là gì để tránh dùng lẫn hai khái niệm.
Lỗi thường gặp
Lỗi đầu tiên là trích dẫn một đường link chung nhưng không ghi tên báo cáo, năm phát hành, đơn vị phát hành và trang chứa số liệu. Người đọc cần biết chính xác con số được lấy từ đâu, đặc biệt khi nguồn có nhiều phiên bản cập nhật.
Lỗi thứ hai là gọi mọi dữ liệu tải trên Internet là dữ liệu thứ cấp đáng tin cậy. Một bảng tổng hợp trên mạng có thể đã bị cắt bớt định nghĩa hoặc sao chép qua nhiều nguồn. Hãy ưu tiên tài liệu gốc và lưu bản PDF, ngày truy cập, tên tệp cùng phiên bản dữ liệu.
Lỗi thứ ba là đổi dữ liệu theo cảm tính để output đạt ngưỡng. Xóa quan sát bất thường, đổi mã missing thành số 0 hoặc thay giá trị trống bằng trung bình đều có thể làm thay đổi kết quả. Mỗi thao tác phải có lý do phương pháp và được ghi trong nhật ký xử lý dữ liệu.
Lỗi thứ tư là dùng dữ liệu tổng hợp để kết luận về cá nhân. Số liệu doanh thu theo tỉnh cho phép bạn phân tích ở cấp tỉnh, không tự động cho phép kết luận rằng từng người dân trong tỉnh có hành vi giống nhau.
Trong phần phương pháp, bạn có thể viết: “Nghiên cứu sử dụng dữ liệu thứ cấp từ [tên cơ quan hoặc báo cáo], được công bố vào [năm], gồm [số quan sát] quan sát trong giai đoạn [thời gian]. Các biến [tên biến] được chuẩn hóa theo [đơn vị], dữ liệu thiếu được xử lý bằng [cách xử lý] và nguồn gốc từng biến được trình bày tại [phụ lục hoặc bảng].” Hãy thay toàn bộ phần trong ngoặc vuông bằng thông tin thật từ file của bạn.
Câu hỏi thường gặp
Dữ liệu thứ cấp là gì trong nghiên cứu khoa học?
Đó là dữ liệu đã tồn tại trước khi bạn thực hiện nghiên cứu hiện tại và được thu thập bởi một cá nhân hoặc tổ chức khác. Báo cáo thống kê, dữ liệu doanh nghiệp, báo cáo ngành và bài nghiên cứu công bố đều có thể là nguồn thứ cấp nếu bạn sử dụng lại chúng cho mục tiêu mới.
Bạn cần ghi rõ nguồn, thời điểm, phạm vi và cách dữ liệu được tạo ra. Chỉ có tên tệp hoặc một đường link chung thường chưa đủ để giải trình.
Dữ liệu thứ cấp lấy ở đâu?
Bạn có thể tìm từ cổng dữ liệu của cơ quan nhà nước, báo cáo thường niên, báo cáo ngành, cơ sở dữ liệu học thuật, hồ sơ doanh nghiệp được cấp quyền hoặc phụ lục của các nghiên cứu đã công bố. Hãy ưu tiên nguồn có đơn vị phát hành, thời gian, định nghĩa biến và phương pháp thu thập rõ ràng.
Nếu tải dữ liệu từ một trang trung gian, hãy truy ngược về nguồn gốc trước khi đưa vào luận văn. Lưu cả phiên bản tài liệu mà bạn đã sử dụng.
Dữ liệu thứ cấp có cần chạy Cronbach's Alpha không?
Chỉ cần chạy Cronbach's Alpha khi dữ liệu của bạn gồm nhiều biến quan sát được thiết kế để đo cùng một khái niệm. Một bảng chỉ số kinh tế hoặc dữ liệu giao dịch không phải thang đo Likert, nên Alpha có thể không phù hợp.
Nếu nguồn đã công bố thang đo nhưng bạn sử dụng lại các biến quan sát đó, hãy mô tả rõ cấu trúc thang đo và kiểm tra độ tin cậy theo thiết kế nghiên cứu của bạn.
Có nên kết hợp dữ liệu sơ cấp và thứ cấp không?
Có thể kết hợp khi hai loại dữ liệu bổ sung cho cùng câu hỏi nghiên cứu và có đơn vị, thời gian, định nghĩa đủ tương thích. Ví dụ, dữ liệu thứ cấp mô tả thị trường, còn dữ liệu sơ cấp đo nhận thức của người trả lời.
Bạn cần trình bày riêng nguồn, quy trình xử lý và giới hạn của từng loại. Không gộp chúng thành một tập dữ liệu duy nhất nếu chưa có cách liên kết hợp lệ.
Dữ liệu thứ cấp bị thiếu nhiều thì phải làm sao?
Trước hết, kiểm tra mã missing và tài liệu gốc để phân biệt ô trống với giá trị bằng 0. Sau đó đánh giá tỷ lệ thiếu theo biến, theo thời gian và theo nhóm quan sát. Cách xử lý có thể là tìm nguồn bổ sung, loại biến không đủ thông tin hoặc dùng phương pháp phù hợp nếu thiết kế nghiên cứu cho phép.
Bạn nên ghi lại số lượng dữ liệu thiếu, tiêu chí xử lý và ảnh hưởng đến cỡ mẫu. Đừng thay toàn bộ ô trống bằng 0 chỉ để đủ dữ liệu chạy SPSS.
Mở file dữ liệu của bạn, lập bảng gồm tên biến, định nghĩa, đơn vị đo, nguồn, thời gian và mã missing, rồi đối chiếu từng dòng với tài liệu gốc. Nếu cần chạy phân tích trên chính file .sav hoặc .csv, bạn có thể dùng module M4 phân tích dữ liệu.