Cách gộp file dữ liệu trong SPSS đúng cách
Bạn mở SPSS lên, có hai hoặc nhiều file khảo sát riêng và muốn biến chúng thành một file duy nhất để chạy Cronbach's Alpha, EFA hoặc hồi quy. Lúc này, thao tác quan trọng nhất là xác định bạn đang cần gộp theo chiều dọc hay theo chiều ngang. Chọn nhầm kiểu gộp có thể làm số dòng, số biến và ý nghĩa dữ liệu bị sai.
Có hai cách chính: Add Cases để nối thêm người trả lời mới vào cuối file, và Add Variables để thêm biến mới vào cùng những người trả lời đã có. Bài viết này dùng giao diện SPSS phổ biến, đồng thời chỉ ra cách chạy gộp file dữ liệu trong SPSS khi các file có tên biến, thứ tự cột hoặc số mã người trả lời không hoàn toàn giống nhau.
Khi nào dùng gộp file dữ liệu trong SPSS
Bạn dùng Add Cases khi các file có cùng bộ biến nhưng chứa những nhóm người trả lời khác nhau. Ví dụ, file khao_sat_mien_bac.sav có 150 người và file khao_sat_mien_nam.sav có 120 người. Nếu cả hai cùng có các biến GT, TUOI, QL1, QL2, QL3, bạn nối 120 dòng của file thứ hai xuống dưới 150 dòng của file thứ nhất. File mới dự kiến có 270 dòng.
Bạn dùng Add Variables khi hai file mô tả cùng một nhóm người trả lời nhưng mỗi file chứa một nhóm biến khác nhau. Chẳng hạn, file thứ nhất có thông tin nhân khẩu học và file thứ hai có các biến đo lường. Hai file phải có một khóa ghép tương ứng, thường là mã người trả lời. Nếu ghép theo vị trí dòng khi hai file đã bị sắp xếp khác nhau, dữ liệu của người này có thể bị gắn sang người khác.
| Tình huống | Lệnh phù hợp | Kết quả mong đợi | Rủi ro chính |
|---|---|---|---|
| Hai file có cùng biến, khác người trả lời | Add Cases | Tăng số dòng | Trùng dòng, lệch tên biến |
| Hai file có cùng người trả lời, khác biến | Add Variables | Tăng số cột | Ghép sai mã người trả lời |
| Một file SPSS và một file Excel | Open hoặc Import, sau đó kiểm tra | Đưa về cùng định dạng | Sai kiểu dữ liệu, mất nhãn |
| Thu thập dữ liệu thành nhiều đợt | Add Cases | Một bộ dữ liệu chung | Khác mã hóa giữa các đợt |
Nếu bạn chưa chắc file nào là dữ liệu gốc, hãy tạo một bản sao trước khi thao tác. Bạn cũng nên ghi lại nguồn của từng file, thời điểm thu thập và số dòng ban đầu. Với dữ liệu khảo sát, có thể xem thêm hướng dẫn về dữ liệu sơ cấp để phân biệt dữ liệu do bạn tự thu thập với dữ liệu lấy từ nguồn có sẵn.
Chuẩn bị dữ liệu trước khi chạy
Trước khi mở lệnh gộp, mở từng file trong SPSS và kiểm tra ở hai cửa sổ Data View và Variable View. Đừng chỉ nhìn tên cột. Hai biến có cùng tên nhưng một biến là Numeric, biến còn lại là String vẫn có thể gây lỗi hoặc tạo ra kết quả không như bạn nghĩ.
Kiểm tra tên và nhãn biến
Với Add Cases, các biến tương ứng nên có cùng tên, cùng kiểu dữ liệu và cùng ý nghĩa. HL1 ở file thứ nhất phải vẫn là biến quan sát đầu tiên của thang đo hài lòng ở file thứ hai. Nếu một file đặt tên là SAT1, bạn cần đổi tên có chủ đích, không nên để SPSS tự tạo hai cột riêng.
Kiểm tra tại Variable View các cột Name, Type, Label, Values, Missing và Measure. Nhãn biến có thể khác nhau nhưng sự khác biệt đó cần được ghi chú. Với thang Likert, hãy kiểm tra mã 1 đến 5 hoặc 1 đến 7 có cùng ý nghĩa ở mọi file. Nếu một file mã 1 là “hoàn toàn không đồng ý”, file kia mã 1 là “hoàn toàn đồng ý”, gộp file sẽ không sửa được sai lệch này.
Kiểm tra mã người trả lời và số dòng
Nếu dùng Add Cases, kiểm tra biến mã người trả lời có bị trùng giữa các file không. Mã trùng có thể xảy ra khi mỗi đợt khảo sát đều bắt đầu từ 001. Bạn có thể thêm tiền tố theo đợt, chẳng hạn MB001 và MN001, trước khi gộp.
Nếu dùng Add Variables, mã người trả lời phải là khóa ghép. Hãy kiểm tra mã này có duy nhất trong mỗi file và có cùng kiểu dữ liệu. 001 dạng String không hoàn toàn giống số 1 dạng Numeric trong thao tác ghép.
Xử lý missing, biến đảo chiều và file nguồn
Giá trị thiếu cần được thống nhất. Ô trống, mã 99 và mã -9 không nên cùng lúc được dùng cho một ý nghĩa nếu bạn chưa khai báo rõ trong cột Missing. Biến đảo chiều cũng phải được recode trước hoặc sau khi gộp theo một quy trình nhất quán. Bạn có thể tham khảo thêm bài chuẩn hóa dữ liệu là gì nếu các file đang dùng cách mã hóa khác nhau.
Lưu toàn bộ file thành bản sao với tên có ngày xử lý, ví dụ data_gop_v01.sav. Không ghi đè lên file gốc. Nếu cần lặp lại quy trình, bạn có thể lưu lệnh bằng syntax, tương tự cách quản lý trong bài chạy syntax SPSS.
Các bước chạy gộp file dữ liệu trong SPSS
Bước 1: Mở file chính
Mở file được chọn làm file chính bằng File > Open > Data. Với Add Cases, file chính thường là file có cấu trúc biến đầy đủ và đã được kiểm tra trước. Với Add Variables, file chính nên chứa mã người trả lời mà bạn muốn dùng làm khóa.
Kiểm tra số dòng ở Data View và ghi lại. Bạn có thể dùng Analyze > Descriptive Statistics > Frequencies để đếm biến mã người trả lời hoặc một biến bắt buộc phải có dữ liệu. Con số trước khi gộp là mốc đối chiếu sau này.
Bước 2: Chọn Add Cases để nối thêm dòng
Chọn Data > Merge Files > Add Cases. Trong hộp thoại, chọn An external SPSS Statistics data file nếu file cần gộp đang nằm ngoài cửa sổ hiện tại, rồi bấm Browse để chọn file thứ hai.
SPSS sẽ hiển thị danh sách biến chung và biến chỉ xuất hiện trong một file. Các biến có dấu * thường là biến trùng tên và có thể được ghép theo cột tương ứng. Nếu tên biến không khớp, hãy quay lại đổi tên hoặc kiểm tra ý nghĩa trước khi bấm tiếp tục.
Bước 3: Chọn Add Variables để nối thêm cột
Chọn Data > Merge Files > Add Variables. Chọn file bên ngoài, sau đó xác định biến khóa trong phần Key Variables. Đưa mã người trả lời vào danh sách khóa. Nếu hai file đã được sắp xếp theo khóa, bật tùy chọn cho biết file đang được sắp xếp theo thứ tự khóa khi SPSS yêu cầu.
Không chọn ghép theo vị trí dòng chỉ vì hai file có cùng số dòng. Cách này chỉ an toàn khi bạn chắc chắn dòng thứ 1 ở hai file thuộc cùng một người, dòng thứ 2 cũng vậy, và không có dòng nào bị lọc hoặc sắp xếp khác.
Bước 4: Lưu thành file mới và ghi lại nhật ký
Sau khi bấm OK, chọn File > Save As và đặt tên mới. Trong ghi chú xử lý, lưu lại tên hai file nguồn, loại gộp, số dòng hoặc số cột trước và sau khi gộp, các biến đã đổi tên và những dòng bị loại.
Nếu bạn thường xuyên nhận dữ liệu từ nhiều đợt, có thể dùng syntax để giảm thao tác thủ công. Tuy nhiên, syntax chỉ lặp lại đúng những gì bạn viết. Nếu đường dẫn file, tên biến hoặc khóa ghép sai, lỗi vẫn được lặp lại ở mọi lần chạy.
Đọc kết quả output sau khi gộp
Gộp file không tạo ra một bảng kiểm định giống hồi quy hay EFA. Bạn cần kiểm tra Data View, Variable View và các bảng tần số để xác nhận cấu trúc sau thao tác. Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật.
| Kiểm tra sau khi gộp | File A trước gộp | File B trước gộp | File sau gộp | Diễn giải |
|---|---|---|---|---|
| Số trường hợp hợp lệ | 150 | 120 | 270 | Phù hợp với Add Cases |
Số biến quan sát QL1 đến QL5 | 5 | 5 | 5 | Bộ biến chung được giữ lại |
| Mã người trả lời trùng | 0 | 0 | 0 | Không phát hiện trùng mã |
Missing của QL1 | 3 | 2 | 5 | Cần giữ cùng quy ước missing |
| Giá trị ngoài thang đo 1 đến 5 | 0 | 1 | 1 | Cần kiểm tra dòng tương ứng |
Để kiểm tra số dòng, vào Analyze > Descriptive Statistics > Frequencies, đưa mã người trả lời hoặc một biến bắt buộc vào ô phân tích. Nếu Add Cases mà số dòng sau gộp không bằng tổng số dòng hợp lệ của hai file, hãy kiểm tra bộ lọc, dòng bị chọn hoặc dữ liệu thiếu.
Để kiểm tra biến bị gộp nhầm, vào Analyze > Descriptive Statistics > Frequencies cho những biến quan trọng. Xem Minimum, Maximum và bảng tần số. Một biến Likert từ 1 đến 5 nhưng xuất hiện giá trị 55 hoặc 0 thường là dấu hiệu nhập sai mã hoặc dùng sai quy ước missing.
Với Add Variables, hãy tạo bảng tần số cho mã người trả lời và kiểm tra số trường hợp không ghép được. Nếu số dòng tăng bất thường, có thể khóa ghép không duy nhất. Trước khi chạy phân tích chính, bạn cũng nên xem lại các biến định tính. Bài biến định tính chạy hồi quy phải làm sao giải thích thêm việc mã hóa các biến nhóm trước hồi quy.
Tiêu chí đánh giá dữ liệu sau khi gộp
Các ngưỡng dưới đây không quyết định file có được gộp hay không. Chúng giúp bạn kiểm tra dữ liệu đã gộp có đủ điều kiện để chuyển sang các phân tích tiếp theo. Mỗi dòng đều nêu nguồn để bạn có thể giải trình khi cần.
| Tiêu chí kiểm tra | Ngưỡng hoặc quy tắc | Nguồn |
|---|---|---|
| Mã người trả lời | Không trùng nếu dùng làm khóa | Quy tắc kiểm tra cấu trúc dữ liệu, không gán ngưỡng thống kê |
| Giá trị của biến Likert | Nằm trong khoảng mã đã thiết kế, ví dụ 1 đến 5 | (Likert, 1932) |
| Corrected Item-Total Correlation | Từ 0.3 trở lên khi kiểm tra độ tin cậy | (Nunnally và Bernstein, 1994) |
| Cronbach's Alpha | Từ 0.7 trở lên; thang đo khám phá có thể xem mức 0.6 theo bối cảnh | (Nunnally, 1978) và (Hair và cộng sự, 2010) |
| KMO trước EFA | Từ 0.5 trở lên | (Kaiser, 1974) |
| Factor loading trong EFA | Từ 0.5 trở lên | (Hair và cộng sự, 2010) |
| Số quan sát trên một biến quan sát | Khoảng 5 đến 10 quan sát cho mỗi biến | (Hair và cộng sự, 2010) |
Nếu dữ liệu sau gộp chưa đạt một tiêu chí, đừng tự động xóa dòng hoặc biến để làm đẹp bảng. Trước hết xác định lỗi đến từ file nguồn, cách mã hóa hay từ một nhóm người trả lời thực sự có đặc điểm khác. Với dữ liệu thứ cấp, quy trình kiểm tra sẽ khác dữ liệu khảo sát, bạn có thể xem thêm dữ liệu thứ cấp là gì.
Cách viết kết quả vào luận văn
Gộp file thường được mô tả trong phần phương pháp và làm sạch dữ liệu, không nên viết như thể đây là một kiểm định giả thuyết. Bạn cần nêu số file, nguồn dữ liệu, số quan sát trước và sau gộp, cách xử lý mã trùng hoặc phản hồi không hợp lệ.
Cách viết vào luận văn: “Dữ liệu được tổng hợp từ [số lượng] file khảo sát, gồm [mô tả nhóm hoặc thời điểm thu thập]. Nhóm nghiên cứu sử dụng chức năng Add Cases trong SPSS để nối các trường hợp có cùng cấu trúc biến. Sau khi kiểm tra mã người trả lời, giá trị thiếu và giá trị ngoài phạm vi [khoảng mã], bộ dữ liệu cuối cùng gồm [số quan sát] quan sát hợp lệ và [số biến] biến phục vụ phân tích.”
Nếu dùng Add Variables, thay câu giữa bằng: “Nhóm nghiên cứu sử dụng chức năng Add Variables, ghép các file theo biến khóa [tên biến khóa]. Các trường hợp không xác định được khóa ghép được [giữ lại và đánh dấu hoặc loại bỏ theo tiêu chí], sau đó kiểm tra lại số biến và số trường hợp trong file cuối.” Chỉ điền con số sau khi bạn đã kiểm tra trên file thật.
Lỗi thường gặp khi chạy gộp file dữ liệu trong SPSS
Hai biến cùng ý nghĩa nhưng khác tên. SPSS xem GIOITINH và GT là hai biến khác nhau. Đổi tên một biến tại Variable View trước khi gộp, đồng thời ghi lại thay đổi trong nhật ký dữ liệu.
Biến cùng tên nhưng khác kiểu. Một biến Numeric và một biến String có thể khiến SPSS cảnh báo hoặc tạo dữ liệu không dùng được. Chọn kiểu dữ liệu thống nhất, sau đó kiểm tra lại mã và nhãn trước khi gộp.
Gộp Add Cases làm tăng số cột. Đây thường là dấu hiệu các file không có tên biến đồng nhất. Hãy xem danh sách biến chỉ có trong một file. Nếu đó là cùng một biến được đặt tên khác, sửa tên trước khi chạy lại.
Add Variables ghép sai người. Nguyên nhân thường là mã khóa bị trùng, khác kiểu dữ liệu hoặc hai file đang có thứ tự khác nhau. Kiểm tra tính duy nhất của khóa và không ghép theo vị trí dòng nếu chưa xác minh.
Số dòng bị giảm. Kiểm tra Data > Select Cases, bộ lọc đang bật, trọng số tại Data > Weight Cases và các dòng đã bị xóa trong file nguồn. Tắt bộ lọc không có nghĩa là những dòng đã xóa sẽ tự quay lại.
Dữ liệu gộp xong nhưng Cronbach's Alpha giảm. Đây không phải bằng chứng chắc chắn rằng thao tác gộp sai. Các nhóm thu thập ở thời điểm hoặc bối cảnh khác nhau có thể trả lời khác nhau. Kiểm tra phân phối, mã đảo chiều, missing và giá trị ngoài phạm vi trước khi quyết định loại biến.
Câu hỏi thường gặp
Gộp file dữ liệu trong SPSS là gì?
Đây là thao tác kết hợp dữ liệu từ nhiều file thành một file để tiếp tục làm sạch và phân tích. Add Cases nối thêm trường hợp theo hàng, còn Add Variables nối thêm biến theo cột.
Nên dùng Add Cases hay Add Variables?
Nếu các file có cùng bộ biến nhưng là những người trả lời khác nhau, dùng Add Cases. Nếu các file mô tả cùng người trả lời nhưng chứa những nhóm biến khác nhau, dùng Add Variables và cần một mã khóa đáng tin cậy.
Có thể gộp file Excel với file SPSS không?
Có. Bạn có thể mở hoặc nhập file Excel bằng File > Open > Data, sau đó kiểm tra tên biến, dòng tiêu đề, kiểu dữ liệu và mã missing. Chỉ gộp sau khi file Excel đã có cấu trúc tương thích với file SPSS.
Vì sao SPSS báo biến không tương thích khi gộp?
Các nguyên nhân thường gặp là tên biến khác nhau, kiểu dữ liệu khác nhau, biến có độ dài String khác nhau hoặc mã hóa không thống nhất. Mở Variable View ở cả hai file và đối chiếu từng biến thay vì chỉ sửa theo thông báo lỗi.
Gộp file xong có cần chạy lại Cronbach's Alpha không?
Có, nếu file mới chứa thêm người trả lời hoặc có thay đổi trong bộ biến. Cronbach's Alpha, EFA và hồi quy phải được chạy trên bộ dữ liệu cuối cùng mà bạn thực sự dùng để kiểm định giả thuyết. Không lấy kết quả từ một file cũ để mô tả file mới.
Bạn hãy tạo bản sao của các file nguồn, ghi rõ mục tiêu là Add Cases hay Add Variables, kiểm tra khóa và số dòng, rồi chạy thao tác trên file mới. Nếu cần chạy phân tích trên chính file .sav hoặc .csv của bạn, module M4 phân tích dữ liệu của DoThesis hỗ trợ kiểm tra và thực hiện bước này.