Cách gộp file dữ liệu trong SPSS đúng cách

SPSS··14 phút đọc

Bạn mở SPSS lên, có hai hoặc nhiều file khảo sát riêng và muốn biến chúng thành một file duy nhất để chạy Cronbach's Alpha, EFA hoặc hồi quy. Lúc này, thao tác quan trọng nhất là xác định bạn đang cần gộp theo chiều dọc hay theo chiều ngang. Chọn nhầm kiểu gộp có thể làm số dòng, số biến và ý nghĩa dữ liệu bị sai.

Có hai cách chính: Add Cases để nối thêm người trả lời mới vào cuối file, và Add Variables để thêm biến mới vào cùng những người trả lời đã có. Bài viết này dùng giao diện SPSS phổ biến, đồng thời chỉ ra cách chạy gộp file dữ liệu trong SPSS khi các file có tên biến, thứ tự cột hoặc số mã người trả lời không hoàn toàn giống nhau.

Khi nào dùng gộp file dữ liệu trong SPSS

Bạn dùng Add Cases khi các file có cùng bộ biến nhưng chứa những nhóm người trả lời khác nhau. Ví dụ, file khao_sat_mien_bac.sav có 150 người và file khao_sat_mien_nam.sav có 120 người. Nếu cả hai cùng có các biến GT, TUOI, QL1, QL2, QL3, bạn nối 120 dòng của file thứ hai xuống dưới 150 dòng của file thứ nhất. File mới dự kiến có 270 dòng.

Bạn dùng Add Variables khi hai file mô tả cùng một nhóm người trả lời nhưng mỗi file chứa một nhóm biến khác nhau. Chẳng hạn, file thứ nhất có thông tin nhân khẩu học và file thứ hai có các biến đo lường. Hai file phải có một khóa ghép tương ứng, thường là mã người trả lời. Nếu ghép theo vị trí dòng khi hai file đã bị sắp xếp khác nhau, dữ liệu của người này có thể bị gắn sang người khác.

Tình huốngLệnh phù hợpKết quả mong đợiRủi ro chính
Hai file có cùng biến, khác người trả lờiAdd CasesTăng số dòngTrùng dòng, lệch tên biến
Hai file có cùng người trả lời, khác biếnAdd VariablesTăng số cộtGhép sai mã người trả lời
Một file SPSS và một file ExcelOpen hoặc Import, sau đó kiểm traĐưa về cùng định dạngSai kiểu dữ liệu, mất nhãn
Thu thập dữ liệu thành nhiều đợtAdd CasesMột bộ dữ liệu chungKhác mã hóa giữa các đợt

Nếu bạn chưa chắc file nào là dữ liệu gốc, hãy tạo một bản sao trước khi thao tác. Bạn cũng nên ghi lại nguồn của từng file, thời điểm thu thập và số dòng ban đầu. Với dữ liệu khảo sát, có thể xem thêm hướng dẫn về dữ liệu sơ cấp để phân biệt dữ liệu do bạn tự thu thập với dữ liệu lấy từ nguồn có sẵn.

Chuẩn bị dữ liệu trước khi chạy

Trước khi mở lệnh gộp, mở từng file trong SPSS và kiểm tra ở hai cửa sổ Data ViewVariable View. Đừng chỉ nhìn tên cột. Hai biến có cùng tên nhưng một biến là Numeric, biến còn lại là String vẫn có thể gây lỗi hoặc tạo ra kết quả không như bạn nghĩ.

Kiểm tra tên và nhãn biến

Với Add Cases, các biến tương ứng nên có cùng tên, cùng kiểu dữ liệu và cùng ý nghĩa. HL1 ở file thứ nhất phải vẫn là biến quan sát đầu tiên của thang đo hài lòng ở file thứ hai. Nếu một file đặt tên là SAT1, bạn cần đổi tên có chủ đích, không nên để SPSS tự tạo hai cột riêng.

Kiểm tra tại Variable View các cột Name, Type, Label, Values, MissingMeasure. Nhãn biến có thể khác nhau nhưng sự khác biệt đó cần được ghi chú. Với thang Likert, hãy kiểm tra mã 1 đến 5 hoặc 1 đến 7 có cùng ý nghĩa ở mọi file. Nếu một file mã 1 là “hoàn toàn không đồng ý”, file kia mã 1 là “hoàn toàn đồng ý”, gộp file sẽ không sửa được sai lệch này.

Kiểm tra mã người trả lời và số dòng

Nếu dùng Add Cases, kiểm tra biến mã người trả lời có bị trùng giữa các file không. Mã trùng có thể xảy ra khi mỗi đợt khảo sát đều bắt đầu từ 001. Bạn có thể thêm tiền tố theo đợt, chẳng hạn MB001MN001, trước khi gộp.

Nếu dùng Add Variables, mã người trả lời phải là khóa ghép. Hãy kiểm tra mã này có duy nhất trong mỗi file và có cùng kiểu dữ liệu. 001 dạng String không hoàn toàn giống số 1 dạng Numeric trong thao tác ghép.

Xử lý missing, biến đảo chiều và file nguồn

Giá trị thiếu cần được thống nhất. Ô trống, mã 99 và mã -9 không nên cùng lúc được dùng cho một ý nghĩa nếu bạn chưa khai báo rõ trong cột Missing. Biến đảo chiều cũng phải được recode trước hoặc sau khi gộp theo một quy trình nhất quán. Bạn có thể tham khảo thêm bài chuẩn hóa dữ liệu là gì nếu các file đang dùng cách mã hóa khác nhau.

Lưu toàn bộ file thành bản sao với tên có ngày xử lý, ví dụ data_gop_v01.sav. Không ghi đè lên file gốc. Nếu cần lặp lại quy trình, bạn có thể lưu lệnh bằng syntax, tương tự cách quản lý trong bài chạy syntax SPSS.

Các bước chạy gộp file dữ liệu trong SPSS

Bước 1: Mở file chính

Mở file được chọn làm file chính bằng File > Open > Data. Với Add Cases, file chính thường là file có cấu trúc biến đầy đủ và đã được kiểm tra trước. Với Add Variables, file chính nên chứa mã người trả lời mà bạn muốn dùng làm khóa.

Kiểm tra số dòng ở Data View và ghi lại. Bạn có thể dùng Analyze > Descriptive Statistics > Frequencies để đếm biến mã người trả lời hoặc một biến bắt buộc phải có dữ liệu. Con số trước khi gộp là mốc đối chiếu sau này.

Bước 2: Chọn Add Cases để nối thêm dòng

Chọn Data > Merge Files > Add Cases. Trong hộp thoại, chọn An external SPSS Statistics data file nếu file cần gộp đang nằm ngoài cửa sổ hiện tại, rồi bấm Browse để chọn file thứ hai.

SPSS sẽ hiển thị danh sách biến chung và biến chỉ xuất hiện trong một file. Các biến có dấu * thường là biến trùng tên và có thể được ghép theo cột tương ứng. Nếu tên biến không khớp, hãy quay lại đổi tên hoặc kiểm tra ý nghĩa trước khi bấm tiếp tục.

Bước 3: Chọn Add Variables để nối thêm cột

Chọn Data > Merge Files > Add Variables. Chọn file bên ngoài, sau đó xác định biến khóa trong phần Key Variables. Đưa mã người trả lời vào danh sách khóa. Nếu hai file đã được sắp xếp theo khóa, bật tùy chọn cho biết file đang được sắp xếp theo thứ tự khóa khi SPSS yêu cầu.

Không chọn ghép theo vị trí dòng chỉ vì hai file có cùng số dòng. Cách này chỉ an toàn khi bạn chắc chắn dòng thứ 1 ở hai file thuộc cùng một người, dòng thứ 2 cũng vậy, và không có dòng nào bị lọc hoặc sắp xếp khác.

Bước 4: Lưu thành file mới và ghi lại nhật ký

Sau khi bấm OK, chọn File > Save As và đặt tên mới. Trong ghi chú xử lý, lưu lại tên hai file nguồn, loại gộp, số dòng hoặc số cột trước và sau khi gộp, các biến đã đổi tên và những dòng bị loại.

Nếu bạn thường xuyên nhận dữ liệu từ nhiều đợt, có thể dùng syntax để giảm thao tác thủ công. Tuy nhiên, syntax chỉ lặp lại đúng những gì bạn viết. Nếu đường dẫn file, tên biến hoặc khóa ghép sai, lỗi vẫn được lặp lại ở mọi lần chạy.

Đọc kết quả output sau khi gộp

Gộp file không tạo ra một bảng kiểm định giống hồi quy hay EFA. Bạn cần kiểm tra Data View, Variable View và các bảng tần số để xác nhận cấu trúc sau thao tác. Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật.

Kiểm tra sau khi gộpFile A trước gộpFile B trước gộpFile sau gộpDiễn giải
Số trường hợp hợp lệ150120270Phù hợp với Add Cases
Số biến quan sát QL1 đến QL5555Bộ biến chung được giữ lại
Mã người trả lời trùng000Không phát hiện trùng mã
Missing của QL1325Cần giữ cùng quy ước missing
Giá trị ngoài thang đo 1 đến 5011Cần kiểm tra dòng tương ứng

Để kiểm tra số dòng, vào Analyze > Descriptive Statistics > Frequencies, đưa mã người trả lời hoặc một biến bắt buộc vào ô phân tích. Nếu Add Cases mà số dòng sau gộp không bằng tổng số dòng hợp lệ của hai file, hãy kiểm tra bộ lọc, dòng bị chọn hoặc dữ liệu thiếu.

Để kiểm tra biến bị gộp nhầm, vào Analyze > Descriptive Statistics > Frequencies cho những biến quan trọng. Xem Minimum, Maximum và bảng tần số. Một biến Likert từ 1 đến 5 nhưng xuất hiện giá trị 55 hoặc 0 thường là dấu hiệu nhập sai mã hoặc dùng sai quy ước missing.

Với Add Variables, hãy tạo bảng tần số cho mã người trả lời và kiểm tra số trường hợp không ghép được. Nếu số dòng tăng bất thường, có thể khóa ghép không duy nhất. Trước khi chạy phân tích chính, bạn cũng nên xem lại các biến định tính. Bài biến định tính chạy hồi quy phải làm sao giải thích thêm việc mã hóa các biến nhóm trước hồi quy.

Tiêu chí đánh giá dữ liệu sau khi gộp

Các ngưỡng dưới đây không quyết định file có được gộp hay không. Chúng giúp bạn kiểm tra dữ liệu đã gộp có đủ điều kiện để chuyển sang các phân tích tiếp theo. Mỗi dòng đều nêu nguồn để bạn có thể giải trình khi cần.

Tiêu chí kiểm traNgưỡng hoặc quy tắcNguồn
Mã người trả lờiKhông trùng nếu dùng làm khóaQuy tắc kiểm tra cấu trúc dữ liệu, không gán ngưỡng thống kê
Giá trị của biến LikertNằm trong khoảng mã đã thiết kế, ví dụ 1 đến 5(Likert, 1932)
Corrected Item-Total CorrelationTừ 0.3 trở lên khi kiểm tra độ tin cậy(Nunnally và Bernstein, 1994)
Cronbach's AlphaTừ 0.7 trở lên; thang đo khám phá có thể xem mức 0.6 theo bối cảnh(Nunnally, 1978) và (Hair và cộng sự, 2010)
KMO trước EFATừ 0.5 trở lên(Kaiser, 1974)
Factor loading trong EFATừ 0.5 trở lên(Hair và cộng sự, 2010)
Số quan sát trên một biến quan sátKhoảng 5 đến 10 quan sát cho mỗi biến(Hair và cộng sự, 2010)

Nếu dữ liệu sau gộp chưa đạt một tiêu chí, đừng tự động xóa dòng hoặc biến để làm đẹp bảng. Trước hết xác định lỗi đến từ file nguồn, cách mã hóa hay từ một nhóm người trả lời thực sự có đặc điểm khác. Với dữ liệu thứ cấp, quy trình kiểm tra sẽ khác dữ liệu khảo sát, bạn có thể xem thêm dữ liệu thứ cấp là gì.

Cách viết kết quả vào luận văn

Gộp file thường được mô tả trong phần phương pháp và làm sạch dữ liệu, không nên viết như thể đây là một kiểm định giả thuyết. Bạn cần nêu số file, nguồn dữ liệu, số quan sát trước và sau gộp, cách xử lý mã trùng hoặc phản hồi không hợp lệ.

Cách viết vào luận văn: “Dữ liệu được tổng hợp từ [số lượng] file khảo sát, gồm [mô tả nhóm hoặc thời điểm thu thập]. Nhóm nghiên cứu sử dụng chức năng Add Cases trong SPSS để nối các trường hợp có cùng cấu trúc biến. Sau khi kiểm tra mã người trả lời, giá trị thiếu và giá trị ngoài phạm vi [khoảng mã], bộ dữ liệu cuối cùng gồm [số quan sát] quan sát hợp lệ và [số biến] biến phục vụ phân tích.”

Nếu dùng Add Variables, thay câu giữa bằng: “Nhóm nghiên cứu sử dụng chức năng Add Variables, ghép các file theo biến khóa [tên biến khóa]. Các trường hợp không xác định được khóa ghép được [giữ lại và đánh dấu hoặc loại bỏ theo tiêu chí], sau đó kiểm tra lại số biến và số trường hợp trong file cuối.” Chỉ điền con số sau khi bạn đã kiểm tra trên file thật.

Lỗi thường gặp khi chạy gộp file dữ liệu trong SPSS

Hai biến cùng ý nghĩa nhưng khác tên. SPSS xem GIOITINHGT là hai biến khác nhau. Đổi tên một biến tại Variable View trước khi gộp, đồng thời ghi lại thay đổi trong nhật ký dữ liệu.

Biến cùng tên nhưng khác kiểu. Một biến Numeric và một biến String có thể khiến SPSS cảnh báo hoặc tạo dữ liệu không dùng được. Chọn kiểu dữ liệu thống nhất, sau đó kiểm tra lại mã và nhãn trước khi gộp.

Gộp Add Cases làm tăng số cột. Đây thường là dấu hiệu các file không có tên biến đồng nhất. Hãy xem danh sách biến chỉ có trong một file. Nếu đó là cùng một biến được đặt tên khác, sửa tên trước khi chạy lại.

Add Variables ghép sai người. Nguyên nhân thường là mã khóa bị trùng, khác kiểu dữ liệu hoặc hai file đang có thứ tự khác nhau. Kiểm tra tính duy nhất của khóa và không ghép theo vị trí dòng nếu chưa xác minh.

Số dòng bị giảm. Kiểm tra Data > Select Cases, bộ lọc đang bật, trọng số tại Data > Weight Cases và các dòng đã bị xóa trong file nguồn. Tắt bộ lọc không có nghĩa là những dòng đã xóa sẽ tự quay lại.

Dữ liệu gộp xong nhưng Cronbach's Alpha giảm. Đây không phải bằng chứng chắc chắn rằng thao tác gộp sai. Các nhóm thu thập ở thời điểm hoặc bối cảnh khác nhau có thể trả lời khác nhau. Kiểm tra phân phối, mã đảo chiều, missing và giá trị ngoài phạm vi trước khi quyết định loại biến.

Câu hỏi thường gặp

Gộp file dữ liệu trong SPSS là gì?

Đây là thao tác kết hợp dữ liệu từ nhiều file thành một file để tiếp tục làm sạch và phân tích. Add Cases nối thêm trường hợp theo hàng, còn Add Variables nối thêm biến theo cột.

Nên dùng Add Cases hay Add Variables?

Nếu các file có cùng bộ biến nhưng là những người trả lời khác nhau, dùng Add Cases. Nếu các file mô tả cùng người trả lời nhưng chứa những nhóm biến khác nhau, dùng Add Variables và cần một mã khóa đáng tin cậy.

Có thể gộp file Excel với file SPSS không?

Có. Bạn có thể mở hoặc nhập file Excel bằng File > Open > Data, sau đó kiểm tra tên biến, dòng tiêu đề, kiểu dữ liệu và mã missing. Chỉ gộp sau khi file Excel đã có cấu trúc tương thích với file SPSS.

Vì sao SPSS báo biến không tương thích khi gộp?

Các nguyên nhân thường gặp là tên biến khác nhau, kiểu dữ liệu khác nhau, biến có độ dài String khác nhau hoặc mã hóa không thống nhất. Mở Variable View ở cả hai file và đối chiếu từng biến thay vì chỉ sửa theo thông báo lỗi.

Gộp file xong có cần chạy lại Cronbach's Alpha không?

Có, nếu file mới chứa thêm người trả lời hoặc có thay đổi trong bộ biến. Cronbach's Alpha, EFA và hồi quy phải được chạy trên bộ dữ liệu cuối cùng mà bạn thực sự dùng để kiểm định giả thuyết. Không lấy kết quả từ một file cũ để mô tả file mới.

Bạn hãy tạo bản sao của các file nguồn, ghi rõ mục tiêu là Add Cases hay Add Variables, kiểm tra khóa và số dòng, rồi chạy thao tác trên file mới. Nếu cần chạy phân tích trên chính file .sav hoặc .csv của bạn, module M4 phân tích dữ liệu của DoThesis hỗ trợ kiểm tra và thực hiện bước này.