Mở file CSV trong SPSS: Cách nhập dữ liệu đúng và xử lý lỗi

SPSS··15 phút đọc

Khi nào dùng mở file CSV trong SPSS

Bạn dùng cách mở file CSV trong SPSS khi dữ liệu đang được lưu dưới dạng bảng văn bản có phần mở rộng .csv, thường xuất ra từ Google Forms, fillform, Excel hoặc một phần mềm khảo sát khác. Mỗi dòng thường là một người trả lời, mỗi cột là một biến quan sát, biến nhân khẩu học hoặc mã định danh.

CSV thuận tiện vì nhẹ và có thể mở bằng nhiều phần mềm. Tuy nhiên, SPSS không chỉ cần đọc được tên file. Nó còn phải nhận đúng dấu phân cách giữa các cột, mã hóa tiếng Việt, dòng chứa tên biến, kiểu dữ liệu và giá trị missing. Nếu một cột Likert bị đọc thành chuỗi, bạn sẽ gặp lỗi khi chạy Cronbach's Alpha, EFA hoặc hồi quy.

Về mặt nghiên cứu, việc nhập CSV phù hợp khi bạn đã thu thập dữ liệu sơ cấp bằng bảng hỏi hoặc nhận một bộ dữ liệu thứ cấp đã được chuẩn hóa. Bạn có thể xem thêm dữ liệu sơ cấp và dữ liệu thứ cấp là gì để phân biệt nguồn dữ liệu trước khi mô tả mẫu trong luận văn.

Giả sử giả thuyết của bạn có dạng: mức độ dễ sử dụng ảnh hưởng đến ý định sử dụng. Khi đó file CSV cần có các cột như PEOU1, PEOU2, PEOU3, INT1, INT2, INT3 và các biến kiểm soát. Mở file đúng chỉ là bước đầu, nhưng nó quyết định toàn bộ các bước phân tích phía sau.

Chuẩn bị dữ liệu trước khi chạy

Hãy giữ nguyên file CSV gốc và tạo một bản sao để mở trong SPSS. Không chỉnh sửa trực tiếp file duy nhất bạn có. Nếu thao tác đổi dấu phân cách hoặc xóa dòng làm hỏng dữ liệu, bạn vẫn còn bản gốc để kiểm tra.

Tên biến nên viết ngắn, không dấu, không có khoảng trắng và không bắt đầu bằng số. GT, TUOI, PEOU1 và YDINH1 thường an toàn hơn các tên như Giới tính người trả lời hoặc Mức độ hài lòng. Nhãn diễn giải dài có thể đặt trong cột Label của Variable View sau khi nhập.

Một bảng hỏi Likert nên được mã hóa thành số, chẳng hạn từ 1 đến 5. Các lựa chọn như “Hoàn toàn không đồng ý” có thể giữ ở file khảo sát gốc, nhưng trước khi chạy phân tích định lượng bạn cần có quy tắc mã hóa nhất quán. Nếu một biến được hỏi theo chiều ngược, hãy ghi chú để reverse code trước khi kiểm định độ tin cậy.

Kiểm tra nhanh file bằng Excel hoặc trình soạn thảo văn bản. Bạn cần biết bốn điểm: file dùng dấu phẩy hay dấu chấm phẩy để ngăn cách cột, ký tự thập phân là dấu chấm hay dấu phẩy, dòng đầu có tên biến hay không, và tiếng Việt được lưu ở dạng UTF-8 hay một mã hóa khác.

Hạng mục cần kiểm traDấu hiệu đúngNếu sai thì xử lý
Tên biếnMột tên nằm trong một cột, không có khoảng trắngĐổi tên ngắn, không dấu
Dòng đầuChứa tên biến, không phải câu trả lời đầu tiênChọn Read variable names from first row
Dấu phân cáchCác trường tách thành đúng cộtChọn đúng Comma, Semicolon hoặc Tab
Kiểu LikertHiển thị số và có thể tính toánĐổi sang Numeric, kiểm tra dấu thập phân
Giá trị bỏ trốngÔ trống hoặc mã missing thống nhấtKhai báo missing, không tự động đổi thành 0
Mã hóa tiếng ViệtChữ có dấu hiển thị đúngLưu lại bằng UTF-8 rồi nhập lại

Nếu dữ liệu có biến định tính như giới tính, ngành học hoặc nhóm thu nhập, bạn vẫn có thể nhập chúng vào SPSS. Chỉ cần phân biệt biến định tính dùng để mô tả, so sánh nhóm với biến định lượng dùng trong tính điểm thang đo. Khi cần đưa biến định tính vào hồi quy, cách mã hóa sẽ khác, bạn có thể xem hướng dẫn biến định tính chạy hồi quy phải làm sao.

Các bước mở file CSV trong SPSS

Bước 1: Mở Data Import Wizard

Mở SPSS, chọn File > Open > Data. Trong hộp thoại mở file, tại phần loại tệp, chọn Text (*.txt, *.csv, *.dat) hoặc chọn All Files nếu phiên bản SPSS của bạn không hiện CSV. Tìm đến file cần nhập rồi bấm Open.

Với một số phiên bản, bạn có thể chọn trực tiếp File > Import Data > CSV Data. Tên menu có thể thay đổi nhẹ giữa các bản SPSS, nhưng mục tiêu vẫn là mở trình hướng dẫn nhập dữ liệu dạng văn bản, thường gọi là Text Import Wizard.

Bước 2: Chọn cách đọc dòng đầu

Ở màn hình đầu của Text Import Wizard, chọn Yes nếu dòng đầu tiên chứa tên biến. Chọn No nếu dòng đầu là dữ liệu quan sát đầu tiên. Hầu hết file khảo sát có hàng tiêu đề nên bạn thường chọn Yes.

Kiểm tra phần xem trước ngay dưới tùy chọn. Nếu tên biến bị cắt bất thường, có ký tự lạ hoặc cột đầu tiên bị nhập thành một chuỗi dài, dừng lại để sửa dấu phân cách hoặc mã hóa trước khi sang bước tiếp theo.

Bước 3: Chọn mỗi dòng là một trường hợp

Ở bước tiếp theo, chọn mỗi dòng đại diện cho một case, tức một người trả lời hoặc một đơn vị quan sát. Nếu dữ liệu của bạn được xoay theo chiều ngược, mỗi dòng có thể đang là biến và mỗi cột là người trả lời. Khi đó cần chuyển cấu trúc trước khi phân tích, vì SPSS mặc định xem một dòng là một case.

Kiểm tra số lượng case trong bản xem trước. Một dòng tiêu đề duy nhất không được tính là một người trả lời. Nếu file có dòng ghi chú, dòng tổng hợp hoặc dòng trống ở đầu, hãy loại bỏ chúng trước khi nhập.

Bước 4: Chọn dấu phân cách và mã hóa

Chọn Delimited nếu các cột được tách bằng dấu phẩy, dấu chấm phẩy, tab hoặc ký tự cụ thể. Ở màn hình Delimiters, đánh dấu đúng loại dấu đang dùng. File xuất từ các thiết lập vùng khác nhau thường dùng dấu chấm phẩy thay cho dấu phẩy.

Nếu chọn sai, toàn bộ dữ liệu có thể nằm trong một cột. Đây là lỗi dễ nhận ra nhất. Trong trường hợp file dùng dấu phẩy bên trong nội dung trả lời, hãy kiểm tra dấu ngoặc kép. CSV chuẩn thường đặt phần văn bản có dấu phân cách bên trong giữa hai dấu ngoặc kép.

Chọn encoding là UTF-8 nếu file có tiếng Việt. Sau khi chọn, nhìn vào phần preview để kiểm tra các chữ như “giới tính”, “nghề nghiệp” hoặc nội dung nhãn. Nếu chữ thành ký tự vuông hoặc dấu hỏi, hãy đóng trình hướng dẫn, lưu lại file CSV bằng UTF-8 rồi nhập lại.

Bước 5: Kiểm tra tên biến và kiểu dữ liệu

SPSS sẽ cho bạn xem tên biến, kiểu dữ liệu và độ rộng trường. Với biến Likert, chọn Numeric. Với mã định danh có số 0 ở đầu, chẳng hạn 00125, cân nhắc lưu là String nếu cần giữ nguyên mã hiển thị. Không dùng mã định danh để chạy Cronbach's Alpha hay hồi quy.

Bạn có thể đặt tên biến và nhãn ngay trong bước này, nhưng thường dễ kiểm soát hơn khi sửa tiếp trong Variable View. Đảm bảo các cột thang đo có cùng kiểu dữ liệu. Nếu PEOU1 là Numeric nhưng PEOU2 là String vì có một ô chứa chữ, phép tính điểm trung bình sẽ bị lỗi.

Bước 6: Hoàn tất và lưu thành file SAV

Bấm Finish để SPSS tạo Data View. Kiểm tra vài dòng đầu, vài dòng giữa và vài dòng cuối. Sau đó chọn File > Save As, đặt tên file mới và lưu ở định dạng .sav.

CSV là định dạng trao đổi dữ liệu. File SAV phù hợp hơn cho quá trình phân tích vì giữ được kiểu biến, nhãn biến, nhãn giá trị và thiết lập missing. Bạn vẫn nên giữ CSV gốc, đồng thời lưu một bản SAV sạch sau mỗi vòng chỉnh sửa quan trọng.

Nếu muốn lặp lại thao tác nhập mà không bấm menu nhiều lần, bạn có thể dùng syntax. Hướng dẫn chạy syntax SPSS sẽ hữu ích khi bạn phải nhập lại nhiều file hoặc cần ghi lại quy trình để giải trình với giảng viên.

Đọc kết quả output

Mở file CSV không tạo ra bảng kiểm định như Cronbach's Alpha hay Regression. Kết quả đầu tiên bạn cần đọc là Data View và Variable View, sau đó kiểm tra Frequencies để phát hiện lỗi nhập liệu. Chọn Analyze > Descriptive Statistics > Frequencies, đưa các biến phân loại và biến thang đo cần kiểm tra vào ô Variable(s), rồi bấm OK.

Trong Data View, một hàng phải tương ứng với một case. Nếu bạn có 250 người trả lời, số dòng dữ liệu hợp lệ phải phù hợp với quy trình làm sạch của bạn. Trong Variable View, cột Type của biến Likert nên là Numeric, cột Measure thường đặt Scale, còn giới tính hoặc nhóm tuổi có thể đặt Nominal hoặc Ordinal tùy cách đo.

Bảng Frequencies, số liệu minh họa

Bảng dưới đây là số liệu minh họa, không phải kết quả từ một nghiên cứu thật. Các con số chỉ mô phỏng hình dạng bảng để bạn biết cần nhìn vào đâu sau khi nhập CSV.

StatisticsValidMissingMinimumMaximumMean
PEOU12182153.74
PEOU22200153.61
PEOU32191153.69
INT12200153.88

Nếu một biến Likert có Minimum bằng 0 trong khi bảng hỏi chỉ cho phép 1 đến 5, hãy tìm nguyên nhân trước khi chạy phân tích. Nếu Maximum là 55, có thể mười câu trả lời đã bị dồn vào một cột hoặc biến được nhập thành tổng điểm thay vì điểm từng item.

Bạn cũng nên chạy Analyze > Descriptive Statistics > Descriptives để xem Mean, Standard Deviation, Minimum và Maximum. Sau khi dữ liệu đạt bước kiểm tra cơ bản, bạn mới chuyển sang chủ đề SPSS để chọn phân tích phù hợp với mô hình và giả thuyết.

Tiêu chí đánh giá

Không có một con số duy nhất chứng minh file CSV đã nhập đúng. Bạn đánh giá theo ba lớp: cấu trúc, kiểu dữ liệu và phạm vi giá trị. Bảng dưới đây là checklist thực hành, trong đó các ngưỡng thống kê được đặt cạnh nguồn canonical để tránh lấy một con số không rõ xuất xứ.

Nội dung kiểm traMức tham khảo hoặc quyết địnhNguồn
Tương quan biến tổng hiệu chỉnh khi chạy Cronbach's AlphaCorrected Item-Total Correlation từ 0.3 trở lên(Nunnally và Bernstein, 1994)
Cronbach's AlphaTừ 0.7 trở lên; thang đo khám phá có thể xem xét từ 0.6(Nunnally, 1978); (Hair và cộng sự, 2010)
KMO trước EFATừ 0.5 trở lên(Kaiser, 1974)
Bartlett's Testp-value dưới 0.05(Kaiser, 1974)
Factor loading trong EFATừ 0.5 trở lên(Hair và cộng sự, 2010)
Total variance explainedTừ 50% trở lên(Hair và cộng sự, 2010)

Các ngưỡng trên chỉ được dùng sau khi bạn đã xác định dữ liệu đang đo đúng khái niệm và thiết kế phân tích phù hợp. Chúng không sửa được một file nhập sai. Chẳng hạn, nếu PEOU2 bị đọc thành String, việc Alpha thấp không tự động có nghĩa là biến quan sát kém.

Khi kiểm tra dữ liệu, hãy phân biệt missing với giá trị 0. Ô trống thường thể hiện người trả lời bỏ qua câu hỏi. Số 0 có thể là một mã hợp lệ hoặc là dấu hiệu bạn đã thay thế ô trống không đúng cách. Nếu tự đổi missing thành 0 cho thang Likert 1 đến 5, Mean và Standard Deviation sẽ bị kéo lệch.

Cách viết kết quả vào luận văn

Sau khi mở CSV và kiểm tra dữ liệu, bạn có thể viết ngắn gọn trong phần xử lý dữ liệu của chương 3. Đừng khẳng định “dữ liệu đã đạt” chỉ vì SPSS mở được file. Hãy mô tả nguồn file, số quan sát ban đầu, cách kiểm tra và số quan sát dùng cho phân tích.

Cách viết vào luận văn: “Dữ liệu khảo sát được xuất dưới định dạng CSV và nhập vào IBM SPSS Statistics. Sau khi kiểm tra tên biến, kiểu dữ liệu, giá trị thiếu và phạm vi mã hóa từ [mức thấp nhất] đến [mức cao nhất], nghiên cứu giữ lại [số quan sát hợp lệ] trên tổng số [số quan sát ban đầu] bảng trả lời để thực hiện các phân tích tiếp theo. Các biến thang đo được mã hóa theo thang Likert [5/7] mức, trong đó [nêu cách xử lý biến đảo nếu có].”

Nếu đã chạy Frequencies, bạn có thể bổ sung: “Kết quả kiểm tra mô tả cho thấy các biến [tên biến] có giá trị quan sát nằm trong khoảng [min] đến [max], phù hợp với phạm vi mã hóa của bảng hỏi. Các trường hợp thiếu dữ liệu được xử lý theo [quy tắc thực tế của nghiên cứu].” Chỉ điền số sau khi nhìn đúng output của file mình.

Lỗi thường gặp khi chạy mở file CSV trong SPSS

Toàn bộ dữ liệu nằm trong một cột

Nguyên nhân thường là chọn sai delimiter. Mở lại file bằng trình soạn thảo văn bản, xem giữa hai trường là dấu phẩy, dấu chấm phẩy hay tab, rồi chọn đúng ở Text Import Wizard. Đừng tách cột thủ công trong Data View nếu bạn chưa hiểu cấu trúc file gốc.

Tiếng Việt bị lỗi mã hóa

Đóng SPSS, mở CSV bằng một công cụ có tùy chọn encoding, lưu lại dưới UTF-8 rồi nhập lại. Việc đổi font trong SPSS chỉ thay đổi cách hiển thị, không sửa được mã hóa đã hỏng.

Biến số bị đọc thành String

Tìm các ô chứa chữ, khoảng trắng hoặc ký hiệu như N/A, - và dấu thập phân không nhất quán. Sau khi làm sạch, có thể dùng Transform > Automatic Recode cho biến phân loại, nhưng không nên tự động recode biến Likert nếu chưa kiểm tra ý nghĩa từng mã.

Dòng đầu bị tính như một người trả lời

Bạn đã chọn sai tùy chọn đọc tên biến. Nhập lại file và chọn Yes, read variable names from the first row of data. Kiểm tra số case sau khi nhập, vì sai một dòng tiêu đề có thể làm sai cả thống kê mô tả.

Cột bị lệch sau một câu trả lời dài

CSV có thể chứa dấu phẩy trong nội dung văn bản. Kiểm tra xem trường đó có được bao bởi dấu ngoặc kép hay không. Nếu file xuất không đúng chuẩn, hãy xuất lại từ nguồn khảo sát thay vì cố sửa hàng trăm dòng bằng tay.

Câu hỏi thường gặp

Mở file CSV trong SPSS có làm mất dữ liệu gốc không?

Thông thường không, vì SPSS chỉ đọc file CSV và tạo một bộ dữ liệu trong phiên làm việc. Tuy nhiên, nếu bạn chọn Save As và ghi đè lên file gốc bằng một định dạng khác, bạn có thể mất bản CSV ban đầu. Hãy lưu file SAV thành tên mới và giữ nguyên bản CSV.

Vì sao file CSV mở bằng Excel đúng nhưng vào SPSS lại sai cột?

Excel thường tự đoán dấu phân cách theo thiết lập vùng của máy tính, còn SPSS cần bạn xác nhận delimiter trong Text Import Wizard. Hai phần mềm có thể đọc cùng một file theo hai cách khác nhau. Hãy xem nội dung thô của file để xác định ký tự ngăn cách thật sự.

Có thể mở CSV tiếng Việt trong SPSS phiên bản cũ không?

Có thể, nhưng tùy phiên bản mà tùy chọn UTF-8 không hiển thị rõ. Nếu tiếng Việt bị lỗi, hãy lưu CSV bằng encoding mà phiên bản SPSS của bạn đọc được hoặc chuyển sang một phiên bản mới hơn. Dù dùng phiên bản nào, bạn vẫn cần kiểm tra tên biến và nhãn sau khi nhập.

Có nên nhập điểm Likert dạng chữ rồi đổi sang số trong SPSS không?

Bạn có thể làm vậy nếu bảng hỏi ban đầu lưu các lựa chọn bằng chữ, nhưng cần lập bảng mã hóa rõ ràng trước khi chuyển đổi. Ví dụ, “Hoàn toàn không đồng ý” phải luôn có cùng một mã trong toàn bộ biến. Với dữ liệu đã có mã số 1 đến 5, giữ Numeric sẽ an toàn và thuận tiện hơn.

Sau khi mở CSV, tôi có thể chạy Cronbach's Alpha ngay không?

Bạn nên kiểm tra Data View, Variable View, Frequencies, missing và phạm vi giá trị trước. Sau đó mới chọn các biến quan sát đúng cùng một khái niệm để chạy Analyze > Scale > Reliability Analysis. Nếu bỏ qua bước kiểm tra, Alpha thấp có thể xuất phát từ lỗi nhập dữ liệu thay vì vấn đề của thang đo.

Mở file CSV trong SPSS xong, việc tiếp theo của bạn là lưu một bản .sav, ghi lại số quan sát hợp lệ và kiểm tra từng nhóm biến trước khi chạy phân tích. Nếu muốn chạy trên chính file .sav hoặc .csv và cần hỗ trợ từ nhập dữ liệu đến đọc output, bạn có thể dùng module M4 phân tích của DoThesis.