Nhập liệu trong SPSS: Cách nhập dữ liệu từ Excel đúng cách

SPSS··16 phút đọc

Khi nào dùng nhập liệu trong SPSS

Nhập liệu trong SPSS là bước đưa câu trả lời từ bảng hỏi vào một file .sav để bạn tiếp tục chạy Cronbach's Alpha, EFA, hồi quy hoặc các kiểm định khác. Nếu bạn đã thu thập dữ liệu bằng bảng hỏi giấy, Google Forms hoặc một công cụ khảo sát trực tuyến, dữ liệu ban đầu thường nằm trong Excel hoặc CSV. Khi đó, bạn cần nhập trực tiếp vào SPSS hoặc dùng lệnh mở file để chuyển sang Data View.

Bạn dùng cách này khi mỗi dòng đại diện cho một người trả lời và mỗi cột đại diện cho một biến. Ví dụ, dòng 2 là người trả lời đầu tiên, cột GT là giới tính, TUOI là tuổi, còn DV1, DV2, DV3 là các biến quan sát đo cùng một khái niệm. Cấu trúc này phù hợp với giả thuyết dạng “giới tính khác nhau có mức độ hài lòng khác nhau” hoặc “chất lượng dịch vụ ảnh hưởng đến ý định tiếp tục sử dụng”.

Nếu bạn chưa phân biệt dữ liệu thu từ bảng hỏi với dữ liệu lấy từ báo cáo, xem thêm dữ liệu sơ cấp và dữ liệu thứ cấp là gì. Hai loại dữ liệu có thể cùng được nhập vào SPSS, nhưng cách giải thích nguồn dữ liệu trong chương phương pháp sẽ khác nhau.

Chuẩn bị dữ liệu trước khi chạy

Trước khi tìm cách chạy nhập liệu trong SPSS, hãy sửa bảng dữ liệu gốc. Một file có nhiều cột thừa, tên biến có dấu tiếng Việt hoặc câu trả lời ghi lẫn chữ và số sẽ gây lỗi ở bước phân tích sau đó. Bạn nên giữ một bản Excel nguyên gốc, rồi tạo một bản sao dành riêng cho việc làm sạch.

Sắp xếp cấu trúc bảng dữ liệu

Hàng đầu tiên nên chứa tên biến, chẳng hạn ID, GT, TUOI, CL1, CL2, CL3, HL1, HL2. Từ hàng thứ hai trở đi là câu trả lời của từng người. Không gộp ô, không chèn tiêu đề nghiên cứu vào giữa bảng và không để một người trả lời chiếm nhiều dòng.

Tên biến nên ngắn, không có khoảng trắng, không bắt đầu bằng số và không dùng ký tự đặc biệt. Bạn có thể dùng CL1 thay cho “Chất lượng dịch vụ 1”. Phần diễn giải đầy đủ đặt ở nhãn biến trong Variable View, còn tên ngắn giúp bạn đọc bảng output và viết syntax dễ hơn.

Xác định kiểu dữ liệu và mã hóa

Biến định lượng như tuổi, thu nhập hoặc điểm trung bình có thể được khai báo là Numeric. Biến phân loại như giới tính, khu vực hoặc trình độ học vấn cũng thường được lưu bằng số, nhưng cần có Value Labels để SPSS hiểu 1 = Nam, 2 = Nữ.

Với thang Likert, hãy thống nhất một chiều mã hóa. Nếu bảng hỏi dùng mức từ 1 đến 5, hãy kiểm tra xem 1 luôn là “hoàn toàn không đồng ý” và 5 luôn là “hoàn toàn đồng ý”. Biến đảo chiều phải được xử lý trước khi tính điểm thang đo. Ví dụ, một phát biểu tiêu cực có thể cần tạo biến mới theo công thức 6 - biến_gốc khi thang đo chạy từ 1 đến 5. Đừng sửa âm thầm giá trị gốc, vì bạn sẽ khó giải trình khi giảng viên hỏi lại.

Kiểm tra ô trống và câu trả lời không hợp lệ

Trong Excel, lọc từng cột để tìm ô trống, chữ nằm trong cột số, giá trị ngoài khoảng cho phép và các dòng trả lời giống nhau từ đầu đến cuối. Một dòng toàn bộ câu trả lời là số 3 chưa tự động chứng minh người trả lời không nghiêm túc, nhưng đó là dấu hiệu bạn cần kiểm tra cùng với thời gian hoàn thành hoặc các câu sàng lọc nếu có.

Nếu dùng mã 99 cho câu không trả lời, bạn phải khai báo 99 là missing value trong SPSS. Nếu để nguyên 99 như một điểm Likert, trung bình và độ lệch chuẩn sẽ bị kéo lệch. Trước khi nhập, hãy ghi lại quy tắc loại dữ liệu nào bị loại và quy tắc nào được giữ lại.

Khai báo Variable View

Trong SPSS, chuyển sang tab Variable View ở cuối cửa sổ. Các cột thường cần quan tâm gồm Name, Type, Width, Decimals, Label, Values, Missing, Measure và Role. Bảng dưới đây là cấu hình minh họa cho một file khảo sát.

NameTypeLabelValuesMissingMeasure
IDNumericMã người trả lờiKhông cầnKhông khai báo nếu đủ mãNominal
GTNumericGiới tính1 Nam; 2 Nữ99 nếu dùng mã nàyNominal
TUOINumericTuổiKhông cần99 nếu dùng mã nàyScale
CL1NumericChất lượng dịch vụ 11 đến 5 theo Likert99 nếu cóOrdinal hoặc Scale
HL1NumericHài lòng 11 đến 5 theo Likert99 nếu cóOrdinal hoặc Scale

Với dữ liệu khảo sát dùng thang Likert, nhiều nghiên cứu khai báo Measure là Scale để chạy các phân tích định lượng phổ biến. Điều quan trọng là cách khai báo phải thống nhất với phương pháp bạn trình bày trong luận văn, không phải đổi tùy ý để output trông đẹp hơn.

Các bước chạy nhập liệu trong SPSS

Bước 1: Nhập dữ liệu trực tiếp trong SPSS

Mở SPSS, chọn New Dataset. Ở tab Variable View, tạo từng biến theo danh sách trong bảng hỏi. Sau đó chuyển sang Data View và nhập mỗi người trả lời trên một dòng. Bạn có thể dán một vùng dữ liệu từ Excel vào Data View, nhưng nên kiểm tra lại số dòng và số cột sau khi dán.

Cột đầu tiên thường là mã người trả lời. Mã này giúp bạn phát hiện dòng trùng hoặc quay lại bảng dữ liệu gốc khi có vấn đề. Không dùng số thứ tự dòng làm mã nếu bạn thường xuyên lọc hoặc sắp xếp dữ liệu, vì số thứ tự có thể thay đổi.

Bước 2: Nhập dữ liệu từ Excel trong SPSS

Đây là cách được dùng nhiều nhất khi bảng hỏi đã được tổng hợp trong Excel. Chọn File > Open > Data, đổi loại file sang Excel, chọn file cần mở rồi nhấn Open. Trong hộp thoại mở file, đánh dấu Read variable names from the first row of data nếu hàng đầu tiên đang là tên biến.

SPSS sẽ hiển thị bản xem trước. Kiểm tra sheet được chọn, vùng dữ liệu và số cột. Nếu tên biến trong Excel có dấu cách, SPSS có thể tự điều chỉnh hoặc tạo tên không giống mong muốn. Sau khi mở, chuyển sang Variable View để sửa lại Name, Label, Values và Measure.

Bạn cũng có thể dùng File > Import Data > Excel tùy phiên bản SPSS. Cách chạy nhập dữ liệu từ Excel trong SPSS không khác nhiều giữa các phiên bản, nhưng tên hộp thoại có thể thay đổi nhẹ. Nếu file Excel có nhiều sheet, hãy chọn đúng sheet chứa dữ liệu khảo sát, không chọn sheet tổng hợp biểu đồ.

Bước 3: Kiểm tra định dạng cột sau khi nhập

Trong Data View, dùng thanh cuộn để xem các biến cuối cùng. Trong Variable View, kiểm tra xem biến Likert có bị nhận thành String hay không. Nếu một cột có một ô chứa chữ như “Không biết”, SPSS có thể xem cả cột là chuỗi, khiến bạn không chạy được trung bình hoặc hồi quy.

Nếu biến đang là String nhưng phải là số, hãy xử lý ở Excel hoặc tạo biến số mới bằng Transform > Automatic Recode. Với dữ liệu nghiên cứu, tạo biến mới thường an toàn hơn việc ghi đè lên cột gốc. Sau đó đối chiếu một vài dòng giữa Excel và SPSS để bảo đảm mã không bị thay đổi.

Bước 4: Khai báo Value Labels và Missing Values

Trong Variable View, tại cột Values, nhấn nút ba chấm rồi nhập từng cặp mã và nhãn. Ví dụ nhập Value 1, Label Nam, nhấn Add; tiếp tục nhập 2, Label Nữ. Tại cột Missing, chọn Discrete missing values và nhập 99 nếu đó là mã bạn đã quy ước.

Sau đó vào Analyze > Descriptive Statistics > Frequencies, đưa các biến phân loại và biến quan sát vào ô Variable(s). Chọn Statistics nếu cần xem Mean, Minimum và Maximum. Nếu một biến Likert có giá trị nhỏ nhất là 1 và lớn nhất là 5, dữ liệu có vẻ đúng phạm vi. Nếu xuất hiện 0, 6 hoặc 99, quay lại file gốc để kiểm tra.

Bước 5: Lưu file SPSS và tạo bản kiểm tra

Chọn File > Save As, đặt tên có phiên bản như khaosat_lam_sach_v01.sav. Sau mỗi lần loại dòng hoặc recode biến, lưu thành phiên bản mới. Cách này giúp bạn trả lời được câu hỏi “vì sao cỡ mẫu giảm từ 250 xuống 238” thay vì phải đoán lại.

Nếu bạn muốn giảm thao tác lặp lại, có thể lưu lệnh và xem thêm hướng dẫn chạy syntax SPSS. Syntax đặc biệt hữu ích khi bạn phải chạy lại Frequencies, Reliability Analysis hoặc hồi quy sau khi thay đổi một biến.

Đọc kết quả output

Nhập liệu không tạo ra một bảng kiểm định riêng. Output đầu tiên bạn nên đọc là bảng tần số để xác nhận file đã vào SPSS đúng trước khi chạy phân tích chính. Với các biến số, hãy chú ý Valid, Missing, Minimum, Maximum và Mean. Với biến phân loại, xem Frequencies và Percent.

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Tên cột được trình bày theo dạng SPSS thường hiển thị trong bảng tần số.

StatisticsGTTUOICL1CL2HL1
N Valid238238238238238
N Missing00000
Minimum119111
Maximum245555
Mean1.5427.633.713.643.82

Nếu N Valid của CL1 là 238 nhưng CL2 chỉ là 221, hai biến đang có số lượng thiếu khác nhau. Bạn cần kiểm tra quy tắc xử lý missing trước khi tính Cronbach's Alpha. Nếu Minimum hoặc Maximum nằm ngoài mã đã quy định, hãy dừng phân tích và sửa dữ liệu.

Khi dữ liệu đã hợp lệ, bạn mới chuyển sang các bước tiếp theo như Analyze > Scale > Reliability Analysis cho Cronbach's Alpha, Analyze > Dimension Reduction > Factor cho EFA hoặc Analyze > Regression > Linear cho hồi quy. Việc nhập đúng dữ liệu không thay thế cho việc kiểm tra giả định của từng phân tích.

Tiêu chí đánh giá

Phần nhập dữ liệu không có một con số “nhập liệu SPSS bao nhiêu là tốt” áp dụng cho mọi nghiên cứu. Một file được xem là sẵn sàng khi tên biến rõ, kiểu dữ liệu đúng, mã hóa nhất quán, giá trị nằm trong phạm vi bảng hỏi và số lượng missing đã được kiểm tra. Các ngưỡng dưới đây áp dụng cho bước kiểm tra và phân tích sau khi nhập, không phải tiêu chuẩn để sửa số liệu theo ý muốn.

Nội dung kiểm traMức tham khảoNguồn
Mã hóa thang LikertGiữ đúng các mức đã thiết kế trong bảng hỏi(Likert, 1932)
Corrected Item-Total CorrelationTừ 0.3 trở lên khi đánh giá thang đo(Nunnally và Bernstein, 1994)
Cronbach's AlphaTừ 0.7 trở lên; thang đo khám phá có thể tham khảo từ 0.6(Nunnally, 1978) và (Hair và cộng sự, 2010)
KMOTừ 0.5 trở lên trước khi xem EFA(Kaiser, 1974)
Bartlett's TestCó ý nghĩa thống kê với p-value dưới 0.05(Kaiser, 1974)
Factor loadingTừ 0.5 trở lên theo mức tham khảo phổ biến(Hair và cộng sự, 2010)
Số quan sát cho mỗi biến quan sátKhoảng 5 đến 10 quan sát cho một biến quan sát(Hair và cộng sự, 2010)

Không được xóa hàng chỉ vì một người trả lời có điểm thấp hoặc giữ một giá trị 99 để tăng số quan sát. Mọi quyết định phải dựa trên quy tắc đã nêu trong phương pháp nghiên cứu. Nếu cần chuẩn hóa cách trình bày dữ liệu trước khi phân tích, bạn có thể xem chuẩn hóa dữ liệu là gì.

Cách viết kết quả vào luận văn

Sau khi kiểm tra xong, bạn có thể viết phần mô tả dữ liệu trong chương 4. Hãy thay số liệu minh họa bằng số liệu thật trong bảng Frequencies hoặc Descriptive Statistics, không sao chép số trong ví dụ.

Cách viết vào luận văn: “Sau khi loại các phiếu không hợp lệ và kiểm tra dữ liệu thiếu, nghiên cứu còn [N] quan sát hợp lệ. Dữ liệu được mã hóa trong SPSS với mỗi dòng đại diện cho một người trả lời và mỗi cột đại diện cho một biến. Các biến [tên nhóm biến] có giá trị từ [giá trị nhỏ nhất] đến [giá trị lớn nhất], phù hợp với khoảng mã hóa [1 đến 5 hoặc khoảng khác] của bảng hỏi.”

Nếu nhập dữ liệu từ Excel, bạn có thể thêm: “Dữ liệu ban đầu được tổng hợp trong Excel và nhập vào SPSS. Sau khi nhập, nghiên cứu kiểm tra tên biến, kiểu dữ liệu, Value Labels, Missing Values và phạm vi giá trị trước khi thực hiện các phân tích tiếp theo.” Câu này chỉ mô tả quy trình, không khẳng định dữ liệu của bạn đạt kết quả thống kê nào.

Khi trình bày giới tính hoặc nhóm tuổi, đưa số lượng và tỷ lệ phần trăm vào bảng mô tả. Khi trình bày các biến quan sát, dùng Mean và Standard Deviation nếu phương pháp của bạn có yêu cầu. Nếu biến định tính bị đưa vào hồi quy, cần mã hóa phù hợp trước khi chạy, xem thêm biến định tính chạy hồi quy phải làm sao.

Lỗi thường gặp khi chạy nhập liệu trong SPSS

Excel mở được nhưng tên biến bị sai

Nguyên nhân thường là hàng đầu tiên chứa dấu cách, dấu tiếng Việt hoặc ký tự đặc biệt. Hãy sửa tên cột thành dạng ngắn như DV1, DV2, YD1, sau đó dùng Label để ghi diễn giải đầy đủ trong SPSS.

Một cột số bị nhận thành String

Chỉ cần một ô chứa chữ, dấu cách hoặc ký hiệu không hợp lệ cũng có thể làm cột bị nhận là chuỗi. Lọc cột trong Excel, sửa giá trị lỗi, nhập lại file hoặc tạo biến số mới. Không dùng Find and Replace để đổi hàng loạt nếu bạn chưa lưu bản gốc.

SPSS báo dữ liệu thiếu dù Excel có câu trả lời

Có thể ô Excel chứa khoảng trắng, công thức trả về chuỗi rỗng hoặc mã missing không được khai báo. Dùng Frequencies để xem Valid và Missing, rồi kiểm tra trực tiếp các dòng có vấn đề trong Data View.

Số dòng trong SPSS ít hơn Excel

Bạn có thể đã chọn sai vùng dữ liệu, sai sheet hoặc Excel có dòng trống ở giữa. Mở lại bằng File > Open > Data, kiểm tra sheet và đánh dấu đọc tên biến ở hàng đầu tiên. Sau đó đối chiếu mã ID đầu và cuối giữa hai file.

Nhập nhầm mã thang đo

Lỗi này thường xảy ra khi một số câu dùng 1 là đồng ý, câu khác lại dùng 1 là không đồng ý. Đối chiếu bảng hỏi gốc, lập bảng mã hóa trước khi nhập và chỉ recode biến đảo chiều sau khi giữ lại biến gốc.

Đã nhập nhưng chưa biết làm gì tiếp theo

Hãy đi theo thứ tự: Frequencies để kiểm tra phạm vi, Descriptives để xem thống kê mô tả, Reliability Analysis để kiểm tra độ tin cậy, EFA nếu mô hình cần, rồi mới chạy hồi quy hoặc mô hình phù hợp. Đừng chạy hồi quy ngay khi chưa biết dữ liệu có mã sai hoặc missing hàng loạt.

Câu hỏi thường gặp

Nhập liệu SPSS là gì?

Nhập liệu SPSS là quá trình đưa dữ liệu khảo sát vào Data View và khai báo đặc điểm của từng biến trong Variable View. Dữ liệu có thể được nhập thủ công, dán từ Excel hoặc mở từ file .xlsx và .csv.

Một dòng thường đại diện cho một người trả lời, còn một cột đại diện cho một biến. Quy tắc này giúp SPSS thực hiện các phép tính trên từng biến và từng trường hợp một cách nhất quán.

Có thể nhập dữ liệu từ Excel trong SPSS không?

Có. Bạn chọn File > Open > Data, chọn file Excel, chọn đúng sheet và đánh dấu đọc tên biến từ hàng đầu tiên. Sau khi mở, cần kiểm tra lại Variable View vì SPSS có thể nhận sai kiểu dữ liệu hoặc tên cột.

Nếu dùng CSV, chọn đúng dấu phân cách như dấu phẩy hoặc dấu chấm phẩy. Khi có tiếng Việt, hãy kiểm tra mã hóa ký tự để tránh tên biến hoặc nội dung bị lỗi.

Nhập liệu SPSS bao nhiêu là tốt?

Không có một số điểm chung cho chất lượng nhập liệu. Một file tốt là file có cấu trúc dòng và cột đúng, biến được mã hóa nhất quán, không có giá trị ngoài phạm vi, missing được khai báo và số quan sát hợp lệ được ghi lại.

Các ngưỡng như Cronbach's Alpha, KMO hoặc factor loading chỉ được xem ở bước phân tích thang đo và EFA. Bạn không nên điều chỉnh dữ liệu để ép các chỉ số này đạt ngưỡng.

Nhập liệu xong có cần chạy Frequencies không?

Có, đặc biệt với file mới nhập từ Excel. Frequencies giúp phát hiện mã ngoài phạm vi, cột bị nhận sai kiểu, giá trị 99 chưa xử lý và số lượng missing bất thường.

Bạn nên chạy kiểm tra này trước khi tính điểm trung bình hoặc chạy mô hình. Một lỗi nhỏ ở bước nhập có thể xuất hiện dưới dạng kết quả lạ ở nhiều bảng output sau đó.

Có nên nhập trực tiếp hay nhập từ Excel?

Nhập từ Excel phù hợp khi bạn đã có nhiều câu trả lời và cần làm sạch, lọc hoặc đối chiếu dữ liệu. Nhập trực tiếp phù hợp với file nhỏ hoặc khi bạn đang xây dựng bộ mã hóa ngay trong SPSS.

Dù chọn cách nào, hãy lưu bản gốc, lưu file .sav theo phiên bản và ghi lại mọi lần loại dòng, đổi mã hoặc tạo biến mới. Đây là phần giải trình cần thiết khi người hướng dẫn hỏi về quy trình xử lý dữ liệu.

Mở file của bạn ngay bây giờ, kiểm tra hàng tiêu đề, khai báo Variable View, chạy Frequencies và lưu một bản .sav đầu tiên; nếu cần chạy phân tích trên dữ liệu thật bằng SPSS hoặc SmartPLS, bạn có thể dùng M4 phân tích dữ liệu.