Cách gán nhãn giá trị trong SPSS từ A đến Z
Khi nào dùng gán nhãn giá trị trong SPSS
Bạn dùng gán nhãn giá trị khi file SPSS đang lưu câu trả lời bằng mã số, nhưng bạn cần nhìn thấy ý nghĩa của từng mã. Ví dụ, cột GIOITINH có các giá trị 1 và 2, trong đó 1 là Nam, 2 là Nữ. Cột HL1 có các giá trị từ 1 đến 5, tương ứng với mức độ từ hoàn toàn không đồng ý đến hoàn toàn đồng ý.
Gán nhãn giá trị, hay Value Labels, giúp SPSS hiển thị phần diễn giải bên cạnh mã số. Thao tác này phù hợp với biến định tính, biến thứ bậc và các biến Likert trong bảng hỏi. Nó không biến dữ liệu định tính thành dữ liệu định lượng mới, cũng không thay đổi con số đang có trong ô dữ liệu.
Bạn nên làm bước này ngay sau khi nhập dữ liệu từ bảng hỏi, trước khi chạy Frequencies, Descriptive Statistics, Cronbach's Alpha hoặc hồi quy. Nếu đang phân vân dữ liệu của mình là dữ liệu sơ cấp hay dữ liệu thứ cấp, bạn có thể xem thêm bài dữ liệu sơ cấp và dữ liệu thứ cấp là gì. Hai loại dữ liệu đều có thể cần gán nhãn, miễn là bạn hiểu rõ mã số ban đầu.
Chuẩn bị dữ liệu trước khi chạy
Gán nhãn không sửa được một bảng dữ liệu nhập sai. Trước khi mở Variable View, hãy đối chiếu file .sav với bảng mã của bảng hỏi. Bạn cần biết tên biến, loại biến, mã hợp lệ, mã thiếu và nội dung của từng mức trả lời.
Tên biến nên ngắn, không có khoảng trắng và nhất quán với bảng hỏi. Chẳng hạn, GT cho giới tính, TUOI cho nhóm tuổi, HL1 đến HL5 cho các biến quan sát của thang đo hài lòng. Cột Name chứa tên kỹ thuật, còn Label có thể ghi mô tả đầy đủ hơn như “Giới tính của người trả lời”.
Ở cột Type, dữ liệu mã hóa bằng 1, 2, 3 nên thường để là Numeric. Cột Decimals có thể để 0 với biến mã nhóm. Với biến Likert, các mã cũng thường là số nguyên, nhưng bạn vẫn cần kiểm tra bảng hỏi để chắc chắn. Nếu bạn nhập trực tiếp chữ “Nam”, “Nữ” vào Data View thì đó là biến chuỗi, cách xử lý sẽ khác với biến số đã gán nhãn.
Hãy kiểm tra bốn điểm sau trước khi gán nhãn:
- Mã số trong Data View có nằm trong mã trả lời của bảng hỏi không.
- Giá trị thiếu như bỏ trống, không trả lời hoặc không áp dụng có được quy ước riêng không.
- Các biến đảo chiều đã được ghi chú để xử lý ở bước sau chưa.
- Thang đo có dùng cùng một chiều từ mức thấp đến mức cao không.
Nếu bạn cần chỉnh dạng dữ liệu trước khi phân tích, hãy xem hướng dẫn chuẩn hóa dữ liệu là gì. Với biến định tính đưa vào hồi quy, việc gán nhãn chỉ giúp đọc dữ liệu, còn việc tạo biến giả là một bước khác. Trường hợp đó cần xem thêm biến định tính chạy hồi quy phải làm sao.
Các bước chạy gán nhãn giá trị trong SPSS
Gán nhãn giá trị không nằm trong nhóm lệnh Analyze. Bạn thực hiện chủ yếu ở Variable View, sau đó dùng Analyze > Descriptive Statistics > Frequencies để kiểm tra nhãn đã hiển thị đúng chưa.
Mở Variable View và xác định biến cần gán nhãn
Mở file SPSS, nhìn xuống cuối cửa sổ Data Editor và chọn tab Variable View. Mỗi hàng là một biến, mỗi cột là một thuộc tính. Tìm biến cần xử lý bằng cột Name, thay vì chỉ dựa vào vị trí của cột.
Ở cột Label, bạn có thể ghi câu mô tả đầy đủ. Ví dụ, với biến GT, nhập “Giới tính người trả lời”. Nhãn của biến và nhãn của giá trị là hai thứ khác nhau. Variable Label mô tả cả biến, còn Value Label mô tả từng mã số bên trong biến.
Mở hộp Value Labels
Tại hàng của biến GT, đi đến cột Values. Bấm vào ô đó, sau đó bấm nút có dấu ba chấm. Hộp thoại Value Labels xuất hiện với hai ô Value và Value Label.
Nhập 1 vào Value, nhập Nam vào Value Label, rồi bấm Add. Tiếp tục nhập 2 và Nữ, sau đó bấm Add. Khi danh sách đã đủ, bấm OK. SPSS vẫn giữ số 1 và 2 trong Data View, chỉ bổ sung cách diễn giải cho chúng.
Với biến Likert, bạn có thể nhập lần lượt như sau: 1 là “Hoàn toàn không đồng ý”, 2 là “Không đồng ý”, 3 là “Trung lập”, 4 là “Đồng ý”, 5 là “Hoàn toàn đồng ý”. Nếu bảng hỏi dùng cách diễn đạt khác, hãy giữ nguyên wording đã được duyệt trong bảng hỏi để tránh nhầm khi viết chương phương pháp.
Bật hiển thị nhãn trong Data View
Chọn View > Value Labels, hoặc bấm biểu tượng hiển thị nhãn trên thanh công cụ. Khi bật, Data View có thể hiển thị Nam thay cho 1, tùy phiên bản SPSS và trạng thái hiển thị. Bấm lại tùy chọn này nếu bạn muốn quay về xem mã số.
Việc chuyển qua lại giữa mã số và nhãn rất hữu ích khi kiểm tra. Bạn nhìn nhãn để đọc dữ liệu, nhưng vẫn nhìn được mã số khi đối chiếu với file mã hóa hoặc khi phát hiện một người trả lời có giá trị ngoài quy ước.
Kiểm tra bằng Frequencies
Chọn Analyze > Descriptive Statistics > Frequencies. Đưa biến vừa gán nhãn vào ô Variable(s), giữ lựa chọn hiển thị bảng tần số và bấm OK. Bảng Frequency trong Output Viewer sẽ cho biết SPSS đang đọc mã và nhãn như thế nào.
Nếu muốn kiểm tra nhiều biến cùng lúc, bạn có thể đưa nhóm biến giới tính, độ tuổi hoặc các biến Likert vào hộp phân tích. Với nhóm biến quan sát dùng cho Cronbach's Alpha, bước Frequencies giúp phát hiện nhanh một biến bị nhập nhầm thang điểm hoặc xuất hiện mã không có trong bảng hỏi.
Lưu lại file và ghi lại bảng mã
Chọn File > Save hoặc File > Save As để lưu phiên bản đã gán nhãn. Nên giữ một bản dữ liệu gốc chưa chỉnh sửa, một bản làm việc và một file syntax nếu bạn muốn tái lập thao tác. Bạn có thể xem thêm cách chạy syntax SPSS để lưu lại lệnh và tránh phải nhập thủ công nhiều lần.
Đừng chỉ dựa vào việc SPSS đã lưu nhãn. Hãy giữ một bảng mã riêng gồm tên biến, nội dung biến, mã giá trị, nhãn giá trị và mã thiếu. Bảng này giúp bạn giải thích dữ liệu khi giảng viên hỏi vì sao một mã số được xem là “không áp dụng” thay vì một câu trả lời hợp lệ.
Đọc kết quả output
Sau khi chọn Analyze > Descriptive Statistics > Frequencies, SPSS thường tạo bảng Statistics và bảng Frequency Table. Với biến có nhãn, cột Value trong bảng tần số sẽ hiển thị nội dung như Nam, Nữ hoặc tên mức Likert, thay vì chỉ hiện mã số.
Frequency Table, số liệu minh họa
Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thực tế. Nó mô phỏng output của SPSS khi biến GT đã được gán nhãn giá trị.
| Giới tính người trả lời | Frequency | Percent | Valid Percent | Cumulative Percent |
|---|---|---|---|---|
| Nam | 82 | 41.0 | 41.0 | 41.0 |
| Nữ | 114 | 57.0 | 57.0 | 98.0 |
| Khác | 4 | 2.0 | 2.0 | 100.0 |
| Total | 200 | 100.0 | 100.0 |
Frequency là số quan sát ở mỗi nhóm. Percent tính trên toàn bộ dòng dữ liệu, còn Valid Percent loại các trường hợp bị xem là missing. Khi không có missing, hai cột này thường giống nhau. Cumulative Percent cộng dồn theo thứ tự các giá trị, phù hợp hơn với biến có thứ bậc như nhóm tuổi hoặc mức độ đồng ý.
Nếu output vẫn hiện 1, 2, 3 thay vì nhãn, nguyên nhân thường là bạn chưa bật Value Labels, nhãn chưa được thêm vào đúng biến, hoặc dữ liệu đang là kiểu String. Nếu bảng có một dòng mã lạ, chẳng hạn 6 trong thang đo chỉ cho phép từ 1 đến 5, lỗi nằm ở dữ liệu hoặc quy ước nhập chứ không nằm ở phần hiển thị.
Bạn cũng cần đọc dòng Missing trong output. Một ô trống trong Data View và một mã như 99 có thể được SPSS xử lý khác nhau. Nếu 99 chưa được khai báo là missing, nó vẫn được tính vào tần số hợp lệ và có thể làm sai phần trăm.
Tiêu chí đánh giá
Gán nhãn giá trị không có một ngưỡng thống kê riêng để kết luận “đạt” hay “không đạt”. Bạn đánh giá chất lượng của bước này bằng tính nhất quán giữa bảng hỏi, bảng mã và output. Các ngưỡng dưới đây thường xuất hiện ở bước kiểm tra tiếp theo, vì vậy hãy dùng đúng mục đích, không dùng chúng để hợp thức hóa một mã nhập sai.
| Nội dung cần kiểm tra | Mức tham khảo hoặc quyết định | Nguồn |
|---|---|---|
| Corrected Item-Total Correlation khi kiểm tra thang đo | Từ 0.3 trở lên | (Nunnally và Bernstein, 1994) |
| Cronbach's Alpha của thang đo | Từ 0.7 trở lên | (Nunnally, 1978) |
| Cronbach's Alpha trong thang đo mới hoặc nghiên cứu khám phá | Có thể xem xét từ 0.6 | (Hair và cộng sự, 2010) |
| KMO trước EFA | Từ 0.5 trở lên | (Kaiser, 1974) |
| Bartlett's Test trước EFA | p-value nhỏ hơn 0.05 | (Kaiser, 1974) |
| Factor loading trong EFA | Từ 0.5 trở lên | (Hair và cộng sự, 2010) |
| Số quan sát cho mỗi biến quan sát | Khoảng 5 đến 10 quan sát cho một biến | (Hair và cộng sự, 2010) |
Ví dụ, nếu một biến Likert được gán nhãn từ 1 đến 5 nhưng trong output xuất hiện giá trị 7, bạn cần quay lại kiểm tra bảng hỏi và dữ liệu. Không nên xóa giá trị 7 chỉ để bảng tần số trông đẹp. Hãy xác định đó là lỗi nhập, một lựa chọn hợp lệ chưa được cập nhật, hay mã missing chưa khai báo.
Với biến danh nghĩa như giới tính, không có ý nghĩa xếp hạng giữa mã 1 và mã 2. Với biến thứ bậc, thứ tự của mã có ý nghĩa, nên nhãn cần phản ánh đúng chiều tăng giảm. Đối với thang Likert, việc đổi nhãn “1 là hoàn toàn đồng ý” sang “1 là hoàn toàn không đồng ý” có thể làm bạn diễn giải ngược toàn bộ kết quả.
Cách viết kết quả vào luận văn
Cách viết vào luận văn: “Dữ liệu được mã hóa trước khi nhập vào SPSS. Biến [TÊN BIẾN] được gán các giá trị [MÃ 1] = [NHÃN 1], [MÃ 2] = [NHÃN 2] và [MÃ 3] = [NHÃN 3]. Các mã không áp dụng hoặc không trả lời được khai báo là giá trị thiếu trước khi thực hiện thống kê mô tả.”
Nếu đang mô tả mẫu, bạn có thể viết: “Trong tổng số [N] quan sát hợp lệ, nhóm [TÊN NHÓM] có [TẦN SỐ] người, chiếm [TỶ LỆ]%. Tỷ lệ được tính trên số quan sát hợp lệ sau khi xử lý giá trị thiếu.” Chỉ điền số sau khi đối chiếu trực tiếp với bảng Frequency Table trong file của bạn.
Không nên viết rằng “SPSS chuyển giới tính thành biến định lượng” chỉ vì bạn đã gán mã 1 và 2. Cách viết chính xác hơn là biến được mã hóa bằng số để phần mềm lưu trữ và phân tích, còn ý nghĩa của mã được xác định bởi bảng mã nghiên cứu.
Lỗi thường gặp khi chạy gán nhãn giá trị trong SPSS
Nhập nhãn nhưng không bấm Add. Bạn nhập 1 = Nam, bấm OK ngay mà quên Add, nên SPSS không lưu dòng đó. Mở lại Value Labels và kiểm tra danh sách bên trái trước khi đóng hộp thoại.
Gán nhãn nhầm biến. Hai biến có thể đứng cạnh nhau như GT và NHOMTUOI. Hãy nhìn cột Name và Label, không chọn theo vị trí hàng một cách máy móc.
Nhập chữ vào biến Numeric. Nếu cột đang là Numeric mà bạn gõ “Nam” trong Data View, SPSS có thể báo lỗi hoặc tạo missing. Cách an toàn là giữ mã số trong Data View và đặt chữ ở Value Labels.
Nhầm Value Label với Variable Label. Variable Label là mô tả của cả cột, còn Value Label là diễn giải cho từng giá trị. Ghi “Giới tính” vào Variable Label chưa đủ để SPSS biết mã 1 và mã 2 có nghĩa gì.
Dùng mã missing như một câu trả lời hợp lệ. Các mã quy ước cho không trả lời cần được khai báo ở cột Missing. Nếu không, Frequencies, trung bình và các phân tích sau có thể tính cả những dòng không có câu trả lời thực sự.
Gán nhãn đảo chiều. Một biến đảo chiều trong thang đo cần được ghi chú rõ. Gán nhãn chỉ làm cho mã dễ đọc, không tự động đảo điểm. Nếu cần đảo chiều, bạn phải thực hiện phép biến đổi theo quy ước của thang đo rồi kiểm tra lại trước khi chạy Cronbach's Alpha.
Câu hỏi thường gặp
Gán nhãn giá trị trong SPSS có làm thay đổi số liệu không?
Không. Value Labels chỉ gắn phần mô tả cho mã số đang có. Giá trị 1 vẫn là 1 và giá trị 2 vẫn là 2. Tuy nhiên, nhãn sai có thể khiến bạn đọc và diễn giải kết quả sai, nên cần đối chiếu với bảng mã gốc.
Vì sao tôi gán nhãn rồi nhưng Data View vẫn hiện 1, 2, 3?
Bạn kiểm tra View > Value Labels trước. Nếu tùy chọn này đã bật mà dữ liệu vẫn hiện mã số, hãy mở lại cột Values trong Variable View để xem các dòng nhãn đã được thêm bằng nút Add hay chưa. Cũng cần kiểm tra biến có phải kiểu Numeric hay đang là String.
Có cần gán nhãn cho tất cả biến trước khi chạy SPSS không?
Bạn nên gán nhãn cho các biến phân loại, biến nhóm và các biến quan sát dùng trong bảng hỏi. Với biến định lượng liên tục như doanh thu hoặc số năm kinh nghiệm, nhãn giá trị thường không cần thiết nếu mỗi giá trị là một con số đo lường riêng. Variable Label vẫn hữu ích để ghi rõ đơn vị và nội dung biến.
Có thể gán nhãn hàng loạt cho nhiều biến Likert không?
Có. Bạn có thể sao chép thuộc tính nhãn giữa các biến có cùng thang đo, hoặc dùng syntax để giảm thao tác lặp. Trước khi áp dụng hàng loạt, hãy chắc chắn các biến có cùng mã và cùng chiều diễn giải. Nếu một biến dùng thang 1 đến 7 trong khi các biến còn lại dùng 1 đến 5, không nên sao chép chung.
Gán nhãn xong có cần chạy Frequencies không?
Có, đặc biệt với file vừa nhập từ bảng hỏi. Analyze > Descriptive Statistics > Frequencies giúp bạn phát hiện mã ngoài phạm vi, nhóm không có quan sát, tỷ lệ missing và nhãn bị nhập nhầm. Đây là bước kiểm tra dữ liệu, không phải bằng chứng rằng thang đo đã đạt độ tin cậy.
Bạn hãy mở bản sao file .sav, kiểm tra từng biến trong Variable View, chạy Frequencies cho các biến phân loại và lưu lại bảng mã trước khi chuyển sang Cronbach's Alpha hoặc EFA. Nếu muốn chạy phân tích trên chính file .sav hoặc .csv mà không phải dò từng lỗi một, bạn có thể dùng module M4 phân tích dữ liệu của DoThesis.