File SAV là gì? Cách mở và đọc file SAV trong SPSS
File SAV là gì
File SAV là định dạng tệp dữ liệu gốc của IBM SPSS Statistics, thường có phần mở rộng .sav. Khi bạn nhập bảng trả lời khảo sát vào SPSS rồi lưu lại bằng File > Save As, SPSS thường tạo ra tệp dạng này. Một file SAV có thể chứa dữ liệu của từng người trả lời, tên biến, nhãn biến, nhãn giá trị, loại thang đo, mã giá trị thiếu và một số thông tin mô tả khác.
Bạn có thể hiểu file SAV như một bảng dữ liệu đã được SPSS ghi nhận theo cấu trúc riêng. Mỗi hàng thường là một quan sát, chẳng hạn một người trả lời bảng hỏi. Mỗi cột là một biến, chẳng hạn GT, TUOI, HL1, HL2 hoặc TN1. File SAV trong SPSS khác với một bảng Excel ở chỗ nó lưu được cả phần dữ liệu và phần mô tả biến.
File SAV không phải là kết quả phân tích. Nó là dữ liệu đầu vào để bạn chạy Cronbach's Alpha, EFA, hồi quy, tương quan hoặc các thủ tục khác. Kết quả phân tích thường nằm trong cửa sổ Output và có thể được lưu thành file riêng, chẳng hạn .spv trong các phiên bản SPSS hỗ trợ định dạng này.
Nếu bạn đang phân vân giữa dữ liệu thu từ bảng hỏi và dữ liệu có sẵn, có thể xem thêm bài dữ liệu sơ cấp là gì và dữ liệu thứ cấp là gì. Việc xác định nguồn dữ liệu giúp bạn mô tả đúng phương pháp ở chương 3.
Ý nghĩa của file SAV trong nghiên cứu định lượng
Trong một luận văn định lượng, file SAV là bản làm việc giúp bạn đi từ bảng trả lời đến kết quả thống kê. Khi mở file, bạn có thể kiểm tra dữ liệu gốc, phát hiện ô trống, xem mã hóa biến và thực hiện các bước làm sạch trước khi chạy mô hình.
File SAV cũng giữ lại cấu trúc mà một bảng Excel thông thường dễ làm mất. Ví dụ, biến GT có thể được đặt nhãn là “Giới tính”, giá trị 1 có nhãn “Nam” và giá trị 2 có nhãn “Nữ”. Khi người khác mở file, họ hiểu được ý nghĩa của các con số mà không phải đoán từ tên cột.
Bạn nên giữ ít nhất ba phiên bản: file dữ liệu ban đầu, file đã làm sạch và file dùng cho phân tích cuối cùng. Không nên sửa trực tiếp bản gốc sau khi đã thu thập dữ liệu. Nếu xóa một dòng, đổi mã hoặc loại một biến, hãy ghi lại lý do trong nhật ký xử lý dữ liệu.
Một file SAV tốt giúp bạn trả lời được các câu hỏi sau:
- Có bao nhiêu quan sát hợp lệ.
- Mỗi biến được mã hóa theo cách nào.
- Có biến nào nhập nhầm kiểu dữ liệu hay không.
- Các biến quan sát có cùng chiều đo hay cần đảo mã.
- Dữ liệu hiện tại dùng được cho phân tích nào.
Tên file nên thể hiện trạng thái dữ liệu, chẳng hạn khaosat_raw.sav, khaosat_clean.sav và khaosat_efa_v2.sav. Cách đặt tên này có ích khi bạn phải quay lại một bước trước vì kết quả không phù hợp.
Bạn cũng có thể xem trang chủ đề SPSS để đối chiếu các thủ tục thường dùng trong nghiên cứu định lượng. SPSS, SmartPLS, AMOS, JASP và R đều có thể hỗ trợ phân tích, nhưng file SAV là định dạng gắn trực tiếp với SPSS. Nếu giảng viên yêu cầu nộp file dữ liệu, hãy hỏi rõ họ cần .sav, .xlsx, .csv hay cả ba.
File SAV bao nhiêu là tốt
Câu hỏi “file SAV bao nhiêu là tốt” thường bị hiểu thành kích thước file tính bằng MB. Kích thước nhỏ hay lớn không quyết định chất lượng dữ liệu. Một file chỉ vài trăm KB vẫn có thể chứa lỗi mã hóa, nhiều dòng trùng hoặc biến nhập sai. Ngược lại, file lớn chưa chắc có dữ liệu phù hợp.
Điều cần đánh giá là số quan sát hợp lệ, số biến, mức độ đầy đủ và sự phù hợp giữa dữ liệu với mô hình nghiên cứu. Nếu bảng hỏi có 25 biến quan sát, quy tắc tham khảo thường được dùng là 5 đến 10 quan sát cho mỗi biến quan sát (Hair và cộng sự, 2010). Đây là căn cứ tham khảo, không phải phép bảo đảm rằng file của bạn chắc chắn đạt.
| Nội dung cần kiểm tra | Dấu hiệu nên có | Cách kiểm tra trong SPSS | Nguồn hoặc lưu ý |
|---|---|---|---|
| Số quan sát | Đủ so với thiết kế mẫu và mô hình | Analyze > Descriptive Statistics > Frequencies | Quy tắc 5 đến 10 quan sát cho mỗi biến quan sát (Hair và cộng sự, 2010) |
| Dữ liệu thiếu | Được mã hóa thống nhất, không bỏ sót hàng loạt | Analyze > Descriptive Statistics > Frequencies | Cần xem tỷ lệ và nguyên nhân, không có một ngưỡng chung áp dụng cho mọi đề tài |
| Cronbach's Alpha | Từ 0.7 thường được xem là chấp nhận được | Analyze > Scale > Reliability Analysis | (Nunnally, 1978) |
| Corrected Item-Total Correlation | Từ 0.3 trở lên | Bảng Item-Total Statistics | (Nunnally và Bernstein, 1994) |
| KMO | Từ 0.5 trở lên | Bảng KMO and Bartlett's Test | (Kaiser, 1974) |
| Bartlett's Test | Sig. nhỏ hơn 0.05 | Bảng KMO and Bartlett's Test | (Kaiser, 1974) |
| Factor loading | Từ 0.5 trở lên trong EFA | Bảng Rotated Component Matrix | (Hair và cộng sự, 2010) |
| Total Variance Explained | Từ 50% trở lên trong trường hợp áp dụng EFA | Bảng Total Variance Explained | (Hair và cộng sự, 2010) |
Các nguồn trong bảng là căn cứ thường được trích trong luận văn, nhưng bạn vẫn cần xem hướng dẫn của khoa và đặc điểm thang đo. Không nên xóa biến chỉ vì một con số chưa đẹp mà chưa kiểm tra nội dung biến, chiều đo và cấu trúc lý thuyết.
Cách đọc file SAV trên output
Để mở file, vào File > Open > Data, chọn loại tệp SPSS Statistics và tìm đến file .sav. Bạn cũng có thể nhấp đúp vào file nếu máy đã liên kết phần mở rộng này với SPSS. Sau khi mở, SPSS thường hiển thị hai tab chính là Data View và Variable View.
Trong Data View, mỗi hàng là một bản ghi và mỗi cột là một biến. Trong Variable View, bạn kiểm tra Name, Type, Label, Values, Missing, Measure và các thuộc tính khác. Hãy nhìn cả hai tab trước khi chạy phân tích. Nhiều lỗi xuất hiện vì người dùng chỉ nhìn bảng số liệu mà không kiểm tra phần định nghĩa biến.
Ví dụ, nếu HL1, HL2, HL3 là các biến quan sát của khái niệm hài lòng, bạn có thể chạy Analyze > Scale > Reliability Analysis. Đưa các biến này vào ô Items, chọn model Alpha, sau đó vào Statistics và đánh dấu Scale if item deleted. Bảng output có thể có dạng sau.
Bảng số liệu minh họa, không phải kết quả của một nghiên cứu thực tế:
| Reliability Statistics | Cronbach's Alpha | N of Items |
|---|---|---|
| Thang đo Hài lòng | 0.812 | 4 |
| Item-Total Statistics | Scale Mean if Item Deleted | Corrected Item-Total Correlation | Cronbach's Alpha if Item Deleted |
|---|---|---|---|
| HL1 | 12.46 | 0.571 | 0.783 |
| HL2 | 12.18 | 0.648 | 0.748 |
| HL3 | 12.31 | 0.614 | 0.764 |
| HL4 | 12.05 | 0.402 | 0.806 |
Trong ví dụ minh họa, Alpha là 0.812 và tương quan biến tổng của bốn biến đều cao hơn 0.3. Bạn vẫn cần đọc cột Cronbach's Alpha if Item Deleted. Nếu xóa một biến làm Alpha tăng rất ít nhưng biến đó có ý nghĩa lý thuyết, việc xóa chưa chắc hợp lý.
Sau Cronbach's Alpha, EFA thường được chạy bằng Analyze > Dimension Reduction > Factor. Trong hộp thoại, đưa các biến cần phân tích vào Variables, chọn Descriptives để lấy KMO và Bartlett, chọn Extraction để xem eigenvalue, rồi chọn Rotation như Varimax nếu phù hợp với thiết kế. Output cần đọc theo thứ tự KMO and Bartlett's Test, Total Variance Explained và Rotated Component Matrix.
Nếu bạn muốn lặp lại các bước mà không bấm lại từng hộp thoại, hãy lưu syntax bằng nút Paste thay vì OK, sau đó chạy trong Syntax Editor. Bài cách chạy syntax SPSS sẽ hữu ích khi bạn cần ghi lại chính xác từng vòng phân tích.
Khi file SAV không đạt thì xử lý thế nào
Trước hết, xác định “không đạt” đang nói về file hay về kết quả phân tích. File không mở được là lỗi định dạng hoặc đường dẫn. File mở được nhưng Alpha thấp, KMO thấp hoặc ma trận xoay không rõ là vấn đề của dữ liệu, thang đo hoặc cách mã hóa.
Thứ tự xử lý nên bắt đầu từ những việc ít ảnh hưởng nhất:
Kiểm tra kiểu biến và mã hóa
Trong Variable View, xem biến có đang là Numeric hay String. Các biến dùng để tính điểm thường phải ở dạng số. Nếu câu trả lời đang là chữ như “Hoàn toàn đồng ý”, bạn cần mã hóa thành số theo quy ước của bảng hỏi trước khi chạy phân tích.
Kiểm tra biến đảo chiều
Một biến phủ định cần được đảo mã trước khi tính Alpha hoặc tạo điểm trung bình. Với thang Likert 5 mức, phép đảo thường có dạng 6 - giá trị cũ, nhưng chỉ dùng khi thang đo thật sự có 5 mức và quy ước mã hóa đúng như vậy. Hãy đối chiếu bảng hỏi trước khi dùng Transform > Compute Variable.
Kiểm tra dữ liệu thiếu và dòng bất thường
Dùng Analyze > Descriptive Statistics > Frequencies để xem giá trị ngoài khoảng, ô trống và tần suất bất thường. Một người trả lời chọn cùng một mức cho toàn bộ bảng hỏi chưa đủ để kết luận là dữ liệu sai, nhưng đó là dấu hiệu cần xem lại thời gian trả lời và điều kiện lọc mẫu.
Chạy lại theo từng thang đo
Nếu Alpha thấp, đọc Corrected Item-Total Correlation và nội dung biến. Có thể loại biến khi có căn cứ thống kê và lý thuyết, đồng thời ghi lại biến nào bị loại và lý do. EFA hiếm khi ra đẹp ở lần chạy đầu. Loại biến, chạy lại và lưu từng phiên bản là cách làm có thể giải trình.
Nếu đã kiểm tra mã hóa, dữ liệu thiếu và biến ngoại lệ mà cấu trúc vẫn không phù hợp, hãy trao đổi với giảng viên về việc giữ nguyên kết quả, điều chỉnh mô hình hoặc thu thập bổ sung. Không nên xóa hàng loạt quan sát chỉ để làm đẹp Alpha.
Phân biệt file SAV với các định dạng dễ nhầm
File SAV thường bị nhầm với file output, file Excel và file CSV. Mỗi định dạng có mục đích khác nhau.
| Định dạng | Nội dung chính | Khi nên dùng | Điểm cần chú ý |
|---|---|---|---|
.sav | Dữ liệu, nhãn biến, nhãn giá trị và thuộc tính SPSS | Làm việc trực tiếp trong SPSS | Cần SPSS hoặc phần mềm tương thích để mở đầy đủ thuộc tính |
.spv | Bảng và biểu đồ kết quả trong Output Viewer | Lưu kết quả phân tích | Không phải file dữ liệu đầu vào |
.xlsx | Bảng dữ liệu dạng Excel | Nhập liệu, kiểm tra và chia sẻ | Có thể mất nhãn biến hoặc thay đổi định dạng khi nhập lại |
.csv | Dữ liệu dạng văn bản phân tách bằng dấu phẩy hoặc ký tự khác | Trao đổi giữa SPSS, R, Python và SmartPLS | Không lưu đầy đủ nhãn biến, nhãn giá trị và thiết lập đo lường |
Nếu bạn dùng SmartPLS, file CSV thường thuận tiện hơn SAV. Nếu nghiên cứu làm toàn bộ trong SPSS, SAV giúp giữ lại cấu trúc biến. Khi chuyển từ Excel sang SPSS, hãy kiểm tra hàng tiêu đề, tên biến, dấu thập phân và giá trị thiếu.
Bạn cũng nên phân biệt file SAV với việc chuẩn hóa dữ liệu. Chuẩn hóa là một phép biến đổi trên giá trị, còn SAV chỉ là định dạng lưu trữ. Bài chuẩn hóa dữ liệu là gì giải thích riêng khi nào cần biến đổi dữ liệu và khi nào không nên làm.
Cách viết vào luận văn
Bạn có thể viết: “Dữ liệu khảo sát sau khi thu thập được mã hóa và lưu dưới định dạng .sav để xử lý bằng IBM SPSS Statistics. Mỗi dòng dữ liệu đại diện cho một quan sát, mỗi cột đại diện cho một biến, trong đó các biến quan sát được mã hóa theo bảng hỏi và kiểm tra dữ liệu thiếu trước khi phân tích.” Hãy thay [số quan sát], [số biến] và [phiên bản SPSS] bằng thông tin thật trong file của bạn.
Lỗi thường gặp
Lỗi đầu tiên là mở nhầm file output rồi tưởng đó là file dữ liệu. Hãy nhìn phần mở rộng trước khi mở. .sav là dữ liệu, còn .spv là kết quả output trong các phiên bản SPSS tương ứng.
Lỗi thứ hai là đặt tên biến có dấu, khoảng trắng hoặc ký tự đặc biệt. Tên biến nên ngắn, dễ truy vết như DV1, DV2, HL1. Phần Label có thể ghi diễn giải đầy đủ bằng tiếng Việt.
Lỗi thứ ba là nhập dòng tiêu đề như một quan sát. Khi nhập Excel, hãy kiểm tra tùy chọn “Read variable names from the first row of data”. Nếu không, hàng tên cột có thể bị đưa vào dữ liệu.
Lỗi thứ tư là lưu đè file gốc sau mỗi lần loại biến. Hãy dùng tên phiên bản như efa_v1.sav, efa_v2.sav. Việc này giúp bạn giải thích với giảng viên vì sao số quan sát hoặc số biến thay đổi.
Lỗi thứ năm là chỉ nhìn kích thước file. Một file SAV bao nhiêu là tốt không được quyết định bằng dung lượng. Hãy ưu tiên tính hợp lệ của quan sát, mã hóa nhất quán, khả năng truy xuất nguồn dữ liệu và sự phù hợp với mô hình.
Nếu bạn đang hồi quy với biến phân loại, đừng tự chuyển chữ thành số rồi đưa thẳng vào mô hình mà không kiểm tra cách tạo biến giả. Có thể xem hướng dẫn biến định tính chạy hồi quy phải làm sao trước khi thực hiện bước này.
Câu hỏi thường gặp
File SAV có mở bằng Excel được không
Excel có thể đọc một số file SAV thông qua công cụ hoặc phần mềm trung gian, nhưng không giữ đầy đủ nhãn biến và thuộc tính SPSS trong mọi trường hợp. Nếu phân tích bằng SPSS, nên mở trực tiếp bằng File > Open > Data để hạn chế mất thông tin.
File SAV có phải là dữ liệu đã xử lý xong không
Không. SAV chỉ cho biết dữ liệu được lưu theo định dạng của SPSS. File có thể là dữ liệu thô, dữ liệu đã làm sạch hoặc dữ liệu sau khi tạo biến mới. Bạn cần xem tên file, nhật ký xử lý và các biến bên trong để xác định trạng thái.
File SAV bị lỗi không mở được thì làm sao
Trước tiên, sao chép file sang một thư mục khác và thử mở bản sao. Kiểm tra file có bị đổi phần mở rộng, bị nén hoặc bị gián đoạn khi tải xuống hay không. Nếu có bản backup, dùng bản gần nhất thay vì tiếp tục chỉnh trên file lỗi.
Bạn cũng có thể nhờ người gửi xuất lại thành .sav hoặc .csv, nhưng cần kiểm tra lại tên biến, mã giá trị và số dòng sau khi nhập. Không nên đổi đuôi .xlsx thành .sav, vì đổi tên phần mở rộng không chuyển đổi định dạng.
Có nên lưu file SAV trên Google Drive không
Có thể lưu để sao lưu, nhưng nên giữ một bản cục bộ và đặt tên phiên bản rõ ràng. Khi nhiều người cùng chỉnh sửa, hãy thống nhất một file chính để tránh việc mỗi người dùng một bản khác nhau. Dữ liệu khảo sát có thể chứa thông tin nhạy cảm, vì vậy cần kiểm tra quyền chia sẻ trước khi tải lên dịch vụ lưu trữ.
File SAV có dùng được cho SmartPLS không
SmartPLS thường làm việc thuận tiện với CSV. Bạn có thể xuất dữ liệu từ SPSS bằng File > Save As, chọn định dạng phù hợp, rồi kiểm tra lại hàng tiêu đề, kiểu số và giá trị thiếu trong CSV. Trước khi chạy, hãy bảo đảm tên biến trùng với indicator trong mô hình SmartPLS.
Mở file khaosat.sav ngay bây giờ, kiểm tra Data View và Variable View, rồi tạo một bản sao có tên mới trước khi làm sạch dữ liệu. Nếu cần chạy phân tích trên chính file .sav hoặc .csv của bạn, M4 phân tích dữ liệu của DoThesis hỗ trợ bước này mà không thay số liệu của bạn bằng số liệu giả.