Cách chạy Aggregate dữ liệu trong SPSS từng bước

SPSS··15 phút đọc

Khi nào dùng Aggregate dữ liệu trong SPSS

Aggregate trong SPSS dùng để gom nhiều dòng dữ liệu thành một dòng đại diện cho một nhóm, hoặc tạo thêm một biến tổng hợp ngay trên file hiện tại. Bạn thường cần thao tác này khi dữ liệu đang ở cấp độ giao dịch, lượt mua, lần đo hoặc câu trả lời lặp lại, nhưng mô hình nghiên cứu lại cần dữ liệu ở cấp độ người trả lời, cửa hàng, doanh nghiệp hay mã khách hàng.

Ví dụ, một người trả lời có thể xuất hiện ba dòng vì họ đánh giá ba sản phẩm. Nếu mục tiêu là so sánh điểm trung bình giữa các khách hàng, bạn cần tổng hợp các dòng theo mã khách hàng. Aggregate có thể tính Mean, Sum, Minimum, Maximum, Count và một số thống kê khác cho từng nhóm.

Thao tác này khác với tính điểm trung bình của một thang đo. Khi bạn tính Mean của các biến quan sát như SAT1, SAT2, SAT3, bạn đang tạo điểm cho một khái niệm. Khi chạy Aggregate theo MaKH, bạn đang thay đổi cấp độ của dữ liệu. Đây là khác biệt cần kiểm tra trước khi chạy hồi quy hoặc EFA.

Nếu bạn mới nhận file khảo sát, hãy xác định trước đó là dữ liệu sơ cấp hay dữ liệu được lấy lại từ nguồn có sẵn. Cấp độ quan sát và ý nghĩa của mỗi dòng phải rõ ràng thì kết quả Aggregate mới có thể giải thích được.

Chuẩn bị dữ liệu trước khi chạy

Trước khi tìm menu Aggregate, bạn nên mở Variable View và Data View để trả lời bốn câu hỏi: mỗi dòng là gì, nhóm cần tổng hợp là gì, biến nào cần tính, và giá trị thiếu được mã hóa ra sao.

Xác định biến nhóm. Biến nhóm có thể là MaKH, MaDN, MaCuaHang, MaLop hoặc một mã định danh khác. Mã này cần thống nhất về kiểu dữ liệu. Nếu một số mã đang là chữ, chẳng hạn KH001, KH002, hãy để biến ở dạng String. Nếu mã chỉ gồm số và không có số 0 ở đầu, có thể dùng Numeric.

Kiểm tra biến cần tổng hợp. MeanSum chỉ có ý nghĩa với biến số. Các biến Likert phải được mã hóa cùng chiều trước khi tính điểm. Nếu một biến là câu hỏi đảo chiều, bạn cần recode trước. Chẳng hạn thang đo từ 1 đến 5, biến đảo có thể được chuyển theo công thức 6 - điểm gốc. Sau đó mới dùng biến đã đảo chiều trong Aggregate.

Kiểm tra missing values. SPSS có thể tính trung bình dựa trên số quan sát hợp lệ, tùy cách xử lý và số lượng giá trị thiếu. Bạn không nên biến mã 99 hoặc 999 thành một giá trị số bình thường, vì nó sẽ kéo Mean và Sum lệch mạnh. Nếu file có mã thiếu như vậy, khai báo ở cột Missing hoặc recode thành system-missing trước khi chạy.

Kiểm tra bản sao và thứ tự dữ liệu. Aggregate theo nhóm sẽ cho kết quả khác nếu mã nhóm bị nhập sai, có khoảng trắng ở cuối hoặc cùng một đối tượng dùng hai mã khác nhau. Hãy chạy Analyze > Descriptive Statistics > Frequencies cho biến nhóm để phát hiện mã bất thường. Nếu muốn giữ dữ liệu chi tiết, lưu một bản sao trước khi thao tác.

Bạn có thể xem thêm hướng dẫn về chuẩn hóa dữ liệu là gì nếu các biến đang có đơn vị đo rất khác nhau. Tuy nhiên, chuẩn hóa không phải điều kiện bắt buộc cho mọi phép Aggregate. Bạn chỉ cần chuẩn hóa khi câu hỏi nghiên cứu hoặc mô hình yêu cầu so sánh các thang đo khác đơn vị.

Các bước chạy Aggregate dữ liệu trong SPSS

Cách chạy aggregate dữ liệu trong SPSS thường đi qua menu Data > Aggregate. Các bước dưới đây dùng SPSS Statistics và phù hợp khi bạn muốn tạo một file dữ liệu tổng hợp riêng.

Bước 1: Mở hộp thoại Aggregate

Trong Data View, chọn Data > Aggregate.... Hộp thoại Aggregate Data xuất hiện. Ở khung Break Variable(s), bạn đưa biến dùng để chia nhóm, chẳng hạn MaKH. Break Variable(s) có nghĩa là SPSS sẽ gom những dòng có cùng mã thành một nhóm.

Nếu bạn không đưa biến nào vào Break Variable(s), SPSS sẽ tính thống kê cho toàn bộ file như một nhóm duy nhất. Đây là nguyên nhân phổ biến khiến người dùng nhận một giá trị Mean chung thay vì một giá trị cho từng khách hàng.

Bước 2: Chọn biến cần tính

Đưa biến cần tổng hợp vào khung Aggregated Variables. Sau đó chọn hàm bằng cách nhấp vào nút Function. Với điểm đánh giá lặp lại, Mean thường phù hợp hơn Sum nếu mỗi nhóm có số dòng không bằng nhau. Với số lượt giao dịch, Count hoặc N có thể phù hợp hơn.

Bạn có thể tạo nhiều biến tổng hợp trong cùng một lần chạy. Ví dụ, với DoanhThu, tạo Mean_DTTB bằng hàm Mean và Sum_DT bằng hàm Sum. Đặt tên mới có ý nghĩa, vì tên mặc định dài và khó theo dõi khi đưa vào hồi quy.

Bước 3: Chọn cách lưu dữ liệu

Trong phần Save, bạn thường thấy hai lựa chọn: tạo một file dữ liệu mới chỉ chứa các nhóm tổng hợp, hoặc thêm biến tổng hợp vào file hiện tại. Nếu dữ liệu gốc có nhiều dòng cho mỗi nhóm, tạo file mới thường dễ kiểm tra hơn. Bạn vẫn giữ được file chi tiết để đối chiếu.

Nếu chọn cách tạo file mới, hãy đặt tên file rõ ràng như data_aggregate_khachhang.sav. Không ghi đè lên file gốc trong lần chạy đầu. Khi cần dùng syntax, bạn có thể xem thêm bài chạy syntax SPSS để lưu lại toàn bộ lệnh và tái lập quy trình.

Bước 4: Kiểm tra tùy chọn tạo chỉ số số dòng

Một số phiên bản SPSS cho phép tạo biến đếm số dòng trong mỗi nhóm, thường thông qua tùy chọn Number of cases. Biến này hữu ích để biết mỗi khách hàng có bao nhiêu bản ghi. Nếu một nhóm chỉ có một dòng trong khi các nhóm khác có năm dòng, bạn cần xem lại dữ liệu trước khi kết luận.

Bước 5: Nhấn OK và đối chiếu kết quả

Nhấn OK, sau đó xem Data View của file mới. Mỗi nhóm cần xuất hiện đúng một dòng nếu bạn đã chọn tạo dữ liệu tổng hợp. Kiểm tra ngẫu nhiên hai hoặc ba nhóm bằng cách quay lại file gốc, lọc theo mã nhóm và tự tính Mean hoặc Sum để so sánh.

Nếu cần chạy lại nhiều lần với các biến khác nhau, bạn nên ghi lại tên biến, hàm đã chọn và số nhóm. Việc này giúp bạn giải thích quy trình khi giảng viên hỏi vì sao số dòng giảm sau Aggregate. Bạn cũng có thể tìm hướng dẫn trong chủ đề SPSS để nối bước này với các phân tích tiếp theo.

Đọc kết quả output

Aggregate không tạo ra một bảng kiểm định giống Coefficients hay ANOVA. Kết quả chính nằm trong Data View của file mới, còn Output Viewer có thể không hiển thị nhiều thông tin nếu bạn chỉ chạy qua menu. Vì vậy, bạn phải đọc tên biến mới, số dòng và giá trị thống kê ở từng nhóm.

Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thật. Giả sử file gốc có nhiều giao dịch cho từng khách hàng, bạn tổng hợp theo MaKH và tính trung bình DiemHaiLong, tổng DoanhThu, cùng số dòng trong nhóm.

MaKHMean_DiemHaiLongSum_DoanhThuN_Records
KH0014.201,850,0003
KH0023.67920,0002
KH0034.502,410,0004

Trong bảng minh họa, KH001 có ba dòng ở file gốc. Điểm hài lòng trung bình của nhóm này là 4.20, còn tổng doanh thu là 1.850.000 theo đơn vị tiền tệ của file. Nếu bạn chỉ muốn giữ một dòng cho mỗi khách hàng, N_Records vẫn nên được giữ lại trong giai đoạn kiểm tra để phát hiện nhóm có quá ít hoặc quá nhiều bản ghi.

Khi Aggregate thêm biến vào file hiện tại thay vì tạo file mới, bạn có thể thấy cùng một giá trị tổng hợp lặp lại trên nhiều dòng thuộc cùng nhóm. Điều này là bình thường về mặt kỹ thuật, nhưng nguy hiểm nếu bạn dùng ngay file đó để chạy hồi quy. Các dòng lặp có thể làm số quan sát bị đếm nhiều lần. Hãy kiểm tra số dòng trước khi phân tích.

Nếu bạn định dùng biến tổng hợp để chạy hồi quy, hãy xác định biến phụ thuộc và biến độc lập đang ở cùng cấp độ. Một biến ở cấp khách hàng không nên ghép trực tiếp với biến ở cấp giao dịch nếu không có cách quy đổi rõ ràng. Trường hợp nghiên cứu có dữ liệu nhiều cấp, bạn có thể cần một phương pháp khác thay vì chỉ dùng Aggregate.

Tiêu chí đánh giá

Aggregate không có một ngưỡng p-value duy nhất để kết luận đạt hay không đạt. Tiêu chí quan trọng là dữ liệu sau tổng hợp phù hợp với câu hỏi nghiên cứu, nhóm được xác định chính xác, và hàm thống kê được chọn đúng với loại biến. Một số kiểm tra định lượng dưới đây giúp bạn tránh đưa file lỗi sang bước tiếp theo.

Nội dung cần kiểm traTiêu chí thực hànhNguồn
Số quan sát cho hồi quyNếu dùng hồi quy với m biến dự báo, cỡ mẫu nên từ 50 + 8m trở lên(Tabachnick và Fidell, 2013)
Mean của thang đoCác biến quan sát cần cùng chiều và cùng thang đo trước khi tính(Nguyễn Đình Thọ, 2011)
Cronbach's Alpha sau khi tạo điểmTừ 0.7 trở lên thường được chấp nhận(Nunnally, 1978)
Corrected Item-Total CorrelationTừ 0.3 trở lên(Nunnally và Bernstein, 1994)
Số biến quan sát trong EFACỡ mẫu tham khảo từ 5 đến 10 quan sát cho mỗi biến quan sát(Hair và cộng sự, 2010)
Durbin-Watson khi chạy hồi quyTrong khoảng 1 đến 3(Field, 2013)

Các dòng trong bảng là tiêu chí cho bước kiểm tra tiếp theo, không phải điều kiện bắt buộc của lệnh Aggregate. Chẳng hạn, Aggregate vẫn chạy được khi cỡ mẫu thấp, nhưng mô hình hồi quy sau đó có thể thiếu cơ sở. Bạn nên phân biệt lỗi thao tác với giới hạn phương pháp.

Nếu bạn tổng hợp các biến quan sát thành một điểm đại diện cho thang đo, hãy chạy lại Analyze > Scale > Reliability Analysis trước khi dùng điểm đó. Trong hộp thoại, đưa các biến quan sát cùng khái niệm vào Items, nhấn Statistics, chọn Scale if item deletedItem, rồi đọc bảng Reliability Statistics cùng Item-Total Statistics.

Cách viết kết quả Aggregate vào luận văn

Phần phương pháp nên nói rõ dữ liệu ban đầu có đơn vị quan sát nào, biến nhóm là gì, hàm tổng hợp nào được dùng và file sau xử lý còn bao nhiêu nhóm. Bạn không nên viết rằng SPSS tự động chứng minh dữ liệu đại diện, vì Aggregate chỉ thực hiện phép gom và tính toán theo tùy chọn bạn chọn.

Cách viết vào luận văn: “Dữ liệu ban đầu gồm [số dòng] quan sát ở cấp [cấp dữ liệu]. Nghiên cứu sử dụng biến [tên biến nhóm] để tổng hợp dữ liệu theo [đối tượng], trong đó [tên biến 1] được tính bằng [Mean/Sum/Count] và [tên biến 2] được tính bằng [Mean/Sum/Count]. Sau khi kiểm tra các mã nhóm và giá trị thiếu, bộ dữ liệu còn [số nhóm] quan sát để thực hiện [phân tích tiếp theo].”

Nếu muốn mô tả một kết quả cụ thể, bạn có thể viết: “Nhóm [mã nhóm] có [số bản ghi] bản ghi trong dữ liệu gốc, với [tên biến] trung bình là [giá trị minh họa hoặc giá trị thực tế]. Các giá trị trong đoạn này phải lấy từ file của bạn, không thay bằng số liệu minh họa trong bài.”

Khi trình bày trong chương 4, hãy đặt bảng mô tả trước kết quả mô hình. Nếu Aggregate làm giảm số dòng từ [N1] xuống [N2], hãy giải thích nguyên nhân giảm là do các bản ghi được gom theo [biến nhóm]. Giảng viên thường hỏi ngay điểm này khi số quan sát trong bảng dữ liệu khác số phiếu thu thập ban đầu.

Lỗi thường gặp khi chạy Aggregate dữ liệu trong SPSS

Chọn nhầm biến nhóm. Nếu chọn mã giao dịch thay vì mã khách hàng, mỗi dòng có thể vẫn là một nhóm riêng. Dấu hiệu là số dòng sau Aggregate gần như không giảm. Mở Frequencies và xem số lượng giá trị riêng biệt của biến nhóm.

Dùng Sum cho thang đo Likert. Tổng điểm có thể dùng trong một số thiết kế, nhưng nó phụ thuộc vào số biến hoặc số lần ghi nhận. Nếu các nhóm có số dòng khác nhau, Sum giữa các nhóm không còn dễ so sánh. Hãy dùng Mean khi mục tiêu là điểm trung bình và ghi rõ lựa chọn đó.

Để mã missing như 99. Một khách hàng có điểm 99 sẽ làm Mean tăng bất thường. Kiểm tra Minimum, Maximum và Frequencies trước khi tổng hợp. Với thang Likert 1 đến 5, một giá trị 99 gần như chắc chắn là mã lỗi hoặc mã thiếu cần xử lý.

Không lưu file gốc. Nếu bạn chọn Add aggregated variables to the active dataset, các biến mới có thể xuất hiện trong file đang mở. Lưu bản sao trước khi chạy và đặt nhãn biến để phân biệt điểm gốc với điểm tổng hợp.

Dùng dữ liệu lặp để chạy mô hình. Nếu cùng một khách hàng xuất hiện nhiều dòng nhưng bạn coi mỗi dòng là một người trả lời, hệ số và sai số chuẩn có thể bị ảnh hưởng. Sau Aggregate, dùng Analyze > Descriptive Statistics > Frequencies để kiểm tra số dòng và số mã nhóm.

Nhầm Aggregate với Compute Variable. Transform > Compute Variable thường dùng để tính điểm từ các biến trên cùng một dòng. Data > Aggregate dùng để tính theo nhóm nhiều dòng. Chọn sai lệnh sẽ khiến kết quả có vẻ hợp lệ nhưng trả lời một câu hỏi khác.

Đọc thêm: dữ liệu thứ cấp là gì, biến định tính chạy hồi quy phải làm sao.

Câu hỏi thường gặp

Aggregate dữ liệu trong SPSS có làm mất file gốc không

Lệnh này không bắt buộc phải xóa file gốc. Bạn có thể chọn tạo một file dữ liệu mới hoặc thêm biến vào file hiện tại. Để an toàn, hãy dùng Save As tạo bản sao trước khi chạy và kiểm tra tùy chọn lưu trong hộp thoại Aggregate Data.

Khi nào nên dùng Mean và khi nào nên dùng Sum

Dùng Mean khi bạn muốn so sánh mức trung bình giữa các nhóm và số dòng của nhóm có thể khác nhau. Dùng Sum khi tổng lượng là ý nghĩa nghiên cứu, chẳng hạn tổng doanh thu hoặc tổng số lượt. Hãy kiểm tra xem số dòng giữa các nhóm có chênh lệch lớn không trước khi chọn.

Vì sao chạy Aggregate xong số dòng giảm

Đó là kết quả dự kiến khi bạn chọn một hoặc nhiều Break Variable(s). Các dòng có cùng mã nhóm được gom thành một dòng. Nếu file từ 500 dòng còn 120 dòng, có thể bạn đã chuyển từ cấp giao dịch sang 120 nhóm, nhưng cần kiểm tra xem mã nhóm có bị nhập sai hoặc thiếu không.

Aggregate có thay thế được tính điểm Cronbach's Alpha không

Không. Aggregate chỉ tính thống kê theo nhóm. Cronbach's Alpha kiểm tra độ nhất quán nội tại của các biến quan sát trong một thang đo. Bạn nên kiểm tra độ tin cậy trước, sau đó mới tính điểm đại diện và tổng hợp theo nhóm nếu thiết kế nghiên cứu yêu cầu.

Có thể chạy Aggregate bằng syntax SPSS không

Có. Bạn có thể ghi lại lệnh do SPSS tạo hoặc viết syntax để tái lập quy trình. Syntax giúp bạn lưu tên biến nhóm, hàm tính và tên file đầu ra, đặc biệt hữu ích khi phải chạy lại sau khi làm sạch dữ liệu. Hãy kiểm tra file đầu ra bằng Data View, không chỉ dựa vào việc syntax chạy không báo lỗi.

Việc tiếp theo của bạn là xác định chính xác cấp độ của từng dòng, sao lưu file .sav, chạy Data > Aggregate trên một bản sao, rồi đối chiếu ít nhất ba nhóm với dữ liệu gốc. Nếu bạn muốn chạy toàn bộ bước phân tích trên file thật của mình, M4 phân tích dữ liệu SPSS và SmartPLS có thể xử lý tiếp từ file .sav hoặc .csv của bạn.