
Trọng số mẫu là gì? Cách hiểu và xử lý trong SPSS
Trọng số mẫu là gì
Bạn mở file dữ liệu lên, mỗi dòng là một người trả lời nhưng tỷ lệ nam, nữ, độ tuổi hoặc khu vực trong mẫu đang lệch so với tổng thể. Khi đó, một câu hỏi thường xuất hiện là: có cần cho một số người trả lời “nặng” hơn trong phân tích hay không. Trọng số mẫu, tiếng Anh là sampling weight hoặc survey weight, là hệ số dùng để điều chỉnh mức đóng góp của từng đơn vị quan sát khi mẫu không đại diện cho tổng thể theo một tiêu chí đã biết.
Hiểu đơn giản, người có trọng số 2 được tính trong một số phép phân tích như thể họ đại diện cho khoảng hai đơn vị trong tổng thể. Người có trọng số 0,5 chỉ đóng góp bằng một nửa so với một quan sát có trọng số 1. Trọng số không làm phát sinh người trả lời mới và cũng không sửa câu trả lời gốc. Nó chỉ thay đổi cách phần mềm tính tổng, tỷ lệ, trung bình hoặc mô hình dựa trên dữ liệu đó.
Một công thức khởi đầu thường dùng là:
Trọng số mẫu = tỷ lệ của nhóm trong tổng thể / tỷ lệ của nhóm trong mẫu
Ví dụ, nữ chiếm 60% tổng thể nhưng chỉ chiếm 40% mẫu. Trọng số của nhóm nữ là 0,60 / 0,40 = 1,50. Nam chiếm 40% tổng thể nhưng chiếm 60% mẫu, nên trọng số là 0,40 / 0,60 = 0,67. Đây là ví dụ minh họa cho hiệu chỉnh theo một biến phân loại. Trọng số thực tế có thể được tính từ xác suất chọn mẫu, tỷ lệ không trả lời, phân tầng, cụm hoặc nhiều giai đoạn lấy mẫu.
Bạn nên phân biệt trọng số mẫu với cỡ mẫu là gì. Cỡ mẫu trả lời câu hỏi có bao nhiêu quan sát cần thu thập. Trọng số trả lời câu hỏi mỗi quan sát được tính với mức đóng góp nào khi phân tích.
Ý nghĩa của trọng số mẫu trong nghiên cứu định lượng
Trọng số mẫu giúp giảm một dạng sai lệch do cơ cấu mẫu không khớp với cơ cấu tổng thể. Chẳng hạn, đề tài khảo sát người dùng ngân hàng số trong một thành phố có 55% nữ và 45% nam, nhưng mẫu thu được có 75% nữ và 25% nam. Nếu mục tiêu là mô tả ý kiến của toàn bộ người dùng, kết quả trung bình chưa trọng số sẽ chịu ảnh hưởng lớn hơn từ nhóm nữ.
Tuy nhiên, trọng số chỉ hữu ích khi bạn biết mình đang hiệu chỉnh theo tổng thể nào. Bạn cần có tỷ lệ tham chiếu đáng tin cậy, xác định rõ biến dùng để hiệu chỉnh và ghi lại cách tạo trọng số. Nếu lấy một tỷ lệ từ nguồn khác địa bàn, khác thời điểm hoặc khác định nghĩa đối tượng, việc gán trọng số có thể tạo ra một con số trông hợp lý nhưng không còn cơ sở phương pháp.
Trọng số cũng liên quan đến cách bạn chọn mẫu. Nếu mẫu được chọn theo xác suất không giống nhau, trọng số nghịch đảo xác suất được chọn có thể cần được xem xét. Nếu bạn chỉ phát bảng hỏi thuận tiện qua mạng xã hội, việc đặt trọng số theo giới tính không tự động biến mẫu thuận tiện thành mẫu ngẫu nhiên. Hãy xem thêm phương pháp chọn mẫu và chọn mẫu ngẫu nhiên để phân biệt hai vấn đề này.
Trong luận văn định lượng, trọng số thường được dùng cho ba mục đích. Thứ nhất là ước lượng tỷ lệ hoặc trung bình gần với cơ cấu tổng thể hơn. Thứ hai là điều chỉnh chênh lệch xác suất chọn mẫu giữa các nhóm. Thứ ba là phục vụ các phân tích từ bộ dữ liệu khảo sát đã có sẵn, trong đó nhà cung cấp dữ liệu đã tạo sẵn biến trọng số.
Bạn không nên mặc định dùng trọng số cho mọi đề tài. Nếu mục tiêu chỉ là kiểm định mối quan hệ giữa các biến trong một mẫu được xác định rõ, việc thêm trọng số có thể làm thay đổi sai số chuẩn, p-value và kết luận. Hãy hỏi giảng viên hướng dẫn trước khi dùng, đặc biệt khi đề tài đang chạy Cronbach's Alpha, EFA, hồi quy hoặc PLS-SEM.
Trọng số mẫu bao nhiêu là đạt
Câu hỏi “trọng số mẫu bao nhiêu là tốt” không có một ngưỡng chung áp dụng cho mọi bộ dữ liệu. Trọng số đúng hay không phụ thuộc trước hết vào cách tính và nguồn tỷ lệ tham chiếu. Một trọng số 1,8 có thể hợp lý nếu nhóm đó bị thiếu trong mẫu. Ngược lại, trọng số 1,1 vẫn có thể sai nếu tỷ lệ tổng thể được dùng không liên quan đến đối tượng nghiên cứu.
Bảng dưới đây không đưa ra một ngưỡng tùy ý cho trọng số. Bảng chỉ đặt trọng số vào đúng quy trình đánh giá dữ liệu khảo sát, với các căn cứ phương pháp có thể trích dẫn trong luận văn.
| Nội dung cần kiểm tra | Cách quyết định trong file dữ liệu | Nguồn canonical |
|---|---|---|
| Cỡ mẫu ban đầu | Xác định số quan sát hợp lệ trước khi gán trọng số, không dùng trọng số để thay thế việc xác định cỡ mẫu | (Yamane, 1967) |
| Số quan sát theo biến quan sát | Khi nghiên cứu thang đo, xem xét quy mô mẫu theo số biến quan sát và bối cảnh nghiên cứu | (Hair và cộng sự, 2010) |
| Đại diện theo nhóm | So sánh tỷ lệ nhóm trong mẫu với tỷ lệ tổng thể hoặc tỷ lệ tham chiếu đã xác định | (Cochran, 1977) |
| Xác suất chọn mẫu | Nếu mỗi đơn vị có xác suất chọn khác nhau, cân nhắc trọng số nghịch đảo xác suất đó | (Cochran, 1977) |
| Phân tích hồi quy sau khi gán trọng số | Kiểm tra lại cỡ mẫu hiệu dụng và các giả định của mô hình, không chỉ nhìn số dòng trong file | (Tabachnick và Fidell, 2013) |
| Báo cáo cách xử lý | Ghi nguồn tỷ lệ, công thức, biến trọng số và phần mềm đã sử dụng | (Nguyễn Đình Thọ, 2011) |
Có thể dùng độ dao động của trọng số như một dấu hiệu cảnh báo, nhưng không nên gọi đó là tiêu chí “đạt” nếu bạn không có quy định riêng từ thiết kế khảo sát hoặc bộ dữ liệu. Trọng số quá lớn làm một số quan sát chi phối mạnh kết quả. Trọng số quá nhỏ làm nhiều quan sát gần như ít ảnh hưởng. Khi độ chênh lệch lớn, bạn cần kiểm tra lại cơ cấu mẫu, tỷ lệ tham chiếu và cách thu thập dữ liệu trước khi cắt ngọn trọng số.
Nếu bạn chưa xác định rõ tổng thể, hãy dừng ở việc mô tả mẫu và nêu hạn chế. Việc tự đặt toàn bộ trọng số bằng 1 thường tương đương với không áp dụng hiệu chỉnh. Đó có thể là lựa chọn hợp lý, miễn là bạn giải thích mẫu được phân tích như một mẫu quan sát thực tế chứ không tuyên bố đại diện thống kê cho một tổng thể rộng hơn.
Cách đọc trọng số mẫu trên output
Trong SPSS, trọng số không phải lúc nào cũng xuất hiện như một cột riêng trong bảng kết quả. Bạn thường tạo một biến số, chẳng hạn weight_gender, sau đó vào Data > Weight Cases, chọn Weight cases by và đưa biến này vào ô tương ứng. Khi bật chức năng này, SPSS sử dụng giá trị trọng số trong các thủ tục tiếp theo cho đến khi bạn chọn Do not weight cases.
Bạn cần ghi lại trạng thái này trước mỗi lần chạy. Một lỗi khá khó phát hiện là bật trọng số khi chạy Frequencies, sau đó quên tắt trước khi chạy Cronbach's Alpha hoặc hồi quy. Kết quả vẫn hiện ra bình thường, nhưng số lượng và tỷ lệ có thể đã được tính theo cách bạn không chủ ý.
Dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thực tế. Bảng mô phỏng phần tóm tắt mà bạn có thể tự tạo khi kiểm tra biến trọng số và tỷ lệ nhóm trong SPSS.
| Nhóm giới tính | Tỷ lệ tổng thể | Tỷ lệ trong mẫu | Công thức | Weight | N mẫu | N sau hiệu chỉnh, minh họa |
|---|---|---|---|---|---|---|
| Nam | 0,45 | 0,60 | 0,45 / 0,60 | 0,75 | 120 | 90,0 |
| Nữ | 0,55 | 0,40 | 0,55 / 0,40 | 1,375 | 80 | 110,0 |
| Tổng | 1,00 | 1,00 | 200 | 200,0 |
Trong bảng này, 120 người nam vẫn là 120 dòng dữ liệu gốc. Con số 90,0 chỉ là tổng đóng góp có trọng số theo công thức minh họa. Bạn không được viết rằng dữ liệu đã thu thêm hoặc loại bớt người trả lời. Nếu bảng Frequencies hiển thị tần số thập phân, đó là hệ quả của việc dùng trọng số liên tục.
Khi đọc output, hãy kiểm tra bốn điểm. Thứ nhất, biến trọng số có giá trị âm, bằng 0 hoặc bị thiếu hay không. Thứ hai, tổng tỷ lệ sau hiệu chỉnh có gần với tỷ lệ mục tiêu không. Thứ ba, số liệu mô tả thay đổi bao nhiêu trước và sau khi bật trọng số. Thứ tư, các bảng kiểm định và mô hình được chạy ở trạng thái nào.
Với dữ liệu khảo sát phức tạp, Weight Cases của SPSS có thể chưa phản ánh đầy đủ thiết kế phân tầng, cụm và sai số chuẩn phức tạp. Nếu bộ dữ liệu có biến strata, cluster hoặc replicate weight, hãy xem tài liệu đi kèm bộ dữ liệu và cân nhắc thủ tục Complex Samples thay vì chỉ bật một biến trọng số thông thường.
Khi trọng số mẫu không đạt thì xử lý thế nào
Trước tiên, kiểm tra công thức và mã hóa nhóm. Một lỗi phổ biến là tỷ lệ tổng thể được nhập dưới dạng 60 thay vì 0,60, hoặc nhóm “nữ” trong dữ liệu được viết thành nhiều mã như Nu, Nữ và 2. Bạn hãy chạy Analyze > Descriptive Statistics > Frequencies để xem số lượng, giá trị thiếu và nhãn của biến dùng để tạo trọng số.
Kiểm tra nguồn tỷ lệ tham chiếu
Đối chiếu địa bàn, thời điểm và định nghĩa đối tượng. Tỷ lệ dân số của cả nước không nhất thiết phù hợp với mẫu người dùng một ứng dụng tại Thành phố Hồ Chí Minh. Nếu không chứng minh được sự tương thích, ghi rõ đây là tỷ lệ tham chiếu hạn chế, không trình bày nó như cơ cấu tổng thể chính xác.
Tính lại trọng số theo đúng nhóm
Tạo bảng chéo giữa các biến hiệu chỉnh, chẳng hạn giới tính và nhóm tuổi. Khi hiệu chỉnh đồng thời nhiều biến, trọng số có thể được tạo bằng phương pháp raking hoặc quy trình chuyên dụng, không nên nhân các tỷ lệ một cách máy móc nếu bạn chưa kiểm tra kết quả. Với bài luận văn nhỏ, một biến hiệu chỉnh đơn giản và có lý do rõ ràng thường dễ giải trình hơn một quy trình phức tạp không tái lập được.
So sánh kết quả trước và sau trọng số
Chạy cùng một bảng mô tả hoặc mô hình ở hai trạng thái. Nếu kết luận thay đổi, bạn phải báo cáo điều đó và giải thích lý do chọn phiên bản nào. Nếu chỉ dùng trọng số để làm p-value “đẹp hơn”, đó là cách xử lý khó bảo vệ trước hội đồng.
Cắt ngọn trọng số chỉ khi có quy tắc
Một số nghiên cứu giới hạn các trọng số quá lớn để giảm ảnh hưởng của vài quan sát. Đây là quyết định phương pháp, không phải thao tác sửa lỗi tùy ý. Nếu áp dụng, hãy ghi giá trị trước và sau khi cắt, lý do chọn giới hạn, rồi thực hiện phân tích độ nhạy. Nếu không có căn cứ, giữ nguyên trọng số và nêu hạn chế sẽ an toàn hơn.
Khi nào cần thu lại dữ liệu
Nếu nhóm quan trọng bị thiếu nghiêm trọng và bạn không có tỷ lệ tham chiếu đáng tin cậy, phần mềm không thể tạo ra thông tin mới. Bạn có thể xem lại cỡ mẫu của mẫu số liệu là gì và tính cỡ mẫu để đánh giá khả năng thu bổ sung. Trọng số chỉ điều chỉnh mức đóng góp, không thay thế một thiết kế mẫu phù hợp.
Phân biệt trọng số mẫu với cỡ mẫu và tần số
Cỡ mẫu là số dòng hoặc số quan sát hợp lệ được đưa vào nghiên cứu. Tần số là số lần một giá trị hoặc nhóm xuất hiện. Trọng số mẫu là hệ số gắn với từng quan sát để thay đổi đóng góp của quan sát đó trong phép tính.
Ví dụ, file có 200 dòng và biến weight bằng 1,5 cho một nhóm. File vẫn có 200 dòng. Khi bật Weight Cases, tổng đóng góp của nhóm có thể lớn hơn số dòng thật. Nếu bạn báo cáo “đã khảo sát 300 người” chỉ vì tổng trọng số bằng 300, đó là cách diễn giải sai.
Trọng số mẫu cũng khác với biến nhân bản dữ liệu. Nhân bản tạo thêm dòng hoặc bản ghi, còn trọng số giữ nguyên số dòng và để phần mềm dùng hệ số trong tính toán. Hai cách có thể cho một số kết quả mô tả gần nhau nhưng không nên coi là cùng một thao tác, nhất là khi tính sai số chuẩn.
Bạn cũng cần phân biệt trọng số với điểm số Likert. Điểm trung bình của năm biến quan sát là phép tổng hợp thang đo. Trọng số mẫu là thông tin về mức đóng góp của đối tượng quan sát. Một biến tên weight trong file không chắc đã là sampling weight, vì có thể đó là điểm số, hệ số quy đổi hoặc biến được tạo cho mục đích khác.
Lỗi thường gặp
Bật Weight Cases rồi quên tắt. Hãy kiểm tra thanh trạng thái hoặc mở lại Data > Weight Cases trước mỗi thủ tục. Lưu một bản dữ liệu gốc chưa bật trọng số và một bản phân tích có ghi chú rõ ràng.
Dùng trọng số để biến mẫu thuận tiện thành mẫu đại diện. Hiệu chỉnh giới tính và độ tuổi không giải quyết toàn bộ sai lệch do cách tuyển người trả lời, tỷ lệ không phản hồi hoặc khác biệt giữa người tham gia và người không tham gia.
Đặt trọng số theo cảm giác. Không dùng 1,2 cho nhóm này và 0,8 cho nhóm kia chỉ vì muốn tỷ lệ cân bằng. Mỗi con số phải truy ngược được về xác suất chọn mẫu hoặc tỷ lệ tham chiếu.
Gán giá trị thiếu bằng 1. Nếu không biết trọng số của một quan sát, giá trị 1 có thể làm dữ liệu trông đầy đủ nhưng che giấu vấn đề. Hãy xác định quy tắc xử lý missing trước khi chạy.
Chỉ báo cáo output sau khi bật trọng số. Nên lưu cả số dòng hợp lệ, tỷ lệ chưa trọng số, tỷ lệ sau trọng số và cách tạo biến. Người đọc cần biết kết quả đến từ dữ liệu nào.
Trộn trọng số khảo sát với PLS-SEM. SmartPLS có quy trình riêng và không nên mặc định hiểu biến weight trong file CSV như trọng số khảo sát. Nếu đề tài dùng SmartPLS, hãy xác định rõ phần mềm có hỗ trợ cách hiệu chỉnh bạn cần hay không trước khi diễn giải path coefficient.
Câu hỏi thường gặp
Trọng số mẫu có bắt buộc trong mọi khảo sát không?
Không. Bạn chỉ nên dùng khi thiết kế nghiên cứu hoặc bộ dữ liệu có lý do rõ ràng về việc điều chỉnh xác suất chọn mẫu hay cơ cấu tổng thể. Khảo sát không xác suất không tự động trở thành đại diện nhờ một cột trọng số.
Trọng số mẫu bao nhiêu là tốt?
Không có một con số cố định để kết luận tốt hoặc xấu. Hãy kiểm tra nguồn tỷ lệ, công thức, mức chênh lệch giữa các nhóm và ảnh hưởng của trọng số lên kết quả. Một trọng số hợp lệ phải giải trình được, không chỉ nằm trong một khoảng do người viết tự đặt.
Trọng số mẫu trong SPSS bật ở đâu?
Vào Data > Weight Cases, chọn Weight cases by, rồi chọn biến chứa trọng số. Sau khi phân tích xong, vào lại hộp thoại và chọn Do not weight cases nếu các thủ tục sau không cần trọng số. Ghi lại trạng thái này trong nhật ký phân tích.
Có nên dùng trọng số khi chạy Cronbach's Alpha và EFA không?
Câu trả lời phụ thuộc vào mục tiêu và thiết kế nghiên cứu. Nếu trọng số được cung cấp cùng bộ dữ liệu khảo sát, hãy xem hướng dẫn của nguồn dữ liệu. Nếu bạn tự tạo trọng số, chạy so sánh trước và sau, hỏi giảng viên hướng dẫn và giải thích rõ vì trọng số có thể ảnh hưởng đến ma trận tương quan và kết quả thang đo.
Có thể dùng trọng số để tăng cỡ mẫu không?
Không. Trọng số không tạo thêm người trả lời và không thay thế việc xác định cỡ mẫu. Khi cần đánh giá số quan sát cần có, hãy quay lại thiết kế mẫu, tổng thể nghiên cứu và cách lấy mẫu.
Tôi không biết tỷ lệ tổng thể thì phải làm sao?
Bạn có thể phân tích mẫu không trọng số, mô tả giới hạn đại diện và tránh khái quát quá mức. Đừng tự lấy một tỷ lệ bất kỳ trên Internet để tạo trọng số. Nếu đề tài cần ước lượng cho tổng thể, hãy trao đổi lại về nguồn dữ liệu và kế hoạch thu thập trước khi sửa file.
Việc bạn nên làm ngay trong file là tạo một bản sao, kiểm tra biến trọng số bằng Frequencies, ghi nguồn của từng tỷ lệ và chạy cùng một bảng trước và sau khi bật Weight Cases. Nếu cần thực hiện trọn quy trình phân tích trên chính file .sav hoặc .csv, bạn có thể dùng module M4 phân tích dữ liệu của DoThesis.