
Test-retest reliability là gì? Cách đọc và đánh giá trong SPSS
Test-retest reliability là gì
Bạn có thể gặp thuật ngữ test-retest reliability khi muốn biết một thang đo có cho kết quả ổn định theo thời gian hay không. Cách kiểm tra này đo cùng một nhóm đối tượng bằng cùng một công cụ ở hai thời điểm khác nhau, sau đó so sánh điểm số của lần đo thứ nhất với điểm số của lần đo thứ hai.
Nếu một người có đặc điểm tương đối ổn định và bảng hỏi được thiết kế tốt, điểm số của họ ở hai lần đo sẽ có xu hướng gần nhau. Mức độ tương quan hoặc mức độ nhất quán giữa hai lần đo càng cao thì độ tin cậy ổn định theo thời gian càng tốt. Trong tiếng Việt, test-retest reliability thường được gọi là độ tin cậy kiểm tra lại hoặc độ ổn định của thang đo theo thời gian.
Quy trình cơ bản gồm bốn phần: chọn cùng một nhóm người trả lời, chạy bảng hỏi lần đầu, chờ một khoảng thời gian phù hợp, rồi chạy lại đúng bảng hỏi đó. Sau cùng, bạn dùng một chỉ số tương quan hoặc chỉ số agreement phù hợp để đánh giá mức độ giống nhau giữa hai lần đo. Khoảng thời gian này cần đủ dài để người trả lời không nhớ nguyên câu trả lời cũ, nhưng không quá dài đến mức khái niệm nghiên cứu đã thay đổi đáng kể.
Test-retest reliability khác với việc kiểm tra các biến quan sát có cùng đo một khái niệm trong một lần khảo sát. Nếu bạn đang đánh giá sự nhất quán giữa các biến quan sát trong cùng một thời điểm, hãy xem thêm bài Cronbach alpha và quy trình kiểm định độ tin cậy thang đo trong SPSS.
Ý nghĩa của test-retest reliability trong nghiên cứu định lượng
Test-retest reliability trả lời một câu hỏi rất cụ thể: kết quả đo có ổn định khi lặp lại theo thời gian không. Chỉ số này phù hợp với các khái niệm được kỳ vọng tương đối bền vững, chẳng hạn thái độ chung, nhận thức, đặc điểm tâm lý hoặc mức độ đánh giá một thuộc tính ổn định của đối tượng.
Trong luận văn, kết quả test-retest giúp bạn quyết định liệu bảng hỏi có thể được sử dụng lại trong cùng bối cảnh hay không. Nếu điểm số thay đổi quá lớn chỉ sau một khoảng thời gian ngắn, nguyên nhân có thể nằm ở cách diễn đạt biến quan sát, điều kiện khảo sát, mức độ hiểu câu hỏi hoặc bản thân khái niệm đang đo có tính biến động cao.
Bạn cần phân biệt độ ổn định theo thời gian với độ nhất quán nội tại. Cronbach's Alpha xem các biến quan sát trong một lần đo có vận hành nhất quán hay không. Test-retest reliability xem kết quả của cùng công cụ có ổn định qua hai thời điểm hay không. Một thang đo có Alpha cao vẫn có thể có test-retest reliability thấp nếu người trả lời thay đổi mạnh hoặc điều kiện đo giữa hai lần khác nhau.
Chỉ số này thường được dùng trong giai đoạn thử nghiệm bảng hỏi, trước khi thu thập mẫu chính thức. Nếu đề tài của bạn chỉ có một lần khảo sát và không thiết kế khảo sát lặp lại, bạn không nên tự suy luận test-retest reliability từ một bảng Reliability Statistics duy nhất. Khi đó, bạn có thể đánh giá Cronbach's Alpha, Corrected Item-Total Correlation và các tiêu chí giá trị thang đo phù hợp với mô hình. Bạn có thể xem thêm nhóm chủ đề Thống kê để đối chiếu quy trình phân tích.
Test-retest reliability bao nhiêu là đạt
Không có một con số duy nhất áp dụng cho mọi thang đo. Mức đạt phụ thuộc vào loại khái niệm, khoảng cách giữa hai lần đo, đặc điểm mẫu và chỉ số bạn dùng. Với hệ số tương quan, giá trị cao cho thấy hai lần đo có quan hệ cùng chiều mạnh, nhưng tương quan cao không tự động chứng minh hai lần đo hoàn toàn giống nhau. Một thang đo có thể giữ nguyên thứ hạng giữa người trả lời nhưng vẫn có chênh lệch điểm trung bình giữa hai thời điểm.
Bảng dưới đây giúp bạn đặt kết quả vào đúng ngữ cảnh. Các mức được trình bày như mốc tham khảo trong báo cáo, không phải quy tắc máy móc để loại hoặc giữ thang đo.
| Nội dung cần xem | Mốc tham khảo hoặc cách đọc | Nguồn |
|---|---|---|
| Cronbach's Alpha của thang đo | Từ 0.7 trở lên thường được chấp nhận; với thang đo mới hoặc nghiên cứu khám phá, từ 0.6 có thể được xem xét | (Nunnally, 1978); (Hair và cộng sự, 2010) |
| Corrected Item-Total Correlation | Từ 0.3 trở lên là mốc thường dùng để xem xét biến quan sát | (Nunnally và Bernstein, 1994) |
| Tương quan giữa hai lần đo | Càng gần 1 càng cho thấy thứ hạng điểm số ổn định hơn, cần giải thích theo bối cảnh và thời gian đo | (Field, 2013) |
| Thiết kế hai lần đo | Dùng cùng công cụ, cùng cách chấm điểm và ghi rõ khoảng cách giữa hai lần đo | (Field, 2013) |
| Cách kết luận | Không kết luận chỉ từ một hệ số, cần xem cỡ mẫu, khoảng tin cậy, chênh lệch trung bình và điều kiện khảo sát | (Field, 2013) |
Nếu giảng viên hỏi “test retest reliability bao nhiêu là tốt”, bạn nên báo cáo con số cụ thể, loại hệ số, khoảng tin cậy nếu có, khoảng cách giữa hai lần đo và lý do chọn mốc đánh giá. Đừng viết rằng thang đo đạt chỉ vì hệ số vượt một ngưỡng nhưng không nói bạn đã đo hai lần như thế nào.
Trong thực tế, nhiều sinh viên dùng Pearson correlation để so sánh tổng điểm lần 1 và lần 2. Đây là cách dễ thực hiện, nhưng Pearson chủ yếu phản ánh mức độ liên hệ tuyến tính. Nếu mục tiêu là đánh giá mức độ đồng thuận tuyệt đối giữa hai lần đo, bạn cần cân nhắc chỉ số phù hợp hơn, chẳng hạn Intraclass Correlation Coefficient, tùy thiết kế dữ liệu và hướng dẫn của giảng viên.
Cách đọc test-retest reliability trên output
Chuẩn bị dữ liệu cho hai lần đo
Bạn cần có mã người trả lời để ghép đúng cùng một người ở hai thời điểm. Mỗi người phải có điểm lần 1 và điểm lần 2 cho cùng một thang đo, hoặc có các biến quan sát tương ứng ở cả hai lần. Không được sắp xếp ngẫu nhiên hai cột rồi coi chúng là hai lần đo của cùng đối tượng.
Ví dụ, SAT_T1 là tổng điểm hài lòng ở lần 1 và SAT_T2 là tổng điểm ở lần 2. Nếu bảng hỏi có nhiều biến quan sát, bạn cần thống nhất cách tính điểm, xử lý biến đảo chiều và quy định dữ liệu thiếu trước khi tạo tổng điểm. Khoảng thời gian giữa hai lần khảo sát cũng phải được ghi lại trong phương pháp nghiên cứu.
Chạy tương quan trong SPSS
Để chạy test-retest reliability trong SPSS theo cách dùng Pearson correlation, mở file dữ liệu và chọn Analyze > Correlate > Bivariate. Đưa SAT_T1 và SAT_T2 vào ô Variables, giữ lựa chọn Pearson, chọn Two-tailed, sau đó chọn OK.
Nếu bạn muốn kiểm tra độ tin cậy giữa các biến quan sát của hai lần đo bằng Cronbach's Alpha, có thể tạo một nhóm biến gồm các biến tương ứng ở hai thời điểm rồi vào Analyze > Scale > Reliability Analysis. Tuy nhiên, cách gộp biến phải có cơ sở phương pháp rõ ràng. Alpha của toàn bộ biến gộp không thay thế hoàn toàn cho việc đánh giá độ ổn định của điểm số giữa hai lần đo.
Đọc bảng Correlations
SPSS thường trả về bảng Correlations với các cột Pearson Correlation, Sig. (2-tailed) và N. Pearson Correlation cho biết hướng và mức độ liên hệ, Sig. (2-tailed) cho biết p-value của kiểm định tương quan, còn N là số cặp quan sát được dùng trong phân tích.
Bảng dưới đây là số liệu minh họa, không phải kết quả của một nghiên cứu thực tế. Bạn cần thay bằng số liệu trong file của mình.
| Correlations | SAT_T1 | SAT_T2 |
|---|---|---|
| SAT_T1, Pearson Correlation | 1.000 | 0.812** |
| SAT_T1, Sig. (2-tailed) | . | 0.000 |
| SAT_T1, N | 86 | 86 |
| SAT_T2, Pearson Correlation | 0.812** | 1.000 |
| SAT_T2, Sig. (2-tailed) | 0.000 | . |
| SAT_T2, N | 86 | 86 |
Trong ví dụ này, hệ số tương quan giữa SAT_T1 và SAT_T2 là 0.812, với N bằng 86. Dấu ** thường cho biết tương quan có ý nghĩa thống kê ở mức được SPSS chú thích trong bảng. Bạn vẫn cần kiểm tra khoảng cách đo, cách tính điểm và khả năng có outlier trước khi viết kết luận.
Nếu bạn dùng Analyze > Compare Means > Paired-Samples T Test, bảng Paired Samples Correlations cho biết tương quan giữa hai lần đo, còn bảng Paired Samples Test kiểm tra chênh lệch trung bình. Hai bảng trả lời hai câu hỏi khác nhau. Một bảng xem điểm số có liên hệ hay không, bảng còn lại xem trung bình hai lần đo có khác nhau có ý nghĩa hay không.
Khi test-retest reliability không đạt thì xử lý thế nào
Trước tiên, kiểm tra lỗi ghép dữ liệu. Đối chiếu mã người trả lời, số dòng hợp lệ và thứ tự các biến. Một lỗi phổ biến là lần 1 được sắp xếp theo mã tăng dần, trong khi lần 2 được nhập theo thời gian trả lời. Khi đó, SPSS vẫn chạy được nhưng hệ số không phản ánh cùng một người.
Tiếp theo, kiểm tra biến đảo chiều và cách tính tổng điểm. Nếu một biến có thang điểm ngược nhưng chưa recode, tổng điểm giữa hai lần đo có thể lệch mạnh. Bạn cũng cần xem dữ liệu thiếu, câu trả lời bất thường, thời gian hoàn thành quá ngắn và những người trả lời thay đổi điều kiện đáng kể giữa hai lần.
Sau đó, kiểm tra biểu đồ phân tán giữa hai điểm tổng. Một vài outlier có thể kéo hệ số tương quan xuống. Việc loại outlier chỉ được chấp nhận khi bạn có lý do dữ liệu rõ ràng, chẳng hạn lỗi nhập liệu hoặc mẫu không thuộc đối tượng nghiên cứu. Không nên xóa người trả lời chỉ vì họ làm cho hệ số đẹp hơn.
Nếu quy trình dữ liệu đúng, hãy xem lại khoảng thời gian giữa hai lần đo. Khoảng cách quá ngắn có thể khiến người trả lời nhớ câu cũ, còn khoảng cách quá dài có thể để sự kiện thực tế làm thay đổi thái độ. Với khái niệm vốn thay đổi theo thời gian, hệ số thấp có thể phản ánh đặc tính của khái niệm thay vì lỗi của bảng hỏi.
Cuối cùng, xem lại từng biến quan sát và cách diễn đạt. Bạn có thể chạy lại Cronbach alpha trong SPSS để xem biến nào có Corrected Item-Total Correlation thấp, nhưng không được tự động loại biến chỉ để tăng Alpha. Nếu cần xử lý một biến, hãy ghi lại lý do, số liệu trước và sau, rồi trao đổi với giảng viên.
Khi viết báo cáo, bạn có thể dùng đoạn sau và thay các phần trong ngoặc: “Thang đo [tên khái niệm] được khảo sát hai lần trên cùng nhóm đối tượng, cách nhau [số ngày]. Kết quả cho thấy hệ số tương quan giữa hai lần đo là [giá trị], với p-value [giá trị] và N = [cỡ mẫu]. Kết quả này được diễn giải cùng với chênh lệch điểm trung bình và điều kiện thu thập dữ liệu.”
Phân biệt test-retest reliability với Cronbach's Alpha
Cronbach's Alpha đánh giá mức độ nhất quán nội tại của các biến quan sát trong một lần đo. Ví dụ, bốn biến SAT1, SAT2, SAT3, SAT4 được dùng để đo sự hài lòng trong cùng bảng hỏi. Alpha cho biết các biến này có cùng vận hành theo một hướng hay không.
Test-retest reliability cần hai lần đo. Ví dụ, SAT_T1 và SAT_T2 là tổng điểm của cùng thang đo ở hai thời điểm. Nó tập trung vào sự ổn định của kết quả qua thời gian. Vì vậy, Alpha cao và test-retest cao là hai bằng chứng khác nhau, không thể dùng một chỉ số để thay cho chỉ số còn lại.
Bạn cũng không nên nhầm test-retest reliability với Composite Reliability. Composite Reliability thường xuất hiện trong PLS-SEM để đánh giá độ tin cậy của biến tiềm ẩn trong mô hình đo lường. Bạn có thể đọc thêm về composite reliability là gì nếu đang chạy SmartPLS.
Nếu vấn đề của bạn là một biến quan sát có tương quan biến tổng thấp, hãy xem hướng dẫn item total correlation nhỏ hơn 0 3 phải làm sao. Còn nếu bạn chỉ có một lần thu thập dữ liệu, hãy báo cáo các kiểm định độ tin cậy phù hợp với thiết kế thực tế, không gọi Alpha là test-retest reliability.
Lỗi thường gặp
Lỗi đầu tiên là dùng hai nhóm người khác nhau nhưng gọi đó là test-retest. Thiết kế này không đo độ ổn định của cùng đối tượng. Bạn cần ghép được kết quả lần 1 và lần 2 của từng người bằng một mã nhất quán.
Lỗi thứ hai là chỉ nhìn p-value. Tương quan có thể có p-value nhỏ vì cỡ mẫu lớn nhưng hệ số vẫn thấp về mặt thực tiễn. Ngược lại, mẫu nhỏ có thể làm một hệ số khá cao nhưng p-value chưa đạt. Hãy báo cáo cả hệ số, p-value, N và bối cảnh đo.
Lỗi thứ ba là dùng ngưỡng Cronbach's Alpha để kết luận trực tiếp cho test-retest reliability. Alpha và test-retest có mục tiêu khác nhau. Nếu luận văn dùng cả hai, hãy đặt chúng ở hai phần phân tích và giải thích đúng câu hỏi mà mỗi chỉ số trả lời.
Lỗi thứ tư là không ghi khoảng cách giữa hai lần khảo sát. Con số này ảnh hưởng trực tiếp đến cách đọc kết quả. Hội đồng có thể hỏi vì sao bạn chọn khoảng thời gian đó, liệu người trả lời đã nhớ bảng hỏi cũ hay khái niệm nghiên cứu đã thay đổi hay chưa.
Câu hỏi thường gặp
Test-retest reliability là gì và dùng khi nào?
Đây là cách đánh giá độ ổn định của cùng một thang đo khi dùng cho cùng nhóm đối tượng ở hai thời điểm. Bạn dùng nó khi muốn kiểm tra kết quả đo có giữ tương đối ổn định theo thời gian hay không.
Test-retest reliability bao nhiêu là tốt?
Bạn không nên dùng một ngưỡng duy nhất cho mọi đề tài. Hãy báo cáo hệ số, N, khoảng cách giữa hai lần đo, chênh lệch trung bình và cơ sở phương pháp mà bạn chọn. Với tương quan, hệ số càng cao thường cho thấy thứ hạng điểm số giữa hai lần đo càng ổn định, nhưng cần xem thêm mức đồng thuận.
Test-retest reliability trong SPSS chạy ở đâu?
Cách cơ bản là vào Analyze > Correlate > Bivariate, chọn hai biến điểm tổng của lần 1 và lần 2, rồi đọc bảng Correlations. Nếu cần kiểm tra chênh lệch trung bình, chạy thêm Analyze > Compare Means > Paired-Samples T Test.
Có thể dùng Cronbach's Alpha thay cho test-retest reliability không?
Không. Cronbach's Alpha đánh giá sự nhất quán giữa các biến quan sát trong một lần đo, còn test-retest reliability đánh giá sự ổn định giữa hai thời điểm. Hai chỉ số có thể được báo cáo cùng nhau nếu thiết kế nghiên cứu có đủ dữ liệu.
Test-retest reliability thấp thì có phải xóa thang đo không?
Chưa thể kết luận ngay. Bạn cần kiểm tra ghép cặp người trả lời, biến đảo chiều, dữ liệu thiếu, outlier, cách tính tổng điểm và khoảng cách giữa hai lần đo. Chỉ loại biến hoặc loại thang đo khi có lý do phương pháp rõ ràng và đã ghi lại các vòng xử lý.
Mở file SPSS của bạn, xác định đúng hai cột điểm tổng của cùng người ở hai thời điểm, kiểm tra mã ghép và chạy Analyze > Correlate > Bivariate trước khi viết kết quả. Nếu cần chạy phân tích trên chính file .sav hoặc .csv và kiểm tra từng bước, xem module M4 phân tích dữ liệu.