07 / 07
스트룹 테스트 결과 해석하는 법 — 간섭 효과·정답률·산점도
결과 화면의 간섭 효과, 촉진·억제 비용, 오답률 차이, 평균과 중앙값, 시행별 산점도를 읽는 법과 측정 정확도의 한계, 몇 번 재야 믿을 만한지를 설명합니다.
테스트가 끝나면 조건별 평균·중앙값 반응시간, 정답률, 간섭 효과, 시행별 산점도가 나옵니다. 각 숫자가 무엇을 뜻하고 어디까지 믿을 수 있는지 정리합니다.
어떻게 계산하나
- 반응시간 — 단어가 화면에 그려진 프레임부터 버튼·키 입력 이벤트까지의 시간(ms)입니다. 평균과 중앙값에는 정답 시행만 씁니다.
- 제외 규칙 — 200 ms보다 빠른 응답은 단어를 보고 판단하기 전에 누른 예측 입력으로 보고 반응시간과 정답률 모두에서 뺍니다. 시간 초과는 오답으로 세고 반응시간에서는 뺍니다. 자극이 나오기 전(+ 표시 중)에 누른 입력은 무시하고 횟수만 알려 줍니다.
간섭 효과 = 불일치 평균 − 일치 평균
촉진 = 중립 평균 − 일치 평균 · 억제 비용 = 불일치 평균 − 중립 평균
간섭 효과 읽기
값이 양수이면 불일치 조건에서 그만큼 느렸다는 뜻입니다. 대부분의 사람에게 양수가 나오며, 0에 가깝거나 음수가 나오면 먼저 시행 수가 적어 우연히 흔들렸을 가능성을 생각하세요.
이 사이트는 '상위 몇 %'나 연령별 평균과 비교하지 않습니다. 온라인 버튼 과제에 맞는 공인 규준이 없고, 기기마다 지연이 달라 다른 사람의 숫자와 바로 비교할 수 없기 때문입니다. 비교는 같은 기기, 같은 언어, 같은 설정에서 잰 내 기록끼리 하세요.
정답률도 함께 보기
불일치에서 반응시간 차이가 작아도 오답이 많다면, 빨리 누르느라 정확도를 희생한 것일 수 있습니다(속도-정확도 교환). 결과 화면의 오답률 차이(불일치 − 일치)를 함께 보세요. 반응시간과 오답률 모두에서 불일치가 불리하다면 간섭이 분명하다고 볼 수 있습니다.
평균과 중앙값
한두 번 멍하니 늦게 누른 시행이 있으면 평균이 크게 흔들립니다. 중앙값은 이런 튀는 값에 덜 민감합니다. 평균 기준과 중앙값 기준 간섭이 크게 다르면 튀는 시행이 있었다는 신호이니, 산점도에서 위쪽에 홀로 떨어진 점을 찾아보세요.
산점도 읽기
가로축은 시행 순서, 세로축은 반응시간입니다. ○는 일치, ■는 불일치, △는 중립, ×는 오답·시간 초과·예측 입력이고, 점선은 조건별 평균입니다.
- ■가 ○보다 전체적으로 위에 있다 — 간섭이 있습니다.
- 앞쪽 점이 높고 뒤로 갈수록 내려간다 — 과제에 익숙해지는 연습 효과입니다. 연습 8회를 켜면 줄어듭니다.
- 뒤로 갈수록 올라가거나 흩어진다 — 피로나 집중 저하를 의심해 보세요.
- ×가 몰린 구간 — 규칙을 헷갈렸거나 서두른 구간입니다.
몇 번 해야 믿을 만한가
24회 설정은 조건당 8회뿐이라 값이 크게 흔들립니다. 조건마다 정답 시행이 5개 미만이면 결과 화면에 경고가 뜹니다. 간섭처럼 두 평균의 차이는 각 평균보다 잡음이 커서, 헤지 등(Hedge, Powell & Sumner, 2018)은 스트룹 간섭의 검사-재검사 신뢰도가 기대보다 낮다고 보고했습니다. 48~72회로 여러 번 재고 추이를 보는 편이 한 번의 숫자보다 낫습니다.
측정 정확도에 영향을 주는 것
- 입력 장치 — 유선 키보드는 보통 지연이 짧고, 무선·블루투스 키보드와 터치스크린은 더 긴 지연이 더해질 수 있습니다.
- 화면 주사율 — 60 Hz 화면은 16.7 ms마다 한 번 그려지므로, 단어가 실제로 보인 시점에 한 프레임 안팎의 오차가 생깁니다.
- 브라우저와 기기 부하 — 다른 탭이나 앱이 무거우면 이벤트 처리가 늦어질 수 있습니다. 테스트 중 다른 탭으로 옮기면 자동으로 중단됩니다.
이런 지연은 대부분 모든 조건에 똑같이 더해지므로, 조건 간 차이인 간섭 효과는 절대 반응시간보다 영향을 덜 받습니다. 다만 기기를 바꾸면 절대값이 달라질 수 있으니 같은 기기로 비교하세요.
진단이 아닙니다
이 테스트는 표준화된 신경심리 검사가 아니며 의학적·심리학적 진단을 내리지 않습니다. 결과는 재미와 자기 관찰용으로만 쓰세요.
참고 문헌
Hedge, C., Powell, G., & Sumner, P. (2018). The reliability paradox: Why robust cognitive tasks do not produce reliable individual differences. Behavior Research Methods, 50(3), 1166–1186.
MacLeod, C. M. (1991). Half a century of research on the Stroop effect: An integrative review. Psychological Bulletin, 109(2), 163–203.