결측치 확인하고 처리하기

분석 전에 문항별 결측이 몇 개인지 먼저 보세요. 5% 미만이면 그 케이스를 빼도 무방하고, 특정 문항에만 몰려 있다면 그 문항이 불편했다는 신호입니다.

필수 응답으로 만들었어도 빈칸은 생깁니다. 중간에 나간 사람, 링크로 들어와 일부만 답한 사람, 답하기 곤란해서 넘긴 사람이 있습니다.

먼저 얼마나 있는지 봅니다

문항별 결측 개수 확인
FREQUENCIES VARIABLES=q1 TO q30
 /FORMAT=NOTABLE
 /STATISTICS=MEAN STDDEV MIN MAX.

NOTABLE은 값별 빈도표를 빼고 요약표만 남기라는 뜻입니다. 그 요약표에 문항마다 유효 개수와 결측 개수가 나옵니다. 이 표를 먼저 보고 나서 분석에 들어가세요. q1 TO q30은 데이터 파일에서 q1과 q30 사이에 놓인 변수를 모두 뜻하므로, 변수 순서가 뒤섞여 있다면 이름을 하나씩 적어야 합니다.

얼마나 되면 문제인가

  • 전체의 5% 미만이고 여기저기 무작위로 흩어져 있다면 그 케이스를 빼고 분석해도 무방하다고 보는 것이 통례입니다. 다만 이 5%는 절대 기준이 아니라 널리 인용되는 경험적 목표선입니다.
  • 특정 문항에만 몰려 있다면 그 문항 자체를 의심하세요. 질문이 불편했거나 이해가 안 됐다는 신호입니다.
  • 특정 응답자가 절반 이상 비워뒀다면 그 응답자를 통째로 제외하는 편이 낫습니다.

제외 방식 두 가지

목록별 제외는 하나라도 빈칸이 있는 응답자를 모든 분석에서 뺍니다. 대응별 제외는 그 분석에 쓰는 변수에만 값이 있으면 포함합니다. 회귀분석처럼 여러 변수를 한꺼번에 쓰는 분석은 목록별 제외가 기본입니다.

어느 쪽을 썼는지에 따라 분석마다 N이 달라집니다. 논문에 표를 넣을 때 N을 함께 적고, 방법도 밝히세요.

논문에는 이렇게 씁니다
결측치는 전체 응답의 2.3%로 나타났으며, 특정 문항이나 특정 응답자에 몰려 있지 않아 목록별 제외 방식으로 처리하였다.

이 작업을 대신 해드립니다

구글폼이나 엑셀로 받은 응답 파일을 올리면 변수 레이블, 값 레이블, 역문항 역코딩, 요인별 신뢰도, 요인 평균변수가 들어간 SPSS 명령문을 만들어드립니다. 지금은 무료입니다.

올린 파일은 서버로 보내지 않습니다. 계산은 브라우저 안에서만 이루어집니다.

데이터 올려보기

함께 보면 좋은 글

가이드 전체 보기