Imputation Methods for Nonresponse and Their Effect

무응답 대체 방법과 대체 효과

  • 김규성 (서울시립대학교 전산통계학과)
  • Published : 2000.01.01

Abstract

We consider statistical methods for nonresponse problem in social and economic sample surveys. To create a complete data set, which does not include item nonresponse data, imputation methods are generally used. In this paper, we introduce some imputation methods and compare them with one another. Also, we consider some problems, which occur when an imputed data set is treated as a response data set. Due to the imputed values, the true variance of the estimator after imputation is increased by the imputation variance. However, since usual naive variance estimator constructed from the imputed data set does not estimate the imputation variance, the true variance of the estimator after imputation tends to be underestimated. Theoretical reason is investigated and serious results are explained through a simulation study. Finally, some adjusted variance estimation methods to compensate for underestimation are presented and discussed.

사회${\cdot}$경제조사에서 흔히 발생하는 무응답에 대한 통계적 대처 방안을 고찰하였다. 항목 무응답이 발생했을 때 무응답 데이터를 포함하지 않는 완전 데이터를 만드는 방법으로 무응답 대체 방법이 널리 이용되고 있다. 본 논문에서는 여러 가지 대체 방법을 소개하고 각 방법의 장${\cdot}$단점을 비교${\cdot}$설명하였다. 또한 대체된 데이터를 응답 데이터인 것처럼 활용했을 때 발생하는 문제점들을 지적하였다. 무응답을 대체하면 대체된 값들 때문에 대체 후 추정량의 분산은 대체 분산만큼 증가하는 반면, 대체된 데이터에 기초한 통상적인 분산추정량은 대체 분산을 추정하지 못하므로 결과적으로 대체 후 추정량의 분산을 과소추정하게 된다. 이러한 분산의 과소추정의 원인을 이론적으로 고찰하였고, 모의실험을 통하여 그 결과의 심각성을 설명하였다. 마지막으로 분산의 과소추정 문제를 해결하는 몇 가지 수정된 분산추정 방법을 소개하고 토의하였다.

Keywords