• 제목/요약/키워드: Missing mechanisms

검색결과 30건 처리시간 0.018초

불완전한 반복측정 자료의 보정방법 (Methods for Handling Incomplete Repeated Measures Data)

  • 우해봉;윤인진
    • 한국조사연구학회지:조사연구
    • /
    • 제9권2호
    • /
    • pp.1-27
    • /
    • 2008
  • 사회조사 자료를 활용한 통계분석에 있어서 불완전 자료의 문제는 거의 모든 연구자들이 경험하는 하나의 보편적인 문제이다. 불완전 자료의 문제는 특히 패널조사와 같은 종단적 자료를 활용한 연구에 있어서 중요한 이슈가 된다. 본 연구의 목적은 최근까지 이루어진 불완전 자료에 대한 보정방범을 소개하는 것이다. 특히, 본 연구는 패널자괴에서 발생한 불완전 자료의 처리에 대한 관심이 부족한 점을 고려하여 최근까지 이루어진 보정방법들을 반복측정 패널자료 분석에 적용하는데 초점을 맞춘다. 첫째, 본 연구는 불완전 자료에 대한 적절하지 못한 사후처리는 분석결과에 있어서 유의미한 차이로 이어 수 있음을 시사한다. 특히, 분석결과는 반복측정 자료를 사용하는 연구의 경우 불완전 자료의 발생은 궤적의 초기값보다는 시간의 경과에 따른 궤적의 변화를 적절히 추정하는데 문제를 가질 수 있음을 시사하고 있다. 둘째, 분석결과는 완전제거법이나 평균대체법이 EM, FIML, MICE 방법들에 비해 불완전 자료의 처리효과가 상대적으로 떨어짐을 보여준다. 특히, 완전제거법이나 평균대체법과 같은 방법에 비해 최대우도법이나 다중대체법이 갖는 상대적 우위는 MCAR 가정에 비해 보다 현실적인 가정이라고 할 수 있는 MAR 조건하에서 크게 나타난다. 본 연구의 분석결과는 또한 비록 결측치의 발생기제가 MNAR 상황이라고 하더라도 연구자가 결측치의 발생과 관련된 변수들을 보정과정에서 적절하게 활용하면 편의의 상당부분을 감소시킬 수 있음을 시사한다.

  • PDF

Non-identifiability and testability of missing mechanisms in incomplete two-way contingency tables

  • Park, Yousung;Oh, Seung Mo;Kwon, Tae Yeon
    • Communications for Statistical Applications and Methods
    • /
    • 제28권3호
    • /
    • pp.307-314
    • /
    • 2021
  • We showed that any missing mechanism is reproduced by EMAR or MNAR with equal fit for observed likelihood if there are non-negative solutions of maximum likelihood equations. This is a generalization of Molenberghs et al. (2008) and Jeon et al. (2019). Nonetheless, as MCAR becomes a nested model of MNAR, a natural question is whether or not MNAR and MCAR are testable by using the well-known three statistics, LR (Likelihood ratio), Wald, and Score test statistics. Through simulation studies, we compared these three statistics. We investigated to what extent the boundary solution affect tesing MCAR against MNAR, which is the only testable pair of missing mechanisms based on observed likelihood. We showed that all three statistics are useful as long as the boundary proximity is far from 1.

디지털 데이터에서 데이터 전처리를 위한 자동화된 결측 구간 대치 방법에 관한 연구 (A Study on Automatic Missing Value Imputation Replacement Method for Data Processing in Digital Data)

  • 김종찬;심춘보;정세훈
    • 한국멀티미디어학회논문지
    • /
    • 제24권2호
    • /
    • pp.245-254
    • /
    • 2021
  • We proposed the research on an analysis and prediction model that allows the identification of outliers or abnormality in the data followed by effective and rapid imputation of missing values was conducted. This model is expected to analyze efficiently the problems in the data based on the calibrated raw data. As a result, a system that can adequately utilize the data was constructed by using the introduced KNN + MLE algorithm. With this algorithm, the problems in some of the existing KNN-based missing data imputation algorithms such as ignoring the missing values in some data sections or discarding normal observations were effectively addressed. A comparative evaluation was performed between the existing imputation approaches such as K-means, KNN, MEI, and MI as well as the data missing mechanisms including MCAR, MAR, and NI to check the effectiveness/efficiency of the proposed algorithm, and its superiority in all aspects was confirmed.

A Study on Imputation using Adjusted Cohen Method

  • Chung, Sung-Suk;Chun, Young-Min;Lee, Sun-Kyung
    • Journal of the Korean Data and Information Science Society
    • /
    • 제17권3호
    • /
    • pp.871-888
    • /
    • 2006
  • Many studies have been done to develop procedures to deal with missing values. Most common method is to reassign the other values to the missing data. The purpose of our study is to suggest adjusted Cohen methods and to compare the efficiency of them with other methods through a simulation study. The adjusted Cohen methods use an auxiliary variable to arrange ranking of the variable with missing values. It leads to a reduced mean square error(MSE) compared with the Cohen method.

  • PDF

A comparison of imputation methods using machine learning models

  • Heajung Suh;Jongwoo Song
    • Communications for Statistical Applications and Methods
    • /
    • 제30권3호
    • /
    • pp.331-341
    • /
    • 2023
  • Handling missing values in data analysis is essential in constructing a good prediction model. The easiest way to handle missing values is to use complete case data, but this can lead to information loss within the data and invalid conclusions in data analysis. Imputation is a technique that replaces missing data with alternative values obtained from information in a dataset. Conventional imputation methods include K-nearest-neighbor imputation and multiple imputations. Recent methods include missForest, missRanger, and mixgb ,all which use machine learning algorithms. This paper compares the imputation techniques for datasets with mixed datatypes in various situations, such as data size, missing ratios, and missing mechanisms. To evaluate the performance of each method in mixed datasets, we propose a new imputation performance measure (IPM) that is a unified measurement applicable to numerical and categorical variables. We believe this metric can help find the best imputation method. Finally, we summarize the comparison results with imputation performances and computational times.

19대 대선 여론조사에서 무응답 메카니즘의 민감도 분석 (Sensitivity analysis of missing mechanisms for the 19th Korean presidential election poll survey)

  • 김성용;곽동호
    • 응용통계연구
    • /
    • 제32권1호
    • /
    • pp.29-40
    • /
    • 2019
  • 선거여론조사 자료의 경우 무응답이 흔히 관측되며, 이와 같이 무응답이 존재하는 범주형 자료는 불완전 분할표로 표현된다. 불완전 분할표로 표현된 선거여론조사 자료에서 후보자 지지율을 추정하는 경우, 지지율은 무응답이 어떤 메카니즘을 따르는가에 따라 다르게 추정되며, 따라서 자료가 어떠한 무응답 메카니즘을 따르는지에 대한 판별이 분석에 선행되어야 한다. 그러나 최근 연구에 따르면, 관측된 자료를 이용해서는 무응답 메카니즘을 판별할 수 없음이 밝혀졌다. 이러한 문제를 해결하기 위해 다양한 무응답 메카니즘을 반영할 수 있는 민감도 분석이 제안되었다. 그러나 기존에 제안된 민감도 분석의 경우, 이원 분할표에서 각 변수의 범주 수가 두 개인 경우만을 대상으로 한다. 우리나라 선거여론조사에서 고려되는 요인이 지역, 성, 연령 등임을 감안할 때, 기존 방법론으로 민감도 분석을 시행하기에는 한계점이 존재한다. 이에 따라 본 논문에서는 기존의 민감도 분석을 다차원 불완전 분할표에 적용할 수 있도록 확장하고, 이를 우리나라 19대 대선 여론조사 자료에 적용하였다. 분석 결과, 민감도 분석의 구간이 실제 지지율을 포함하고 있을 뿐 아니라, 다양한 무응답 메카니즘의 결과를 포괄하고 있으며, 실제 지지율과 가장 가까운 예측치의 경우 후보자에 대한 지지가 무응답의 발생에 영향을 미침을 알 수 있었다.

ELCIC: An R package for model selection using the empirical-likelihood based information criterion

  • Chixiang Chen;Biyi Shen;Ming Wang
    • Communications for Statistical Applications and Methods
    • /
    • 제30권4호
    • /
    • pp.355-368
    • /
    • 2023
  • This article introduces the R package ELCIC (https://cran.r-project.org/web/packages/ELCIC/index.html), which provides an empirical likelihood-based information criterion (ELCIC) for model selection that includes, but is not limited to, variable selection. The empirical likelihood is a semi-parametric approach to draw statistical inference that does not require distribution assumptions for data generation. Therefore, ELCIC is more robust and versatile in the context of model selection compared to the currently existing information criteria. This paper illustrates several applications of ELCIC, including its use in generalized linear models, generalized estimating equations (GEE) for longitudinal data, and weighted GEE (WGEE) for missing longitudinal data under the mechanisms of missing at random and dropout.

시간-종속적 공변량이 포함된 이분형 반복측정자료의 GEE를 이용한 분석에서 결측 체계에 따른 회귀계수 추정방법 비교 (Comparison of GEE Estimation Methods for Repeated Binary Data with Time-Varying Covariates on Different Missing Mechanisms)

  • 박보람;정인경
    • 응용통계연구
    • /
    • 제26권5호
    • /
    • pp.697-712
    • /
    • 2013
  • 다시점 자료 연구에서 일반화추정방정식은 가상관행렬을 잘못 가정하더라도 모수의 일치추정량을 도출하므로 많이 이용된다. 하지만, 결측 체계가 완전임의결측이 아닌 경우에는 편의추정량을 제공하고, 시간-종속적 공변량이 포함된 경우에는 가상관행렬에 따라 회귀계수 추정값이 다르게 도출될 수 있는 문제점이 있다. 결측 체계가 임의결측인 경우에 발생하는 문제를 해결하기 위해 가중 방법과 다중대체 방법을 사용하는 것이 제안되었다. 본 논문에서는 시간-종속적 공변량이 포함된 이분형 반복측정자료를 GEE를 이용하여 분석할 때 다양한 결측 체계에서 일반화추정방정식 방법, 가중 방법, 다중대체 방법의 회귀계수 추정에 대한 로버스트성과 정확성을 모의실험을 통하여 비교해 보았다. 세 가지 방법 모두에서 시간-종속적 공변량의 회귀계수가 시간-독립적 공변량의 회귀계수에 비해 가상관행렬에 따라 추정값의 차이가 크게 나타났다. 다른 두 방법에 비해 다중대체 방법이 가상관행렬의 형태에 대해 더 로버스트하고 편의도 작은 추정치를 도출하였다.

순환확률분포를 이용한 교통량 결측자료 보정 모형 (Modelling Missing Traffic Volume Data using Circular Probability Distribution)

  • 김현석;임강원;이영인;남두희
    • 대한교통학회지
    • /
    • 제25권4호
    • /
    • pp.109-121
    • /
    • 2007
  • 자료결측의 심각성은 현실적으로 거의 대부분의 조사에서 발생한다. 비단 교통분야뿐만 아니라 인문사회 분야나 기상학, 생물학, 지구과학 등 모든 분야에서 인력식이든 기계식이든 조사 방식에 관계없이 발생한다. 교통자료 수집장비에서의 자료결측의 발생은 현실적으로 불가피한 현상으로 볼 수 있으며, 이와 같은 자료 수집과정에서 발생하는 결측을 신뢰성있게 추정하여 보정하였던 선행연구의 대부분은 교통량 자료의 결측값 보정시 통계적 검증없이 시간적인 임의의 종속성만 고려함으로서, 보정 성능이 떨어지는 단점을 노출하고 있다. 이들 연구에서 적용했던 기법들 또한, 교통량 자료가 가지고 있는 가장 큰 특징인 주기적 순환성(periodic circularity)이 제대로 반영되지 못함으로서 적용상 한계를 노출하고 있다. 본 연구는 현실적으로 거의 대부분의 조사과정에서 발생하는 자료결측의 심각성에 대한 인식을 토대로 대안으로 순환분포모형을 제안하였다. 이러한 자료결측 현상에 대응하고자 하였던 기존의 ad-hoc 또는 heuristic 보정 기법과 모형 기반 및 알고리즘 기반의 보정 기법에 관한 선행 연구의 고찰을 통하여 이들 기법들의 한계점을 확인하였다.

플러그묘 자동이식기의 묘 자동공급 및 이식기구에 관한 연구 (Automatic Feeding and Transplanting Mechanism for Plug Seedling Transplanter)

  • 민영봉;문성동
    • Journal of Biosystems Engineering
    • /
    • 제23권3호
    • /
    • pp.259-270
    • /
    • 1998
  • An automatic seedling transplanter, employed an innovative plug-seedling feeder was developed by improving the problems of conversational feeding and transplanting mechanisms. With conventional methods, missing and damage rates of seedling were high for long seedlings over 20cm and also breaking seed-bed was frequently observed. Thus, a pushout-bucket slide-hopper type trandsplanter was devised and tested. Test results of picking and transferring accuracies of the developed transplanter are as follows : A prototype transplanter performed with 1.5% of missing rate. The deviations of horizontal feed ranged from -0.3mm to 2.8mm and averaged 0.673mm for the 128-hoe test tray : and ranged from -lmm to +3mm and averaged 0.785mm for the 200-hole test tray. The deviations could decrease with precise manufacturing and lightening the mechanism. The maximum and deviations of vertical feed were -2.3mm and + 1mm, respectively, for the 128-hole test tray ; and were +3mm and +2.5mm, respectively, for the 200-hole test tray. The missing rate, seeding bruise rate and seed-bed damage rate were esitmate to be 1.3%, 0.4% and 3.5%, respectively, with the developed automatic transplanter.

  • PDF