• 제목/요약/키워드: Selection Bias

검색결과 331건 처리시간 0.034초

A Study on Unbiased Methods in Constructing Classification Trees

  • Lee, Yoon-Mo;Song, Moon Sup
    • Communications for Statistical Applications and Methods
    • /
    • 제9권3호
    • /
    • pp.809-824
    • /
    • 2002
  • we propose two methods which separate the variable selection step and the split-point selection step. We call these two algorithms as CHITES method and F&CHITES method. They adapted some of the best characteristics of CART, CHAID, and QUEST. In the first step the variable, which is most significant to predict the target class values, is selected. In the second step, the exhaustive search method is applied to find the splitting point based on the selected variable in the first step. We compared the proposed methods, CART, and QUEST in terms of variable selection bias and power, error rates, and training times. The proposed methods are not only unbiased in the null case, but also powerful for selecting correct variables in non-null cases.

데이터마이닝 패키지에서 변수선택 편의에 관한 연구 (A Study on Variable Selection Bias in Data Mining Software Packages)

  • 송문섭;윤영주
    • 응용통계연구
    • /
    • 제14권2호
    • /
    • pp.475-486
    • /
    • 2001
  • 데이터마이닝 패키지에 구현된 분류나무 알고리즘 가운데 CART, CHAID, QUEST, C4.5에서 변수 선택법을 비교하였다. CART의 전체탐색법이 편의를 갖는다는 사실은 잘알려졌으며, 여기서는 상품화된 패키지들에서 이들 알고리즘의 편의와 선택력을 모의실험 연구를 통하여 비교하였다. 상용 패키지로는 CART, Enterprise Miner, AnswerTree, Clementine을 사용하였다. 본 논문의 제한된 모의실험 연구 결과에 의하면 C4.5와 CART는 모두 변수선택에서 심각한 편의를 갖고 있으며, CHAID와 QUEST는 비교적 안정된 결과를 보여주고 있었다.

  • PDF

Heckman의 표본선택모형을 이용한 대졸자의 임금결정요인 분석 (The wage determinants of college graduates using Heckman's sample selection model)

  • 조장식
    • Journal of the Korean Data and Information Science Society
    • /
    • 제28권5호
    • /
    • pp.1099-1107
    • /
    • 2017
  • 본 연구에서는 한국고용정보원에서 실시한 "2014년 대졸자 직업이동 경로조사" 자료를 활용하여 대졸자의 임금결정요인을 분석하였다. 일반적으로 임금은 개인의 취업여부와 임금의 크기에 대한 두 가지의 복합적인 정보를 담고 있으나, 많은 선행연구에서는 임금의 크기에 대한 정보만을 활용하여 선형 회귀분석을 수행함으로써 표본선택에 위한 편의 (sample selection bias) 문제가 발생하게 된다. 이런 문제점을 극복하기 위해 본 연구에서는 Heckman의 표본선택 모형을 분석에 활용하였다. 주요 분석 결과를 요약하면 다음과 같다. 먼저 Heckman의 표본선택 모형에 대한 타당성은 통계적으로 유의함을 알 수 있었다. 남자는 여자에 비해서 취업확률과 임금의 크기 모두 통계적으로 유의하게 높게 나타났으며, 연령이 증가하고 부모의 소득이 증가 할수록 취업확률과 임금의 크기 모두 높게 나타났다. 또한 대학만족도가 높아질수록, 그리고 취득한 자격증 수가 증가할수록 취업확률과 임금 모두 증가하는 경향이 있는 것으로 나타났다.

인과연구에서 중첩편향을 제거하기 위한 공변량선택기준 (Covariate selection criteria for controlling confounding bias in a causal study)

  • ;김지현
    • 응용통계연구
    • /
    • 제29권5호
    • /
    • pp.849-858
    • /
    • 2016
  • 관측 자료를 이용한 인과연구에서 관심 있는 처리변수의 효과가 다른 공변량의 효과와 중첩되지 않도록 조건화할 공변량을 선택하는 것이 중요하다. 인과연구에서의 공변량선택 문제는 공분산분석 모형에서의 변수선택 문제와 다르다는 것을 예를 들어 설명하였다. 그리고 모든 변수들 사이의 인과관계를 파악하지 않고도 적용할 수 있는 실용적인 공변량선택기준에 대해 살펴보았다. VanderWeele과 Shpitser (2011)가 새로운 기준을 제안하면서 새로운 기준이 다른 두 기준보다 나은 성능을 보인다고 주장하였는데, 이 기준에도 한계와 단점이 있음을 예증하였다. 새로운 기준이 완전한 기준은 아니지만 조건을 조금 수정하면 다른 두 기준과 달리 중첩을 제거할 수 있다는 점에서 좀 더 나은 기준이라고 할 수 있다.

Robust Variable Selection in Classification Tree

  • 장정이;정광모
    • 한국통계학회:학술대회논문집
    • /
    • 한국통계학회 2001년도 추계학술발표회 논문집
    • /
    • pp.89-94
    • /
    • 2001
  • In this study we focus on variable selection in decision tree growing structure. Some of the splitting rules and variable selection algorithms are discussed. We propose a competitive variable selection method based on Kruskal-Wallis test, which is a nonparametric version of ANOVA F-test. Through a Monte Carlo study we note that CART has serious bias in variable selection towards categorical variables having many values, and also QUEST using F-test is not so powerful to select informative variables under heavy tailed distributions.

  • PDF

A FACETS Analysis of Rater Characteristics and Rater Bias in Measuring L2 Writing Performance

  • Shin, You-Sun
    • 영어어문교육
    • /
    • 제16권1호
    • /
    • pp.123-142
    • /
    • 2009
  • The present study used multi-faceted Rasch measurement to explore the characteristics and bias patterns of non-native raters when they scored L2 writing tasks. Three raters scored 254 writing tasks written by Korean university students on two topics adapted from the TOEFL Test of Written English (TWE). The written products were assessed using a five-category rating scale (Content, Organization, Language in Use, Grammar, and Mechanics). The raters only showed a difference in severity with regard to rating categories but not in task types. Overall, the raters scored Grammar most harshly and Organization most leniently. The results also indicated several bias patterns of ratings with regard to the rating categories and task types. In rater-task bias interactions, each rater showed recurring bias patterns in their rating between two writing tasks. Analysis of rater-category bias interaction showed that the three raters revealed biased patterns across all the rating categories though they were relatively consistent in their rating. The study has implications for the importance of rater training and task selection in L2 writing assessment.

  • PDF

전화조사를 위한 시간균형할당표본추출 (Time-Balanced Quota Sampling for Telephone Survey)

  • 허명회;황진모
    • 한국조사연구학회지:조사연구
    • /
    • 제7권2호
    • /
    • pp.39-52
    • /
    • 2006
  • 우리나라 대다수 조사전문기관은 지역 성 나이대 할당표본추출에 의한 전화조사를 하고 있다. 그러나 평일에는 인구사회적 속성에 따른 개인별 재택률의 차이가 심하므로 체계적 응답자선택편향(respondent selection bias)이 우려된다. 문제 해결을 위해 조사시간대를 할당변수로 추가한 '시간균형할당표본추출'(time-balanced quota sampling) 방법과 저녁시간대 할당을 부분적으로 완화한 '시간균형준할당표본추출'(time-balanced quasi-quota sampling) 방법을 제안한다. 그리고 우리나라 통계청에서 2004년에 수집한 생활시간조사 원자료를 가상적 모집단으로 설정하여 새로운 할당추출법과 기존할당추출법에 의해 얻는 몬테칼로 표본들을 비교할 것이다.

  • PDF

An Application of Heckman Two-step Procedure to Management Accounting and Firm Effectiveness: An Empirical Study from Vietnam

  • HUYNH, Quang Linh
    • The Journal of Asian Finance, Economics and Business
    • /
    • 제9권2호
    • /
    • pp.347-353
    • /
    • 2022
  • Using the Heckman two-step procedure, this study investigates the relationship between management accounting implementation and firm effectiveness. The research data for this study was acquired from 450 publicly traded companies in Vietnam; however, the final sample only includes 304 responses containing useful information. The reliability analysis was used to evaluate the acquired data to examine the qualities of constructs and the dimensions that make them up. Then, the Heckman two-step technique was performed to analyze the causal connection from the acceptance of management accounting to firm effectiveness allowing for the effect of environmental uncertainty and organizational characteristics on the likelihood of adopting management accounting. The empirical findings show that management accounting acceptance determines firm effectiveness; however, the research model on the relationship between management accounting adoption and firm effectiveness has a sample selection bias. The main conclusions of this study are that there is a difference in the effects of management accounting adoption on business effectiveness when sample selection bias is not taken into consideration. When potential sample selection bias is taken into account by integrating environmental uncertainty and organizational characteristics in the research model, the effect of adopting management accounting on company effectiveness becomes minor.

최근접 이웃 규칙 기반 프로토타입 선택과 편의-분산을 이용한 성능 평가 (Nearest-neighbor Rule based Prototype Selection Method and Performance Evaluation using Bias-Variance Analysis)

  • 심세용;황두성
    • 전자공학회논문지
    • /
    • 제52권10호
    • /
    • pp.73-81
    • /
    • 2015
  • 이 논문은 프로토타입 선택 방법을 제안하고, 편의-분산 분해를 이용하여 최근접 이웃 알고리즘과 프로토타입 기반 분류 학습의 일반화 성능 비교 평가에 있다. 제안하는 프로토타입 분류기는 클래스 영역 내에서 가변 반지름을 이용한 다차원 구를 정의하고, 적은 수의 프로토타입으로 구성된 새로운 훈련 데이터 집합을 생성한다. 최근접 이웃 분류기는 새 훈련 집합을 이용하여 테스트 데이터의 클래스를 예측한다. 평균 기대 오류의 편의와 분산 요소를 분해하여 최근접 이웃 규칙, 베이지안 분류기, 고정 반지름을 이용한 프로토타입 선택 방법, 제안하는 프로토타입 선택 방법의 일반화 성능을 비교한다. 실험에서 제안하는 프로토타입 분류기의 편의-분산 변화 추세는 모든 훈련 데이터를 사용하는 최근접 이웃 알고리즘과 비슷한 편의-분산 추세를 보였으며, 프로토타입 선택 비율은 전체 데이터의 평균 약 27.0% 이하로 나타났다.

앙상블의 편기와 분산을 이용한 패턴 선택 (Pattern Selection Using the Bias and Variance of Ensemble)

  • 신현정;조성중
    • 대한산업공학회지
    • /
    • 제28권1호
    • /
    • pp.112-127
    • /
    • 2002
  • A useful pattern is a pattern that contributes much to learning. For a classification problem those patterns near the class boundary surfaces carry more information to the classifier. For a regression problem the ones near the estimated surface carry more information. In both cases, the usefulness is defined only for those patterns either without error or with negligible error. Using only the useful patterns gives several benefits. First, computational complexity in memory and time for learning is decreased. Second, overfitting is avoided even when the learner is over-sized. Third, learning results in more stable learners. In this paper, we propose a pattern 'utility index' that measures the utility of an individual pattern. The utility index is based on the bias and variance of a pattern trained by a network ensemble. In classification, the pattern with a low bias and a high variance gets a high score. In regression, on the other hand, the one with a low bias and a low variance gets a high score. Based on the distribution of the utility index, the original training set is divided into a high-score group and a low-score group. Only the high-score group is then used for training. The proposed method is tested on synthetic and real-world benchmark datasets. The proposed approach gives a better or at least similar performance.