A Study on the Construction of Stable Clustering by Minimizing the Order Bias

순서 바이어스 최소화에 의한 안정적 클러스터링 구축에 관한 연구

  • Published : 1999.06.01

Abstract

When a hierarchical structure is derived from data set for data mining and machine learning, using a conceptual clustering algorithm, one of the unsupervised learning paradigms, it is not unusual to have a different set of outcomes with respect to the order of processing data objects. To overcome this problem, the first classification process is proceeded to construct an initial partition. The partition is expected to imply the possible range in the number of final classes. We apply center sorting to the data objects in the classes of the partition for new data ordering and build a new partition using ITERATE clustering procedure. We developed an algorithm, REIT that leads to the final partition with stable and best partition score. A number of experiments were performed to show the minimization of order bias effects using the algorithm.

데이터 마이닝 또는 기계학습을 위한 무감독 학습 알고리즘인 개념적 클러스터링을 이용하여 계층적 구조를 유도해낼 때 자료를 처리하는 순서에 따라 서로 다른 결과에 도달하는 양상을 보인다. 이 순서 바이어스 문제를 해결하는 방안으로 먼저 주어진 자료 세트에 분류를 시행하여 초기 분류를 형성한다. 이 분류를 통해 최종 분류의 가능한 클래스 수를 예측하고 이 정보에 기반하여 자료 분석과 중심 정렬을 통해 자료 처리 순서를 새로이 결정한다. 재배열된 자료 세트에 ITERATE 분류 과정을 적용해 새로운 분류를 생성한다. 본 논문에서는 이 과정을 반복하여 안정적이고 최적의 분류 점수를 갖도록 하는 알고리즘 REIT를 제안하였다. 이 알고리즘을 여러 자료 세트에 적용하고 순서 바이어스의 영향을 최소화하는지 여부를 실험을 통해 비교 분석하였다.

Keywords