• 제목/요약/키워드: Classification Problem

검색결과 1,729건 처리시간 0.025초

텍스트 문서 분류에서 범주간 유사도와 계층적 분류 방법의 성과 관계 연구 (A Study on the Relationship between Class Similarity and the Performance of Hierarchical Classification Method in a Text Document Classification Problem)

  • 장수정;민대기
    • 한국전자거래학회지
    • /
    • 제25권3호
    • /
    • pp.77-93
    • /
    • 2020
  • 비정형 텍스트 문서를 다중 범주로 분류하는 문제에 있어서, 계층적 분류 방법이 비계층적 분류 방법에 비하여 분류 성능이 우수한 것으로 알려져 있다. 기존 문헌과 다르게 본 연구에서는 사전에 범주들의 계층 구조가 정의된 상황에서 계층적 분류 방법과 비계층적 분류 방법의 성능을 비교하였다. 수자원 분야 기후변화 적응기술과 관련한 논문 분류 데이터와 20NewsGroup 오픈 데이터를 대상으로 계층적/비계층적 분류 방법의 성능을 비교하였다. 본 연구결과 기존 문헌과 다르게 계층적 분류 방법이 비계층적 분류 방법에 비하여 언제나 성능이 우수한 것은 아님을 확인하였다. 계층 구조의 상위/하위 수준에서의 상대적 유사도에 따라서 계층적/비계층적 분류 방법의 성능에 차이가 있음을 확인하였다. 즉, 상위 수준의 유사도가 하위 수준보다 상대적으로 낮은 경우 상위 수준에서의 오분류 감소로 계층적 분류 방법의 성능이 개선됨을 확인하였다.

Intention Classification for Retrieval of Health Questions

  • Liu, Rey-Long
    • International Journal of Knowledge Content Development & Technology
    • /
    • 제7권1호
    • /
    • pp.101-120
    • /
    • 2017
  • Healthcare professionals have edited many health questions (HQs) and their answers for healthcare consumers on the Internet. The HQs provide both readable and reliable health information, and hence retrieval of those HQs that are relevant to a given question is essential for health education and promotion through the Internet. However, retrieval of relevant HQs needs to be based on the recognition of the intention of each HQ, which is difficult to be done by predefining syntactic and semantic rules. We thus model the intention recognition problem as a text classification problem, and develop two techniques to improve a learning-based text classifier for the problem. The two techniques improve the classifier by location-based and area-based feature weightings, respectively. Experimental results show that, the two techniques can work together to significantly improve a Support Vector Machine classifier in both the recognition of HQ intentions and the retrieval of relevant HQs.

불균형 자료에 대한 분류분석 (Classification Analysis for Unbalanced Data)

  • 김동아;강수연;송종우
    • 응용통계연구
    • /
    • 제28권3호
    • /
    • pp.495-509
    • /
    • 2015
  • 일반적인 2집단 분류(2-class classification)의 경우, 두 집단의 비율이 크게 차이나지 않는 경우가 많다. 본 논문에서는 두 집단의 비율이 크게 차이나는 불균형 데이터(unbalanced data)의 분류 문제에 대해서 다루고자 한다. 불균형 데이터의 분류방법은 균형이 맞는 데이터(balanced data)의 경우보다 분류하기 어려운 경우가 많다. 이런 자료에서 보통의 분류모형을 적용하게 되면 많은 경우에 대부분의 관측치가 큰 집단으로 분류 되는 경우가 많은데 실질적인 어플리케이션에서는 이런 오분류가 손해가 더 큰 경우가 대부분이다. 우리는 sampling 기법을 이용하여 다양한 분류 방법론의 성능을 비교 분석 하였다. 또한 비대칭 손실(asymmetric loss)을 가정한 경우에 어떤 방법론이 가장 작은 loss를 생성하는 지를 비교하였다. 성능 비교를 위해서는 오분류율(misclassification rate), G-mean, ROC, 그리고 AUC(Area under the curve) 등을 이용하였다.

규칙의 커플링문제를 최소화하기 위한 퍼지-러프 분류방법 (A Fuzzy-Rough Classification Method to Minimize the Coupling Problem of Rules)

  • 손창식;정환묵;서석태;권순학
    • 한국지능시스템학회논문지
    • /
    • 제17권4호
    • /
    • pp.460-465
    • /
    • 2007
  • 본 논문에서는 규칙의 커플링 문제를 최소화하기 위해 주어진 데이터의 통계적 특성과 퍼지-러프집합을 기반으로 한 새로운 패턴분류 방법을 제안한다. 제안한 방법 하에서 주어진 데이터의 통계적 특성은 입력부 퍼지집합의 파티션 개수를 결정하고, 생성된 규칙의 커플링문제를 최소화하기 위한 선택기준으로 사용하였다. 또한 러프집합은 수치적인 데이터로부터 생성된 규칙들 간의 불필요한 속성들을 제거하기 위한 도구로서 이용하였다. 제안된 방법의 타당성을 검증하기 위하여 Fisher의 IRIS 데이터를 사용하여 기존의 패턴분류 방법과 분류 정확도를 비교하였다. 실험결과, 제안한 방법이 기존의 학습에 의한 방법들보다 비교적 좋은 성능을 가진다는 것을 알 수 있었다.

Sparse kernel classication using IRWLS procedure

  • Kim, Dae-Hak
    • Journal of the Korean Data and Information Science Society
    • /
    • 제20권4호
    • /
    • pp.749-755
    • /
    • 2009
  • Support vector classification (SVC) provides more complete description of the lin-ear and nonlinear relationships between input vectors and classifiers. In this paper. we propose the sparse kernel classifier to solve the optimization problem of classification with a modified hinge loss function and absolute loss function, which provides the efficient computation and the sparsity. We also introduce the generalized cross validation function to select the hyper-parameters which affects the classification performance of the proposed method. Experimental results are then presented which illustrate the performance of the proposed procedure for classification.

  • PDF

성장곡선모형의 판별분석에서 균형이차분류법의 적용 (An Application of the Balanced Quadratic Classification Rule on the Discriminant Analysis in Growth Curve Model)

  • 심규박
    • 품질경영학회지
    • /
    • 제23권2호
    • /
    • pp.53-67
    • /
    • 1995
  • The problem considered here is to find the optimal discriminant analysis method in growth curve model. It has been studied how to find correct prior probability for the effective classification in discriminant analysis. We use the balanced condition to calculate prior probability. From the informative simulation study, new classification rule for the growth curve model is suggested. The suggested classification rule has better classification result than the other previously suggested method in terms of error rate criterion.

  • PDF

A Note on Linear SVM in Gaussian Classes

  • Jeon, Yongho
    • Communications for Statistical Applications and Methods
    • /
    • 제20권3호
    • /
    • pp.225-233
    • /
    • 2013
  • The linear support vector machine(SVM) is motivated by the maximal margin separating hyperplane and is a popular tool for binary classification tasks. Many studies exist on the consistency properties of SVM; however, it is unknown whether the linear SVM is consistent for estimating the optimal classification boundary even in the simple case of two Gaussian classes with a common covariance, where the optimal classification boundary is linear. In this paper we show that the linear SVM can be inconsistent in the univariate Gaussian classification problem with a common variance, even when the best tuning parameter is used.

다단계 퓨전기법을 이용한 비유사도 기반 식별기의 최적화 (On Optimizing Dissimilarity-Based Classifier Using Multi-level Fusion Strategies)

  • 김상운;로버트 듀인
    • 전자공학회논문지CI
    • /
    • 제45권5호
    • /
    • pp.15-24
    • /
    • 2008
  • 얼굴인식 등과 같은 고차원 식별문제에서는 샘플패턴의 수가 패턴의 차원보다 작아지게 된다. 이러한 상황에서 차원을 축소하기위해 선형판별분석법을 적용할 경우, 희소성(Small Sample Size: SSS)문제가 발생한다. 최근, SSS 문제를 해결하기 위하여 비유사도에 기반 한 식별법(Dissimilarity-Based Classification: DBC)을 이용하는 방법이 검토되었다. DBC에서는 특징 벡터 대신에 학습 샘플들로부터 추출한 프로토타입들과의 비유사도를 측정하여 입력 패턴을 식별하는 방법이다. 본 논문에서는 비유사도 표현단계와 DBC 학습단계에서 퓨전기법을 중복 적용하는 다단계 퓨전기법(Multi-level Fusion Strategies: MFS)으로 DBCs를 최적화시키는 방법을 제안한다. 제안 방법을 벤취마크 얼굴영상 데이터베이스를 대상으로 실험한 결과, 식별률을 향상시킬 수 있음을 확인하였다.

A New Hybrid Algorithm for Invariance and Improved Classification Performance in Image Recognition

  • Shi, Rui-Xia;Jeong, Dong-Gyu
    • International journal of advanced smart convergence
    • /
    • 제9권3호
    • /
    • pp.85-96
    • /
    • 2020
  • It is important to extract salient object image and to solve the invariance problem for image recognition. In this paper we propose a new hybrid algorithm for invariance and improved classification performance in image recognition, whose algorithm is combined by FT(Frequency-tuned Salient Region Detection) algorithm, Guided filter, Zernike moments, and a simple artificial neural network (Multi-layer Perceptron). The conventional FT algorithm is used to extract initial salient object image, the guided filtering to preserve edge details, Zernike moments to solve invariance problem, and a classification to recognize the extracted image. For guided filtering, guided filter is used, and Multi-layer Perceptron which is a simple artificial neural networks is introduced for classification. Experimental results show that this algorithm can achieve a superior performance in the process of extracting salient object image and invariant moment feature. And the results show that the algorithm can also classifies the extracted object image with improved recognition rate.