• 제목/요약/키워드: 범주형

검색결과 548건 처리시간 0.024초

자동분류 알고리즘을 이용한 지능형 정보검색시스템 구축에 관한 연구 (A Study of Designing the Intelligent Information Retrieval System by Automatic Classification Algorithm)

  • 서휘
    • 한국도서관정보학회지
    • /
    • 제39권4호
    • /
    • pp.283-304
    • /
    • 2008
  • 본 연구의 목적은 이용자의 탐색 행태, 시스템의 정보 구축 행태를 기반으로 초기 질의어의 범주에 해당하는 연관 용어들(해당 용어의 지식구조와 관련된 연관 용어들)을 학습기능을 통해 자동으로 제시해 줄 수 있는 지능형 검색 시스템을 구현하는 것이다. 이를 위해 학습을 통해 전문가 수준의 색인어를 추출할 수 있는 지능형자동색인 알고리즘, 자동분류에 관련한 클러스터링 알고리즘과 문서 범주화 알고리즘 그리고 범주 표현 알고리즘에 대한 이론적 연구를 수행하였으며, 이들 이론적 연구를 근거로 비용과 시간적인 측면에서 그리고 재현율과 정도율이란 측면에서 우수한 성능을 발휘할 수 있는 지능형검색시스템을 구현하였다.

  • PDF

대용량 데이터를 위한 전역적 범주화를 이용한 결정 트리의 순차적 생성 (Incremental Generation of A Decision Tree Using Global Discretization For Large Data)

  • 한경식;이수원
    • 정보처리학회논문지B
    • /
    • 제12B권4호
    • /
    • pp.487-498
    • /
    • 2005
  • 최근 들어, 대용량의 데이터를 처리할 수 있는 트리 생성 방법에 많은 관심이 집중되고 있다 그러나 대용량 데이터를 위한 대부분의 알고리즘은 일괄처리 방식으로 데이터를 처리하기 때문에 새로운 데이터가 추가되면 이 데이터를 반영한 결정 트리를 생성하기 위해 처음부터 트리를 다시 생성해야 하다. 이러한 재생성에 따른 비용문제에 보다 효율적인 접근 방법은 결정 트리를 순차적으로 생성하는 접근 방법이다. 대표적인 알고리즘으로 BOAT와 ITI를 들 수 있으며 이들 알고리즘은 수치형 데이터 처리를 위해 지역적 범주화를 이용한다. 그러나 범주화는 정렬된 형태의 수치형 데이터를 요구하기 때문에 대용량 데이터를 처리해야하는 상황에서 전체 데이터에 대해 한번만 정렬을 수행하는 전역적 범주화 기법이 모든 노드에서 매번 정렬을 수행하는 지역적 범주화보다 적합하다. 본 논문은 수치형 데이터 처리를 위해 전역적 범주화를 이용하여 생성된 트리를 효율적으로 재생성하는 순차적 트리 생성 방법을 제안한다. 새로운 데이터가 추가될 경우, 전역적 범주화에 기반 한 트리를 순차적으로 생성하기 위해서는 첫째, 이 새로운 데이터가 반영된 범주를 재생성해야 하며, 둘째, 범주 변화에 맞게 트리의 구조를 변화시켜야한다. 본 논문에서는 효율적인 범주 재생성을 위해 샘플 분할 포인트를 추출하고 이로부터 범주화를 수행하는 기법을 제안하며 범주 변화에 맞는 트리 구조 변화를 위해 신뢰구간과 트리 재구조화기법을 이용한다. 본 논문에서 피플 데이터베이스를 이용하여 기존의 지역적 범주화를 이용한 경우와 비교 실험하였다.

가변 그룹 벤치마킹 모형과 범주형 변수모형을 이용한 아시아 컨테이너항만의 클러스터링측정 및 추세분석에 관한 실증적 연구 (An Empirical Study on the Measurement of Clustering and Trend Analysis among the Asian Container Ports Using the Variable Group Benchmarking and Categorical Variable Models)

  • 박노정
    • 한국항만경제학회지
    • /
    • 제29권1호
    • /
    • pp.143-175
    • /
    • 2013
  • 본 논문에서는 아시아 항만들 간의 클러스터링 추세를 분석하기 위해서 가변그룹벤치마킹모형과 범주형 변수모형에 대해서 이론적으로 설명하고, 아시아 38개 항만들의 9 년간 자료를 4개의 투입요소(선석길이, 수심, 총면적, 크레인 수), 1개의 산출요소(컨테이너화물처리량)를 이용하여 특정국가의 항만그룹 또는 특정항만을 대상으로 클러스터링 하는 방법을 실증적으로 보여 주고 분석하였다. 실증분석의 주요한 결과는 다음과 같다. 첫째, 가변그룹벤치마킹모형에 의한 중국항만을 벤치마킹하는 경우의 클러스터링 추세분석을 측정한 결과를 보면, 상해항, 청도항, 닝보항의 클러스터링 역할이 커진 것으로 나타났다. 둘째, 컨테이너화물처리량을 중심으로 한 범주형 변수모형에 의한 클러스터링 추세분석 결과를 살펴보면 중국이외의 항에서는 싱가포르항, 키롱항, 두바이항, 카오슝항이 클러스터링의 중심항만들로 나타났다. 셋째, 아카바, 두바이, 홍콩,상하이, 광저우, 닝보 항만들이 지역적으로 근접한 항만들끼리 클러스터링을 위해서 기본이 되는 효율적인 항만들로 나타났다. 넷째, 지역별 항만의 위치를 중심으로 한 범주형변수모형에 의한 클러스터링의 측정한 결과를 살펴보면, 두바이항과 코르파칸항, 홍콩항과 상하이항, 싱가포르항과 키롱항, 닝보항, 클러스터링의 중심항만이 되고 있는 추세를 보여 주었다. 전체적으로 보았을 때, 두바이항, 코르파칸항, 상하이항, 홍콩항, 닝보항, 싱가포르항 등이 아시아 항만들과 클러스터링을 해야만 하는 항만들로 나타났다. 본 논문이 갖는 정책적인 함의는 항만정책입안자들이 본 연구에서 사용한 두 가지 모형을 항만의 클러스터링에 도입하여 해당항만이 발전할 수 있는 전략을 수립하고 이행해 나가야만 한다는 점이다.

은행과 저축은행 관련 재정 지표 분석: 생물 정보학 분석 기법의 응용 (Analyzing Financial Data from Banks and Savings Banks: Application of Bioinformatical Methods)

  • 박노진
    • 응용통계연구
    • /
    • 제27권4호
    • /
    • pp.577-588
    • /
    • 2014
  • 자료의 수집과 저장이 수월해 지면서 대용량의 자료들이 존재하고 특히 개체 보다 변수가 더 많은 자료들이 생산되고 있다. 변수들이 증가하면서 다중공선성 같은 문제들이 발생하여 분석의 어려움에 봉착하게 된다. 이러한 문제를 해결하는 방법들이 많이 연구되었지만 다소간의 정보의 손실을 감내하고 연속형 자료를 범주형 자료로 변환하면 나름 유용한 분석이 가능하다고 본다. 대용량 범주형 자료의 대표적인 사례로 유전자 염기 서열 자료가 있고 이를 분석하기 위한 많은 기술들이 발달되어 있다. 본 논문에서는 국내 은행들이 생산해 낸 다양한 지표들을 분석하기 위해 유전자 염기 서열 분석 기법을 적용하여 분석하였고 나름 유용한 정보를 얻을 수 있음을 보였다. 본 논문에서 사용한 자료는 11개의 은행과 5개의 저축은행과 관련된 78개 재정 지표를 갖는 자료로서 심각한 다중 공선성이 존재하여 자료를 범주화하고 분석한 결과 몇 가지 유용한 결과를 도출하였다.

범주형 속성 기반 군집화를 위한 새로운 유사 측도 (A New Similarity Measure for Categorical Attribute-Based Clustering)

  • 김민;전주혁;우경구;김명호
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제37권2호
    • /
    • pp.71-81
    • /
    • 2010
  • 데이터의 군집을 찾아내는 문제는 패턴 인식, 이미지 처리, 시장 조사 등 많은 응용 분야에서 널리 사용되고 있다. 군집의 질을 결정하는 핵심 요소로는 유사 측도, 차원의 개수 등이 있다. 유사 측도는 데이터의 특성을 반영하여 다르게 정의되어야 하는데, 대부분 기존의 연구들은 데이터를 특징 지어주는 속성이 수치형으로 주어진 경우에 국한되어 있었다. 속성이 범주형으로 주어진 경우도 실생활에 많이 존재하지만, 범주형 변수에 대한 속성값의 유사성은 값의 순서가 고유하게 정해지지 않아서 정의하기 어렵다. 이에 더하여, 고차원 데이터에 대해서는 데이터 점들이 희박하게 위치하여 가까운 점과 먼 점간의 차이가 거의 없고, 군집화 결과가 좋지 않을 수 있다. 이 문제를 해결하기 위해 부분 차원 군집화 방법이 제안되어 왔다. 부분 차원 군집화 방법은 각 군집을 발견하기에 적합한 부분 차원을 선택하면서 군집화를 수행하는 방법이다. 본 논문에서는 범주형 속성으로 특징지어진 고차원 데이터를 부분 차원 군집화하기 위한 새로운 유사 측도를 제안한다. 유사 측도는 각 군집은 다른 군집과 구별되는 특정 정보를 잘 표현할 수 있어야 한다는 기본적인 가정 하에 속성들 사이의 상관성을 반영하여 정의되었다. 이들 모두를 반영한 유사측도는 기존에 존재하지 않았다는 점에서 본 연구는 의미가 있다. 실제 데이터 집합을 군집화하는 실험을 통해 제안하는 방법이 다른 군집화 방법보다 저차원 데이터와 고차원 데이터 모두에 대해 좀 더 정확한 군집 결과를 얻을 수 있음을 보였다.

무응답을 포함하는 범주형 자료의 분석 (Analysis of categorical data with nonresponses)

  • 박태성;이승연
    • 응용통계연구
    • /
    • 제11권1호
    • /
    • pp.83-95
    • /
    • 1998
  • 본 논문에서는 여론조사를 비롯한 표본조사에서 얻어지는 범주형 자료에서 결측치(missing observation)나 무응답(nonresponse)이 발생했을 때 이러한 자료를 적절하게 처리하여 분석할 수 있는 통계모형을 소개하고 실제 사례로서 1948년도에 미국에서 실시한 대통령 선거에 대한 여론조사 자료를 분석하였다. 당시 미국 여론조사 기관에서는 Dewey 후보가 압승을 거둘 것으로 예상을 했지만 실제 선거에서는 Truman 후보가 승리했었다.

  • PDF

K-모드 알고리즘과 ROCK 알고리즘의 개선 (Improvements of K-modes Algorithm and ROCK Algorithm)

  • 김보화;김규성
    • 응용통계연구
    • /
    • 제15권2호
    • /
    • pp.381-393
    • /
    • 2002
  • K-모드(modes) 알고리즘과 락(ROCK) 알고리즘은 대규모 범주형 자료에 적용 가능한 데이터 군집화 방법이다. 이 논문에서는 두 알고리즘을 고찰하였으며, 두 알고리즘의 단점을 보완한 개선된 데이터 군집화 알고리즘을 제안하였다. 그리고 실제자료에 제안된 방법을 적용한 모의실험을 실시하여 제안된 방법이 데이터 군집화의 성능을 향상시킬 수 있음을 보였다.

데이터 마이닝을 이용한 교통사고 심각도 분류분석 (Data Mining for Road Traffic Accident Type Classification)

  • 손소영;신형원
    • 대한교통학회지
    • /
    • 제16권4호
    • /
    • pp.187-194
    • /
    • 1998
  • 본 연구는 교통사고 심각도와 관련된 중요변수를 찾고 이들 변수를 바탕으로 신경망, Decision Tree, 로지스틱 회귀분석을 이용하여 사고 심각도 분류 예측모형을 추정하였다. 다수의 범주형 변수로 이루어진 교통사고 통계원표상의 설명변수 들로부터 사고 심각도 변화에 영향력 있는 변수 선택을 위하여 독립성 검정을 위한 $x^2$ test와 Decision Tree를 이용하였고, 선택된 변수들은 신경망과 로지스틱 회귀분석의 기초로 이용되었다. 분석결과 세가지기법간에 분류정확도에는 유의한 차이가 없는 것으로 나타났다. 그러나 Decision Tree가 설명변수 선택능력과 분석수행시간, 사고 심각도 결정요인 식별의 용이함 측면에서 범주형 종속변수인 사고 심각도의 분석에 적합한 것으로 보이며 사고 심각도에는 보호장구가 가장 큰 영향을 미치는 것으로 재입증되었다.

  • PDF

데이터 마이닝을 이용한 교통사고 심각도 분류분석 (Data Mining for Road Traffic Accident Type Classification)

  • 손소영
    • 대한교통학회:학술대회논문집
    • /
    • 대한교통학회 1998년도 Proceedings 제34회 추계 학술발표회
    • /
    • pp.373-381
    • /
    • 1998
  • 본 연구는 교통사고 심각도와 관련된 중요변수를 찾고 이들 변수를 바탕으로 신경망, Decision Tree, 로지스틱 회귀분석을 이용하여 사고 심각도 분류 예측모형을 추정하였다. 다수의 범주형 변수로 이루어진 교통사고 통계원표상의 설명변수 들로부터 사고 심각도변화에 영향력 있는 변수선택을 위하여 $X^2$ 독립성 검정과 Decision Tree를 이용하였고, 선택된 변수들은 신경망과 로지스틱 회귀분석의 기초로 이용되었다. 분석결과 세가지기법간에 분류정확도에는 유의한 차이가 없는 것으로 나타났다. 그러나 decision Tree가 설명변수 선택능력과 분석수행시간, 사고 심각도 결정요인 식별의 용이함 측면에서 범주형 종속변수인 사고 심각도의 분석에 적합합 것으로 보이며 사고 심각도에는 보호장구가 가장 큰 영향을 미치는 것으로 재입증되었다.

  • PDF