• 제목/요약/키워드: Incremental Clustering

검색결과 44건 처리시간 0.023초

커널을 이용한 전역 클러스터링의 비선형화 (A Non-linear Variant of Global Clustering Using Kernel Methods)

  • 허경용;김성훈;우영운
    • 한국컴퓨터정보학회논문지
    • /
    • 제15권4호
    • /
    • pp.11-18
    • /
    • 2010
  • Fuzzy c-means(FCM)는 퍼지 집합을 응용한 간단하지만 효율적인 클러스터링 방법 중 하나이다. FCM은 여러 응용 분야에서 성공적으로 활용되어 왔지만, 초기화와 잡음에 민감하고 볼록한 형태의 클러스터들만 다룰 수 있는 문제점이 있다. 이 논문에서는 이러한 FCM의 문제점을 해결하기 위해 전역 클러스터링(global clustering) 기법과 커널 클러스터링(kernel clustering) 기법을 결합하여 새로운 비선형 클러스터링 기법인 커널 전역 FCM(kernel global fuzzy c-means, KG-FCM)을 제안한다. 전역 클러스터링은 클러스터링의 초기화를 위한 방법 중 하나로, 순차적으로 클러스터를 하나씩 추가함으로써 초기화에 민감한 FCM의 한계를 극복할 수 있도록 해준다. FCM의 잡음 민감성과 볼록한 클러스터들만 다룰 수 있는 한계를 극복하기 위한 방법은 여러 가지가 있으며 커널 클러스터링이 그 중 하나이다. 커널 클러스터링은 사용하는 커널을 바꿈으로써 쉽게 확장이 가능하므로 이 논문에서는 커널 클러스터링을 사용하였다. 두 방법을 결합함으로써 제안한 방법은 위에서 언급한 문제점들을 해결할 수 있으며, 이는 가상 및 실제 데이터를 이용한 실험 결과를 통해 확인할 수 있다.

휴대폰 상에서 개인용 사진 컬렉션에 대한 자동 이벤트 군집화 방법 (Automatic Event Clustering Method for Personal Photo Collection on Mobile Phone)

  • 유정수;낭종호
    • 한국정보과학회논문지:컴퓨팅의 실제 및 레터
    • /
    • 제16권12호
    • /
    • pp.1269-1273
    • /
    • 2010
  • 일반적으로 사용자는 휴대폰에서 촬영한 개인용 사진 컬렉션에 대하여 이벤트 기준으로 관리 및 접근하는 것을 선호한다. 본 논문에서는 휴대폰상의 개인용 사진 컬렉션에 대하여 계산 량이 적고 정확도가 높으며 증감적인 클러스터링을 지원하는 이벤트 클러스터링 알고리즘을 제안하였다. 제안한 방법은 실제 샘플 사진들을 수집하여 이벤트 내의 사진들의 시간 경과 치에 대한 통계적 분석을 통하여 이벤트 경계 구간을 결정하였으며, 시간 정보만으로 분할이 모호한 구간에서는 위치 정보와 시각 정보를 사용하여 보완하였다. 본 논문에서는 제안한 방법에 대하여 실험 및 검증을 수행하였으며, 기존의 일반적인 클러스터링 방법에 비하여 높은 성능을 나타내는 것을 확인하였다.

반복적 2차원 프로젝션 필터링을 이용한 확장 고차원 클러스터링 (Extended High Dimensional Clustering using Iterative Two Dimensional Projection Filtering)

  • 이혜명;박영배
    • 정보처리학회논문지D
    • /
    • 제8D권5호
    • /
    • pp.573-580
    • /
    • 2001
  • 대용량의 고차원 데이터 집합은 고차원 데이터 고유 희소성에 의하여 상당한 양의 잡음을 포함하므로 효과적인 고차원 클러스터링에 어려움을 더한다. CLIP은 이와 같은 고차원 데이터의 특성을 지원하는 클러스터링 알고리즘으로 개발되었다. CLIP은 1차원 성형변환 프로젝션을 점진적으로 적용하여, 각 프로젝션 공간에서 얻어진 1차원 클러스터들의 곱집합을 찾는다. 이 집합은 클러스터를 포함할 뿐 아니라 잡음도 포함할 수 있다. 본 논문에서는 클러스터를 포함하는 곱집합을 정제하는 확장된 CLIP 알고리즘을 제안한다. 이미 CLIP에서 찾은 곱집합에 반복적인 2차원 프로젝션을 적용하여 클러스터의 고차원적 잡음을 제거한다. 확장된 알고리즘의 성능을 평가하기 위해 합성 데이터를 이용한 일련의 실험을 통하여 효과성을 증명한다.

  • PDF

Infinite Relational Model 기반 Co-Clustering을 이용한 영화 추천 (Movie Recommendation Using Co-Clustering by Infinite Relational Models)

  • 김병희;장병탁
    • 한국지능시스템학회논문지
    • /
    • 제24권4호
    • /
    • pp.443-449
    • /
    • 2014
  • 사람의 영화에 대한 선호도에는 개인의 특성과 영화의 속성을 기반으로 하는 다양한 요인이 연관되어 있다. 영화 추천을 위한 사용자-영화-선호도 연관 관계의 분석 기법으로서, 다중 개념 탐색 기법의 특성을 지닌 infinite relational model (IRM)의 활용 가능성을 확인하고, 이를 기초로 영화 선호 유형에 따른 사용자-영화 군집을 탐색한다. 별점으로 표현되는 명시적인 선호도 데이터에 영화 컨텐츠 관련 메타데이터를 추가하여 학습 데이터를 구성하고, 이에 IRM을 적용하여 공군집화(co-clustering)를 수행한 결과, 해석 가능한 다양한 명시적 연관 관계를 발견하였다. 공군집화 결과를 기초로 개인화 추천에서의 다양한 활용 방안을 논의한다.

선형회귀와 국부적인 RBFN에 의한 점진적인 모델의 설계 (Design of Incremental Model by Linear Regression and Local RBFNs)

  • 이명원;곽근창
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2010년도 추계학술발표대회
    • /
    • pp.471-473
    • /
    • 2010
  • 본 논문은 선형회귀(LR: Linear Regression)와 국부적인 방사기저함수 네트워크(RBFN: Radial Basis Function Networks)를 결합한 점진적인 모델(incremental model)의 설계와 관련되어진다. 전형적인 RBFN에 의한 모델링과는 달리, 제안된 방법의 근본적인 원리는 두 단계에 의해 고려되어진다. 첫째, 전체 모델의 설계과정에서 전역적인 모델로써 선형회귀에 의해 데이터의 선형부분을 구축한다. 다음으로, 모델링 오차는 오차가 존재하는 국부적인 공간에서 RBFN에 의해 보상되어진다. 여기서, 오차의 분포로부터 RBFN을 설계하기 위해 컨텍스트 기반 퍼지 클러스터링(CFC: Context-based Fuzzy Clustering)를 통해 정보입자의 형태로 구축되어진다. 실험은 자동차 mpg 연료소비량 예측과 부동산 가격예측문제를 통해 제안된 방법의 우수성을 증명한다.

개념분류기법을 적용한 한국에 명사분류 (Korean Noun Clustering Via Incremental Conceptual Clustering)

  • 정연수;조정미;김길창
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1995년도 제7회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.50-55
    • /
    • 1995
  • 많은 언어관계들이 의미적으로 유사한 단어들의 집합에 적응된다. 그러므로 단어들을 의미가 비슷한 것들의 집합으로 분류하는 것은 아주 유용한 일이다. 본 논문에서는 말뭉치로부터의 동사와 명사의 분포정보를 이용하여 명사들을 분류하고자 한다. 한국어에서는 명사마다 문장에서 그 명사를 특정한 격으로 사용할 수 있는 동사들이 제한되어 있다. 그러므로 본 논문에서는 말뭉치에서 나타나는 명사와 그 명사를 특정한 격으로 사용하는 동사들의 분포정보로부터 명사들을 분류하는 방법을 제시한다. 형태소 해석된 50만 단어 말뭉치에서 가장 빈도수가 높은 명사 85단어를 대상으로 실험하였다. 명사와 동사의 구문정보를 사용하므로 의미적으로는 다르지만 쓰임이 비슷한 단어들도 같은 부류로 분류되었다. 의미적으로 애매성을 가지는 명사들의 경우도 실험결과를 나쁘게하는 요인이 되었다. 그리고, 좀더 좋은 결과를 얻기 위해서는 동사들도 의미가 유사한 것들로 분류한 후, 명사와 동사의 분포정보가 아닌 명사와 동사들의 집합의 분포정보를 이용하는 것도 종은 방법이 될 것이다.

  • PDF

고차원 데이터에서 점진적 프로젝션을 이용한 클러스터링 (A Clustering using Incremental Projection for High Dimensional Data)

  • 이혜명;박영배
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2000년도 가을 학술발표논문집 Vol.27 No.2 (1)
    • /
    • pp.189-191
    • /
    • 2000
  • 데이터 마이닝의 방법론 중 클러스터링은 데이터베이스 객체들의 에트리뷰트 값에 근거하여 유사한 그룹으로 식별하는 기술적인 작업이다. 그러나 대부분 알고리즘들은 데이터의 차원이 증가할수록 형성된 전체 데이터 공간은 매우 방대하므로 의미있는 클러스터의 탐색이 더욱 어렵다. 따라서 효과적인 클러스터링을 위해서는 클러스터가 포함될 데이터 공간의 예측이 필요하다. 본 논문에서는 고차원 데이터에서 각 차원에 대한 점진적 프로젝션을 이용한 클러스터링 방법을 제안한다. 제안한 방법에서는 클러스터가 포함될 가능성이 있는 데이터공간의 후보영역을 결정하여, 이 영역에서 점들의 평균값을 중심으로 클러스터를 탐색한다.

  • PDF

온톨로지 기반 점진적 클러스터링 기법에 관한 연구 (A Study of Incremental Clustering Technique based on Ontology)

  • 김제민;박영택
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2005년도 가을 학술발표논문집 Vol.32 No.2 (2)
    • /
    • pp.643-645
    • /
    • 2005
  • 클러스터링은 무질서한 데이터들의 상호 연관 관계를 정의하고, 이를 통하여 보다 체계적으로 데이터를 군집화하는 것이다. 클러스터링을 적용한 웹 서비스 시스템은 비슷한 내용을 묶어 제공하기 때문에 사용자는 보다 효율적으로 정보를 제공받을 수 있다. 시멘틱 웹의 기반이 되는 온톨로지는 클러스터링을 위한 완벽한 입력 데이터를 제공한다. 본 논문은 온톨로지를 기반의 메타 데이터를 클러스터링 하기 위한 기법을 제안한다. 본 논문의 목적은 온톨로지 기반의 메타 데이터들의 유사성을 측정하기 위한 평가함수를 정의하고, 이러한 평가함수를 적용한 계층적 클러스터링 알고리즘을 연구하는 것이다.

  • PDF

점진적 알고리즘을 이용한 웹 문서 클러스터링 시스템의 설계 및 구현 (Design and implementation of web document clustering system using on incremental algorithm)

  • 황태호;손기락
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 1999년도 가을 학술발표논문집 Vol.26 No.2 (1)
    • /
    • pp.207-209
    • /
    • 1999
  • 클러스터 분석은 관측의 대상이 되는 집합에 맞는 분류 구조를 생성하는데 이용되는 통계학적인 기술이다. 정보검색 응용에서 전형적으로 발견되는 높은 차원을 가진 많은 데이터 집합을 클러스터하기 위하여, 많은 공간과 시간이 필요하다. SLINK 알고리즘은 O(n2)의 시간과 O(n)의 공간의 성능을 갖으며 점진성을 반영할 수 있는 알고리즘이다. SLINK알고리즘을 이용하여 검색 엔진의 검색결과에 온라인으로 클러스터 분류를 수행하는 시스템을 구현하였다. 구현된 시스템은 상대적으로 높은 정확도와 각 클러스터를 저장하고 표현하는데 있어서의 장점을 제공하며, 상대적으로 느린 수행 속도는 온라인으로 문서들이 다운로드 되는 속도가 느리므로 문제가 되지 않음을 알 수 있었다.

  • PDF

점증적으로 증가하는 타원형 군집화 : 피부색 영역 검출에의 적용 (Elliptical Clustering with Incremental Growth and its Application to Skin Color Region Segmentation)

  • 이경미
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제31권9호
    • /
    • pp.1161-1170
    • /
    • 2004
  • 본 논문에서는 군집화 알고리즘을 사용하여 피부색 영역을 분할하는 방법을 제안한다. 기존의 군집화 알고리즘들의 대부분은 주로 구형의 군집을 검출하고, 배치형으로 수행되며, 군집의 개수를 미리정해야 한다는 문제점을 가지고 있다. 본 논문에서는 대표적인 타원형 군집화 알고리즘인 EM 알고리즘을 변형하여, 온라인으로 학습가능하며, 군집의 개수를 자동적으로 찾아낼 수 있는 EAM 알고리즘을 사용하였다. EAM 알고리즘외 유효성은 피부색 영역 분할에 대해 증명되었다. 실험결과는 군집의 개수가 미리 주어지지 않더라도, EAM 알고리즘은 주어진 영상에 대해 자동적으로 옳은 군집의 개수를 찾아냈고, EM 알고리즘과 비교하여 더 좋은 분할 결과를 보여주고 있다. 영역에 대한 조건부 확률을 이용하여 성공적인 피부색 영역의 탐지 및 분할 결과를 얻었다. 또한 사람이 포함된 영상을 분류하는 문제에도 적용하여 좋은 분류 결과를 얻었다.