• 제목/요약/키워드: 군집 적합도

검색결과 339건 처리시간 0.027초

군집수 결정 문제 (How to determine the number of clusters)

  • 윤복식
    • 한국경영과학회:학술대회논문집
    • /
    • 대한산업공학회/한국경영과학회 2004년도 춘계공동학술대회 논문집
    • /
    • pp.689-693
    • /
    • 2004
  • 주어진 데이터를 일정한 기준에 따라 여러 개 군집으로 분할할 때 대부분 경우는 군집수에 대한 사전 정보가 없이 군집화를 실시하게 된다. 적절한 군집수의 결정은 군집화 결과의 타당성에 전제가 되는 매우 중요한 문제이나 내재된 복잡성 때문에 실제 적용에 간편한 방법을 찾기 힘들고 더구나 다양한 형태의 데이터에 보편적으로 적합한 방법을 찾기는 더욱 어렵다. 본 연구에서는 기존의 제시된 군집수 결정방법 들의 아이디어 들을 소개하고 주어진 데이터의 종류에 관계없이 일반적으로 적용할 수 있는 새로운 군집수 결정기법을 제시한다. 대부분의 경우 군집수 결정은 군집화와 동시에 이루어지게 되므로 이것을 한꺼번에 처리하는 범용의 방법도 소개한다. 적용 예제들을 통한 타당성 검증도 이루어진다.

  • PDF

관광지 추천을 위한 클러스터링 최적화 군집수 결정 (Clustering Optimization Cluster Count Determination for Tourist Destination Recommendation)

  • 여해진;조인휘
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2023년도 추계학술발표대회
    • /
    • pp.371-373
    • /
    • 2023
  • factor 들이 많은 데이터의 군집화는 어려움을 요한다. K-means 클러스터링을 사용하여 군집화를 할 때, 각 데이터들이 가진 factor 의 개수가 상이한 경우 비슷한 성향을 가진 데이터임에도 불구하고 클러스터링이 적합하게 되지 않는 현상이 발생한다. 이러한 문제점을 해결하기 위해 최적의 군집화 개수를 결정하는 실루엣 기반 방법을 제안하고 제안기법의 성능을 평가한다.

합형식의 군집 유효화 지수의 분석과 새로운 지수 개발 (Analysis and New Indices of Cluster Validity Indices in Summation Type)

  • 김민호
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2005년도 한국컴퓨터종합학술대회 논문집 Vol.32 No.1 (B)
    • /
    • pp.598-600
    • /
    • 2005
  • 군집 유효화 평가란 기본적으로 클래스 (Class)에 대한 정보가 주어지지 않은 상태에서 다양한 입력 변수에 의해 발생되는 군집화의 결과들을 평가하여 그들 중에서 주어진 데이터 집합의 자연적인 분할 상태에 가장 적합한 결과를 찾는 기법을 말한다. 군집 유효화 평가에서 그 척도로 사용되는 것이 군집 유효화 지수이다. 본 논문에서는 우선 현존하는 다양한 군집 유효화 지수들 중에서 합 형식을 가지는 지수들을 다룬다. 구체적으로 이 지수들의 설계 원리와 각 지수들의 부합성 (Compliance) 분석한다. 다음으로 분석을 통해 밝혀진 그들의 단점을 보완할 수 있는 새로운 군집 유효화 지수들을 제안한다. 마지막으로 기존의 군집 유효화 지수들을 포함한 새로이 제안한 지수들의 성능을 실험 학습을 통해 평가한다.

  • PDF

코시 군집 과정을 이용한 산사태 자료 분석 (Analyzing landslide data using Cauchy cluster process)

  • 이기세;김정환;박노욱;이우주
    • 응용통계연구
    • /
    • 제29권2호
    • /
    • pp.345-354
    • /
    • 2016
  • 산사태 자료에서 환경변수들이 산사태 발생 위험에 어떻게 영향을 주는지 분석하기 위해 현재까지 비동질적 포아송 과정 모형이 주로 사용되어 왔다. 그렇지만, 이 모형은 산사태 자료에서 쉽게 관측되는 산사태 위치의 군집 현상에 대해 설명하지 못한다. 이러한 한계점을 극복하기 위해 우리는 코시 군집 과정을 사용할 것을 제안한다. 그리고, 제안된 방법이 실제 산사태 자료에서 얼마나 모형의 적합도를 개선시키는지 K-함수의 관점에서 살펴보고자 한다. 또한, 코시 군집 과정의 모수 추론을 위해 제안된 다양한 추정 방법의 성능을 비교하기 위해 시뮬레이션 연구를 진행하였다.

연관관계 군집 분할 방법을 이용한 아이템 필터링 시스템 (Item Filtering System Using Associative Relation Clustering Split Method)

  • 조동주;박양재;정경용
    • 한국콘텐츠학회논문지
    • /
    • 제7권6호
    • /
    • pp.1-8
    • /
    • 2007
  • 전자상거래에서 많은 아이템 중에 사용자에게 적합한 아이템을 추천하기 위해서는 많은 시간과 노력이 소요된다. 그러므로 추천 시스템이 사용자들을 대신하여 적합한 아이템을 추천해줄 수 있다면 만족을 얻을 수 있다. 본 논문에서는 정확성과 확장성을 향상시키기 위해서 협력적 필터링에서 연관관계 군집 분할 방법을 제안하였다. 평가한 데이터를 사용하여 연관 아이템간의 향상도를 산출하고 연관관계 군집의 효율성을 높이기 위해서 아이템으로 구성된 노드 군집을 분할하였다. 이는 군집들 중 하나의 아이템만이 연관성을 달리하고, 나머지 아이템들은 군집의 연관성이 충족되어진다면 결합하는 방법이다. 성능을 평가하기 위해서 MovieLens 데이터 집합에서 K-means와 EM에 의한 군집과 비교 평가하였다.

온습도에 따른 대중의 감성(감정+감각) 활동 변화 (A change of the public's emotion depending on Temperature & Humidity index)

  • 양중기;김근영;이영호;강운구
    • 디지털융복합연구
    • /
    • 제12권10호
    • /
    • pp.243-252
    • /
    • 2014
  • 소셜 미디어 데이터를 통해 파급되는 형태를 분석하여 국내 외 정치, 경제, 보건, 사회 문화현상을 대응하고자 하는 연구가 활발히 진행 중이다. 본 연구는 한국인이 가장 많이 사용하는 검색 서비스인 검색 정보를 알 수 있는 네이버 트렌드와 소셜 데이터인 네이버 블로그, 네이버 카페와 Open Data(API)를 사용하고 기상청의 온도, 습도 데이터를 사용하였다. 사람의 감성을 나타내는 감정 어휘와 감각을 표현하는 감각어휘 중 미각 어휘를 분석하여 대중의의 감성 활동 변화를 연구하였다. 적합도 검증과 계층적 군집분석으로 군집의 개수를 정하여 비 계층적 군집분석으로 군집화 하였다. 군집분석 결과 8개의 군집으로 군집화되어 감성어휘를 알 수 있었다. 판별분석에 의하면, 군집분석에서 결정된 8개의 그룹은 98.9% 정확성을 갖는 것으로 나타났다. 본 연구에서 연구한 감성 활동 변화는 온도와 습도에 의해 감성 활동을 예측 할 수 있어 감성을 공유하고 대중의 기분을 파악하여 서로 공감대를 형성 할 수 있다.

자기 조직화 지도와 계층적 군집화를 이용한 유전자 발현 데이터 군집화 기법 (Clustering of Gene Expression Data by using SOM and Hierarchical Clustering)

  • 박창범;이동환;이성환
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2003년도 가을 학술발표논문집 Vol.30 No.2 (2)
    • /
    • pp.784-786
    • /
    • 2003
  • 본 논문에서는 유전자 발현 데이터를 분석하는데 있어서 자기 조직화 지도와 계층적 군집화 기법을 상호 보완적으로 사용하여 사용자가 보다 직관적으로 군집화 결과를 해석할 수 있는 방법을 제안한다. 제안된 방법을 사용하면 빠른 처리 속도로 대용량 데이터 처리에 적합한 자기 조직화 지도의 장점을 살릴 수 있으며 계층적 군집화의 장점인 가시화 기능을 이용하여 자기 조직화 지도의 단점인 군집 경계에 대한 불명확성을 해소하여 군집화 결과를 사용자가 쉽게 이해하고 직관적으로 해석할 수 있도록 도와준다. 본 논문에서 제안된 방법의 효용성을 검증하기 위해 세 종류의 데이터를 사용하여 실험을 수행한 결과 제안된 방법이 기존 방법에 비해 더 나은 성능을 보이는 것을 확인할 수 있었다.

  • PDF

흰개미 군집 알고리즘을 이용한 유사 블로그 추천 시스템에 관한 연구 (A Study of Similar Blog Recommendation System Using Termite Colony Algorithm)

  • 정기성;조이석;이말례
    • 한국인터넷방송통신학회논문지
    • /
    • 제13권1호
    • /
    • pp.83-88
    • /
    • 2013
  • 본 연구의 목적은 유사 블로그 추천 시스템을 통해서 특정 주제의 유사도에 따라 주제를 찾아 주는 것이다. 유사 추천 시스템을 실현하기 위해서는 대규모 데이터 집합에서 유사항목을 가진 그룹을 찾을 수 있도록 군집해야 한다. 군집화(clustering) 기법은 군집하고자 하는 목적에 따라 적합한 기법과 군집수가 결정되어야 한다. 군집기법으로는 가장 많이 사용되는 K-means 알고리즘을 사용 하였고 추천 알고리즘은 흰개미 군집 알고리즘을 사용하였다. 흰개미 습성 모델을 이용한 군집화 기법은 K-means 알고리즘이 갖고 있는 적절한 군집 갯수 문제점을 해결하고, 군집화 시간을 단축하며, 군집을 위한 군집 평균 이동횟수를 개선한다.

다계층 밀도기반 군집화 기법 (Multi-hierarchical Density-based Clustering Method)

  • 신동문;정석호;이경민;이동규;손교용;류근호
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2009년도 추계학술발표대회
    • /
    • pp.797-798
    • /
    • 2009
  • 군집화는 대용량의 데이터로부터 유용한 정보를 추출하는 데에 적합한 데이터마이닝 기법들 중 하나이다. 군집화 기법은 주어진 데이터그룹 내에서 사전정보 없이 의미있는 지식을 발견할 수 있으므로 큰 어려움이 없이 실제 응용분야에 적용할 수 있다. 또한, 대용량 데이터를 다룰 때에 개별적인 데이터에 대한 접근 횟수를 줄이고, 알고리즘이 다루어야 할 데이터 구조의 크기를 줄일 수 있다. 본 논문에서는 밀도-기반 군집화 기법을 기반으로 하는 새로운 군집화 기법을 제안한다. 우리가 제안하는 군집화 기법은 반복적인 군집화 과정을 통하여 군집 내 주변 잡음을 제거하고 더 세밀하게 집단을 세분화하는 것이 가능하다. 또한, 군집을 표현하는 데에 계층구조로 나타내어 각 군집의 상관관계를 파악하는 데에 유리하다. 본 논문에서 제안하는 군집화 기법을 통하여 다양한 밀도를 가진 군집들을 효과적으로 분류할 수 있을 거라고 기대된다.

정규분포기반 두각 혼합모형의 순환적 적합을 이용한 군집분석에서의 변수선택 (Variable Selection in Clustering by Recursive Fit of Normal Distribution-based Salient Mixture Model)

  • 김승구
    • 응용통계연구
    • /
    • 제26권5호
    • /
    • pp.821-834
    • /
    • 2013
  • Law 등 (2004)은 군집분석에서 변수선택을 위해 정규분포기반 "두각 혼합모형(salient mixture model)"의 사용을 제안하였다. 본 논문에서는 이 모형의 적합 상의 문제점과 변수선택의 결함을 지적하고 그 대안을 제시한다. 모의자료와 실자료를 바탕으로 제안된 방법이 기존의 방법보다 유용함을 보였다.