• 제목/요약/키워드: clustering validity index

검색결과 24건 처리시간 0.028초

속성유사도에 따른 사회연결망 서브그룹의 군집유효성 (Clustering Validity of Social Network Subgroup Using Attribute Similarity)

  • 윤한성
    • 디지털산업정보학회논문지
    • /
    • 제17권1호
    • /
    • pp.75-84
    • /
    • 2021
  • For analyzing big data, the social network is increasingly being utilized through relational data, which means the connection characteristics between entities such as people and objects. When the relational data does not exist directly, a social network can be configured by calculating relational data such as attribute similarity from attribute data of entities and using it as links. In this paper, the composition method of the social network using the attribute similarity between entities as a connection relationship, and the clustering method using subgroups for the configured social network are suggested, and the clustering effectiveness of the clustering results is evaluated. The analysis results can vary depending on the type and characteristics of the data to be analyzed, the type of attribute similarity selected, and the criterion value. In addition, the clustering effectiveness may not be consistent depending on the its evaluation method. Therefore, selections and experiments are necessary for better analysis results. Since the analysis results may be different depending on the type and characteristics of the analysis target, options for clustering, etc., there is a limitation. In addition, for performance evaluation of clustering, a study is needed to compare the method of this paper with the conventional method such as k-means.

음양인 유형분류에 관한 연구 (설문지를 중심으로) (A Study on the Pattern Distribution of Yin-Yang Ren [음양인] (Used on Questionnaire))

  • 이상범;최경미;박영배
    • 대한한의학회지
    • /
    • 제25권1호
    • /
    • pp.1-20
    • /
    • 2004
  • Objectives : Based on the analysis of Yin-Yang[음양] characteristics and symptoms, each person is classified into Yin-Yang. Also the validity of the result is statistically analized. Methods : From Feb. to May. 2003, the data were collected through a questionnaire given to 690 patients. The questionnaire was composed of 34 items which were about personality, habit, sweat, response to coldness, thirst, bowel, urine, physical shape, and menstruation for women only. SD(Semantic Differential Technique) used for each item, each item is measured as a contrast of two opposite symptoms. Reliability analysis was used to select items and categories. Based on means of items in each category the Yin-Yang index was developed. The validity of Yin-Yang index was investigated using classification and clustering analysis. In statistical analysis, SPSS V10.0.7 PC was used. Results : The obtained results are summarized as follows: 1) We constructed Yin-Yang index based on the middle point of the sum of categorical means. Then we classified each person into Yin or Yang. 2) To investigate the validity of the distribution of personal Yin-Yang degree, the crosstabulation of results from clustering and classification was used. The hit ratio for classification was much higher than Maximum Chance Criterion($C_{max}$), and concurrence in crosstabulation was successful. Therefore we can infer that the distribution of Yin-Yang was valid. Conclusions : Based on Yin-Yang characteristics and symptoms, we was analyzed personal degree of Yin-Yang, and confirmed the validity of its distribution. Therefore this index can be used further for Bian-Zheng [변증] and classification of the constitution.

  • PDF

효모 마이크로어레이 유전자 발현 데이터에 대한 유전자 선별 및 군집분석 (Gene Screening and Clustering of Yeast Microarray Gene Expression Data)

  • 이경아;김태훈;김재희
    • 응용통계연구
    • /
    • 제24권6호
    • /
    • pp.1077-1094
    • /
    • 2011
  • 마이크로어레이 유전자 발현 데이터인 yeast cdc15에 대해 시계열 데이터의 특성을 반영한 푸리에 계수를 이용한 검정통계량과 FDR 다중비교법을 이용하여 차별화된 유전자를 선별한 후 선별된 유전자들에 대해 모형기반 군집방법, K-평균법, PAM, SOM, 계층적 Ward 군집방법과 Fuzzy 군집방법을 실시하였다. 군집방법에 따른 특성을 알아보고 군집화 결과와 내부유효성 측도로 연결성 측도, Dunn 지수와 실루엣 값을 살펴본다. 또한 GO분석을 통한 생물학적 의미도 파악해본다.

퍼지 클러스터링의 타당성 평가 기준 (A Cluster Validity Index for Fuzzy Clustering)

  • 권순학
    • 한국지능시스템학회:학술대회논문집
    • /
    • 한국퍼지및지능시스템학회 1998년도 추계학술대회 학술발표 논문집
    • /
    • pp.83-89
    • /
    • 1998
  • 본 논문에서는, 퍼지 클러스터의 수가 증가함에 따라 나타나는 퍼지 클러스터링 타당성 평가 기준의 단조 감소 현상을 억제하는 새로운 퍼지 클러스터링 타당성 평가 기준을 제시한다. 또한, 제시된 평가 기준의 성질을 조사하고 기존의 퍼지 클러스터링 타당성 평가 기준과의 차이점에 대하여 논한다. 마지막으로, 퍼지 크러스터링에 자주 인용되는 몇 가지 전형적인 자료에 대한 모의 실험을 통하여 제시된 평가 기준의 효용성을 보인다.

  • PDF

고차원 (유전자 발현) 자료에 대한 군집 타당성분석 기법의 성능 비교 (Comparison of the Cluster Validation Methods for High-dimensional (Gene Expression) Data)

  • 정윤경;백장선
    • 응용통계연구
    • /
    • 제20권1호
    • /
    • pp.167-181
    • /
    • 2007
  • 유전자 발현 자료(gene expression data)는 전형적인 고차원 자료이며, 이를 분석하기 위한 여러 가지 군집 알고리즘(clustering algorithm)과 군집 결과들을 검증하는 군집타당성분석 기법(cluster validation technique)이 제안되고 있지만, 이들 군집 타당성을 분석하는 기법의 성능에 대한 비교, 평가는 매우 드물다. 본 논문에서는 저차원의 모의실험 자료와 실제 유전자 발현 자료에 대하여 군집 타당성분석 기법들의 성능을 비교하였으며, 그 결과 내적 측도에서는 Dunn 지수, Silhouette 지수 순으로 뛰어났고 외적 측도에서는 Jaccard 지수가 성능이 가장 우수한 것으로 평가되었다.

자기조직화지도에서 연결강도에 기반한 새로운 군집타당성지수 (A new cluster validity index based on connectivity in self-organizing map)

  • 김상민;김재직
    • 응용통계연구
    • /
    • 제33권5호
    • /
    • pp.591-601
    • /
    • 2020
  • 자기조직화지도는 고차원의 원자료를 노드들로 이루어진 저차원의 공간으로 투영하는 비지도학습 방법이다. 이 방법은 고차원의 자료를 노드들을 사용하여 2 또는 3차원의 공간에서 시각화할 수 있고, 이를 통해 자료의 특성을 탐색하는데 유용하다. 자료의 구조를 파악하기 위해 종종 노드들에 대한 군집분석을 시도하는데, 군집분석의 중요한 문제중 하나는 군집의 개수를 결정하는 것이다. 이 문제를 해결하기 위해 다양한 군집타당성지수들이 지금까지 개발되어 왔고, 이러한 지수들은 자기조직화지도의 노드들의 군집분석에 직접적으로 적용될 수 있다. 그러나, 자기조직화 지도가 원자료의 위상적 특성을 저차원 공간에 반영할 수 있다는 특징을 갖는데 반해, 이러한 일반적인 지수들은 이를 고려하지 않는 문제가 있다. 이에 본 연구에서는 원자료의 위상적 특성을 고려한 노드들 사이의 연결강도를 기반으로 하는 군집타당성지수를 제안한다. 이 새로운 군집타당성지수의 성능은 모의실험을 통해 기존의 군집타당성지수들과의 비교되고 검증된다.

신경망을 사용한 사상체질 진단검사 개발 연구 (Development of Sasang Type Diagnostic Test with Neural Network)

  • 채한;황상문;엄일규;김병철;김영인;김병주;권영규
    • 동의생리병리학회지
    • /
    • 제23권4호
    • /
    • pp.765-771
    • /
    • 2009
  • The medical informatics for clustering Sasang types with collected clinical data is important for the personalized medicine, but it has not been thoroughly studied yet. The purpose of this study was to examine the usefulness of neural network data mining algorithm for traditional Korean medicine. We used Kohonen neural network, the Self-Organizing Map (SOM), for the analysis of biomedical information following data pre-processing and calculated the validity index as percentage correctly predicted and type-specific sensitivity. We can extract 12 data fields from 30 after data pre-processing with correlation analysis and latent functional relationship analysis. The profile of Myers-Briggs Type Inidcator and Bio-Impedance Analysis data which are clustered with SOM was similar to that of original measurements. The percentage correctly predicted was 56%, and sensitivity for So-Yang, Tae-Eum and So-Eum type were 56%, 48%, and 61%, respectively. This study showed that the neural network algorithm for clustering Sasang types based on clinical data is useful for the sasang type diagnostic test itself. We discussed the importance of data pre-processing and clustering algorithm for the validity of medical devices in traditional Korean medicine.

유전자 발현 자료를 이용한 군집 타당성분석 기법 비교 (Comparison of the Cluster Validation Techniques using Gene Expression Data)

  • 정윤경;백장선
    • 한국데이터정보과학회:학술대회논문집
    • /
    • 한국데이터정보과학회 2006년도 PROCEEDINGS OF JOINT CONFERENCEOF KDISS AND KDAS
    • /
    • pp.63-76
    • /
    • 2006
  • 유전자 발현 자료(gene expression data)를 분석하기 위한 여러 가지 군집 알고리즘(clustering algorithm)과 군집 결과들을 검증하는 척도, 즉 군집 타당성분석 기법(cluster validation technique)이 제안되고 있지만, 이틀 군집 타당성을 분석하는 기법들에 대한 성능의 비교 평가는 매우 드물다. 본 논문에서는 모의 생성 자료로 몇 가지 특정 상황을 연출하여 군집 타당성 분석 기법들을 비교해 보고, 실제 유전자 발현 자료 두 가지에 대해서도 이들 기법의 성능을 비교 평가해 보았다.

  • PDF

Unbounded Johnson 분포를 이용한 GARCH 수익률 모형의 적용 (GARCH Model with Conditional Return Distribution of Unbounded Johnson)

  • 정승현;오정준;김성곤
    • 응용통계연구
    • /
    • 제25권1호
    • /
    • pp.29-43
    • /
    • 2012
  • 주식, 환율 등과 같은 금융자료의 수익률의 분포는 정규분포에 비해 꼬리가 두껍고, 좌우 비대칭성을 보인다. 조건부수익률이 정규분포를 따른다고 가정한 GARCH 모형을 이용하여 VaR을 추정하였을 때, 이러한 비정규성 때문에 적절한 추정이 이루어지지 않고, VaR을 초과하는 손실의 발생과정에 군집(clustering)현상이 발생하는 문제점이 있다. 이러한 문제를 해결하기 위해, 본 논문에서는 조건부수익률의 분포로 unbounded Johnson 분포를 이용한 GARCH 모형을 이용하여 VaR을 추정한다. 또한, 조건부수익률이 각각 정규분포, Student-t 분포를 따르는 GARCH 모형의 경우와 비교하였다. 초과손실 발생과정 자료를 이용하여 실패율검정과 군집성검정을 통해 조건부수익률 분포로 unbounded-Johnson 분포를 사용하는 방법의 타당성을 살펴보았다. Unbounded Johnson 분포가 조건부수익률 분포로 주어지는 GARCH 모형의 경우는 과소, 과대추정을 하지 않고, 군집현상 또한 발생하지 않아 적절한 추정을 하고 있음을 확인하였다.

군집분석 비교 및 한우 관능평가데이터 군집화 (A Comparison of Cluster Analyses and Clustering of Sensory Data on Hanwoo Bulls)

  • 김재희;고윤실
    • 응용통계연구
    • /
    • 제22권4호
    • /
    • pp.745-758
    • /
    • 2009
  • 자발적인 군집을 유도하는 다변량 통계기법으로 널리 사용되는 군집분석은 데이터에 기반한 탐색적 방법으로 쓰이며 군집원칙에 따라 여러 가지 방법이 제안되어 왔다. 또한 군집화된 결과에 대하여 유효성을 측정하는 측도도 다양한방법이 개발되었다. 본 연구에서는 계층적 군집분석 방법으로 최장연결법과 Ward의 방법, 비계층적 군집분석 방법으로 K-평균법 그리고 확률분포정보를 활용한 모형기반 군집분석방법을 이용하여 모의실험으로 군집분석을 실시하고 군집유효성 측도로는 연결성, Dunn 지수, 실루엣을 구하여 각 군집방법에 대해 유효성을 비교한다. 또한, 한우 관능평가 데이터에 군집분석을 적용하여 최적의 군집 상황을 구하고자 한다.