• 제목/요약/키워드: Software Clustering

검색결과 316건 처리시간 0.024초

스킵연결이 적용된 오토인코더 모델의 클러스터링 성능 분석 (Clustering Performance Analysis of Autoencoder with Skip Connection)

  • 조인수;강윤희;최동빈;박용범
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제9권12호
    • /
    • pp.403-410
    • /
    • 2020
  • 오토인코더의 데이터 복원(Output result) 기능을 이용한 노이즈 제거 및 초해상도와 같은 연구가 진행되는 가운데 오토인코더의 차원 축소 기능을 이용한 클러스터링의 성능 향상에 대한 연구도 활발히 진행되고 있다. 오토인코더를 이용한 클러스터링 기능과 데이터 복원 기능은 모두 동일한 학습을 통해 성능을 향상시킨다는 공통점이 있다. 본 논문은 이런 특징을 토대로, 데이터 복원 성능이 뛰어나도록 설계된 오토인코더 모델이 클러스터링 성능 또한 뛰어난지 알아보기 위한 실험을 진행했다. 데이터 복원 성능이 뛰어난 오토인코더를 설계하기 위해서 스킵연결(Skip connection) 기법을 사용했다. 스킵연결 기법은 기울기 소실(Vanishing gradient)현상을 해소해주고 모델의 학습 효율을 높인다는 장점을 가지고 있을 뿐만 아니라, 데이터 복원 시 손실된 정보를 보완해 줌으로써 데이터 복원 성능을 높이는 효과도 가지고 있다. 스킵연결이 적용된 오토인코더 모델과 적용되지 않은 모델의 데이터 복원 성능과 클러스터링 성능을 그래프와 시각적 추출물을 통해 결과를 비교해 보니, 데이터 복원 성능은 올랐지만 클러스터링 성능은 떨어지는 결과를 확인했다. 이 결과는 오토인코더와 같은 신경망 모델이 출력된 결과 성능이 좋다고 해서 각 레이어들이 데이터의 특징을 모두 잘 학습했다고 확신할 수 없음을 알려준다. 마지막으로 클러스터링의 성능을 좌우하는 잠재변수(latent code)와 스킵연결의 관계를 분석하여 실험 결과의 원인에 대해 파악하였고, 파악한 결과를 통해 잠재변수와 스킵연결의 특징정보를 이용해 클러스터링의 성능저하 현상을 보완할 수 있다는 사실을 보였다. 이 연구는 한자 유니코드 문제를 클러스터링 기법을 이용해 해결하고자 클러스터링 성능 향상을 위한 선행연구이다.

퍼지 클러스터링 기반의 국소평가 유전자 알고리즘 (Partially Evaluated Genetic Algorithm based on Fuzzy Clustering)

  • 유시호;조성배
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제31권9호
    • /
    • pp.1246-1257
    • /
    • 2004
  • 유전자 알고리즘은 원하는 최적해를 찾기 위해서 개체 집단의 크기를 가능한 크게 유지하여야 한다. 하지만 실제 문제에서 개체의 적합도를 평가하는 것이 어려운 경우가 많기 때문에 큰 집단의 모든 개체에 대하여 적합도를 평가하는 것은 많은 시간과 비용을 요구한다. 이에 본 논문에서는 집단의 크기를 크게 유지하되 클러스터링에 의해 대표 개체만을 평가함으로써 효율을 높이는 퍼지 글러스터링 기반의 국소 평가 유전자 알고리즘을 제안한다. 나머지 개체들은 대표 개체로부터 간접적으로 적합도를 분배받는다. 다수의 집단에 소속되는 개체들의 경우, 하드 클러스터링 방법으로는 정확한 적합도 분배를 하기 어렵기 때문에 퍼지 c-means 알고리즘을 사용하였고, 클러스터 결과인 퍼지 소속 행렬에 의해 적합도를 배분하였다. 9개의 벤치마크 적합도 함수에 대하여 6가지 하드 클러스터링 알고리즘을 적용한 유클리디안 거리와 피어슨 상관계수에 의한 적합도 배분 방법과 본 논문에서 제안하는 방법을 비교 실천한 결과, 제안한 방법의 우수한 성능을 확인할 수 있었다.

점증적으로 증가하는 타원형 군집화 : 피부색 영역 검출에의 적용 (Elliptical Clustering with Incremental Growth and its Application to Skin Color Region Segmentation)

  • 이경미
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제31권9호
    • /
    • pp.1161-1170
    • /
    • 2004
  • 본 논문에서는 군집화 알고리즘을 사용하여 피부색 영역을 분할하는 방법을 제안한다. 기존의 군집화 알고리즘들의 대부분은 주로 구형의 군집을 검출하고, 배치형으로 수행되며, 군집의 개수를 미리정해야 한다는 문제점을 가지고 있다. 본 논문에서는 대표적인 타원형 군집화 알고리즘인 EM 알고리즘을 변형하여, 온라인으로 학습가능하며, 군집의 개수를 자동적으로 찾아낼 수 있는 EAM 알고리즘을 사용하였다. EAM 알고리즘외 유효성은 피부색 영역 분할에 대해 증명되었다. 실험결과는 군집의 개수가 미리 주어지지 않더라도, EAM 알고리즘은 주어진 영상에 대해 자동적으로 옳은 군집의 개수를 찾아냈고, EM 알고리즘과 비교하여 더 좋은 분할 결과를 보여주고 있다. 영역에 대한 조건부 확률을 이용하여 성공적인 피부색 영역의 탐지 및 분할 결과를 얻었다. 또한 사람이 포함된 영상을 분류하는 문제에도 적용하여 좋은 분류 결과를 얻었다.

Stiefel 다양체에서 곱셈의 업데이트를 이용한 비음수 행렬의 직교 분해 (Orthogonal Nonnegative Matrix Factorization: Multiplicative Updates on Stiefel Manifolds)

  • 유지호;최승진
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제36권5호
    • /
    • pp.347-352
    • /
    • 2009
  • 주어진 비음수 데이터를 두 개의 비음수 행렬의 곱의 형태로 표현하는 비음수 행렬 분해(Nonnegative Matrix Factorization)는 비음수 데이터의 다변량 분석에서 폭넓게 사용되고 있는 방법이다. 비음수 행렬 분해는 집단화(Clustering), 특히 문서의 집단화에서 유용하게 쓰일 수 있다. 본 논문에서는 주어진 문서들로부터 구성된 단어-문서 행렬을 두 개의 비음수 행렬의 곱으로 분해할 때, 그 중 하나의 행렬에 직교 제한을 주는 비음수 행렬의 직교 분해(Orthogonal Nonnegative Matrix Factorization) 방법을 다룬다. 현존하는 비음수 행렬의 직교 분해 방법은 직교 제한과 관련된 항을 더해주는 방식을 사용하지만, 여기서는 Stiefel 다양체 위에서의 실제 기울기를 직접 구하여 곱셈의 업데이트 알고리즘을 유도하였다. 다양한 문서 데이터에 대한 실험을 통해 새롭게 유도된 비음수 행렬의 직교 분해 방법이 기존의 비음수 행렬 분해나 기존의 비음수 행렬의 직교 분해보다 문서 집단화에서 우수한 성능을 나타냄을 보였다.

문장구조 유사도와 단어 유사도를 이용한 클러스터링 기반의 통계기계번역 (Clustering-based Statistical Machine Translation Using Syntactic Structure and Word Similarity)

  • 김한경;나휘동;이금희;이종혁
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제37권4호
    • /
    • pp.297-304
    • /
    • 2010
  • 통계기계번역에서 번역성능의 향상을 위해서 문장의 유형이나 장르에 따라 클러스터링을 수행하여 도메인에 특화된 번역을 시도하는 방법이 있다. 그러나 기존의 연구 중 문장의 유형 정보와 장르에 따른 정보를 동시에 사용한 경우는 없었다. 본 논문에서는 각 문장의 문법적 구조 유사도에 따른 유형별분류 기법과, 단어 유사도 정보를 사용한 장르 구분법을 적용하여 기존의 두 기법을 통합하였다. 이렇게 분류된 말뭉치에서 추출한 도메인 특화 모델과 전체 말뭉치에서 추출된 모델에서 보간법(interpolation)을 사용하여 통계기계번역의 성능을 향상하였다. 문장구조 유사도와 단어 유사도의 계산 방법으로는 각각 커널과 코사인 유사도를 적용하였으며, 두 유사도를 적용하여 말뭉치를 분류하는 과정에서는 K-Means 알고리즘과 유사한 기계학습 기법을 사용하였다. 이를 일본어-영어의 특허문서에서 실험한 결과 최선의 경우 약 2.5%의 상대적인 성능 향상을 얻었다.

시공간 클러스터링 분석을 이용한 2010~2011 국내 발생 구제역 전파양상 (Temporospatial clustering analysis of foot-and-mouth disease transmission in South Korea, 2010~2011)

  • 배선학;신연경;김병한;박선일
    • 대한수의학회지
    • /
    • 제53권1호
    • /
    • pp.49-54
    • /
    • 2013
  • To investigate the transmission pattern of geographical area and temporal trends of the 2010~2011 foot-and-mouth disease (FMD) outbreaks in Korea, and to explore temporal intervals at which spatial clustering of FMD cases space-time analysis based on georeferenced database of 3,575 burial sites, from 30 November 2010 to 23 February 2011, was performed. The cases represent approximately 98.1% of all infected farms (n = 3,644) during the same period. Descriptive maps of spatial patterns of the outbreaks were generated by ArcGIS. Spatial Scan Statistics, using SaTScan software, was applied to investigate geographical clusters of FMD cases across the country. Overall, spatial heterogeneity was identified, and the transmission pattern was different by province. Cattle have more clusters in number but smaller in size, as compared to the swine population. In addition, spatiotemporal analysis and the comparison of clustering patterns between the first 7 days and days 8 to 14 of the outbreak revealed that the strongest spatial clustering was identified at the 7-day interval, although clustering over longer intervals (8~14 days) was also observed. We further discussed the importance of time period elapsed between FMD-suspected notice and the date of confirmation, and emphasized the necessity of region-specific and species-specific control measures.

상대인력 모델에 기반한 자연적 개체 군집화 알고리즘 (A Natural Clustering Algorithm based on the Relative Gravitation Model)

  • 김은주;고재필;변혜란;이일병
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제28권10호
    • /
    • pp.757-763
    • /
    • 2001
  • 본 논문에서는 상대인력 모델에 기반한 새로운 군집화 알고리즘, G-CLUS를 제안한다. 제한한 방법에서 모든 개체들은 초기에 동일한 질량을 가지고, 개체간의 인력에 의해 인력이 작용하는 방향으로 점진적으로 이동하게 되어, 초기 시작점 선택이나 군집의 개수를 미리 지정하지 않은 상태에서 자연스럽게 군집을 형성한다. 제안한 방법을 인력작용과정에서 군집의 수가 자연스럽게 결정되며, 한 개체가 받는 힘은 개체간의 인력을 합한 합력을 사용하기 때문에 이상치에 대한 민감성을 완화하였다. 본 알고리즘은 계산복잡도를 낮추기 위하여 큐브개념을 적용하여 O(nk)의 계산 복잡도를 유지하도록 하였다. 실험에서는 개체들의 움직임 특성, 군집화 모델에 따른 군집화 과정, 임의의 데이타 집합에 대한 군집화 결과를 보이고, 또한 타 군집화 알고리즘과 제안한 알고리즘 군집화 결화를 비교한다.

  • PDF

퍼지 클러스터링의 베이지안 검증 방법을 이용한 발아효모 세포주기 발현 데이타의 분석 (Analysis of Saccharomyces Cell Cycle Expression Data using Bayesian Validation of Fuzzy Clustering)

  • 유시호;원홍희;조성배
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제31권12호
    • /
    • pp.1591-1601
    • /
    • 2004
  • 유전자를 분석하는 방법 중 하나인 클러스터링은 비슷한 기능을 가진 유전자들을 집단화시켜서 유전자 집단의 기능을 분석하는데 이용되고 있다. 유전자들은 다양한 functional family에 속할 수 있기 때문에 각 유전자의 클러스터를 하나로 결정짓는 기존의 클러스터링 방법보다 퍼지 클러스터링 방법이 유전자 클러스터링에 더 적합하다. 본 논문에서는 피지 클러스터 결과를 효과적으로 검증할 수 있는 베이지안 검증 방법을 제안한다. 베이지안 검증 방법은 확률기반의 방법으로 주어진 데이타에 대해 가장 큰 사후확률을 가진 클러스터 분할을 선택한다. 먼저 본 논문에서 제안하는 베이지안 검증 방법과 기존의 대표적인 4가지 퍼지 클러스터 검증 방법들을 4가지 데이타에 대해 퍼지 c-means알고리즘을 대상으로 비교 평가한다. 그리고 발아효모 세포주기 발현 데이타를 클러스터링한 후, 제안하는 방법으로 그 결과를 검증하여 분석한다.

키워드 군집화를 이용한 연구 논문 분류에 관한 연구 (A Study on Research Paper Classification Using Keyword Clustering)

  • 이윤수;;이종혁;길준민
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제7권12호
    • /
    • pp.477-484
    • /
    • 2018
  • 컴퓨터 기술의 발전으로 힘입어 수많은 논문이 출판되고 있으며, 새로운 분야들도 계속 생기면서 사용자들은 방대한 논문들 중 자신이 필요로 하는 논문을 검색하거나 분류하기에 많은 어려움을 겪고 있다. 사용자의 이러한 어려움을 완화하기 위해 본 논문에서는 유사 내용의 논문을 분류하고 이를 군집화하는 방법을 제한한다. 본 논문의 제안 방법은 TF-IDF를 이용하여 각 논문의 초록으로부터 주요 주제어를 추출하고, K-평균 클러스터링 알고리즘을 이용하여 추출한 TF-IDF 값을 근거로 논문들을 유사 내용의 논문으로 군집화한다. 제안 방법의 실효성을 검증하기 위해 실제 데이터인 FGCS 저널의 논문 데이터를 사용하였으며, 엘보우 기법을 적용하여 클러스터 개수를 도출하고 실루엣 기법을 이용하여 클러스터링 성능을 검증하였다.

온라인 데이터 스트림에서의 동적 부분 공간 클러스터링 기법 (Dynamic Subspace Clustering for Online Data Streams)

  • 박남훈
    • 디지털융복합연구
    • /
    • 제20권2호
    • /
    • pp.217-223
    • /
    • 2022
  • 온라인 데이터 스트림에 대한 부분 공간 클러스터링은 데이터 공간 차원의 모든 부분 집합을 검사해야 하므로 많은 양의 메모리 자원을 필요로 한다. 유한한 메모리 공간에서 데이터 스트림에 대한 클러스터들의 지속적인 변화를 추적하기 위해 본 논문에서는 메모리 자원을 효과적으로 사용하는 격자기반 부분 공간 클러스터링 알고리즘을 제안한다. n차원 데이터 스트림이 주어지면 각 차원 데이터 공간에 있는 데이터 항목의 분포 정보를 격자셀 리스트에 의해 모니터링 된다. 첫번째 레벨의 격자셀 목록에서 데이터 항목의 빈도가 높아 단위 격자셀이 되면 해당 격자셀로부터 모든 가능한 부분 공간의 클러스터를 찾기 위해 다음 레벨의 격자셀 리스트를 자식 노드로 생성한다. 이와 같이 최대 다차원 n레벨의 격자셀 부분 공간 트리가 구성되고, k차원의 부분 공간 클러스터는 부분 공간 격자셀 트리의 k레벨에서 찾을 수 있다. 실험을 통해서 제안하는 방법이 기존 방법만큼 정확도를 유지하면서, 밀집 공간만 확장하여 컴퓨팅 자원을 보다 효율적으로 사용하는 것을 확인하였다.