• 제목/요약/키워드: Pattern clustering

검색결과 543건 처리시간 0.036초

우리나라 산불 발생의 원인별 공간적 특성 분석 (Cause-specific Spatial Point Pattern Analysis of Forest Fire in Korea)

  • 곽한빈;이우균;이시영;원명수;구교상;이병두;이명보
    • 한국산림과학회지
    • /
    • 제99권3호
    • /
    • pp.259-266
    • /
    • 2010
  • 우리나라에서 산불 발생 공간분포는 인간 활동과 큰 관련성이 있기 때문에, 지역별 군집형태의 강한 공간의존성을 갖는다. 본 연구에서는 공간의존성의 개념에 입각하여 점자료 분석법을 통한 산불발생의 공간분포패턴을 분석하였다. Ripley의 K 함수를 이용하여 산불 발생 원인별 공간분포 형태를 파악하였으며, Kernel 함수를 통해 산불발생의 공간적 집중도를 분석하였다. 그 결과 정도는 상이하지만 모든 원인의 산불이 임의(random) 분포가 아닌 군집화(clustered)되어 발생하는 특징이 있는 것으로 나타났다. 또한, 산불 발생의 군집성을 원인별로 크게 두 집단으로 나눌 수 있었다. 첫째는 전국적 발생 패턴을 가지는 원인으로 입산자 실화, 논밭두렁 소각과 같은 활동과 관련된 것이고 또 다른 하나는 국지적 군집성을 가지는 원인으로 담뱃불이나 어린이 불장난, 방화이다. 그 군집성의 범위는 30 km내외로 나타났으며, 그 범위 밖에서는 임의 분포하고 있었다. Kernel 함수에 의한 원인별 집중도 분석에서는 강한 군집도를 나타냈던 3가지 원인(담뱃불, 어린이 불장난, 방화)의 경우 대부분 인구밀도가 높은 수도권을 중심으로 발생하는 것을 확인할 수 있었다.

시간단위 전력사용량 시계열 패턴의 군집 및 분류분석 (Clustering and classification to characterize daily electricity demand)

  • 박다인;윤상후
    • Journal of the Korean Data and Information Science Society
    • /
    • 제28권2호
    • /
    • pp.395-406
    • /
    • 2017
  • 전력 공급 시스템의 효율적인 운영을 위해 전력수요예측은 필수적이다. 본 연구에서는 군집분석과 분류분석을 이용하여 일 단위 시간별 전력수요량 시계열 패턴의 유형을 살펴보고자 한다. 전력거래소에서 수집된 2008년 1월 1일부터 2012년 12월 31일까지의 일 단위 시간별 전력수요량 데이터를 추세성분, 계절성분, 오차 성분으로 구성된 시계열 자료로 변환하여 사용하였다. 추세성분을 제거한 시계열 자료의 패턴을 구분하기 위한 군집 분석방법은 k-평균 군집분석 (k-means), 가우시안혼합모델 혼합 모델 군집분석 (Gaussian mixture model), 함수적 군집분석 (functional clustering)을 고려하였다. 주성분분석을 통해 24시간 자료를 2개의 요인로 축소한 후 k-평균 군집분석과 가우시안 혼합 모델, 함수적 군집분석을 수행하였다. 군집분석 결과를 토대로 2008년부터 2011년까지 총 4년간 데이터를 4가지 분류분석방법인 의사결정나무, RF (random forest), Naive bayes, SVM (support vector machine)을 통해 훈련시켜 2012년 군집을 예측하였다. 분석 결과 가우시안 혼합 분포기반 군집분석과 RF를 이용한 군집예측 결과의 성능이 가장 우수하였다.

과거이력자료를 활용한 요일별 패턴분류 알고리즘 개발 (Development of a Daily Pattern Clustering Algorithm using Historical Profiles)

  • 조준한;김보성;김성호;강원의
    • 한국ITS학회 논문지
    • /
    • 제10권4호
    • /
    • pp.11-23
    • /
    • 2011
  • 이 연구는 시계열 과거 속도자료를 활용하여 유사한 패턴 변화를 보이는 요일을 그룹핑하는 알고리즘을 개발하였다. 알고리즘에 적용할 이력자료 시간적 범위는 과거 2개월치 자료를 사용하였으며, 공간적 범위는 도시부도로를 대상으로 하였다. 이 연구에서 제안한 알고리즘은 크게 거시적인 관점과 미시적인 관점으로 나누어 요일별 패턴분류를 수행하였다. 먼저 거시적인 관점에서 요일별 첨두/비첨두 시간대와 요일별 속도변화가 크게 나타나는 중점시간대를 도출하였다. 미시적인 관점에서는 거시적인 관점에서 도출된 중점시간대를 대상으로 요일간 속도 차이를 개별(요일별) 혹은 그룹간의 유사성을 비교하여 단계적으로 분류하는 2단계 속도 군집 알고리즘(Two-step speed clustering algorithm, TSC)을 개발하였다. TSC 알고리즘은 중점시간대의 매 가공주기(또는 제공주기)마다 요일별(월~일) 속도차이를 토대로 그룹핑하는 1단계와 1단계에서 도출된 각 그룹의 평균과 요일간의 속도차이를 비교하여 재할당하는 2단계로 구성된다. TSC 알고리즘은 실제 지점검지기에서 수집된 시간대별 시계열 자료를 토대로 개발 및 성능평가가 수행되었다. 따라서, 교통정보센터에서 수집 가공 저장되는 과거이력자료를 이용하여 요일별 패턴분류 수행이 가능하고 알고리즘 구현도 실제 가공체계에 적용하기 용이하다. 이 연구에서 제안한 알고리즘은 통행패턴기반 정보가공 알고리즘 개발, 요일별 반복정체구간 운영관리, TOD에 근거한 신호운영 개선 등 교통운영 및 관리 전반에 적용이 가능하다.

EXTRACTING INSIGHTS OF CLASSIFICATION FOR TURING PATTERN WITH FEATURE ENGINEERING

  • OH, SEOYOUNG;LEE, SEUNGGYU
    • Journal of the Korean Society for Industrial and Applied Mathematics
    • /
    • 제24권3호
    • /
    • pp.321-330
    • /
    • 2020
  • Data classification and clustering is one of the most common applications of the machine learning. In this paper, we aim to provide the insight of the classification for Turing pattern image, which has high nonlinearity, with feature engineering using the machine learning without a multi-layered algorithm. For a given image data X whose fixel values are defined in [-1, 1], X - X3 and ∇X would be more meaningful feature than X to represent the interface and bulk region for a complex pattern image data. Therefore, we use X - X3 and ∇X in the neural network and clustering algorithm to classification. The results validate the feasibility of the proposed approach.

An Adaption of Pattern Sequence-based Electricity Load Forecasting with Match Filtering

  • Chu, Fazheng;Jung, Sung-Hwan
    • 한국멀티미디어학회논문지
    • /
    • 제20권5호
    • /
    • pp.800-807
    • /
    • 2017
  • The Pattern Sequence-based Forecasting (PSF) is an approach to forecast the behavior of time series based on similar pattern sequences. The innovation of PSF method is to convert the load time series into a label sequence by clustering technique in order to lighten computational burden. However, it brings about a new problem in determining the number of clusters and it is subject to insufficient similar days occasionally. In this paper we proposed an adaption of the PSF method, which introduces a new clustering index to determine the number of clusters and imposes a threshold to solve the problem caused by insufficient similar days. Our experiments showed that the proposed method reduced the mean absolute percentage error (MAPE) about 15%, compared to the PSF method.

차분 진화 알고리즘을 이용한 Fuzzy Prototype Classifier 최적화 (The Optimization of Fuzzy Prototype Classifier by using Differential Evolutionary Algorithm)

  • 안태천;노석범;김용수
    • 한국지능시스템학회논문지
    • /
    • 제24권2호
    • /
    • pp.161-165
    • /
    • 2014
  • 본 논문에서는 입력 공간의 부분 영역의 특성을 기술하기 위하여 각 부분 영역을 대표하는 prototype을 정의하고 정의된 Prototype 에 가중치를 적용하여 각 부분 영역이 각 클래스의 경계면에 미치는 영향을 차등화 하는 Fuzzy Prototype 분류기를 제안 한다. 제안된 패턴 분류기의 Prototype은 퍼지 클러스터링 알고리즘인 Fuzzy C-Means Clustering 알고리즘을 사용하여 결정한다. 또한, 각 부분 영역의 가중치를 결정하기 위하여 유전자 알고리즘에서 파생된 차분 진화 알고리즘을 적용하여 각각의 퍼지 규칙의 가중치를 최적화 한다. 또한 퍼지 규칙 기반 시스템 기반 패턴 분류기의 경우 각각의 퍼지 규칙의 후반부 구조인 다항식의 계수를 추정하기 위하여 Linear Discriminant Analysis를 사용한다. 마지막으로, 본 논문에서 제안한 패턴 분류기의 패턴 분류 특성 및 성능을 평가하기위하여 기계 학습 데이터를 사용한다.

순차패턴에 기반한 XML 문서 클러스터링 (XML Document Clustering Based on Sequential Pattern)

  • 황정희;류근호
    • 정보처리학회논문지D
    • /
    • 제10D권7호
    • /
    • pp.1093-1102
    • /
    • 2003
  • 인터넷의 사용 증가로 정보의 양은 기하급수적으로 증가하고 있으며 웹 데이터의 표준인 XML의 데이터 표현의 유연성으로 인해 EDMS(Electronic Document Management System), ebXML(e-business extensible Markup Language) 등 웹 기반의 전자문서론 이용하는 시스템들은 XML를 문서 교환 방식 및 표준 문서 형식으로 도입하고 있는 실정이다. 그러므로 점차 확산되어 가고 있는 XML 문서에 대한 효율적인 문서의 관리와 검색을 위한 연구가 필요하다. 이 논문에서는 다중 문서간의 구조적 유사성을 분류하기 위하여 엘리먼트의 순서적 의미를 갖는 XML 문서를 대상으로 순차패턴을 이용하여 문서의 특성을 반영하는 대표구조를 추출하고 추출된 구조를 기반으로 유사 구조 문서를 클러스터링하는 방법을 제시한다. 이 논문의 제안 알고리즘은 클러스터의 응집도와 클러스터간의 유사도를 함께 고려하는 비용계산 방식을 이용하므로써 클러스터링의 정확도를 높일 수 있는 효과를 얻을 수 있다.

패턴 clustering에 의한 캠코더 퍼지 제어기의 rule 획득 (A Pattern Clustering Approach to the Rule Acquisition for the Fuzzy controller of a CAMCODER)

  • 장경식;정진영;신충식;신중인;방교윤;김재희
    • 전자공학회논문지B
    • /
    • 제30B권1호
    • /
    • pp.72-78
    • /
    • 1993
  • While the rules for an expert system are obtained through the interviewing with domain experts or by designer's own experience, these are not adequate for fuzzy controllers dealing quantitative control values. In this paper, by considering a state of the controlled system as a pattern, we propose a method to obtain the control rules by a statistical method. Namely, we propose a method to obtain the control rules by a statistical method. Namely, we propose an rule acquisition method that is objective, mechanical, and inductive inference using a cluster-seeking algorithm, or K-means clustering algorithm. To validate this study, we show an example of an IRIS control in a CAMCODER and analyse the rules acquired from 98 sample patterns consisting of 45 features.

  • PDF

Linear Discriminant Clustering in Pattern Recognition

  • Sun, Zhaojia;Choi, Mi-Seon;Kim, Young-Kuk
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 2008년도 하계종합학술대회
    • /
    • pp.717-718
    • /
    • 2008
  • Fisher Linear Discriminant(FLD) is a sample and intuitive linear feature extraction method in pattern recognition. But in some special cases, such as un-separable case, one class data dispersed into several clustering case, FLD doesn't work well. In this paper, a new discriminant named K-means Fisher Linear Discriminant, which combines FLD with K-means clustering is proposed. It could deal with this case efficiently, not only possess FLD's global-view merit, but also K-means' local-view property. Finally, the simulation results also demonstrate its advantage against K-means and FLD individually.

  • PDF

Use of Factor Analyzer Normal Mixture Model with Mean Pattern Modeling on Clustering Genes

  • Kim Seung-Gu
    • Communications for Statistical Applications and Methods
    • /
    • 제13권1호
    • /
    • pp.113-123
    • /
    • 2006
  • Normal mixture model(NMM) frequently used to cluster genes on microarray gene expression data. In this paper some of component means of NMM are modelled by a linear regression model so that its design matrix presents the pattern between sample classes in microarray matrix. This modelling for the component means by given design matrices certainly has an advantage that we can lead the clusters that are previously designed. However, it suffers from 'overfitting' problem because in practice genes often are highly dimensional. This problem also arises when the NMM restricted by the linear model for component-means is fitted. To cope with this problem, in this paper, the use of the factor analyzer NMM restricted by linear model is proposed to cluster genes. Also several design matrices which are useful for clustering genes are provided.