• 제목/요약/키워드: 다변량 데이터 분석

검색결과 174건 처리시간 0.048초

단변량 및 다변량 함수 데이터에 대한 분산분석의 활용 (Application of functional ANOVA and functional MANOVA)

  • 김미정
    • 응용통계연구
    • /
    • 제35권5호
    • /
    • pp.579-591
    • /
    • 2022
  • 함수 데이터는 다양한 분야에서 수집되고 있으며, 집단 간의 함수 데이터를 비교해야하는 경우가 종종 발생한다. 이럴 경우 점별 분산분석 방법을 이용하여 설명하기에는 무리가 있으며, 통합된 결과를 제시할 필요가 있다. 이에 대한 다양한 연구가 제안되었으며, 최근에 R 패키지 fdANOVA로 구현되었다. 이 논문에서 우선 분산분석 및 다변량 분산분석을 설명하고, 최근에 제안된 다양한 단변량 및 다변량 함수 데이터 분산분석을 설명하고자 한다. 또한 R 패키지 fdANOVA의 사용 방법을 설명하고, 이 패키지를 이용하여 서울과 부산 지역의 주별 기온을 단변량 함수 데이터 분산분석을 통해 비교하고, 손글씨 이미지를 다변량 함수 데이터로 변환하여 다변량 함수 데이터 분산분석을 이용하여 비교하고자 한다.

베이지안 다변량 선형 모형을 이용한 청소년 패널 데이터 분석 (KCYP data analysis using Bayesian multivariate linear model)

  • 이인선;이근백
    • 응용통계연구
    • /
    • 제35권6호
    • /
    • pp.703-724
    • /
    • 2022
  • 다변량 경시적 자료 분석은 반복 측정된 자료에 존재하는 상관관계를 올바르게 추정하면서 자료를 분석해야 한다. 경시적 연구에서는 다변량 경시적 자료가 주로 생성되지만, 기존 통계적 모형은 대부분 단변량으로 분석되어 다변량 경시적 자료에 존재하는 복잡한 상관관계를 제대로 설명하지 못하게 된다. 따라서 본 논문에서는 복잡한 상관관계를 설명하기 위해 공분산 행렬을 모형화하는 다양한 방법에 대해 고찰한다. 그 중 수정된 콜레스키 분해, 수정된 콜레스키 블록분해와 초구분해를 살펴본다. 그리고 일반화 자기회귀모수 행렬이 가지는 희박성 문제를 해결하기 위해 베이지안 방법을 이용하여 청소년 패널 데이터를 분석한다. 청소년 패널 데이터는 다변량 경시적 자료이며, 반응 변수로는 학교 적응도, 학업 성취도, 휴대전화 의존도를 고려한다. 자기 상관 구조와 혁신 표준 편차 구조를 달리 가정하여 여러 모형을 비교한다. 가장 적합한 모형에 대해 학교 적응도와 학업 성취도에 대해 모든 설명 변수가 유의미하며, 휴대전화 의존도가 반응 변수일 때 사교육 시간을 제외한 모든 설명 변수가 유의미한 것으로 나타난다.

범주형 다변량 데이터의 상관관계분석에 관한 기초적 연구(II) (A Study on the Correlation Analysis about Categorical Multivariate Data(II))

  • 노형진
    • 한국컴퓨터정보학회논문지
    • /
    • 제5권3호
    • /
    • pp.142-150
    • /
    • 2000
  • 범주형 다변량 데이터의 상관관계분석을 위하여 개발한 수량화이론 III류나 대응분석 등의 기법은 다차원 공간상에서 점간의 거리로써 두 요소집합간의 관련성을 설명하는 데 있어서 매우 유용하다. 본 연구에서는 상관관계분석을 위한 대응분석의 특성을 수량화이론 III류와 비교하여 설명하고 그 유용성을 논하기로 한다. 이 기법은 사회과학 분야의 상관관계분석에 널리 활용될 것으로 기대된다.

  • PDF

다변량 고빈도 금융시계열의 변동성 분석 (Multivariate volatility for high-frequency financial series)

  • 이근주;황선영
    • 응용통계연구
    • /
    • 제30권1호
    • /
    • pp.169-180
    • /
    • 2017
  • 본 논문은 다변량 변동성을 다루고 있다. 최근 들어 활발하게 연구가 되고 있는 고빈도(high frequency)자료에 기초한 변동성 측정방법인 실현변동성을 계산하고 기존의 다변량 GARCH 모형과 비교분석하였다. 정준상관분석과 VaR분석을 이용하여 실현변동성과 다양한 다변량 GARCH 모형을 비교하였으며 최근 6년 동안의 삼성전자/현대차 거래 가격 고빈도 데이터를 이용하여 실증분석을 실시하였다.

지진유발 변형률 데이터의 분포 특성 분석을 위한 응용통계기법의 적용 (Application of Statistical Analysis to Analyze the Spatial Distribution of Earthquake-induced Strain Data)

  • 김보람;채병곤;김용제;서용석
    • 지질공학
    • /
    • 제23권4호
    • /
    • pp.353-361
    • /
    • 2013
  • 본 연구에서는 ${\bigcirc}{\bigcirc}$지역 토목용 계측기에서 측정된 지진유발 변형률 데이터의 분포 특성을 분석하기 위한 기법으로 응용통계기법에 대한 적용성을 평가하였다. 2011년 도호쿠 대지진과 같은 해에 발생한 규모 7.0 이상의 여진을 계측한 4방향의 변형률 데이터를 활용하였다. 데이터의 미세한 변동을 감지하기 위하여 단변량 분석기법인 x-MR 분석을 실시하였으며 분석결과 계측 데이터 간의 분산시점에 차이가 발생하는 것을 확인하였다. 이러한 분산시점의 차이를 해결하기 위하여 변형률 데이터 간의 상관성을 고려한 다변량 통계분석을 실시하였다. 다변량 분석기법 가운데 하나인 주성분 분석결과를 $T_2$과 Q-통계량 분석에 적용하여 신뢰구간 99.9%, 99.0%, 95.0%로 실시간 분석을 수행하였다. 분석결과 $T_2$과 Q-통계량 값이 신뢰구간 99.9%를 초과하는 시점은 x-MR 분석의 분산시점과 일치하거나 이른 시간으로 나타났다. 또한, 신뢰구간 95.0%와 99.0%를 초과하는 시점은 99.9%를 초과하는 시점 이전에 타점되어 지진발생 전에 이상 분포 발생을 예측할 수 있었다. 이러한 결과는 변형률 데이터의 비정상적인 분포 특성을 다변량 통계분석법으로 인지할 수 있다는 것을 의미한다. 따라서 다변량 통계분석은 변형률 데이터의 분포 특성을 분석하여 지진을 예지하는 방법으로 이용가능하다고 판단된다.

다변량 확률분포함수의 추정을 위한 MKDE-ebd 개발 (Development of MKDE-ebd for Estimation of Multivariate Probabilistic Distribution Functions)

  • 강영진;노유정;임오강
    • 한국전산구조공학회논문집
    • /
    • 제32권1호
    • /
    • pp.55-63
    • /
    • 2019
  • 공학문제에서 많은 확률 변수들은 상관성을 가지고 있고, 입력변수의 상관성은 기계시스템의 통계적 성능 분석 결과에 큰 영향을 미친다. 하지만, 상관 변수들은 결합분포함수를 모델링하기 어렵다는 이유로 종종 독립변수로 취급되거나 특정한 모수적 모델로 표현되는 경우가 많으며, 특히 데이터가 적은 경우 결합분포함수를 정확히 모델링하는데 더 큰 어려움이 있다. 본 연구에서 개발된 경계데이터를 이용한 다변량 커널밀도추정은 비선형성을 갖는 다양한 형태의 다변량 확률 분포 추정을 위해 개발되었다. 다변량 커널밀도추정은 주어진 데이터와 균등분포함수의 파라미터의 신뢰구간으로부터 생성된 경계데이터를 결합하여 데이터의 질과 수에 덜 민감하다. 따라서 제안된 방법은 보수적인 통계모델링과 신뢰성 해석 결과를 도출할 수 있으며, 통계시뮬레이션과 공학예제를 통해 그 성능을 검증하였다.

지역 군집화를 위한 CNN-GRU 기반 다변량 시계열 데이터의 특성 추출 (Feature Extraction of CNN-GRU based Multivariate Time Series Data for Regional Clustering)

  • 김진아;이지훈;최동욱;문남미
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2019년도 추계학술발표대회
    • /
    • pp.950-951
    • /
    • 2019
  • 시계열 데이터에 대한 군집화 관련 연구는 주로 통계 분석을 통해 이뤄지기 때문에 데이터가 갖는 특성을 완전히 반영하는 데 한계를 갖는다. 본 논문에서는 다변량 데이터에서의 군집화를 위하여 변수별로 시간에 따른 변화와 특징을 추출하기 위한 CNN-GRU(Convolutional Neural Network - Gated Recurrent Unit) 기반의 신경망 모델을 제안한다. CNN을 활용하여 변수별로 갖는 특성을 파악하고자 하였으며, GRU을 통해 전체 시간에 따른 소비 추세를 도출하고자 하였다. 지역별로 업종에 따라 사용된 2년 치의 실제 카드 데이터를 활용하였으며, 유사한 소비 추세를 보이는 지역을 군집화하는데 이를 적용하였다. 결과적으로, 다변량 시계열 데이터를 통해 전체적인 흐름을 반영하여 패턴화했다는 점에서 의의를 갖는다.

인공 신경망 회귀 모델을 활용한 인버터 기반 태양광 발전량 예측 알고리즘 (Inverter-Based Solar Power Prediction Algorithm Using Artificial Neural Network Regression Model)

  • 박건하;임수창;김종찬
    • 한국전자통신학회논문지
    • /
    • 제19권2호
    • /
    • pp.383-388
    • /
    • 2024
  • 본 논문은 전라남도에서 측정한 태양광 발전 데이터를 기반으로 발전량 예측값을 도출하기 위한 연구이다. 발전량 측정을 위해 인버터에서 직류, 교류, 환경데이터와 같은 다변량 변수를 측정하였고, 측정값의 안정성과 신뢰성 확보를 위한 전처리 작업을 수행하였다. 상관관계 분석은 부분자기상관함수(PACF: Partial Autocorrelation Function)을 활용하여 시계열 데이터에서 발전량과 상관성이 높은 데이터만을 예측을 위해 사용하였다. 태양광 발전량 예측을 위해 딥러닝 모델을 이용하여 발전량을 측정했고, 예측 정확도를 높이기 위해 각 다변량 변수의 상관관계 분석 결과를 이용하였다. 정제된 데이터를 활용한 학습은 기존 데이터를 그대로 사용했을 때 보다 안정되었고, 상관관계 분석 결과를 반영하여 다변량 변수 중 상관성이 높은 변수만을 활용하여 태양광 발전량 예측 알고리즘을 개선하였다.

다변량 관리도를 활용한 블로거 정서 변화 탐지 (Detection of the Change in Blogger Sentiment using Multivariate Control Charts)

  • 문정훈;이성임
    • 응용통계연구
    • /
    • 제26권6호
    • /
    • pp.903-913
    • /
    • 2013
  • 최근 소셜 네크워크 서비스의 발달로 인해 개인의 감정이나 의견을 표현하는 소셜 데이터들이 하루에도 수백만 건씩 생산되고 있다. 또한 소셜 데이터는 개인의 의견에 또 다른 생각을 더하는 등 정보의 생산과 소비가 누구나 가능해짐으로써 사회현상을 잘 반영해주는 도구로 성장하고 있다. 본 연구에서는 블로그에 올라온 부정적인 감성어들을 분석하여 블로거의 감성변화를 탐지하기 위해 다변량 관리도를 이용하고자 한다. 이를 위해 2008년 1월 1일부터 2009년 12월 31일 사이에 생성되었던 모든 블로그를 사용하였다. 품질 특성치가 다변량으로 주어지는 경우 호텔링의 $T^2$ 관리도가 널리 사용된다. 그러나 이 관리도는 품질 특성치들의 분포가 다변량 정규분포라는 가정을 하고 있어, 비정규 다변량 자료에 대한 관리도의 성능은 좋지 않다. 이에 본 논문에서는 Sun과 Tsung (2003)이 제안한 써포트 벡터머신에서 단일 집합 분류 기법 중 하나인 SVDD(support vector data description) 알고리즘과 이를 확장한 K-관리도를 소개하고, 실제 데이터 분석에 적용해 보았다.

다변량 데이터 분석을 위한 PCA 알고리즘 구현 (Performance of PCA Algorithm for Multivariate Data Analysis)

  • 김귀숙;손호선;류근호;이영성
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2013년도 추계학술발표대회
    • /
    • pp.1264-1266
    • /
    • 2013
  • 다변량 데이터 분석에 주로 사용되는 차원축소 기법 중 하나인 PCA 알고리즘을 직접 구현해보고 기존의 통계분석 프로그램과 그 결과를 비교분석 해보았다. UCI에서 제공하는 유방암 데이터를 이용하여 실험 해본 결과 두 프로그램 모두 같은 주성분을 얻고, Eigenvalue와 variance도 같은 값을 얻었다. 따라서 상용화된 통계패키지를 사용하지 않고도 PCA 알고리즘을 적용하여 차원축소 문제를 해결하고 데이터를 분석 할 수 있다.