• 제목/요약/키워드: 다변량 시계열 데이터

검색결과 38건 처리시간 0.024초

시계열 데이터 결측치 처리 기술 동향 (Technical Trends of Time-Series Data Imputation)

  • 김에덴;고석갑;손승철;이병탁
    • 전자통신동향분석
    • /
    • 제36권4호
    • /
    • pp.145-153
    • /
    • 2021
  • Data imputation is a crucial issue in data analysis because quality data are highly correlated with the performance of AI models. Particularly, it is difficult to collect quality time-series data for uncertain situations (for example, electricity blackout, delays for network conditions). Thus, it is necessary to research effective methods of time-series data imputation. Many studies on time-series data imputation can be divided into 5 parts, including statistical based, matrix-based, regression-based, deep learning (RNN and GAN) based methodologies. This study reviews and organizes these methodologies. Recently, deep learning-based imputation methods are developed and show excellent performance. However, it is associated to some computational problems that make it difficult to use in real-time system. Thus, the direction of future work is to develop low computational but high-performance imputation methods for application in the real field.

한강수계 전이함수 모형 적용 (Application of Transfer function Model in Han River Basin)

  • 강권수;허준행
    • 한국수자원학회:학술대회논문집
    • /
    • 한국수자원학회 2007년도 학술발표회 논문집
    • /
    • pp.1512-1516
    • /
    • 2007
  • 자신의 현재와 과거의 시계열데이터만을 가지고 시계열 모형을 구축하는 단변량 ARIMA모형 분석법과는 달리, 관심의 대상이 되는 출력시계열과 이와 관련있는 입력시계열의 동태적 특성을 나타내는 전이함수모형(Transfer function model)을 사용하여 소양강댐, 충주댐, 화천댐에 대한 월별 수문자료를 이용하여 유입량을 예측해 보고자 한다. 본 연구의 주요 목적은 다변량 추계학적 시스템의 해석을 위한 모형의 추정과 등정을 위한 과정을 개발하는데 있다. 일반적 추계학적 시스템 모형이 표현되며 그것으로부터 수문학적 시스템의 모형을 매우 적절하게 유도하기 위한 다중 입력-단일 출력 TF, TFN모형을 유도하는데 있다. 이 모형은 수문학적 시스템을 위한 경우에 있어 상관된 입력을 설명할 수 있도록 개발된다. 일반적으로 모형을 만드는 전략이 유도되며 실제유역시스템에 적용하여 검토된다. 한강수계 주요 다목적댐인 소양강댐, 충주댐, 화천댐의 수문자료를 가지고 추계학적 모형(TF, TFN)에 의한 결과와 실제유입량을 비교하여 검토하고자 한다.

  • PDF

경기도 평택지역과 서울 정동지역 지표오존농도의 시계열모형 연구

  • 이훈자
    • 한국데이터정보과학회:학술대회논문집
    • /
    • 한국데이터정보과학회 2006년도 추계 학술발표회 논문집
    • /
    • pp.29-36
    • /
    • 2006
  • 최근 유해성이 강한 지표오존농도가 대기환경의 주요한 문제로 부각되고 있다. 본 연구에서는 경기도 평택과 서울 정동지역의 오존농도를 설명 변수를 사용할 수 있는 다변량 시계열 모형인 ARE(자기회귀오차) 모형으로 분석하였다. ARE모형에서는 오존 전체자료를 사용한 전체모형과 오존농도가 41ppb 이상 되는 자료를 사용한 부분모형 두 가지 모형을 비교하였다. ARE의 오존농도 설명변수로는 오존농도와 연관 있는 8종류의 기상자료와 4종류의 대기오염자료를 고려하였다. 기상자료의 8가지 설명변수로 일 최고온도, 일사량, 풍속, 상대습도, 강수량, 이슬점온도, 수증기압, 운량 자료를 사용하였다. 대기오염자료의 4가지 설명변수로는 아황산가스(SO2), 이산화질소(NO2), 코발트(CO)와 프로메툼 10(PM10)를 사용하였다.

  • PDF

인공 신경망 회귀 모델을 활용한 인버터 기반 태양광 발전량 예측 알고리즘 (Inverter-Based Solar Power Prediction Algorithm Using Artificial Neural Network Regression Model)

  • 박건하;임수창;김종찬
    • 한국전자통신학회논문지
    • /
    • 제19권2호
    • /
    • pp.383-388
    • /
    • 2024
  • 본 논문은 전라남도에서 측정한 태양광 발전 데이터를 기반으로 발전량 예측값을 도출하기 위한 연구이다. 발전량 측정을 위해 인버터에서 직류, 교류, 환경데이터와 같은 다변량 변수를 측정하였고, 측정값의 안정성과 신뢰성 확보를 위한 전처리 작업을 수행하였다. 상관관계 분석은 부분자기상관함수(PACF: Partial Autocorrelation Function)을 활용하여 시계열 데이터에서 발전량과 상관성이 높은 데이터만을 예측을 위해 사용하였다. 태양광 발전량 예측을 위해 딥러닝 모델을 이용하여 발전량을 측정했고, 예측 정확도를 높이기 위해 각 다변량 변수의 상관관계 분석 결과를 이용하였다. 정제된 데이터를 활용한 학습은 기존 데이터를 그대로 사용했을 때 보다 안정되었고, 상관관계 분석 결과를 반영하여 다변량 변수 중 상관성이 높은 변수만을 활용하여 태양광 발전량 예측 알고리즘을 개선하였다.

Movie Box-office Prediction using Deep Learning and Feature Selection : Focusing on Multivariate Time Series

  • Byun, Jun-Hyung;Kim, Ji-Ho;Choi, Young-Jin;Lee, Hong-Chul
    • 한국컴퓨터정보학회논문지
    • /
    • 제25권6호
    • /
    • pp.35-47
    • /
    • 2020
  • 박스 오피스 예측은 영화 이해관계자들에게 중요하다. 따라서 정확한 박스 오피스 예측과 이에 영향을 미치는 주요 변수를 선별하는 것이 필요하다. 본 논문은 영화의 박스 오피스 예측 정확도 향상을 위해 다변량 시계열 데이터 분류와 주요 변수 선택 방법을 제안한다. 연구 방법으로 한국 영화 일별 데이터를 KOBIS와 NAVER에서 수집하였고, 랜덤 포레스트(Random Forest) 방법으로 주요 변수를 선별하였으며, 딥러닝(Deep Learning)으로 다변량 시계열을 예측하였다. 한국의 스크린 쿼터제(Screen Quota) 기준, 딥러닝을 이용하여 영화 개봉 73일째 흥행 예측 정확도를 주요 변수와 전체 변수로 비교하고 통계적으로 유의한지 검정하였다. 딥러닝 모델은 다층 퍼셉트론(Multi-Layer Perceptron), 완전 합성곱 신경망(Fully Convolutional Neural Networks), 잔차 네트워크(Residual Network)로 실험하였다. 결과적으로 주요 변수를 잔차 네트워크에 사용했을 때 예측 정확도가 약 93%로 가장 높았다.

시계열 내부 구조 기반 그래프 생성을 통한 행동 분류 모델 (Behavior Classification Model Based on Graph Generation Using Time Series Structural Feature)

  • 최혁순;양진환;김시웅;김성식;문남미
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2024년도 춘계학술발표대회
    • /
    • pp.37-40
    • /
    • 2024
  • 본 연구에서는 웨어러블 디바이스로부터 수집된 다변량 반려동물 행동 데이터를 처리하기 위해, GCN(Graph Convolutional Network)과 GRU(Gated Recurrent Unit)를 결합한 모델을 제안한다. 제안된 모델은 시계열 내부 구조를 활용하여 그래프 구조로 변환하고, DTW(Dynamic Time Warping) 유사도 분석을 통해 노드 간의 시간적 유사도를 기반으로 엣지를 생성한다. 실험결과로 DTW 기반 엣지 생성 방식이 유클리드 거리 및 선형 방식에 비해 더 높은 성능을 나타냈다. 본 연구는 반려동물의 행동을 정확히 분류하기 위한 효과적인 방법론을 제공한다.

  • PDF

다변량 시계열 분석에 기반한 쿠버네티스 오토-스케일링 개선 (An Improvement of Kubernetes Auto-Scaling Based on Multivariate Time Series Analysis)

  • 김용회;김영한
    • 정보처리학회논문지:컴퓨터 및 통신 시스템
    • /
    • 제11권3호
    • /
    • pp.73-82
    • /
    • 2022
  • 오토-스케일링은 클라우드 컴퓨팅 기술이 ICT 핵심 기반 기술로 자리 잡을 수 있는 가장 중요한 기능 중 하나로써 사용자나 서비스 요청의 폭발적인 증가 또는 감소에도 시스템 자원과 서비스 인스턴스를 적절하게 확장 또는 축소하여 상황에 맞는 서비스의 안정성과 비용 대비 효과를 향상하는 기술이다. 하지만 특정 시스템 자원에 대한 모니터링 시점의 단일 메트릭 데이터를 기반으로 정책이 수립·실행되다 보니 이미 서비스에 영향이 있거나 실제 필요한 서비스 인스턴스를 세밀하게 관리하지 못하는 문제점이 있다. 이러한 문제점을 해결하기 위해서 본 논문에서는 시스템 자원과 서비스 응답시간을 다변량 시계열 분석 모델을 사용하여 분석·예측하고 이를 기반으로 오토-스케일링 정책을 수립하는 방안을 제안한다. 이를 검증하기 위해 쿠버네티스 환경에서 커스텀 스케쥴러를 구현하고, 실험을 통해 쿠버네티스 기본 오토-스케일링 방식과 비교 분석한다. 제안하는 기법은 시스템 자원과 응답시간 사이의 영향에 기반한 예측 데이터를 활용하여 예상되는 상황에 대한 오토-스케일링을 선제적으로 실행함으로써 시스템의 안정성을 확보하고 서비스 품질이 저하되지 않는 범위내에서 필요한 만큼의 인스턴스를 세밀하게 관리할 수 있는 결과를 보인다.

다변량 통합공정관리의 재수정 절차에서 모수추정 (Parameter estimation in a readjustment procedure in the multivariate integrated process control)

  • 조교영;박종숙
    • Journal of the Korean Data and Information Science Society
    • /
    • 제24권6호
    • /
    • pp.1275-1283
    • /
    • 2013
  • 다변량 통합공정관리의 기본절차는 잡음이 내재하는 공정에 수정조치를 취하여 공정편차벡터를 백색잡음벡터로 전환하도록 하여 공정제곱편차벡터를 최소화하게 되는 것이며, 이러한 다변량 통합공정관리의 수정활동을 하는 경우 공정에 이상원인이 발생하면 관리도를 통해 이를 탐지하고 제거하게 된다. 수정된 공정은 이상원인 발생 전에는 백색잡음이지만, 이상원인 발생 후 다양한 형태의 시계열 모형으로 변환하게 된다. 만약 수정된 공정을 탐지하여 이상원인의 신호가 발생한 경우 교정활동을 통하여 이를 제거해야 하지만, 구조적으로 교정이 불가능 하거나 교정활동의 비용이 많이 발생하는 경우에는 이상원인의 효과를 감안하여 수정활동을 재조정해야할 것이다. 이 논문에서는 공정모형으로 다변량 IMA(1,1)모형을 가정하고 다변량 통합공정관리 절차를 수행하는 경우 이상신호가 발생한 후 재수정 절차에서 필요한 모수추정을 하고자 한다.

다변량 스트림 데이터 축소 기법 평가 (Evaluation of Multivariate Stream Data Reduction Techniques)

  • 정훈조;서성보;최경주;박정석;류근호
    • 정보처리학회논문지D
    • /
    • 제13D권7호
    • /
    • pp.889-900
    • /
    • 2006
  • 센서 네트워크는 애플리케이션 분야에 따라 데이터 특성과 사용자의 요구사항이 다양함에도 불구하고, 현존하는 스트림 데이터 축소 연구는 데이터의 본질적인 특징보다 특정 축소 기법의 성능 향상 측면에 중점을 두고 있다. 이 논문은 계층/분산형 센서 네트워크 구조와 데이터 모델을 소개하고, 선택적으로 축소 기법을 적용하기 위해 데이터 특성과 사용자의 요구에 적합한 다변량 데이터 축소 기법을 비교 평가한다. 다변량 데이터 축소 기법의 성능을 비교 분석하기 위해, 우리는 웨이블릿, HCL(Hierarchical Clustering), SVD(Singular Value Decomposition), 샘플링과 같은 표준화 된 다변량 축소 기법을 이용한다. 실험 데이터는 다차원 시계열 데이터와 로봇 센서 데이터를 사용한다. 실험 결과 SVD와 샘플링 기법이 상대 에러 비율과 수행 성능 측면에서 웨이블릿과 HCL기법에 비해 우수하였다. 특히 각 데이터 축소 기법의 상대 에러 비율은 입력 데이터 특성에 따라 다르기 때문에 선택적으로 데이터 축소 기법을 적용하는 것이 좋은 성능을 보였다. 이 논문은 다차원 센서 데이터가 수집되는 센서 네트워크를 디자인하고 구축하는 응용 분야에 유용하게 활용될 것이다.

벡터오차수정모형과 다변량 GARCH 모형을 이용한 코스피200 선물의 헷지성과 분석 (Hedging effectiveness of KOSPI200 index futures through VECM-CC-GARCH model)

  • 권동안;이태욱
    • Journal of the Korean Data and Information Science Society
    • /
    • 제25권6호
    • /
    • pp.1449-1466
    • /
    • 2014
  • 본 논문에서는 기초자산의 선물을 이용하는 헷지 전략을 연구하였다. 최적헷지비율을 구하기 위한 전통적인 방법으로 회귀분석이 사용되고 있으나, 현물과 선물 사이에 존재하는 장기균형관계와 금융 시계열 자료의 분산에 존재하는 변동성 군집현상 등의 특징을 설명하지 못하는 한계가 있다. 이를 극복하기 위해 코스피200 지수와 선물 자료에 대해 평균모형으로 벡터오차수정모형을 적합하고, 분산모형으로 다변량 GARCH 모형을 적합하여 분산-공분산 행렬을 추정하고, 이를 통해 최적헷지비율을 구하는 방법을 연구하였다. 실증분석 결과에 의하면 시장이 안정적일 때에는 회귀분석을 사용해도 큰 차이가 없지만, 시장이 불안정해지고 변동성이 커지는 구간에서는 벡터오차수정모형과 다변량 GARCH 모형을 이용하는 경우에 헷지성과가 월등히 좋아지는 결과를 얻을 수 있었다.