• 제목/요약/키워드: TimeSeries Data

검색결과 3,626건 처리시간 0.044초

BST-IGT Model: Synthetic Benchmark Generation Technique Maintaining Trend of Time Series Data

  • Kim, Kyung Min;Kwak, Jong Wook
    • 한국컴퓨터정보학회논문지
    • /
    • 제25권2호
    • /
    • pp.31-39
    • /
    • 2020
  • 본 논문에서는 시계열 데이터를 기반으로 합성 벤치마크를 생성하는 기법을 소개한다. IoT 기기에서 측정되는 많은 데이터는 시간에 따른 수치 변화를 측정하는 시계열적 특성이 있다. 하지만 긴 기간 동안 측정되는 데이터를 일반화된 시계열 데이터로 모델링하기 힘든 문제점이 존재한다. 이런 문제를 개선하기 위해 본 논문에서는 BST-IGT 모델을 소개한다. BST-IGT 모델은 전체 데이터를 시계열 모델링이 쉬운 구간으로 분리하여 생성 데이터를 템플릿으로 수집하고 이를 기반으로 특성을 공유하거나 변형되는 새로운 합성 벤치마크를 생성한다. 제안된 모델링 기법을 이용하여 신규 벤치마크를 생성한 결과, 기존 데이터의 통계적 특성을 유지하는 합성 벤치마크와 다른 벤치마크와의 혼합으로 여러 특성을 가지는 벤치마크의 생성을 수행할 수 있었다.

이상탐지 기반의 효율적인 시계열 유사도 측정 및 순위화 (Efficient Time-Series Similarity Measurement and Ranking Based on Anomaly Detection)

  • 최지현;안현
    • 인터넷정보학회논문지
    • /
    • 제25권2호
    • /
    • pp.39-47
    • /
    • 2024
  • 시계열 분석은 시간 순서로 정렬된 데이터로부터 다양한 정보와 인사이트를 발견하기 위한 방법으로 많은 조직에서 비즈니스 문제 해결을 위해 적용하고 있다. 그중에서 시계열 유사도 측정은 패턴이 비슷한 시계열들을 식별하기 위한 단계로서 시계열 검색 및 군집화와 같은 시계열 분석 응용에서 매우 중요하다. 본 연구에서는 전체 시계열이 아닌 이상치들을 중심으로 시계열 유사도 측정을 계산 효율적으로 수행하는 방법을 제안한다. 이와 관련하여 이상탐지를 통해 추출된 서브시퀀스 집합에 대한 유사도 측정 결과와 시계열 전체에 대한 유사도 측정 결과 사이의 순위 상관관계를 측정 및 분석하여 제안 방법을 검증한다. 실험 결과로써, 주식 종목 시계열 데이터에 이상치 비율 10% 을 적용한 유사도 측정으로부터 최대 0.9 이상의 스피어만 순위 상관계수를 확인하였다. 결론적으로 제안 방법을 통해 시계열 유사도 측정에 소요되는 계산량을 유의미하게 절감하는 동시에 신뢰 가능한 시계열 검색 및 군집화 결과를 기대할 수 있다.

VaR(Value at Risk) for Korean Financial Time Series

  • Hwang, S.Y.;Park, J.
    • Journal of the Korean Data and Information Science Society
    • /
    • 제16권2호
    • /
    • pp.283-288
    • /
    • 2005
  • Value at Risk(VaR) has been proven useful in finance literature as a tool of risk management(cf. Jorion(2001)). This article is concerned with introducing VaR to various Korean financial time series. Five daily data sets with sample period ranging from 2000 and 2004 such as KOSPI, KOSPI 200, KOSDAQ, KOSDAQ 50 and won-dollar exchange rate are analyzed using GARCH modeling and in turn VaR is obtained for each data.

  • PDF

Statistical Inference for Space Time Series Model with Application to Mumps Data

  • Jeong, Ae-Ran;Kim, Sun-Woo;Lee, Sung-Duck
    • Journal of the Korean Data and Information Science Society
    • /
    • 제17권2호
    • /
    • pp.475-486
    • /
    • 2006
  • Space time series data can be viewed either as a set of time series collected simultaneously at a number of spatial locations or as sets of spatial data collected at a number of time points. The major purpose of this article is to formulate a class of space time autoregressive moving average (STARMA) model, to discuss some of the their statistical properties such as model identification approaches, some procedure for estimation and the predictions. For illustration, we apply this STARMA model to the mumps data. The data set of mumps cases consists of the number of cases of mumps reported from twelve states monthly over the years 1969-1988.

  • PDF

회귀모형에 의한 서해안 평균해면의 연시계열자료의 평가 (The Evaluation of the Annual Time Series Data for the Mean Sea Level of the West Coast by Regression Model)

  • 조기태;박영기;이장춘
    • 한국환경과학회지
    • /
    • 제9권1호
    • /
    • pp.19-25
    • /
    • 2000
  • As the tideland reclamation is done on a large scale these days, construction work is active in the coastal areas. Facilities in the coastal areas must be built with the tide characteristics taken into consideration. Thus the tide characteristics affect the overall reclamation plan. The analysis of the tide data boils down to a harmonic analysis of the hourly changes of long-term tide data and extraction of unharmonic coefficients from the results. Since considerable amount of tide data of the West Coast are available, the existing data can be collected and can be used to obtain the temporal changes of the tide by being fitted into the tide prediction model. The goal of this thesis lies in assessing whether the mean sea level used in the field agrees with the analysis results from the long-term observation data obtained with their homogeneity guaranteed. To achieve this goal, the research was conducted as follows. First the present conditions of the observation stations, the land level standard, and the sea level standard were analyzed to set up a time series model formula for representing them. To secure the homogeneity of the time series, each component was separated. Lastly the mean sea level used in the field was assessed based on the results obtained form the analysis of the time series.

  • PDF

Unit Root Test를 기반으로 한 장기 시계열 데이터의 Non-Stationary 발생에 따른 구조 변화 검정 및 시각화 연구 (A Study on the Test and Visualization of Change in Structures Associated with the Occurrence of Non-Stationary of Long-Term Time Series Data Based on Unit Root Test)

  • 유재성;주재걸
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제8권7호
    • /
    • pp.289-302
    • /
    • 2019
  • 시계열의 구조 변화란, 전체 시계열 자료를 구성하는 기간에서 관측치들의 분포가 상대적으로 안정적이다가, 특정 시점에서 분포 특성의 급격한 변화를 보이는 것을 의미한다. 비정상(non-stationary) 장기 시계열 안에서도, 단기적인 추세의 변화가 일시적인 것인지, 아니면 구조적으로 변한 것인지를 적시에 판단하는 것은 중요하다. 이는 시계열 추세의 변화를 상시 감지하여, 변화에 맞는 적정한 대응을 할 필요가 있기 때문이다. 본 연구에서는 단위근 검정법을 기반으로 한 검정 결과를 시각화함으로써, 의사결정자가 시계열의 구조 변화를 손쉽게 파악할 수 있는 방안을 제시하였다. 특히 시계열을 분할한 후 검정하는 방법을 통해, 장기 시계열일 때에도 단기 구조 변화를 파악할 수 있도록 하였다.

ProphetNet 모델을 활용한 시계열 데이터의 열화 패턴 기반 Health Index 연구 (A Study on the Health Index Based on Degradation Patterns in Time Series Data Using ProphetNet Model)

  • 원선주;김용수
    • 산업경영시스템학회지
    • /
    • 제46권3호
    • /
    • pp.123-138
    • /
    • 2023
  • The Fourth Industrial Revolution and sensor technology have led to increased utilization of sensor data. In our modern society, data complexity is rising, and the extraction of valuable information has become crucial with the rapid changes in information technology (IT). Recurrent neural networks (RNN) and long short-term memory (LSTM) models have shown remarkable performance in natural language processing (NLP) and time series prediction. Consequently, there is a strong expectation that models excelling in NLP will also excel in time series prediction. However, current research on Transformer models for time series prediction remains limited. Traditional RNN and LSTM models have demonstrated superior performance compared to Transformers in big data analysis. Nevertheless, with continuous advancements in Transformer models, such as GPT-2 (Generative Pre-trained Transformer 2) and ProphetNet, they have gained attention in the field of time series prediction. This study aims to evaluate the classification performance and interval prediction of remaining useful life (RUL) using an advanced Transformer model. The performance of each model will be utilized to establish a health index (HI) for cutting blades, enabling real-time monitoring of machine health. The results are expected to provide valuable insights for machine monitoring, evaluation, and management, confirming the effectiveness of advanced Transformer models in time series analysis when applied in industrial settings.

Finding associations between genes by time-series microarray sequential patterns analysis

  • Nam, Ho-Jung;Lee, Do-Heon
    • 한국생물정보학회:학술대회논문집
    • /
    • 한국생물정보시스템생물학회 2005년도 BIOINFO 2005
    • /
    • pp.161-164
    • /
    • 2005
  • Data mining techniques can be applied to identify patterns of interest in the gene expression data. One goal in mining gene expression data is to determine how the expression of any particular gene might affect the expression of other genes. To find relationships between different genes, association rules have been applied to gene expression data set [1]. A notable limitation of association rule mining method is that only the association in a single profile experiment can be detected. It cannot be used to find rules across different condition profiles or different time point profile experiments. However, with the appearance of time-series microarray data, it became possible to analyze the temporal relationship between genes. In this paper, we analyze the time-series microarray gene expression data to extract the sequential patterns which are similar to the association rules between genes among different time points in the yeast cell cycle. The sequential patterns found in our work can catch the associations between different genes which express or repress at diverse time points. We have applied sequential pattern mining method to time-series microarray gene expression data and discovered a number of sequential patterns from two groups of genes (test, control) and more sequential patterns have been discovered from test group (same CO term group) than from the control group (different GO term group). This result can be a support for the potential of sequential patterns which is capable of catching the biologically meaningful association between genes.

  • PDF

Threshold-asymmetric volatility models for integer-valued time series

  • Kim, Deok Ryun;Yoon, Jae Eun;Hwang, Sun Young
    • Communications for Statistical Applications and Methods
    • /
    • 제26권3호
    • /
    • pp.295-304
    • /
    • 2019
  • This article deals with threshold-asymmetric volatility models for over-dispersed and zero-inflated time series of count data. We introduce various threshold integer-valued autoregressive conditional heteroscedasticity (ARCH) models as incorporating over-dispersion and zero-inflation via conditional Poisson and negative binomial distributions. EM-algorithm is used to estimate parameters. The cholera data from Kolkata in India from 2006 to 2011 is analyzed as a real application. In order to construct the threshold-variable, both local constant mean which is time-varying and grand mean are adopted. It is noted via a data application that threshold model as an asymmetric version is useful in modelling count time series volatility.

다변량 시계열 자료를 이용한 부정맥 예측 (Prediction of arrhythmia using multivariate time series data)

  • 이민혜;노호석
    • 응용통계연구
    • /
    • 제32권5호
    • /
    • pp.671-681
    • /
    • 2019
  • 최근에 부정맥 환자가 증가하면서 머신러닝을 이용한 부정맥을 예측하는 연구가 활발하게 진행되고 있다. 기존의 많은 연구들은 특정한 시점의 RR 간격 데이터에서 추출한 특징변수 다변량 데이터에 기반하여 부정맥을 예측하였다. 본 연구에서는 심장 상태가 시간에 따라 변해가는 패턴도 부정맥 예측에 중요한 정보가 될 수 있다고 생각하여 일정한 시간 간격을 두고 특징변수의 다변량 벡터를 추출하여 쌓음으써 얻어지는 다변량 시계열 데이터로 부정맥을 예측하는 것의 유용성에 대해 살펴보았다. 1-Nearest Neighbor 방법과 그것을 앙상블(ensemble)한 learner를 중심으로 비교했을 경우 시계열의 특징을 고려한 적절한 시계열 거리함수를 선택하여 시계열 정보를 활용한 다변량 시계열 데이터 기반 방법의 분류 성능이 더 좋게 나오는 것을 확인하였다.