• Title/Summary/Keyword: Ensemble models

검색결과 358건 처리시간 0.029초

고차원 데이터에서 One-class SVM과 Spectral Clustering을 이용한 이진 예측 이상치 탐지 방법 (A Binary Prediction Method for Outlier Detection using One-class SVM and Spectral Clustering in High Dimensional Data)

  • 박정희
    • 한국멀티미디어학회논문지
    • /
    • 제25권6호
    • /
    • pp.886-893
    • /
    • 2022
  • Outlier detection refers to the task of detecting data that deviate significantly from the normal data distribution. Most outlier detection methods compute an outlier score which indicates the degree to which a data sample deviates from normal. However, setting a threshold for an outlier score to determine if a data sample is outlier or normal is not trivial. In this paper, we propose a binary prediction method for outlier detection based on spectral clustering and one-class SVM ensemble. Given training data consisting of normal data samples, a clustering method is performed to find clusters in the training data, and the ensemble of one-class SVM models trained on each cluster finds the boundaries of the normal data. We show how to obtain a threshold for transforming outlier scores computed from the ensemble of one-class SVM models into binary predictive values. Experimental results with high dimensional text data show that the proposed method can be effectively applied to high dimensional data, especially when the normal training data consists of different shapes and densities of clusters.

머신러닝 기반 기업부도위험 예측모델 검증 및 정책적 제언: 스태킹 앙상블 모델을 통한 개선을 중심으로 (Machine learning-based corporate default risk prediction model verification and policy recommendation: Focusing on improvement through stacking ensemble model)

  • 엄하늘;김재성;최상옥
    • 지능정보연구
    • /
    • 제26권2호
    • /
    • pp.105-129
    • /
    • 2020
  • 본 연구는 부도위험 예측을 위해 K-IFRS가 본격적으로 적용된 2012년부터 2018년까지의 기업데이터를 이용한다. 부도위험의 학습을 위해, 기존의 대부분 선행연구들이 부도발생 여부를 기준으로 사용했던 것과 다르게, 본 연구에서는 머튼 모형을 토대로 각 기업의 시가총액과 주가 변동성을 이용하여 부도위험을 산정했으며, 이를 통해 기존 방법론의 한계로 지적되어오던 부도사건 희소성에 따른 데이터 불균형 문제와 정상기업 내에서 존재하는 부도위험 차이 반영 문제를 해소할 수 있도록 하였다. 또한, 시장의 평가가 반영된 시가총액 및 주가 변동성을 기반으로 부도위험을 도출하되, 부도위험과 매칭될 입력데이터로는 비상장 기업에서 활용될 수 있는 기업 정보만을 활용하여 학습을 수행함으로써, 포스트 팬데믹 시대에서 주가 정보가 존재하지 않는 비상장 기업에게도 시장의 판단을 모사하여 부도위험을 적절하게 도출할 수 있도록 하였다. 기업의 부도위험 정보가 시장에서 매우 광범위하게 활용되고 있고, 부도위험 차이에 대한 민감도가 높다는 점에서 부도위험 산출 시 안정적이고 신뢰성 높은 평가방법론이 요구된다. 최근 머신러닝을 활용하여 기업의 부도위험을 예측하는 연구가 활발하게 이루어지고 있으나, 대부분 단일 모델을 기반으로 예측을 수행한다는 점에서 필연적인 모델 편향 문제가 존재하고, 이는 실무에서 활용하기 어려운 요인으로 작용하고 있다. 이에, 본 연구에서는 다양한 머신러닝 모델을 서브모델로 하는 스태킹 앙상블 기법을 활용하여 개별 모델이 갖는 편향을 경감시킬 수 있도록 하였다. 이를 통해 부도위험과 다양한 기업정보들 간의 복잡한 비선형적 관계들을 포착할 수 있으며, 산출에 소요되는 시간이 적다는 머신러닝 기반 부도위험 예측모델의 장점을 극대화할 수 있다. 본 연구가 기존 머신러닝 기반 모델의 한계를 극복 및 개선함으로써 실무에서의 활용도를 높일 수 있는 자료로 활용되기를 바라며, 머신러닝 기반 부도위험 예측 모형의 도입 기준 정립 및 정책적 활용에도 기여할 수 있기를 희망한다.

Improved prediction of soil liquefaction susceptibility using ensemble learning algorithms

  • Satyam Tiwari;Sarat K. Das;Madhumita Mohanty;Prakhar
    • Geomechanics and Engineering
    • /
    • 제37권5호
    • /
    • pp.475-498
    • /
    • 2024
  • The prediction of the susceptibility of soil to liquefaction using a limited set of parameters, particularly when dealing with highly unbalanced databases is a challenging problem. The current study focuses on different ensemble learning classification algorithms using highly unbalanced databases of results from in-situ tests; standard penetration test (SPT), shear wave velocity (Vs) test, and cone penetration test (CPT). The input parameters for these datasets consist of earthquake intensity parameters, strong ground motion parameters, and in-situ soil testing parameters. liquefaction index serving as the binary output parameter. After a rigorous comparison with existing literature, extreme gradient boosting (XGBoost), bagging, and random forest (RF) emerge as the most efficient models for liquefaction instance classification across different datasets. Notably, for SPT and Vs-based models, XGBoost exhibits superior performance, followed by Light gradient boosting machine (LightGBM) and Bagging, while for CPT-based models, Bagging ranks highest, followed by Gradient boosting and random forest, with CPT-based models demonstrating lower Gmean(error), rendering them preferable for soil liquefaction susceptibility prediction. Key parameters influencing model performance include internal friction angle of soil (ϕ) and percentage of fines less than 75 µ (F75) for SPT and Vs data and normalized average cone tip resistance (qc) and peak horizontal ground acceleration (amax) for CPT data. It was also observed that the addition of Vs measurement to SPT data increased the efficiency of the prediction in comparison to only SPT data. Furthermore, to enhance usability, a graphical user interface (GUI) for seamless classification operations based on provided input parameters was proposed.

ANALYSIS OF TWOPHASE FLOW MODEL EQUATIONS

  • Jin, Hyeonseong
    • 호남수학학술지
    • /
    • 제36권1호
    • /
    • pp.11-27
    • /
    • 2014
  • In this paper, we propose closures for multi-phase flow models, which satisfy boundary conditions and conservation constraints. The models governing the evolution of the fluid mixing are derived by applying an ensemble averaging procedure to the microphysical equations characterized by distinct phases. We consider compressible multi species multi-phase flow with surface tension and transport.

Evaluation of Ensemble Approach for O3 and PM2.5 Simulation

  • Morino, Yu;Chatani, Satoru;Hayami, Hiroshi;Sasaki, Kansuke;Mori, Yasuaki;Morikawa, Tazuko;Ohara, Toshimasa;Hasegawa, Shuichi;Kobayashi, Shinji
    • Asian Journal of Atmospheric Environment
    • /
    • 제4권3호
    • /
    • pp.150-156
    • /
    • 2010
  • Inter-comparison of chemical transport models (CTMs) was conducted among four modeling research groups. Model performance of the ensemble approach to $O_3$ and $PM_{2.5}$ simulation was evaluated by using observational data with a time resolution of 1 or 6 hours at four sites in the Kanto area, Japan, in summer 2007. All groups applied the Community Multiscale Air Quality model. The ensemble average of the four CTMs reproduced well the temporal variation of $O_3$ (r=0.65-0.85) and the daily maximum $O_3$ concentration within a factor of 1.3. By contrast, it underestimated $PM_{2.5}$ concentrations by a factor of 1.4-2, and did not reproduce the $PM_{2.5}$ temporal variation at two suburban sites (r=~0.2). The ensemble average improved the simulation of ${SO_4}^{2-}$, ${NO_3}^-$, and ${NH_4}^+$, whose production pathways are well known. In particular, the ensemble approach effectively simulated ${NO_3}^-$, despite the large variability among CTMs (up to a factor of 10). However, the ensemble average did not improve the simulation of organic aerosols (OAs), underestimating their concentrations by a factor of 5. The contribution of OAs to $PM_{2.5}$ (36-39%) was large, so improvement of the OA simulation model is essential to improve the $PM_{2.5}$ simulation.

Remaining Useful Life Estimation based on Noise Injection and a Kalman Filter Ensemble of modified Bagging Predictors

  • Hung-Cuong Trinh;Van-Huy Pham;Anh H. Vo
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제17권12호
    • /
    • pp.3242-3265
    • /
    • 2023
  • Ensuring reliability of a machinery system involve the prediction of remaining useful life (RUL). In most RUL prediction approaches, noise is always considered for removal. Nevertheless, noise could be properly utilized to enhance the prediction capabilities. In this paper, we proposed a novel RUL prediction approach based on noise injection and a Kalman filter ensemble of modified bagging predictors. Firstly, we proposed a new method to insert Gaussian noises into both observation and feature spaces of an original training dataset, named GN-DAFC. Secondly, we developed a modified bagging method based on Kalman filter averaging, named KBAG. Then, we developed a new ensemble method which is a Kalman filter ensemble of KBAGs, named DKBAG. Finally, we proposed a novel RUL prediction approach GN-DAFC-DKBAG in which the optimal noise-injected training dataset was determined by a GN-DAFC-based searching strategy and then inputted to a DKBAG model. Our approach is validated on the NASA C-MAPSS dataset of aero-engines. Experimental results show that our approach achieves significantly better performance than a traditional Kalman filter ensemble of single learning models (KESLM) and the original DKBAG approaches. We also found that the optimal noise-injected data could improve the prediction performance of both KESLM and DKBAG. We further compare our approach with two advanced ensemble approaches, and the results indicate that the former also has better performance than the latters. Thus, our approach of combining optimal noise injection and DKBAG provides an effective solution for RUL estimation of machinery systems.

신용카드 불법현금융통 적발을 위한 축소된 앙상블 모형 (Illegal Cash Accommodation Detection Modeling Using Ensemble Size Reduction)

  • 이화경;한상범;지원철
    • 지능정보연구
    • /
    • 제16권1호
    • /
    • pp.93-116
    • /
    • 2010
  • 불법현금융통 적발모형 개발에 앙상블 접근방법을 사용하였다. 불법현금융통은 국내 신용카드사의 손익에 영향을 미치며 최근 국제화되고 있음에도 불구하고 학문적인 접근이 이루어지지 않았다. 부정행위 적발모형(Fraud Detection Model, FDM)은 데이터 불균형 문제로 인하여 좋은 성능을 얻기 어려운데, 다수의 모형을 결합하는 앙상블이 대안으로 제시되어 왔다. 앙상블에 포함된 모형들의 다양성이 보장된다면 단일모형에 비해 더 좋은 성능을 보인다는 점은 이미 인정되고 있으며, 최근 연구 결과는 학습된 모든 기본모형들을 사용하는 것보다 적절한 기본모형들만 선택하여 앙상블에 포함시키는 것이 바람직하다는 것이다. 본 논문에서는 효과적인 불법현금융통 적발을 위하여 축소된 앙상블 기법을 사용하는데, 정확성과 다양성 척도를 사용하여 앙상블에 참여할 기본모형을 선택하는 것이다. 다양성은 앙상블을 구성하는 기본모형들 사이의 불일치 (Disagreement or Ambiguity)를 의미하는데, FDM에 내재된 데이터 불균형문제를 고려하여 두 가지 측면에 중점을 두었다. 첫째, 학습 자료의 추출 과정에서 다양성을 확보하기 위한 소수 범주의 과잉추출 방법과 적절한 훈련 방법에 대해 설명하였다. 둘째, 소수범주에 초점을 맞추어 기존의 다양성 척도를 효과적인 척도로 변형시키고, 전진추가법과 후진소거법의 동적 다양성 계산법을 도입하여 앙상블에 참여할 기본모형을 평가하였다. 실험에 사용된 학습 알고리즘은 신경망, 의사결정수와 로짓 회귀분석이었으며, 동질적 앙상블과 이질적 앙상블을 구성하여 성능평가를 하였다. 실험결과 불법현금융통 적발모형에 있어 축소된 앙상블은 모든 기본모형이 포함된 앙상블과 성능 차이가 없었다. 축소된 앙상블은 앙상블 구성의 복잡성을 감소시키고 구현을 용이하게 한다는 점에서 FDM에서도 유력한 모형 수립 접근방법이 될 수 있음을 보였다.

디리클레 분포 기반 모델 기여도 예측을 이용한 앙상블 트레이딩 알고리즘 (Ensemble trading algorithm Using Dirichlet distribution-based model contribution prediction)

  • 정재용;이주홍;최범기;송재원
    • 스마트미디어저널
    • /
    • 제11권3호
    • /
    • pp.9-17
    • /
    • 2022
  • 알고리즘을 이용하여 금융 상품을 거래하는 알고리즘 트레이딩은 시장의 많은 요인들로 인해 그 결과가 안정적이지 못한 문제가 있다. 이 문제를 완화시키기 위해 트레이딩 알고리즘들을 조합한 앙상블 기법들이 제안되었다. 하지만 이 앙상블 방법에도 여러 문제가 존재한다. 첫째, 앙상블의 필요 요건인 앙상블에 포함된 알고리즘의 최소 성능 요건(랜덤 이상)을 만족시키도록, 트레이딩 알고리즘을 선택하지 못할 수 있다는 점이다. 둘째, 과거에 우수한 성능을 보인 앙상블 모델이 미래에도 우수한 성능을 보일 것이라는 보장이 없다는 점이다. 이 문제점들을 해결하기 위해 앙상블 모델에 포함되는 트레이딩 알고리즘들을 선택하는 방법을 다음과 같이 제안한다. 과거의 데이터를 기반으로 상위 성능의 앙상블 모델들에 포함된 트레이딩 알고리즘들의 기여도를 측정한다. 그러나 이 과거 데이터에만 기반 된 기여도들은 과거의 데이터가 충분히 많지 않고 과거 데이터의 불확실성이 반영되어 있지 않기 때문에 디리클레 분포를 사용하여 기여도 분포를 근사시키고, 기여도 분포에서 기여도 값들을 샘플하여 불확실성을 반영한다. 과거 데이터로부터 구한 트레이딩 알고리즘의 기여도 분포를 기반으로 Transformer을 훈련하여 미래의 기여도를 예측한다. 예측된 미래 기여도가 높은 트레이딩 알고리즘들을 앙상블 모델에 선택하여 포함시킨다. 실험을 통하여 제안된 앙상블 방법이 기존 앙상블 방법들과 비교하여 우수한 성능을 보임을 입증하였다.

Feature Selection with Ensemble Learning for Prostate Cancer Prediction from Gene Expression

  • Abass, Yusuf Aleshinloye;Adeshina, Steve A.
    • International Journal of Computer Science & Network Security
    • /
    • 제21권12spc호
    • /
    • pp.526-538
    • /
    • 2021
  • Machine and deep learning-based models are emerging techniques that are being used to address prediction problems in biomedical data analysis. DNA sequence prediction is a critical problem that has attracted a great deal of attention in the biomedical domain. Machine and deep learning-based models have been shown to provide more accurate results when compared to conventional regression-based models. The prediction of the gene sequence that leads to cancerous diseases, such as prostate cancer, is crucial. Identifying the most important features in a gene sequence is a challenging task. Extracting the components of the gene sequence that can provide an insight into the types of mutation in the gene is of great importance as it will lead to effective drug design and the promotion of the new concept of personalised medicine. In this work, we extracted the exons in the prostate gene sequences that were used in the experiment. We built a Deep Neural Network (DNN) and Bi-directional Long-Short Term Memory (Bi-LSTM) model using a k-mer encoding for the DNA sequence and one-hot encoding for the class label. The models were evaluated using different classification metrics. Our experimental results show that DNN model prediction offers a training accuracy of 99 percent and validation accuracy of 96 percent. The bi-LSTM model also has a training accuracy of 95 percent and validation accuracy of 91 percent.

종분포모형의 불확실성 확인을 위한 앙상블모형 적용 (Applying Ensemble Model for Identifying Uncertainty in the Species Distribution Models)

  • 권혁수
    • 대한공간정보학회지
    • /
    • 제22권4호
    • /
    • pp.47-52
    • /
    • 2014
  • 종분포모형은 생물다양성 평가, 보호지역 지정, 서식지 관리 및 복원, 기후변화 예측 등의 다양한 분야에 활용되고 있으나 공공이나 정책분야에서는 모형의 불확실성으로 인하여 활용이 제한적이었다. 최근에는 이러한 모형의 불확실성을 저감하기 위하여 앙상블이나 합의모형 등의 다중모형을 적용하는 연구가 증가하고 있다. 이에 본 연구에서는 히어리를 대상으로 단일모형과 앙상블(다중) 모형을 적용하고 이를 비교하는 연구를 수행하였다. 모형은 AUC와 kappa, TSS를 이용하여 적합도를 평가하였으며, 이 중 모형 간의 비교가 용이하고 이항형 지도로 바로 변환할 수 있는 TSS가 효과적이었다. 단일모형과 앙상블 모형 모두 높은 모형적합도를 나타내었으며, 다중 모형 중에서는 RF, Maxent, GBM이 높게, GAM, SRE는 비교적 낮게 평가되었다. 예측지도에서는 단일모형에 비해 다중모형의 예측범위가 과대 추정되는 경향이 있었다. 이는 여러 모형이 중첩된 결과로 현장전문가와 모형전문가들 간의 협력연구를 통하여 적절한 모형 선택과 가중치 부여 등을 통하여 문제를 해결할 수 있다. 앙상블모형을 공간의사결정이나 보호지역계획에 활용하기 위해서는 불확실성의 정도와 원인을 파악하고, 이를 저감하려는 개선작업과 함께 결과의 불확실성이나 위험성을 인지하고 의사결정을 해야 한다.