• 제목/요약/키워드: LightGBM model

검색결과 64건 처리시간 0.025초

대출 상환 예측을 위한 의사결정나무모델과 TabNet 간 성능 비교 (Performance comparison between Decision tree model and TabNet for loan repayment prediction)

  • 한수진 ;김현철
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2023년도 추계학술발표대회
    • /
    • pp.453-455
    • /
    • 2023
  • 본 연구는 은행에서 리스크 관리 자동화를 위해 고객의 대출 상환 여부 예측 모델을 제안하고자 한다. 예측 모델로 금융 데이터 같은 정형데이터에서 전통적으로 높은 성능을 보인 의사결정나무기반 모델 LightGBM, CatBoost, XGB 와 최근 제안된 정형데이터에서 사용할 수 있는 설명 가능한 딥러닝 기반 모델 TabNet 간의 성능 비교를 진행한다. 다만, 대출 상환 여부 데이터는 불균형 클래스 데이터로 구성되어있어 샘플링을 진행한다. SMOTE, Random Under Sampling, 혼합 방식을 비교해 가장 높은 성능의 샘플링 기법을 제안한다. 대출 상환 여부 예측 결과 TabNet 모델이 의사결정나무모델들보다 좋은 성능을 보여 정형데이터에서 의사결정나무 기반 모델을 딥러닝 모델이 대체 할 수 있는 가능성을 확인했다.

Prediction of Larix kaempferi Stand Growth in Gangwon, Korea, Using Machine Learning Algorithms

  • Hyo-Bin Ji;Jin-Woo Park;Jung-Kee Choi
    • Journal of Forest and Environmental Science
    • /
    • 제39권4호
    • /
    • pp.195-202
    • /
    • 2023
  • In this study, we sought to compare and evaluate the accuracy and predictive performance of machine learning algorithms for estimating the growth of individual Larix kaempferi trees in Gangwon Province, Korea. We employed linear regression, random forest, XGBoost, and LightGBM algorithms to predict tree growth using monitoring data organized based on different thinning intensities. Furthermore, we compared and evaluated the goodness-of-fit of these models using metrics such as the coefficient of determination (R2), mean absolute error (MAE), and root mean square error (RMSE). The results revealed that XGBoost provided the highest goodness-of-fit, with an R2 value of 0.62 across all thinning intensities, while also yielding the lowest values for MAE and RMSE, thereby indicating the best model fit. When predicting the growth volume of individual trees after 3 years using the XGBoost model, the agreement was exceptionally high, reaching approximately 97% for all stand sites in accordance with the different thinning intensities. Notably, in non-thinned plots, the predicted volumes were approximately 2.1 m3 lower than the actual volumes; however, the agreement remained highly accurate at approximately 99.5%. These findings will contribute to the development of growth prediction models for individual trees using machine learning algorithms.

확률변동성 모형을 적용한 해운산업의 벙커가격과 환율 리스크 추정 (Application to the Stochastic Modelling of Risk Measurement in Bunker Price and Foreign Exchange Rate on the Maritime Industry)

  • 김현석
    • 한국항만경제학회지
    • /
    • 제34권1호
    • /
    • pp.99-110
    • /
    • 2018
  • 본 연구는 해운기업의 주요 비용요인 벙커 가격과 환율의 불확실성으로 인한 재무적 리스크를 수치화하는 방법론을 2010년 1월 1일부터 2018년 1월 31일까지의 일별자료를 대상으로 적용한다. 기하브라운 운동 (Geometric Brownian Motion 이하 GBM)과 이를 확장한 조건부 이분산성(heteroskedasticity) 및 점프 확산 프로세스(jump diffusion process)에 의존하는 모형으로부터 추정한 현금 흐름 리스크 추정치는 다음 세 가지 학술적 기여로 요약할 수 있다. 첫째, 운임수익률과 같은 단일 변수에 의존한 리스크 분석을 벙커가격과 환율 수익률 변동성과 같이 복합요인으로부터 발생하는 영향으로 분석을 확장하였다. 둘째, 개별기업 수준에서 벙커가격과 환율 리크스 관리의 필요성을 민감도 분석을 통해 현금흐름수준으로 제시하였다. 마지막으로 분석결과가 제시하는 리스크 규모를 근거로 해운기업은 리스크 관리를 위한 수단으로 무엇이 적절한가를 고민해야 할 필요성이 있음을 제기한다.

봉선화(鳳仙花) 추출물의 막성신증(膜性腎症)에 대한 치료효과(治療效果) (Therapeutic Effect of the Impatiens balsamina Linne Extract on the Membranous Nephropathy)

  • 위경;유지현;도은수;장준복;길기정
    • 대한본초학회지
    • /
    • 제26권4호
    • /
    • pp.115-124
    • /
    • 2011
  • Objective : Membranous nephropathy(MN) is one of the most common causes of nephrotic syndrome in adults. MN has been defined as granular subepithelial deposition of IgG immune complexes along the glomerular basement membrane(GBM). However, there is not a satisfactory treatment for MN. We aimed to identify the effect of Impatiens balsamina Linne(IBL) treatment on cationic bovine serum albumin(cBSA)-induced MN in a mouse model. Methods : Mice were divided into 4 groups. The normal group was injected with saline. The Control group was treated with cBSA(50 mg/kg i.p) only. The third group IBL-100, was treated with cBSA(50 mg/kg, i.p) and IBL(100 mg/kg, p.o). The fourth group IBL-400, was treated with cBSA(50 mg/kg, i.p) and IBL (400 mg/kg, p.o). After cBSA and IBL treatment for 6 weeks, we measured change of body weight, proteinuria, serum albumin, total cholesterol, triglyceride, BUN, creatinine, IgA, IgM, IgG, TNF-${\alpha}$, IL-6 and IL-$1{\beta}$ levels. The morphologic changes of renal glomeruli were also observed with a light microscope. Results : The level of proteinuria significantly decreased and serum albumin increased in groups treated with cBSA and IBL extract compared with the control. The levels of serum triglyceride, BUN, IgG, TNF-${\alpha}$, IL-$1{\beta}$ significantly decreased in both IBL groups. In histological findings of kidney tissue, thickening of GBM decreased in both IBL groups. Conclusions : This study shows that IBL might be effective for treatment of acute stage MN. More clinical data and studies are to be done for efficient application.

한국 프로배구 연맹의 경기 예측 및 영향요인 분석 (Matching prediction on Korean professional volleyball league)

  • 김희숙;이나경;이지윤;송종우
    • 응용통계연구
    • /
    • 제37권3호
    • /
    • pp.323-338
    • /
    • 2024
  • 본 연구는 한국 프로배구 리그를 체계적으로 분석하고 대표적인 머신러닝 분류 방법을 활용하여 경기 결과를 예측하고자 한다. 이를 위해 2012/2013 시즌부터 2022/2023 시즌까지의 남자 프로배구와 여자 프로배구 리그 경기 데이터를 수집하였으며, 이 데이터는 경기 세부 내용을 상세하게 포함하고 있다. 데이터는 각 경기를 두 팀으로 분리한 경우와 홈팀을 기준으로 상대팀과의 성과 차이로 데이터를 가공한 경우로 두 가지 다른 데이터 구조를 모델에 적용했다. 이를 통해 남자 프로배구와 여자 프로배구 각각에 대해 총 4개의 예측 모형을 구축했다. 경기 종료 전에는 모형에서 사용하는 세부 변수 값들을 알 수 없기 때문에, 오늘 경기 직전까지의 3~4 경기의 결과를 전처리하여 이를 변수로 사용했다. 본 연구에서는 Decision Tree, Logistic Regression, Bagging, Random Forest, Xgboost, Adaboost, Light GBM 같은 다양한 머신러닝 기법을 분류에 활용하여, Random Forest를 사용한 모델이 가장 우수한 예측 성능을 보였다. 최종 선택한 모형에 대해 변수 중요도 그림과 부분 의존도 그림을 확인한 결과 성별과 데이터 구조에 따라 중요한 변수들이 다른 것으로 나타났지만, 공통적으로 세트 성공 수, 블로킹 득점, 범실 개수가 가장 중요한 변수임을 알 수 있었다. 본 승패 예측 모델은 사후적 예측이 아닌 경기 종료 전 사전 예측이 가능한 모형이라는 점에서 차별성을 가지며, 우리의 분석이 한국 프로배구 팀들에게 전략적 추론이 될 수 있을 것이라 기대한다.

Performance Comparison of Neural Network and Gradient Boosting Machine for Dropout Prediction of University Students

  • Hyeon Gyu Kim
    • 한국컴퓨터정보학회논문지
    • /
    • 제28권8호
    • /
    • pp.49-58
    • /
    • 2023
  • 학생들의 중도 탈락은 대학의 재정적 손실 뿐 아니라, 학생 개개인 및 사회적으로도 부정적인 영향을 끼친다. 이러한 문제를 해결하기 위해 기계 학습을 이용하여 대학생들의 중도 탈락 여부를 예측하고자 하는 다양한 시도가 이루어지고 있다. 본 논문에서는 대학생들의 중도 탈락 여부를 예측하기 위해 DNN(Deep Neural Network)과 LGBM(Light Gradient Boosting Machine)을 이용한 모델을 구현하고 성능을 비교하였다. 학습 데이터로는 서울 소재 중소규모 4년제 대학인 A 대학의 20,050명의 학생을 대상으로 수집된 학적 및 성적 데이터를 학습에 이용하였다. 원본 데이터의 140여개의 속성 중 중도 탈락 여부를 나타내는 속성과의 상관계수가 0.1 이상인 속성들만 추출하여 학습하였다. 두 모델의 성능 실험 결과, DNN과 LGBM의 F1-스코어는 0.798과 0.826이었으며, LGBM이 DNN에 비해 2.5% 나은 예측 성능을 보였다.

앙상블 기법을 활용한 RNA-Sequencing 데이터의 폐암 예측 연구 (A Study on Predicting Lung Cancer Using RNA-Sequencing Data with Ensemble Learning)

  • Geon AN;JooYong PARK
    • Journal of Korea Artificial Intelligence Association
    • /
    • 제2권1호
    • /
    • pp.7-14
    • /
    • 2024
  • In this paper, we explore the application of RNA-sequencing data and ensemble machine learning to predict lung cancer and treatment strategies for lung cancer, a leading cause of cancer mortality worldwide. The research utilizes Random Forest, XGBoost, and LightGBM models to analyze gene expression profiles from extensive datasets, aiming to enhance predictive accuracy for lung cancer prognosis. The methodology focuses on preprocessing RNA-seq data to standardize expression levels across samples and applying ensemble algorithms to maximize prediction stability and reduce model overfitting. Key findings indicate that ensemble models, especially XGBoost, substantially outperform traditional predictive models. Significant genetic markers such as ADGRF5 is identified as crucial for predicting lung cancer outcomes. In conclusion, ensemble learning using RNA-seq data proves highly effective in predicting lung cancer, suggesting a potential shift towards more precise and personalized treatment approaches. The results advocate for further integration of molecular and clinical data to refine diagnostic models and improve clinical outcomes, underscoring the critical role of advanced molecular diagnostics in enhancing patient survival rates and quality of life. This study lays the groundwork for future research in the application of RNA-sequencing data and ensemble machine learning techniques in clinical settings.

인공위성 원격 탐사 정보가 자료 기반 모형의 미계측 유역 하천유출 예측성능에 미치는 영향 분석 (Analysis of the Impact of Satellite Remote Sensing Information on the Prediction Performance of Ungauged Basin Stream Flow Using Data-driven Models)

  • 서지유;정하은;원정은;최시중;김상단
    • 한국습지학회지
    • /
    • 제26권2호
    • /
    • pp.147-159
    • /
    • 2024
  • 부족한 하천유출 관측 데이터는 모델 보정 작업을 어렵게 만들어 모델의 성능 향상을 제한한다. 위성 기반 원격탐사 자료는 수문 관련 데이터의 확보에 적극적으로 활용될 수 있으므로 새로운 대안이 될 수 있다. 최근에는 여러 연구를 통하여 기존의 개념적/물리적 모델보다는 인공지능을 이용한 해법이 더 적절하다는 평가를 받고 있다. 본 연구에서는 다양한 순환 신경망들과 의사결정나무 기반 알고리즘들을 결합한 자료 기반 접근 방식을 제안하였다. 또한 인공지능 학습을 위하여 인공위성 원격탐사 정보의 활용성을 조사하였다. 본 연구에서 위성영상은 MODIS와 SMAP의 자료가 사용된다. 공적으로 공개된 25개 유역의 자료를 사용하여 제안된 접근 방식을 검증하였다. 전통적인 지역화 접근법에서 착안하여 모든 유역의 자료를 통합하여 하나의 자료 기반 모델을 학습하는 전략을 채택하였으며, Leave-one-out cross-validation 지역화 설정을 이용하여 하나의 모델이 다양한 유역의 하천유출을 예측함으로써 제안된 접근 방식의 잠재력을 평가하였다. GRU + Light GBM 모델이 대상 유역에 적합한 모델 조합으로 판명되었으며(25개 미계측 유역 일 하천유량 예측 모형효율계수 평균 0.7187) 하천유출이 매우 작은 시기를 제외하면 우수한 미계측 유역의 하천유출 예측 성능을 보여주었다. 인공위성 원격탐사 정보의 영향력은 최대 10% 정도로 파악되었으며, 위성 정보의 추가 적용이 풍수기 또는 평수기보다는 저수기 또는 갈수기의 하천유출 예측에 더 큰 영향을 미쳤다.

Improved prediction of soil liquefaction susceptibility using ensemble learning algorithms

  • Satyam Tiwari;Sarat K. Das;Madhumita Mohanty;Prakhar
    • Geomechanics and Engineering
    • /
    • 제37권5호
    • /
    • pp.475-498
    • /
    • 2024
  • The prediction of the susceptibility of soil to liquefaction using a limited set of parameters, particularly when dealing with highly unbalanced databases is a challenging problem. The current study focuses on different ensemble learning classification algorithms using highly unbalanced databases of results from in-situ tests; standard penetration test (SPT), shear wave velocity (Vs) test, and cone penetration test (CPT). The input parameters for these datasets consist of earthquake intensity parameters, strong ground motion parameters, and in-situ soil testing parameters. liquefaction index serving as the binary output parameter. After a rigorous comparison with existing literature, extreme gradient boosting (XGBoost), bagging, and random forest (RF) emerge as the most efficient models for liquefaction instance classification across different datasets. Notably, for SPT and Vs-based models, XGBoost exhibits superior performance, followed by Light gradient boosting machine (LightGBM) and Bagging, while for CPT-based models, Bagging ranks highest, followed by Gradient boosting and random forest, with CPT-based models demonstrating lower Gmean(error), rendering them preferable for soil liquefaction susceptibility prediction. Key parameters influencing model performance include internal friction angle of soil (ϕ) and percentage of fines less than 75 µ (F75) for SPT and Vs data and normalized average cone tip resistance (qc) and peak horizontal ground acceleration (amax) for CPT data. It was also observed that the addition of Vs measurement to SPT data increased the efficiency of the prediction in comparison to only SPT data. Furthermore, to enhance usability, a graphical user interface (GUI) for seamless classification operations based on provided input parameters was proposed.

아차(兒茶)가 Cationic Bovine Serum Albumin 투여로 유발된 Membranous Nephropathy Mouse Model에 미치는 영향 (Effects of the Acasia Catechu Extract on the Membranous Nephropathy Induced by Cationic Bovine Serum Albumin in Mice)

  • 정기훈;조충식;김철중
    • 대한한방내과학회지
    • /
    • 제30권3호
    • /
    • pp.495-509
    • /
    • 2009
  • Objective : Membranous nephropathy(MN) is an organ-specific autoimmune disease and a relatively common cause of nephrotic syndrome in adults worldwide. But treatment of MN is not defined. This study was to evaluate the effects of Acasia Catechu extract(ACE) on the MN induced by cBSA in mice. Methods : Mice were divided into 4 groups. The normal group was injected with a saline solution. The control group was treated with cBSA(10 mg/kg i.p.) only. The third group was treated with cBSA (10 mg/kg i.p.) and ACE (250 mg/kg, p.o.). The fourth group was treated with cBSA (10mg/kg i.p.) and ACE (500mg/kg, p.o.). After cBSA and ACE treatment for 6 weeks, we measured change of body weight, 24hrs proteinuria, serum albumin, total cholesterol, triglyceride, BUN, creatinine, TNF-$\alpha$, IL-6, IL-$1{\beta}$, IFN-$\gamma$, IgA, IgM and IgG levels. The morphologic changes of renal glomeruli were also observed with a light microscope. Results : The levels of 24 hrs proteinuria, total cholesterol, triglyceride, IgG, IgM, IgA, TNF-$\alpha$, IL-6, IL-$1{\beta}$, IFN-$\gamma$ significantly decreased in both ACE groups. The level of albumin significantly increased in both ACE groups. The mRNA expression of IL-$1{\beta}$ in splenocytes considerably decreased in the ACE-500 group. In histological findings of kidney tissue, thickening of GBM decreased in both ACE groups. Conclusions : This study shows that ACE might be effective for treatment of MN. More clinical data and studies are to be done for efficient application.

  • PDF