• 제목/요약/키워드: XGBoost 알고리즘

검색결과 54건 처리시간 0.035초

토지 보상비 추정 모델 개발 - 건설CALS데이터와 공공데이터 중심으로 (Development of Land Compensation Cost Estimation Model : The Use of the Construction CALS Data and Linked Open Data)

  • 이상규;김진욱;서명배
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2020년도 제62차 하계학술대회논문집 28권2호
    • /
    • pp.375-378
    • /
    • 2020
  • 본 연구는 토지 보상비의 추정 모델 개발을 위해서 건설 CALS (Continuous Acquisition & Life-cycle Support) 시스템의 내부데이터와 개별공시지가 및 표준지 공시지가 등의 외부데이터, 그리고 개발된 추정 모델의 고도화를 위한 개별공시가 데이터를 기반으로 생성된 데이터를 활용하였다. 이렇게 수집된 3가지 유형의 데이터를 분석하기 위해서 기존 선형 모델 또는 의사결정나무 (Tree) 기반의 모델상 과적합 오류를 제거할 경우 매우 유용한 알고리즘으로 Decision Tree 기반의 Xgboost 알고리즘을 데이터 분석 방법론으로 토지 보상비 추정 모델 개발에 활용하였다. Xgboost 알고리즘의 고도화를 위해 하이퍼파라미터 튜닝을 적용한 결과, 실제 보상비와 개발된 보상비 추정 모델의 MAPE(Mean Absolute Percentage Error) 범위는 19.5%로 확인하였다.

  • PDF

악성코드 탐지를 위한 기계학습 알고리즘의 성능 비교 (Performance Comparison of Machine Learning Algorithms for Malware Detection)

  • 이현종;허재혁;황두성
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2018년도 제57차 동계학술대회논문집 26권1호
    • /
    • pp.143-146
    • /
    • 2018
  • 서명기반 악성코드 탐지는 악성 파일의 고유 해싱 값을 사용하거나 패턴화된 공격 규칙을 이용하므로, 변형된 악성코드 탐지에 취약한 단점이 있다. 기계 학습을 적용한 악성코드 탐지는 이러한 취약점을 극복할 수 있는 방안으로 인식되고 있다. 본 논문은 정적 분석으로 n-gram과 API 특징점을 추출해 특징 벡터로 구성하여 XGBoost, k-최근접 이웃 알고리즘, 지지 벡터 기기, 신경망 알고리즘, 심층 학습 알고리즘의 일반화 성능을 비교한다. 실험 결과로 XGBoost가 일반화 성능이 99%로 가장 우수했으며 k-최근접 이웃 알고리즘이 학습 시간이 가장 적게 소요됐다. 일반화 성능과 시간 복잡도 측면에서 XGBoost가 비교 대상 알고리즘에 비해 우수한 성능을 보였다.

  • PDF

선박 연료 공급 기기류의 장시간 운전 데이터의 고장 진단에 있어서 XGBoost 및 Conv1D의 예측 정확성 비교 (Comparison of Fault Diagnosis Accuracy Between XGBoost and Conv1D Using Long-Term Operation Data of Ship Fuel Supply Instruments)

  • 김형진;김광식;황세윤;이장현
    • 한국항해항만학회:학술대회논문집
    • /
    • 한국항해항만학회 2022년도 춘계학술대회
    • /
    • pp.110-110
    • /
    • 2022
  • 본 연구는 자율운항 선박의 원격 고장 진단 기법 개발의 일부로 수행되었다. 특히, 엔진 연료 계통 장비로부터 계측된 시계열 데이터로부터 상태 진단을 위한 알고리즘 구현 결과를 제시하였다. 엔진 연료 펌프와 청정기를 가진 육상 실험 장비로부터 진동 시계열 데이터 계측하였으며, 이상 감지, 고장 분류 및 고장 예측이 가능한 심층 학습(Deep Learning) 및 기계 학습(Machine Learning) 알고리즘을 구현하였다. 육상 실험 장비에 고장 유형 별로 인위적인 고장을 발생시켜 특징적인 진동 신호를 계측하여, 인공 지능 학습에 이용하였다. 계측된 신호 데이터는 선행 발생한 사건의 신호가 후행 사건에 영향을 미치는 특성을 가지고 있으므로, 시계열에 내포된 고장 상태는 시간 간의 선후 종속성을 반영할 수 있는 학습 알고리즘을 제시하였다. 고장 사건의 시간 종속성을 반영할 수 있도록 순환(Recurrent) 계열의 RNN(Recurrent Neural Networks), LSTM(Long Short-Term Memory models)의 모델과 합성곱 연산 (Convolution Neural Network)을 기반으로 하는 Conv1D 모델을 적용하여 예측 정확성을 비교하였다. 특히, 합성곱 계열의 RNN LSTM 모델이 고차원의 순차적 자연어 언어 처리에 장점을 보이는 모델임을 착안하여, 신호의 시간 종속성을 학습에 반영할 수 있는 합성곱 계열의 Conv1 알고리즘을 고장 예측에 사용하였다. 또한 기계 학습 모델의 효율성을 감안하여 XGBoost를 추가로 적용하여 고장 예측을 시도하였다. 최종적으로 연료 펌프와 청정기의 진동 신호로부터 Conv1D 모델과 XGBoost 모델의 고장 예측 성능 결과를 비교하였다

  • PDF

XGBoost 알고리즘을 활용한 강우의 음향 및 진동 분석 기반의 강우강도 산정 (Discerning the intensity of precipitation through acoustic and vibrational analysis of rainfall via XGBoost algorithm)

  • 황승현;이진욱;김현준;변종윤;전창현
    • 한국수자원학회:학술대회논문집
    • /
    • 한국수자원학회 2023년도 학술발표회
    • /
    • pp.209-209
    • /
    • 2023
  • 본 연구에서는 강우 시 발생하는 음향 및 진동 신호를 기반으로 강우강도를 산정하기 위한 방법론을 제안하였다. 먼저, Raspberry Pi, 콘덴서 마이크 및 가속도 센서로 구성된 관측 기기로부터 실제 비가 내리는 환경에서의 음향 및 진동 신호를 수집하였다. 가속도 센서로부터 계측된 진동 신호를 활용하여 강우 유무에 대한 이진 분류를 수행하고, 강우가 발생한 것으로 판단된 기간에 해당하는 음향 신호에 Short-Time Fourier Transform 기술을 적용하여 주파수 영역에서 나타나는 magnitude의 평균과 표준 편차, 최고 주파수 등의 특징을 기반으로 강우강도를 산정하였다. 이를 위해 앙상블 기반의 머신러닝 학습 모델인 XGBoost 알고리즘을 사용하였으며, 광학 우적계를 통해 관측한 강우강도와 산정 결과를 비교·평가하였다. 강우강도 산정 과정에서 사용된 음향 신호의 길이를 1초, 10초, 1분으로 구분하였으며, 무강우 기간 내 음향 정보로부터 배경 음향에 의한 노이즈를 제거하고자 하였다. 최종적으로 강우 유무 이진 분류 과정의 선행 여부, 음향 신호의 길이 및 노이즈 제거 방법에 따른 강우강도 산정 결과들에 대한 성능 비교를 통해 본 연구에서 제안하고자 하는 방법론의 실효성을 평가하였다.

  • PDF

A Design and Implement of Efficient Agricultural Product Price Prediction Model

  • Im, Jung-Ju;Kim, Tae-Wan;Lim, Ji-Seoup;Kim, Jun-Ho;Yoo, Tae-Yong;Lee, Won Joo
    • 한국컴퓨터정보학회논문지
    • /
    • 제27권5호
    • /
    • pp.29-36
    • /
    • 2022
  • 본 논문에서는 DACON에서 제공하는 데이터셋을 기반으로 한 효과적인 농산물 가격 예측 모델을 제안한다. 이 모델은 XGBoost와 CatBoost 이며 Gradient Boosting 계열의 알고리즘으로써 기존의 Logistic Regression과 Random Forest보다 평균정확도 및 수행시간이 우수하다. 이러한 장점들을 기반으로 농산물의 이전 가격들을 기반으로 1주, 2주, 4주뒤 가격을 예측하는 머신러닝 모델을 설계한다. XGBoost 모델은 회귀 방식의 모델링인 XGBoost Regressor 라이브러리를 사용하여 하이퍼 파라미터를 조정함으로써 가장 우수한 성능을 도출할 수 있다. CatBoost 모델은 CatBoost Regressor를 사용하여 모델을 구현한다. 구현한 모델은 DACON에서 제공하는 API를 이용하여 검증하고, 모델 별 성능평가를 실시한다. XGBoost는 자체적인 과적합 규제를 진행하기 때문에 적은 데이터셋에도 불구하고 우수한 성능을 도출하지만, 학습시간, 예측시간 등 시간적인 성능 면에서는 LGBM보다 성능이 낮다는 것을 알 수 있었다.

AI 기반환경의 주식 시세예측을 위한 성능 비교분석 시스템 (The Performance Comparative Analysis System for Stock Price Forecasting on AI Environment)

  • 이철현;오염덕
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2022년도 제65차 동계학술대회논문집 30권1호
    • /
    • pp.127-128
    • /
    • 2022
  • 최근 많은 증권사 및 다양한 금융사기업에서 투자자의 주식투자를 돕는 투자자문 인공지능, 로보어드바이저를 제안하고 활용한다. 본 논문에서는 증권사 등에서 사용되고 있는 주식 시세예측 알고리즘의 성능을 상호 비교분석한다. 주식 시계열 데이터 예측에 용이한 4가지의 인공지능 알고리즘인 LSTM, GRU, 딥Q 네트워크강화학습, XGBoost 알고리즘의 성능을 분석하고 비교하는 시스템을 구현하였다. 본 연구에서는 구현된 성능 분석 시스템을 통해 어떤 알고리즘이 주식 시세를 예측하고 활용하기 위해 가장 좋은 성능을 가졌는지 비교분석하고 해당 시스템의 결과분석이 주식예측에 어떠한 영향을 주는지를 평가한다.

  • PDF

머신러닝 학습 알고리즘을 이용한 광주천 수질 분석에 대한 예측 모델 연구 (A Study on the Prediction Model for Analysis of Water Quality in Gwangju Stream using Machine Learning Algorithm)

  • 정유정;이정재
    • 한국전자통신학회논문지
    • /
    • 제19권3호
    • /
    • pp.531-538
    • /
    • 2024
  • 수질 환경의 중요성이 강조되고 있는 가운데 광주광역시 도시 하천의 수질개선을 위한 수질 지표는 수생 생태계에 영향을 미치는 중요한 요소로 정확한 예측이 필요하다. 본 연구에서는 XGBoost와 LightGBM 머신러닝 알고리즘을 활용하여 광주천의 중요한 지점인 하류 평촌교(PyeongchonBr)와 상류 방학교(BangHakBr_Gwangjucheon1) 수계의 수질 검사 항목 중 통계적 검증 결과 유의미한 항목인 질소(TN), 질산염(NO3), 암모니아 양(NH3) 세 가지 수질 지표를 예측하는 연구를 수행하였고, 회귀 모델 평가 지표인 RMSE를 이용하여 예측 모델의 성능을 평가하였다. 수계별 개별적인 모델을 구현하여 교차 검증 후 성능을 비교한 결과, XGBoost 모델이 뛰어난 예측 능력을 보였다

반도체 공정에서 가상계측 위한 XGBoost 기반 예측모델 (XGBoost Based Prediction Model for Virtual Metrology in Semiconductor Manufacturing Process)

  • 한정석;김형근
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2022년도 춘계학술발표대회
    • /
    • pp.477-480
    • /
    • 2022
  • 반도체 성능 향상으로 신호를 전달하는 회로의 단위가 마이크로 미터에서 나노미터로 미세화되어 선폭(linewidth)이 점점 좁아지고 있다. 이러한 변화는 검출해야 할 불량의 크기가 작아지고, 정상 공정상태와 비정상 공정상태의 차이도 상대적으로 감소되어, 공정오차 및 공정조건의 허용범위가 축소되었음을 의미한다. 따라서 검출해야 할 이상징후 탐지가 더욱 어렵게 되어, 높은 정밀도와 해상도를 갖는 검사공정이 요구되고 있다. 이러한 이유로, 미세 공정변화를 파악할 수 있는 신규 검사 및 계측 공정이 추가되어 TAT(Turn-around Time)가 증가하게 되었고, 웨이퍼가 가공되어 완제품까지 도달하는데 필요한 공정시간이 증가하여 제조원가 상승의 원인으로 작용한다. 본 논문에서는 웨이퍼의 검계측 데이터가 아닌, 제조공정 과정에서 발생하는 다양한 센서 및 장비 데이터를 기반으로 웨이퍼 제조 결과가 양품인지 그렇지 않으면 불량인지 구별할 수 있는 가상계측 모델을 제안한다. 기계학습의 여러 알고리즘 중에서 다양한 장점을 갖는 XGBoost 알고리즘을 이용하여 예측모델을 구축하였고, 데이터 전처리(data-preprocessing), 주요변수 추출(feature selection), 모델 구축(model design), 모델 평가(model evaluation)의 순서로 연구를 수행하였다. 결과적으로 약 94% 이상의 정확성을 갖는 모형을 구축하는데 성공하였으나 더욱 높은 정확성을 확보하기 위해서는 반도체 공정과 관련된 Domain Knowledge 를 반영한 모델구축과 같은 추가적인 연구가 필요하다.

기계 학습 모델을 통해 XGBoost 기법을 활용한 부산 컨테이너 물동량 예측 (Forecasting the Busan Container Volume Using XGBoost Approach based on Machine Learning Model)

  • 웬티프엉타인;조규성
    • 사물인터넷융복합논문지
    • /
    • 제10권1호
    • /
    • pp.39-45
    • /
    • 2024
  • 항만 성능에 대한 정확한 평가는 컨테이너 물동량은 매우 중요한 요소이며, 효과적인 항만 개발 및 운영 전략에 대한 정확한 예측이 필수적이다. 하지만 해양 산업의 급격한 변화로 인해 컨테이너 물동량 예측의 정확성이 향상되기는 어렵다. 이를 해결하기 위해 사물인터넷(IoT)을 이용한 항만 성능에 미치는 영향을 분석하여 부산항의 경쟁력과 효율성을 향상시키기 위해 적용이 필요하다. 이에 본 연구에서는 부산항의 미래 컨테이너 물동량을 예측하기 위한 예측 모델을 개발하는 것을 목표로 이를 통해 항만 관리 기관의 개선된 의사 결정과 항만 생산성을 향상시키는 데 초점을 맞추고 있다. 항만 컨테이너 물동량을 예측하기 위해 본 연구에서는 기계 학습 모델의 Extreme Gradient Boosting (XGBoost) 기법을 도입하였다. XGBoost는 다른 알고리즘에 비해 높은 정확도, 빠른 학습 및 예측 속도,과적합을 방지하고 Feature Importance 제공하는 장점이 돋보인다. 특히 XGBoost는 회귀 예측 모델링에 직접 사용할 수 있어 기존 연구에서 제시된 물동량 예측 모델의 정확도 향상에 도움이 된다. 이를 통해 본 연구는 4.3% MAPE (Mean absolute percenture error) 값으로 제안된 방법이 컨테이너 물동량을 정확하고 신뢰성 있게 예측할 수 있다. 본 연구에서 제시한 방법론을 통해서 부산 컨테이너물동량의 정확성을 높일 수 있을 것으로 판단된다.

XGBoost 기반 침입탐지모델을 위한 데이터 스케일링 및 특성선택 기법 연구 (A study on data scaling and feature selection techniques for XGBoost-based intrusion detection model)

  • 김영원;이수진
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2022년도 제66차 하계학술대회논문집 30권2호
    • /
    • pp.251-254
    • /
    • 2022
  • 본 논문은 XGBoost 알고리즘 기반의 침입탐지모델의 성능을 향상하기 위한 스케일링(scaling) 및 특성선택(feature selection) 기법을 제안한다. 머신러닝 모델 개발 중 전처리 단계에서 스케일링 및 특성선택을 수행하면 데이터세트의 조건수가 감소하여 모델의 성능을 향상할 수 있다. 각 과정별로 다양한 기법이 있지만 기존의 연구에서는 이러한 기법들을 적용한 결과를 비교·분석하지 않고 특정 기법을 적용한 결과만을 나열하였고 스케일링 및 특성선택에 대해 최적의 조합은 제시하지 못하였다. 따라서 본 논문에서는 다양한 전처리 기법들의 적용결과를 비교하고 최적의 조합을 제안한다. 또한 기존의 연구들이 특정 데이터세트에만 적용 가능한 전처리 기법을 제안하는데 비해 본 논문은 다양한 데이터세트에 대해 공통적으로 적용 가능한 전처리 기법을 제안함으로써 제안 기법의 범용성과 실세계 적용 가능성을 증명한다.

  • PDF