• 제목/요약/키워드: Improved Decision Tree

검색결과 83건 처리시간 0.024초

고혈압 예측을 위한 이상치 탐지 알고리즘 및 데이터 통합 기법 (An Outlier Detection Algorithm and Data Integration Technique for Prediction of Hypertension)

  • 홍고르출;김미혜 ;송미화
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2023년도 춘계학술발표대회
    • /
    • pp.417-419
    • /
    • 2023
  • Hypertension is one of the leading causes of mortality worldwide. In recent years, the incidence of hypertension has increased dramatically, not only among the elderly but also among young people. In this regard, the use of machine-learning methods to diagnose the causes of hypertension has increased in recent years. In this study, we improved the prediction of hypertension detection using Mahalanobis distance-based multivariate outlier removal using the KNHANES database from the Korean national health data and the COVID-19 dataset from Kaggle. This study was divided into two modules. Initially, the data preprocessing step used merged datasets and decision-tree classifier-based feature selection. The next module applies a predictive analysis step to remove multivariate outliers using the Mahalanobis distance from the experimental dataset and makes a prediction of hypertension. In this study, we compared the accuracy of each classification model. The best results showed that the proposed MAH_RF algorithm had an accuracy of 82.66%. The proposed method can be used not only for hypertension but also for the detection of various diseases such as stroke and cardiovascular disease.

Using Machine Learning Techniques for Accurate Attack Detection in Intrusion Detection Systems using Cyber Threat Intelligence Feeds

  • Ehtsham Irshad;Abdul Basit Siddiqui
    • International Journal of Computer Science & Network Security
    • /
    • 제24권4호
    • /
    • pp.179-191
    • /
    • 2024
  • With the advancement of modern technology, cyber-attacks are always rising. Specialized defense systems are needed to protect organizations against these threats. Malicious behavior in the network is discovered using security tools like intrusion detection systems (IDS), firewall, antimalware systems, security information and event management (SIEM). It aids in defending businesses from attacks. Delivering advance threat feeds for precise attack detection in intrusion detection systems is the role of cyber-threat intelligence (CTI) in the study is being presented. In this proposed work CTI feeds are utilized in the detection of assaults accurately in intrusion detection system. The ultimate objective is to identify the attacker behind the attack. Several data sets had been analyzed for attack detection. With the proposed study the ability to identify network attacks has improved by using machine learning algorithms. The proposed model provides 98% accuracy, 97% precision, and 96% recall respectively.

Hyperparameter Tuning Based Machine Learning classifier for Breast Cancer Prediction

  • Md. Mijanur Rahman;Asikur Rahman Raju;Sumiea Akter Pinky;Swarnali Akter
    • International Journal of Computer Science & Network Security
    • /
    • 제24권2호
    • /
    • pp.196-202
    • /
    • 2024
  • Currently, the second most devastating form of cancer in people, particularly in women, is Breast Cancer (BC). In the healthcare industry, Machine Learning (ML) is commonly employed in fatal disease prediction. Due to breast cancer's favorable prognosis at an early stage, a model is created to utilize the Dataset on Wisconsin Diagnostic Breast Cancer (WDBC). Conversely, this model's overarching axiom is to compare the effectiveness of five well-known ML classifiers, including Logistic Regression (LR), Decision Tree (DT), Random Forest (RF), K-Nearest Neighbor (KNN), and Naive Bayes (NB) with the conventional method. To counterbalance the effect with conventional methods, the overarching tactic we utilized was hyperparameter tuning utilizing the grid search method, which improved accuracy, secondary precision, third recall, and finally the F1 score. In this study hyperparameter tuning model, the rate of accuracy increased from 94.15% to 98.83% whereas the accuracy of the conventional method increased from 93.56% to 97.08%. According to this investigation, KNN outperformed all other classifiers in terms of accuracy, achieving a score of 98.83%. In conclusion, our study shows that KNN works well with the hyper-tuning method. These analyses show that this study prediction approach is useful in prognosticating women with breast cancer with a viable performance and more accurate findings when compared to the conventional approach.

Machine learning application to seismic site classification prediction model using Horizontal-to-Vertical Spectral Ratio (HVSR) of strong-ground motions

  • Francis G. Phi;Bumsu Cho;Jungeun Kim;Hyungik Cho;Yun Wook Choo;Dookie Kim;Inhi Kim
    • Geomechanics and Engineering
    • /
    • 제37권6호
    • /
    • pp.539-554
    • /
    • 2024
  • This study explores development of prediction model for seismic site classification through the integration of machine learning techniques with horizontal-to-vertical spectral ratio (HVSR) methodologies. To improve model accuracy, the research employs outlier detection methods and, synthetic minority over-sampling technique (SMOTE) for data balance, and evaluates using seven machine learning models using seismic data from KiK-net. Notably, light gradient boosting method (LGBM), gradient boosting, and decision tree models exhibit improved performance when coupled with SMOTE, while Multiple linear regression (MLR) and Support vector machine (SVM) models show reduced efficacy. Outlier detection techniques significantly enhance accuracy, particularly for LGBM, gradient boosting, and voting boosting. The ensemble of LGBM with the isolation forest and SMOTE achieves the highest accuracy of 0.91, with LGBM and local outlier factor yielding the highest F1-score of 0.79. Consistently outperforming other models, LGBM proves most efficient for seismic site classification when supported by appropriate preprocessing procedures. These findings show the significance of outlier detection and data balancing for precise seismic soil classification prediction, offering insights and highlighting the potential of machine learning in optimizing site classification accuracy.

상태레벨 공유를 이용한 MLLR 적응화의 회귀클래스 생성에 관한 연구 (A Study on Regression Class Generation of MLLR Adaptation Using State Level Sharing)

  • 오세진;성우창;김광동;노덕규;송민규;정현열
    • 한국음향학회지
    • /
    • 제22권8호
    • /
    • pp.727-739
    • /
    • 2003
  • 본 논문에서는 HM-Net (Hidden Markov Network)을 다양한 태스크에의 적용과 화자의 특성을 효과적으로 나타내기 위해 HM-Net 음성인식 시스템에 MLLR (Maximum Likelihood Linear Regression) 적응방법을 도입하였으며, HM-Net 학습 알고리즘을 개량하여 회귀클래스 생성방법을 제안한다. 제안방법은 PDT-SSS (Phonetic Decision Tree-based Successive State Splitting)알고리즘의 문맥방향 상태분할에 의한 상태레벨 공유를 이용한 방법이다. 즉, 문맥방향의 각 상태에 적응화자 음성데이터에 포함된 문맥정보를 분할하여 적응화될 음소환경을 결정하는 것이다. 따라서 제안방법은 새로운 화자로부터 문맥정보와 적응화 데이터의 발성 양에 의존하여 결정된 많은 적응 파라미터들을 (평균, 분산) 자유롭게 제어할 수 있게 된다. 제안방법의 유효성을 확인하기 위해 국어공학센터 (KLE) 452 데이터와 항공편 예약관련 (YNU200) 연속음성을 대상으로 인식실험을 수행한 결과, 음소인식, 단어인식, 연속음성인식에 대해서, 평균 34∼37%, 평균 9%, 평균 20%의 성능 향상을 각각 보였다. 또한 적응화 데이터의 양에 따른 인식성능 비교에서 제안방법을 적용한 인식 시스템이 적응 데이터의 양이 적은 경우에도 향상된 인식률을 보여 MLLR 적응방법의 특성을 만족하였다. 따라서 MLLR 적응방법을 도입한 HM-Net 음성인식 시스템에 제안한 회귀클래스 생성방법이 유효함을 확인할 수 있었다.

건강정보이해능력과 개인의 특성이 스마트 헬스케어 이용 경험에 미치는 요인 분석 (Factors Affecting Consumers' Experience of Using Smart Healthcare Focusing on Health Literacy and Personal Characteristics)

  • 김가은;박현준
    • 한국콘텐츠학회논문지
    • /
    • 제19권4호
    • /
    • pp.41-53
    • /
    • 2019
  • 헬스케어의 패러다임이 치료 중심에서 예방 중심으로 변화함에 따라, 질병 예방과 관련된 제품 및 서비스가 국내외로 많이 등장하고 있다. 스마트 헬스케어는 만성질환자 수의 증가, 의료비 부담의 증가 등의 보건의료 문제점의 대안으로 언급되어 기업 및 정부는 산업 확산 움직임을 보여주고 있다. 기업은 웨어러블 기기, 앱 등의 형태로 제품 개발 및 출시를 하고 있고, 정부는 보건소를 중심으로 모바일 헬스케어 사업을 시행하고 있다. 본 연구는 소비자의 스마트 헬스케어 제품 및 서비스 이용에 미치는 요인을 건강정보이해능력(Health Literacy)와 건강관련 개인특성을 중심으로 탐색적 연구를 진행하고, 정책적 시사점을 제공하고자 한다. 전국의 20대 이상 소비자 1,027명을 대상으로 온라인 설문조사를 실시하고 의사결정나무 기법으로 요인을 분석하였다. 연구 결과, 응답자의 대부분(76.9%)은 사용 경험이 없는 것으로 나타났지만 건강정보이해능력 중 '대중매체 정보의 활용'의 어려움 정도에 따라 사용 경험에 차이를 보였다. 그 밖에는 신기술 활용 의향 정도, 주변인의 조언 이해, 건강검진 유무가 관련이 있는 것으로 분석되었다. 스마트 헬스케어를 통한 자가 건강관리가 가능하려면, 건강정보를 대중매체로부터 탐색하고 활용할 수 있는 소비자의 건강정보이해능력이 제고되어야하며 이를 위한 정부와 기업의 노력이 필요하다.

GOCI 영상과 기계학습 기법을 이용한 Cochlodinium polykrikoides 적조 탐지 기법 연구 (Study on Detection for Cochlodinium polykrikoides Red Tide using the GOCI image and Machine Learning Technique)

  • 엥흐자리갈 운자야;박수호;황도현;정민지;김나경;윤홍주
    • 한국전자통신학회논문지
    • /
    • 제15권6호
    • /
    • pp.1089-1098
    • /
    • 2020
  • 본 연구에서는 적조 Cochlodinium Polykrikoide를 기계학습 방법과 정지궤도 해색위성 영상을 활용하여 탐지하는 방법을 제안한다. 기계학습 모형을 학습시키기 위해 GOCI Level2 자료를 활용하였으며, 국립수산과학원의 적조 속보 자료를 활용하였다. 기계학습 모델은 로지스틱 회귀모형, 의사결정나무 모형, 랜덤포래스트 모형을 사용하였다. 성능 평가 결과 기계학습을 사용하지 않은 전통적인 GOCI 영상 기반 적조 탐지 알고리즘(Son et al.,2012) (75%)과 비교해보았을 때 약 13~22%p (88~98%)의 정확도 향상을 확인할 수 있었다. 또한 기계학습 모형 간 탐지 성능을 비교 분석해본 결과 랜덤 포레스트 모형(98%)이 가장 높은 탐지 정확도를 보였다. 이러한 기계학습 기반 적조 탐지 알고리즘은 향후 적조를 조기에 탐지하고 그 이동과 확산을 추적 모니터링하는데 활용될 수 있을 것이라고 판단된다.

데이터 분포를 고려한 연속 값 속성의 이산화 (Discretization of Continuous-Valued Attributes considering Data Distribution)

  • 이상훈;박정은;오경환
    • 한국지능시스템학회논문지
    • /
    • 제13권4호
    • /
    • pp.391-396
    • /
    • 2003
  • 본 논문에서는 특정 매개변수(parameter)의 입력 없이 속성(attribute)에 따른 목적속성(class)값의 분포를 고려하여 연속형(continuous) 속성 값을 범주형(categorical)의 형태로 변환시키는 새로운 방법을 제안하였다. 각각의 속성에 대해 목적속성의 분포를 1차원 공간에 사상(mapping)하고, 각 목적속성의 밀도, 다른 목적속성과의 중복 정도 등의 기준에 따라 구간을 군집화 한다. 이렇게 생성된 군집들은 각각 목적속성을 예측할 수 있는 확률적 수치에 기반한 것으로, 각 속성이 제공하는 정보의 손실을 최소화 하는 이산화 경계선을 갖고 있다. 제안된 데이터 이산화 방법의 향상된 성능은 C4.5 알고리즘과 UCI Machine Learning Data Repository 데이터를 사용하여 확인할 수 있다.

출력 코딩 기반 다중 클래스 서포트 벡터 머신을 위한 특징 선택 기법 (A Novel Feature Selection Method for Output Coding based Multiclass SVM)

  • 이영주;이정진
    • 한국멀티미디어학회논문지
    • /
    • 제16권7호
    • /
    • pp.795-801
    • /
    • 2013
  • 서포트 벡터 머신은 뛰어난 일반화 성능에 힘입어 다양한 분야에서 의사 결정 나무나 인공 신경망에 비해 더 좋은 분류 성능을 보이고 있기 때문에 최근 널리 사용되고 있다. 서포트 벡터 머신은 기본적으로 이진 분류 문제를 위하여 설계되었기 때문에 서포트 벡터 머신을 다중 클래스 문제에 적용하기 위한 방법으로 다중 이진 분류기의 출력 결과를 이용하는 출력 코딩 방법이 주로 사용되고 있다. 그러나 출력 코딩 기반 서포트 벡터 머신에 사용된 기존 특징 선택 기법은 각 분류기의 정확도 향상을 위한 특징이 아니라 전체 분류 정확도 향상을 위한 특징을 선택하고 있다. 본 논문에서는 출력 코딩 기반 서포트 벡터 머신의 각 이진 분류기의 분류 정확도를 최대화하는 특징을 각각 선택하여 사용함으로써, 전체 분류 정확도를 향상시키는 특징 선택 기법을 제안한다. 실험 결과는 제안 기법이 기존 특징 선택 기법에 비하여 통계적으로 유의미한 분류 정확도 향상이 있었음을 보여주었다.

기계학습 응용 및 학습 알고리즘 성능 개선방안 사례연구 (A Case Study on Machine Learning Applications and Performance Improvement in Learning Algorithm)

  • 이호현;정승현;최은정
    • 디지털융복합연구
    • /
    • 제14권2호
    • /
    • pp.245-258
    • /
    • 2016
  • 본 논문에서는 기계학습과 관련된 다양한 사례들에 대한 연구를 바탕으로 기계학습 응용 및 학습 알고리즘의 성능 개선 방안을 제시한다. 이를 위해 기계학습 기법을 적용하여 결과를 얻어낸 문헌을 자료로 수집하고 학문분야로 나누어 각 분야에서 적합한 기계학습 기법을 선택 및 추천하였다. 공학에서는 SVM, 의학에서는 의사결정나무, 그 외 분야에서는 SVM이 빈번한 이용 사례와 분류/예측의 측면에서 그 효용성을 보였다. 기계학습의 적용 사례분석을 통해 응용 방안의 일반적 특성화를 꾀할 수 있었다. 적용 단계는 크게 3단계로 이루어진다. 첫째, 데이터 수집, 둘째, 알고리즘을 통한 데이터 학습, 셋째, 알고리즘에 대한 유의미성 테스트 이며, 각 단계에서의 알고리즘의 결합을 통해 성능을 향상시킨다. 성능 개선 및 향상의 방법은 다중 기계학습 구조 모델링과 $+{\alpha}$ 기계학습 구조 모델링 등으로 분류한다.