• 제목/요약/키워드: Classification Accuracy Test

검색결과 393건 처리시간 0.026초

Multivariate Procedure for Variable Selection and Classification of High Dimensional Heterogeneous Data

  • Mehmood, Tahir;Rasheed, Zahid
    • Communications for Statistical Applications and Methods
    • /
    • 제22권6호
    • /
    • pp.575-587
    • /
    • 2015
  • The development in data collection techniques results in high dimensional data sets, where discrimination is an important and commonly encountered problem that are crucial to resolve when high dimensional data is heterogeneous (non-common variance covariance structure for classes). An example of this is to classify microbial habitat preferences based on codon/bi-codon usage. Habitat preference is important to study for evolutionary genetic relationships and may help industry produce specific enzymes. Most classification procedures assume homogeneity (common variance covariance structure for all classes), which is not guaranteed in most high dimensional data sets. We have introduced regularized elimination in partial least square coupled with QDA (rePLS-QDA) for the parsimonious variable selection and classification of high dimensional heterogeneous data sets based on recently introduced regularized elimination for variable selection in partial least square (rePLS) and heterogeneous classification procedure quadratic discriminant analysis (QDA). A comparison of proposed and existing methods is conducted over the simulated data set; in addition, the proposed procedure is implemented to classify microbial habitat preferences by their codon/bi-codon usage. Five bacterial habitats (Aquatic, Host Associated, Multiple, Specialized and Terrestrial) are modeled. The classification accuracy of each habitat is satisfactory and ranges from 89.1% to 100% on test data. Interesting codon/bi-codons usage, their mutual interactions influential for respective habitat preference are identified. The proposed method also produced results that concurred with known biological characteristics that will help researchers better understand divergence of species.

Effect Analysis of Worldview-3 SWIR Bands for Wetland Classification in Suncheon Bay, South Korea

  • Han, Youkyung;Jung, Sejung;Park, Honglyun;Choi, Jaewan
    • 한국측량학회지
    • /
    • 제36권5호
    • /
    • pp.371-379
    • /
    • 2018
  • Unlike general VHR (Very-High-Resolution) satellite sensors that are mainly for panchromatic and MS (Multispectral) imaging, Worldview-3 sensor additionally provides eight SWIR (Short Wavelength Infrared) bands in wavelength range from 1198 nm to 2365 nm. This study investigates the effect of informative Worldview-3 SWIR bands for wetland classification performance. Worldview-3 imagery acquired over Sunchon Bay, which is a coastal wetland located in South Korea, is used to implement the classification. Land-cover classes for the scene are determined by referring to national land-cover maps, which are provided by the Ministry of Environment, overlapped with the scene. After that, training data for each determined class are collected. In order to analyze the effect of SWIR bands, classifications with and without SWIR bands are carried out and the results are then compared. In this regard, a SVM (Support Vector Machine) is utilized as their classifier. As a result of the accuracy assessments performed by test data that are independently extracted from training data, it was confirmed that classification performance was improved when the SWIR bands are included as input features for SVM-based classification.

S-MTS를 이용한 강판의 표면 결함 진단 (Steel Plate Faults Diagnosis with S-MTS)

  • 김준영;차재민;신중욱;염충섭
    • 지능정보연구
    • /
    • 제23권1호
    • /
    • pp.47-67
    • /
    • 2017
  • 강판 표면 결함은 강판의 품질과 가격을 결정하는 중요한 요인 중 하나로, 많은 철강 업체는 그동안 검사자의 육안으로 강판 표면 결함을 확인해왔다. 그러나 시각에 의존한 검사는 통상 30% 이상의 판단 오류가 발생함에 따라 검사 신뢰도가 낮은 문제점을 갖고 있다. 따라서 본 연구는 Simultaneous MTS (S-MTS) 알고리즘을 적용하여 보다 지능적이고 높은 정확도를 갖는 새로운 강판 표면 결함 진단 시스템을 제안하였다. S-MTS 알고리즘은 단일 클래스 분류에는 효과적이지만 다중 클래스 분류에서 정확도가 떨어지는 기존 마할라노비스 다구찌시스템 알고리즘(Mahalanobis Taguchi System; MTS)의 문제점을 해결한 새로운 알고리즘이다. 강판 표면 결함 진단은 대표적인 다중 클래스 분류 문제에 해당하므로, 강판 표면 결함 진단 시스템 구축을 위해 본 연구에서는 S-MTS 알고리즘을 채택하였다. 강판 표면 결함 진단 시스템 개발은 S-MTS 알고리즘에 따라 다음과 같이 진행하였다. 첫째, 각 강판 표면 결함 별로 개별적인 참조 그룹 마할라노비스 공간(Mahalanobis Space; MS)을 구축하였다. 둘째, 구축된 참조 그룹 MS를 기반으로 비교 그룹 마할라노비스 거리(Mahalanobis Distance; MD)를 계산한 후 최소 MD를 갖는 강판 표면 결함을 비교 그룹의 강판 표면 결함으로 판단하였다. 셋째, 강판 표면 결함을 분류하는 데 있어 결함 간의 차이점을 명확하게 해주는 예측 능력이 높은 변수를 파악하였다. 넷째, 예측 능력이 높은 변수만을 이용해 강판 표면 결함 분류를 재수행함으로써 최종적인 강판 표면 결함 진단 시스템을 구축한다. 이와 같은 과정을 통해 구축한 S-MTS 기반 강판 표면 결함 진단 시스템의 정확도는 90.79%로, 이는 기존 검사 방법에 비해 매우 높은 정확도를 갖는 유용한 방법임을 보여준다. 추후 연구에서는 본 연구를 통해 개발된 시스템을 현장 적용하여, 실제 효과성을 검증할 필요가 있다.

한국어 언어 모델을 활용한 보이스피싱 탐지 기능 개선 (Exploiting Korean Language Model to Improve Korean Voice Phishing Detection)

  • ;박동주
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제11권10호
    • /
    • pp.437-446
    • /
    • 2022
  • 보이스피싱 통화 내용을 탐지하고 분류하는데 핵심 엔진으로 최신 머신러닝(ML) 및 딥러닝(DL) 알고리즘과 결합된 자연어 처리(NLP)의 텍스트 분류 작업이 널리 사용된다. 비대면 금융거래의 증가와 더불어 보이스피싱 통화 내용 분류에 대한 많은 연구가 진행되고 양호한 성과를 보이고 있지만, 최신 NLP 기술을 활용한 성능 개선의 필요성이 여전히 존재한다. 본 논문은 KorCCVi라는 레이블이 지정된 한국 보이스 피싱 데이터의 텍스트 분류를 기반으로 여러 다른 최신 알고리즘과 비교하여 사전 훈련된 한국어 모델 KoBERT의 한국 보이스 피싱 탐지 성능을 벤치마킹한다. 실험 결과에 따르면 KoBERT 모델의 테스트 집합에서 분류 정확도가 99.60%로 다른 모든 모델의 성능을 능가한다.

Machine Learning Methods to Predict Vehicle Fuel Consumption

  • Ko, Kwangho
    • 한국컴퓨터정보학회논문지
    • /
    • 제27권9호
    • /
    • pp.13-20
    • /
    • 2022
  • 본 연구에서는 주행 차량의 실시간 연료소모량을 예측할 수 있는 머신러닝 기법을 제안하고 그 특성을 분석하였다. 머신러닝 학습을 위해 실도로 주행을 실시하여 주행 속도, 가속도, 도로 구배와 함께 연료소모량을 측정하였다. 특성 데이터로 속도, 가속도, 도로구배를, 타깃으로 연료소모량을 지정하여 다양한 머신러닝 모델을 학습시켰다. 회귀법에 해당하는 K-최근접이웃회귀 및 선형회귀와 함께, 분류법에 해당하는 K-최근접이웃분류, 로지스틱회귀, 결정트리, 랜덤포레스트, 그래디언부스팅을 사용하였다. 실시간 연료소모량에 대한 예측 정확도는 0.5 ~ 0.6 수준으로 전반적으로 낮았고, 회귀법의 경우 분류법보다 정확도가 떨어졌다. 총연료소모량에 대한 예측 오차는 0.2 ~ 2.0% 수준으로 상당히 정확했고, 분류법보다 회귀법의 오차가 더 낮았다. 이는 예측 정확도의 기준으로 결정계수(R2)를 사용했기 때문인데, 이 값이 작을수록 타깃의 평균 부근에 예측치가 좁게 분포하기 때문이다. 따라서 실시간 연료소모량 예측에는 분류법이, 총연료소모량 예측에는 회귀법이 적합하다고 할 수 있다.

딥러닝 기반 작물 질병 탐지 및 분류 시스템 (Deep Learning-based system for plant disease detection and classification)

  • 고유진;이현준;정희자;위리;김남호
    • 스마트미디어저널
    • /
    • 제12권7호
    • /
    • pp.9-17
    • /
    • 2023
  • 작물의 병충해는 다양한 작물의 성장에 영향을 미치기 때문에 초기에 병충해를 식별하는 것이 매우 중요하다. 이미 많은 머신러닝(ML) 모델이 작물 병충해의 검사와 분류에 사용되었지만, 머신러닝의 부분 집합인 딥러닝(DL)이 발전을 이루면서 이 연구 분야에서 많은 진보가 있었다. 본 연구에서는 YOLOX 검출기와 MobileNet 분류기를 사용하여 비정상 작물의 병충해 검사 및 정상 작물에 대해서는 성숙도 분류를 진행하였다. 이 방법을 통해 다양한 작물 병충해 특징을 효과적으로 추출할 수 있으며, 실험을 위해 딸기, 고추, 토마토와 관련된 다양한 해상도의 이미지 데이터 셋을 준비하여 작물 병충해 분류에 사용하였다. 실험 결과에 따르면 복잡한 배경 조건을 가진 영상에서 평균 테스트 정확도가 84%, 성숙도 분류 정확도가 83.91% 임을 확인할 수 있었다. 이 모델은 자연 상태에서 3가지 작물에 대한 6가지 질병 검출 및 각 작물의 성숙도 분류를 효과적으로 진행할 수 있었다.

Identification of Cardiovascular Disease Based on Echocardiography and Electrocardiogram Data Using the Decision Tree Classification Approach

  • Tb Ai Munandar;Sumiati;Vidila Rosalina
    • International Journal of Computer Science & Network Security
    • /
    • 제23권9호
    • /
    • pp.150-156
    • /
    • 2023
  • For a doctor, diagnosing a patient's heart disease is not easy. It takes the ability and experience with high flying hours to be able to accurately diagnose the type of patient's heart disease based on the existing factors in the patient. Several studies have been carried out to develop tools to identify types of heart disease in patients. However, most only focus on the results of patient answers and lab results, the rest use only echocardiography data or electrocardiogram results. This research was conducted to test how accurate the results of the classification of heart disease by using two medical data, namely echocardiography and electrocardiogram. Three treatments were applied to the two medical data and analyzed using the decision tree approach. The first treatment was to build a classification model for types of heart disease based on echocardiography and electrocardiogram data, the second treatment only used echocardiography data and the third treatment only used electrocardiogram data. The results showed that the classification of types of heart disease in the first treatment had a higher level of accuracy than the second and third treatments. The accuracy level for the first, second and third treatment were 78.95%, 73.69% and 50%, respectively. This shows that in order to diagnose the type of patient's heart disease, it is advisable to look at the records of both the patient's medical data (echocardiography and electrocardiogram) to get an accurate level of diagnosis results that can be accounted for.

Estimating Prediction Errors in Binary Classification Problem: Cross-Validation versus Bootstrap

  • Kim Ji-Hyun;Cha Eun-Song
    • Communications for Statistical Applications and Methods
    • /
    • 제13권1호
    • /
    • pp.151-165
    • /
    • 2006
  • It is important to estimate the true misclassification rate of a given classifier when an independent set of test data is not available. Cross-validation and bootstrap are two possible approaches in this case. In related literature bootstrap estimators of the true misclassification rate were asserted to have better performance for small samples than cross-validation estimators. We compare the two estimators empirically when the classification rule is so adaptive to training data that its apparent misclassification rate is close to zero. We confirm that bootstrap estimators have better performance for small samples because of small variance, and we have found a new fact that their bias tends to be significant even for moderate to large samples, in which case cross-validation estimators have better performance with less computation.

전자정부내 의미기반 기술 도입에 따른 기능 및 정책 연구 (Research on Function and Policy for e-Government System using Semantic Technology)

  • 고광섭;장영철;이창훈
    • 한국디지털정책학회:학술대회논문집
    • /
    • 한국디지털정책학회 2007년도 춘계학술대회
    • /
    • pp.79-87
    • /
    • 2007
  • This paper aims to offer a solution based on semantic document classification to improve e-Government utilization and efficiency for people using their own information retrieval system and linguistic expression Generally, semantic document classification method is an approach that classifies documents based on the diverse relationships between keywords in a document without fully describing hierarchial concepts between keywords. Our approach considers the deep meanings within the context of the document and radically enhances the information retrieval performance. Concept Weight Document Classification(CoWDC) method, which goes beyond using exist ing keyword and simple thesaurus/ontology methods by fully considering the concept hierarchy of various concepts is proposed, experimented, and evaluated. With the recognition that in order to verify the superiority of the semantic retrieval technology through test results of the CoWDC and efficiently integrate it into the e-Government, creation of a thesaurus, management of the operating system, expansion of the knowledge base and improvements in search service and accuracy at the national level were needed.

  • PDF

핵석지반에서의 굴착난이도 평가방법 연구 (A Study to Determine the Degree of Difficulties with the Excavation of Corestone Weathering Profiles)

  • 이수곤;이벽규;김민성
    • 지질공학
    • /
    • 제17권1호
    • /
    • pp.89-99
    • /
    • 2007
  • 일반적으로 지반의 굴착난이도를 평가하기 위한 간단한 방법은 지반 내에 분포하는 암석강도와 절리발달빈도를 고려하는데, 이 방법은 핵석 풍화단면에 그대로 적용할 수가 없다. 그러므로 암석강도와 절리발달빈도 뿐만 아니라, 핵석의 분포상태 및 분포비율, 굴착의 공사가능성, 굴착의 효율성들을 모두 종합하여서 판단하여야 비교적 정확하게 굴착난이도 추정이 가능하다. 굴착난이도를 판단하는 가장 좋은 방법으로 알려진 현장에서의 탄성파탐사 측정방법은 실제로 현장에서 육안으로 지질 상태를 확인한 결과와 차이가 심하다. (평균 $3{\sim}4m$, 최대 6m 차이) 그러므로 육안관찰과 현장탄성파탐사 방법은 모두 장단점이 있으므로 핵석지질에서 보다 정확하게 굴착난이도를 추정하고자 하면, 현장에서 지질 상태를 육안으로 관찰하고 동시에 현장 탄성파탐사를 모두 사용하여서 그 결과들을 종합하여 굴착난이도를 분석하고 적용하여야 한다.