• 제목/요약/키워드: 분류적중률

검색결과 35건 처리시간 0.037초

불균형 데이터 집합의 분류를 위한 하이브리드 SVM 모델 (A Hybrid SVM Classifier for Imbalanced Data Sets)

  • 이재식;권종구
    • 지능정보연구
    • /
    • 제19권2호
    • /
    • pp.125-140
    • /
    • 2013
  • 어떤 클래스에 속한 레코드의 개수가 다른 클래스들에 속한 레코드의 개수보다 매우 많은 경우에, 이 데이터 집합을 '불균형 데이터 집합'이라고 한다. 데이터 분류에 사용되는 많은 기법들은 이러한 불균형 데이터에 대해서 저조한 성능을 보인다. 어떤 기법의 성능을 평가할 때에 적중률뿐만 아니라, 민감도와 특이도도 함께 측정하여야 한다. 고객의 이탈을 예측하는 문제에서 '유지' 레코드가 다수 클래스를 차지하고, '이탈' 레코드는 소수 클래스를 차지한다. 민감도는 실제로 '유지'인 레코드를 '유지'로 예측하는 비율이고, 특이도는 실제로 '이탈'인 레코드를 '이탈'로 예측하는 비율이다. 많은 데이터 마이닝 기법들이 불균형 데이터에 대해서 저조한 성능을 보이는 것은 바로 소수 클래스의 적중률인 특이도가 낮기 때문이다. 불균형 데이터 집합에 대처하는 과거 연구 중에는 소수 클래스를 Oversampling하여 균형 데이터 집합을 생성한 후에 데이터 마이닝 기법을 적용한 연구들이 있다. 이렇게 균형 데이터 집합을 생성하여 예측을 수행하면, 특이도는 다소 향상시킬 수 있으나 그 대신 민감도가 하락하게 된다. 본 연구에서는 민감도는 유지하면서 특이도를 향상시키는 모델을 개발하였다. 개발된 모델은 Support Vector Machine (SVM), 인공신경망(ANN) 그리고 의사결정나무 기법 등으로 구성된 하이브리드 모델로서, Hybrid SVM Model이라고 명명하였다. 구축과정 및 예측과정은 다음과 같다. 원래의 불균형 데이터 집합으로 SVM_I Model과 ANN_I Model을 구축한다. 불균형 데이터 집합으로부터 Oversampling을 하여 균형 데이터 집합을 생성하고, 이것으로 SVM_B Model을 구축한다. SVM_I Model은 민감도에서 우수하고, SVM_B Model은 특이도에서 우수하다. 입력 레코드에 대해서 SVM_I와 SVM_B가 동일한 예측치를 도출하면 그것을 최종 해로 결정한다. SVM_I와 SVM_B가 상이한 예측치를 도출한 레코드에 대해서는 ANN과 의사결정나무의 도움으로 판별 과정을 거쳐서 최종 해를 결정한다. 상이한 예측치를 도출한 레코드에 대해서는, ANN_I의 출력값을 입력속성으로, 실제 이탈 여부를 목표 속성으로 설정하여 의사결정나무 모델을 구축한다. 그 결과 다음과 같은 2개의 판별규칙을 얻었다. 'IF ANN_I output value < 0.285, THEN Final Solution = Retention' 그리고 'IF ANN_I output value ${\geq}0.285$, THEN Final Solution = Churn'이다. 제시되어 있는 규칙의 Threshold 값인 0.285는 본 연구에서 사용한 데이터에 최적화되어 도출된 값이다. 본 연구에서 제시하는 것은 Hybrid SVM Model의 구조이지 특정한 Threshold 값이 아니기 때문에 이 Threshold 값은 대상 데이터에 따라서 얼마든지 변할 수 있다. Hybrid SVM Model의 성능을 UCI Machine Learning Repository에서 제공하는 Churn 데이터 집합을 사용하여 평가하였다. Hybrid SVM Model의 적중률은 91.08%로서 SVM_I Model이나 SVM_B Model의 적중률보다 높았다. Hybrid SVM Model의 민감도는 95.02%이었고, 특이도는 69.24%이었다. SVM_I Model의 민감도는 94.65%이었고, SVM_B Model의 특이도는 67.00%이었다. 그러므로 본 연구에서 개발한 Hybrid SVM Model이 SVM_I Model의 민감도 수준은 유지하면서 SVM_B Model의 특이도보다는 향상된 성능을 보였다.

사용자 주도 폼 다이얼로그 시스템의 VoiceXML 어플리케이션에 관한 연구 (A Study on VoiceXML Application of User-Controlled Form Dialog System)

  • 권형준;노용완;이현구;홍광석
    • 정보처리학회논문지B
    • /
    • 제14B권3호
    • /
    • pp.183-190
    • /
    • 2007
  • VoiceXML은 음성을 통해 웹 자원 탐색을 제공하기 위한 목적으로 설계된 XML 기반의 새로운 마크업 언어이다. VoiceXML로 만들어진 어플리케이션은 기계 주도 폼 다이얼로그 구조와 상호 주도 폼 다이얼로그 구조로 분류된다. 이와 같은 다이얼로그 구조들은 어플리케이션 개발자에 의해 서비스 시나리오가 결정되기 때문에 사용자가 자유롭게 웹 자원을 탐색하는 서비스를 구축할 수 없다. 본 논문에서는 사용자의 의도에 따라 서비스 시나리오가 결정되는 음성 웹 서비스의 구축을 위해 사용자 주도 폼 다이얼로그 시스템의 VoiceXML 어플리케이션 구조를 제안한다. 제안하는 어플리케이션은 사용자에 의해 요청된 정보로부터 인식 후보들을 자동적으로 검출하여 음성 앵커로 사용하고 각각의 음성 앵커론 새로운 음성 노드로 연결한다. 제안하는 시스템의 예로 IT 용어사전을 내장한 뉴스 서비스를 구현하여 음성 앵커의 검출 및 등록 여부를 확인하였고, 음성 인식률 및 사용자가 의도한 정보를 성공적으로 제공했는지 판단하는 척도가 되는 적중률과 응답 속도를 측정하였다. 실험 결과, 제안한 시스템이 기존의 VoiceXML 폼 다이얼로그 구조의 시스템보다 더 자유로운 웹 자원의 탐색이 가능함을 확인하였다.

지식재산권이 기업의 경영성과에 미치는 영향에 대한 실증연구: 특허권을 중심으로 (An empirical study on the impact of intellectual property rights on the management performance of companies: focusing on patent rights)

  • 양창용;홍정완;유연우
    • 한국융합학회논문지
    • /
    • 제12권6호
    • /
    • pp.173-181
    • /
    • 2021
  • 그동안은 규모가 큰 기업 위주의 분석과 과거 경영실적과 특허권의 관계위주의 분석을 했으나, 본 연구에서는 실증분석을 통해 중소기업을 대상으로 특허를 보유한 기업의 미래 매출액 변동성에 대해 살펴보았다. 본 연구에서는 지식재산권인 특허권의 양적가치와 질적가치가 기업경영성과에 미치는 영향을 분석하였다. 특허의 양적가치로는 특허의 수를, 질적가치는 특허평균점수를 기업경영성과로는 평균매출액증가율을 사용하였다. SPSS를 이용한 판별분석을 통해 2가지 독립변수 모두 평균매출액 증가율이 2배 이상인 기업과 2배 미만인 기업을 구분하는데 유의적인 변수임을 확인하였다. 따라서 특허권 보유 중소기업에 대해 보증심사나 여신심사시 본 연구결과를 이용하여 향후 매출액이 어떻게 변경될지에 대한 분석의 틀을 이해관계자에게 제공한다는데 의의가 있다.

IT자산 장애처리의 사전 예측을 위한 기계학습 프로세스 (Machine Learning Process for the Prediction of the IT Asset Fault Recovery)

  • 문영준;류성열;최일우
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제2권4호
    • /
    • pp.281-290
    • /
    • 2013
  • IT자산은 조직의 경영목적을 지원해주는 핵심영역이며, IT자산의 장애 발생시 신속한 처리를 지원하는 것은 매우 중요하다. 본 연구에서는 IT자산의 장애가 발생할 경우, 장애해결을 위하여 기존의 장애 데이터를 기초로 장애처리 예측 기법을 제시한다. 제안한 장애처리 예측 기법은 첫째, 기존의 장애처리 데이터를 전처리하여 장애처리 유형별로 분류하고 둘째, 분류된 장애처리 유형과 장애 발생 후 접수된 내용을 키워드 매핑시키는 규칙을 제정하였으며 셋째, 제정된 규칙에 의하여 장애 발생 후 장애처리 방법이 사전에 예측 가능한 기계학습 프로세스를 제시하였다. 제시한 기계학습 프로세스의 유효성을 입증하기 위하여 A사에서 6개월 동안 접수된 33,000여건의 전산기기 장애 데이터를 실험한 결과 장애처리 예측의 적중률이 약 72%였으며, 지속적인 기계학습을 통하여 81%로 향상되었다.

디지털 운행기록에 근거한 시내버스 운전자의 사고발생 예측모형 개발 (Development for City Bus Dirver's Accident Occurrence Prediction Model Based on Digital Tachometer Records)

  • 김정열;금기정
    • 한국ITS학회 논문지
    • /
    • 제15권1호
    • /
    • pp.1-15
    • /
    • 2016
  • 본 연구는 시내버스 운전자의 실제 운행기록 정보를 토대로 사고발생 가능성을 내포한 운전자를 판단할 수 있는 모형개발을 목적으로 하였다. 본 연구를 위하여 사고발생 운전자 및 사고 미발생 운전자의 실제 운행기록 정보에서 교통사고와 관련한 유의변수를 도출하는 한편, 판별분석(Discriminant Analysis) 및 로지스틱회귀분석(Logistic Regression Analysis)을 적용하여 개발된 분류모형에 대한 모형간 정확도를 비교하였다. 또한, 개발된 모형을 다른 운전자들의 운행기록자료에 적용하여 모형의 정확도를 검증하였다. 사고발생 가능성을 내포한 운전자 분류모형을 개발한 결과 감속도($X_{deceleration}$) 및 우측방향 가속도($Y_{right}$)가 동시에 작용할 때 이 변수가 사고발생 운전자 분류의 최적 요인변수로 도출되었으며, 판별분석에 의한 예측모형은 최대 62.8%, 로지스틱회귀분석에 의한 예측모형은 최대 76.7%의 비율로 사고 발생 운전자 분류가 가능한 것으로 나타났다. 또한, 모형 예측력에 대한 검증결과 84.1%의 적중률을 보이는 것으로 나타났다.

기상예보자료 기반의 농업용저수지 저수율 전망을 위한 나이브 베이즈 분류 및 다중선형 회귀모형 개발 (Development of Naïve-Bayes classification and multiple linear regression model to predict agricultural reservoir storage rate based on weather forecast data)

  • 김진욱;정충길;이지완;김성준
    • 한국수자원학회논문집
    • /
    • 제51권10호
    • /
    • pp.839-852
    • /
    • 2018
  • 본 연구의 목적은 기상자료(강수량, 최고기온, 최저기온, 평균기온, 평균풍속) 기반의 다중선형 회귀모형을 개발하여 농업용저수지 저수율을 예측하는 것이다. 나이브 베이즈 분류를 활용하여 전국 1,559개의 저수지를 지리형태학적 제원(유효저수량, 수혜면적, 유역면적, 위도, 경도 및 한발빈도)을 기준으로 30개 군집으로 분류하였다. 각 군집별로, 기상청 기상자료와 한국농어촌공사 저수지 저수율의 13년(2002~2014) 자료를 활용하여 월별 회귀모형을 유도하였다. 저수율의 회귀모형은 결정계수($R^2$)가 0.76, Nash-Sutcliffe efficiency (NSE)가 0.73, 평균제곱근오차가 8.33%로 나타났다. 회귀모형은 2년(2015~2016) 기간의 기상청 3개월 기상전망자료인 GloSea5 (GS5)를 사용하여 평가되었다. 현재저수율과 평년저수율에 의해 산정되는 저수지 가뭄지수(Reservoir Drought Index, RDI)에 의한 ROC (Receiver Operating Characteristics) 분석의 적중률은 관측값을 이용한 회귀식에서 0.80과 GS5를 이용한 회귀식에서 0.73으로 나타났다. 본 연구의 결과를 이용해 미래 저수율을 전망하여 안정적인 미래 농업용수 공급에 대한 의사결정 자료로 사용할 수 있을 것이다.

이미지 생성을 위해 노이즈를 이용한 GAN 시스템 (GAN System Using Noise for Image Generation)

  • 배상중;김민규;정회경
    • 한국정보통신학회논문지
    • /
    • 제24권6호
    • /
    • pp.700-705
    • /
    • 2020
  • 생성적 적대 신경망(GAN, Generative Adversarial Network)은 두 개의 신경망을 대립하여 이미지를 생성하는 방법이다. 이미지를 생성할 때 랜덤으로 생성한 노이즈를 재배열하여 이미지를 생성하는데 이러한 방법으로 생성된 이미지는 노이즈에 따라 생성이 잘 이루어지지 않고, 이미지의 픽셀이 적은 경우 제대로 된 이미지를 생성하기 어렵다는 문제점이 발생할 수 있다. 또한 데이터 분류에서 데이터가 쌓이는 속도와 크기가 증가되는데 이들을 라벨링하는 데는 많은 어려움이 있다. 본 논문에서는 이를 해결하기 위해 랜덤으로 생성하던 노이즈에 실제 데이터를 사용하여 노이즈를 생성하고 이를 기반으로 이미지를 생성하는 기법을 제안한다. 제안하는 시스템은 기존에 있는 이미지를 기반으로 하는 이미지를 생성하는 것이므로 좀 더 자연스러운 이미지의 생성이 가능하다는 것을 확인하였고 이를 학습에 이용할 경우 기존의 생성적 적대 신경망을 사용한 방법보다 더 높은 적중률을 보임을 확인하였다.

무인항공기를 이용한 소나무재선충병 선단지 예찰 기법: 세종특별자치시를 중심으로 (Use of Unmanned Aerial Vehicle for Forecasting Pine Wood Nematode in Boundary Area: A Case Study of Sejong Metropolitan Autonomous City)

  • 김명준;방홍석;이준우
    • 한국산림과학회지
    • /
    • 제106권1호
    • /
    • pp.100-109
    • /
    • 2017
  • 본 연구는 세종특별자치시 소나무재선충병(PWN) 피해지의 선단지에 대해서 무인항공기를 이용하여 효율적인 예찰 및 방제사업 지원을 실시하기 위해 수행되었다. 선단지를 중심으로 2016년 2월 15일부터 약 2주간 6개 구역 총 2,284 ha의 면적에 대해 무인항공 촬영을 실시하여 GSD (Ground Sample Distance) 12 cm의 고품질 정사영상 6매를 제작하였다. 정사영상을 바탕으로 1차 피해 의심목 분류를 실시한 결과 총 423본이 분류되었다. 그러나 촬영시기의 계절적 특성, 임상의 다양성 등의 문제로 인해 적중률이 낮아짐에 따라 1차 분류 결과와 스냅사진, 비행정보 등을 활용하여 2차 재분류를 실시하였으며, 이를 통해 피해 의심목 423본 중 231본을 추출하였다. 추출된 231본에 대해 대상지별 주제도를 제작하고 GNSS 등을 이용하여 현장조사를 실시하였으며, 그 결과 총 23본의 피해 의심목을 추출하였다. 현장조사를 통해 추출된 23본에 대해 시료를 채취하여 관련기관에 검증을 의뢰한 결과 23본 모두 소나무재선충병에 감염된 것으로 나타났다. 소나무재선충병 피해목의 분포 특성을 분석한 결과 활엽수림 14본, 침엽수림 4본, 소나무림 3본, 리기다소나무림 2본 등 다양한 임상에서 피해목이 검출된 것으로 나타났다. 무인항공기를 활용하여 항공촬영에서부터 현장조사까지의 과정에 대해 효율성 분석을 실시한 결과 2.3인의 인력으로 6일에 걸쳐 수행한 것으로 분석되었다.

로지스틱 회귀분석을 이용한 임도붕괴 위험도 평가 (Assessment of Slope Failures Potential in Forest Roads using a Logistic Regression Model)

  • 백승안;조구현;황진성;정도현;박진우;최병구;차두송
    • 한국산림과학회지
    • /
    • 제105권4호
    • /
    • pp.429-434
    • /
    • 2016
  • 임도 사면의 붕괴는 환경적 피해 뿐 만 아니라 사회 경제적 손실을 발생시킨다. 본 연구는 2013년 집중호우로 임도 붕괴가 발생한 강원도 홍천군 화촌면 지역을 대상으로 GIS의 속성정보와 로지스틱 회귀분석을 이용하여 임도 붕괴지 위험도 평가를 실시하였다. 로지스틱 회귀분석결과, 토성이 사토인 지역의 회귀계수는 6.616으로 임도붕괴에 가장 위험성이 높았으며, 경급이 중경목인 지역의 경우 회귀계수가 -3.282로 임도사면의 안정성이 높았다. 임도 붕괴지의 정오분류결과는 74.6%의 분류정확도를 보였다. 로지스틱 회귀모델식을 이용하여 전 구간을 대상으로 적용해 본 결과, 임도붕괴지의 경우 0.5의 기준점 보다 높은 0.7이상의 구간에서 가장 많이 분포하여 붕괴가능성이 높은 것으로 나타났다. 임도 위험도 평가의 판별적중률로 볼 때 임도의 산림환경 및 입지인자의 분석을 통해서도 충분한 붕괴위험 평가가 가능할 것으로 사료된다.

농업용 저수지의 수질 예측 모델을 위한 PSO(Particle Swarm Optimization) 알고리즘의 적용 (Application of Particle Swarm Optimization(PSO) for Prediction of Water Quality in Agricultural Reservoirs of Korea)

  • 권용수;배미정;황순진;박영석
    • 생태와환경
    • /
    • 제41권spc호
    • /
    • pp.11-20
    • /
    • 2008
  • 본 연구에서는 농림부와 환경부의 전국수질측정망 자료를 이용하여 2002년 9월 전후에 조사된 전국 290개 농업용 저수지의 Chl-${\alpha}$ 농도를 예측하였다. 우리나라 290개 농업용 저수지의 9월 전후 영양상태를 분류한 결과, 부영양 상태 이상을 나타내는 저수지가 $TSI_{CHL}\;64.1%,\;TSI_{TP}\;75.5%$로 대부분의 저수지가 높은 부영양화 상태를 보였다. 이렇게 분류된 저수지의 영양 상태를 환경특성에 따라 판별분석을 실시하였다. 그 결과 전체 판별적중률은 약 60%를 보였다. 판별분석의 결과에 정준분석을 실시한 결과, 각 그룹은 영양상태에 따라 구분이 되었으며, COD, DO, TP등이 중요한 인자로 나타났다. 또한 MLP-PSO 모델을 이용하여 부영양화에 따른 저수지 수질을 예측한 결과 높은 예측력을 보였으며 (r=0.831, p<0.05), 민감도 분석 결과 COD와 TP가 상대적으로 가장 중요한 요인으로 작용하였으며, 고도 및 제방 높이는 음의 영향을 미치는 것으로 나타났다.