• 제목/요약/키워드: 데이터 분포 불균형

검색결과 54건 처리시간 0.026초

전동킥보드 통행분포모형 추정을 위한 적정 존단위 선정 연구 (How to Set an Appropriate Scale of Traffic Analysis Zone for Estimating Travel Patterns of E-Scooter in Transporation Planning?)

  • 김규혁;김상훈;송태진
    • 한국ITS학회 논문지
    • /
    • 제22권3호
    • /
    • pp.51-61
    • /
    • 2023
  • 정확한 전동킥보드 중장기수요예측은 지역별 수요공급 불균형 문제해결 및 MaaS 등 연계교통체계 마련을 위해 필요하다. 공유 전동킥보드의 지역별 발생-유입량을 예측하는 연구는 많지만, 공유 전동킥보드의 존간 통행분포를 예측하는 연구는 전무한 실정이다. 본 연구에서는 공유 전동킥보드의 통행분포모형 추정을 위한 적정 존단위를 선정하고자 하였다. 분석 대상 존단위는 250m, 500m, 750m, 1,000m 정사각형 그리드로 설정하였다. 공유 전동킥보드 이용 이력 데이터는 각 공간 단위별 통행거리, 통행시간 계산 및 중력모형 도출을 위해 활용되었다. 평균제곱오차는 각 중력모형의 적정성을 검증하는데 활용되었다. 분석 결과, 250m 그리드가 실제 공유킥보드 통행분포를 가장 잘 묘사하는 것으로 나타났다.

교차 프로젝트 결함 예측 성능 향상을 위한 효과적인 하모니 검색 기반 비용 민감 부스팅 최적화 (Effective Harmony Search-Based Optimization of Cost-Sensitive Boosting for Improving the Performance of Cross-Project Defect Prediction)

  • 류덕산;백종문
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제7권3호
    • /
    • pp.77-90
    • /
    • 2018
  • 소프트웨어 결함 예측(SDP)은 결함이 있는 모듈을 식별하기 위한 연구 분야이다. 충분한 로컬 데이터가 없으면 다른 회사에서 수집한 데이터를 사용하여 분류기를 구축하는 교차 프로젝트 결함 예측(CPDP)을 활용할 수 있다. SDP에 대한 대부분의 기계 학습 알고리즘은 서로 다른 값에 따라 예측 성능에 큰 영향을 미치는 하나 이상의 매개 변수를 사용한다. 본 연구의 목적은 CPDP의 예측 성능 향상을 위해 매개 변수 선택 기법을 제안하는 것이다. Harmony Search 알고리즘을 사용하여, 예측 어려움을 야기하는 클래스 불균형을 해결하는 방법인 비용에 민감한 부스팅의 매개 변수를 조정한다. 분포 특성에 따라 매개 변수 범위와 매개 변수 간의 제한 조건 규칙이 정의되어 하모니 검색 알고리즘에 적용된다. 제안된 접근법은 15개의 대상 프로젝트를 대상으로 3개의 CPDP 모델과 내부프로젝트 결함 예측(WPDP) 모델을 비교한다. 실험 결과는 제안된 방법이 클래스 불균형의 맥락에서 다른 CPDP 방법보다 성능이 우수하다는 것을 보여준다. 이전의 연구에서는 탐지 확률이 낮거나 오보 가능성이 높았으나 우리의 기법은 높은 PD와 낮은 PF를 제공하면서 높은 전체 성능을 보였다. 또한 WPDP와 비슷한 성능을 제공하였다.

신용카드 사기 검출을 위한 비용 기반 학습에 관한 연구 (Cost-sensitive Learning for Credit Card Fraud Detection)

  • 박래정
    • 한국지능시스템학회논문지
    • /
    • 제15권5호
    • /
    • pp.545-551
    • /
    • 2005
  • 사기 검출의 주목적은 사기 거래로 인해 발생하는 손실을 최소화하는 것이다. 하지만, 사기 검출 문제의 특이한 속성, 즉 불균형하고 중첩이 심한 클래스 분포와 비균일한 오분류 비용으로 인해, 실제로 희망하는 거절율 동작 영역에서의 분류비용 측면의 최적 분류기를 생성하는 것이 용이하지 않다. 본 논문에서는, 특정 동작 영역에서의 분류기의 분류 비용을 정의하고, 진화 탐색을 이용하여 이를 직접적으로 최적화함으로써, 실제 신용카드 사기 검출에 적합한 분류기를 학습할 수 있는 비용 기반 학습 방법을 제시한다. 신용카드 거래 데이터를 사용한 실험을 통해, 제시한 방법이 타 학습 방법에 비해 비용에 민감한 분류기를 학습할 수 있는 효과적인 방법임을 보인다.

Aqueduct 3.0과 Water Conflict Chronology를 활용한 한국의 수자원 및 물 분쟁 사례 분석 (Analysis of Water Resources and Water Conflicts in Korea using Aqueduct 3.0 and Water Conflict Chronology)

  • 이준학
    • 한국수자원학회:학술대회논문집
    • /
    • 한국수자원학회 2023년도 학술발표회
    • /
    • pp.395-395
    • /
    • 2023
  • 전 세계 곳곳에서 매년 발생하고 있는 홍수, 가뭄, 수질 문제는 인류가 해결해야 할 공통적인 문제이다. 홍수, 가뭄, 수질 문제뿐만 아니라 수자원의 지역적인 불균형과 인근 지역의 물 분배 문제, 공유하천 문제 등으로 인한 물 사용자 간의 물 갈등, 물 분쟁도 지속되고 있다. 최근 정보통신기술이 발달함에 따라 수자원 관련 각종 위험지표, 물 갈등, 물 분쟁 사례를 자료화하여 활용할 수 있는 온라인 플랫폼이 개발되고 있다. Aqueduct 3.0은 전 세계 물 위험을 식별하고 평가할 수 있는 물 위험평가 프로그램(water risk assessment tool)으로 세계 수자원 협회에서 2019년 기존 프로그램을 업데이트하여, 온라인 플랫폼을 통해 전 세계 각국의 지역별 수자원 분포에 따른 각종 위험지도와 데이터를 무료로 제공하고 있다. 또한 세계 자연기금(World Wide Fund For Nature)도 온라인 플랫폼으로 전 세계의 물 위험 필터도구(water risk filter tool)를 제공하고 있다. 또한 물 갈등 연대기(Water Conflict Chronology)는 태평양 협회에서 전 세계 물갈등 사례를 수집하여 연대별로 정리한 것으로, 업데이트되어 2022년 사례까지 제공하고 있다. 본 연구는 Aqueduct와 Water Conflict Chronology 등 온라인 플랫폼에 탑재된 한반도 관련 수자원 자료를 조사하여 기존 자료와 분석하였다. 연구 결과 Aqueduct와 Water Conflict Chronology 등 온라인 플랫폼이 수자원 관련 교육의 유용한 도구임을 알 수 있었다.

  • PDF

이수식 TBM 데이터와 랜덤포레스트를 이용한 일축압축강도 분류 예측에 관한 연구 (A Study on the Prediction of Uniaxial Compressive Strength Classification Using Slurry TBM Data and Random Forest)

  • 강태호;최순욱;이철호;장수호
    • 터널과지하공간
    • /
    • 제33권6호
    • /
    • pp.547-560
    • /
    • 2023
  • 최근 국내외에서 기계학습 기법으로 TBM 굴진 데이터와 지반데이터를 분석하는 지반 분류예측 연구가 증가하고 있다. 본 연구에서는 다양한 분야에서 널리 사용되고 있는 머신러닝 기법들 중 의사결정트리 기반 랜덤포레스트 모델을 3곳의 이수식 TBM 현장에서 획득한 기계 데이터와 지반 데이터에 적용하여 일축압축강도에 대한 다중 분류예측 연구를 하였다. 일축압축강도의 다중 분류 예측을 위해서 학습과 테스트 데이터를 7:3으로 분할하였으며, 최적의 파라미터를 선정을 위해서 분할 교차검증을 포함하는 그리드 서치를 활용하였다. 의사 결정 트리를 기반으로 한 랜덤 포레스트를 사용하여 일축압축강도 분류 학습을 수행한 결과, 다중 분류 예측 모델의 정확도는 학습 세트와 테스트 세트에서 각각 0.983 및 0.982로 모두 높게 나타났다. 다만, 클래스 간 데이터 분포의 불균형으로 인하여 클래스 4에서는 재현율이 낮게 평가되었다. 다양한 현장에서 획득한 일축압축강도의 측정 데이터양을 늘리는 연구가 필요한 것으로 판단된다.

한국어 학습 모델별 한국어 쓰기 답안지 점수 구간 예측 성능 비교 (Comparison of Korean Classification Models' Korean Essay Score Range Prediction Performance)

  • 조희련;임현열;이유미;차준우
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제11권3호
    • /
    • pp.133-140
    • /
    • 2022
  • 우리는 유학생이 작성한 한국어 쓰기 답안지의 점수 구간을 예측하는 문제에서 세 개의 딥러닝 기반 한국어 언어모델의 예측 성능을 조사한다. 이를 위해 총 304편의 답안지로 구성된 실험 데이터 세트를 구축하였는데, 답안지의 주제는 직업 선택의 기준('직업'), 행복한 삶의 조건('행복'), 돈과 행복('경제'), 성공의 정의('성공')로 다양하다. 이들 답안지는 네 개의 점수 구간으로 구분되어 평어 레이블(A, B, C, D)이 매겨졌고, 총 11건의 점수 구간 예측 실험이 시행되었다. 구체적으로는 5개의 '직업' 답안지 점수 구간(평어) 예측 실험, 5개의 '행복' 답안지 점수 구간 예측 실험, 1개의 혼합 답안지 점수 구간 예측 실험이 시행되었다. 이들 실험에서 세 개의 딥러닝 기반 한국어 언어모델(KoBERT, KcBERT, KR-BERT)이 다양한 훈련 데이터로 미세조정되었다. 또 두 개의 전통적인 확률적 기계학습 분류기(나이브 베이즈와 로지스틱 회귀)도 그 성능이 분석되었다. 실험 결과 딥러닝 기반 한국어 언어모델이 전통적인 기계학습 분류기보다 우수한 성능을 보였으며, 특히 KR-BERT는 전반적인 평균 예측 정확도가 55.83%로 가장 우수한 성능을 보였다. 그 다음은 KcBERT(55.77%)였고 KoBERT(54.91%)가 뒤를 이었다. 나이브 베이즈와 로지스틱 회귀 분류기의 성능은 각각 52.52%와 50.28%였다. 학습된 분류기 모두 훈련 데이터의 부족과 데이터 분포의 불균형 때문에 예측 성능이 별로 높지 않았고, 분류기의 어휘가 글쓰기 답안지의 오류를 제대로 포착하지 못하는 한계가 있었다. 이 두 가지 한계를 극복하면 분류기의 성능이 향상될 것으로 보인다.

효율적인 병원보건관리를 위한 태아건강분류 모델 (Design of Fetal Health Classification Model for Hospital Operation Management)

  • 전제란
    • 디지털융복합연구
    • /
    • 제19권5호
    • /
    • pp.263-268
    • /
    • 2021
  • 본 연구에서는 병원에서 실질적인 태아분만 시스템에 관리를 위한 태아건강분류모델을 설계하는 것을 목적으로 한다. 출산 중 사망자 수는 2017년을 기준으로 295,000명인 산모 사망률과 유사하다. 이러한 사망의 94%는 환경에 의해 발생하므로 대부분 예방할 수 있다. 따라서 본 논문에서는 랜덤 포레스트(Random Forest)를 이용하여 Cardiotocograms(CTG) 검사에서 추출한 2개의 데이터(태아의 심박수, 태아의 움직임, 자궁 수축 등)로 태아의 건강을 예측하는 모델을 제안하였다. 본 연구에서 제안된 모델은 태아분만 보건운영 시스템을 안정적으로 관리하기 위해 태아분만에 대한 데이터의 분포가 불균형한 이상 데이터를 갖는 항목을 찾아 표준편차의 상한 및 하한의 임계값을 설정하여 이상값을 제거하여 정확도를 높혔다. 또한 태아의 건강상태를 나타내는 클래스의 비율이 불규칙함으로, 데이터 리샘플링을 이용하여 소수의 클래스를 복제하여 클래스의 균형을 맞추었다. 그 결과 정확도가 4~5% 향상되어 97.75%로 나타났다. 이에 예측 모델을 통해 발생 할 수 있는 태아의 사망과 병을 사전에 정확히 예측하여 우선적으로 관리함으로써 효율적인 태아 보건운영과 태아 사망 및 병 예방에 기여할 수 있을 것이라고 기대한다.

부분 구문 분석 결과에 기반한 두 단계 부분 의미 분석 시스템 (Two-Phase Shallow Semantic Parsing based on Partial Syntactic Parsing)

  • 박경미;문영성
    • 정보처리학회논문지B
    • /
    • 제17B권1호
    • /
    • pp.85-92
    • /
    • 2010
  • 부분 의미 분석 시스템은 문장의 구성 요소들이 술어와 갖는 관계를 분석하는 것으로 문장에서 술어의 주체, 객체, 도구 등을 나타내는 의미 논항을 확인하게 된다. 본 논문에서 개발한 부분 의미 분석 시스템은 두 단계로 구성되어 있는데, 먼저 부분 구문 분석 결과로부터 의미 논항의 경계를 찾는 의미 논항 확인 단계를 수행하고 다음으로 확인된 의미 논항에 적절한 의미역을 부착하는 의미역 할당 단계를 수행한다. 순차적인 두 단계 방법을 적용하는 것에 의해서, 학습 성능 저하의 주요한 원인인 클래스 분포의 불균형 문제를 완화할 수 있고, 각 단계에 적합한 자질을 선별하여 사용할 수 있다. 본 논문에서는 PropBank 말뭉치에 기반한 CoNLL-2004 shared task의 데이터 집합 및 평가 프로그램을 사용하여 각 단계가 시스템의 전체 성능에 기여하는 정도를 보인다.

서울시 아파트 실거래가의 변화패턴 분석 (Analysis of Pattern Change of Real Transaction Price of Apartment in Seoul)

  • 김정희
    • 대한공간정보학회지
    • /
    • 제22권1호
    • /
    • pp.63-70
    • /
    • 2014
  • 본 연구는 국토교통부에서 제공하는 아파트 실거래가자료를 이용하여 2006~2010년까지 5년간의 서울시 아파트실거래가 변화패턴을 시공간적으로 분석하는데 그 목적이 있다. 이를 위해 아파트별 평균 실거래가, 동별 평균 아파트 실거래가 자료를 위치정보자료와 연결하여 GIS데이터로 구축하였다. 분석방법으로는 먼저 공간보간기법 중 크리깅(kriging)을 이용하여 개별 아파트의 시기별/면적별 실거래가의 변화패턴을 분석하였다. 둘째 행정구역(행정동)별 아파트실거래가의 변화패턴을 분석하기 위해 단위 면적별 실거래가의 평균을 계산하여 Moran I 값으로 변환한 후 거래가격의 공간상의 군집도를 분석하였다. 이를 통해 시공간상의 분포패턴을 파악하고, 변화유형까지 유추할 수 있어 주택 및 지역정책에 기초자료로 활용할 수 있다. 시계열 자료를 바탕으로 종적인 변화패턴과 GIS를 이용한 횡적 변화패턴을 분석하기 때문에 아파트가격의 지역 불균형을 한눈에 살펴 볼 수 있다.

적대적 생성 모델을 활용한 사용자 행위 이상 탐지 방법 (Anomaly Detection for User Action with Generative Adversarial Networks)

  • 최남웅;김우주
    • 지능정보연구
    • /
    • 제25권3호
    • /
    • pp.43-62
    • /
    • 2019
  • 한때, 이상 탐지 분야는 특정 데이터로부터 도출한 기초 통계량을 기반으로 이상 유무를 판단하는 방법이 지배적이었다. 이와 같은 방법론이 가능했던 이유는 과거엔 데이터의 차원이 단순하여 고전적 통계 방법이 효과적으로 작용할 수 있었기 때문이다. 하지만 빅데이터 시대에 접어들며 데이터의 속성이 복잡하게 변화함에 따라 더는 기존의 방식으로 산업 전반에 발생하는 데이터를 정확하게 분석, 예측하기 어렵게 되었다. 따라서 기계 학습 방법을 접목한 SVM, Decision Tree와 같은 모형을 활용하게 되었다. 하지만 지도 학습 기반의 모형은 훈련 데이터의 이상과 정상의 클래스 수가 비슷할 때만 테스트 과정에서 정확한 예측을 할 수 있다는 특수성이 있고 산업에서 생성되는 데이터는 대부분 정답 클래스가 불균형하기에 지도 학습 모형을 적용할 경우, 항상 예측되는 결과의 타당성이 부족하다는 문제점이 있다. 이러한 단점을 극복하고자 현재는 클래스 분포에 영향을 받지 않는 비지도 학습 기반의 모델을 바탕으로 이상 탐지 모형을 구성하여 실제 산업에 적용하기 위해 시행착오를 거치고 있다. 본 연구는 이러한 추세에 발맞춰 적대적 생성 신경망을 활용하여 이상 탐지하는 방법을 제안하고자 한다. 시퀀스 데이터를 학습시키기 위해 적대적 생성 신경망의 구조를 LSTM으로 구성하고 생성자의 LSTM은 2개의 층으로 각각 32차원과 64차원의 은닉유닛으로 구성, 판별자의 LSTM은 64차원의 은닉유닛으로 구성된 1개의 층을 사용하였다. 기존 시퀀스 데이터의 이상 탐지 논문에서는 이상 점수를 도출하는 과정에서 판별자가 실제데이터일 확률의 엔트로피 값을 사용하지만 본 논문에서는 자질 매칭 기법을 활용한 함수로 변경하여 이상 점수를 도출하였다. 또한, 잠재 변수를 최적화하는 과정을 LSTM으로 구성하여 모델 성능을 향상시킬 수 있었다. 변형된 형태의 적대적 생성 모델은 오토인코더의 비해 모든 실험의 경우에서 정밀도가 우세하였고 정확도 측면에서는 대략 7% 정도 높음을 확인할 수 있었다.