• 제목/요약/키워드: naive Bayesian classifier

검색결과 50건 처리시간 0.021초

Lifelong Machine Learning 기반 스팸 메시지 필터링 방법 (A Method for Spam Message Filtering Based on Lifelong Machine Learning)

  • 안연선;정옥란
    • 전기전자학회논문지
    • /
    • 제23권4호
    • /
    • pp.1393-1399
    • /
    • 2019
  • 인터넷의 급속한 성장으로 데이터의 송수신의 편리성과 비용이 들지 않는다는 장점 때문에 매일 수백만 건의 무차별적인 광고성 스팸 문자와 메일이 발송되고 있다. 아직은 스팸 단어나 스팸 번호를 차단하는 방법을 주로 사용하지만, 기계 학습이 떠오름에 따라 스팸을 필터링하는 방법에 대해 다양한 방식으로 활발히 연구되고 있다. 그러나 스팸에서만 등장하는 단어나 패턴은 스팸 필터링 시스템에 의해 걸러지지 않기 위해 지속적으로 변화하고 있기 때문에, 기존 기계 학습 메커니즘으로는 새로운 단어와 패턴을 감지, 적응할 수 없다. 최근 이러한 기존 기계 학습의 한계점을 극복하기 위해 기존의 지식을 활용하여 새로운 지식을 지속적으로 학습하도록 하는 Lifelong Learning(이하 LL)의 개념이 대두되었다. 본 논문에서는 문서 분류에 가장 많이 사용되는 나이브 베이즈와 Lifelong Machine Learning(이하 LLML)의 앙상블 기법을 이용한 스팸 메시지 필터링 방법을 제안한다. 우리는 기존 스팸 필터링 시스템에 가장 많이 사용되는 나이브 베이즈와, LLML 모델 중 ELLA를 적용하여 LL의 성능을 검증한다.

베이지언 문서분류시스템을 위한 능동적 학습 기반의 학습문서집합 구성방법 (An Active Learning-based Method for Composing Training Document Set in Bayesian Text Classification Systems)

  • 김제욱;김한준;이상구
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제29권12호
    • /
    • pp.966-978
    • /
    • 2002
  • 기계학습 기법을 이용한 문서분류시스템의 정확도를 결정하는 요인 중 가장 중요한 것은 학습문서 집합의 선택과 그것의 구성방법이다. 학습문서집합 선택의 문제란 임의의 문서공간에서 보다 정보량이 큰 적은 양의 문서집합을 골라서 학습문서로 채택하는 것을 말한다. 이렇게 선택한 학습문서집합을 재구성하여 보다 정확도가 높은 문서분류함수를 만드는 것이 학습문서집합 구성방법의 문제이다. 전자의 문제를 해결하는 대표적인 알고리즘이 능동적 학습(active learning) 알고리즘이고, 후자의 경우는 부스팅(boosting) 알고리즘이다. 본 논문에서는 이 두 알고리즘을 Naive Bayes 문서분류 알고리즘에 적응해보고, 이때 생기는 여러 가지 특징들을 분석하여 새로운 학습문서집합 구성방법인 AdaBUS 알고리즘을 제안한다. 이 알고리즘은 능동적 학습 알고리즘의 아이디어를 이용하여 최종 문서분류함수룰 만들기 위해 임시로 만든 여러 임시 문서분류함수(weak hypothesis)들 간의 변이(variance)를 높였다. 이를 통해 부스팅 알고리즘이 효과적으로 구동되기 위해 필요한 핵심 개념인 교란(perturbation)의 효과를 실현하여 문서분류의 정확도를 높일 수 있었다. Router-21578 문서집합을 이용한 경험적 실험을 통해, AdaBUS 알고리즘이 기존의 알고리즘에 비해 Naive Bayes 알고리즘에 기반한 문서분류시스템의 정확도를 보다 크게 향상시킨다는 사실을 입증한다.

선호도 재계산을 위한 연관 사용자 군집 분석과 Representative Attribute -Neighborhood를 이용한 협력적 필터링 시스템의 성능향상 (Performance Improvement of Collaborative Filtering System Using Associative User′s Clustering Analysis for the Recalculation of Preference and Representative Attribute-Neighborhood)

  • 정경용;김진수;김태용;이정현
    • 정보처리학회논문지B
    • /
    • 제10B권3호
    • /
    • pp.287-296
    • /
    • 2003
  • 추천 시스템에 있어서 협력적 필터링 기술은 많은 연구가 되고 있다. 그러나 협력적 필터링 기술을 이용한 추천 시스템은 초기 평가 문제와 희박성 문제가 발생한다. 이를 해결하기 위해서 본 논문에서는 선호도 재 계산을 위한 연관 사용자 군집과 베이지안 추정치를 이용한 사용자 선호도 예측 방법을 제안한다. 제안한 방법에서는 협력적 필터링 시스템에서 아이템의 속성을 고려하지 않는 단점을 보완하기 위해서 선호도에 가장 크게 영향을 미치는 대표 장르를 추출하여 유사한 이웃을 찾아 낼 때 예측에 이용하는 Representative Attribute-Neighborhood 방법을 사용한다. 협력적 필터링의 알고리즘에 군집 아이템 백터 내의 특정 아이템의 선호도를 재계산 하기 위한 연관 사용자 군집 분석을 적용하여 성능 향상을 하였다. 또 초기 평가 문제와 희박성 문제를 해결하기 위하여 Association Rule Hypergraph Partitioning 알고리즘을 사용하여 사용자를 장르별로 군집한다. 새로운 사용자는 Naive Bayes 분류자에 의해 이들 장르 중 하나로 분류된다. 또한, 분류된 장르 내에 속한 사용자들과 새로운 사용자의 유사도를 구하기 위해 Naive Bayes 학습을 통해 사용자가 평가한 아이템에 추정치를 달리 부여한다. 추정치가 부여된 선호도를 피어슨 상관 관계에 적용할 경우 결측치(Missing Value)로 인한 예측의 오류를 적게하여 예측의 정확도를 높일 수 있다. 제안된 방법은 기존의 방법보다 높은 성능을 나타냄을 보인다.

베이지안 분류 기반 통합가뭄지수를 활용한 낙동강 유역의 미래 가뭄에 대한 수문학적 위험도 분석 (Evaluation of Future Hydrologic Risk of Drought in Nakdong River Basin Using Bayesian Classification-Based Composite Drought Index)

  • 김혁;김지은;김지영;유지영;김태웅
    • 대한토목학회논문집
    • /
    • 제43권3호
    • /
    • pp.309-319
    • /
    • 2023
  • 최근 기후변화로 인해 기상재해의 발생빈도와 강도가 증가하고 있다. 우리나라는 지역별 기후 특성의 편차로 인해 기후변화에 따른 취약성 및 대응능력이 지역별로 차이가 크다. 특히 가뭄은 다양한 요인에 의해 발생하고, 기상학적, 수문학적, 농업적 영향 범위가 광범위하다. 따라서 가뭄에 효과적으로 대응하기 위해서는 다양한 요인을 고려할 수 있는 통합가뭄지수를 활용할 필요가 있으며, 기후변화를 고려한 미래 가뭄을 종합적으로 평가해야 한다. 본 연구에서는 베이지안 분류(DNBC) 기반의 통합가뭄지수를 활용하여 낙동강 유역의 미래 가뭄에 대한 수문학적 위험도(${\bar{R}}$)를 평가하였다. 우선, 관측자료와 기후변화 시나리오 자료를 이용하여 부문별 가뭄지수(SPI, SDI, ESI, WSCI)를 DNBC에 적용하여 통합가뭄지수를 산정하였다. 산정된 통합가뭄지수의 심도와 지속기간을 대상으로 이변량 가뭄빈도분석을 실시하고, 이변량 재현기간을 활용하여 수문학적 위험도를 산정하였다. 그 결과, S2(2021-2040) 기간에서 위험도가 가장 높게 나타났으며(${\bar{R}}$=0.572), 평균적으로 위험도가 가장 높은 지역은 밀양강(#2021)이었다(${\bar{R}}$=0.94). 단기 미래(2021-2040) 기간 동안 낙동강 유역의 수문학적 위험도는 전반적으로 큰 폭으로 상승하였으며, 중·장기 미래(2041-2070, 2071-2099) 기간 동안 낙동강 유역 북부의 위험도는 감소하고 남부의 위험도는 상승하였다.

고혈압 예측을 위한 노모그램 구축 및 비교 (Comparison of nomograms designed to predict hypertension with a complex sample)

  • 김민호;신민석;이제영
    • 응용통계연구
    • /
    • 제33권5호
    • /
    • pp.555-567
    • /
    • 2020
  • 고혈압은 발병률이 꾸준히 증가하고 있을 뿐 아니라, 심혈관 질환과 같은 2차 질병의 주된 위험 요인이 되었다. 게다가 고혈압은 뇌졸중, 혈관성 치매와 같은 다른 합병증을 유발하는 질병이다. 따라서 고혈압 발병률을 예측하는 것은 중요한 일이다. 본 연구에서, 고혈압 발병률을 예측할 수 있는 노모그램을 구축하였다. 데이터는 2013년부터 2016년까지의 국민건강영양조사로부터 얻어졌다. 복합 표본의 특성을 고려하여 Rao-Scott chi-squared test를 통해 고혈압에 영향을 미치는 10가지 요인을 규명하였다. 하지만 로지스틱 회귀분석 시, 흡연 상태와, 운동 유무는 유의하지 않았다. 따라서 8개의 주 효과를 고혈압의 위험요인으로 최종 선별하였다. 그리고 최종 선별된 위험 요인들로 로지스틱 노모그램과 베이지안 노모그램을 제시 및 비교하였다. 마지막으로 ROC curve 그래프와 calibration plot을 통해 노모그램을 검증하였다.

속성선택방법과 워드임베딩 및 BOW (Bag-of-Words)를 결합한 오피니언 마이닝 성과에 관한 연구 (Investigating Opinion Mining Performance by Combining Feature Selection Methods with Word Embedding and BOW (Bag-of-Words))

  • 어균선;이건창
    • 디지털융복합연구
    • /
    • 제17권2호
    • /
    • pp.163-170
    • /
    • 2019
  • 과거 10년은 웹의 발달로 인한 데이터가 폭발적으로 생성되었다. 데이터마이닝에서는 대용량의 데이터에서 무의미한 데이터를 구분하고 가치 있는 데이터를 추출하는 단계가 중요한 부분을 차지한다. 본 연구는 감성분석을 위한 재표현 방법과 속성선택 방법을 적용한 오피니언 마이닝 모델을 제안한다. 본 연구에서 사용한 재표현 방법은 백 오즈 워즈(Bag-of-words)와 Word embedding to vector(Word2vec)이다. 속성선택(Feature selection) 방법은 상관관계 기반 속성선택(Correlation based feature selection), 정보획득 속성선택(Information gain)을 사용했다. 본 연구에서 사용한 분류기는 로지스틱 회귀분석(Logistic regression), 인공신경망(Neural network), 나이브 베이지안 네트워크(naive Bayesian network), 랜덤포레스트(Random forest), 랜덤서브스페이스(Random subspace), 스태킹(Stacking)이다. 실증분석 결과, electronics, kitchen 데이터 셋에서는 백 오즈 워즈의 정보획득 속성선택의 로지스틱 회귀분석과 스태킹이 높은 성능을 나타냄을 확인했다. laptop, restaurant 데이터 셋은 Word2vec의 정보획득 속성선택을 적용한 랜덤포레스트가 가장 높은 성능을 나타내는 조합이라는 것을 확인했다. 다음과 같은 결과는 오피니언 마이닝 모델 구축에 있어서 모델의 성능을 향상시킬 수 있음을 나타낸다.

트레이닝 데이터가 제한된 환경에서 N-Gram 사전을 이용한 트위터 스팸 탐지 방법 (A Method for Twitter Spam Detection Using N-Gram Dictionary Under Limited Labeling)

  • 최혁준;박정희
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제6권9호
    • /
    • pp.445-456
    • /
    • 2017
  • 본 논문에서는 트레이닝 데이터가 제한된 환경에서 n-gram 사전을 이용하여 불건전 정보를 포함하는 스팸 트윗을 탐지하는 방법을 제안한다. 불건전 정보를 포함하는 스팸 트윗은 유사한 단어와 문장을 사용하는 경향이 있다. 이러한 특성을 이용하여 스팸 트윗과 정상 트윗에 대한 n-gram 사전을 구축하고 나이브 베이스 분류기를 적용하여 효과적으로 스팸 트윗을 탐지할 수 있음을 보인다. 반면에, 실시간으로 대용량의 데이터가 유입되는 트위터의 특성은 초기 트레이닝 집합 구성에 매우 큰 비용을 요구 한다. 따라서, 초기 트레이닝 집합이 매우 작거나 존재하지 않는 환경에서 적용할 수 있는 스팸 트윗 탐지 방법이 필요하다. 이를 위해 트위터의 리트윗 기능을 활용하여 의사 라벨을 생성하고 초기 트레이닝 집합의 구성과 n-gram 사전 업데이트에 활용하는 방법을 제안한다. 2016년 12월 1일부터 2016년 12월 7일까지 수집된 한국어 트윗 130만 건을 사용한 다양한 실험 결과는 비교 방법들보다 제안하는 방법의 성능이 우수함을 입증한다.

하지근력증강로봇 제어를 위한 착용자의 보행단계구분 (Human Gait-Phase Classification to Control a Lower Extremity Exoskeleton Robot)

  • 김희영
    • 한국통신학회논문지
    • /
    • 제39B권7호
    • /
    • pp.479-490
    • /
    • 2014
  • 하지근력증강로봇은 인간의 하체에 착용하여 보행능력을 강화하거나 보조하기 위한 장비다. 보행능력을 향상하기 위해 로봇은 착용자의 걷는 움직임을 감지하고 이에 적합한 로봇의 동작을 구동한다. 본 논문에서는 로봇이 착용자의 움직임을 감지하는 방법을 소개하고, 감지된 데이터를 착용자의 현재 보행단계를 의미하는 보행단계상태 정보로 변환하는 보행단계구분 알고리즘을 제시한다. 로봇은 보행단계상태 정보에 따라 현재 필요한 제어모드를 결정하고 로봇구동기를 작동하기 때문에 잘못된 정보가 전달된다면 로봇은 착용자의 보행능력을 향상할 수 없거나 착용자에게 오히려 불편을 줄 수 있다. 따라서 보행단계구분 알고리즘은 항상 정확한 정보를 제공할 수 있어야 한다. 하지만 본 연구에서 사용하는 센서장치의 경우 작은 움직임에도 민감하게 반응하는 특성이 있어 센서데이터를 임계기준으로 구분하는 방법으로는 항상 정확한 보행단계상태 정보를 구할 수 없다. 이러한 특성을 극복하면서 정확한 정보를 제공하기 위해 확률적 구분 방법을 응용한 나이브-플렉시블 베이지안 보행단계구분 알고리즘을 제안하였고, 실험을 통해 제안 방법의 정확성을 비교 분석하였다.

행동 패턴 모델을 이용한 게임 봇 검출 방법 (Behavior Pattern Modeling based Game Bot detection)

  • 박상현;정혜욱;윤태복;이지형
    • 한국지능시스템학회논문지
    • /
    • 제20권3호
    • /
    • pp.422-427
    • /
    • 2010
  • 2004년 이후 정보기술의 성장과 더불어 게임 서비스에 대한 피해 사례가 해 마다 빠르게 증가하고 있는 실정이다. 특히 게임 봇(자동사냥 프로그램)에 대한 피해규모가 가장 크게 조사되고 있으며 이를 방지하기 위한 연구도 활발히 진행되고 있다. 게임 봇은 사용자가 입력하는 키보드나 마우스의 움직임을 대신해 자동으로 게임을 수행하는 프로그램으로 어떠한 사용자의 조작 없이도 게임 속에서의 이득 활동을 무한정 행할 수 있다. 이와 같은 행동은 일반적인 사용자에게 상대적인 불쾌감을 줄 뿐만 아니라 게임의 수명을 단축시키는 등 게임 회사 및 사용자에게 큰 피해를 발생시키고 있어 이를 방지하기 위한 방법이 주목 되고 있다. 기존의 게임 봇 검출 연구들은 단순이 사용자 개인 PC에 설치되어 동작중인 프로그램을 감시하기 때문에 게임 봇 사용자의 조작에 의해 쉽게 피해갈수 있는 단점을 가지고 있다. 따라서 본 논문에서는 게임 서버측면에서 사람과 게임 봇의 행동을 비교하여 게임 봇 사용자들이 조작이나 회피가 힘든 게임 봇 검출 방법을 제안한다. 제안 방법으로는 게임 봇과 사람의 행동 패턴 차이 모델을 정의하고 나이브 베이지안 분류기를 사용하여 게임 봇을 검출한다.

점진적 기계학습 기반의 레이더 위협체 역추정 모델 생성 및 갱신 (Managing the Reverse Extrapolation Model of Radar Threats Based Upon an Incremental Machine Learning Technique)

  • 김철표;노상욱
    • 한국차세대컴퓨팅학회논문지
    • /
    • 제13권4호
    • /
    • pp.29-39
    • /
    • 2017
  • 다양한 전자전 상황에서 단위 위협체에 대하여 전자전 모델링과 시뮬레이션을 수행할 수 있는 통합 전자전 시뮬레이터의 개발 필요성이 대두되고 있다. 본 논문에서는 전자전 상황에서 전자정보 수집신호의 변수를 기반으로 전자파 신호를 발산하는 레이더 위협을 역추정하기 위한 시뮬레이션 시스템의 구성요소를 분석하고, 역추정 모델을 점진적으로 유지할 수 있는 방법을 제안한다. 또한, 실험을 통하여 점진적 역추정 모델 갱신 기법의 유효성 및 개별 역추정 결과의 통합 기법을 평가한다. 개별 역추정 모델의 생성을 위하여 의사결정트리, 베이지안 분류기, 인공신경망 및 유클리디안 거리 측정방식과 코사인 유사도 측정방식을 활용하는 군집화 알고리즘을 이용하였다. 첫 번째 실험에서 레이더 위협체에 대한 역추정 모델을 구축하기 위한 위협 예제의 크기를 점진적으로 증가시키면 역추정 모델의 정확도는 향상되었으며, 이러한 과정이 반복되면 역추정 모델에 대한 정확도는 일정한 값으로 수렴하였다. 두 번째 실험에서는 개별 역추정 모델의 결과를 통합하기 위하여 투표, 가중투표 및 뎀스터-쉐이퍼 알고리즘을 이용하였으며, 역추정 모델의 통합 결과는 뎀스터-쉐이퍼 알고리즘에 의한 역추정 정확도가 가장 좋은 성능을 보였다.