• 제목/요약/키워드: 베이지안 분류기

검색결과 77건 처리시간 0.046초

빅데이터 검색 정확도에 미치는 다양한 측정 방법 기반 검색 기법의 효과 (Impact of Diverse Document-evaluation Measure-based Searching Methods in Big Data Search Accuracy)

  • 김지영;한다현;김종권
    • 정보과학회 논문지
    • /
    • 제44권5호
    • /
    • pp.553-558
    • /
    • 2017
  • 빅데이터의 공급이 늘어남에 따라, 이로부터 유용한 정보를 추출해내기 위한 학계와 업계의 연구가 활발히 진행 되고 있다. 특히 분석한 정보의 특징과 함께, 정보 검색 시 검색자의 의도를 함께 반영하여 정보를 여과해 주는 것이 대부분의 연구의 최종 목표이다. 정확하게 분석된 자료는 기업이 제공하는 서비스에 대한 사용자의 충성도를 높여주고, 사용자 스스로 보다 효율적이고 효과적으로 정보를 이용할 수 있게 된다. 본 논문에서는 가장 높은 빈도로 사용되는 검색 분야인 기사를 검색하는 경우의 정확도를 높이기 위해, 관련 데이터를 TF-IDF, 결정 트리, 코사인 유사도, 단순 베이지안 분류기 등의 다양한 측도방법으로 평가해 보고, 이를 분석하였다. 또한, 분석 결과를 바탕으로 가장 적합한 측도 방법을 제안한다.

속성 값 빈도 기반의 전문가 다수결 분류기 (Committee Learning Classifier based on Attribute Value Frequency)

  • 이창환;정인철;권영식
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제37권4호
    • /
    • pp.177-184
    • /
    • 2010
  • 센서 정보, 물류/유통정보, 신용 정보, 주식 정보 등이 과거보다 다양하면서 대용량의 연속 발생 형태 데이터가 발생하고 있다. 이러한 데이터는 대용량의 특의 변화가 빠른 특징들을 가지고 있기 때문에 학습이 어렵다. 이러한 문제점을 해결하기 위해 일정 윈도우 크기의 최근 데이터를 연속적으로 학습시킴으로써 전체 모형을 새롭게 만들거나 모형의 일부분을 대체 하는 방법을 사용하여 왔다. 그러나 이러한 방법은 계속해서 새로운 학습모형을 만들어야 하므로 대용량의 연속 데이터를 학습시키는데 많은 시간과 비용이 든다. 따라서, 이러한 특성에 대비하기 위하여 추가적인 학습 데이터가 발생할 때 마다, 점진적이며 지속적으로 학습을 할 수 있는 학습 기법이 필요하다. 보다 빠른 속도로 학습 모형의 변화 없이 분류를 하기 위하여 대표적인 점진적 학습 방법으로 베이지안 분류기를 사용할 수 있지만, 사전확률을 알고 있다는 가정으로부터 시작을 하게 되어 일정량 이상의 학습데이터가 필요하다. 따라서 본 연구에서는 베이지안 분류기와 같이 점진적으로 학습을 할 수 있지만, 사전 확률을 알지 못하더라고 학습을 할 수 있는 새로운 점진적 학습 알고리즘을 제안하고자 한다. 본 연구에서 제안하는 알고리즘의 기본 개념은 여러 전문가의 의견을 종합하는 방식이다. 여기서는 속성값(attribute value)을 한명의 전문가로 보고 전문가 집단의 의사 결정이 맞을 경우에는 가점을 주고 틀릴 경우에는 감점을 하는 방식으로 학습을 하게 된다. 실험결과 이 방법은 의사결정나무나 베이지언 분류기와 비교해 비슷한 성능을 나타내었으며, 향후에 스트림 데이터 분석에 사용할 가능성을 보였다.

다층 퍼셉트론과 마코프 랜덤 필드 모델을 이용한 베이지안 결 분할 (Bayesian Texture Segmentation Using Multi-layer Perceptron and Markov Random Field Model)

  • 김태형;엄일규;김유신
    • 대한전자공학회논문지SP
    • /
    • 제44권1호
    • /
    • pp.40-48
    • /
    • 2007
  • 이 논문은 다중 스케일 베이지안 관점에서 다층 퍼셉트론과 마코프 랜덤 필드를 사용한 새로운 결 분할 방법을 제안한다. 다층 퍼셉트론의 출력은 사후 확률을 모델링하므로 본 논문에서는 다중 스케일 웨이블릿 계수들을 다층 퍼셉트론의 입력으로 사용한다. 다층 퍼셉트론으로부터 구한 사후 확률과 MAP (maximum a posterior) 분류를 이용하여 각 스케일에서 결 분류를 수행한다. 또한 가장 섬세한 스케일에서 더 개선된 분할 결과를 얻기 위하여 모든 스케일에서 MAP 분류 결과들을 거친 스케일에서 섬세한 스케일까지 차례로 융합한다. 이런 과정은 한 스케일에서의 분류 정보와 그 인접한 보다 거친 스케일에서 얻어지는 문맥과 관련한 연역적 정보를 이용하여 MAP 분류를 행함으로써 이루어진다. 이 융합 과정에서, MRF (Markov random fields) 사전 모델이 평탄화 제한자로서 동작하고, 깁스 샘플러 (Gibbs sampler)는 MAP 분류기로서 동작한다. 제안한 분할 방법은 HMT (Hidden Markov Trees) 모델과 HMTseg 알고리즘을 이용한 결 분할 방법보다 더 좋은 성능을 보인다.

웹문서 자동 분류를 위한 하이퍼링크 기반 특징 가중치 부여 기법 (A Hyperlink-based Feature Weighting Technique for Web Document Classification)

  • 이아람;김한준
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2012년도 추계학술발표대회
    • /
    • pp.417-420
    • /
    • 2012
  • 기계학습을 이용하는 문서 자동분류 시스템은 분류모델의 구성을 위해서 단어를 특징으로 사용한다. 자동분류 시스템의 성능을 높이기 위해 보다 의미있는 특징을 선택하여 분류모델을 구성하기 위한 여러 연구가 진행되고 있다. 특히 인터넷상에서 사용되는 웹문서는 단어 외에도 태그정보, 링크정보를 가지고 있다. 본 논문에서는 이 두 가지 정보를 이용하여 웹문서 자동분류 시스템의 성능을 향상 시키는 방법 제안 한다. 태그 정보와 링크 정보를 이용하여 적절한 특징을 선택하고, 각 특징의 중요도를 계산하여 가중치를 구한다. 계산된 가중치를 각 특징에 부여하여 분류 모델을 구성하고 나이브 베이지안 분류기를 통하여 성능을 평가하였다

향상된 교차 버전 결함 예측을 위한 베이지안 최적화 프레임워크 (Bayesian Optimization Framework for Improved Cross-Version Defect Prediction)

  • 최정환;류덕산
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제10권9호
    • /
    • pp.339-348
    • /
    • 2021
  • 최근 소프트웨어 결함 예측 연구는 교차 프로젝트 간의 결함 예측뿐만 아니라 교차 버전 프로젝트 간의 결함 예측 또한 이루어지고 있다. 종래의 교차 버전 결함 예측 연구들은 WP(Within-Project)로 가정한다. 하지만, CV(Cross-Version) 환경에서는 프로젝트 버전 간의 분포 차이의 중요성을 고려한 연구들이 없다. 본 연구에서는 다른 버전 간의 분포 차이까지 고려하는 자동화된 베이지안 최적화 프레임워크를 제안한다. 이를 통해 분포차이에 따라 전이 학습(Transfer Learning) 수행 여부를 자동으로 선택하여 준다. 해당 프레임워크는 버전 간의 분포 차이, 전이 학습과 분류기(Classifier)의 하이퍼파라미터를 최적화하는 기법이다. 실험을 통해 전이 학습 수행 여부를 분포차 기준으로 자동으로 선택하는 방법이 효과적이라는 것을 알 수 있다. 그리고 최적화를 이용하는 것이 성능 향상에 효과가 있으며 이러한 결과 소프트웨어 인스펙션 노력을 감소할 수 있다는 것을 확인할 수 있다. 이를 통해 교차 버전 프로젝트 환경에서 신규 버전 프로젝트에 대하여 효과적인 품질 보증 활동 수행을 지원할 것으로 기대된다.

범주형 시퀀스 데이터의 K-Nearest Neighbor알고리즘 (A K-Nearest Neighbor Algorithm for Categorical Sequence Data)

  • 오승준
    • 한국컴퓨터정보학회논문지
    • /
    • 제10권2호
    • /
    • pp.215-221
    • /
    • 2005
  • 최근에는 단백질 시퀀스, 소매점 거래 데이터, 웹 로그 등과 같은 상업적이거나 과학적인 데이터의 폭발적인 증가를 볼 수 있다. 이런 데이터들은 순서적인 면을 가지고 있는 시퀀스 데이터들이다. 본 논문에서는 이런 시퀀스 데이터들을 분류하는 문제를 다룬다. 분류 기법 으로는 의사결정 나무나 베이지안 분류기, K-NN방법 등 석러 종류가 있는데, 본 연구에서는 또-U방법을 이용하여 시퀀스들을 분류한다. 또한, 시퀀스들간의 유사도를 구하기 위한 새로운 계산 방법과 효율적인 계산 방법도 제안한다.

  • PDF

GC/MS 분석과 베이지안 분류 모형을 이용한 새 윤활유와 사용 엔진 오일의 동일성 추적과 분류 (Identification and classification of fresh lubricants and used engine oils by GC/MS and bayesian model)

  • 김남이;남금문;김유나;이동계;박세연;이경재;이재용
    • 분석과학
    • /
    • 제27권1호
    • /
    • pp.41-59
    • /
    • 2014
  • 국내 시판제품으로 서울시내에서 구입한 산업용 윤활유, 이륜구동 윤활유, 선박용 윤활유, 자동차용 윤활유(엔진오일, 수동 변속기 기어유, 자동변속기 오일) 등 80종(기유 4종 포함)의 새 윤활유들(80 classes)과 8종의 경유 차량과 16종의 휘발유 차량에 각각 3종씩의 경유와 휘발유 전용 엔진 오일로 교환하여 차량별 및 주행거리별로 각각 채취한 사용 엔진 오일 86종을 GC/MS로 분석한 TIC로 데이터베이스를 만들고, 새 윤활유와 사용 엔진오일들의 동일성 추적과 차량별 분류를 위하여 차원 축소와 베이지안 방식의 분류 모형을 개발하였다. 새 윤활유의 분류는 웨이블렛 적합방법과 주성분 분석방법으로 차원 축소하여 베이지안 방식의 분류 모형을 적용한 결과 각각 97.5%와 96.7%의 정분류율을 보여 차원 축소는 웨이블렛 적합방법이 더 좋은 결과를 나타냈다. 그리고 새 윤활유의 분류에서 선택된 웨이블렛 적합방법의 차원 축소와 베이지안 방식의 분류 모형에 의한 사용 엔진 오일의 차량별 분류(총 24 classes)는 86.4%의 정분류율을 보였고, 경유 차량인지 휘발유 차량인지를 구분하는 차량 연료 타입별 분류(총 2 classes)는 99.6%의 정분류율을 나타내었고, 사용 엔진 오일 브랜드별 분류(총 6 classes)는 97.3%의 정분류율을 나타내었다.

스마트폰 환경에서 개인화된 행위 인식기 및 로거 (Personalized Activity Recognizer and Logger in Smart Phone Environment)

  • 조금환;한만형;이호성;이승룡
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2012년도 제46차 하계학술발표논문집 20권2호
    • /
    • pp.65-68
    • /
    • 2012
  • 본 논문에서는 최근 활발히 연구가 진행되고 있는 행위인식 연구 분야 중에서 스마트폰 환경에서의 개인화된 행위 인식기 및 로거를 제안한다. 최근 스마트폰의 보급이 활발해지면서 행위 인식 연구 분야에서 스마트폰을 이용하는 연구가 활발히 진행되고 있다. 그러나 스마트폰에서는 센서를 이용하여 행위정보를 수집하고, 서버에서 는 분류 및 처리하는 방식으로 실시간 인식과 개발자에 의한 트레이닝으로 인해 개인화된 트레이닝이 불가능하다는 단점이 있다. 이러한 단점을 극복하고자 Naive Bayes Classifier를 사용하여 스마트폰 환경에서 실시간으로 사용자 행위 수집이 가능하고 행위정보의 분류 및 처리가 가능한 경량화 및 개인화된 행위 인식기 및 로거의 구현을 목적으로 한다. 제안하는 방법은 행위 인식기를 통해 행위 인식이 가능할 뿐만 아니라 로거를 통해 사용자의 라이프로그, 라이프패턴 등의 연구 분야에 이용이 가능하다.

  • PDF

트래픽 관찰을 통한 인터넷 서비스 소비성향의 식별 (Identification of User Behaviors Consuming Internet Services by Traffic Observation)

  • 이택;인호
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2009년도 추계학술발표대회
    • /
    • pp.449-450
    • /
    • 2009
  • 사용자의 인터넷 소비성향을 파악하고 그에 적응적인 인프라 리소스를 제공하는 일은 네트워크 설계/관리자나 인터넷 서비스 공급자(ISP)들에게는 주요 관심사이다. 이러한 분석은 한정된 네트워크 자원을 보다 적절한 지점에 효율적인 방식으로 투자하도록 도와준다. 본 논문은 각종 인터넷 서비스를 활용하는 사용자들의 서비스(각종 인터넷 어플리케이션) 소비성향을 네트워크 트래픽 관찰만으로 파악할 수 있는 성향분류 척도를 제안한다. 아울러 베이지안 분류기를 사용하여 제안 척도를 활용한 사용자 성향 분류 방법을 함께 제시한다.

실시간 영상에서의 휴먼 검출 및 얼굴 분류

  • 김건우;남미영;한종욱
    • 정보보호학회지
    • /
    • 제20권3호
    • /
    • pp.48-57
    • /
    • 2010
  • 본 고는 휴먼 객체 검출 및 분류를 위한 것으로서, 입력된 동영상에서 배경 이미지와의 차분 영상을 통해 객체 영역을 검출하고, 검출된 객체 영역에서 얼굴 즉 헤드 영역을 검출하는 방법에 대해서 설명한다. 실시간으로 녹화된 동영상에서 사람이 움직이는 위치와, 크기 등이 아주 다양하며, 또한 한 사람이 아닌 여러 사람 객체를 검출하기 위하여 다중의 사람객체 검출기를 이용한 캐스케이드 사람 객체 추출 방법을 제안한다. 얼굴 크기 등을 고려하여 헤드 영역의 shape 를 기반으로 하여 1차 검출을 수행하고, 검출되지 않은 영역에 대하여 히스토그램 기반의 얼굴 영역을 검출한다. 또한 중복된 영상에 대해 베이지안 얼굴 검출기를 통해 인증함으로써 성능을 향상시킬 수 있다.