• 제목/요약/키워드: EM기법

검색결과 162건 처리시간 0.023초

오류 학습 문서 제거를 통한 문서 범주화 기법의 성능 향상 (A Text Categorization Method Improved by Removing Noisy Training Documents)

  • 한형동;고영중;서정연
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제32권9호
    • /
    • pp.912-919
    • /
    • 2005
  • 문서 범주화에서 이진 분류를 다중 분류에 적용할 때 일반적으로 '한 범주에 적합-다른 모든 범주에서는 부적합(One-Against-All) 판정 방법'을 사용한다. 하지만, 이러한 '한 범주에 적합-다른 모든 범주에서는 부적합 판정 방법'은 한 가지 문제점을 가지는데, 적합(positive) 집합의 문서들은 사람이 직접범주를 할당한 것이지만 부적합(negative) 집합의 문서들은 사람이 직접 범주를 할당한 것이 아니기 때문에 오류 문서들이 많이 포함될 수 있다는 것이다. 본 논문에서는 이러한 문제점을 해결하기 위해서 슬라이딩 원도우(sliding window) 기법과 EM 알고리즘을 이진 분류 기반의 문서 범주화에 적용할 것을 제안한다. 제안된 기법은 먼저 슬라이딩 윈도우 기법을 사용하여 오류 문서들을 추출하고 이들을 EM알고리즘을 사용해서 다시 범주를 할당함으로써 이진 분류 기반의 문서 범주화 기법의 성능을 향상시킨다.

나이브베이즈 문서분류시스템을 위한 선택적샘플링 기반 EM 가속 알고리즘 (Accelerating the EM Algorithm through Selective Sampling for Naive Bayes Text Classifier)

  • 장재영;김한준
    • 정보처리학회논문지D
    • /
    • 제13D권3호
    • /
    • pp.369-376
    • /
    • 2006
  • 본 논문은 온라인 전자문서환경에서 전통적 베이지안 통계기반 문서분류시스템의 분류성능을 개선하기 위해 EM(Expectation Maximization) 가속 알고리즘을 접목한 방법을 제안한다. 기계학습 기반의 문서분류시스템의 중요한 문제 중의 하나는 양질의 학습문서를 확보하는 것이다. EM 알고리즘은 소량의 학습문서집합으로 베이지안 문서분류 알고리즘의 성능을 높이는데 활용된다. 그러나 EM 알고리즘은 최적화 과정에서 느린 수렴성과 성능 저하 현상을 나타내는데, EM 알고리즘의 기본 가정을 따르지 않는 온라인 전자문서환경에서 특히 그러하다. 제안 기법의 주요 아이디어는 전통적 EM 알고리즘을 개선하기 위해 불확정성도 기반 선택적 샘플링 기법을 활용한 것이다. 성능평가를 위해 Reuter-21578 문서집합을 사용하여, 제안 알고리즘의 빠른 수렴성을 보이고 전통적 베이지안 알고리즘의 분류 정확성을 향상시켰음을 보인다.

점진적 EM 알고리즘에 의한 잠재토픽모델의 학습 속도 향상 (Accelerated Loarning of Latent Topic Models by Incremental EM Algorithm)

  • 장정호;이종우;엄재홍
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제34권12호
    • /
    • pp.1045-1055
    • /
    • 2007
  • 잠재토픽모델(latent topic model)은 데이타에 내재된 특징적 패턴이나 데이타 정의 자질들 간의 상호 관련성을 확률적으로 모델링하고 자동 추출하는 모델로서 최근 텍스트 문서로부터의 의미 자질 자동 추출, 이미지를 비롯한 멀티미디어 데이타 분석, 생물정보학 분야 등에서 많이 응용되고 있다. 이러한 잠재토픽모델의 대규모 데이타에 대한 적용 시 그 효과 증대를 위한 중요한 이슈 중의 하나는 모델의 효율적 학습에 관한 것이다. 본 논문에서는 대표적 잠재토픽모델 중의 하나인 PLSA (probabilistic latent semantic analysis) 기법을 대상으로 점진적 EM 알고리즘을 활용한, 기본 EM 알고리즘 기반의 기존 학습에 대한 학습속도 증진 기법을 제안한다. 점진적 EM 알고리즘은 토픽 추론 시 전체 데이타에 대한 일괄적 E-step 대신에 일부 데이타에 대한 일련의 부분적 E-step을 수행하는 특징이 있으며 이전 데이터 일부에 대한 학습 결과를 바로 다음 데이타 학습에 반영함으로써 모델 학습의 가속화를 기대할 수 있다. 또한 이론적인 측면에서 지역해로의 수렴성이 보장되고 기존 알고리즘의 큰 수정 없이 구현이 용이하다는 장점이 있다. 논문에서는 해당 알고리즘의 기본적인 응용과 더불어 실제 적용과정 상에서의 가능한 데이터 분할법들을 제시하고 모델 학습 속도 개선 면에서의 성능을 실험적으로 비교 분석한다. 실세계 뉴스 문서 데이타에 대한 실험을 통해, 제안하는 기법이 기존 PLSA 학습 기법에 비해 유의미한 수준에서 학습 속도 증진을 달성할 수 있음을 보이며 추가적으로 모델의 병렬 학습 기법과의 조합을 통한 실험 결과를 간략히 제시한다.

색조영상에서 랜덤결측화소값 대체를 위한 EM 알고리즘 기반 기법 (An EM Algorithm-Based Approach for Imputation of Pixel Values in Color Image)

  • 김승구
    • 응용통계연구
    • /
    • 제23권2호
    • /
    • pp.305-315
    • /
    • 2010
  • 본 논문에서는 색조영상의 R-, G-, B-성분에서 랜덤결측된 화소값들의 대체를 위한 프리퀀티스틱(frequentictic) 기법을 제공한다. 이 기법은 관측영상을 가우시안 마코프 랜덤필드 상의 실현치로서 가정하고, 주어진 화소 내의 근방 화소들이 에지 강도에 따른 서로 다른 분산을 가지는 정규분포를 따른다고 설계함으로써 에지에서 결측화소 대체값이 이질적 색상에 영향 받지 않도록 한다. 이러한 모형하에서 우도가 최대화하도록 결측화소값들을 근사 EM 알고리즘에 기반 한 방법으로 모수들을 추정하고 결측화소를 대체한다. 제안된 방법의 결과들은 보간법에 기초한 대체법과 비교하여 그 유효성을 보인다.

PSC 내부 텐던의 긴장력 관리를 위한 저전압 EM 센싱 기법 (Low-Voltage EM(Elasto-Magnetic) Sensing Technique for Tensile Force Management of PSC(Prestressed Concrete) Internal Tendon)

  • 박지환;김준경;엄기영;박승희
    • 한국전산구조공학회논문집
    • /
    • 제32권2호
    • /
    • pp.87-92
    • /
    • 2019
  • 본 논문에서는 안정적인 전력공급이 어려운 실제 현장에 적용하기 위해서 PSC 내부 텐던의 긴장력 관리를 위한 저전압 EM센싱기법을 검증하였다. 지난 국내외 PSC 구조물 사고 사례를 볼 수 있듯이, 공용간 구조적 안정성을 확보하기 위해서는 PS텐던의 긴장력 관리가 매우 중요함을 알 수 있었다. 이에 본 논문에서는 EM센서를 통해 탄성-자기이론을 기반한 강자성체의 자기변형과 응력의 관계를 이용하여 전압 크기에 따른 긴장력에 대한 자기이력곡선을 계측하고자 하였다. 이를 위해 이중 원통코일형태의 EM센서를 제작하고 유압식 인장기를 이용한 PS텐던 인장 실험 장비를 구성하였다. 실험은 단계적으로 전압을 감소시켜 긴장력 크기에 따른 자기이력곡선의 변화를 계측하면서 최대/최소 전압값에 대한 계측결과에 따른 투자율의 변화와 긴장력의 관계를 비교 분석하였다. 그 결과, 전압이 감소하여 자기장의 크기가 작아짐에 따라 추정식에 대한 상수는 상이하지만 유사한 형태의 자기이력곡선 투자율의 변화를 확인할 수 있었다. 이를 통해 본 연구에서는 저전압 상태에서 EM센싱기법을 이용한 PSC 내부 텐던에 대한 긴장력 관리가 가능할 것으로 판단된다.

EM 알고리즘을 이용한 이진 분류 문서 범주화의 성능 향상 (Improving performance of Binary Text Classification Using the EM algorithm)

  • 한형동;고영중;서정연
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 가을 학술발표논문집 Vol.31 No.2 (1)
    • /
    • pp.790-792
    • /
    • 2004
  • 문서 범주화에서 이진분류를 다중 분류에 적용할 때, 일반적으로 One-Against-All 방법을 사용한다. 하지만, 이 One-Against-All 방법은 한가지 문제점을 가진다. 즉, positive 집합의 문서들은 사람이 직접 범주를 할당한 것이지만, negative 집합의 문서들은 사람이 직접 범주를 할당한 것이 아니기 때문에 오류 문서들이 포함될 수 있다는 것이다. 본 논문에서는 이러한 문제점을 해결하기 위해 Sliding Window기법과 EM 알고리즘을 이진 분류 기반의 문서 범주화에 적용할 것을 제안한다. 먼저 Sliding Window 기법을 이용하여 학습 데이터로부터 오류 문서들을 추출하고 이 문서들을 EM 알고리즘을 사용해서 다시 범주를 할당함으로써 이진 분류 기반의 문서 범주화 기법의 성능을 향상시킨다.

  • PDF

마코프 랜덤 필드 하에서 정규혼합모형에 의한 다중 결측값 대체기법: 색조영상 결측 화소값 대체에 응용 (Imputation of Multiple Missing Values by Normal Mixture Model under Markov Random Field: Application to Imputation of Pixel Values of Color Image)

  • 김승구
    • Communications for Statistical Applications and Methods
    • /
    • 제16권6호
    • /
    • pp.925-936
    • /
    • 2009
  • 자료의 독립성 가청 하에서 EM 알고리즘에 의한 경측치 대체 (imputation of missing values) 기법은 잘 알려져 있다. 그러나 공간자료를 다루는 응용문제에서는 독립성 가정이 확장된 마코프 랜덤 필드 (Markov random field; MRF) 하에서 다루어져야 할 것이다. 이에 본 논문에서는 마코프 랜덤 필드 모형 궁에서 다변량 자료 중에 다중의 결측치의 대체를 위한 EM 알고리즘을 제공한다. 이 기법은 몇 가지 현실척 가정하에서 결국 혼합모형에 의한 대체 기법 임을 보인다. 그리고 제공된 기법으로 3-변량으로 구성된 색조영상(color image)의 결측화소값 대체문제에 적용하여 그 유용성과 문제점을 밝히며, 문제정의 개선방안에 대해 논의한다.

트리패턴매칭기법의 재목적 가능한 중간코드 최적화 시스템 (Retargetable Intermediate Code Optimization System Using Tree Pattern Matching Techniques)

  • 김정숙;오세만
    • 한국정보처리학회논문지
    • /
    • 제6권8호
    • /
    • pp.2253-2261
    • /
    • 1999
  • ACK에서는 패턴 테이블 생성기와 핍홀 최적화기에서 스트링 패턴 매칭 기법을 이용하여 EM 중간 코드에 대한 최적화 코드를 생성한다. 하지만 이 스트링 패턴 매칭 방법은 패턴 결정 시에 반복적으로 많은 비교 동작이 이루어지므로 비효율적이다. 본 논문은 ACK의 중간 코드 최적화기를 개선하기 위해 EM 트리 생성기, 최적화 패턴 테이블 생성기, 트리 패턴 매칭기로 구성된 트리 패턴 매칭 알고리즘을 이용한 EM 중간 코드 최적화 시스템을 설계하고 구현하였다. 이러한 트리 패턴 매칭 알고리즘은 EM 트리를 하향식으로 순회하면서 트리 구조를 가진 패턴 테이블을 참조하여 루트 노드를 중심으로 패턴 매칭을 수행한다. 트리 패턴 매칭 동작은 궁극적으로 ACK의 스트링 패턴 매칭에 비해 최적화 패턴을 찾는데 걸리는 시간을 평균 10.8% 감소시킬 수 있는 효과를 보였다.

  • PDF

LPC 분석 기법 및 EM 알고리즘 기반 잡음 환경에 강인한 진동 특징을 이용한 고 신뢰성 유도 전동기 다중 결함 분류 (High-Reliable Classification of Multiple Induction Motor Faults using Robust Vibration Signatures in Noisy Environments based on a LPC Analysis and an EM Algorithm)

  • 강명수;장원철;김종면
    • 한국컴퓨터정보학회논문지
    • /
    • 제19권2호
    • /
    • pp.21-30
    • /
    • 2014
  • 최근 산업 현장에서 유도 전동기의 사용이 증대되고 있으며, 유도 전동기는 산업 현장에서 중요한 역할을 하고 있다. 따라서 유도 전동기의 결함으로 인한 피해를 최소화하기 위해 유도 전동기의 결함 검출 및 분류 시스템의 개발이 중요한 문제로 대두되고 있다. 따라서 본 논문에서는 유도전동기의 결함을 조기에 식별하기 위해 선형예측 코딩(LPC)기법과 Expectation Maximization(EM) 알고리즘을 이용하여 각각의 유도 전동기 고장의 스펙트럼 포락처리 모델을 추정한다. 앞서 두 기법을 사용하여 추정된 고장 유형 모델과 마할라노비스 거리(MD) 기법을 사용하여 유도전동기의 결합을 분류한다. 또한 제안된 알고리즘 성능을 평가하기 위해 기존에 제안된 진동 신호의 특징을 이용한 유도 전동기 결함 분류 알고리즘과 분류 정확도 측면에서 성능을 검증하였다. 실험 결과, 제안하는 알고리즘은 잡음이 없는 환경 및 잡음이 섞인 환경에서도 높은 분류 성능을 보였다.

깁스 표본 기법을 이용한 베이지안 계층적 모형: 야생쥐의 예 (Bayesian Hierachical Model using Gibbs Sampler Method: Field Mice Example)

  • 송재기;이군희;하일도
    • Journal of the Korean Data and Information Science Society
    • /
    • 제7권2호
    • /
    • pp.247-256
    • /
    • 1996
  • 본 논문은 깁스 표본 기법을 이용하여 Demster et al.(1981)에 의해 소개된 Field Mice자료를 분석하기 위하여 베이지안 계층적 모형을 적용시켜 보았다. Jeffrey의 사전확률을 이용한 사후 평균을 깁스 표본 기법을 이용하여 구하였고, 이로 부터 얻은 베이지안 추정량을 최소 자승 추정량, EM알고리즘을 이용한 랜덤 효과를 포함한 가능도함수에 대한 최대 가능도 추정량(MLR)과 비교하였다.

  • PDF