• 제목/요약/키워드: Automatic Lipreading

검색결과 9건 처리시간 0.02초

은닉 마르코프 모델의 확률적 최적화를 통한 자동 독순의 성능 향상 (Improved Automatic Lipreading by Stochastic Optimization of Hidden Markov Models)

  • 이종석;박철훈
    • 정보처리학회논문지B
    • /
    • 제14B권7호
    • /
    • pp.523-530
    • /
    • 2007
  • 본 논문에서는 자동 독순(automatic lipreading)의 인식기로 쓰이는 은닉 마르코프 모델(HMM: hidden Markov model)의 새로운 확률적 최적화 기법을 제안한다. 제안하는 기법은 전역 최적화가 가능한 확률적 기법인 모의 담금질과 지역 최적화 기법을 결합하는 것으로써, 알고리즘의 빠른 수렴과 좋은 해로의 수렴을 가능하게 한다. 제안하는 알고리즘이 전역 최적해로 수렴함을 수학적으로 보인다. 제안하는 기법을 통해 HMM을 학습함으로써 기존의 알고리즘이 지역해만을 찾는 단점을 개선함으로써 향상된 독순 성능을 나타냄을 실험으로 보인다.

컬러 입술영상과 주성분분석을 이용한 자동 독순 (Automatic Lipreading Using Color Lip Images and Principal Component Analysis)

  • 이종석;박철훈
    • 정보처리학회논문지B
    • /
    • 제15B권3호
    • /
    • pp.229-236
    • /
    • 2008
  • 본 논문은 화자의 입술 움직임으로부터 음성을 인식하는 자동 독순에서 회색조 영상 대신 컬러 영상을 사용하는 것의 유용성에 대해 고찰한다. 먼저 인간의 독순 실험을 통해 컬러 정보가 인식 성능에 어떠한 영향을 미치는지 확인한다. 다음으로 주성분분석을 이용한 자동 독순에서 회색조 또는 컬러 입술영상을 사용하는 경우에 대해 인식 성능을 비교한다. 다양한 컬러 좌표계에 대한 실험을 통해 컬러 영상의 사용으로 인식율이 향상됨을 보인다. 특히 RGB 좌표계를 사용했을 때 가장 좋은 성능을 얻으며, 회색조의 경우에 비해 잡음이 없는 환경에서는 4.7%, 잡음이 있는 경우 평균 13.0%의 상대적 오인식율 감소를 얻을 수 있음을 확인한다.

향상된 자동 독순을 위한 새로운 시간영역 필터링 기법 (A New Temporal Filtering Method for Improved Automatic Lipreading)

  • 이종석;박철훈
    • 정보처리학회논문지B
    • /
    • 제15B권2호
    • /
    • pp.123-130
    • /
    • 2008
  • 자동 독순(automatic lipreading)은 화자의 입술 움직임을 통해 음성을 인식하는 기술이다. 이 기술은 잡음이 존재하는 환경에서 말소리를 이용한 음성인식의 성능 저하를 보완하는 수단으로 최근 주목받고 있다. 자동 독순에서 중요한 문제 중 하나는 기록된 영상으로부터 인식에 적합한 특징을 정의하고 추출하는 것이다. 본 논문에서는 독순 성능의 향상을 위해 새로운 필터링 기법을 이용한 특징추출 기법을 제안한다. 제안하는 기법에서는 입술영역 영상에서 각 픽셀값의 시간 궤적에 대역통과필터를 적용하여 음성 정보와 관련이 없는 성분, 즉 지나치게 높거나 낮은 주파수 성분을 제거한 후 주성분분석으로 특징을 추출한다. 화자독립 인식 실험을 통해 영상에 잡음이 존재하는 환경이나 존재하지 않는 환경에서 모두 향상된 인식 성능을 얻음을 보인다.

이미지 변환과 HMM에 기반한 자동 립리딩 (Automatic Lipreading Based on Image Transform and HMM)

  • 김진범;김진영
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 1999년도 추계종합학술대회 논문집
    • /
    • pp.585-588
    • /
    • 1999
  • This paper concentrates on an experimental results on visual only recognition tasks using an image transform approach and HMM based recognition system. There are two approaches for extracting features of lipreading, a lip contour based approach and an image transform based one. The latter obtains a compressed representation of the image pixel values that contain the speaker's mouth results in superior lipreading performance. In addition, PCA(Principal component analysis) is used for fast algorithm. Finally, HMM recognition tasks are compared with the another.

  • PDF

은닉 마르코프 모델의 다목적함수 최적화를 통한 자동 독순의 성능 향상 (Improved Automatic Lipreading by Multiobjective Optimization of Hidden Markov Models)

  • 이종석;박철훈
    • 정보처리학회논문지B
    • /
    • 제15B권1호
    • /
    • pp.53-60
    • /
    • 2008
  • 본 논문은 입술의 움직임을 통해 음성을 인식하는 자동 독순의 인식 성능 향상을 위해 인식기로 사용되는 은닉 마르코프 모델을 분별적으로 학습하는 기법을 제안한다. 기존에 많이 사용되는 Baum-Welch 알고리즘에서는 각 모델이 해당 클래스 데이터의 확률을 최대화하는 것을 목표로 학습시키는 반면, 제안하는 알고리즘에서는 클래스간의 분별력을 높이기 위해 두 가지의 최소화 목적함수로 이루어진 새로운 학습 목표를 정의하고 이를 달성하기 위해 모의 담금질 기법에 기반을 둔 다목적함수 전역 최적화 기법을 개발한다. 화자종속 인식 실험을 통해 제안하는 기법의 성능을 평가하며, 실험결과 기존의 학습 방법에 비해 오인식율을 상대적으로 약 8% 감소시킬 수 있음을 보인다.

입술의 대칭성에 기반한 효율적인 립리딩 방법 (An Efficient Lipreading Method Based on Lip's Symmetry)

  • 김진범;김진영
    • 대한전자공학회논문지SP
    • /
    • 제37권5호
    • /
    • pp.105-114
    • /
    • 2000
  • 본 논문에서는 영상 변환 기반 자동 립리딩 알고리즘에서 처리하는 데이터 수를 효과적으로 감소시키는데 중점을 두었다 화자의 입술에 대한 압축된 정보를 갖는 영상 변환 방식이 입술 윤곽선 기반 방식보다 우수한 립리딩 성능을 보이지만 이 방식은 입술 특정 파라미터를 다수 갖게 되므로 데이터 처리량이 많아지고 인식시간이 길어지게 된다 계산되는 데이터를 줄이기 위해 우리는 엽술의 대칭성에 기반하여 입술영상을 수직으로 접는 간단한 방법을 제안한다 추가적으로 주성분 분석(PCA) 알고리즘을 사용하여 빠른 알고리즘을 고려하였고, HMM을 이용한 단어 인식실험 결과를 보인다 제안된 방법에서 접어진 입술영상을 이용한 결과, 일반적으로 $16{\times}16$ 입술영상을 사용하는 방법에 비해 특정파라미터 수가 $22{\sim}47%$ 감소하였고, HMM(hidden Markov model) 인식 알고리즘을 이용한 단어 인식률에서도 $2{\sim}3%$ 개선된 결과를 얻었다.

  • PDF

얼굴 특징점을 이용한 한국어 8모음 독화 시스템 구축 (Design & Implementation of Speechreading System using the Face Feature on the Korean 8 Vowels)

  • 김선옥;이경호
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2008년도 제39차 동계학술발표논문집 16권2호
    • /
    • pp.135-140
    • /
    • 2009
  • 본 논문은 한국어 8 단모음을 인식하는 자동 독화 신경망 시스템을 구축한 것이다. 얼굴의 특정들은 휘도와 채도 성분으로 인하여 다양한 색 공간에서 다양한 표현 값을 갖는다. 이를 이용하여 각 표현 값들을 증폭하거나 축소, 대비시킴으로서 얼굴 특정들을 추출되게 하였다. 눈과 코, 안쪽 입의 외곽선, 이의 외곽선을 찾았고, 그 후 한국어 8모음 발화시 구분되게 변화는 값들을 파라미터로 설정하였다. 한국어 8모음을 발화하는 2400개의 자료를 모아 분석하고 이 분석을 바탕으로 신경망 시스템을 구축하여 실험하였다. 이 실험에 정상인 5명이 동원되었고, 사람들 사이에 있는 관찰 오차를 정규화를 통하여 수정하였다. 5명으로 분석하였고, 5명으로 인식 실험하여 좋은 결과를 얻었다.

  • PDF

한국어 8모음 자동 독화에 관한 연구 (A Study on Speechreading about the Korean 8 Vowels)

  • 이경호;양룡;김선옥
    • 한국컴퓨터정보학회논문지
    • /
    • 제14권3호
    • /
    • pp.173-182
    • /
    • 2009
  • 본 논문은 한국어 8단모음을 인식하기 위한 효율적인 파라미터의 추출과 자동 독화 시스템의 구축에 관하여 연구한 것이다. 얼굴의 특징들은 다양한 칼라 공간에서 다양한 값으로 표현되는 것을 이용하여 각 표현 값들을 증폭하거나 또는 축소, 대비시켜 얼굴 요소들이 추출되도록 하였다. 눈과 코의 위치, 안쪽 입의 외곽선, 윗입술의 상단, 이의 외곽선을 특징 점으로 찾았으며, 이를 분석하여 안쪽 입의 면적, 안쪽 입의 높이와 폭, 이의 보임 비율 코와 윗입술 상단과의 거리를 파라미터로 사용하였다. 2400개의 영상으로 분석하였고 이 분석을 바탕으로 신경망 시스템을 구축한 후 인식 실험을 하였다. 정상인 5명이 동원되었고, 사람들 사이에 있는 관찰 오차를 정규화를 통하여 수정하였으며 실험하여 파라미터의 유용성 관점에서 좋은 결과를 얻었다.

동적 환경에서의 립리딩 인식성능저하 요인분석에 대한 연구 (A Study on Analysis of Variant Factors of Recognition Performance for Lip-reading at Dynamic Environment)

  • 신도성;김진영;이주헌
    • 한국음향학회지
    • /
    • 제21권5호
    • /
    • pp.471-477
    • /
    • 2002
  • 최근 립리딩에 대한 연구는 음성인식방법에 있어서 부가적인 정보를 제공하여 잡음환경에서 견인한 음성 인식을 하거나 음성정보의 부가적인 특징벡터로 사용하기 위한 방법으로 연구되고 있다. 그러나 립리딩 연구의 대부분은 실험실 환경하의 제한된 결과로서, 실제 다양한 동적 환경에서의 견인성에 대해서는 연구된 바가 없다. 현재 우리는 입술정보만을 이용한 자동22단어 인식기를 만들었으며, 이미지 기반 립리딩의 성능은 53.54%의 성능을 가지고 있다. 본 연구에서는 기 구현된 립리딩 시스템을 기반으로 하여, 립리딩 성능이 환경 적인 변화에 대해서 얼마나 안정할 수 있는지, 그리고 립리딩의 인식성능 저하를 일으키는 주요 요인이 무엇인지에 대하여 연구하였다. 입술이미지의 동적 변이로서는 이동, 회전. 크기변화와 같은 공간적 변화와 빛에 의한 조명변화를 고려하였다. 실험용 데이터로는 영상변환에 의한 시뮬레이션 된 데이터와 동적 변화가 심한 자동차 환경에서 수집한 데이터를 사용하였다. 실험결과 입술의 공간 변화가 인식성능 저하의 한가지 요인으로 작용함을 발견하였다. 그러나 실제적으로 공간변화보다 더 심각한 성능저하 원인은 시간흐름에 따른 조명조건의 변화로써 70%이상의 왜곡이 발생했다. 따라서 신뢰할 수 있는 립리딩 시스템 구현을 위해서 고려해야 할 가장 큰 요인은 빛의 변화임을 발견할 수 있었다.