Speech Recognition Using Formant Bandwidth Normalization

포만트 밴드폭 정규화를 이용한 음성인식

  • Published : 1991.05.01

Abstract

In this paper, the cause of linear prediction error is analysed and the theoretical basis for nomalizing the format bandwidth to 0is given and its validity is verified. The formant and bandwidth in relation to the position of the poles of AR filter are measured for an alaysis of the relation between the pole position and the formant bandwidth. By changing the glottis reflection coefficient to 1. the pole position and the formant bandwidth. By changing the glottis reflection coefficient to 1. the effect of the glottis is eliminated and as the result a new linear preiction coefficients are obtained by normalizing the formant bandwidth of the signal to 0. since these coefficients are symmetrical, the standard deviation is larger than the coefficients with fixed glottis reflection coefficient. The bit rate for speech coding can be reduced by a factor of 2 without any loss of information. Through computer simulation, recognition rate of 96.7% is botained by using the proposed algorithm in recognizing 5 Korean vowels in noisy environment.

본 논문에서는 기존의 선형예측기법의 문제점을 선형예측계수, ar필터의 POLE위치, 포만트-밴드폭의 관점에서 분석하고, 정문반사계수의 영향을 정도추정이론에 따라 분석했으며, 이러한 분석을 근거로 하여 포만트 밴드폭 정규화 방법을 보완하였다. 정분반사계수를 1로 변경하여 정문의 영향을 정규화되어 포만트가 최적으로 강조된 스펙트럽이 된다. 이 전형예측계수는 앞뒤로 대칭되면서, 표준편차가 정문반사계수를 변경시키지 않은 성형예측계수보다 증가하므로써, 음성부호화시에 bit rate을 50%로 줄일 수있으면서 정보의 양을 그대로 보존하고 있음을 알수 있었다. 이러한 포만트 밴드폭을 0으로 정규화하는 방법을 이용하여 한국어 5개 모음을 포만트에 의해서 소음환경에서 인식하기 위한 실험을 실시하여 96.7%의 인식율을 얻을 수 있었다.

Keywords