• 제목/요약/키워드: 음성 파라메터

검색결과 76건 처리시간 0.02초

감정에 강인한 음성 인식을 위한 음성 파라메터 (Speech Parameters for the Robust Emotional Speech Recognition)

  • 김원구
    • 제어로봇시스템학회논문지
    • /
    • 제16권12호
    • /
    • pp.1137-1142
    • /
    • 2010
  • This paper studied the speech parameters less affected by the human emotion for the development of the robust speech recognition system. For this purpose, the effect of emotion on the speech recognition system and robust speech parameters of speech recognition system were studied using speech database containing various emotions. In this study, mel-cepstral coefficient, delta-cepstral coefficient, RASTA mel-cepstral coefficient and frequency warped mel-cepstral coefficient were used as feature parameters. And CMS (Cepstral Mean Subtraction) method were used as a signal bias removal technique. Experimental results showed that the HMM based speaker independent word recognizer using vocal tract length normalized mel-cepstral coefficient, its derivatives and CMS as a signal bias removal showed the best performance of 0.78% word error rate. This corresponds to about a 50% word error reduction as compare to the performance of baseline system using mel-cepstral coefficient, its derivatives and CMS.

이산 시간 제어 CHMM을 이용한 한국어 연속 음성 인식에 관한 연구 (A Study on Recognition of Korean Continuous Speech using Discrete Duration CHMM.)

  • 김상범
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1994년도 제11회 음성통신 및 신호처리 워크샵 논문집 (SCAS 11권 1호)
    • /
    • pp.368-372
    • /
    • 1994
  • 확률적 모델을 이용한 HMM 으로 한국어 연속 음성 인식시스템을 구성하였다. 학습 모델로서는 양자화 DCK가 없는 연속출력 확률밀도를 사용한 연속출력 확률분포 HMM과 과도 구간 및 정상 구간의 시간구조를 충분히 BYGUS할 수 없는 것을 계속시간 확률 파라메터를 추가하여 보완한 이산 지속시간 제어 연속출력 확률분포 HMM을 이용하였다. 인식 알고리즘은 시계열 패턴의 시간축상에서의 비선형 신축을 고려한 에 매칭으로서, 음절의 경계를 자동으로 검출하는 O에을 이용하였다. 실험에서 사용된 연속음성데이타는 4연 숫자음과 연속음성 10문장으로 하였다. 인식 실험 결과 4연 숫자음에서 CHMM은 80.7%, DDCHMM은 92.9%의 인식률을 얻었고, 신문 사설에서 발췌한 연속 음성문장의 경우 CHMM 54.2%, DDCHMM에서는 68.9%을 얻어, 시간장 제어를 고려한 DDCHMM이 CHMM보다 SHB은 인식률을 얻었다.

  • PDF

어휘독립 환경에서의 가변어휘 음성인식에 관한 연구 (A Study on the Variable Vocabulary Speech Recognition in the Vocabulary-Independent Environments)

  • 황병한
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1998년도 학술발표대회 논문집 제17권 2호
    • /
    • pp.369-372
    • /
    • 1998
  • 본 논문은 어휘독립(Vocabulary-Independent) 환경에서 별도의 훈련과정 없이 인식대상 어휘를 추가 및 변경할 수 있는 가변어휘(Variable Vocabulary) 음성인식에 관한 연구를 다룬다. 가변어휘 인식은 처음에 대용량 음성 데이터베이스(DB)로 음소모델을 훈련하고 인식대상 어휘가 결정되면 발음사전에 의거하여 음소모델을 연결함으로써 별도의 훈련과정 없이 인식대상 어휘를 변경 및 추가할 수 있다. 문맥 종속형(Context-Dependent) 음소 모델인 triphone을 사용하여 인식실험을 하였고, 인식성능의 비교를 위해 어휘종속 모델을 별도로 구성하여 인식실험을 하였다. Unseen triphone 문제와 훈련 DB의 부족으로 인한 모델 파라메터의 신뢰성 저하를 방지하기 위해 state-tying 방법 중 음성학적 지식에 기반을 둔 tree-based clustering(TBC) 기법[1]을 도입하였다. Mel Frequency Cepstrum Coefficient(MFCC)와 대수에너지에 기반을 둔 3 가지 음성특징 벡터를 사용하여 인식 실험을 병행하였고, 연속 확률분포를 가지는 Hidden Markov Model(HMM) 기반의 고립단어 인식시스템을 구현하였다. 인식 실험에는 22 개 부서명 DB[3]를 사용하였다. 실험결과 어휘독립 환경에서 최고 98.4%의 인식률이 얻어졌으며, 어휘종속 환경에서의 인식률 99.7%에 근접한 성능을 보였다.

  • PDF

HMM을 이용한 연속음성인식 시스템의 화자적응화에 관한 연구 (A Study on Speaker Adaptation of HMM in a Continous Speech Recognition System)

  • 김상범
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1995년도 제12회 음성통신 및 신호처리 워크샵 논문집 (SCAS 12권 1호)
    • /
    • pp.100-104
    • /
    • 1995
  • 일반적으로 화자적응화는 이미 학습되어 있는 불특정 화자 모델을 표준모델로 하고 소량의 적응화용 발화로 추가적인 학습을 실시하여 특정화자 모델의 성능에 가깝게 하는 기술로서 연속음성 인식에 있어서 매우 중요하다. ML 추정법을 이용한 화자적응화는 카테고리마다 모델의 학습패턴들을 다수개 준비한 후 학습시에 일괄적으로 적용시켜 모델 파라메터를 추정 갱신하므로 추가되는 화자데이터에 대해 데이터를 모두 공급하여야 한다. 본 연구에서는 문발화 데이터의 음절단위를 자동추출한 후 추가되는 화자데이터가 주어질 때 마다 적응화할 수 있는 화자적응화 방법을 검토하였다. 이 방법은 문발화 데이터를 잘라내지 않고 음절 단위를 자동추출시켜 추가 데이터마다 최대 사후확률 추정법을 이용하여 적응화 시키는 것으로 수소의 데이터로서도 적응화를 가능하게 하는 것이다. 본 연구에서 사용되는 음성데이터는 신문사설에서 발췌한 연속음성 10문장을 사용하고, 이 음성 데이터중 6명분은 HMM 학습용으로 하고 나머지 3명분은 적응화용 및 평가용 데이터로 사용하였다. 6명의 화자를 DDCHMM으로 학습하고 나머지 3명분을 MAP법으로 적응화시켰다. 그 결과 적응전과 비교해 볼 때 약 32%의 인식율 향상을 얻을 수 있었다.

  • PDF

EM 알고리즘을 이용할 재귀적인 음소분리 (Recursive Segmentation of Speech Signals using Expectation-Minimization)

  • 강병옥;정홍
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 2002년도 하계학술발표대회 논문집 제21권 1호
    • /
    • pp.103-106
    • /
    • 2002
  • 본 논문에서는 입력음성신호로부터 음소간의 경계를 찾는 문제를 풀기위해 재귀적인 방식으로 EM 알고리즘을 적용한다. 즉, 예상되는 두 끝점 사이의 부분을 현재의 프레임 n 이라고 하면, 그 전 프레임 n-1 에서 구해진 끝점이 주는 정보와 그 끝점으로부터 이어지는 음성샘플로부터 현재 프레임의 끝점을 구한다. 또한 현재의 프레임 n 에서 끝점을 추정해 내면, 그 추정한 끝점과 그 점 이후에 이어지는 음성샘플값으로부터 다음 프레임 n+1 의 끝점을 구한다. 이러한 방식을 재귀적인 음소분리 방식이라고 한다. 그리고, 각 프레임에서 끝점을 구하기 위해서는 끝점의 좌표를 추정해야 할 파라메터로 하고, 그 주변의 음성샘플 값을 관찰 값으로 하여 EM(Expectation and Maximization) 알고리즘을 이용한다. 이 EM 알고리즘을 이용한 재귀적인 음소분리 방식을 실제 음성 DB 로부터 음소쌍을 추출하여 테스트 했을 때 약 5 회의 EM 반복 후에 경계간으로 수렴함을 볼 수 있었다.

  • PDF

프랙탈 차원을 이용한 모음인식 (Vowel Recognition Using the Fractal Dimension)

  • 최철영;김형순;김재호;손경식
    • 한국통신학회논문지
    • /
    • 제19권6호
    • /
    • pp.1140-1148
    • /
    • 1994
  • 본 논문에서는 음성신호의 프랙탈 차원을 이용하여 한국어 모음인식 실험을 수행하였다. 프랙탈 차원은 Minkowski-Bouligand 차원을 사용하였으며, 형태학적 커버링(morphological covering) 방법을 이용하여 구하였다. 프렉탈 차원과 더불어 기존에 우수한 음성 인식 파라메타로 알려져 있는 LPC 켐스트럼(cepstrum)을 함께 사용하였으며, 프랙탈 차원의 음성인식에의 유용성 여부를 조사하였다. 다양한 자음환경에서의 모음인식 실험결과, LPC 켐스트럼 만을 사용하는 경우 및 프렉탈 차원과 LPC 켐스트럼을 함께 사용하는 경우의 모음 오인식율이 각각 5.6% 및 3.2%로 얻어졌다. 이는 LPC 켑스트럼에 프렉탈 차원을 추가함으로써 오인식되는 데이터가 40%이상 감소되는 결과이며, 프랙탈 차원이 음성인식에 있어서 유용한 특징 파라메터임을 보여준다.

  • PDF

강인한 음성 인식 시스템을 사용한 감정 인식 (Emotion Recognition using Robust Speech Recognition System)

  • 김원구
    • 한국지능시스템학회논문지
    • /
    • 제18권5호
    • /
    • pp.586-591
    • /
    • 2008
  • 본 논문은 음성을 사용한 인간의 감정 인식 시스템의 성능을 향상시키기 위하여 감정 변화에 강인한 음성 인식 시스템과 결합된 감정 인식 시스템에 관하여 연구하였다. 이를 위하여 우선 다양한 감정이 포함된 음성 데이터베이스를 사용하여 감정 변화가 음성 인식 시스템의 성능에 미치는 영향에 관한 연구와 감정 변화의 영향을 적게 받는 음성 인식 시스템을 구현하였다. 감정 인식은 음성 인식의 결과에 따라 입력 문장에 대한 각각의 감정 모델을 비교하여 입력 음성에 대한 최종감정 인식을 수행한다. 실험 결과에서 강인한 음성 인식 시스템은 음성 파라메터로 RASTA 멜 켑스트럼과 델타 켑스트럼을 사용하고 신호편의 제거 방법으로 CMS를 사용한 HMM 기반의 화자독립 단어 인식기를 사용하였다. 이러한 음성 인식기와 결합된 감정 인식을 수행한 결과 감정 인식기만을 사용한 경우보다 좋은 성능을 나타내었다.

무선 송수신모듈용 실리콘 바이폴라 트랜지스터의 새로운 전류원 모델링 (A New Current Source Modeling of Silicon Bipolar Transistor for Wireless Transceiver Module)

  • 서영석
    • 조명전기설비학회논문지
    • /
    • 제19권3호
    • /
    • pp.93-98
    • /
    • 2005
  • 근거리에서의 무선설비제어, 구내음성통신과 같은 전파통신설비의 송수신 모듈에 실리콘 바이폴라 트랜지스터가 많이 사용되고 있다. 이러한 실리콘 바이폴라 트랜지스터의 내부 전류원에 대한 새로운 모델링 방법이 제시되었다. 제안된 방법은 Si-BJT의 새로운 열 저항 추출방법과 전류원 파라메터에 대한 새로운 해석적인 방정식에 기반을 두고 있다. 이 방법은 기존의 방법에서 채택된 반복적인 최적화 과정 없이 바로 파라메터를 구할 수 있다. 제안된 방법을 5개의 핑거를 가지는 $0.4\times20[{\mu}m^2]$ 의 Si-BJT에 이 방법을 적용시켰으며, 모델링된 데이터는 측정결과를 $3[\%]$ 이내의 오차로 잘 예측하였다.

ATM 멀티플렉서에서 우선순위 제어에 의한 음성전송효율 및 버퍼관리에 관한 연구 (A Study on the Voice Traffic Efficiency and Buffer Management by Priority Control in ATM Multiplexer)

  • 이동수;최창수;강준길
    • 한국통신학회논문지
    • /
    • 제19권2호
    • /
    • pp.354-363
    • /
    • 1994
  • 본 논문은 광대역 ISDN에서 음성 서비스를 효율적으로 제공하는 방법에 관한 연구이다. 음성은 그 특성상 유음구간과 북음구간으로 나누어지며, 음성활성검출에 의하여 실제로 말을 하는 동안만 전송이 이루어질 수 있도록 음성 트래픽을 발생한다. 본 논문에서는 ATM통신망에서 음성을 음성활성검출과 삽입(Embedded) ADPCM으로 코딩하고, 멀티플렉서에서 셀 폐기를 통하여 트래픽을 제어하는 알고리즘에 관하여 연구하였다. 트래픽 제어는 버퍼에 임계값을 주어, 버퍼의 상태가 임계값을 초과하는 경우에 낮은 우선순위를 갖는 음성 셀을 폐기하는 셀 폐기 알고리즘을 사용하였다. 셀 손실 확률, 큐 크기, 평균지연등을 성능분석 파라메터로 설정하고, 트래픽 제어 알고리즘의 성능을 평가하기 위하여 컴퓨터 시뮬레이션하였다. 이를 통하여 센 폐기방식에 의한 트래픽 제어가 음성의 질을 많이 저하시키지 않으면서도 트래픽 제어를 하지 않을 때에 비하여 전송 대역 이득을 향상시킨다는 것을 확인하였다.

  • PDF

음성 확성을 위한 하울링 신호 자동 검출기법 연구 (A Study on the Automatic Howling Signal Detection Algorithm for Speech Sound Reinforcement)

  • 김경택;김동규;노용완;홍광석
    • 융합신호처리학회 학술대회논문집
    • /
    • 한국신호처리시스템학회 2005년도 추계학술대회 논문집
    • /
    • pp.246-249
    • /
    • 2005
  • 음향 시스템에 있어서 하울링 현상은 음성 레벨을 제한함으로써 음성의 명료도를 저하시키는 주된 요인이다. 그리고 이를 해결하기 위한 방법으로 하울링 주파수 대역의 게인을 낮추어 음향신호의 피드백을 최소화 하는 것이 일반적이기 때문에 하울링 주파수를 찾아내는 것이 하울링 제어에 있어서 가장 핵심적인 요소가 된다. 그래서 본 논문에서는 하울링 주파수를 자동으로 검출할 수 있는 기법을 제시하였다. 이는 외부로부터 입력된 오디오신호가 하울링 신호 특성을 만족하는 정도를 ‘하울링 지수’라는 파라메터로 정의한 후 이를 기준으로 하울링 발생여부를 판단하고 하울링으로 판별된 신호의 최대 진폭을 갖는 주파수를 하울링 주파수로 출력하는 기법이다. 본 하울링 신호 자동 검출기법의 내용을 검증하기 위하여 하울링 자동 검출 프로그램을 제작하여 실험을 수행한 결과 전체 하울링 신호의 95% 이상을 검출할 수 있었다.

  • PDF