• 제목/요약/키워드: Speech signal processing

검색결과 331건 처리시간 0.025초

윈도우가 적용된 자기상관에 의한 선형예측부호의 개선 (Improvement of the Linear Predictive Coding with Windowed Autocorrelation)

  • 이창영;이채봉
    • 한국전자통신학회논문지
    • /
    • 제6권2호
    • /
    • pp.186-192
    • /
    • 2011
  • 본 논문은 선형예측부호의 개선을 위한 새로운 과정을 제안한다. 코딩에 따른 오차를 줄이기 위하여, 신호에 윈도우를 적용하는 과정과 선형예측 과정의 순서를 바꾸었다. 이 처방은 윈도우를 적용한 자기상관을 이용하여 선형예측부호를 추출하는 것에 해당한다. 기존의 방법에서는 보다 적은 파라미터에 대해 레빈슨-더빈의 재귀적 계산법을 적용하는 것이 가능한 반면, 본 논문에서 제안된 방법에서는 더 많은 작업 파라미터에 대한 역행렬 계산이 필요하므로, 보다 긴 계산 시간이 요구된다. 하지만, 여러 음성 음소에 대해 테스트한 결과, 제안된 방법에 의하면 기존의 기술에 비해 약 5 % 적은 파워 왜곡이 얻어짐이 밝혀졌다. 따라서 부호화의 신뢰성에 관한 한, 기존의 기술에 비해 본 논문에서 제안된 방법이 더 나은 것으로 사료된다. 40명에 의해 발성된 50 고립단어에 대한 화자종속 음성인식 시험에서도 제안된 방법이 보다 우수한 성능을 보여주었다.

음성인식을 위한 의사(疑似) N-gram 언어모델에 관한 연구 (A Study on Pseudo N-gram Language Models for Speech Recognition)

  • 오세진;황철준;김범국;정호열;정현열
    • 융합신호처리학회논문지
    • /
    • 제2권3호
    • /
    • pp.16-23
    • /
    • 2001
  • 본 논문에서는 대어휘 음성인식에서 널리 사용되고 있는 N-gram 언어모델을 중규모 어휘의 음성인식에서도 사용할 수 있는 의사(疑似) N-gram 언어모델을 제안한다. 제안방법은 ARPA 표준형식 N-gram 언어모델의 구조를 가지면서 각 단어의 확률을 임의로 부여하는 비교적 간단한 방법으로 1-gram은 모든 단어의 출현확률을 1로 설정하고, 2-gram은 허용할 수 있는 단어시작기호 와 WORD 및 WORD와 단어종료기호 의 접속확률만을 1로 설정하며, 3-gram은 단어 시작기호 와 WORD, 단어종료기호 만의 접속을 허용하며 접속확률을 1로 설정한다. 제안방법의 유효성을 확인하기 위해 사전실험으로서 국어공학센터(KLE) 단어음성에 대해 오프라인으로 평가한 견과, 남성 3인의 452 단어에 대해 평균 97.7%의 단어인식률을 구하였다. 또한 사전실험결과를 바탕으로 1,500단어의 중규모 어휘의 증권명을 대상으로 온라인 인식실험을 수행한 결과, 남성 20명이 발성한 20단어에 대해 평균 92.5%의 단어인식률을 얻어 제안방법의 유효성을 확인하였다.

  • PDF

MINT 필터링에 의한 스테레오 음향 반향 제거기의 성능 향상 (Performance Improvement of Stereo Acoustic Echo Canceller Using MINT Filtering)

  • 차경환
    • 한국음향학회지
    • /
    • 제21권1호
    • /
    • pp.42-46
    • /
    • 2002
  • 본 논문에서는 스테레오 음향 반향 제거기의 성능을 향상시킬 수 있는 새로운 전처리 방법의 반향 제거기를 제안한다. 제안한 반향 제거기는 MINT (Multiple input/output INverse Theorem) 필터링에 의해 실내 전달함수의 잔향이 저감되어진 입력을 사용함으로써 필터계수의 추정오차를 감소시켜 성능을 향상시킬 수 있었다. 실제의 스테레오 음성과 실제 음장의 전달함수를 사용한 시뮬레이션 결과, 제안한 방법이 NLMS (Normalized Least Mean Square)와 Projection 등의 적응 알고리즘 종류에 관계없이 ERLE가 3∼5 dB 향상됨을 확인하였다.

새로운 CMOS Floating저항의 설계와 그 응용에 대한연구 (A study on the design of new floating resistor and it′s application)

  • 이영훈
    • 한국컴퓨터정보학회논문지
    • /
    • 제5권3호
    • /
    • pp.76-83
    • /
    • 2000
  • CMOS기술의 발전에 의해 연속신호시스템은 상당한 발전을 가져왔다. 이 논문에서는 새로운 CMOS floating저항을 써서 저역통과필터를 설계하고 PSpice Simulation을 통하여 그 특성이 우수함을 입증하였다. 특히, CMOS로 구성되는 새로운 floating저항은 포화영역에서 동작하도록 구현하였다. 이 방법으로 설계된 저역통과필터는 SC필터보다 구조가 더 간단하므로 IC화 할 때 칩 면적을 감소시킬 수 있다.

  • PDF

Variational autoencoder for prosody-based speaker recognition

  • Starlet Ben Alex;Leena Mary
    • ETRI Journal
    • /
    • 제45권4호
    • /
    • pp.678-689
    • /
    • 2023
  • This paper describes a novel end-to-end deep generative model-based speaker recognition system using prosodic features. The usefulness of variational autoencoders (VAE) in learning the speaker-specific prosody representations for the speaker recognition task is examined herein for the first time. The speech signal is first automatically segmented into syllable-like units using vowel onset points (VOP) and energy valleys. Prosodic features, such as the dynamics of duration, energy, and fundamental frequency (F0), are then extracted at the syllable level and used to train/adapt a speaker-dependent VAE from a universal VAE. The initial comparative studies on VAEs and traditional autoencoders (AE) suggest that the former can efficiently learn speaker representations. Investigations on the impact of gender information in speaker recognition also point out that gender-dependent impostor banks lead to higher accuracies. Finally, the evaluation on the NIST SRE 2010 dataset demonstrates the usefulness of the proposed approach for speaker recognition.

G-peak의 특성을 이용한 성문폐쇄시점 검출 (Detection of Glottal Closure Instant using the property of G-peak)

  • 금홍;김대식;배명진;김영일
    • The Journal of the Acoustical Society of Korea
    • /
    • 제13권1E호
    • /
    • pp.82-88
    • /
    • 1994
  • 음성신호의 처리에서 GCI를 정확하게 검출하는 것은 중요하다. 따라서 이에 대한 연구가 부분적으로 진행되어 왔다. 이러한 방법은 광범위한 화자와 다양한 단어에 대해 적합하지 못하기 때문에 우리는 G-peak를 사용하여 GCI를 검출하는 새로운 기법을 제안하였다. 우선 음성 신호 파형을 가변 저역 통과 여파기에 통과 시킨다. 여파된 신호를 사용하여 G-peak를 검출하고 이를 기준으로 GCI를 검출하게 된다. 제안된 방법으로 검출한 GCI와 눈으로 찾은 GCI의 차이가 1ms이내이면 고려의 대상으로 삼았다. 제안된 방법은 검출율이 각각 0dB SNR하에서 94%, 20dB SNR하에서 96.5%, 무잡음에서 97.9%를 나타내었다. 결론적으로 제안된 방법은 잡음 환경하에서도 우수한 수행결과를 보였다.

  • PDF

소음환경에 강인한 피치주기 검출 알고리즘에 관한 연구 (A Study on the Robust Pitch Period Detection Algorithm in Noisy Environments)

  • 서현수;배상범;김남호
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국해양정보통신학회 2006년도 춘계종합학술대회
    • /
    • pp.481-484
    • /
    • 2006
  • 음성 신호의 피치주기 검출 알고리즘은 음성 인식, 화자 식별 등의 다양한 음성 신호 처리 분야에 적용되고 있으며, 시간영역과 주파수영역에서 많은 연구가 진행되고 있다. 피치주기 검출 알고리즘의 하나인 AMDF(average magnitude difference function)는 연산속도가 빠른 장점이 있지만, 피치주기 검출을 위한 valley점 선정에 있어서 알고리즘이 복잡해지는 문제점이 발생한다. 또한 이러한 피치주기 검출 알고리즘이 실생활에 응용되기 위해서는 다양한 환경에서 발생하는 소음으로부터 강인한 특성을 가져야 한다. 따라서, 본 논문에서는 변형된 AMDF 알고리즘을 이용하여 피치주기 검출을 위한 전체 최소 valley점 선정을 보다 용이하게 하였으며, 테스트 신호로써 지하철 등과 같은 소음환경에서의 음성신호를 사용하였다.

  • PDF

웨이브렛의 주파수-시간 평면 해석에 관한 연구 (A Study on Frequency-Time Plane Analysis of Wavelet)

  • 배상범;류지구;김남호
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국해양정보통신학회 2005년도 추계종합학술대회
    • /
    • pp.451-454
    • /
    • 2005
  • 현재, 신호를 해석하기 위한 많은 방법들이 제시되고 있으며, 대표적인 방법으로는 퓨리에 변환과 웨이브렛 변환이 있다. 이러한 방법들에서, 퓨리에 변환은 모든 주파수 범위에 대해 cosine과 sine 파형의 조합으로써 신호를 표현하지만, 신호 내에서 특정 주파수 성분이 발생한 시간정보를 제공하지 않으며, 분석 신호의 전체적인 특징만을 나타낸다. 따라서 이러한 한계를 극복하기 위해, 다중해상도 해석이 가능한 웨이브렛 변환이 음성과 영상처리, 컴퓨터 비전 등의 광범위한 분야에서 응용되고 있다. 그리고 웨이브렛 변환은 스케일 변수에 따라 변화하는 윈도우를 사용하여 시간-주파수 국부성을 나타낸다. 본 논문에서는 cosine과 sine 형태의 웨이브렛을 사용하여, 퓨리에 변환의 새로운 접근법을 제시하였으며, 주파수-시간 평면의 유한한 지점에서 신호의 특징을 분석하였다.

  • PDF

MRI내 회전운동에 기인한 아티팩트 제거 (Artifact Cancellation due to Rotational Motion in MRI)

  • 김응규;이수종
    • 융합신호처리학회 학술대회논문집
    • /
    • 한국신호처리시스템학회 2005년도 추계학술대회 논문집
    • /
    • pp.155-158
    • /
    • 2005
  • MRI 스캔시 화상평면내에서 촬상대상물체의 회전은 MRI 신호에 위상오차와 불균일 표본화를 일으킨다. MRI 신호의 위상오차와 불균일 표본화에 대한 문제의 모델은 화상평면내 임의 중심과 원점에 관한 회전운동에 의해 열화된 MRI 신호들사이에 위상차가 존재함을 나타낸다. 이에 아티팩트가 포함된 MR 화상의 화질을 개선하기위해서 다음과 같은 방법을 제안한다. 우선, 2차원 회전운동의 회전각은 이미 알려져 있고, 회전중심의 위치가 미지인 경우에 대해 위상보정에 기초한 아티팩트를 보정하는 알고리즘과, 다음으로, 회전중심과 각도가 모두 미지인 2차원 회전운동에 대해 아티팩트를 보정하는 알고리즘을 제안한다. 이때, 미지 운동 파라메타를 예측하기위해 촬상대상물체의 경계바깥쪽에서 이상적인 MR 화상의 에너지는 최소가 되고, 촬상대상물체의 회전이 존재할 때 측정된 에너지는 증가한다는 성질을 이용한다. 이러한 성질을 이용해서 각 위상부호화 단계에서 미지의 회전각 크기를 추정하기위한 평가함수가 도입된다. 최종적으로 시뮬레이션 화상 및 실제화상에 적용해서 제안한 본 방법의 유효성을 확인한다.

  • PDF

에너지 연산자에 기초한 간단한 피치 추적 방법 (A Simple Pitch Tracking Algorithm based on the Energy Operator)

  • Tai-Ho Lee
    • 융합신호처리학회논문지
    • /
    • 제5권1호
    • /
    • pp.1-5
    • /
    • 2004
  • 유성음의 피치주파수 궤적을 추정할 수 있는 새로운 방법을 제시하였다. 이 방법은 에너지연산자[1]를 두 번 적용하는데 기초하고 있다. Kaiser의 에너지연산자는 정현파의 진폭과 주파수 정보를 추출하는 기능을 가지고 있다. 변조모형에 의하면 유성음은 피치 신호로 변조된 포만트들의 합성으로 파악될 수 있으므로 이 파형의 진폭 포락선을 추출해서 피치 신호와 유사한 파형을 얻는다. 이 파형의 평균 주파수를 검출하여 피치 주파수를 구하는 것이다. 앞부분은 Gopalan의 접근법[9]과 마찬가지이나, 뒷부분의 LPC-스펙트럼 분석등의 과정 대신 또 한번 에너지 연산자를 적용하도록 하여 매우 단순화되고 온라인 적용이 가능한 알고리듬을 얻었다. 추정 결과는 거친 편이지만 온라인으로 피치 궤적의 일반적 스케치를 얻는데 유용할 것으로 기대된다.

  • PDF