• 제목/요약/키워드: Signal-to-Noise Ratio Enhancement

검색결과 172건 처리시간 0.036초

상호억제와 시간지연 신경회로망을 사용한 적응적인 음성강조시스템 (An Adaptive Speech Enhancement System Using Lateral Inhibition and Time-Delay Neural Network)

  • 최재승
    • 대한전자공학회논문지SP
    • /
    • 제45권2호
    • /
    • pp.95-102
    • /
    • 2008
  • 본 논문에서는 다양한 배경잡음에 의해 열화된 음성을 강조하기 위하여 청각시스템을 기초로 한 적응적인 음성강조시스템을 제안한다. 제안한 시스템은 먼저 유성음과 무성음의 구간을 검출한 후, 각 입력 프레임에서 검출된 결과에 따라서 상호억제 계수와 진폭성분조정계수를 적응적으로 조정한다. 마지막으로 시간지연신경회로망을 사용하여 잡음신호를 제거한다. 실험결과 본 시스템은 신호대잡음비의 평가방법을 통하여 다양한 잡음에 의해서 열화된 음성신호를 백색잡음 및 유색잡음에 대해서 효과적인 것을 보여준다.

잡음 환경에 효과적인 마스크 기반 음성 향상을 위한 손실함수 조합에 관한 연구 (A study on combination of loss functions for effective mask-based speech enhancement in noisy environments)

  • 정재희;김우일
    • 한국음향학회지
    • /
    • 제40권3호
    • /
    • pp.234-240
    • /
    • 2021
  • 본 논문에서는 잡음 환경에서 효과적인 음성 인식을 위해 마스크 기반의 음성 향상 기법을 개선한다. 마스크 기반의 음성 향상 기법에서는 심층 신경망을 기반으로 추정한 마스크를 잡음 오염 음성에 곱하여 향상된 음성을 얻는다. 마스크 추정 모델로 VoiceFilter(VF) 모델을 사용하고 추정된 마스크로 얻은 음성으로부터 잔여 잡음을 보다 확실히 제거하기 위해 Spectrogram Inpainting(SI)기법을 적용한다. 본 논문에서는 음성 향상 결과를 보다 개선하기 위해 마스크 추정을 위한 모델 학습 과정에 사용되는 조합된 손실함수를 제안한다. 음성 구간에 남아 있는 잡음을 보다 효과적으로 제거하기 위해 잡음 오염 음성에 마스크를 적용한 Triplet 손실함수의 Positive 부분을 컴포넌트 손실함수와 조합하여 사용한다. 실험 평가를 위한 잡음 음성 데이터는 TIMIT 데이터베이스와 NOISEX92, 배경음악 잡음을 다양한 Signal to Noise Ratio(SNR) 조건으로 합성하여 만들어 사용한다. 음성 향상의 성능 평가는 Source to Distortion Ratio(SDR), Perceptual Evaluation of Speech Quality(PESQ), Short-Time Objective Intelligibility(STOI)를 이용한다. 실험을 통해 평균 제곱 오차로만 훈련된 기존 시스템과 비교하여, VF 모델은 평균 제곱 오차로 훈련하고 SI 모델은 조합된 손실함수를 사용하였을 때 SDR은 평균 0.5dB, PESQ는 평균 0.06, STOI는 평균 0.002만큼 성능이 향상된 것을 확인했다.

음성 강화를 위한 a priori SNR 추정기반 적응 바람소리 저감 방법 (An Adaptive Wind Noise Reduction Method Based on a priori SNR Estimation for Speech Eenhancement)

  • 서지훈;이석필
    • 전기학회논문지
    • /
    • 제64권12호
    • /
    • pp.1756-1760
    • /
    • 2015
  • This paper focuses on a priori signal to noise ratio (SNR) estimation method for the speech enhancement. There are many researches for speech enhancement with several ambient noise cancellation methods. The method based on spectral subtraction (SS) which is widely used in noise reduction has a trade-off between the performance and the distortion of the signals. So the need of adaptive method like an estimated a priori SNR being able to making a high performance and low distortion is increasing. The decision directed (DD) approach is used to determine a priori SNR in noisy speech signals. A priori SNR is estimated by using only the magnitude components and consequently follows a posteriori SNR with one frame delay. We propose a modified a priori SNR estimator and the weighted rational transfer function for speech enhancement with wind noises. The experimental result shows the performance of our proposed estimator is better Perceptual Evaluation of Speech Quality scores (PESQ, ITU-T P.862) compare to the conventional DD approach-based systems and different noise reduction methods.

재귀적 지연추정기를 갖는 적응잡음제거 기법을 이용한 음성개선 (Speech Enhancement Using the Adaptive Noise Canceling Technique with a Recursive Time Delay Estimator)

  • 강해동;배근성
    • 전자공학회논문지B
    • /
    • 제31B권7호
    • /
    • pp.33-41
    • /
    • 1994
  • A single channel adaptive noise canceling (ANC) technique with a recursive time delay estimator (RTDE) is presented for removing effects of additive noise on the speech signal. While the conventional method makes a reference signal for the adaptive filter using the pitch estimated on a frame basis from the input speech, the proposed method makes the reference signal using the delay estimated recursively on a sample-by-sample basis. As the RTDEs, the recursion formulae of autocorrelation function (ACF) and average magnitude difference function (AMDF) are derived. The normalized least mean square (NLMS) and recursive least square (RLS) algorithms are applied for adaptation of filter coefficients. Experimental results with noisy speech demonstrate that the proposed method improves the perceived speech quality as well as the signal-to-noise ratio and cepstral distance when compared with the conventional method.

  • PDF

잡음 환경에 효과적인 음성인식을 위한 특징 보상 이득 기반의 음성 향상 기법 (Speech enhancement method based on feature compensation gain for effective speech recognition in noisy environments)

  • 배아라;김우일
    • 한국음향학회지
    • /
    • 제38권1호
    • /
    • pp.51-55
    • /
    • 2019
  • 본 논문에서는 잡음 환경에 강인한 음성 인식 성능을 위해 특징 보상 이득을 이용한 음성 향상 기법을 제안한다. 본 논문에서는 변분모델 생성 기법을 채용한 병렬 결합된 가우스 혼합 모델(Parallel Combined Gaussian Mixture Model, PCGMM) 기반의 특징 보상 기법으로부터 계산할 수 있는 특징 보상 이득을 이용하는 음성 향상 기술을 제안한다. 불일치 환경 음성 인식 시스템 적용 환경에서 본 논문에서 제안하는 기법이 실험 결과에서 기존의 전처리 기법 및 이전 연구에서 제안된 특징 보상 기반의 음성 향상 기법에 비해 다양한 잡음 및 SNR(Signal to Noise Ratio) 조건에서 월등한 인식 성능을 나타내는 것을 확인한다. 또한 잡음 모델 선택 기법을 적용함으로써 음성 인식 성능을 유사한 수준으로 유지하면서 계산량을 대폭적으로 감축할 수 있다.

자동 음성 인식기를 위한 단채널 음질 향상 알고리즘의 성능 분석 (Performance Analysis of a Class of Single Channel Speech Enhancement Algorithms for Automatic Speech Recognition)

  • 송명석;이창헌;이석필;강홍구
    • The Journal of the Acoustical Society of Korea
    • /
    • 제29권2E호
    • /
    • pp.86-99
    • /
    • 2010
  • This paper analyzes the performance of various single channel speech enhancement algorithms when they are applied to automatic speech recognition (ASR) systems as a preprocessor. The functional modules of speech enhancement systems are first divided into four major modules such as a gain estimator, a noise power spectrum estimator, a priori signal to noise ratio (SNR) estimator, and a speech absence probability (SAP) estimator. We investigate the relationship between speech recognition accuracy and the roles of each module. Simulation results show that the Wiener filter outperforms other gain functions such as minimum mean square error-short time spectral amplitude (MMSE-STSA) and minimum mean square error-log spectral amplitude (MMSE-LSA) estimators when a perfect noise estimator is applied. When the performance of the noise estimator degrades, however, MMSE methods including the decision directed module to estimate a priori SNR and the SAP estimation module helps to improve the performance of the enhancement algorithm for speech recognition systems.

Micro-LIF measurement of microchannel flow

  • Kim Kyung Chun;Yoon Sang Youl
    • 한국가시화정보학회:학술대회논문집
    • /
    • 한국가시화정보학회 2004년도 Proceedings of 2004 Korea-Japan Joint Seminar on Particle Image Velocimetry
    • /
    • pp.65-74
    • /
    • 2004
  • Measurement of concentration distributions of suspended particles in a micro-channel is out of the most crucial necessities in the area of Lab-on-a-chip to be used for various bio-chemical applications. One most feasible way to measure the concentration field in the micro-channel is using micro-LIF(Laser Induced Fluorescence) method. However, an accurate concentration field at a given cross plane in a micro-channel has not been successfully achieved so far due to various limitations in the light illumination and fluorescence signal detection. The present study demonstrates a novel method to provide an ultra thin laser sheet beam having five(5) microns thickness by use of a micro focus laser line generator. The laser sheet beam illuminates an exact plane of concentration measurement field to increase the signal to noise ratio and considerably reduce the depth uncertainty. Nile Blue A was used as fluorescent dye for the present LIF measurement. The enhancement of the fluorescent intensity signals was performed by a solvent mixture of water $(95\%)$ and ethanol (EtOH)/methanol (MeOH) $(5\%)$ mixture. To reduce the rms errors resulted from the CCD electronic noise and other sources, an expansion of grid size was attempted from $1\times1\;to\;3\times3\;or\;5\times5$ pixel data windows and the pertinent signal-to-noise level has been noticeably increased accordingly.

  • PDF

마이크로 채널 내부의 Micro-LIF 측정을 위한 마이크로 레이저 평면빔과 혼합용매의 적용 (Application of Micro-Thin Laser sheet and Mixed Solvent for Micro-LIF Measurement in a Microchannel)

  • 윤상열;김재민;김경천
    • 한국가시화정보학회:학술대회논문집
    • /
    • 한국가시화정보학회 2004년도 추계학술대회 논문집
    • /
    • pp.86-89
    • /
    • 2004
  • One most feasible way to measure the concentration field in the micro-channel is using micro-LIF(Laser Induced Fluorescence) method. However, an accurate concentration field at a given cross plane in a micro-channel has not been successfully achieved so far due to various limitations in the light illumination and fluorescence signal detection. The present study demonstrates a novel method to provide an ultra thin laser sheet beam having five(5) microns thickness by use of a micro focus laser line generator. The laser sheet beam illuminates an exact plane of concentration measurement field to increase the signal to noise ratio and considerably reduce the depth uncertainty. Nile Blue A was used as fluorescent dye for the present LIF measurement. The enhancement of the fluorescent intensity signals was performed by a solvent mixture of water $(95\%)$ and ethanol (EtOH)/methanol (MeOH) $(5\%)$ mixture. To reduce the rms errors resulted from the CCD electronic noise and other sources, an expansion of grid size was attempted from $1\times1$ to 3(3 or 5(5 pixel data windows and the pertinent signal-to-noise level has been noticeably increased accordingly.

  • PDF

잡음에 강인한 음성인식을 위한 스펙트럼 보상 방법 (A Spectral Compensation Method for Noise Robust Speech Recognition)

  • 조정호
    • 전자공학회논문지 IE
    • /
    • 제49권2호
    • /
    • pp.9-17
    • /
    • 2012
  • 음성 인식 시스템의 용용에서 실제 문제점의 하나는 음성신호의 왜곡에 의한 인식성능의 저하이다. 음성신호의 왜곡에 가장 중요한 원인은 부가적인 잡음이다. 이 논문은 잡음에 강인한 음성인식을 위하여, 스펙트럼 피크 향상 기법과 효과적인 잡음 차감 기법에 기초한 스펙트럼 보상 방법을 기술한다. 제안한 방법은 음성 스펙트럼의 포먼트 구조를 향상시키고 스펙트럼 기울기를 보상하면서도 광 대역폭 스펙트럼 요소는 그대로 유지한다. 백색 가우스 잡음, 자동차 잡음, 음성 잡음 또는 지하철 잡음에 의해 왜곡된 음성을 이용한 인식실험을 수행한 결과, 새로운 방법은 스펙트럼 보상을 하지 않은 경우에 비해, 높은 SNR(Signal to Noise Ratio) 환경에서는 평균 오인식율을 약간 줄였으며, 낮은 SNR(10 dB) 환경에서는 평균 오인식율을 1/2로 크게 줄였다.

잡음 데이터를 활용한 음성 기저 행렬과 NMF 기반 음성 향상 기법 (Speech Basis Matrix Using Noise Data and NMF-Based Speech Enhancement Scheme)

  • 권기수;김형용;김남수
    • 한국통신학회논문지
    • /
    • 제40권4호
    • /
    • pp.619-627
    • /
    • 2015
  • 본 논문은 비음수 행렬 인수분해(NMF)를 이용한 음성향상 기법을 다루고 있다. 음성과 잡음에서 적절한 훈련을 통해 각각의 기저(basis) 행렬을 구하고 이 행렬들을 이용하여 두 음원을 분리 하는 것이다. 그 중에서도 음성향상의 성능은 사용하게 되는 기저 행렬에 따라 크게 달라짐을 보인다. 기존의 독립적으로 구한 음성 기저 행렬에 비해서, 잡음 데이터를 복원하는데 부적합한 방향으로 최적화시킨 음성 기저 행렬을 사용하였을 때 더 높은 음성향상 성능을 보임을 실험으로 확인하였다. 이 때 잡음 데이터의 복원 오차 자체를 크게 해주는 방향과 해당 인코딩 행렬(encoding matrix) 원소의 값을 작게 해주는 두 가지 방법을 적용하여 비교하였다. 좀 더 음성 복원에만 특화된 기저 행렬을 구함으로서 음성 기저 행렬이 잡음 데이터 복원에 사용되는 것을 최소화 하였다. 실험 결과에서는 perceptual evaluation speech quality값과 signal to distortion ratio를 지표로 사용하였고, 기존 기법에서 사용하는 기저 행렬 보다 더 높은 성능을 보임을 확인 하였다.