• 제목/요약/키워드: Speech spectrum

검색결과 309건 처리시간 0.021초

Block Constrained Trellis Coded Vector Quantization of LSF Parameters for Wideband Speech Codecs

  • Park, Jung-Eun;Kang, Sang-Won
    • ETRI Journal
    • /
    • 제30권5호
    • /
    • pp.738-740
    • /
    • 2008
  • In this paper, block constrained trellis coded vector quantization (BC-TCVQ) is presented for quantizing the line spectrum frequency parameters of the wideband speech codec. Both a predictive structure and a safety-net concept are combined into BC-TCVQ to develop the predictive BC-TCVQ. The performance of this quantization is compared with that of the linear predictive coding vector quantizer used in the AMRWB codec, demonstrating reductions in spectral distortion.

  • PDF

A Frequency-Domain Normalized MBD Algorithm with Unidirectional Filters for Blind Speech Separation

  • Kim Hye-Jin;Nam Seung-Hyon
    • The Journal of the Acoustical Society of Korea
    • /
    • 제24권2E호
    • /
    • pp.54-60
    • /
    • 2005
  • A new multichannel blind deconvolution algorithm is proposed for speech mixtures. It employs unidirectional filters and normalization of gradient terms in the frequency domain. The proposed algorithm is shown to be approximately nonholonomic. Thus it provides improved convergence and separation performances without whitening effect for nonstationary sources such as speech and audio signals. Simulations using real world recordings confirm superior performances over existing algorithms and its usefulness for real applications.

인간의 청각 메커니즘을 적용한 웨이블렛 분석을 통한 음성 향상에 대한 연구 (A study of speech. enhancement through wavelet analysis using auditory mechanism)

  • 이준석;길세기;홍준표;홍승홍
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 2002년도 하계종합학술대회 논문집(4)
    • /
    • pp.397-400
    • /
    • 2002
  • This paper has been studied speech enhancement method in noisy environment. By mean of that we prefer human auditory mechanism which is perfect system and applied wavelet transform. Multi-resolution of wavelet transform make possible multiband spectrum analysis like human ears. This method was verified very effective way in noisy speech enhancement.

  • PDF

The Effect of the Speech Enhancement Algorithm for Sensorineural Hearing Impaired Listeners

  • Kim, Dong-Wook;Lee, Young-Woo;Lee, Jong-Shill;Chee, Young-Joon;Lee, Sang-Min;Kim, In-Young;Kim, Sun-I.
    • 대한의용생체공학회:의공학회지
    • /
    • 제28권6호
    • /
    • pp.732-743
    • /
    • 2007
  • Background noise is one of the major complaints of not only hearing impaired persons but also normal listeners. This paper describes the results of two experiments in which speech recognition performance was determined for listeners with normal hearing and sensorineural hearing loss in noise environment. First, we compared speech enhancement algorithms by evaluation speech recognition ability in various speech-to-noise ratios and types of noise. Next, speech enhancement algorithms by reducing background noise were presented and evaluated to improve speech intelligibility for sensorineural hearing impairment listeners. We tested three noise reduction methods using single-microphone, such as spectrum subtraction and companding, Wiener filter method, and maximum likelihood envelop estimation. Their responses in background noise were investigated and compared with those by the speech enhancement algorithm that presented in this paper. The methods improved speech recognition test score for the sensorineural hearing impaired listeners, but not for normal listeners. The results suggest the speech enhancement algorithm with the loudness compression can improve speech intelligibility for listeners with sensorineural hearing loss.

한국어 방언 음성의 실험적 연구 (An Experimental Study of Korean Dialectal Speech)

  • 김현기;최영숙;김덕수
    • 음성과학
    • /
    • 제13권3호
    • /
    • pp.49-65
    • /
    • 2006
  • Recently, several theories on the digital speech signal processing expanded the communication boundary between human beings and machines drastically. The aim of this study is to collect dialectal speech in Korea on a large scale and to establish a digital speech data base in order to provide the data base for further research on the Korean dialectal and the creation of value-added network. 528 informants across the country participated in this study. Acoustic characteristics of vowels and consonants are analyzed by Power spectrum and Spectrogram of CSL. Test words were made on the picture cards and letter cards which contained each vowel and each consonant in the initial position of words. Plot formants were depicted on a vowel chart and transitions of diphthongs were compared according to dialectal speech. Spectral times, VOT, VD, and TD were measured on a Spectrogram for stop consonants, and fricative frequency, intensity, and lateral formants (LF1, LF2, LF3) for fricative consonants. Nasal formants (NF1, NF2, NF3) were analyzed for different nasalities of nasal consonants. The acoustic characteristics of dialectal speech showed that young generation speakers did not show distinction between close-mid /e/ and open-mid$/\epsilon/$. The diphthongs /we/ and /wj/ showed simple vowels or diphthongs depending to dialect speech. The sibilant sound /s/ showed the aspiration preceded to fricative noise. Lateral /l/ realized variant /r/ in Kyungsang dialectal speech. The duration of nasal consonants in Chungchong dialectal speech were the longest among the dialects.

  • PDF

과학영재학교 재학생 영어발화 주파수 대역별 음향 에너지 분포의 영어 성취도 예측성 연구 (A study on the predictability of acoustic power distribution of English speech for English academic achievement in a Science Academy)

  • 박순;안현기
    • 말소리와 음성과학
    • /
    • 제14권3호
    • /
    • pp.41-49
    • /
    • 2022
  • 본 연구는 미국영어 화자의 평균적 음향 스펙트럼 분포를 확보한 후 과학영재학교 재학생의 영어발화 양상을 비교하여 상대적으로 우수한 지적 역량을 갖춘 우리나라 과학영재들의 초분절적 영어 유창성 양상을 규명하고, 그 근접성 정도가 영재학교 학생의 영어 과목 정기고사 성취도와 어떤 관계성을 갖는지 탐구하고자 진행되었다. 불과 수 초에서 수십 초에 불과한 음성녹음 데이터 위주로 분석을 시행했던 종래의 연구와 달리 총 4시간에 달하는 미국영어 원어민 화자(남성 15명, 여성 15명)의 음성녹음 자료를 MATLAB(R2022a; The Math Works) 코드로 분석하여 20 -20,000 Hz 주파수 범위 내의 대역별로 장기 스펙트럼 음향에너지 분포값을 확보했으며, 이를 기준으로 과학영재학교 1학년 신입생 80명의 녹음데이터 LTASS(long-term average speech spectrum) 분석 수치와 비교한 결과, 영어 과목 학기말고사의 학업성취도 수준이 상위 30% 이내인 학생들의 표본을 제외하고는 미국영어 음향에너지 분포와의 근접성이 통계적으로 유미하지 않다고 밝혀졌다. 영재학교 입학 후 영어 성취도를 예측하기 위한 지표를 발견하기 위해 수용성 어휘크기검사(receptive vocabulary size test), 학기 중 복수 회 실시한 영어 어휘 형성평가 퀴즈 누적 점수, 공인 영어말하기시험(English Speaking Proficiency Test, ESPT) 성취도를 추가 변량으로 하여 정기고사 성취도와의 상관관계 분석 및 각 변량 간 선형 회귀분석을 시행하였는데, 대개 유년시절 완성되는 영어 유창성을 측정하는 ESPT보다는, 1학기 및 2학기 초 실시한 수용성 어휘크기검사 및 수과학 분야 저빈도 어휘 위주 형성평가 점수와의 통계적 유의성이 월등히 높다는 사실이 관찰되었다. 따라서, 본 연구로부터 확보된 이론적 기반을 토대로 국내 영재학교에서는 발음교육보다 과학영재를 주요 대상으로 한 전문적 수준의 저빈도어휘 교육이 보다 효과적인 교수 요목이라 추정할 수 있다.

Spectral Subtraction과 Two Channel Beamfomer를 이용한 음성 강조 기법 (Speech Enhancement using Spectral Subtraction and Two Channel Beamfomer)

  • 김학윤
    • 한국음향학회지
    • /
    • 제18권1호
    • /
    • pp.38-44
    • /
    • 1999
  • 본 연구에서는 단일 채널 단구간 진폭 스펙트럼 추정 기법의 하나인 Spectral Subtraction 방법과 2 채널 Griffiths-Jim Beamformer를 결합한 음성 강조기법을 제안한다. 기존의 단구간 진폭 스펙트럼 추정 기법에서는 관측된 신호의 스펙트럼에서 잡음의 평균 스펙트럼을 감산하여 잡음을 제거하고 있지만, 이 방법을 이용하여 잡음을 제거 할 경우에는 잡음 변동시 잡음 억제 능력이 미약하고, 목적 신호의 단구간 진폭 스펙트럼 추정 성능이 낮아진다는 단점을 갖고 있다. 그 이유는 실제 잡음의 스펙트럼은 평균값 주위에 분산되어 있기 때문이 다. 그러므로, 2 채널 Beamformer의 사각(Blocking Matrix)를 이용하여 분석 구간에서의 잡음의 단구간 진폭 스펙트럼을 추정하고, 이 추정된 값을 이용하여 목적 신호의 스펙트럼을 추정하는 기법을 제안하고, 컴퓨터 시뮬레이션을 통하여 그 유효성을 입증한다.

  • PDF

Long Term Average Spectrum Characteristics of Head and Chest Register Sounds of Western Operatic Singers - Possibility of a Second Singer's Formant-

  • Jin, Sung-Min;Kwon, Young-Kyung;Song, Yun-Kyung
    • 음성과학
    • /
    • 제10권2호
    • /
    • pp.99-109
    • /
    • 2003
  • The purpose of this study was to analyze and compare head register with chest register of singers acoustically. Fifteen healthy tenor major students were participated. Fifteen healthy untrained adults were chosen as the control group for this study. Long term average (LTA) power spectrum using the Fast Fourier transform (FFT) algorithm and Linear predictive coding (LPC) filter response were made with /a/ sustained in both head (G4, 392 Hz) and chest registers (C3, 131 Hz). Statistical analysis was performed using the Mann-Whitney test. In the LTA power spectrum, head register of singers increased in the level of energy gain within the frequency of 2.2-3.4 kHz (p<0.01), and 7.5-8.4 kHz (p<0.01, p<0.05). Chest register of singers increased in the frequency of 2.2-3.1 kHz (p<0.01), 7.8-8.4 kHz (p<0.05) and around 9.6 kHz (p<0.01). The LTA power spectrum revealed a peak of acoustic energy around 2,500 Hz, known as the singer's formant and another peak of acoustic energy around 8,000 Hz in the singer's voice.

  • PDF

디지털 통신 시스템에서의 음성 인식 성능 향상을 위한 전처리 기술 (Pre-Processing for Performance Enhancement of Speech Recognition in Digital Communication Systems)

  • 서진호;박호종
    • 한국음향학회지
    • /
    • 제24권7호
    • /
    • pp.416-422
    • /
    • 2005
  • 디지털 통신 시스템에서의 음성 인식은 음성 부호화기에 의한 음성 신호의 왜곡으로 인하여 성능이 크게 저하된다. 본 논문에서는 음성 부호화기에 의한 스펙트럼 왜곡을 분석하고 왜곡된 주파수 정보를 보상하는 전처리 과정을 통하여 음성 인식 성능을 향상시키는 방법을 제안한다. 현재 널리 사용되는 표준 음성 부호화기인 IS-127 EVRC, ITU G.729 CS-ACELP. IS-96 QCELP를 사용하여 부호화에 의한 왜곡을 분석하고, 모든 음성 부호화기에 공통으로 적용하여 왜곡을 보상할 수 있는 전처리 방법을 개발하였다. 본 논문에서 제안하는 왜곡 보상 방법을 세 종류의 음성부호화기에 각각 적용하였으며, 왜곡된 음성 신호에 대한 음성 인식률에 비하여 최대 $15.6\%$의 인식률 향상을 얻을 수 있었다.

명료발화와 보통발화에서 파킨슨병환자 음성의 켑스트럼 및 스펙트럼 분석 (Characteristics of voice quality on clear versus casual speech in individuals with Parkinson's disease)

  • 신희백;심희정;정훈;고도흥
    • 말소리와 음성과학
    • /
    • 제10권2호
    • /
    • pp.77-84
    • /
    • 2018
  • The purpose of this study is to examine the acoustic characteristics of Parkinsonian speech, with respect to different utterance conditions, by employing acoustic/auditory-perceptual analysis. The subjects of the study were 15 patients (M=7, F=8) with Parkinson's disease who were asked to read out sentences under different utterance conditions (clear/casual). The sentences read out by each subject were recorded, and the recorded speech was subjected to cepstrum and spectrum analysis using Analysis of Dysphonia in Speech and Voice (ADSV). Additionally, auditory-perceptual evaluation of the recorded speech was conducted with respect to breathiness and loudness. Results indicate that in the case of clear speech, there was a statistically significant increase in the cepstral peak prominence (CPP), and a decrease in the L/H ratio SD (ratio of low to high frequency spectral energy SD) and CPP F0 SD values. In the auditory-perceptual evaluation, a decrease in breathiness and an increase in loudness were noted. Furthermore, CPP was found to be highly correlated to breathiness and loudness. This provides objective evidence of the immediate usefulness of clear speech intervention in improving the voice quality of Parkinsonian speech.