• 제목/요약/키워드: Spectrogram

검색결과 234건 처리시간 0.028초

새로운 시간축 정규화 방법을 이용한 한국어 고립단어 인식기 (Korean isolated word recognizer using new time alignment method of speech signal)

  • 남명우;박규홍;노승용
    • 대한전자공학회논문지SP
    • /
    • 제38권5호
    • /
    • pp.567-575
    • /
    • 2001
  • 본 논문에서는 음성신호의 발성길이와 상관없이 일정한 크기의 파라미터를 얻을 수 있는 새로운 방법을 제안하였다. 음성인식기의 성능은 음성신호에서 추출된 파라미터간의 유사도(패턴간의 거리)를 어떻게 비교하는지에 따라 결정된다. 그러나 화자에 따른 음성신호의 변이나 발성속도의 차이는 음성신호에서 일정한 크기의 파라미터 추출을 어렵게 한다. 제안한 방법은 음성신호에서 얻어진 파라미터를 스펙토그램의 형태로 표현한 뒤 2차원 DCT(Discrete Cosine Transform)를 이용해 일정한 크기의 파라미터로 정규화시키는 방법이다. 제안한 방법의 유효성을 입증하기 위해 청각세포를 모델링한 32개의 대역통과 필터로부터 얻어진 음성신호의 파라미터를 2차원 DCT 방법으로 가공한 후, 신경 회로망의 입력으로 사용하였다. 또한 기존 방법과의 인식률 비교를 위해 기존의 정규화된 입력을 구하는 방법 중 하나를 선택하여 비교 실험을 수행하였다. 실험결과 제안한 방법은 기존 방법에 비해 화자종속 및 화자독립 고립단어 인식에서 더 높은 인식률과 빠른 인식속도를 얻을 수 있었다.

  • PDF

열차위치검지 시스템을 위한 관성센서 데이터 분석 연구 (Data Analysis of Inertial Sensors for Train Positioning Detection System)

  • 김성진;박성수;이재호;강동훈
    • 비파괴검사학회지
    • /
    • 제35권1호
    • /
    • pp.18-24
    • /
    • 2015
  • 철도 시설물의 상태를 종합적으로 동시에 검측하고 건전성 평가가 가능한 고속 종합검측시스템을 위해 열차의 위치검지 정보는 필수불가결하다. 본 논문에서는 위치검지를 위한 위치 기술중 관성센서의 측정과 분석에 대해 다룬다. 관성센서의 가속도 정보와 각속도 정보에 대해 진폭과 주파수 관점에서 분석하였고, 진동 및 열차 동역학에 대한 검토도 이루어졌다. 이러한 검토 결과와 GPS 정보를 이용하여 호남선 나주역부터 일로역까지 한국형 틸팅열차의 위치검지를 수행하였다. 이와 같은 센서 측정치와 열차의 거동에 대한 동기화된 분석은 열차위치검지 시스템의 설계와 성능 향상에 도움을 줄 수 있다.

웨이블릿 변환을 이용한 잡음제거기 설계 (Design of the Noise Suppressor Using Wavelet Transform)

  • 원호진;김종학;이인성
    • 한국음향학회지
    • /
    • 제20권7호
    • /
    • pp.37-46
    • /
    • 2001
  • 본 논문에서는 웨이블릿 변환을 이용한 주변 잡음제거기를 제안하였다. 기존의 고정된 시간-주파수 해상도를 가지는 단구간 푸리에 분석법 대신 다양한 시간-주파수 해상도를 제공하는 웨이블릿 분석법을 사용함으로써 시간 특성이 변하는 베이블 (Babble) 잡음에 좀더 효율적인 잡음제거 방법을 설계하였다. 본 논문에 제안된 웨이블릿 변환 잡음제거기는 스펙트럴 차감법에 기반하여 구성하였으며, 고주파 영역에서 높은 시간 해상도를 갖는 웨이블릿 마스크 패턴을 사용함으로써 시간 특성이 빠르게 변화하는 고주파 잡음에 더욱 효율적인 동작을 하도록 설계하였다. 성능평가를 위해 차량 잡음, 길거리 잡음, 베이블 잡음과 같은 이동통신에서 많이 사용하는 주변잡음에서 시험하였으며, 그 주관적 음질 평가 결과 베이블 잡음의 경우 기존의 EVRC(Enhanced Variable Rate Coder) 잡음 제거기보다 Mos (Mean Opinion Score) 0.2의 성능 개선을 이룰 수 있었다. 출력 음성의 스펙트로그램에서도 성능 개선을 확인할 수 있었다.

  • PDF

여성 결혼이민자들의 한국어 조음에 나타나는 음향음성학 특성 연구 - 일본과 필리핀 출신 여성 결혼이민자들을 대상으로 (Acoustic Characteristics of Korean Spoken by the Women Immigrants from Japan and Philippine)

  • 조선희;김현기;김선준
    • 음성과학
    • /
    • 제15권3호
    • /
    • pp.203-217
    • /
    • 2008
  • The number of Asian women immigrants in Korea is getting bigger and it's important to note that their communication problem in Korean causes not only the difficulty of adapting to Korean society but their children's speech-language disorder. To date there is little research on their acoustics characters and articulatory errors. Therefore, this study focuses on acoustic characters and articulatory error patterns of the women immigrants from Japan and Philippine based on the theory of "contrastive analysis". The subjects were 16 Japanese women immigrants(age: 42.5$\pm$4.4) and 14 Philippine women immigrants(age: 31.64$\pm$6.7) and control group consisted of 10 Korean women(age: 28.3$\pm$1.2). Speech and hearing of all subjects and control group were within normal limits. Speech samples were analyzed in a computer using CSL and data analysis was done on FFT widow for F1, F2, F3 of vowels and on wideband spectrogram for VOT of plosives and africatives. The results of this study were like this; For Japanese women immigrants, they had different articulatory patterns of /e/, /a/, /u/, /o/, /$\varepsilon$/, /m/ from those of Koreans and showed articulatory errors on the fortis and aspirated sounds. The reason is Japanese has only two distinctive characters for plosives and affricates; voicing and voiceless. The Philippine women immigrants also showed the same error patterns as the Japanese women immigrants. Especially the errors on aspirated sounds were prominent because their mother tongue has no distinctive characters about aspirated sounds. For vowels, they showed errors of /a/, /o/, /c/.

  • PDF

중풍으로 인한 마비성 조음장애 환자의 침술 후 말소리의 음향학적 평가 연구 (Acoustic Evaluation of acupuncture therapy effects on post-stroke dysarthria)

  • 문병순;윤종민;신용일;김현기
    • 대한음성학회:학술대회논문집
    • /
    • 대한음성학회 2007년도 한국음성과학회 공동학술대회 발표논문집
    • /
    • pp.211-212
    • /
    • 2007
  • Stroke makes several physical deficits. Dysarthria is one of the most difficult problems in conventional medicine because of the weakness of neuromotor control. The purpose of this study is to find the acoustic characteristics of acupuncture therapy effects on post-stroke dysarthria. Seven patients with stroke(infarction or hemorrhage) were selected by CT or MR imaging. The authors applied acupuncture therapy by inserting needles into 8 acupuncture points, ipsilateral ST4, ST6 and contralateral LI4, ST36 on facial palsy side, and CV23, CV24, bilateral "Sheyu" for 4 weeks. Speech sample were composed of five simple vowels /a,e,i,o,u/ and meaningless polysyllabic words CVCVC(C: stops, affricated, fricative sounds, v: /e/). .VOT, total duration of each speech samples and vowel formant (F1&F2) were analyzed on Spectrogram. The results are as follows: 1. VOT of bilabial and velar stops was decreased post treatment. The VOT of bilabial glottalized pre and post treatment were statistically significant (p < 0.05). 2. Total duration of polysyllabic words was decreased post treatment. Decrement of total duration containing the bilabial was statistically significant (p<0.05). 3. First formant of round vowel /o/ pre and post treatment was statistically significant (p<0.05).

  • PDF

병적인 소리 떨림증과 소리꾼 떨림증의 음향학적인 비교연구 (The comparative Study of the Acoustic Representation between Pansori singer's and Spasmodic dysphonia patient's Voice)

  • 홍기환;김현기;이진국;조재식
    • 대한음성학회:학술대회논문집
    • /
    • 대한음성학회 2007년도 한국음성과학회 공동학술대회 발표논문집
    • /
    • pp.143-145
    • /
    • 2007
  • Muscle groups that are located in and around the vocal tract can produce audible changes in frequency and/or intensity of the voice. Vocal vibrato is a characteristic feature in the singing of performers trained in the western classical tradition and vibrato is generally considered to result from modulation in frequency amplitude and timbre. Vocal tremor is also characterized by periodic fluctuations in the voice frequency or intensity and vocal tremor is symptom of a neurological disease as Spasmodic dysphonia , Parkinson's disease. Vocal vibrato and Vocal tremor may have many of the same origins and mechanisms in the voice production systems. The purpose of this study is to find acostic character of Korean traditional song Pansori singer's vibrato and Spasmodic dysphonia patient's vocal tremor. twelve Pansori singers and seven Spasmodic dysponia patients participated to this study. Power spectrum and Real time Spectrogram are used to analyze the acoustic characteristics of Pansori singing and Spasmodic dysphonia patient's voice The results are as follows; First, vowel formant differences between Pansori singing and Spasmodic dysphonia patient's voice are higher F1, F3. Second, The vibrato rate show differences between Pansori singing and Spasmodic dysphonia patients;$4^{\sim}6/sec$ and $5{\sim}6/sec$ Vibrato rate of pitch is 5.7 Hz ${\sim}$ 42.4 Hz for Pansori singing , 3.8 Hz ${\sim}$ 27.9 Hz for Spasmodic dysphonia patients ;Vibrato rate of intensity range is 0.07 dB ${\sim}$ 8.26 dB for Pansori singing and 0.07 dB ${\sim}$ 4.81 dB for Spasmodic dysphonia patients

  • PDF

협대역 다중 주파수선의 자동 탐지 및 추출 기법 연구 (A Study on the Automatic Detection and Extraction of Narrowband Multiple Frequency Lines)

  • 이성은;황수복
    • 한국음향학회지
    • /
    • 제19권8호
    • /
    • pp.78-83
    • /
    • 2000
  • 수동 소나 시스템에서는 수중 소음원에 대한 신호처리 과정을 수행하여 토널 및 주파수선의 신호 성분으로부터 신호 세기 대역폭, 토널 개수, 토널간의 상호 관계둥의 다양한 특징인자를 분석, 비교하여 표적을 식별하게 되며, 표적 식별율을 향상시키기 위해서는 무엇보다도 주파수선의 신호 성분만을 정밀하게 탐지하고 추출하여야 한다. 그러나 수중신호의 스펙트로그램상에 형성되는 협대역 주파수선은 토널의 신호 세기와 바다 자체의 전달 특성 둥으로 인하여 미약하게 탐지되거나 불규칙하게 끊어져서 불연속적으로 나타날 뿐 아니라 임펄스성의 주변잡음 성분과 복합적으로 존재하므로 주파수선의 신호 성분만을 정밀하게 탐지하고 추출하기가 매우 어렵다. 본 논문에서는 신호 세기가 미약한 경우나 높은 주변잡음이 복합되어 있는 경우에도 정밀하게 주파수선의 신호 성분만을 탐지, 추출한 수 있는 협대역 다중 주파수선의 자동 탐지 및 추출을 위한 기법을 제안하였으며, 실제 수중표적 신호를 적용하여 제안된 알고리즘이 매우 유용함을 보인다.

  • PDF

Praat소프트웨어 프로그램을 이용한 영어모음 길이에 관한 실험적 연구 (An Experimental Study on the English Vowel Lengths Using the Praat Software Program)

  • 박희석
    • 디지털콘텐츠학회 논문지
    • /
    • 제13권3호
    • /
    • pp.279-290
    • /
    • 2012
  • 본 연구는 Praat 소프트웨어 프로그램을 이용하여 영어이중모음 /eɪ/ 와 /aɪ/, 그리고 영어전설저모음 /æ/의 발음 길이에 관해 한국인 피 실험자와 원어민 피 실험자를 대상으로 그 차이를 비교분석해보고자 한 연구이다. 이 연구를 위해서 영어문장이 발화되고 녹음되었으며, 피 실험자는 한국인과 원어민 각각 6명씩 참가하였으며, 모두 여성이었고 나이는 23세에서 35세에 위치하고 있다. 음향특질중 하나인 길이측정을 위해서 Praat소프트웨어 프로그램을 활용하였으며, 그 결과를 통계 처리하였다. 실험결과 /eɪ/ 와 /aɪ/에서는 한국인들이 더 길게 발음하였지만 그 차이가 통계상 유의미한 수준은 아니었다. 그러나 /æ/의 발음에서는 한국인들의 발음 길이가 원어민에 비해 훨씬 짧았으며, 그 차이도 통계상 유의미한 수준으로 나타났다.

시각과 청각 및 음향적 관점에서의 노랫말 모음 연구 (Visual.Auditory.Acoustic Study on Singing Vowels of Korean Lyric Songs)

  • 이재강
    • 대한음성학회:학술대회논문집
    • /
    • 대한음성학회 1996년도 10월 학술대회지
    • /
    • pp.362-366
    • /
    • 1996
  • This paper is generally divided in 2 parts. One is the study on vowels about korean singer's lyric song in view of Daniel Jones' Cardinal Vowel. The other is acoustic study on vowels in my singing about korean lyric song. Analysis data are KBS concert video tape and CSL's. NSP file on my singing and Informants are famous singers i.e. 3 sopranos, 1 mezzo, 2 tenors, 1baritone, and me. Analysis aim is to find out Korean 8 vowels([equation omitted]) quality in singing. The methods of descrition are used in closed vowels, half closed vowels, half open vowels, open vowels and rounded vowels, unroundes vowels and formants. The study of the former is while watching the monitor screen to stop the scene that is to be analysixed. The study of the latter is to analysis the spectrogram converted by CSL's. SP file. Analysis results are an follows: Visual and auditory korean vowels quality in singing have the 3 tendency. One is the tendency of more rounded than is usual Korean vowels. Another is the tendency of centralized to center point in Cardinal Vowel and the other is the tendency of diversity in vowel quality. Acoustic analysis is studied by means of 4 formants. Fl and F2 show similiar step in spoken. In Fl there is the same formant values. This seems to vocal organization be perceived the singign situation. The width of F3 is the widest of all, so F3 may be the characteristics in singing. In conclude, the characteristics of vowels in Korean lyric songs are seems to have the tendencies of rounding, centralizing to center point in Cardinal Vowel, diversity in vowel quality and, F3'widest width in compared with usual Korean vowels.

  • PDF

음성 신호 분류에 따른 장애 음성의 변동률 분석, 비선형 동적 분석, 캡스트럼 분석의 유용성 (The Utility of Perturbation, Non-linear dynamic, and Cepstrum measures of dysphonia according to Signal Typing)

  • 최성희;최철희
    • 말소리와 음성과학
    • /
    • 제6권3호
    • /
    • pp.63-72
    • /
    • 2014
  • The current study assessed the utility of acoustic analyses the most commonly used in routine clinical voice assessment including perturbation, nonlinear dynamic analysis, and Spectral/Cepstrum analysis based on signal typing of dysphonic voices and investigated their applicability of clinical acoustic analysis methods. A total of 70 dysphonic voice samples were classified with signal typing using narrowband spectrogram. Traditional parameters of %jitter, %shimmer, and signal-to-noise ratio were calculated for the signals using TF32 and correlation dimension(D2) of nonlinear dynamic parameter and spectral/cepstral measures including mean CPP, CPP_sd, CPPf0, CPPf0_sd, L/H ratio, and L/H ratio_sd were also calculated with ADSV(Analysis of Dysphonia in Speech and VoiceTM). Auditory perceptual analysis was performed by two blinded speech-language pathologists with GRBAS. The results showed that nearly periodic Type 1 signals were all functional dysphonia and Type 4 signals were comprised of neurogenic and organic voice disorders. Only Type 1 voice signals were reliable for perturbation analysis in this study. Significant signal typing-related differences were found in all acoustic and auditory-perceptual measures. SNR, CPP, L/H ratio values for Type 4 were significantly lower than those of other voice signals and significant higher %jitter, %shimmer were observed in Type 4 voice signals(p<.001). Additionally, with increase of signal type, D2 values significantly increased and more complex and nonlinear patterns were represented. Nevertheless, voice signals with highly noise component associated with breathiness were not able to obtain D2. In particular, CPP, was highly sensitive with voice quality 'G', 'R', 'B' than any other acoustic measures. Thus, Spectral and cepstral analyses may be applied for more severe dysphonic voices such as Type 4 signals and CPP can be more accurate and predictive acoustic marker in measuring voice quality and severity in dysphonia.