• Title/Summary/Keyword: 음성명료도

Search Result 189, Processing Time 0.023 seconds

Effects of Helium Gas on the Articulators (헬륨(He)가스가 조음기관에 미치는 영향)

  • Lim, Soon-Yong;Lim, Sung-Su;Youn, Yong-Heum;Min, Ji-Sun;Song, Han-Sol;Kim, Bong-Hyun;Ka, Min-Kyoung;Cho, Dong-Uk
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2011.04a
    • /
    • pp.1082-1085
    • /
    • 2011
  • 기존에 잠수부가 사용하던 질소가스가 인체에 치명적인 공기 색전증을 유발하게 되면서 헬륨 산소혼합가스는 이를 극복하기 위한 대체 호흡용 가스로 사용되고 있다. 특히, 헬륨가스는 명료도가 낮은 squeaky voice를 유발하기 때문에 잠수부들의 비정상적인 음성에 대한 해석에 어려움이 많다. 또한, 헬륨가스는 일상생활에서 자주 접하는 것이며 다양한 TV프로에서도 헬륨가스를 마신 후 변하는 목소리를 통해 웃음을 전달하고 있다. 따라서 본 논문에서는 헬륨가스가 조음기관에 미치는 영향을 음성분석학적 요소의 적용을 통해 측정하는 연구를 수행하였다.

A study on loss combination in time and frequency for effective speech enhancement based on complex-valued spectrum (효과적인 복소 스펙트럼 기반 음성 향상을 위한 시간과 주파수 영역 손실함수 조합에 관한 연구)

  • Jung, Jaehee;Kim, Wooil
    • The Journal of the Acoustical Society of Korea
    • /
    • v.41 no.1
    • /
    • pp.38-44
    • /
    • 2022
  • Speech enhancement is performed to improve intelligibility and quality of the noise-corrupted speech. In this paper, speech enhancement performance was compared using different loss functions in time and frequency domains. This study proposes a combination of loss functions to utilize advantage of each domain by considering both the details of spectrum and the speech waveform. In our study, Scale Invariant-Source to Noise Ratio (SI-SNR) is used for the time domain loss function, and Mean Squared Error (MSE) is used for the frequency domain, which is calculated over the complex-valued spectrum and magnitude spectrum. The phase loss is obtained using the sin function. Speech enhancement result is evaluated using Source-to-Distortion Ratio (SDR), Perceptual Evaluation of Speech Quality (PESQ), and Short-Time Objective Intelligibility (STOI). In order to confirm the result of speech enhancement, resulting spectrograms are also compared. The experimental results over the TIMIT database show the highest performance when using combination of SI-SNR and magnitude loss functions.

Comparison of acoustic features due to the Lombard effect in typically developing children and adults (롬바르드 효과가 아동과 성인의 말소리 산출에 미치는 영향: 음향학적 특성과 모음공간면적을 중심으로)

  • Yelim Jang;Jaehee Hwang;Nuri Lee;Nakyung Lee;Seeun Eum;Youngmee Lee
    • Phonetics and Speech Sciences
    • /
    • v.16 no.2
    • /
    • pp.19-27
    • /
    • 2024
  • The Lombard effect is an involuntary response to speakers' experiences in the presence of noise during voice communication. This study aimed to investigate the Lombard effect by comparing the acoustic features of children and adults under different listening conditions. Twelve male children (5-9 years old) and 12 young adult men (24-35 years old) were recruited to produce speech under three different listening conditions (quiet, noise-55 dB, noise-70 dB). Acoustic analyses were then carried out to characterize their acoustic features, such as F0, intensity, duration, and vowel space area, under the three listening conditions. A Lombard effect was observed in the intensity and duration for children and adults who participated in this study under adverse listening conditions. However, we did not observe a Lombard effect in the F0 and vowel space areas of either group. These findings suggest that children can adjust their speech production in challenging listening conditions as much as adults.

A New Wideband Speech/Audio Coder Interoperable with ITU-T G.729/G.729E (ITU-T G.729/G.729E와 호환성을 갖는 광대역 음성/오디오 부호화기)

  • Kim, Kyung-Tae;Lee, Min-Ki;Youn, Dae-Hee
    • Journal of the Institute of Electronics Engineers of Korea SP
    • /
    • v.45 no.2
    • /
    • pp.81-89
    • /
    • 2008
  • Wideband speech, characterized by a bandwidth of about 7 kHz (50-7000 Hz), provides a substantial quality improvement in terms of naturalness and intelligibility. Although higher data rates are required, it has extended its application to audio and video conferencing, high-quality multimedia communications in mobile links or packet-switched transmissions, and digital AM broadcasting. In this paper, we present a new bandwidth-scalable coder for wideband speech and audio signals. The proposed coder spits 8kHz signal bandwidth into two narrow bands, and different coding schemes are applied to each band. The lower-band signal is coded using the ITU-T G.729/G.729E coder, and the higher-band signal is compressed using a new algorithm based on the gammatone filter bank with an invertible auditory model. Due to the split-band architecture and completely independent coding schemes for each band, the output speech of the decoder can be selected to be a narrowband or wideband according to the channel condition. Subjective tests showed that, for wideband speech and audio signals, the proposed coder at 14.2/18 kbit/s produces superior quality to ITU-T 24 kbit/s G.722.1 with the shorter algorithmic delay.

The relevancy between Physical index and subjective appraisal of classrooms (강의실 내의 물리지표와 주관적 평가와의 상관관계)

  • Lee, Chai-Bong;Kim, Yong-Man
    • Proceedings of the Korean Society for Noise and Vibration Engineering Conference
    • /
    • 2002.11b
    • /
    • pp.743-748
    • /
    • 2002
  • The eventual Purpose of this research is to make optimum standards for acoustic-environment by using not only physical characteristics but also subjective appraisals. Basic physical data were measured which were necessary to establish standards for acoustic environment in campus buildings, TSP has used to measure sound levels, reverberation times, clearness indexes, and speech-transmission-index. In addition to physical characteristics, questionnaires were given to university students to given subjective appraisals. For instance, questions about volume or clearness of lectures. The relevancy between physical characteristics and subjective appraisals was studied.

  • PDF

우수한 교실음향 구현을 위한 설계기준 및 개선방향조사

  • Jeong, Jeong-Ho
    • Fire Protection Technology
    • /
    • s.42
    • /
    • pp.17-25
    • /
    • 2007
  • 쾌적하고 명료성이 높은 교실내의 음향환경은 학생들의 학업 성취도 및 교사의 언어전달 이해 향상을 이룩할 수 있는 중요한 사항이다. 이러한 우수한 교육환경을 위해서는 우선 우리나라의 교실 음향 실태 파악과 함께 교육시설의 음향상태 및 소음에 의한 학업 성취도, 심리적, 사회적 영향에 대한 정량적 조사가 이루어 져야 한다. 국내 교육시설의 음향 실태 파악을 통해 교육시설에서의 음향 및 소음 기준을 수립하여 교육시설내의 음환경 개선을 추진해야 한다. 교실 음향개선을 합리적으로 평가할 수 있는 지표로서 잔향시간과 배경소음이 가장 중요한 요소로 알려져 있다. 교실의 우수한 음환경을 위해 적절한 잔향시간은 $0.4\sim0.6$초, 배경소음은 NC-$25\sim30$수준이 확보되어야 하는 것으로 조사되었다. 또한 교사의 음성레벨과 배경소음과의 비(S/N비)는 최소 10 dB이상 되어야 강의 내용 전달이 가능하며, 각종 기계설비에서 발생되는 소음 및 진동은 저소음 기기 선정을 통해 최소화하여야 한다. 인접 실에서 발생되는 소음을 충분히 차단하기 위해서는 차음성능 우수한 구조의 벽계로 개선되어야 하며, 기밀성이 높은 출입문사용과 적절한 출입구 배치를 통해 인접한 교실로의 소음 전달을 최소화 할 수 있다.

  • PDF

Regression Tree based Modeling of Segmental Durations For Text-to-Speech Conversion System (Text-to-Speech 변환 시스템을 위한 회귀 트리 기반의 음소 지속 시간 모델링)

  • Pyo, Kyung-Ran;Kim, Hyung-Soon
    • Annual Conference on Human and Language Technology
    • /
    • 1999.10e
    • /
    • pp.191-195
    • /
    • 1999
  • 자연스럽고 명료한 한국어 Text-to-Speech 변환 시스템을 위해서 음소의 지속 시간을 제어하는 일은 매우 중요하다. 음소의 지속 시간은 여러 가지 문맥 정보에 의해서 변화하므로 제어 규칙에 의존하기 보다 방대한 데이터베이스를 이용하여 통계적인 기법으로 음소의 지속 시간에 변화를 주는 요인을 찾아내려고 하는 것이 지금의 추세이다. 본 연구에서도 트리기반 모델링 방법중의 하나인 CART(classification and regression tree) 방법을 사용하여 회귀 트리를 생성하고, 생성된 트리에 기반하여 음소의 지속 시간 예측 모델과, 자연스러운 끊어 읽기를 위한 휴지 기간 예측 모델을 제안하고 있다. 실험에 사용한 음성코퍼스는 550개의 문장으로 구성되어 있으며, 이 중 428개 문장으로 회귀 트리를 학습시켰고, 나머지 122개의 문장으로 실험하였다. 모델의 평가를 위해서 실제값과 예측값과의 상관관계를 구하였더니 음소의 지속 시간을 예측하는 회귀 트리에서는 상관계수가 0.84로 계산되었고, 끊어 읽는 경계에서의 휴지 기간을 예측하는 회귀 트리에서는 상관계수가 0.63으로 나타났다.

  • PDF

The Acoustic Character of Classroom as Using Microphone (마이크 사용시 강의실내의 음향특성)

  • 이채봉;강대기
    • Proceedings of the Korean Society for Noise and Vibration Engineering Conference
    • /
    • 2003.05a
    • /
    • pp.786-790
    • /
    • 2003
  • The purpose of this research is to observe that the acoustic characters of classroom have some difference by several conditions. TSP has used to measure impulse response and such physical indexes as RT(Reverberation Time), D$\sub$50/, and STI(Speech-Transmission-Index) are computed by it. we investigate difference under some conditions such as when students were present at each classroom and when was not so, and when professor used a microphone and unused it. In this study, we found that reverberation time when people take a seat is lower than was not so. we wish to help one who work for construction industry, as they build a kind of classroom

  • PDF

On a Duration Control Technique by using FFT Characteristics (FFT변환 특성을 이용한 지속시간 변경법)

  • Kim JongKuk;Bae MyungJin
    • Proceedings of the Acoustical Society of Korea Conference
    • /
    • spring
    • /
    • pp.123-126
    • /
    • 2002
  • 본 논문에서는 실시간으로 운율을 제어 할 수 있는 방법의 하나인 지속시간 변경을 주파수 영역에서 변경하는 방법을 사용하였다. 또한 프레임처리에서 윈도우의 영향으로 스펙트럼 왜곡 및 음질 저하를 방지하기 위하여 보상된 윈도우를 적용하였다. 만약 운율조절에 있어서 지속시간을 자유롭게 변경할 수 있다면 언어장애인의 발음교정이나 어학학습 등 여러 분야에 이용할 수 있을 것이다. 결과적으로 본 논문에서 제안한 FFT변환 특성을 이용하여 지속시간을 변경한 방법을 사용하여 피치변경후에 지속시간까지 변경한 음성의 명료도가 피치만 변경한 경우보다는 떨어지지만 자연성 면에서는 더 좋은 결과를 얻을 수 있었다.

  • PDF

A Study on the Korean Accentuation Rule for the Korean text to speech conversion (문장-언어 변환을 위한 한국어 액센트에 관한 연구)

  • 진달복;김성곤
    • Journal of the Korea Institute of Information and Communication Engineering
    • /
    • v.8 no.4
    • /
    • pp.804-806
    • /
    • 2004
  • this paper is to propose the formative Korean accentuation rule for the korean tort to speech conversion. The accentuation rule is as following: (1) If the rhyme of first syllable is -v, then accent is on the next syllable. (2) If the rhyme of first syllable is not -v, then accent is on the first syllable.