Search | Korea Science

Emotional Speech Synthesis using the Emotion Editor Program (감정 편집기를 이용한 감정 음성 합성)

Chun Heejin;Lee Yanghee
- Proceedings of the Acoustical Society of Korea Conference
- /
- spring
- /
- pp.79-82
- /
- 2000
감정 표현 음성을 합성하기 위하여 본 연구에서는 감정 음성 데이터의 피치와 지속시간의 음절 유형별 및 어절 내 음절 위치에 따른 변화를 분석하였고, 스펙트럼 포락이 감정 변화에 어떤 영향을 미치는지를 분석하였다. 그 결과, 피치와 지속시간의 음절 유형별, 어절 내 음절 위치에 따른 변화와, 스펙트럼 포락 등도 감정 변화에 영향을 미치는 것으로 나타났다. 또한, 감정 음성의 음향학적 분석 결과를 적용하여 감정 음성을 합성하고 평가하기 위하여, 평상 음성의 음운 및 운율 파라미터 (피치, 에너지, 지속시간, 스펙트럼 포락)를 조절함으로써 감정 음성을 생성하는 감정 편집기를 구현하였다.
PDF

Detection of nonlinearities in speech signal using bicoherence and tricoherence (Bicoherence와 tricoherence를 이용한 음성신호의 비선형성 검출)

김영인;임성빈
- Proceedings of the IEEK Conference
- /
- 1998.06a
- /
- pp.595-598
- /
- 1998
본 논문의 목적은 한국어 모음의 음성 신호에 대하여 2차 및 3차 비선형서의 존재에 대한 정량적인 분석을 수행함에 있다. 음성 신호의 비선형성을 분석하기 위하여 표본화한 음성 신호에 대하여 bicoherence 및 tricoherence를 측정하였다. 실험 결과에 의하면 한국어 모음의 음성 신호의 발생과정에 상당히 강한 2차 및 3차 비선형성이 존재함을 알수 있었다. 특히 음성신호의 3차 비선형성에 대한 연구는 처음 수행되는 것으로 음성 신호 분석에 있어서 매우 중요한 결과로 사료된다.
PDF

Modeling and Analysis of Delay Bound for Voice Traffic in the IEEE 802.11 Wireless LAN (IEEE 802.11 무선랜에서 음성신호의 딜레이 바운드에 관한 분석)

Choi, Won-Suk;Kim, Young-Yong
- Proceedings of the Korea Information Processing Society Conference
- /
- 2003.05b
- /
- pp.1485-1488
- /
- 2003
IEEE 802.11 무선 랜 환경에서 멀티미디어 트래픽이 효과적으로 전송퇴기 위해서는 정해진 딜레이 바운드내에서 전송이 완료되어야 한다 대표적인 멀티미디어 트래픽인 음성신호를 전송할 때의 단방향 딜레이 바운드는 echo canceller를 쓰지 않았을 경우 $25ms{\sim}30ms$ 이다. 딜레이 바운드를 지키지 못하고 전송된다면 시간에 민감한 음성신호의 특성 때문에 음성품질이 유지되지 않을 뿐만 아니라 채널의 혼잡을 유발하게 된다. 본 논문에서는 음성의 품질이 보장되는 기준을 95%이상의 패킷이 성공적으로 전달되는 경우로 제한하여 음성의 딜레이 바운드에 관한 분석을 시도하였다. 이를 위해 음성패킷이 drop될 확률을 수학적인 분석을 통해 유도하고 시뮬레이션을 통한 검증을 시도하였다. 시뮬레이션에서는 IEEE 802.11의 두 가지 기본적인 MAC(Multiple Access Control) 프로토콜인 DCF와 PCF를 사용해서 음성신호를 전송할 때 딜레이 바운드를 지키지 못하는 음성 패킷을 사전에 drop 시킴으로써 몇 개의 음성 노드가 손실율 5% 이내 (음성의 품질이 유지되는 한계)를 만족시키는지를 음성신호를 발생시키는 STA 수와 손실율의 관계를 통해 알아보았다.
PDF

Gender Analysis in Elderly Speech Signal Processing (노인음성신호처리에서의 젠더 분석)

Lee, JiYeoun
- Journal of Digital Convergence
- /
- v.16 no.10
- /
- pp.351-356
- /
- 2018
Changes in vocal cords due to aging can change the frequency of speech, and the speech signals of the elderly can be automatically distinguished from normal speech signals through various analyzes. The purpose of this study is to provide a tool that can be easily accessed by the elderly and disabled people who can be excluded from the rapidly changing technological society and to improve the voice recognition performance. In the study, the gender of the subjects was reported as sex analysis, and the number of female and male voice samples was used equally. In addition, the gender analysis was applied to set the voices of the elderly without using voices of all ages. Finally, we applied a review methodology of standards and reference models to reduce gender difference. 10 Korean women and 10 men aged 70 to 80 years old are used in this study. Comparing the F0 value extracted directly with the waveform and the F0 extracted with TF32 and the Wavesufer speech analysis program, Wavesufer analyzed the F0 of the elderly voice better than TF32. However, there is a need for a voice analysis program for elderly people. In conclusions, analyzing the voice of the elderly will improve speech recognition and synthesis capabilities of existing smart medical systems.
https://doi.org/10.14400/JDC.2018.16.10.351 인용 PDF KSCI

Speech analysis using the Robust Time-Weighted Kalman filtering (시간가중치의 로버스트 칼만필터를 이용한 음성분석)

최홍섭;안수길
- The Journal of the Acoustical Society of Korea
- /
- v.11 no.1E
- /
- pp.73-78
- /
- 1992
시벼형 신호인 음성 신호의 분석에 칼만필터를 이용하였다. 일반적인 음성 분석은 프레임단위의 처리방법인 선형 예측 부호화 기법을 주로 이용하지만 음성의 시변 특성을 파악하는데에는 적절하지 못 하다. 따라서 순차적인 추정기법으로 많이 이용되는 칼만 필터를 음성 분석에 적용하였다. 또한 음성과 같은 시변신호에서는 과거 신호의 잡음의 분산값에 적당한 가중치를 부가하므로써 과거의 신호에 의해 서 현재의 추정값에 미치는 영향을 줄였으며 이를 음성의 천이 구간에서의 파라메타 추정에 사용하였 다. 그리고 음성신호 모델에서 생기는 모델링 오차는 일반적으로 백색 가우시안 잡음으로 가정하고 있 으나 이는 자음과 같은 무성음에서 특징 파라메타 푸정에는 오차가 적지만 모음등의 유성음에서는 음성 발생시의 여기신호인 펄스열에 의해서 많은 모델링 오차를 생기게 한다. 따라서 모델링 오차신호는 Non-Gaussian 확률분포로 가정한 후 로버스트 칼만 필터를 사용하여 합성으멩 대해 특징 파라메터를 추출하였다.
PDF

연축성발성장애의 음성학적 양상

최홍식;이주환;김인섭;고윤우;오종석;이광현;최성희
- Proceedings of the KSLP Conference
- /
- 1999.11a
- /
- pp.179-179
- /
- 1999
배경 : 연축성발성장애는 특징적인 음성의 단절과 함께 짜는 듯한 특징적인 목소리를 보이는 질환으로 발생시기가 다양하지만 대개 중년의 여성과 남성에게 호발하는 만성질환이나 아직까지 그 원인과 병태생리는 규명되어 있지 않으며 이의 음성언어분석 검사에 관한 보고는 드물다. 목적 : 본 연구는 세브란스 병원 이비인후과에서 연축성발성장애로 진단받은 환자를 대상으로 음성 연어분석 검사를 시행한 후 이를 정상인군과 비교 분석하여 연축성 발성장애의 병태생리를 규명하고자 하였다. (중략)
PDF

Performance Analysis of Integrated Voice and Data Traffic in a Cellular Environment (셀룰러 환경에서 통합된 음성과 데이터 트랙픽의 성능분석)

김기완;김두용
- Proceedings of the Korean Information Science Society Conference
- /
- 2000.04a
- /
- pp.265-267
- /
- 2000
본 논문은 셀룰러 이동통신 환경하에서 음성과 데이터가 통합된 통신 시스템의 트래픽 분석 방법을 제안한다. 통합된 통신 시스템에서 음성과 데이터 트래픽은 고유의 채널 영역을 갖고 있고 음성 영역에 유휴한 채널이 있을 경우 데이터 트래픽이 음성 채널을 사용할 수 있으며 음성이 발생하여 필요시 데이터 채널은 preempt 할 수 있는 시스템 제어 방식을 갖는다. 따라서, 본 논문에서는 이와 같이 가변하는 경계를 갖는 시스템의 블록킹 확률과 핸드오프 실패확률 등을 분석한다.
PDF

Collection, Analysis and Classification of Pathological Voice from ARS using Neural Network (ARS와 신경회로망을 이용한 장애음성의 수집, 분석 및 식별에 관한 연구)

김광인;조철우;김대현;왕수건;전계록;안시훈;김기련;김용주
- Proceedings of the IEEK Conference
- /
- 2000.09a
- /
- pp.955-958
- /
- 2000
본 논문은 음성신호를 이용해 성대의 질환이 있는 환자를 진단하고 병명을 판별하게끔 유도하는 자동 진단 시스템을 개발하기 위한 연구의 일부로, 그중 ARS를 이용하여 환자의 음성을 수집, 분석, 식별의 실험에 대한 연구이다. 본 연구 팀에서는 이미 CSL을 이용한 장애음성 데이터의 수집과 식별에 관한 연구 결과를 발표한바 있다. 하지만 선행연구에서는 방음실에서 디지털 녹음기를 이용하여 수집한 음성을 사용했기 때문에, ARS를 통하여 녹음한 음성과는 샘플링 주파수나 대역폭, 잡음성분등의 데이터의 특성이 상당한 차이가 있다. 이러한 이유로 ARS를 통하여 녹음한 음성에 보다 적합한 파라미터 분석프로그램을 작성하여 파라미터를 구하였다. 이 파라미터들은 Kay사의 MDVP를 기초로하여 작성하였고, 대부분 80%정도의 신뢰성을 가졌다. 수집한 음성의 식별은 정상음성과 양성음성의 두가지 경우로 분리하였다. 식별기법으로는 신경망을 이용하였고, 식별파라미터는 구한 파라미터중 6개의 파라미터를 선별하여 식별한 결과 약 90%정도의 식별율을 가졌다.
PDF

A Study on the Acoustic Modeling of the Emotional Speech (감정 음성의 음향학적 모델링에 관한 연구)

천희진;이양희
- Proceedings of the IEEK Conference
- /
- 2000.09a
- /
- pp.815-818
- /
- 2000
본 논문에서는 감정 표현 음성 합성 시스템을 구현하기 위해서, 감정 음성 데이터베이스의 음향학적 특징인 피치, 에너지, 지속시간, 스펙트럼 포락에 대해 분석한 결과와 문법적 요소인 품사에 따른 감정 음성 데이터의 피치 변화를 분석하였다. 분석 결과, 기본 주파수, 에너지, 지속시간, 스펙트럼 포락은 감정 표현에 중요한 영향을 미치는 것으로 나타났으며, 전반적으로 화남과 기쁨의 감정이 평상과 슬픔의 감정 보다 피치 및 에너지의 변화가 크게 나타났으며, 특히 기쁜 감정의 경우 부사, 관형사, 연결어미, 조사, 접미사에서 피치 변화가 많았으며, 화난 감정의 경우, 관형사, 명사, 용언, 접미사에서 피치 변화가 높게 나타났다. 이러한 분석 결과를 적용해 감정 음성을 합성하기 위하여, 평상 음성에 각 감정 음성의 운율 요소를 적용하여 감정 음성을 합성하여 평가한 결과, 기쁜 감정은 기본 주파수의 변화에 의해 86.7%, 화난 감정은 에너지의 변화에 의해 91%, 슬픈 감정은 음절지속시간의 변화에 의해 76.7%가 각각 올바른 감정으로 인지되었다.
PDF

Speech-to-MIDI Conversion with Autocorrelation (자기상관을 이용한 음성 신호의 MIDI 변환)

박상보;황인준
- Proceedings of the Korean Information Science Society Conference
- /
- 2004.10c
- /
- pp.439-441
- /
- 2004
효율적인 멀티미디어 검색의 필요성이 증대됨에 따라 내용기반 멀티미디어의 검색에 대한 다양한 기법들이 소개되고 있다. 그 중에서 친숙한 멜로디를 가지고 사용자가 직접 마이크를 통해 생성한 음성 질의에 대한 분석에 대해 다루고자 한다. 음성 질의에 사용되는 음성 데이터를 분석함으로써 검색에 이용하는 것이다. 음성데이터를 분석하기 위한 방법으로 시간영역에서 가장 많이 쓰이는 기법 중의 하나인 자기상관함수를 사용한다. 자기상관 함수를 이용하여 특정구간에서 발생하는 일정한 주기 즉 기본주기를 검출할 수 있다. 자기상관함수에 의해 분석된 결과를 가지고, 음의 높낮이를 구하기 위한 기본주파수 검출 알고리즘과 음의 길이, 음의 세기를 결정하기 위한 방법을 제안한다.
PDF

Search Result 3,062, Processing Time 0.027 seconds

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

Detail Search

Image Search (β)