통합 검색 | Korea Science

확률적 방법을 이용한 음성 개성 변환 (Voice Personality Transformation Using a Probabilistic Method)

이기승
- 한국음향학회지
- /
- 제24권3호
- /
- pp.150-159
- /
- 2005
본 논문에서는 임의의 음성을 특정 화자가 발성한 것처럼 들리도록 변환하는 음성 개성 변환 알고리즘에 대해 연구하였다. 제안된 기법은 화자의 음성을 LPC 켑스트럼, 피치, 발성 속도를 사용하여 표현하였으며 각각에 대한 변환 규칙을 생성하여 변환을 수행하였다. LPC 켑스트럼은 혼합 가우시안 모델을 이용한 확률적으로 모델링하고, 두 화자간의 대응관계를 조건 확률로 나타내었다. 확률적인 모델링에 필요한 각종 파라메터들을 얻기 위해 최대 가능도 기법이 사용되었으며, 변환 LPC 켑스트럼은 최소 자승 오차 방법에 근거하여 얻어지도록 하였다. 운율 변환을 위한 변수로 본 논문에서는 피치와 발성 속도를 사용하였으며, 두 음성간의 평균값 비율을 사용하여 운율 변환을 수행하였다. 제안된 기법은 기존 벡터 양자화 기반의 기법과 비교에서, 객관적인 척도로 사용한 평균 켑스트럼 거리 감소율, 가능도 증가율 면에서 우수한 성능을 나타내었다. 주관적인 테스트에서도 기존의 방법과 유사한 인식율을 얻었으며 특히 완만하게 변화하는 스펙트럼 궤적에 따른 고음질이 얻어짐을 확인할 수 있었다.
PDF KSCI

심리음향 모델을 이용한 무선 음성인식 시스템 (Wireless Speech Recognition System using Psychoacoustic Model)

노진수;이강현
- 전자공학회논문지CI
- /
- 제43권6호
- /
- pp.110-116
- /
- 2006
본 논문에서는 무선 음성 센서를 사용하여 스위치 제어나 생체신호 인증과 같은 유비쿼터스 센서 네트워크 응용 서비스를 지원하기 위한 음성인식 시스템을 구현하였다. 제안된 시스템은 무선 음성센서와 심리음향 모델을 이용한 음성인식 알고리즘과 에러정정을 위한 LDPC(Low Density Parity Check) 모듈로 구성된다. 제안된 음성인식 알고리즘은 센서의 소비 에너지를 효율적으로 사용하기 위하여 호스트 컴퓨터에 삽입되며, 음성인식의 정확도를 향상시키기 위하여 전방향 에러정정 알고리즘을 사용하였다. 또한, 효율적으로 무선채널의 잡음을 제거하고 무선채널 에러를 정정하기 위하여 실험 환경과 실험 계수를 최적화하였다. 결과적으로, 센서와 음원 사이의 거리가 1.0m 이하 일 때 FAR 0.126%와 FRR 7.5%를 얻었다.
PDF KSCI

운전자 정보 극대화를 위한 Augmented Driving System (ADS) 기술에 관한 연구 (A Study on Augmented Driving System (ADS) Technology Development for Useful Driving Information)

양승훈;김동중;김한울;이수민;황지환;김병규
- 한국정보처리학회:학술대회논문집
- /
- 한국정보처리학회 2012년도 춘계학술발표대회
- /
- pp.836-839
- /
- 2012
본 논문에서는 운전자의 안전을 보장하기 위해 영상 처리 기술을 기반으로 도로 정보를 검출해 운전자에게 알려주고, 버튼을 직접 손으로 눌러야 하는 물리적 인터페이스를 대체할 차세대 인터페이스 기술을 제안한다. 제안된 기술은 카메라 한대에서 입력 받은 영상 정보를 제안된 알고리즘을 통해 앞차와의 거리, 차선, 교통 표지판을 검출하고 차량 내부를 주시하는 카메라와 운전자의 음성을 인식할 마이크를 기반으로 음성인식과 동작 인식이 결합된 인터페이스를 제공한다. 본 논문에서 개발된 기술을 통해 설제 테스트를 실시해 본 결과 표지판인식, 차선검출, 앞차와의 거리 검출 등의 인식률이 약 90% 이상이었으며, 이러한 기술적 요소들은 운전자가 인지하지 못하는 상황 등에서도 적절한 정보를 운전자에게 제공해 줌으로써 교통사고 확률을 크게 낮출 수 있을 것으로 기대된다.
https://doi.org/10.3745/PKIPS.y2012m04a.836 인용 PDF

지각적 표현에 기초한 비음 인식에 관한 연구 (Nasal Consonants Recognition Based on the Perceptual Representation)

김기철;조정완
- 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
- /
- 한국정보과학회언어공학연구회 1989년도 한글날기념 학술대회 발표논문집
- /
- pp.120-125
- /
- 1989
음성 신호에는 언어정보이외에 여러 요인에 의한 정보가 포함되어 있어서, 문자와 일대일로 대응되는 분절을 정확하게 검출하기가 어렵다. 본 연구에서는 선형 예측계수 (LPC) 스펙트럼의 첨두 부분을 강조한 이진 (binary) 스펙트럼을 제안하고, 이를 바탕으로 음의 안정영역과 천이영역을 통합하여 음향특징을 추출하고자 한다. 각 영역의 특징은 이진 스펙트럼을 누적하여 구하며, 통합적인 특징은 각 영역의 특징을 결합한 관계적 특징으로 나타낸다. 제 2 차 포르만트 주파수의 궤적을 관계적 특징으로 하여, 양순 비음과 치조 비음을 구별한 결과, 모음의 문맥과 화자에 비교적 독립적인 인식결과를 얻을 수 있었다. 또한 이진 스펙트럼이 원래의 스펙트럼에 포함된 정보를 유지하는지 검토하기 위해, 같은 거리척도 (distance measure) 에 의해 인식 실험한 결과 이진 스펙트럼의 성능이 오히려 우수하게 나타났으며, 관계적 이진 스펙트럼의 경우 화자에 따른 변화가 더욱 적었다. 음성에 백색 잡음 (Gaussian white noise)을 더하여 잡음음성 (noisy speech) 을 만든 뒤, 같은 방법으로 실험한 결과도 유사한 인식결과를 얻을 수 있어 제안된 이진 스펙트럼의 유효성을 확인하였다.
PDF

입말 표기를 이용한 영어 단어 검색 (Retrieving English Words with a Spoken Work Transliteration)

김지승;김광현;이준호
- 한국문헌정보학회지
- /
- 제39권3호
- /
- pp.93-103
- /
- 2005
영어 사전 검색 서비스 이용자들은 원하는 영어 단어의 철자를 정확하게 기억하지 못하고, 발음만을 기억하는 경우가 있다. 이러한 이용자들에게 도움을 주기 위해 본 연구에서는 입말 표기, 즉 영어 단어 발음의 한글 표기를 이용하여 영어 단어를 효과적으로 검색할 수 있는 방법을 제안한다. 이를 위하여 코닉스(KONIX) 코드를 개발하며, 입말 표기와 영어 단어를 코닉스 코드들로 변환한다. 그리고 변환된 코닉스 코드들 사이의 음성적 유사도를 편집 거리 방법과 2-그램 방법을 이용하여 계산한다. 또한 제안한 방법이 입말 표기에 의한 영어 단어 검색에 매우 효과적임을 실험을 통하여 입증한다.
https://doi.org/10.4275/KSLIS.2005.39.3.093 인용 PDF

잡음적응 변별학습 방식을 이용한 환경적응 (Environment Adaptation by Discriminative Noise Adaptive Training Methods)

강병옥;정호영;이윤근
- 한국정보처리학회:학술대회논문집
- /
- 한국정보처리학회 2007년도 춘계학술발표대회
- /
- pp.397-398
- /
- 2007
본 논문에서는 환경변화에 대해 강인하게 동작하는 음성인식 시스템을 위해 잡음적응 훈련과 변별학습 방식을 결합한 형태의 환경적응 방식을 제안한다. 다중환경 훈련과 잡음제거방식을 결합한 형태인 잡음적응 훈련 방식은 음성인식을 위한 MCE (Minimum Classification Error)의 목적과는 거리가 있고, 음성인식 시스템이 사용되는 모든 환경을 반영하는 것은 현실적으로 어렵다는 점에서 한계가 있다. 이에 잡음적응 훈련방식으로 훈련된 기본 음향모델을 목적환경에서 수집한 소량의 데이터를 이용한 변별학습을 통해 환경적응 모델로 변환함으로써 이러한 단점을 보완할 수 있는 잡음 적응 변별학습을 이용한 훈련방식을 제안한다.
PDF

LPC 켑스트럼 거리 기반의 천이구간 정보를 이용한 음성의 가변적인 시간축 변환 (Variable Time-Scale Modification of Speech Using Transient Information based on LPC Cepstral Distance)

이성주;김희동;김형순
- 음성과학
- /
- 제3권
- /
- pp.167-176
- /
- 1998
Conventional time-scale modification methods have the problem that as the modification rate gets higher the time-scale modified speech signal becomes less intelligible, because they ignore the effect of articulation rate on speech characteristics. Results of research on speech perception show that the timing information of transient portions of a speech signal plays an important role in discriminating among different speech sounds. Inspired by this fact, we propose a novel scheme for modifying the time-scale of speech. In the proposed scheme, the timing information of the transient portions of speech is preserved, while the steady portions of speech are compressed or expanded somewhat excessively for maintaining overall time-scale change. In order to identify the transient and steady portions of a speech signal, we employ a simple method using LPC cepstral distance between neighboring frames. The result of the subjective preference test indicates that the proposed method produces performance superior to that of the conventional SOLA method, especially for very fast playback case.
PDF

Phonetic Posterior Grams에 의해 조건화된 적대적 생성 신경망을 사용한 음성 변환 시스템 (Voice Conversion using Generative Adversarial Nets conditioned by Phonetic Posterior Grams)

임진수;강천성;김동하;김경섭
- 한국정보통신학회:학술대회논문집
- /
- 한국정보통신학회 2018년도 추계학술대회
- /
- pp.369-372
- /
- 2018
본 논문은 매핑 되지 않은 입력 음성과 목표음성 사이에 음성 변환하는 비 병렬 음성 변환 네트워크를 제안한다. 기존 음성 변환 연구에서는 변환 전후 스펙트로그램의 거리 오차를 최소화하는 방법을 주로 학습 한다. 이러한 방법은 MSE의 이미지를 평균 내는 특징으로 인하여 생성된 스펙트로그램의 해상도가 저하되는 문제점이 있었다. 또한, 병렬 데이터를 사용해 연구를 진행했기 때문에 데이터를 수집하는 것에도 어려움이 많았다. 본 논문에서는 입력 음성의 발음 PPGs를 사용하여 비 병렬 데이터 간 학습을 진행 하며, GAN 학습을 통해 더욱 선명한 음성을 생성하는 방법을 사용하였다. 제안한 방법의 유효성을 검증하기 위해서 기존 음성 변환 시스템에서 많이 사용하는 GMM 기반 모델과 MOS 테스트를 진행하였으며 기존 모델에 비하여 성능이 향상되는 결과를 얻었다.
PDF

제품 트리거로서 행동인식의 사용자 경험 디자인 연구 - 제품디자인을 중심으로 - (Study on User Experience design in Gesture Interaction as a Product Trigger - Focusing on Product Design -)

민새얀;이캐시연주
- 디지털융복합연구
- /
- 제17권5호
- /
- pp.379-384
- /
- 2019
본 연구는 최근 급증하는 음성 인터랙션의 기능적 면모에서 사용자가 우선으로 측정하는 경험과 문제점을 파악하고 새롭게 나타날 행동인식 인터랙션의 문법에 적합한지 그 발전 가능성을 탐구하는 데 목적이 있다. 연구방법으로 문헌 연구를 통해 그동안 제품에 사용되던 제품 인터페이스의 이론적 고찰 과정을 거친 후 음성인식을 제품의 트리거로서 사용해 본 20-30대 사용자를 대상으로 심층 인터뷰를 진행하여 사용자 경험 측면에서 이용 경험과 개선 방안에 대해 정리하였다. 그 결과, 정확성 신뢰도 하락으로 인해 음성인식 인터랙션의 선호도가 감소하고 있다는 점과 물리적 거리 배제성이라는 기능적 측면에 알맞은 인터페이스가 필요하다는 결론을 도출해 낼 수 있었다. 이 연구는 제품 트리거 인터페이스에 관한 연구로, 문제를 발견하고 이에 대해 개선 방안을 제시했다는 점에 의의가 있다. 하지만 구체적인 방안을 설계하지 못했다는 데에 한계가 있다. 이 연구를 기점으로 음성인식 인터랙션의 개선 방안을 보완하고, 행동인식 인터랙션과 관련된 후속연구가 이루어져 제품디자인 인터페이스 개선에 도움이 되기를 바란다.
https://doi.org/10.14400/JDC.2019.17.5.379 인용 PDF KSCI HTML

인지 LPC cepstrum의 새로운 구현 및 음성인식에의 적용 (A new Implementation of Perceptual LPC Cepstrum and its Application to Speech Recognition)

김진영;최승호
- 한국음향학회지
- /
- 제15권5호
- /
- pp.61-64
- /
- 1996
본 논문에서는 귀의 주요한 특징인 주파수가중특성과 Bark-scale이라는 비선형주파수특성을 선형주파수축상에서 고려한 거리함수를 정의하고, 이 거리함수로부터 새로운 LPC cepstrum 계수를 제안한다. 귀의 특성은 선형주파수축에서 로그 스펙트럼에 대한 가증함수로서 표현되며, 이 가중함수는 cepstrum 영역에서 콘볼루션으로 표현되어 콘볼루션적으로 가중되는 LPC cepstrum을 정의하게 된다. 제안된 cepstrum 계수에서 정의된 가중함수는 A-weighting의 영향과 비선형주파수축의 영향을 하나의 가중함수로 통합하여 사용된 것이다. 제안된 파라미터의 성능을 음성인식 실험을 통하여 검증하였다.
PDF

검색결과 135건 처리시간 0.029초

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

자세히 찾기

이미지 검색 (β)