통합 검색 | Korea Science

잡음환경에서의 바이모달 음성인식 (Bi-modal speech recognition in noisy environments)

박병구
- 한국음향학회:학술대회논문집
- /
- 한국음향학회 1998년도 학술발표대회 논문집 제17권 1호
- /
- pp.111-114
- /
- 1998
기존의 음성인식시스템의 잡음환경에서 인식률의 한계를 극복하기 위해 음성신호뿐만이 아니라 입술정보를 결합하여 음성인식에 이용하여 바이모달(Bi-modal) 음성인식이 근래에 제안되어지고 있다. 그래서 바이모달 음성인식 시스템을 실제로 구현해보고 인식 실험을 수행해 보았다. 입술영상은 이미지에 근거한 입술모양을 파라메터화하여 인식실험에 사용하였으며 음성과 입술영상을 각각 인식한 후 인식스코어(Score)에 가중치를 적용하여 통합하는 방법을 사용하였다. 마지막으로 바이모달 음성인식의 잡음환경에서의 성능을 알아보기 위해 음성신호에 여러 레벨의 잡음을 섞어서 실험을 하고 잡음환경에서 인식률의 한계를 입술정보를 이용하여 극복할 수 있다는 것을 보이고자 한다.
PDF

전화 대역 확장에 따른 통화품질의 변화 (On the Transmission Quality of Wide-Band Telephony)

김정환
- 한국음향학회:학술대회논문집
- /
- 한국음향학회 1995년도 제12회 음성통신 및 신호처리 워크샵 논문집 (SCAS 12권 1호)
- /
- pp.155-158
- /
- 1995
150~7,000Hzd의 확대역 전화를 위한 전화 전송특성 설계지침으로 활용하기 위해, 확대역과 300~3400Hz 의 협대역 전화에 대한 통화품질 평가결과를 비교/분석하였다. 토화품질 평가는, 조정법에 의한 선호 라우드니스 레벨고 ㅏ동가 라우드니스 레벨 조정실험, 그리고 단음절 명료도평가로 구성되었다. 선호 라우드니스 레벨 조정실험의 결과, 협대역과 확대역 음성에 대한 피험자의 선호레벨이 각각 70.7dB 및 68.6dB로 약 2dB의 차이를, 피험자간 분산은 2.12와 6.11로 의미있는 차이를 보였는데, 이것은 음성대역의 확장에 따라 사용자들의분산이 크기 때문에 확대역 전화에서 수화음량 조절기능이 필요함을 증명한 결과이다. 그리고, 협/확대역 조건에서의 100개 단음절에 대한 명료도 실험 결과에서, 전체 명료도 점수간에는 통계적으로 의미있는 차이를 보이지 않았지만 단음절중 3,400Hz이상에서 많은 에너지를 갖는, 파열음 'ㅌ', 파찰음 'ㅈ', 'ㅉ', 'ㅊ', 그리고 마찰음 'ㅅ', 'ㅆ' 으로 시작하는 20개 단음절에 대한 부분명료도에 있어서 협대역과 확대역 조건간에 20%의 명료도 차이를 나타내었다. 또한, 비교 라우드니스 레벨 조정실험의 결과, 협대역과 확대역 사이의 평균 라우드니스 레벨 차이가 약 3.4dB (A)로 나타났는데, 이 결과는 국내 확대역 전화의 수화음량적격 설정에 지침으로 활용할 것이다.
PDF

은닉 마르코프 모델과 레벨 빌딩을 이용한 한국어 연속 음성 인식 (Recognition of Continuous Spoken Korean Language using HMM and Level Building)

김경현;김상균;김항준
- 전자공학회논문지C
- /
- 제35C권11호
- /
- pp.63-75
- /
- 1998
한국어 연속 음성에서 발생하는 조음결합문제를 해결하기 위하여 단어를 기본 인식 단위로 사용할 경우 각 단어의 효율적인 표현 방법, 연속된 단어로 이루어진 여러 문장의 표현 방법 그리고 입력된 연속음성을 연속된 여러 단어로의 정합 방법에 관한 연구가 선행되어야 한다. 본 논문에서는 은닉 마르코프 모델과 레벨빌딩 알고리즘을 이용한 한국어 연속 음성 인식 시스템을 제안한다. 각 단어는 은닉 마르코프 모델로 표현하고 문장을 표현하기 위하여 단어 모델을 연결한 형태인 인식 네트워크를 구성한다. 인식네트워크의 탐색 알고리즘으로는 레벨 빌딩 알고리즘을 사용한다. 제안한 방법은 항공기 예약 시스템에 적용한 실험에서 인식율과 인식속도면에서 실용적이었으며 또한 비교적 적은 저장공간으로 전체 문장을 표현하고 쉽게 확장할 수 있다는 장점을 가지고 있다.
PDF

HMM 기반 감정 음성 합성기 개발을 위한 감정 음성 데이터의 음색 유사도 분석 (Analysis of Voice Color Similarity for the development of HMM Based Emotional Text to Speech Synthesis)

민소연;나덕수
- 한국산학기술학회논문지
- /
- 제15권9호
- /
- pp.5763-5768
- /
- 2014
하나의 합성기에서 감정이 표현되지 않는 기본 음성과 여러 감정 음성을 함께 합성하는 경우 음색을 유지하는 것이 중요해 진다. 감정이 과도하게 표현된 녹음 음성을 사용하여 합성기를 구현하는 경우 음색이 유지되지 못해 각 합성음이 서로 다른 화자의 음성처럼 들릴 수 있다. 본 논문에서는 감정 레벨을 조절하는 HMM 기반 음성 합성기를 구현하기 위해 구축한 음성데이터의 음색 변화를 분석하였다. 음성 합성기를 구현하기 위해서는 음성을 녹음하여 데이터베이스를 구축하게 되는데, 감정 음성 합성기를 구현하기 위해서는 특히 녹음 과정이 매우 중요하다. 감정을 정의하고 레벨을 유지하는 것은 매우 어렵기 때문에 모니터링이 잘 이루어져야 한다. 음성 데이터베이스는 일반 음성과 기쁨(Happiness), 슬픔(Sadness), 화남(Anger)의 감정 음성으로 구성하였고, 각 감정은 High/Low의 2가지 레벨로 구별하여 녹음하였다. 기본음성과 감정 음성의 음색 유사도 측정을 위해 대표 모음들의 각각의 스펙트럼을 누적하여 평균 스펙트럼을 구하고, 평균 스펙트럼에서 F1(제 1포만트)을 측정하였다. 감정 음성과 일반 음성의 음색 유사도는 Low-level의 감정 데이터가 High-level의 데이터 보다 우수하였고, 제안한 방법이 이러한 감정 음성의 음색 변화를 모니터링 할 수 있는 방법이 될 수 있음을 확인할 수 있었다.
https://doi.org/10.5762/KAIS.2014.15.9.5763 인용 PDF KSCI

NGN에서의 품질보장형 음성서비스 제공을 위한 대역 설계 방법 (Dimensioning Next Generation Networks for QoS Guaranteed Voice Services)

Kim, Yoon-Kee;Lee, Hoon;Lee, Kwang-Hui
- 대한전자공학회논문지TC
- /
- 제40권12호
- /
- pp.9-17
- /
- 2003
본고는 차세대 IP망(NGN)에서의 대역 설계 방법에 관한 것이다. 특히, VoIP 뿐만 아니라 데이터 서비스를 수용하는 에지 라우터에서의 호레벨 및 패킷 레벨 음성 트래픽 대역 설계 방법을 제시하였다. 호레벨 모델은 실제 연결되는 호의 수를 통계적으로 계산하기 위해 평균, 분산과 같은 통계적 기법을 사용하고, 패킷레벨 모델은 M/G/1 큐잉 모델을 활용하여 음성 및 데이터 트래픽의 부하를 나타내었다. 제시된 트래픽 모델을 통해서 계산된, 음성과 데이터 연결을 위한 대역폭을 기반으로 최대 트래픽 부하를 예측할 수 있고, 또한 수치 시험을 통한 이의 결과를 제시하였다.
PDF KSCI

상태레벨 공유를 이용한 HM-Net 적응화 시스템의 성능평가에 관한 연구 (A Study on Performance Evaluation of HM-Net Adaptation System Using the State Level Sharing)

오세진;김광동;노덕규;황철준;김범국;김광수;성우창;정현열
- 대한전자공학회:학술대회논문집
- /
- 대한전자공학회 2003년도 신호처리소사이어티 추계학술대회 논문집
- /
- pp.397-400
- /
- 2003
본 연구에서는 KM-Net(Hidden Markov Network)을 다양한 태스크에의 적용과 화자의 특성을 효과적으로 나타내기 위해 HM-Net 음성인식 시스템에 MLLR(Maximum Likelihood Linear Regression) 적응방법을 도입하였으며, HM-Net 학습 알고리즘을 개량하여 회귀클래스 생성방법을 제안한다. 제안방법은 PDT-SSS(Phonetic Decision Tree-based Successive State Splitting) 알고리즘의 문맥방향 상태분할에 의한 상태레벨 공유를 이용한 방법으로 새로운 화자로부터 문맥정보와 적응화 데이터의 발성 양에 의존하여 결정된 많은 적응 파라미터들을(평균, 분산) 자유롭게 제어할 수 있게 된다. 제안방법의 유효성을 확인하기 위해 국어공학센터(KLE) 452 음성 데이터와 항공편 예약관련 연속음성을 대상으로 인식실험을 수행한 결과, 전체적으로 음소인식의 경우 평균 34-37％, 단어인식의 경우 평균 9％, 연속음성인식의 경우 평균 7-8％의 인식성능 향상을 각각 보였다. 또한 적응화 데이터의 양에 따른 인식성능 비교에서, 제안방법을 적용한 인식 시스템이 적응 데이터의 양이 적은 경우에도 향상된 인식률을 보였으며. 잡음을 부가한 음성에 대한 적응화 실험에서도 향상된 인식성능을 보여 MLLR 적응방법의 특성을 만족하였다. 따라서 MLLR 적응방법을 도입한 HM-Net 음성인식 시스템에 제안한 회귀클래스 생성방법이 유효함을 확인한 수 있었다.
PDF

주거 공간에서 고령자 청력손실을 고려한 소음 및 잔향에 따른 음성 전송 성능의 주관적 평가 (Effect of noise and reverberation on subjective measure of speech transmission performance for elderly person with hearing loss in residential space)

오양기;류종관;송한솔
- 한국음향학회지
- /
- 제37권5호
- /
- pp.369-377
- /
- 2018
본 논문은 주거공간에서 고령자 청력손실을 고려한 소음 및 잔향에 따른 음성 전송 성능을 청취실험을 통해 평가하였다. 주거환경 소음으로 바닥충격음, 교통소음, 공기전달음과 배수소음을 대상으로 하였으며, 공동주택의 잔향환경을 모사하기 위해 실내음향 컴퓨터시뮬레이션을 실시하여 충격응답를 추출하였다. 청취실험 음원은 고령자 청력손실(65세 남성)을 반영하기 위해 소음 및 단어 음원의 고주파대역의 음압레벨을 저감시킨 음원(고령자 음원)과 정상청력을 반영한 원음(청년 음원)을 대상으로 하였다. 청취실험은 각각 3개의 소음레벨($L_{Aeq}$ 30, 40, 50 dB)과 잔향시간(0.5, 1.0, 1.5 s)을 갖는 음환경 조건에서 제시된 단어($L_{Aeq}$ 55 dB)의 음성요해도(speech intelligibility)와 듣기 어려운 정도(listening difficulty)를 평가하는 것으로 하였다. 청취실험 결과, 음성레벨이 55 dB($L_{Aeq}$)일 때 잔향시간 1.0 s 이하 조건에서 충격소음(점핑음) 50 dB($L_{i,Fmax,AW}$)와 정상소음(도로, 음악, 배수 소음) 40 dB($L_{Aeq}$) 이하의 소음레벨에서는 고령자 및 청년 음원 모두 90 % 이상의 음성요해도와 30 % 이하의 듣기 어려운 정도를 확보할 수 있을 것으로 판단된다. 고령자 청력손실을 반영한 고령자 음원의 경우 청년 음원 보다 음성요해도는 0 % ~ 5 % 낮았고 듣기 어려운 정도는 2 % ~ 10 % 높은 것으로 나타났다.
https://doi.org/10.7776/ASK.2018.37.5.369 인용 PDF KSCI

자동차 ECU제어를 위한 음성인식 패턴매칭레벨에 관한 연구 (A Study on Voice Recognition Pattern matching level for Vehicle ECU control)

안종영;김영섭;김수훈;허강인
- 한국인터넷방송통신학회논문지
- /
- 제10권1호
- /
- pp.75-80
- /
- 2010
자동차 환경에서의 음성인식은 잡음처리가 매우 중요한 요소이다. 하드웨어 및 소프트웨어로 적인 접근방법으로 많은 연구가 되어 지고 있다. 하드웨어적인 방법으로는 Low-pass filter를 기본으로한 잡음처리 필터가 많이 연구되어 가시적인 성과를 보이고 있고, 소프트웨어적으로는 Noise canceler, 신경망 등 패턴인식 알고리듬의 연구가 이루어지고 있다. 본 논문에서는 시계열 패턴인식에 적용 가능한 알고리듬인 DTW(Dynamic Time Warping)를 자동차 잡음환경에 적용하여 그 음성인식을 위한 파라미터 패턴에 대한 매칭 레벨을 분류하여 잡음환경 적합한 패턴 매칭 레벨을 분석 하였다.
PDF KSCI

자연발화상에 나타난 단음절 단일간투사의 길이특성 분석 (Analysis of the durational characteristics of monosyllabic interjections in Natural spoken language)

김기호
- 한국음향학회:학술대회논문집
- /
- 한국음향학회 1994년도 제11회 음성통신 및 신호처리 워크샵 논문집 (SCAS 11권 1호)
- /
- pp.95-98
- /
- 1994
자연발화상에 포함되어, 음성언어 인식에 장애를 초래하는 간투사의 음성적 특성 중 가장 뚜렷이 구별되는 길이특성얼 분석하여 음성언어 인식에 도움을 주는 것을 목적으로 한다. 이 연구에서는 간투사의 대부분을 차지하는 단음절 단일 간투사에 한정하여, 실제 대화의 녹음자료에서 나타나는 간투사의 빈도수와, 그 길이특성을 신분별, 성별, 간투사 유형별로 분석하였다. 또 간투사를 위치에 따라, 음운구초 간투사, 음운구말 간투사로 나누고, 그 길이를 음절 평균, 음운 구초 음절이나 음운구말 음절의 길이와 비교하여 간투사의 증가율을 측정하였다. 분석결과 가장 높은 빈도수를 보이는 단음절 단일 간투사는 어 이며, 간투사 길이 증가율은, 음절평균에 대해서는 그가, 음운구초 평균에 대해서는 응이 가장 큰 증가율을 나타낸다. 전체적을 음운구초 음절길이에 대한 간투사 길이 증가율이 음절평균 길이에 대한 간투사 길이 증가율보다 더 크게 나타났다. 이러한 분석결과를 통해 하위레벨에서 제거할 수 있는 간투사와, 통사적 또는 의미론적 분석이 필요한 상위레벨에서 처리해야할 간투사를 구별할 수 있다. 이와 같은 길이 특성외에 간투사에 대한 다양한 음성적 특성과, 다음절 단일 간투사와, 이중 간투사에 대한 연구가 진척된다면 음성언어 인식에 장애가 되는 간투사의 효과적 배제가 가능할 것으로 보인다.
PDF

양자화 왜곡에 대한 음성품질 평가 (Assessment on the Speech Quality for Quantization Distortion)

김정환
- 전자통신동향분석
- /
- 제10권4호통권38호
- /
- pp.129-142
- /
- 1995
본 고에서는, 음성을 디지털로 부호화하여 전송함으로써 발생되는 신호 대 양자화왜곡 비(Q)의 개념 및 CODEC과의 관계를 분석하고, MNRU를 디지털 회로로 구현하는데 필요한 입력음성 신호레벨, 잡음의 통계적 성질 및 진폭제한이 음성품질에 미치는 영향을 살펴보았다. 또한, 본 연구에서 구현한 MNRU의 성능에 대해 주관평가 실험을 실시하여, 다른 나라의 주관평가 결과와 비교/분석하였다.
https://doi.org/10.22648/ETRI.1995.J.100410 인용 PDF

검색결과 138건 처리시간 0.025초

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

자세히 찾기

이미지 검색 (β)