• 제목/요약/키워드: 음성검출기

검색결과 137건 처리시간 0.022초

Microphone 거리에 따른 Glottal Spectrum 성분 분석에 관한 연구 (A Study on Glottal Spectrum Analysis According to the Distance between the Microphone and the lips)

  • 박현영;장경아;배명진
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 2002년도 하계학술발표대회 논문집 제21권 1호
    • /
    • pp.65-68
    • /
    • 2002
  • 현재 음성인식기는 다 채널의 음성입력방식을 사용하고 있는 추세이다. 이런 방법으로 음성인식기를 사용할 때에 자동적으로 음성을 검출하는 음성입력 방식은 발성자와 마이크간의 거리에 따라 Glottal Spectrum 성분이 변하는 특성을 가지고 있다. 이러한 Glottal Spectrum 성분은 a=R1/R0 (LPC 포락선의 기울기) 로 나타낼 수 있다. 본 논문에서는 발성자와 마이크 거리에 따른 Glottal Spectrum 성분을 비교 분석 하고자 한다.

  • PDF

주파수 영역에서의 Gaussian Mixture Model 기반의 동시통화 검출 연구 (Frequency Domain Double-Talk Detector Based on Gaussian Mixture Model)

  • 이규호;장준혁
    • 한국음향학회지
    • /
    • 제28권4호
    • /
    • pp.401-407
    • /
    • 2009
  • 본 논문에서는 주파수 영역에서의 가우시안 혼합 모델 (Gaussian Mixture Model, GMM) 기반의 새로운 동시통화 검출 (Double-talk Detection, DTD) 알고리즘을 제안한다. 구체적으로 주파수 영역에서의 음향학적 반향억제 (Acoustic Echo Suppression, AES)를 위한 동시 통화 검출 알고리즘을 구성하기 위해 기존의 시간 영역에서의 동시통화 검출에 사용되는 상호 상관계수를 이산 푸리에 변환을 통해 16개 채널의 주파수 영역으로 변환하였다. 이러한 주파수 영역에서의 상호 상관계수를 GMM의 보다 효과적인 구성을 위해 통계적 분류 특성에 근거하여 우수한 7개를 선별하였다. 본 논문은 이러한 특징 벡터로 패턴인식에서 우수한 성능을 보이는 GMM을 구성하였으며 원단화자만 있는 구간, 동시통화 구간, 근단 화자만 있는 구간을 우도 (Likelihood) 비교에 따라 분류함으로써 별도의 원단 화자 신호에 대한 음성 검출기 (Voice Activity Detector, VAD)의 사용 없이 잡음환경과 반향 경로 변화에서 강인한 동시통화 검출 알고리즘을 제안한다. 다양한 실험 결과 제안된 방법은 기존의 상호 상관계수를 고정된 문턱 값과 가부 비교하여 동시 통화 구간을 검출하는 hard decision 방법에 비해 검출 오류 확률 (Detection Error Probability)을 비교한 결과 우수한 성능을 보였다.

음성강화를 위한 이동 평균 예측량 기반의 검출방법 최적화 (Optimization of Detection Method Using a Moving Average Estimator for Speech Enhancement)

  • 이수정;신계현;김순협
    • 대한전자공학회논문지SP
    • /
    • 제44권3호
    • /
    • pp.97-104
    • /
    • 2007
  • 적응 반향제거기는 휴대전화나 음성 인식 시스템과 같은 음성 통신 시스템에서 중요한 부분의 하나로 자리잡았다. 이러한 응용에서 반향경로는 긴 임펄스 응답을 가지게 된다. 본 논문에서는 음향반향제거를 위해 Moving-Average Least Mean Square(MVLMS) 알고리즘을 제안하였다. 유색 입력 모델을 이용한 실험 결과는 MVLMS 검출 알고리즘이 Least Mean Square 검출 알고리즘에 비해 수렴 성능이 우위에 있음을 입증하였다. MVLMS 알고리즘은 약간의 계산 복잡도 향상이 있지만, 표준 LMS 검출 알고리즘에 비해 월등한 안정성 향상을 가져온다.

외국어 발화오류 검출 음성인식기의 성능 개선을 위한 스코어링 기법 (Scoring Methods for Improvement of Speech Recognizer Detecting Mispronunciation of Foreign Language)

  • 강효원;권철홍
    • 대한음성학회지:말소리
    • /
    • 제49호
    • /
    • pp.95-105
    • /
    • 2004
  • An automatic pronunciation correction system provides learners with correction guidelines for each mispronunciation. For this purpose we develope a speech recognizer which automatically classifies pronunciation errors when Koreans speak a foreign language. In order to develope the methods for automatic assessment of pronunciation quality, we propose a language model based score as a machine score in the speech recognizer. Experimental results show that the language model based score had higher correlation with human scores than that obtained using the conventional log-likelihood based score.

  • PDF

한국인의 외국어 발화오류 검출을 위한 음성인식기의 발음 네트워크 구성 (Pronunciation Network Construction of Speech Recognizer for Mispronunciation Detection of Foreign Language)

  • 이상필;권철홍
    • 대한음성학회지:말소리
    • /
    • 제49호
    • /
    • pp.123-134
    • /
    • 2004
  • An automatic pronunciation correction system provides learners with correction guidelines for each mispronunciation. In this paper we propose an HMM based speech recognizer which automatically classifies pronunciation errors when Koreans speak Japanese. We also propose two pronunciation networks for automatic detection of mispronunciation. In this paper, we evaluated performances of the networks by computing the correlation between the human ratings and the machine scores obtained from the speech recognizer.

  • PDF

음성인식기를 이용한 한국인의 외국어 발화오류 자동 검출 (Automatic Detection of Mispronunciation Using Phoneme Recognition For Foreign Language Instruction)

  • 권철홍;강효원;이상필
    • 대한음성학회지:말소리
    • /
    • 제48호
    • /
    • pp.127-139
    • /
    • 2003
  • An automatic pronunciation correction system provides learners with correction guidelines for each mispronunciation. In this paper we propose an HMM based speech recognizer which automatically classifies pronunciation errors when Korean speak Japanese. For this purpose we also develop phoneme recognizers for Korean and Japanese. Experimental results show that the machine scores of the proposed recognizer correlate with expert ratings well.

  • PDF

입술움직임 영상신호를 고려한 음성존재 검출 (Speech Activity Decision with Lip Movement Image Signals)

  • 박준;이영직;김응규;이수종
    • 한국음향학회지
    • /
    • 제26권1호
    • /
    • pp.25-31
    • /
    • 2007
  • 본 논문은 음성인식을 위한 음성구간 검출과정에서, 음향에너지 이외에도 화자의 입술움직임 영상신호까지 확인하도록 함으로써, 외부의 음향잡음이 음성인식 대상으로 오인식되는 것을 방지하기 위하여 시도한 것이다. 먼저, PC용 화상카메라를 통하여 영상을 획득하고, 입술움직임 여부가 식별된다. 그리고 입술움직임 영상신호 데이터는 공유메모리에 저장되어 음성인식 프로세스와 공유한다. 한편, 음성인식의 전처리 단계인 음성구간 검출과정에서는 공유메모리에 저장되어 있는 데이터를 확인함으로써 사람의 발성에 의한 음향에너지인지의 여부를 확인하게 된다. 음성인식기와 영상처리기를 연동시켜 실험한 결과, 화상카메라에 대면해서 발성하면 음성인식 결과의 출력까지 정상적으로 진행됨을 확인하였고, 화상카메라에 대면하지 않고 발성하면 음성인식 결과를 출력하지 않는 것을 확인하였다. 이는 음향에너지가 입력되더라도 입술움직임 영상이 확인되지 않으면 음향잡음으로 간주하도록 한 것에 따른 것이다.

dSPACE 보드를 이용한 음성인식 명령처리시스템 실시간 구현에 관한 연구 (A study on real-time implementation of speech recognition and speech control system using dSPACE board)

  • 김재웅;정원용
    • 융합신호처리학회 학술대회논문집
    • /
    • 한국신호처리시스템학회 2000년도 추계종합학술대회논문집
    • /
    • pp.173-176
    • /
    • 2000
  • 음성은 인간이 가진 가장 편리한 제어전송수단으로 이를 통한 제어는 인간에게 많은 편리함을 제공할 것이다. 본 논문에서는 다층구조 신경망(Multi-Layer Perceptron)을 이용하여 간단한 음성인식 명령처리시스템을 Matlab 상에서 구성해 보았다. 음성인식을 통한 제어의 목적을 위해 화자종속, 고립단어인식기를 목표로 설정하여 연구를 수행하였다. 음성의 시작점과 끝점을 검출하기 위해 단구간 에너지와 영교차율(ZCR)을 이용하였고 인식기의 특징파라미터로는 12차 LPC켑스트럼 계수를 사용하였다. 그리고 신경망의 출력값을 기동, 정지시에 활성화되도록 3개의 계층으로 하였고, 신경망의 뉴런의 개수를 각각 12, 12, 2으로 설정하였다. 먼저 기준음성패턴으로 학습시킨 후에 Matlab 환경하에 동작하는 dSPACE 실시간처리보드에 변환된 C프로그램을 다운로드하고, 음성을 입력하여 인식 후 dSPACE보드의 D/A컨버터의 출력단에 연결된 DC모터를 기동, 정지제어를 수행하였다. 실시간 음성인식 명령처리 시스템 구현을 통하여 원격제어와 같은 음성명령을 통한 제어가 가능함을 확인할 수 있었다.

  • PDF

500단어급 핵심어 검출기에서 화자적응 성능 평가 (Speaker Adaptation Performance Evaluation in Keyword Spotting System)

  • 서현철;이경록;김진영;최승호
    • 대한음성학회지:말소리
    • /
    • 제43호
    • /
    • pp.151-161
    • /
    • 2002
  • This study presents performance analysis results of speaker adaptation for keyword spotting system. In this paper, we implemented MLLR (Maximum Likelihood Linear Regression) method on our middle size vocabulary keyword spotting system. This system was developed for directory services of universities and colleges. The experimental results show that speaker adaptation reduces the false alarm rate to 1/3 with the preservation of the mis-detection ratio. This improvement is achieved when speaker adaptation is applied to not only keyword models but also non-keyword models.

  • PDF

기능적 자기공명영상 및 확산텐서영상을 이용한 전음성 난청과 감각신경성 난청군의 비교 연구: 예비 결과

  • 이재준;황문정;이영주;김인성;배성진;장용민;이상흔;우성구;강덕식
    • 대한자기공명의과학회:학술대회논문집
    • /
    • 대한자기공명의과학회 2003년도 제8차 학술대회 초록집
    • /
    • pp.94-94
    • /
    • 2003
  • 목적: 기능적 자기공명영상과 확산텐서영상기법을 이용하여 전음성 난청과 감각신경성 난청에서의 뇌활성화 양상 그리고 청신경경로상의 차이점을 비교 연구하고자 하였다. 대상 및 방법: 전음성 난청군 (n=4)과 감각신경성 난청군(n=5) 그리고 정상군(n=5)에서의 기능적 자기 공명영상과 확산텐서영상을 획득하였다. 기능적 자기공명영상의 경우 1.5T Siemens MR scanner에서 BOLD 기법을 이용하여 500 Hz 순음 청각자극에 대한 뇌활성화 영역을 검출하였고 영상촬영시 발생하는 기계적 소음을 차폐하기 위한 청각자극기를 특별히 제작하여 사용하였다. 뇌백질신경로를 영상화하는 확산텐서영상은 3.0T GE whole body MR scanner를 사용하였으며 미세한 확산운동을 검출하기 위해 초고속 영상기법인 EPI 기법을 사용하였다. 영상의 화질을 높이기 위해 공간적으로 25개의 다른 방향으로 확산경사자장을 가하였다. 청신경로의 비등방성 영상, 신경로 방향 영상등을 구현하기 위해 획득한 확산영상들에 대한 영상 후처리과정을 시행하였다.

  • PDF