• Title/Summary/Keyword: 화자 구분

Search Result 69, Processing Time 0.02 seconds

ETRI신기술-화자검증기술

  • Electronics and Telecommunications Research Institute
    • Electronics and Telecommunications Trends
    • /
    • v.14 no.5 s.59
    • /
    • pp.151-152
    • /
    • 1999
  • 화자검증기술은 화자의 입력음성으로부터 화자의 특성을 계산하고 해당 화자를 유일하게 구분할 수 있는 통계적 모수를 추출하여 이를 화자의 개인 데이터베이스로 구축하며, 검증시에는 개인데이터베이스와 입력되는 미지 화자의 특성에 대한 유사도를 비교.검증하는 것이다. 또한 이때 주어진 임계치(Threshold)의 만족 정도에 따라 동일 화자여부를 결정하는 결정논리(decision logic)로 검증엔진을 구성하는 기술이며, 응용영역에 따라 환경잡음, 채널잡음 등 사용환경과 전체시스템과의 적절한 시나리오 구성 등이 실용화를 위한 중요한 척도가 된다.

  • PDF

I-vector similarity based speech segmentation for interested speaker to speaker diarization system (화자 구분 시스템의 관심 화자 추출을 위한 i-vector 유사도 기반의 음성 분할 기법)

  • Bae, Ara;Yoon, Ki-mu;Jung, Jaehee;Chung, Bokyung;Kim, Wooil
    • The Journal of the Acoustical Society of Korea
    • /
    • v.39 no.5
    • /
    • pp.461-467
    • /
    • 2020
  • In noisy and multi-speaker environments, the performance of speech recognition is unavoidably lower than in a clean environment. To improve speech recognition, in this paper, the signal of the speaker of interest is extracted from the mixed speech signals with multiple speakers. The VoiceFilter model is used to effectively separate overlapped speech signals. In this work, clustering by Probabilistic Linear Discriminant Analysis (PLDA) similarity score was employed to detect the speech signal of the interested speaker, which is used as the reference speaker to VoiceFilter-based separation. Therefore, by utilizing the speaker feature extracted from the detected speech by the proposed clustering method, this paper propose a speaker diarization system using only the mixed speech without an explicit reference speaker signal. We use phone-dataset consisting of two speakers to evaluate the performance of the speaker diarization system. Source to Distortion Ratio (SDR) of the operator (Rx) speech and customer speech (Tx) are 5.22 dB and -5.22 dB respectively before separation, and the results of the proposed separation system show 11.26 dB and 8.53 dB respectively.

LPC 켑스트럼 및 FFT 스펙트럼에 의한 성별 인식 알고리즘

  • Choe, Jae-Seung;Jeong, Byeong-Gu
    • Proceedings of the Korean Institute of Information and Commucation Sciences Conference
    • /
    • 2012.10a
    • /
    • pp.63-65
    • /
    • 2012
  • 본 논문에서는 입력된 음성이 남성화자인지 여성화자인지를 구분하는 FFT 스펙트럼 및 LPC 켑스트럼 입력에 의한 성별인식 알고리즘을 제안한다. 본 논문에서는 특히 남성화자와 여성화자의 특징벡터를 비교 분석하여, 이러한 남녀의 음향학적인 특징벡터의 차이점을 이용하여 신경회로망에 의한 성별 인식에 대한 실험을 수행한다. 특히 12차의 LPC 켑스트럼 및 8차의 저역 FFT 스펙트럼의 특징벡터를 사용한 경우에, 남성화자 및 여성화자에 대해서 양호한 남녀 성별인식률이 구해졌다.

  • PDF

Text-dependent Speaker Verification System in SVAPI 1.0 Environment (SVAPI 1.0 환경에서의 어구 종속 화자 확인 시스템)

  • 김유진
    • Proceedings of the Acoustical Society of Korea Conference
    • /
    • 1998.08a
    • /
    • pp.401-405
    • /
    • 1998
  • SVAPI 1.0 환경에서의 어구 종속 화자 확인 시스템에 대해 기술한다. 구현된 시스템은 궁극적으로 공중 전화망 응용이 가능한 실용 시스템을 목표로 개발되었으며 이를 위해 SVAPI 위원회에 의해 제안된 SVAPI 1.0을 개발 환경으로 사용하였다. SVAPI는 객체 지향 구조, 클라이언트-서버 및 telephony 환경의 지원등이 특징이며 어플리케이션과 엔진을 독립적으로 개발할 수 있는 이점을 제공한다. 구현된 데모 시스템은 펜티엄 프로세서와 Windows95/NT 4.0 운영체제 그리고 Win16/Win32 API를 통해 제어 가능하며 음성 입력이 가능한 디바이스를 장착한 IBM 호환 PC이다. 화자의 성문 등록은 화자가 동일한 어구를 3회 발성하여 이뤄지며 등록과 확인의 응답속도는 모두 1초 이내이다. 소프트웨어의 구성은 크게 어플리케이션과 어구 종속 화자 확인 엔진으로 구분할 수 있으며 엔진은 끝점 검출 알고리즘, 음성 특징 추출 알고리즘 그리고 연속 HMM 기반의 화자 성문 모델 등록 및 유사도 계산 등을 포함한 확인 알고리즘으로 구성되어 있다. 화자의 성문은이름과 같은 약 3음절 이상의 단어로 등록되고 테스트되었다. 엔진의 객관적인 평가를 위해 전화선을 통해 남자 6명, 여자 3명의 화자로부터 자신의 이름을 각각 40회 발성하여 구축된 음성 데이터 베이스를 사용하였으며 실험 결과 남자는 2.85%, 여자는 2.44%의 EER을 각각 얻었다.

  • PDF

Speaker recognition technique for offline conference recording system (오프라인 회의 기록 지원시스템을 위한 화자 인식 기법)

  • Park, Han-Mu;Son, Yun-Sik;Jeong, Jin-U
    • Proceedings of the Korean Institute of Intelligent Systems Conference
    • /
    • 2007.11a
    • /
    • pp.29-32
    • /
    • 2007
  • 최근 영상 처리 기술이 발달함에 따라 다양한 응용시스템에 영상 처리 기술을 접목하려는 시도가 나타나고 있다. 특히 영상 내의 얼굴을 객체로 다루는 인식 기술의 발전으로 얼굴 정보를 이용한 기술의 응용 분야는 게임 및 카메라 둥 다양한 분야에서 사용되고 있다. 본 논문에서는 오프라인 회의 보조 시스템에서 화자를 구분하기 위한 기법을 제시한다. 제안된 기법은 얼굴 객체 정보에서 화자 구별을 위한 특징 값을 제시하고, 이를 이용하여 얻어진 입 주변 엣지(Edge)를 이루는 픽셀들의 분산 값으로 화자 여부를 판단한다.

  • PDF

Pattern Recognition by Section Detection Using Speech Word (음성 단어를 이용한 구간검출에 의한 패턴인식)

  • Choi, Jae-Seung
    • Proceedings of the Korean Institute of Information and Commucation Sciences Conference
    • /
    • 2016.05a
    • /
    • pp.681-682
    • /
    • 2016
  • 본 논문에서는 화자 식별에서 음성신호의 애매한 점을 보완할 수 있는 신경회로망의 오차역전파학습 알고리즘과 모음구간 검출에 기초하여 입력되는 음성의 화자 패턴을 구분하는 일본어 단어 패턴인식 알고리즘을 제안한다. 제안하는 알고리즘에서는 일본어 데이터베이스로부터의 단어를 사용하여 음성의 특징벡터를 추출하여 분석하고 이러한 음성의 특징벡터의 차이를 이용하여 일본어 화자에 대한 패턴인식 실험을 수행하였다.

  • PDF

The Attitudinal Force of Psuedo-Quotation Sentences in Korean (유사인용문의 화법 구조)

  • 김종현
    • Proceedings of the Korean Society for Cognitive Science Conference
    • /
    • 2000.05a
    • /
    • pp.178-185
    • /
    • 2000
  • 청자를 직접 대면한 상황에서 1인칭 화자는 {X, Y, 말했다}의 인용구조를 갖추지 않은'[...]고'의 '유사인용문'을 사용하여 주관적 관점을 표현한다. '-다고'로 종결되는 유사인용문 형식이 인용문의 화법과 유사한 기저구조를 지니는 것으로 보고, 화법구조상에서 관점문과 보고문의 의미적 속성을 밝혀나가는 과정에서 유상인용문의 발화 효과와 화자의 발언의도를 설명한다. 화자가 취하는 관점의 선택에 따라 1인칭 화자인 [나] 이외에 다른 제 3 의 주체, 사회적 구속력 등이 화자의 배경지식에 자리잡는 것을 가능세계의 논리적 분할의 측면에서 구분하고 이것이 유사인용문 화자의 발언 동기에 반영되는 정도의 차이에 따라서 화자의 단언적 태도와 완곡의 태도가 각각 실현되는 것임을 보인다.

  • PDF

Effects of Korean syllable structure on English pronunciation (한국어 화자의 영어발음에 모국에의 음절구조가 미치는 영향)

  • Lee Mi-Hyun;Ryu Hee-Kwan
    • Proceedings of the Acoustical Society of Korea Conference
    • /
    • spring
    • /
    • pp.309-312
    • /
    • 2000
  • 이 논문은 한국어 화자들이 영어를 발음할 때 나타나는 한국어 음절구조의 영향을 살펴보는 것을 목적으로 한다. 본 연구에서는 특히, 자음연쇄에 나타나는 한국어 음절구조의 영향을 살펴봄으로써, 음운론적으로는 이미 많이 논의가 되어 온 것을 실험음성학적인 시각에서 살펴본다는 데 의의가 있다. 본 연구에서는 위치에 따른 차이 즉, coda보다는 onset에서 자음이 더 길어지는 것으로 보였다. 또, 한국어 화자의 경우, 영어권 나라에서 2년 이상 체류한 경험이 있는 그룹을 구분하여 비교해 보았으나, 그 차이는 그리 유의하지 않은 것으로 보인다.

  • PDF

Two Languages in One Brain Shown by fMRI: Orthography Specific Effects in L2 (fMRI에 나타난 모국어와 외국어로서의 한국문자와 중국문자의 차이)

  • 이동훈;이홍재;문찬홍;유재욱;남기춘
    • Proceedings of the Korean Society for Cognitive Science Conference
    • /
    • 2002.05a
    • /
    • pp.216-221
    • /
    • 2002
  • 본 연구는 문자 규칙 심층성이 다른 문자체계인 한국어와 중국어의 차이가 이중언어화자의 모국어 처리와 외국어 처리에서 각각 어떤 대뇌 활성화의 차이를 가져오는지 fMRI (functional Magnetic Resonance Imaging)를 이용하여 살펴보았다. 중국어 (Ll)-한국어(L2) 이중언어화자 및 한국어(Ll)-중국어(L2) 이중언어화자를 제 2언어 습득시기에 따라 초기 및 후기 이중언어화자로 구분하여 모국어 차이와 습득시기에 따른 영향을 알아보았다. 실험 1에서는 어휘 판단 과제(lexical decision task)를 실시하였고, 실험 2에서는 의미 판단 과제(semantic decision task)를 각각 실시하였다. 어휘판단과제를 사용한 실험 1의 결과는 음운처리와 관련된 좌반구 SMG(supramarginal gyrus), 하두정소엽(inferior parietal lobule, BA 39, 40)에서 중국어-한국어 초기 및 후기이중언어화자의 경우, 한국어 조건에서 보다 많은 활성화를 보였으나, 한국어-중국어 화자의 경우 활성화가 나타나지 않았다. 철자처리에 관련된 방추상회(fusiform gyrus, BA 37, 19) 영역에서는 중국어-한국어 화자뿐만 아니라, 한국어-중국어 인중언어화자의 경우도 중국어 조건에서 보다 많은 활성화를 보였다. 실험 2에서 사용한 의미판단과제의 경우, 중국어-한국어 이중언어화자의 경우 어휘판단과제를 사용한 실험 1의 결과에서 보고된 한국어 특정적인 반응, 즉 SMG영역에서의 활성화의 증가가 실험 2에서는 나타나지 않았다. 그러나 한국어-중국어 이중언어화자의 경우, 실험 1에서 나타난 것과 같이 철자처리 혹은 의미처리와도 관련된다고 보고되는 방추상회(fusiform gyrus)등의 영역 유의미한 차이를 나타났다. 이는 어휘 판단과제와 의미판단과제가 유도하는 뇌 활성화 양상이 다름을 시사한다. 종합해 볼 때, 이중언어화자의 뇌 영상 연구에서 어휘수준에서는 거의 공통적인 활성화를 보인다는 개략적 수준의 연구 결과를 넘어, 음운처리 및 철자처리와 같은 어휘접근 수준에서는 이중언어화자들의 뇌 활성화가 다르게 일어남을 보여주고 있다. 따라서 이중언어 화자의 뇌 기전을 밝히기 위해서도 보다 개략적 수준을 넘어 언어처리의 세부적인 수준에 따른 접근이 필요함을 시사한다.

  • PDF

Speaker Recognition Performance Improvement by Voiced/Unvoiced Classification and Heterogeneous Feature Combination (유/무성음 구분 및 이종적 특징 파라미터 결합을 이용한 화자인식 성능 개선)

  • Kang, Jihoon;Jeong, Sangbae
    • Journal of the Korea Institute of Information and Communication Engineering
    • /
    • v.18 no.6
    • /
    • pp.1294-1301
    • /
    • 2014
  • In this paper, separate probabilistic distribution models for voiced and unvoiced speech are estimated and utilized to improve speaker recognition performance. Also, in addition to the conventional mel-frequency cepstral coefficient, skewness, kurtosis, and harmonic-to-noise ratio are extracted and used for voiced speech intervals. Two kinds of scores for voiced and unvoiced speech are linearly fused with the optimal weight found by exhaustive search. The performance of the proposed speaker recognizer is compared with that of the conventional recognizer which uses mel-frequency cepstral coefficient and a unified probabilistic distribution function based on the Gassian mixture model. Experimental results show that the lower the number of Gaussian mixture, the greater the performance improvement by the proposed algorithm.