• 제목/요약/키워드: 화자 구분

검색결과 69건 처리시간 0.031초

ETRI신기술-화자검증기술

  • 한국전자통신연구원
    • 전자통신동향분석
    • /
    • 제14권5호통권59호
    • /
    • pp.151-152
    • /
    • 1999
  • 화자검증기술은 화자의 입력음성으로부터 화자의 특성을 계산하고 해당 화자를 유일하게 구분할 수 있는 통계적 모수를 추출하여 이를 화자의 개인 데이터베이스로 구축하며, 검증시에는 개인데이터베이스와 입력되는 미지 화자의 특성에 대한 유사도를 비교.검증하는 것이다. 또한 이때 주어진 임계치(Threshold)의 만족 정도에 따라 동일 화자여부를 결정하는 결정논리(decision logic)로 검증엔진을 구성하는 기술이며, 응용영역에 따라 환경잡음, 채널잡음 등 사용환경과 전체시스템과의 적절한 시나리오 구성 등이 실용화를 위한 중요한 척도가 된다.

  • PDF

화자 구분 시스템의 관심 화자 추출을 위한 i-vector 유사도 기반의 음성 분할 기법 (I-vector similarity based speech segmentation for interested speaker to speaker diarization system)

  • 배아라;윤기무;정재희;정보경;김우일
    • 한국음향학회지
    • /
    • 제39권5호
    • /
    • pp.461-467
    • /
    • 2020
  • 잡음이 많고 여러 사람이 있는 공간에서 음성인식의 성능은 깨끗한 환경보다 저하될 수밖에 없다. 이러한 문제점을 해결하기 위해 본 논문에서는 여러 신호가 섞인 혼합 음성에서 관심 있는 화자의 음성만 추출한다. 중첩된 구간에서도 효과적으로 분리해내기 위해 VoiceFilter 모델을 사용하였으며, VoiceFilter 모델은 여러 화자의 발화로 이루어진 음성과 관심 있는 화자의 발화로만 이루어진 참조 음성이 입력으로 필요하다. 따라서 본 논문에서는 Probabilistic Linear Discriminant Analysis(PLDA) 유사도 점수로 군집화하여 혼합 음성만으로도 참조 음성을 대체해 사용하였다. 군집화로 생성한 음성에서 추출한 화자 특징과 혼합 음성을 VoiceFilter 모델에 넣어 관심 있는 화자의 음성만 분리함으로써 혼합 음성만으로 화자 구분 시스템을 구축하였다. 2명의 화자로 이루어진 전화 상담 데이터로 화자 구분 시스템의 성능을 평가하였으며, 분리 전 상담사(Rx)와 고객(Tx)의 음성 Source to Distortion Ratio(SDR)은 각각 5.22 dB와 -5.22 dB에서 분리 후 각각 11.26 dB와 8.53 dB로 향상된 성능을 보였다.

LPC 켑스트럼 및 FFT 스펙트럼에 의한 성별 인식 알고리즘

  • 최재승;정병구
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2012년도 추계학술대회
    • /
    • pp.63-65
    • /
    • 2012
  • 본 논문에서는 입력된 음성이 남성화자인지 여성화자인지를 구분하는 FFT 스펙트럼 및 LPC 켑스트럼 입력에 의한 성별인식 알고리즘을 제안한다. 본 논문에서는 특히 남성화자와 여성화자의 특징벡터를 비교 분석하여, 이러한 남녀의 음향학적인 특징벡터의 차이점을 이용하여 신경회로망에 의한 성별 인식에 대한 실험을 수행한다. 특히 12차의 LPC 켑스트럼 및 8차의 저역 FFT 스펙트럼의 특징벡터를 사용한 경우에, 남성화자 및 여성화자에 대해서 양호한 남녀 성별인식률이 구해졌다.

  • PDF

SVAPI 1.0 환경에서의 어구 종속 화자 확인 시스템 (Text-dependent Speaker Verification System in SVAPI 1.0 Environment)

  • 김유진
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1998년도 제15회 음성통신 및 신호처리 워크샵(KSCSP 98 15권1호)
    • /
    • pp.401-405
    • /
    • 1998
  • SVAPI 1.0 환경에서의 어구 종속 화자 확인 시스템에 대해 기술한다. 구현된 시스템은 궁극적으로 공중 전화망 응용이 가능한 실용 시스템을 목표로 개발되었으며 이를 위해 SVAPI 위원회에 의해 제안된 SVAPI 1.0을 개발 환경으로 사용하였다. SVAPI는 객체 지향 구조, 클라이언트-서버 및 telephony 환경의 지원등이 특징이며 어플리케이션과 엔진을 독립적으로 개발할 수 있는 이점을 제공한다. 구현된 데모 시스템은 펜티엄 프로세서와 Windows95/NT 4.0 운영체제 그리고 Win16/Win32 API를 통해 제어 가능하며 음성 입력이 가능한 디바이스를 장착한 IBM 호환 PC이다. 화자의 성문 등록은 화자가 동일한 어구를 3회 발성하여 이뤄지며 등록과 확인의 응답속도는 모두 1초 이내이다. 소프트웨어의 구성은 크게 어플리케이션과 어구 종속 화자 확인 엔진으로 구분할 수 있으며 엔진은 끝점 검출 알고리즘, 음성 특징 추출 알고리즘 그리고 연속 HMM 기반의 화자 성문 모델 등록 및 유사도 계산 등을 포함한 확인 알고리즘으로 구성되어 있다. 화자의 성문은이름과 같은 약 3음절 이상의 단어로 등록되고 테스트되었다. 엔진의 객관적인 평가를 위해 전화선을 통해 남자 6명, 여자 3명의 화자로부터 자신의 이름을 각각 40회 발성하여 구축된 음성 데이터 베이스를 사용하였으며 실험 결과 남자는 2.85%, 여자는 2.44%의 EER을 각각 얻었다.

  • PDF

오프라인 회의 기록 지원시스템을 위한 화자 인식 기법 (Speaker recognition technique for offline conference recording system)

  • 박한무;손윤식;정진우
    • 한국지능시스템학회:학술대회논문집
    • /
    • 한국지능시스템학회 2007년도 추계학술대회 학술발표 논문집
    • /
    • pp.29-32
    • /
    • 2007
  • 최근 영상 처리 기술이 발달함에 따라 다양한 응용시스템에 영상 처리 기술을 접목하려는 시도가 나타나고 있다. 특히 영상 내의 얼굴을 객체로 다루는 인식 기술의 발전으로 얼굴 정보를 이용한 기술의 응용 분야는 게임 및 카메라 둥 다양한 분야에서 사용되고 있다. 본 논문에서는 오프라인 회의 보조 시스템에서 화자를 구분하기 위한 기법을 제시한다. 제안된 기법은 얼굴 객체 정보에서 화자 구별을 위한 특징 값을 제시하고, 이를 이용하여 얻어진 입 주변 엣지(Edge)를 이루는 픽셀들의 분산 값으로 화자 여부를 판단한다.

  • PDF

음성 단어를 이용한 구간검출에 의한 패턴인식 (Pattern Recognition by Section Detection Using Speech Word)

  • 최재승
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2016년도 춘계학술대회
    • /
    • pp.681-682
    • /
    • 2016
  • 본 논문에서는 화자 식별에서 음성신호의 애매한 점을 보완할 수 있는 신경회로망의 오차역전파학습 알고리즘과 모음구간 검출에 기초하여 입력되는 음성의 화자 패턴을 구분하는 일본어 단어 패턴인식 알고리즘을 제안한다. 제안하는 알고리즘에서는 일본어 데이터베이스로부터의 단어를 사용하여 음성의 특징벡터를 추출하여 분석하고 이러한 음성의 특징벡터의 차이를 이용하여 일본어 화자에 대한 패턴인식 실험을 수행하였다.

  • PDF

유사인용문의 화법 구조 (The Attitudinal Force of Psuedo-Quotation Sentences in Korean)

  • 김종현
    • 한국인지과학회:학술대회논문집
    • /
    • 한국인지과학회 2000년도 춘계 학술대회
    • /
    • pp.178-185
    • /
    • 2000
  • 청자를 직접 대면한 상황에서 1인칭 화자는 {X, Y, 말했다}의 인용구조를 갖추지 않은'[...]고'의 '유사인용문'을 사용하여 주관적 관점을 표현한다. '-다고'로 종결되는 유사인용문 형식이 인용문의 화법과 유사한 기저구조를 지니는 것으로 보고, 화법구조상에서 관점문과 보고문의 의미적 속성을 밝혀나가는 과정에서 유상인용문의 발화 효과와 화자의 발언의도를 설명한다. 화자가 취하는 관점의 선택에 따라 1인칭 화자인 [나] 이외에 다른 제 3 의 주체, 사회적 구속력 등이 화자의 배경지식에 자리잡는 것을 가능세계의 논리적 분할의 측면에서 구분하고 이것이 유사인용문 화자의 발언 동기에 반영되는 정도의 차이에 따라서 화자의 단언적 태도와 완곡의 태도가 각각 실현되는 것임을 보인다.

  • PDF

한국어 화자의 영어발음에 모국에의 음절구조가 미치는 영향 (Effects of Korean syllable structure on English pronunciation)

  • 이미현;류희관
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 2000년도 하계학술발표대회 논문집 제19권 1호
    • /
    • pp.309-312
    • /
    • 2000
  • 이 논문은 한국어 화자들이 영어를 발음할 때 나타나는 한국어 음절구조의 영향을 살펴보는 것을 목적으로 한다. 본 연구에서는 특히, 자음연쇄에 나타나는 한국어 음절구조의 영향을 살펴봄으로써, 음운론적으로는 이미 많이 논의가 되어 온 것을 실험음성학적인 시각에서 살펴본다는 데 의의가 있다. 본 연구에서는 위치에 따른 차이 즉, coda보다는 onset에서 자음이 더 길어지는 것으로 보였다. 또, 한국어 화자의 경우, 영어권 나라에서 2년 이상 체류한 경험이 있는 그룹을 구분하여 비교해 보았으나, 그 차이는 그리 유의하지 않은 것으로 보인다.

  • PDF

fMRI에 나타난 모국어와 외국어로서의 한국문자와 중국문자의 차이 (Two Languages in One Brain Shown by fMRI: Orthography Specific Effects in L2)

  • 이동훈;이홍재;문찬홍;유재욱;남기춘
    • 한국인지과학회:학술대회논문집
    • /
    • 한국인지과학회 2002년도 춘계학술대회
    • /
    • pp.216-221
    • /
    • 2002
  • 본 연구는 문자 규칙 심층성이 다른 문자체계인 한국어와 중국어의 차이가 이중언어화자의 모국어 처리와 외국어 처리에서 각각 어떤 대뇌 활성화의 차이를 가져오는지 fMRI (functional Magnetic Resonance Imaging)를 이용하여 살펴보았다. 중국어 (Ll)-한국어(L2) 이중언어화자 및 한국어(Ll)-중국어(L2) 이중언어화자를 제 2언어 습득시기에 따라 초기 및 후기 이중언어화자로 구분하여 모국어 차이와 습득시기에 따른 영향을 알아보았다. 실험 1에서는 어휘 판단 과제(lexical decision task)를 실시하였고, 실험 2에서는 의미 판단 과제(semantic decision task)를 각각 실시하였다. 어휘판단과제를 사용한 실험 1의 결과는 음운처리와 관련된 좌반구 SMG(supramarginal gyrus), 하두정소엽(inferior parietal lobule, BA 39, 40)에서 중국어-한국어 초기 및 후기이중언어화자의 경우, 한국어 조건에서 보다 많은 활성화를 보였으나, 한국어-중국어 화자의 경우 활성화가 나타나지 않았다. 철자처리에 관련된 방추상회(fusiform gyrus, BA 37, 19) 영역에서는 중국어-한국어 화자뿐만 아니라, 한국어-중국어 인중언어화자의 경우도 중국어 조건에서 보다 많은 활성화를 보였다. 실험 2에서 사용한 의미판단과제의 경우, 중국어-한국어 이중언어화자의 경우 어휘판단과제를 사용한 실험 1의 결과에서 보고된 한국어 특정적인 반응, 즉 SMG영역에서의 활성화의 증가가 실험 2에서는 나타나지 않았다. 그러나 한국어-중국어 이중언어화자의 경우, 실험 1에서 나타난 것과 같이 철자처리 혹은 의미처리와도 관련된다고 보고되는 방추상회(fusiform gyrus)등의 영역 유의미한 차이를 나타났다. 이는 어휘 판단과제와 의미판단과제가 유도하는 뇌 활성화 양상이 다름을 시사한다. 종합해 볼 때, 이중언어화자의 뇌 영상 연구에서 어휘수준에서는 거의 공통적인 활성화를 보인다는 개략적 수준의 연구 결과를 넘어, 음운처리 및 철자처리와 같은 어휘접근 수준에서는 이중언어화자들의 뇌 활성화가 다르게 일어남을 보여주고 있다. 따라서 이중언어 화자의 뇌 기전을 밝히기 위해서도 보다 개략적 수준을 넘어 언어처리의 세부적인 수준에 따른 접근이 필요함을 시사한다.

  • PDF

유/무성음 구분 및 이종적 특징 파라미터 결합을 이용한 화자인식 성능 개선 (Speaker Recognition Performance Improvement by Voiced/Unvoiced Classification and Heterogeneous Feature Combination)

  • 강지훈;정상배
    • 한국정보통신학회논문지
    • /
    • 제18권6호
    • /
    • pp.1294-1301
    • /
    • 2014
  • 본 논문에서는 화자 인식의 성능을 개선하기 위해서 유성음 및 무성음에 대한 별도의 확률분포 모델링을 사용하였다. 또한, 종래의 멜-주파수 캡스트럼 계수 이외에 유성음 구간에서 추가적으로 왜도, 첨도, 하모닉 대 잡음비 등을 추출하여 활용하였다. 화자 인식을 위한 스코어는 유성음 및 무성음 확률분포 모델에서 각각 구해지는데 전수 조사방식에 의해서 최적의 스코어 결합 가중치가 결정되었다. 제안된 방식의 화자인식기의 성능은 종래의 멜-주파수 캡스트럼 계수 및 화자당 하나의 혼합 가우시안 기반 확률분포 모델링을 사용한 방식과 비교되었으며 실험 결과 제안된 방식이 가우시안 혼합의 수가 낮아질수록 더 큰 성능 향상을 얻음을 알 수 있었다.