• 제목/요약/키워드: 음성데이터베이스

검색결과 269건 처리시간 0.026초

신경망 기반 화자증명 시스템에서 더욱 향상된 사용자 등록속도 (Faster User Enrollment for Neural Speaker Verification Systems)

  • Lee, Tae-Seung;Park, Sung-Won;Hwang, Byong-Won
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국해양정보통신학회 2003년도 추계종합학술대회
    • /
    • pp.1021-1026
    • /
    • 2003
  • MLP(multilayer perceptron)는 화자증명에 대한 응용에 있어 우수한 특질을 지니고 있지만 동시에 느린 학습속도의 문제를 안고 있다. 편리한 사용을 위해 MLP에 기반한 화자증명 시스템에서는 신속한 화자등록이 요구되며 이 문제는 MLP의 빠른 학습속도에 전적으로 의존한다. 이러한 시스템에서 실시간 등록을 달성하기 위해 지금까지 두 가지 측면에서 연구가 시도되었으며 각기 의도한 목적을 달성하였다. 본 논문에서는 이 두 방법이 상이한 최적화 원리에서 동작한다는 가정 하에 이들을 결합하고 이를 MLP 기반 화자증명 시스템에 적용한다. 이러한 결합이 화자등록 속도를 더욱 향상시킬 수 있다는 사실은 한국어 음성 데이터베이스를 이용한 실험결과에서 입증된다.

  • PDF

가중치 분포 특성을 이용한 Eigenvoice 기반 고속화자적응 (Rapid Speaker Adaptation Based on Eigenvoice Using Weight Distribution Characteristics)

  • 박종세;김형순;송화전
    • 한국음향학회지
    • /
    • 제22권5호
    • /
    • pp.403-407
    • /
    • 2003
  • 최근 고속화자적응 기법으로 eigenvoice 방식이 많이 사용되고 있다. Eigenvoice 적응방식에서도 적응화자의 적응 데이터가 매우 적은 경우에는 적절한 가중치의 추정이 어렵기 때문에 적응 데이터가 어느 정도 많은 경우에 비해 인식성능 향상이 크지 않다. 본 논문에서는 적응 데이터가 적을 때의 성능향상을 위하여 eigenvoice의 가중치 분포 특성을 이용한 eigenvoice 기반 고속화자적응을 제안한다. PBW 452 데이터베이스를 사용한 어휘독립 단어인식 실험 결과에서 가중치 문턱치(threshold) 적용 방식을 사용하여 적응 데이터가 매우 적은 경우의 상대적인 성능 저조 문제를 완화시켰다. 적응단어를 단 1개만 사용한 경우 가중치 문턱치 적용 방식을 사용하여 단어 오인식률을 9-18% 정도 감소시켰다.

깊은 신경망 기반의 전이학습을 이용한 사운드 이벤트 분류 (Sound event classification using deep neural network based transfer learning)

  • 임형준;김명종;김회린
    • 한국음향학회지
    • /
    • 제35권2호
    • /
    • pp.143-148
    • /
    • 2016
  • 깊은 신경망은 데이터의 특성을 효과적으로 나타낼 수 있는 방법으로 최근 많은 응용 분야에서 활용되고 있다. 하지만, 제한적인 양의 데이터베이스는 깊은 신경망을 훈련하는 과정에서 과적합 문제를 야기할 수 있다. 본 논문에서는 풍부한 양의 음성 혹은 음악 데이터를 이용한 전이학습을 통해 제한적인 양의 사운드 이벤트에 대한 깊은 신경망을 효과적으로 훈련하는 방법을 제안한다. 일련의 실험을 통해 제안하는 방법이 적은 양의 사운드 이벤트 데이터만으로 훈련된 깊은 신경망에 비해 현저한 성능 향상이 있음을 확인하였다.

원격진료를 위한 인터넷 기반의 의료영상시스템 설계 및 구현 (Design and Implementation of A Web Based Medical Image System for Telemedicine)

  • 이수진;김문회
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2002년도 추계학술발표논문집 (상)
    • /
    • pp.813-816
    • /
    • 2002
  • 컴퓨터 보급의 급속한 발전과 멀티미디어의 등장으로 기존의 텍스트와 이미지, 음성, 오디오, 동영상 등의 정보를 디지털화하고, 컴퓨터를 이용하여 저장, 처리, 전송하게 되면서 의료 분야에서도 상당한 업무의 변화를 요구하게 되었다. 의료 분야에서의 이러한 급격한 개방과 더불어 초고속 정보 통신의 발달은 원격진료라는 또 다른 요구를 대두시키고 있다. 이를 위해서는, 멀티미디어 기술, 대용량의 정보를 저장하는 데이터베이스 기술, 초속의 광 대역 기술 등을 통합하여 종합적인 멀티미디어 의료 정보 시스템을 구축하는 것이 시급하다. 이러한 이유들로 본 논문에서는 병원/의원의 의료진들로 하여금 의료영상이나 자료를 상호 전송하여 환자의 진료 또는 검진결과를 확인하고 전문가의 조언 등을 구하는 원격 진료용 의료영상 시스템의 요구사항을 분석, 설계하고 구현하였다. 본 시스템은 클라이언트/서버 구조로써 영상 획득 및 출력, 의료영상 국제 표준 포맷인 DICOM 포맷으로의 영상 저장, MCA(Multi Channel Analyzer), ROI(Region Of Interest) 등의 영상 분석, 필터링 및 영상 확대/축소/회전 등의 각종 영상 처리의 주요 기능을 갖으며, 사용자가 편리하고 쉽게 사용할 수 있도록 아이콘(icon) 중심의 직관적인 인터페이스를 갖는다.

  • PDF

확률출력 SVM을 이용한 감정식별 및 감정검출 (Identification and Detection of Emotion Using Probabilistic Output SVM)

  • 조훈영;정규준
    • 한국음향학회지
    • /
    • 제25권8호
    • /
    • pp.375-382
    • /
    • 2006
  • 본 논문에서는 음성신호에 포함된 감정정보를 자동으로 식별하는 방법과 특정 감정을 검출하는 방법에 대해 다룬다. 자동 감정식별 및 검출을 위해 장구간 (long-term) 음향 특징을 사용하였고, F-score 기반의 특징선택 기법을 적용하여 최적의 특징 파라미터들을 선정하였다. 기존의 일반적인 SVM을 확률출력 SVM으로 변환하여 감정식별 및 감정검출 시스템을 구축하였으며, 가설검정에 기반한 감정검출을 위해 세 가지의 대수 우도비 (log-likelihood) 근사법을 제안하여 그 성능을 비교하였다. SUSAS 데이터베이스를 사용한 실험 결과, F-score를 이용한 특징선택 기법에 의해 감정식별 성능이 향상되었으며, 확률출력 SVM의 유효성을 검증할 수 있었다. 감정검출의 경우, 제안한 방법에 의해 91.3%의 정확도로 화난 감정을 검출할 수 있었다.

혼합 가우시안 군집화를 이용한 상태공유 음향모델 최적화 (A Study on the Optimization of State Tying Acoustic Models using Mixture Gaussian Clustering)

  • 안태옥
    • 대한전자공학회논문지SP
    • /
    • 제42권6호
    • /
    • pp.167-176
    • /
    • 2005
  • 본 논문은 음성인식에 쓰이는 음향모델의 모델링 방법 중 결정트리 상태공유 모델링(DTST)을 기반으로 출력 확률 분포의 혼합 가우시안 수를 줄여 모델을 최적화하는 방법을 제안한다. DTST는 음성학적 지식을 포함할 수 있는 질의어 집합과 유사도를 기반으로 한 결정 방법을 이용하는 것이다. 이때 상태들의 출력 확률 분포의 혼합 가우시안 수를 늘려 인식률을 증가시킬 수 있게 된다. 본 논문에서는 인식률이 최대가 되는 지점에서 혼합 가우시안들을 군집화 하여 그 수를 줄이고자 한다. 군집화 시에 필요한 거리 측정 방법은 유클리드(Euclidean)와 바타챠랴(Bhattacharyya) 방법을 이용하였고, 새로운 가우시안은 거리가 최소가 되는 두 가우시안으로부터 평균과 분산을 다시 계산하여 생성하였다. 증권상장 회사명(STOCKNAME) 1,680개의 단어 데이터베이스를 구성하여 실험한 결과 바타챠랴 방법은 $97.2\%$의 인식률을 유지하면서 전체 혼합 가우시안 수의 비율을 $1.0\%$로 감소시켰고, 유클리드 방법은 $96.9\%$의 인식률을 유지하면서 혼합 가우시안 수의 비율을 $1.0\%$로 감소시켜 모델을 최적화할 수 있었다.

단일 레이블 분류를 이용한 종단 간 화자 분할 시스템 성능 향상에 관한 연구 (A study on end-to-end speaker diarization system using single-label classification)

  • 정재희;김우일
    • 한국음향학회지
    • /
    • 제42권6호
    • /
    • pp.536-543
    • /
    • 2023
  • 다수의 화자가 존재하는 음성에서 "누가 언제 발화했는가?"에 대해 레이블링하는 화자 분할은 발화 중첩 구간에 대한 레이블링과 화자 분할 모델의 최적화를 위해 심층 신경망 기반의 종단 간 방법에 대해 연구되었다. 대부분 심층 신경망 기반의 종단 간 화자 분할 시스템은 음성의 각 프레임에서 발화한 모든 화자의 레이블들을 추정하는 다중 레이블 분류 문제로 분할을 수행한다. 다중 레이블 기반의 화자 분할 시스템은 임계값을 어떤 값으로 설정하는지에 따라 모델의 성능이 많이 달라진다. 본 논문에서는 임계값 없이 화자 분할을 수행할 수 있도록 단일 레이블 분류를 이용한 화자 분할 시스템에 대해 연구하였다. 제안하는 화자 분할 시스템은 기존의 화자 레이블을 단일 레이블 형태로 변환하여 모델의 출력으로부터 레이블을 바로 추정한다. 훈련에서는 화자 레이블 순열을 고려하기 위해 Permutation Invariant Training(PIT) 손실함수와 교차 엔트로피 손실함수를 조합하여 사용하였다. 또한 심층 구조를 갖는 모델의 효과적인 학습을 위해 화자 분할 모델에 잔차 연결 구조를 추가하였다. 실험은 Librispeech 데이터베이스를 이용해 화자 2명에 대한 시뮬레이션 잡음 데이터를 생성하여 사용하였다. Diarization Error Rate(DER) 성능 평가 지수를 이용해 제안한 방법과 베이스라인 모델을 비교 평가했을 때, 제안한 방법이 임계값 없이 분할이 가능하며, 약 20.7 %만큼 향상된 성능을 보였다.

주기적인 생리변수 측정과 전자건강설문을 이용한 재택건강관리서비스 (Home Health Care Service Using Routine Vital Sign Checkup and Electronic Health Questionnaires)

  • 박승훈;우응제;이광호;김종철
    • 대한의용생체공학회:의공학회지
    • /
    • 제22권5호
    • /
    • pp.469-477
    • /
    • 2001
  • 본 논문은 가정에 있는 만성질환자, 퇴원한 환자 및 자신의 건강을 염려하는 정상인 등을 대상으로 매일 측정한 심전도. 혈압. 혈중 산소 포화농도 등과 같은 생리변수와 건강 설문에 대한 응답을 분석하여 건강상태를 지속적으로 파악하고, 비정상적인 상태가 발견될 경우에는 의사가 정확히 확인하여 필요한 조치를 조언하는 재택건강관리서비스에 대해서 기술하고 있다 재택건강관리서비스를 위해서 가입자는 재택건강관리단말기와 인터넷에 연결된 PC를 가정에 구비하여야 한다. 관제센터는 의사와 가입자의 기본정보와 가입자의 건강정보를 저장하기 위한 데이터베이스 시스템, 생체신호와 건강설문을 분석하여 현재상태의 비정상여부를 판단하는 건강상태자동평가시스템, 가입자와 의사들이 웹 브라우저를 사용하여 원하는 건강정보를 데이터베이스에서 검색, 조회하고. 그 내용을 수정. 편집하여 저장할 수 있는 웹 기반 건강정보관리시스템이 필요하다. 또한, 공중전화망 및 무선통신망을 이용한 음성 및 문자 전송과 인터넷을 이용한 전자우편에 의해 의사의 소견을 가입자에게 전달하는 통합 메시징 시스템 (UMS). 종합검진센터에서 의사가 검사결과와 문진 결과를 입력하기 위한 정보입력 PC. 병원에서 의사가 가입자의 정보를 조회하거나 정밀진단결과를 입력하기 위한 인터넷 PC 등이 설치되어야 한다. 일반에게 이러한 서비스를 널리 보급하기 위해서는, 생리변수들의 무구속 및 무자각 측정기술과 지능적인 건강평가 알고리즘의 개발에 대한 연구가 계속 수행되어야 할 것이다.

  • PDF

모바일 기기 기반 사용자 중심형 전시관 정보 안내 시스템의 설계 및 구현 (Design and Implementation of user centric pavilion information guide system based on commercial mobile device)

  • 윤현주;부소영;최유주
    • 한국컴퓨터정보학회논문지
    • /
    • 제11권2호
    • /
    • pp.187-199
    • /
    • 2006
  • 본 논문에서는 PDA(Personal Digital Assistant: 이하 PDA라 약칭함)와 같은 모바일 기기를 기반으로 하여 사용자가 원하는 대로 시스템의 인터페이스가 구성되는 사용자 중심형 전시관 정보 안내 시스템을 제안한다. 이는 PDA나 휴대폰 등과 같은 모바일 기기를 기반으로 제작함으로써 이동하는 사용자에게 휴대성의 편리를 제공하며, 기존의 브라우저와는 다르게 작은 디바이스 화면에서도 모든 데이터들에 대한 정보가 한 화면에 디스플레이되며, 사용자와의 인터랙션을 통하여 사용자가 원하는 정보를 중심으로 시스템의 인터페이스와 정보 요소를 구성할 수 있게 하여 이용에 편리성을 더한다. 또한 안내 대상의 위치 정보와 상세 정보 등을 글, 이미지, 음성, 동영상 등의 다양한 형태로 사용자에게 제공하는 데 그 특징이 있다. 본 논문에서 시스템은 미디어 정보 데이터베이스를 갖추고 있는 미디어 데이터 서버와 데이터베이스와 휴대용 안내시스템을 실시간으로 동시에 제어하기 위한 휴대용 시스템 컨트롤 서버 그리고 사용자의 요구 사항을 입력받고 구성된 안내 정보를 디스플레이하는 휴대용 안내 시스템 등으로 구성된다. 각 시스템은 TCP/IP기반의 네트워크 연결과 여러 전시관 형태나 데이터의 종류에 따라 갱신 및 추가, 교환이 가능하도록 하기 위한 XML(extensible Markup Language)과 JAVA 2 Micro Edition 기반의 제작을 제시한다. 이는 어떤 모바일 기기에서도 사용할 수 있게 하는 시스템의 범용성을 높일 수 있다.

  • PDF

토큰기반 변환중심 한일 기계번역을 위한 변환사전 (Transfer Dictionary for A Token Based Transfer Driven Korean-Japanese Machine Translation)

  • 양승원
    • 한국산업정보학회논문지
    • /
    • 제9권3호
    • /
    • pp.64-70
    • /
    • 2004
  • 한국어와 일본어는 동일한 어족에 속하며 비슷한 문장구조를 가지고 있어 변환중심 기계번역 방법이 효율적이다. 본 논문에서는 토큰 단위의 변환중심 한일 기계번역 시스템을 위한 변환 사전을 생성하는 방법에 관하여 기술하였다. 변환 사전이 잘 구성되면 구문분석 단계에서는 대역어를 선정하기에 적합한 정도까지의 의존트리를 생성하는 간이 파싱 만을 함으로써 필요 없는 노력을 경감시킬 수 있다. 게다가 구문해석 시에 최종의 결과 트리를 만들지 않아도 되므로 문어체 문장은 물론 입력 형태가 비정형적인 대화체 문장에서 더욱 큰 효과를 볼 수 있다. 본 논문의 변환 사전은 한국전자통신 연구원이 수집한 음성 데이터베이스로부터 추출한 말뭉치를 사용해 구성하였다. 구현한 시스템은 여행 계획영역에서 수집된 900여 발화 안의 문장을 대상으로 시험하였는데 제한된 환경에서 $92\%$, 아무런 제약이 없는 환경에서는 $81\%$의 성공률을 보였다.

  • PDF