• 제목/요약/키워드: Dynamic speaker

검색결과 87건 처리시간 0.023초

Spatio-temporal방법을 이용한 지역명 인식에 관한 연구 (A Study on the recognition of local name using Spatio-Temporal method)

  • 지원우
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1993년도 학술논문발표회 논문집 제12권 1호
    • /
    • pp.121-124
    • /
    • 1993
  • This paper is a study on the word recognition using neural network. A limited vocabulary, speaker independent, isolated word recognition system has been built. This system recognizes isolated word without performing segmentation, phoneme identification, or dynamic time wrapping. It needs a static pattern approach to recognize a spatio-temporal pattern. The preprocessing only includes preceding and tailing silence removal, and word length determination. A LPC analysis is performed on each of 24 equally spaced frames. The PARCOR coefficients plus 3 other features from each frame is extracted. In order to simplify a structure of neural network, we composed binary code form to decrease output nodes.

  • PDF

연속숫자 음성인식에서 화자 적응에 관한 연구 (A Study on Speaker Adaptation in Continuous Digits Speech Recognition)

  • 최광표
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1998년도 학술발표대회 논문집 제17권 2호
    • /
    • pp.319.2-322
    • /
    • 1998
  • 본 논문에서는 반음절 단위 HMM을 이용한 연속 숫자 음성인식 시스템의 2단계로 이루어지는 화자 적응 알고리즘을 수행하였다. 음성인식 시스템에서 사용되는 훈련데이터의 양이 많더라도 발성속도, 발성크기 등의 화자 발성 습관에 따라 화자독립 음성인식 시스템에서는 많은 문제점들이 발생하게 된다. 불특정 화자를 대상으로 한 음성 인식에 있어서 개인차에 의한 변동을 대처하는 방법으로 유효한 음향적 특성을 추출하기 위해 스펙트럼의 동적인(Dynamic) 특성을 주로 이용하고 있다. 따라서 본 논문에서는 화자 적을 기법의 하나인 frequency warped spectral matching 방법을 연속숫자 음성 인식시스템에 적용하였으며, 이때 인식에 의한 적절한 화자별 스케일링 계수 선정 방법을 수행하여 오인식률이 감소함을 확인하였다.

  • PDF

포르만트 주파수를 이용한 한국어 음성의 자동인식에 관한 연구

  • 김순협;박규태
    • 한국통신학회:학술대회논문집
    • /
    • 한국통신학회 1983년도 춘계학술발표회논문집
    • /
    • pp.16-17
    • /
    • 1983
  • In Speech signal processing, ARMA spectral estimation method is used. It has been demonstrated that the ARMA model provides better spectral estimation then the more specialized AR model and MA model. Dynamic program is used to achieve time algnment. Speech sound similarity is defined to be proportional to the distance seperating to sound in a vector space defined by ARMA model. AS a result, the recognition rate of 97.3% for three speaker is obtained.

  • PDF

구문 분석과 One-Stage DP를 이용한 연속 숫자음 인식에 관한 연구 (A study on the Recognition of Continuous Digits using Syntactic Analysis and One-Stage DP)

  • 안태옥
    • 한국음향학회지
    • /
    • 제14권3호
    • /
    • pp.97-104
    • /
    • 1995
  • 본 논문은 음성 다이얼링 시스템 구현을 위한 연속 숫자음 인식에 관한 연구로써, 구문 분석을 이용한 One-Stage DP에 의한 음성 인식 방법을 제안하다. 인식 실험을 위해 우선 구간 구분화 알고리즘을 이용하여 DMS (Dynamic Multi-SEction) 모델을 만들며, 제안된 구문 분석을 이용한 One-Stage DP 방법으로 실험 대ㅛ상의 연속 숫자음 데이터를 인식하게 하였다. 본 연구에서는 8명의 ㅣ남성 화자에 의해 2-3번 발음도니 21종의 7자리의 연속 숫자음이 사용되었고, 기존의 One-Stage DP와 제안된 구문 분석을 이용한 One-Stage DP 음성 인식 알고리즘을 사용해서 화자 종속과 화자 독립 실험을 실험실 환경에서 수행하였다. 인식 실험 결과, 기존의 방법보다 제안된 방법이 인식률이 좋은 것으로 나타났으며, 제안된 방법에서는 화자 종속과 화자 독립 실험에서 각각 약 91.7%, 89.7%로 나타났다.

  • PDF

A Novel Two-Level Pitch Detection Approach for Speaker Tracking in Robot Control

  • Hejazi, Mahmoud R.;Oh, Han;Kim, Hong-Kook;Ho, Yo-Sung
    • 제어로봇시스템학회:학술대회논문집
    • /
    • 제어로봇시스템학회 2005년도 ICCAS
    • /
    • pp.89-92
    • /
    • 2005
  • Using natural speech commands for controlling a human-robot is an interesting topic in the field of robotics. In this paper, our main focus is on the verification of a speaker who gives a command to decide whether he/she is an authorized person for commanding. Among possible dynamic features of natural speech, pitch period is one of the most important ones for characterizing speech signals and it differs usually from person to person. However, current techniques of pitch detection are still not to a desired level of accuracy and robustness. When the signal is noisy or there are multiple pitch streams, the performance of most techniques degrades. In this paper, we propose a two-level approach for pitch detection which in compare with standard pitch detection algorithms, not only increases accuracy, but also makes the performance more robust to noise. In the first level of the proposed approach we discriminate voiced from unvoiced signals based on a neural classifier that utilizes cepstrum sequences of speech as an input feature set. Voiced signals are then further processed in the second level using a modified standard AMDF-based pitch detection algorithm to determine their pitch periods precisely. The experimental results show that the accuracy of the proposed system is better than those of conventional pitch detection algorithms for speech signals in clean and noisy environments.

  • PDF

DMS 모델과 이중 스펙트럼 특징을 이용한 HMM에 의한 음성 인식 (HMM-based Speech Recognition using DMS Model and Double Spectral Feature)

  • 안태옥
    • 한국산학기술학회논문지
    • /
    • 제7권4호
    • /
    • pp.649-655
    • /
    • 2006
  • 본 논문은 화자 독립의 음성인식을 위한 연구로써, DMS 모델에 의한 DMSVQ(Dynamic Multi-Section Vector Quantization) 코드북과 이중 스펙트럼 특징을 이용한 HMM(Hidden Markov Model) 음성인식 방법을 제안한다. 정적 스펙트럼 특징으로서는 LPC ?S스트럼 계수를 이용하였고, 동적 스펙트럼 특징으로는 LPC ?S스트럼의 회귀계수를 사용하였다. 이들 두개의 스펙트럼 특징들을 각각 VQ 코드북으로 양자화되고, DMS 모델을 이용한 HMM은 입력으로써 정적 스펙트럼 특징과 동적 스펙트럼 특징을 받아드림으로써 모델링된다. 제안된 방법에 의한 인식 실험은 기존의 다양한 인식 방법에 의한 인식 실험들과 비교를 위해 동일한 데이터와 조건 하에서 수행하였다. 실험 결과, 본 연구에서 제안한 방법이 기존의 방법들보다 우수한 방법임을 입증하였다.

  • PDF

DMS 모델을 이용한 한국어 음성 인식 (Korean Speech Recognition using Dynamic Multisection Model)

  • 안태옥;변용규;김순협
    • 대한전자공학회논문지
    • /
    • 제27권12호
    • /
    • pp.1933-1939
    • /
    • 1990
  • In this paper, we proposed an algorithm which used backtracking method to get time information, and it be modelled DMS (Dynamic Multisection) by feature vectors and time information whic are represented to similiar feature in word patterns spoken during continuous time domain, for Korean Speech recognition by independent speaker using DMS. Each state of model is represented time sequence, and have time information and feature vector. Typical feature vector is determined as the feature vector of each state to minimize the distance between word patterns. DDD Area names are selected as recognition wcabulary and 12th LPC cepstrum coefficients are used as the feature parameter. State of model is made 8 multisection and is used 0.2 as weight for time information. Through the experiment result, recognition rate by DMS model is 94.8%, and it is shown that this is better than recognition rate (89.3%) by MSVQ(Multisection Vector Quantization) method.

  • PDF

Lie Detection Technique using Video from the Ratio of Change in the Appearance

  • Hossain, S.M. Emdad;Fageeri, Sallam Osman;Soosaimanickam, Arockiasamy;Kausar, Mohammad Abu;Said, Aiman Moyaid
    • International Journal of Computer Science & Network Security
    • /
    • 제22권7호
    • /
    • pp.165-170
    • /
    • 2022
  • Lying is nuisance to all, and all liars knows it is nuisance but still keep on lying. Sometime people are in confusion how to escape from or how to detect the liar when they lie. In this research we are aiming to establish a dynamic platform to identify liar by using video analysis especially by calculating the ratio of changes in their appearance when they lie. The platform will be developed using a machine learning algorithm along with the dynamic classifier to classify the liar. For the experimental analysis the dataset to be processed in two dimensions (people lying and people tell truth). Both parameter of facial appearance will be stored for future identification. Similarly, there will be standard parameter to be built for true speaker and liar. We hope this standard parameter will be able to diagnosed a liar without a pre-captured data.

MSVQ/TDRNN을 이용한 음성인식 (Speech Recognition Using MSVQ/TDRNN)

  • 김성석
    • 한국음향학회지
    • /
    • 제33권4호
    • /
    • pp.268-272
    • /
    • 2014
  • 본 논문에서는 MSVQ(Multi-Section Vector Quantization)와 시간지연 회귀 신경회로망(TDRNN)을 이용한 하이브리드 구조의 음성인식 방법을 제안한다. MSVQ는 음성의 길이를 일정한 구간 수로 정규화한 코드북을 생성하고, 시간지연 회귀 신경회로망은 이 코드북을 이용하여 음성을 인식한다. 시간지연 회귀 신경회로망은 음성의 시계열 문맥정보를 잘 학습할 수 있는 구조로 구성되었다. 음성특징으로 인지선형예측(PLP) 계수가 사용되었다. 음성인식 실험을 수행한 결과 MSVQ/TDRNN 음성인식기는 97.9 %의 화자독립 음성 인식률을 보였다.

DMS 모델과 퍼지 개념을 이용한 HMM에 기초를 둔 음성 인식 (HMM-based Speech Recognition using DMS Model and Fuzzy Concept)

  • 안태옥
    • 한국산학기술학회논문지
    • /
    • 제9권4호
    • /
    • pp.964-969
    • /
    • 2008
  • 본 논문은 화자 독립의 음성인식을 위한 연구로서, DMS(Dynamic Multi-Section) 모델에 의한 DMSVQ(Dynamic Multi-Section Vector Quantization) 코드북과 퍼지 개념을 이용한 HMM(Hidden Markov Model) 음성인식 방법을 제안한다. 제안된 인식 방법에서는 학습 데이터를 동적으로 몇 개의 구간(section)으로 분할한 후, 각 구간마다 DMSVQ 코드북(codebook)으로 부터 거리값이 작은 순으로 퍼지 법칙을 적용함으로써 적당한 확률값을 준 다중 관측열(multi-observation sequences)을 구한다. 그런 다음, 이 다중 관측열을 이용하여 HMM을 작성하고, 인식시에는 관측 확률값이 가장 높은 것을 인식된 것으로 선택한다. 제안된 방법에 의한 인식 실험은 기존의 다양한 인식 실험들과 비교를 위해 동일한 조건하에서 같은 데이터로 수행 하였다. 실험 결과로서, 본 연구에서 제안한 방법이 기존의 방법들보다 우수한 방법임을 입증하였다.