• 제목/요약/키워드: Allophone

검색결과 20건 처리시간 0.02초

변이음 HMM을 이용한 고립단어 인식 (Isolated Word Recognition Using Allophone Unit Hidden Markov Model)

  • 이강성;김순협
    • 한국음향학회지
    • /
    • 제10권2호
    • /
    • pp.29-35
    • /
    • 1991
  • 본 논문에서는 변이음 단위의 Hidden Markov Model (HMM)을 이용하여 고립단어를 인식하는 방법을 논한다. 변이음 단위로 HMM을 구성하여 변이음 사전을 만들고, 이 변이음 사전을 이용하여 단어 사전을 구성한다. 변이음 HMM을 이용하여 단어를 구성하려면 변이음 간의 천이확률이 계산되어야 하므로 본 연구에서는 변이음 간의 천이 확률의 영향을 측정하여 그 변이음으로 이루어지는 임의의 단어를 적응없이 적은 수의 적응 데이터로 단어모델을 구성 인식하는 것을 설명한다. 비교를 위하여 단어인식 HMM으로 인식 실험을 한 결과, 변이음 단위 HMM이 적은 기억 용량과 적은 데이터의 훈련으로 단어단위 HMM 이상의 인식률을 얻을 수 있음을 보였다.

  • PDF

계층구조 시간지연 신경망을 이용한 한국어 변이음 인식에 관한 연구 (A Study on Korean Allophone Recognition Using Hierarchical Time-Delay Neural Network)

  • 김수일;임해창
    • 전자공학회논문지B
    • /
    • 제32B권1호
    • /
    • pp.171-179
    • /
    • 1995
  • In many continuous speech recognition systems, phoneme is used as a basic recognition unit However, the coarticulation generated among neighboring phonemes makes difficult to recognize phonemes consistently. This paper proposes allophone as an alternative recognition unit. We have classified each phoneme into three different allophone groups by the location of phoneme within a syllable. For a recognition algorithm, time-delay neural network(TDNN) has been designed. To recognize all Korean allophones, TDNNs are constructed in modular fashion according to acoustic-phonetic features (e.g. voiced/unvoiced, the location of phoneme within a word). Each TDNN is trained independently, and then they are integrated hierarchically into a whole speech recognition system. In this study, we have experimented Korean plosives with phoneme-based recognition system and allophone-based recognition system. Experimental results show that allophone-based recognition is much less affected by the coarticulation.

  • PDF

가변 어휘 음성 인식기의 음향모델 개선 및 성능분석 (Acoustic Model Improvement and Performance Evaluation of the Variable Vocabulary Speech Recognition System)

  • 이승훈;김회린
    • 한국음향학회지
    • /
    • 제18권8호
    • /
    • pp.3-8
    • /
    • 1999
  • 문맥독립형 음향모델을 채택하고 있는 기존의 가변어휘 음성인식기는 주변환경에 따른 음소의 변화를 모델링 할 수 없었다. 이러한 문제를 해결하기 위해서는 변이음을 이용한 문맥의존형 음향모델을 사용해야 한다. 본 논문은 가변어휘 음성인식기의 음향모델을 효과적으로 개선하기 위하여 적용한 방법에 대해서 기술하고 있다. 즉, 음향모델의 개선은 엔트로피를 이용한 군집화 기법을 적용하여 변이음의 개수를 변경시키면서 최적의 변이음 모델을 추출하는 방법을 사용하였다. 개선된 모델에 대한 성능은 POW(Phonetically Optimized Words) 3848 DB 및 SNR이 크게 다른 2종류의 PC168 DB를 이용하여 훈련 및 인식 실험을 수행하면서 평가하였다. 결론적으로 변이음의 개수를 낮추면서도 인식 성능의 저하를 가져오지 않는 최적의 변이음 모델을 얻을 수 있었으며 PC168 DB를 이용한 인식실험을 통하여 확인할 수 있었다.

  • PDF

정보이론 기반 중세국어 'ㅸ'의 음운론적 대립에 대한 연구 (Information Theoretic Approach to Middle Korean [ß])

  • 박선우
    • 한국어학
    • /
    • 제79권
    • /
    • pp.63-89
    • /
    • 2018
  • This study explores contrastive relation among voiced bilabial fricative [${\ss}$], voiceless bilabial stop [p] and glide [w] in Middle Korean consonant system based on Probabilistic Model. Preceding researches about voiced bilabial fricative [${\ss}$] proposed two influential arguments. One is voiced bilabial fricative [${\ss}$] was an independent phoneme, the other is it was not an independent phoneme but an allophone of voiceless bilabial stop [p] in Middle Korean. This study applies Probabilistic Phonological Relationship Model (PPRM) for solving the problem of dichotomy about contrastive and allophonic relations. The analysis result of the contrastive entropy by PPRM suggests that voiced bilabial fricative [${\ss}$] was just an allophone of voiceless bilabial stop [p] or glide [w] in Middle Korean. Comparing the entropies between [p] and other consonants with the entropies between [${\ss}$] and other consonants, a continuum defined in terms of entropy reveals that [${\ss}$] in Middle Korean was more allophonic than phonemic.

연변어 탄설음화 현상의 음성, 음운론적 분석 (The phonetics and phonology of flapping in Yonbyon dialects)

  • 강현숙
    • 대한음성학회지:말소리
    • /
    • 제37호
    • /
    • pp.1-12
    • /
    • 1999
  • In this paper, we examine the allophones of an underlying segment /l/ in Korean dialects. In particular, we examine how an underlying /l/ sound surfaces in the Korean dialect spoken at Yonbyon, China. To do so, we employ the following processes: First, we perform the phonetic studies on the allophones of an underlying /l/ in the Yonbyon dialect. Secondly, we compare the phonological environments of the allophones of an underlying /l/ in the Yonbyon dialect with the South Korean dialect. Finally, we discuss the phonological implications of the allophones of the underlying /l/ in terms of Feature Geometry and Syllable Contact Law. Based on the phonetic study, we will argue that the distinctive feature [sonorant] should be placed outside the root node and that the flap, an allophone of an underlying /l/, should be understood as an obstruent, not a sonorant.

  • PDF

한국어 변이음 인식을 위한 시간지연 신경망의 확장방법 (A Method of Scaling Time-Delay Neural Networks for Korean Allophone Recognition)

  • 김수일
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1994년도 제11회 음성통신 및 신호처리 워크샵 논문집 (SCAS 11권 1호)
    • /
    • pp.229-234
    • /
    • 1994
  • 본 논문에서는 한국어 변이음을 인식하기 위한 시간지연 신경망의 확장 방법을 살펴보고 한국어 파열음의 벼이음을 인식하는 실험을 통해 각 확장 방법의 인식 성능을 비교한다. 먼저 변이음을 연속음성인식의 인식단위로 사용하기 위하여 한 음소이모든 변이음을 고려하면서 서로 유사한 변이음을 통합 분류하여 3개의 변이음 군으로 나눈다. 한국어 파열음에 대한 인식 실험결과, 음향 음성학적인 특성에 따라 나누어진 trbah 시간지연 신경망들을 모듈 별로 학습한 후, 계층적으로 통합하여 전체적인 시간지연 신경망을 구성하는 방법이 가장 좋은 성능을 나타내었다. 또한, 변이음 단위 인식이 음소 단위 인식에서 문제가 되는 조음 결합 현상을 해결할 수 있음을 확인하였고, 변이음 인식의 결과인 변이음 열이 제공하는 부가적인 정보를 음운파상에 이용하는 방법에 대해 고찰하였다.

  • PDF

한국어 음성인식을 위한 효율적인 사전 구성에 관한 연구 (Study on Efficient Generation of Dictionary for Korean Vocabulary Recognition)

  • 이상복;최대림;김종교
    • 대한음성학회:학술대회논문집
    • /
    • 대한음성학회 2002년도 11월 학술대회지
    • /
    • pp.41-44
    • /
    • 2002
  • This paper is related to the enhancement of speech recognition rate using enhanced pronunciation dictionary. Modern large vocabulary, continuous speech recognition systems have pronunciation dictionaries. A pronunciation dictionary provides pronunciation information for each word in the vocabulary in phonemic units, which are modeled in detail by the acoustic models. But in most speech recognition system based on Hidden Markov Model, actual pronunciation variations are disregarded. Without the pronunciation variations in the speech recognition system, the phonetic transcriptions in the dictionary do not match the actual occurrences in the database. In this paper, we proposed the unvoiced rule of semivowel in allophone rules to pronunciation dictionary. Experimental results on speech recognition system give higher performance than existing pronunciation dictionaries.

  • PDF

HMnet Evaluation for Phonetic Environment Variations of Traning Data in Speech Recognition

  • Kim, Hoi-Rin
    • The Journal of the Acoustical Society of Korea
    • /
    • 제15권4E호
    • /
    • pp.28-36
    • /
    • 1996
  • In this paper, we propose a new evaluation methodology which can more clearly show the performance of the allophone modeling algorithm generally used in large vocabulary speech recognition. The proposed evaluation method shows the running characteristics and limitations of the modeling algorithm by testing how the variation of phonetic environments of training data affects the recognition performance and the desirable number of free parameters to be estimated. Using the method, we experiment results, we conclude that, in vocabulary-independent recognition task, the phonetic diversity of training data greatly affects the robustness of model, and it is necessary to develop a proper measure which can determine the number of states compromizing the robustness and the precision of the HMnet better than the conventional modeling efficiency.

  • PDF

악리론으로 본 정음창제와 정음소 분절 알고리즘 (Ortho-phonic Alphabet Creation by the Musical Theory and its Segmental Algorithm)

  • 진용옥;안정근
    • 음성과학
    • /
    • 제8권2호
    • /
    • pp.49-59
    • /
    • 2001
  • The phoneme segmentation is a very difficult problem in speech sound processing because it has found out segmental algorithm in many kinds of allophone and coarticulation's trees. Thus system configuration for the speech recognition and voice retrieval processing has a complex system structure. To solve it, we discuss a possibility of new segmental algorithm, which is called the minus a thirds one or plus in tripartitioning(삼분손익) of twelve temporament(12 율려), first proposed by Prof. T. S. Han. It is close to oriental and western musical theory. He also has suggested a 3 consonant and 3 vowel phonemes in Hunminjungum(훈민정음) invented by the King Sejong in the 15th century. In this paper, we suggest to newly name it as ortho-phonic phoneme(OPP/정음소), which carries the meaning of 'the absoluteness and independency'. OPP also is acceptable to any other languages, for example IPA. Lastly we know that this algorithm is constantly applicable to the global language and is very useful to construct a voice recognition and retrieval structuring engineering.

  • PDF