Search | Korea Science

A Study on the Analysis and Recognition of Korean Speech Signal using the Phoneme (음소를 이용한 한국어 음성 신호의 분석과 인식에 관한 연구)

Kim Y. I.;Hwang Y. S.;Youn D. H.;Cha I. W.
- The Journal of the Acoustical Society of Korea
- /
- v.8 no.5
- /
- pp.70-77
- /
- 1989
In this paper, Korean language recognition using the phoneme is studied. The experiment is carried out by dividing 545 isolated words into phonemes. Using linear prediction coefficients the recognition rate of consonants, vowels, and end-consonants are $87.3(\%), 91.0(\%), 91.7(\%)$, respectively. Recognition rate of isolated words combined with the phonemes is $71.4(\%)$. Itakura-saito distortion measure is used to phoneme segmentation and phoneme recognition.
PDF

Bidirectional LSTM-RNNs-CRF for Named Entity Recognition in Korean (양방향 LSTM-RNNs-CRF를 이용한 한국어 개체명 인식)

Shin, Youhyun;Lee, Sang-goo
- 한국어정보학회:학술대회논문집
- /
- 2016.10a
- /
- pp.340-341
- /
- 2016
개체명 인식은 질의 응답, 정보 검색, 기계 번역 등 다양한 분야에서 유용하게 사용되고 있는 기술이다. 개체명 인식의 경우 인식의 대상인 개체명이 대부분 새롭게 등장하거나 기존에 존재하는 단어와 중의적 의미를 갖는 고유한 단어라는 문제점이 있다. 본 논문에서는 한국어 개체명 인식에서 미등록어 및 중의성 문제를 해결하기 위한 딥 러닝 모델을 제안한다. 제안하는 모델은 형태소 및 자음/모음을 이용하여 새롭게 등장하는 단어에 대한 기존 단어와의 형태적 유사성을 고려한다. 또한 임베딩 및 양방향 LSTM-RNNs-CRF 모델을 이용하여, 각 입력 값의 문맥에 따른 의미적 유사성, 문법적 유사성을 고려한다. 제안하는 딥 러닝 모델을 사용하여, F1 점수 85.71의 결과를 얻었다.
PDF

Bidirectional LSTM-RNNs-CRF for Named Entity Recognition in Korean (양방향 LSTM-RNNs-CRF를 이용한 한국어 개체명 인식)

Shin, Youhyun;Lee, Sang-goo
- Annual Conference on Human and Language Technology
- /
- 2016.10a
- /
- pp.340-341
- /
- 2016
개체명 인식은 질의 응답, 정보 검색, 기계 번역 등 다양한 분야에서 유용하게 사용되고 있는 기술이다. 개체명 인식의 경우 인식의 대상인 개체명이 대부분 새롭게 등장하거나 기존에 존재하는 단어와 중의적 의미를 갖는 고유한 단어라는 문제점이 있다. 본 논문에서는 한국어 개체명 인식에서 미등록어 및 중의성 문제를 해결하기 위한 딥 러닝 모델을 제안한다. 제안하는 모델은 형태소 및 자음/모음을 이용하여 새롭게 등장하는 단어에 대한 기존 단어와의 형태적 유사성을 고려한다. 또한 임베딩 및 양방향 LSTM-RNNs-CRF 모델을 이용하여, 각 입력 값의 문맥에 따른 의미적 유사성, 문법적 유사성을 고려한다. 제안하는 딥 러닝 모델을 사용하여, F1 점수 85.71의 결과를 얻었다.
PDF

A Study on Context Environment and Model State for Robustness Acoustic Models (강건한 음향모델을 위한 모델의 상태와 문맥환경에 관한 연구)

최재영;오세진;황도삼
- Proceedings of the Korea Multimedia Society Conference
- /
- 2003.05b
- /
- pp.366-369
- /
- 2003
본 연구에서는 강건한 문맥의존 음향모델을 작성하기 위한 기초적인 연구로서 문맥환경과 상태수의 변화에 따른 음향모델의 성능을 고찰하고자 한다. 음성은 시간함수로 표현되며 음절, 단어, 연속음성을 발성할때 자음과 모음에 따라 발성시간에 차이가 있으며 음성인식의 최소 인식단위로 널리 사용되는 음소의 앞과 뒤에 오는 문맥환경에 따라 인식성능에 많은 차이를 보이고 있다. 따라서 본 연구에서는 시간의 변화(상태수의 변화)와 상태분할 과정에서 문맥환경의 변화를 고려하여 다양한 형태의 문맥의존 음향모델을 작성하였다. 모델학습은 음소결정트리 기반 SSS 알고리즘(Phonetic Decision Tree-based Successive State Splitting： PDT-555)을 이용하였다 PDT-SSS 알고리즘은 미지의 문맥정보를 해결하기 위해 문맥방향과 시간방향으로 목표 상태수에 도달할 때까지 상태분할을 수행하여 모델을 작성하는 방법이다. 본 연구에서 강건한 문맥의존 음향모델을 학습하기 위한 방법의 유효성을 확인하기 위해 국어공학센터의 452 단어를 대상으로 음소와 단어인식 실험을 수행하였다. 실험결과, 음성의 시간변이에 따른 모델의 상태수와 각 음소의 문맥환경에 따라 인식성능의 변화를 고찰할 수 있었다. 따라서 본 연구는 향후 음성인식 시스템의 강건한 문맥의존 음향모델을 작성하는데 유효할 것으로 기대된다.
PDF

A Research on Smart Device-based Potable Sign Language Translator for Hearing-impaired Person (청각장애인을 위한 스마트기기 기반의 휴대용 수화통역기 연구)

Choi, Ji-Hee;Jeon, Soo-Min;Park, Hea-Deon;Jo, Jae-Heok;Kim, Hae-Ji;Kim, Yoo-Ri;Ro, Kwang-Hyun;Lee, Seok-ki
- Proceedings of the Korea Information Processing Society Conference
- /
- 2015.10a
- /
- pp.1019-1022
- /
- 2015
사회적 약자인 청각장애인들의 수화통역 서비스가 대체로 만족스럽게 제공되고 있지 않다. 또한 청각 장애인수 대비 수화통역가의 부족과 일반인과의 즉각적인 소통이 어려워 일상생활에 불편함을 느끼는 청각장애인들이 많다. 이의 문제점을 착안하여 본 연구에서는 청각장애인들이 휴대할 수 있는 수화 통역기를 개발하고자 한다. 청각장애인들의 손동작을 인식할 수 있는 3D센서 립모션(Leap-Motion)을 통해 수화를 인식한다. 립모션 센서와 안드로이드 스마트폰 및 태블릿과 연결하여 손 데이터 값을 분석했다. 분석한 손 데이터 값과 특정 지화(자음, 모음)와 간단한 인사말의 수화동작을 취할 때, 트래킹되는 데이터 값을 비교하여 수화를 인식하고 수화와 인식된 지화의 자음과 모음을 글자로 완성시켜, 텍스트와 음성으로 출력한다. 또한 립모션이 부착된 하드케이스 안에 스마트기기 탈착이 가능한 실용성 있는 수화통역기 제품 개발에 대한 연구를 목표로 하고 있다.
https://doi.org/10.3745/PKIPS.y2015m10a.1019 인용 PDF

Printed Name on ID Card recognition using a Hierachical Organized Neural Network (계층적 신경망을 이용한 주민등록증 성명인식)

서원택;조범준
- Proceedings of the Korean Information Science Society Conference
- /
- 2003.04c
- /
- pp.325-327
- /
- 2003
본 논문에서는 인쇄체 한글을 실용적으로 인식할 수 있는 계층적으로 구성한 신경망을 제안하고, 이를 이용해서 주민등록증의 성명을 인식하는데 적용하였다. 문자영상을 신경망을 이용하여 한글의 6가지 유형으로 먼저 분류한 후, 분류된 문자영상을 각 형식에 따라 자소단위로 분할해서 각 형식에 따른 신경망으로 인식하는 구조로 만들었다. 훈련용 데이터는 각 형식 별로 자소를 분리해서 얻은 영상들을 자소별 평균이미지로 만들어서 이를 조합하여 만든 글자로 사용하였다. 그래서 같은 형식의 같은 자음이라도 글자의 모양과 위치가 조금 다른것에 대해서 강인한 훈련을 할 수 있었다. 또한 입력단에서의 잡음을 줄이기 위해 히스토그램의 국부 평균을 적용하였다. 100명의 주민등록증을 컴퓨터 카메라를 이용하여 입력받아서 테스트한 결과 98.1%의 높은 인식률을 얻을 수 있었다.
PDF

The Recognition Experiment of Korean Connected Digit in the Telephone Network (전화망에서의 한국어 연속숫자음 인식 실험)

Kang Jeom-Ja;Kim Kap-kee
- Proceedings of the Acoustical Society of Korea Conference
- /
- spring
- /
- pp.167-170
- /
- 2002
본 논문에서는 전화망 환경에서의 한국어 숫자음 인식을 위한 특징 파라미터 추출, 음향 모델링 방식을 결정하기 위하여 HTK 툴을 사용한 4 연숫자음 인식실험 결과를 기술한다. 또한, 실험 결과를 토대로 빈번하게 발생하는 숫자음에 대해서 오류율을 분석하였다. 숫자 모델로는 left context biword 모델과 triword 모델을 사용하였으며, 상태수와 mixture 수를 바꾸어 인식 실험을 수행한 결과, triword 모델이 biword 모델보다 인식율이 높은 것으로 나타났으며, substitution 에러율은 " 이<->" 에서 가장 높은 에러가 발생하는 결과를 얻을 수 있다.
PDF

Neural Network design for Printed Hangul recognition using structural characteristic of Hangul (한글의 구조적 특징을 이용한 인쇄체 한글인식을 위한 신경망 설계)

서원택;조범준
- Proceedings of the Korea Multimedia Society Conference
- /
- 2003.05b
- /
- pp.588-591
- /
- 2003
본 논문에서는 한글의 구조적인 특징을 이용하여 이를 효과적으로 인식할 수 있는 신경망을 설계해보았고, 이를 이용하여 주민등록증에 있는 이름을 인식하는 시스템을 구성해 보았다. 본 시스템은 한글의 6형식에 따른 구조적인 특징을 효과적으로 구분하기 위해 형식을 구분하는 신경망을 먼저 구성하여 형식별로 분류한 뒤, 형식에 따라 자모음을 분리하여 각 형식에 따라 구성된 2차 신경망으로 입력을 하여 인식하는 구조로 설계되었다. 훈련용 데이터는 각 형식 별로 자소를 분리해서 얻은 영상들을 자소별 평균이미지로 만들어서 이를 조합하여 만든 글자로 사용하였다. 그래서 같은 형식의 같은 자음이라도 글자의 모양과 위치가 조금 다른 것에 대해서 강인한 훈련을 할 수 있었다. 또한 히스토그램의 국부 평균을 적용함으로써 잡음에 효과적으로 대응하였다. 100명의 주민등록증을 컴퓨터 카메라를 이용하여 입력 받아서 테스트한 결과 98.1％의 높은 인식률을 얻을 수 있었다.
PDF

Speech Recognition Using Noise Processing in Spectral Dimension (스펙트럴 차원의 잡음처리를 이용한 음성인식)

Lee, Gwang-seok
- Proceedings of the Korean Institute of Information and Commucation Sciences Conference
- /
- 2009.10a
- /
- pp.738-741
- /
- 2009
This research is concerned for improving the result of speech recognition under the noisy speech. We knew that spectral subtraction and recovery of valleys in spectral envelope obtained from noisy speech are more effective for the improvement of the recognition. In this research, the averaged spectral envelope obtained from vowel spectrums are used for the emphasis of valleys. The vocalic spectral information at lower frequency range is emphasized and the spectrum obtained from consonants is not changed. In simulation, the emphasis coefficients are varied on cepstral domain. This method is used for the recognition of noisy digits and is improved.
PDF

계층적 신경망을 이용한 자소인식에 기초한 Off-Line 필기체 한글인식 : 자소간 섭동체거를 위한 High-Level Constraint 회로의 설계

장주석;김명원;임채덕;송윤선
- Information and Communications Magazine
- /
- v.9 no.11
- /
- pp.34-36
- /
- 1992
여러 개의 문자(혹은 여러 개의 자소로 구성된 한개의 문자)를 인식할때에는 문자(혹은 자소) 상호간에 영향을 미쳐서 오인식이 발생할 가능성이 높다. 개개의 숫자인식에 기초한 숫자열 인식이나, 개개의 자소인식을 바탕으로한 필기체 한글인식이 그 좋은 보기일 것이다. 예를 들어 단순한 한글 '그'를 Neocognitron으로 인식한다고 생각해 보자, 조합 가능한 글자를 모두 기억시키려면 방대한 규모의 회로가 필요하므로 현실적으로 불가능하다. 따라서 기본 자소(자음 14개, 모음 10개)를 인식하도록 학습시키고 이를 바탕으로 한글을 인식하는 것이 효율적이다. 이때, 회로의 각 세포가 보는 receptive field가 유한하여 '?'의 끝 세로부분 'I'가 '?'에 영향을 미쳐서 '?'로 인식된다 즉, 자소간의 섭동에 의해 '그'가 '고'로 인식되는 것이다. 이와같은 예는 '니'가 '넉'으로, '41'이 '4H'로 인식되는 등 매우 많지만 그 해결에 대한 연구는 거의 없다. 이 논문에서는 필기체 한글 자소를 인식하는 Necognitron외에 자소간의 섭동현상을 제거하기 위한 high-level constraint 회로를 Lotka-Volterra동역학에 기초하여 설계하였다. 이로써 off-line필기체 한글인식을 보다 효과적으로 할 수 있음을 컴퓨터 시뮬레이션으로 보인다.
PDF

Search Result 106, Processing Time 0.023 seconds

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

Detail Search

Image Search (β)