Search | Korea Science

Implementation of Speech Recognizer using Relevance Vector Machine (RVM을 이용한 음성인식기의 구현)

Kim, Chang-Keun;Koh, Si-Young;Hur, Kang-In;Lee, Kwang-Seok
- Journal of the Korea Institute of Information and Communication Engineering
- /
- v.11 no.8
- /
- pp.1596-1603
- /
- 2007
In this paper, we experimented by three kind of method for feature parameter, training method and recognition algorithm of most suitable for speech recognition system and considered. We decided speech recognition system of most suitable through two kind of experiment after we make speech recognizer. First, we did an experiment about three kind of feature parameter to evaluate recognition performance of it in speech recognizer using existent MFCC and MFCC new feature parameter that change characteristic space using PCA and ICA. Second, we experimented recognition performance or HMM, SVM and RVM by studying data number. By an experiment until now, feature parameter by ICA showed performance improvement of average 1.5% than MFCC by high linear discrimination from characteristic space. RVM showed performance improvement of maximum 3.25% than HMM in an experiment by decrease of studying data. As such result, effective method for speech recognition system to propose in this paper derives feature parameters using ICA and un recognition using RVM.
https://doi.org/10.6109/jkiice.2007.11.8.1596 인용 PDF KSCI

신경 회로망을 이용한 영상인식

이일병
- 전기의세계
- /
- v.38 no.2
- /
- pp.31-38
- /
- 1989
신경회로망의 특성 및 영상인식에서의 사용 가능성 등에 대해 알아보고자 한다. 또한 기존의 통계적 패턴인식 방법과 비교해서 신경회로망의 이점 등을 살펴보고자 하며 영상인식 신경회로망의 핵심적인 연구인 perceptron을 중심으로 학습방법과 응용등에 대해 살펴보고자 한다. 그리고 간단하게 최근 우리나라에서 수행하고 있는 영상 인식 분야의 신경회로망 연구에 대해 살펴보고자 한다.
PDF

A Study on PLU (Phone-Likely Unit) for Korean Continuous Speech Recognition (강건한 한국어 연속음성인식을 위한 유사음소단일에 대한 연구)

Seo Jun-Bae;Kim Joo-Gon;Kim Min-Jung;Jung Ho-Youl;Chung Hyun-Yeol
- Proceedings of the Acoustical Society of Korea Conference
- /
- spring
- /
- pp.37-40
- /
- 2004
본 논문은 한국어 연속음성인식에 효율적인 문맥의존 음향모델 수에 대한 연구로써 유사음소단위 수에 따른 인식 성능을 비교, 평가하였다. 기존에 본연구실에서는 48음소를 기본인식단위로 이용하고 있으나 연속음성인식의 경우 문맥종속모델이 사용되고 문맥종속모델은 변이 음을 고려한 음소가 이미 포함되어 있어 이를 고려하면 기본 음소를 줄이므로서 계산량의 감소와 인식 성능 향상을 기대할 수 있을 것으로 생각된다. 따라서 , 본 논문에서는 기존의 48음소와 이를 39음소로 줄여 인식실험에 사용하여 그 성능을 비교 평가하기로 하였다. 이를 위하여 다양한 태스크의 데이터베이스를 통합하여 부족한 문맥요소들을 확장한 후 인식실험을 수행하였다. 실험결과 변이음의 개수를 줄이면서도 인식 성능저하가 없음을 확인할 수 있었으며 연속 음성의 경우 39음소를 이용한 경우가 $10\%$정도의 향상된 인식성능을 얻을 수 있음을 확인할 수 있었다.
PDF

Fisherface 알고리즘과 Elastic Graph Matching을 이용한 얼굴 인식

이형지;이완수;정재호
- Proceedings of the IEEK Conference
- /
- 2000.09a
- /
- pp.869-872
- /
- 2000
본 논문에서는 K-L 변환을 기반으로 한 Fisherface 알고리즘과 Elastic Graph Matching 방법을 사용하여 보다 효율적인 얼굴 인식 방법을 제안하고자 한다. 즉, 얼굴의 모양 정보뿐만 아니라, 영상 픽셀의 그레이 정보를 동시에 이용할 수 있는 Elastic Graph Matching 방법과 통계학적으로 신호의 차원을 줄일 뿐만 아니라 주위 환경의 변화에 강인한 Fisherface 알고리즘을 효율적으로 결합하고자 한다 본 연구에서는 얼굴을 인식하는 데에 있어서 주로 문제가 되는 광원의 위치에 따른 조도의 변화, 얼굴 표정 변화, 안경 착용 여부 등을 고려한 Yale대학 데이터베이스에 대해 기존의 여러 얼굴 인식알고리즘을 실험 및 비교하였다. 또한, 이들을 효율적으로 결합할 수 있는 인식 알고리즘을 제안함으로써 인식률 및 속도 면에서 비교적 만족할 만한 결과를 얻을 수 있었다.
PDF

Recognition of Dynamic Hand Gestures based on DSTW using Invariant Moments (불변 모멘트를 이용한 DSTW 기반의 동적 손동작 인식 방법)

Ji, Jae-Young;Jang, Kyung-Hyun;Park, Ki-Tae;Moon, Young-Shik
- Proceedings of the Korean Society of Broadcast Engineers Conference
- /
- 2009.11a
- /
- pp.273-276
- /
- 2009
본 논문에서는 Dynamic Space Time Warping(DSTW) 알고리즘을 이용하여 손동작을 다양한 배경에서도 정확하게 인식할 수 있는 방법을 제안한다. DSTW 알고리즘을 이용한 기존의 손동작 인식 방법은 질의영상의 매 프레임 마다 검출된 다수의 손 후보영역을 사용하여 모델영상과 시간 축 상으로 비교하는 방법이다. 그러나 기존의 DSTW 알고리즘을 이용한 손동작 인식 방법은 손을 포함하지 않은 후보영역들(배경, 팔꿈치 등)에 의해 오인식될 수 있는 경로를 생성하며, 그 결과로 사용자가 의도하지 않은 손동작으로 인식될 수 있다. 이러한 단점을 해결하기 위해서, 본 논문에서는 손 후보영역의 불변 모멘트를 이용하여 질감 정보를 추출한 후 후보영역들 사이의 유사도를 비교하였다. 제안한 방법은 유사도를 모델과 질의의 매칭비용에 가중치로 적용하였고, 다양한 실험 결과 제안한 방법이 기존의 방법에 비해 사용자의 손동작을 정확하게 인식하는 것을 확인하였다.
PDF

An Implementation of Multimedia Game using Speech Recognition for Windows (Windows환경에서 음성인식을 이용한 멀티미디어 게임의 구현)

윤재선
- Proceedings of the Acoustical Society of Korea Conference
- /
- 1998.06e
- /
- pp.335-338
- /
- 1998
본 논문에서는 음성인식 알고리즘인 HMM을 사용하여 Windows 환경에서 온라인으로 사용할 수 있는 음성인식 게임“Voice Illust Magic”개발에 관하여 소개한다. 사용자와 컴퓨터가 상호작용(Interaction)할 수 있는 매체를 마우스와 키보드뿐만 아니라 게임에 필요한 명령어를 음성인식으로 실행함으로써 정보전달이 매우 효과적으로 이루어져 사용자가 접근하기 쉽고 편리하게 되었으며 의사전달 효율을 높일 수 있었다. 음성인식 과정을 온라인으로 마이크를 통해 들어온 음성을 자동으로 끝점을 검출한 후, Mel-Cepstrum을 추출하여 Word 단위의 reference HMM과 비교하여 최적의 model이 선택되면, 윈도우즈에게 메시지를 보내어 마우스나 키보드가 동작하는 것과 마찬가지로 실행되도록 하였다. 또한, 입력 음성을 모든 reference pattern과 비교하는 것이 아니라 그 상황에 적용될 수 있는 표준 패턴을 한정함으로써 탐색시간을 줄일 수 있었으며 높은 인식률을 나타내었다.
PDF

Face Recognition Grand Challenge (FRGC) 및 조명 변화에 강인한 얼굴 인식 기술 개발 동향

Hwang, Won-Jun;Kim, Jun-Mo
- The Magazine of the IEIE
- /
- v.39 no.2
- /
- pp.36-44
- /
- 2012
본 논문에서는 최근 얼굴 인식 평가에 많이 사용된 FRGC Ver 2.0 DB와 그 프로토콜을 간략히 소개하고 이를 이용한 다양한 얼굴 인식 방법 및 그 개발 동향에 대해서 살펴보고자 한다. FRGC는 객관적인 2D/3D 얼굴 인식 알고리즘 성능 평가를 위해서 공개되었는데, 본 논문에서는 2D 정면 얼굴 인식에 대한 내용을 위주로 기술하고자 한다. FRGC의 2D 얼굴 인식 DB는 주로 조명의 Control 유무에 따른 성능 비교를 위한 평가 프로토콜을 제안하고 있다. 이에 2004년부터 최근까지 10개 이상의 알고리즘이 발표되었고, 본 논문에서는 중요한 11개의 알고리즘을 살펴보고자 한다. 또한 이들 알고리즘에서 핵심적으로 사용되는 특징 추출 알고리즘을 살펴보고 마지막으로 각 알고리즘의 FRGC DB에서의 성능을 비교 평가하고자 한다.
PDF

Comparison of Local and Global Features for Sparse Representation-based Human Action Recognition (Sparse Representation 기반의 인간행동인식에 대한 지역특징과 전역특징 비교)

Hwang, Jung-Hyon;Min, Hyun-seok;Ro, Yong Man
- Proceedings of the Korean Society of Broadcast Engineers Conference
- /
- 2013.11a
- /
- pp.246-247
- /
- 2013
인간행동의 자동인식 기술은 영상보안 및 인간-사물 상호작용 분야에 핵심적 기술이다. 그러나 실제 비디오 환경에서는 인간 행동의 다양성 및 잡음 등 많은 제한점들로 인해 효과적인 행동인식에 어려움이 있다. 최근 이러한 문제점을 해결하기 위하여 많은 영상 처리 및 인식 분야에서 연구되고 있는 sparse representation 기반의 방법들이 제시되고 있다. 이에 본 논문에서는 효과적으로 sparse representation을 행동인식에 적용하고, sparse representation 기반 인간행동인식을 위해 사용되는 지역특징 및 전역특징에 대하여 비교했다.
PDF

Performance Comparison of Filler Models and Word Spotting Ratio for Sentence Rejection in Phoneme-based Recognition Networks (문장 거부를 위한 음소기반 인식 네트워크에서의 필러 모델 비율과 단어 검출률의 성능비교)

Kim Hyung-Tai;Lee Byung-Hyuk;Ha Jin-Young
- Proceedings of the Korean Information Science Society Conference
- /
- 2005.07b
- /
- pp.856-858
- /
- 2005
음성인식 시스템에서 입력된 음성 데이터에 대해 비인식 대상을 거부하는 기능은 신뢰도 보장 측면에 있어서 상당히 중요하며, 신뢰도를 높이기 위해서는 단순한 인식기능 외에 부적절한 입력 패턴의 거부 기능이 필요하다. 본 논문에서는 이러한 신뢰성 문제를 해결하기 위하여 음소기반 인식 네트워크에서 필러 모델 방법과 단어 검출률 방법을 사용하여 실험하였고, 문장의 단어 수에 따른 두 방법의 문장 거부 성능을 FAR과 FRR의 평균을 최소화 하는 값을 각각 구함으로써 비교${\cdot}$분석 하였다. 그 결과 필러모델 방법이 좀 더 나은 거부 성능을 보였고, 단어 검출률을 이용하는 방법이 인식 네트워크를 전부 거치지 않아도 되므로 실행속도와 메모리 절약에서 효과적이었다.
PDF

Establishment of the ′Standard Hangul Phoneme into Character Conversion Rule′ (한국어 음가/ 한글 표기 변환을 위한 표준 규칙 제정)

이계영;임재걸
- Proceedings of the Korea Multimedia Society Conference
- /
- 2002.05c
- /
- pp.128-132
- /
- 2002
한글 표기를 음가로 변환하는 규칙을 역으로 적용하여 음가를 한글 표기로 전환시키는 표준 규칙을 고안하는 것이 본 연구의 목표다. 이러한 표준 규칙은 음성인식에 반드시 필요한 귀중한 자료가 된다. 음성 인식은 표준으로 기록된 음성의 패턴과 입력을 비교하여 가장 유사한 패턴을 찾는 방법을 사용한다. 이때 표준 음성 패턴이 띄어쓰기 단위라면 수백만 개의 표준 패턴이 수록되어야 한다. 이렇게 하면 표준 패턴을 위한 데이터베이스도 너무 커지고 비교회수도 너무 많아져서 실용화가 불가능하다. 그래서, 음절단위로 인식하는 것이 바람직하다. 음절단위로 인식하면 인식된 음가가 한글 표기 문법에 맞지 않으므로, 인식 결과를 출력할 때에는 음가를 그대로 출력하는 것이 아니라 한글표기로 변환하여 표기해야 한다 이때, 본 연구의 연구 결과인 표준규칙을 사용한다.
PDF

Search Result 6,315, Processing Time 0.031 seconds

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

Detail Search

Image Search (β)