• 제목/요약/키워드: 인식비교

검색결과 6,308건 처리시간 0.043초

RVM을 이용한 음성인식기의 구현 (Implementation of Speech Recognizer using Relevance Vector Machine)

  • 김창근;고시영;허강인;이광석
    • 한국정보통신학회논문지
    • /
    • 제11권8호
    • /
    • pp.1596-1603
    • /
    • 2007
  • 본 논문에서는 음성인식 시스템을 구현함에 있어 중요한 특징 파라미터와 학습, 인식 알고리즘의 선택을 위한 제안을 하기 위하여 각각 세 가지의 방법을 조합하여 인식 실험을 수행하고 검토하였다. 두 종류의 실험을 통하여 하드웨어 장치로 구현할 경우 보다 효과적인 음성 인식 시스템을 제안한다. 첫 번째로는 특징 파라미터의 성능을 평가하기 위하여 기존의 MFCC와 MFCC를 PCA와 ICA를 이용하여 특징 공간을 변화시킨 새로운 특징 파라미터를 제안하여 총 3종류의 특징파라미터에 대한 인식 실험을 수행하였으며, 두 번째로는 학습데이터 수에 따른 HMM, SVM, RVM의 인식 성능을 실험하였다. 이상의 실험에 의하여 ICA에 의한 특징 파라미터가 특징 공간상에서의 높은 선형 분별성에 의해 MFCC와 비교하여 평균 1.5%의 성능향상을 확인할 수 있었으며 학습데이터의 감소에 따른 인식실험에서는 HMM과 비교하여 RVM에서 최고 3.25%의 성능향상을 확인하였다. 이에 근거하여 TI사의 DSP(TMS320C32)를 사용하여 음성 인식기를 구현하여 실시간으로 실험하여 시뮬레이션과 비교하였다. 이와 같은 결과로서 본 논문에서 제안하는 음성인식시스템을 위한 효과적인 방법은 ICA를 이용한 특징 파라미터를 추출하고 RVM을 이용하여 인식을 수행하는 것이라 판단한다.

신경 회로망을 이용한 영상인식

  • 이일병
    • 전기의세계
    • /
    • 제38권2호
    • /
    • pp.31-38
    • /
    • 1989
  • 신경회로망의 특성 및 영상인식에서의 사용 가능성 등에 대해 알아보고자 한다. 또한 기존의 통계적 패턴인식 방법과 비교해서 신경회로망의 이점 등을 살펴보고자 하며 영상인식 신경회로망의 핵심적인 연구인 perceptron을 중심으로 학습방법과 응용등에 대해 살펴보고자 한다. 그리고 간단하게 최근 우리나라에서 수행하고 있는 영상 인식 분야의 신경회로망 연구에 대해 살펴보고자 한다.

  • PDF

강건한 한국어 연속음성인식을 위한 유사음소단일에 대한 연구 (A Study on PLU (Phone-Likely Unit) for Korean Continuous Speech Recognition)

  • 서준배;김주곤;김민정;정호열;정현열
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 2004년도 춘계학술발표대회 논문집 제23권 1호
    • /
    • pp.37-40
    • /
    • 2004
  • 본 논문은 한국어 연속음성인식에 효율적인 문맥의존 음향모델 수에 대한 연구로써 유사음소단위 수에 따른 인식 성능을 비교, 평가하였다. 기존에 본연구실에서는 48음소를 기본인식단위로 이용하고 있으나 연속음성인식의 경우 문맥종속모델이 사용되고 문맥종속모델은 변이 음을 고려한 음소가 이미 포함되어 있어 이를 고려하면 기본 음소를 줄이므로서 계산량의 감소와 인식 성능 향상을 기대할 수 있을 것으로 생각된다. 따라서 , 본 논문에서는 기존의 48음소와 이를 39음소로 줄여 인식실험에 사용하여 그 성능을 비교 평가하기로 하였다. 이를 위하여 다양한 태스크의 데이터베이스를 통합하여 부족한 문맥요소들을 확장한 후 인식실험을 수행하였다. 실험결과 변이음의 개수를 줄이면서도 인식 성능저하가 없음을 확인할 수 있었으며 연속 음성의 경우 39음소를 이용한 경우가 $10\%$정도의 향상된 인식성능을 얻을 수 있음을 확인할 수 있었다.

  • PDF

Fisherface 알고리즘과 Elastic Graph Matching을 이용한 얼굴 인식

  • 이형지;이완수;정재호
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 2000년도 제13회 신호처리 합동 학술대회 논문집
    • /
    • pp.869-872
    • /
    • 2000
  • 본 논문에서는 K-L 변환을 기반으로 한 Fisherface 알고리즘과 Elastic Graph Matching 방법을 사용하여 보다 효율적인 얼굴 인식 방법을 제안하고자 한다. 즉, 얼굴의 모양 정보뿐만 아니라, 영상 픽셀의 그레이 정보를 동시에 이용할 수 있는 Elastic Graph Matching 방법과 통계학적으로 신호의 차원을 줄일 뿐만 아니라 주위 환경의 변화에 강인한 Fisherface 알고리즘을 효율적으로 결합하고자 한다 본 연구에서는 얼굴을 인식하는 데에 있어서 주로 문제가 되는 광원의 위치에 따른 조도의 변화, 얼굴 표정 변화, 안경 착용 여부 등을 고려한 Yale대학 데이터베이스에 대해 기존의 여러 얼굴 인식알고리즘을 실험 및 비교하였다. 또한, 이들을 효율적으로 결합할 수 있는 인식 알고리즘을 제안함으로써 인식률 및 속도 면에서 비교적 만족할 만한 결과를 얻을 수 있었다.

  • PDF

불변 모멘트를 이용한 DSTW 기반의 동적 손동작 인식 방법 (Recognition of Dynamic Hand Gestures based on DSTW using Invariant Moments)

  • 지재영;장경현;박기태;문영식
    • 한국방송∙미디어공학회:학술대회논문집
    • /
    • 한국방송공학회 2009년도 추계학술대회
    • /
    • pp.273-276
    • /
    • 2009
  • 본 논문에서는 Dynamic Space Time Warping(DSTW) 알고리즘을 이용하여 손동작을 다양한 배경에서도 정확하게 인식할 수 있는 방법을 제안한다. DSTW 알고리즘을 이용한 기존의 손동작 인식 방법은 질의영상의 매 프레임 마다 검출된 다수의 손 후보영역을 사용하여 모델영상과 시간 축 상으로 비교하는 방법이다. 그러나 기존의 DSTW 알고리즘을 이용한 손동작 인식 방법은 손을 포함하지 않은 후보영역들(배경, 팔꿈치 등)에 의해 오인식될 수 있는 경로를 생성하며, 그 결과로 사용자가 의도하지 않은 손동작으로 인식될 수 있다. 이러한 단점을 해결하기 위해서, 본 논문에서는 손 후보영역의 불변 모멘트를 이용하여 질감 정보를 추출한 후 후보영역들 사이의 유사도를 비교하였다. 제안한 방법은 유사도를 모델과 질의의 매칭비용에 가중치로 적용하였고, 다양한 실험 결과 제안한 방법이 기존의 방법에 비해 사용자의 손동작을 정확하게 인식하는 것을 확인하였다.

  • PDF

Windows환경에서 음성인식을 이용한 멀티미디어 게임의 구현 (An Implementation of Multimedia Game using Speech Recognition for Windows)

  • 윤재선
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1998년도 학술발표대회 논문집 제17권 2호
    • /
    • pp.335-338
    • /
    • 1998
  • 본 논문에서는 음성인식 알고리즘인 HMM을 사용하여 Windows 환경에서 온라인으로 사용할 수 있는 음성인식 게임“Voice Illust Magic”개발에 관하여 소개한다. 사용자와 컴퓨터가 상호작용(Interaction)할 수 있는 매체를 마우스와 키보드뿐만 아니라 게임에 필요한 명령어를 음성인식으로 실행함으로써 정보전달이 매우 효과적으로 이루어져 사용자가 접근하기 쉽고 편리하게 되었으며 의사전달 효율을 높일 수 있었다. 음성인식 과정을 온라인으로 마이크를 통해 들어온 음성을 자동으로 끝점을 검출한 후, Mel-Cepstrum을 추출하여 Word 단위의 reference HMM과 비교하여 최적의 model이 선택되면, 윈도우즈에게 메시지를 보내어 마우스나 키보드가 동작하는 것과 마찬가지로 실행되도록 하였다. 또한, 입력 음성을 모든 reference pattern과 비교하는 것이 아니라 그 상황에 적용될 수 있는 표준 패턴을 한정함으로써 탐색시간을 줄일 수 있었으며 높은 인식률을 나타내었다.

  • PDF

Face Recognition Grand Challenge (FRGC) 및 조명 변화에 강인한 얼굴 인식 기술 개발 동향

  • 황원준;김준모
    • 전자공학회지
    • /
    • 제39권2호
    • /
    • pp.36-44
    • /
    • 2012
  • 본 논문에서는 최근 얼굴 인식 평가에 많이 사용된 FRGC Ver 2.0 DB와 그 프로토콜을 간략히 소개하고 이를 이용한 다양한 얼굴 인식 방법 및 그 개발 동향에 대해서 살펴보고자 한다. FRGC는 객관적인 2D/3D 얼굴 인식 알고리즘 성능 평가를 위해서 공개되었는데, 본 논문에서는 2D 정면 얼굴 인식에 대한 내용을 위주로 기술하고자 한다. FRGC의 2D 얼굴 인식 DB는 주로 조명의 Control 유무에 따른 성능 비교를 위한 평가 프로토콜을 제안하고 있다. 이에 2004년부터 최근까지 10개 이상의 알고리즘이 발표되었고, 본 논문에서는 중요한 11개의 알고리즘을 살펴보고자 한다. 또한 이들 알고리즘에서 핵심적으로 사용되는 특징 추출 알고리즘을 살펴보고 마지막으로 각 알고리즘의 FRGC DB에서의 성능을 비교 평가하고자 한다.

  • PDF

Sparse Representation 기반의 인간행동인식에 대한 지역특징과 전역특징 비교 (Comparison of Local and Global Features for Sparse Representation-based Human Action Recognition)

  • 황정현;민현석;노용만
    • 한국방송∙미디어공학회:학술대회논문집
    • /
    • 한국방송공학회 2013년도 추계학술대회
    • /
    • pp.246-247
    • /
    • 2013
  • 인간행동의 자동인식 기술은 영상보안 및 인간-사물 상호작용 분야에 핵심적 기술이다. 그러나 실제 비디오 환경에서는 인간 행동의 다양성 및 잡음 등 많은 제한점들로 인해 효과적인 행동인식에 어려움이 있다. 최근 이러한 문제점을 해결하기 위하여 많은 영상 처리 및 인식 분야에서 연구되고 있는 sparse representation 기반의 방법들이 제시되고 있다. 이에 본 논문에서는 효과적으로 sparse representation을 행동인식에 적용하고, sparse representation 기반 인간행동인식을 위해 사용되는 지역특징 및 전역특징에 대하여 비교했다.

  • PDF

문장 거부를 위한 음소기반 인식 네트워크에서의 필러 모델 비율과 단어 검출률의 성능비교 (Performance Comparison of Filler Models and Word Spotting Ratio for Sentence Rejection in Phoneme-based Recognition Networks)

  • 김형태;이병혁;하진영
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2005년도 한국컴퓨터종합학술대회 논문집 Vol.32 No.1 (B)
    • /
    • pp.856-858
    • /
    • 2005
  • 음성인식 시스템에서 입력된 음성 데이터에 대해 비인식 대상을 거부하는 기능은 신뢰도 보장 측면에 있어서 상당히 중요하며, 신뢰도를 높이기 위해서는 단순한 인식기능 외에 부적절한 입력 패턴의 거부 기능이 필요하다. 본 논문에서는 이러한 신뢰성 문제를 해결하기 위하여 음소기반 인식 네트워크에서 필러 모델 방법과 단어 검출률 방법을 사용하여 실험하였고, 문장의 단어 수에 따른 두 방법의 문장 거부 성능을 FAR과 FRR의 평균을 최소화 하는 값을 각각 구함으로써 비교${\cdot}$분석 하였다. 그 결과 필러모델 방법이 좀 더 나은 거부 성능을 보였고, 단어 검출률을 이용하는 방법이 인식 네트워크를 전부 거치지 않아도 되므로 실행속도와 메모리 절약에서 효과적이었다.

  • PDF

한국어 음가/ 한글 표기 변환을 위한 표준 규칙 제정 (Establishment of the ′Standard Hangul Phoneme into Character Conversion Rule′)

  • 이계영;임재걸
    • 한국멀티미디어학회:학술대회논문집
    • /
    • 한국멀티미디어학회 2002년도 춘계학술발표논문집(상)
    • /
    • pp.128-132
    • /
    • 2002
  • 한글 표기를 음가로 변환하는 규칙을 역으로 적용하여 음가를 한글 표기로 전환시키는 표준 규칙을 고안하는 것이 본 연구의 목표다. 이러한 표준 규칙은 음성인식에 반드시 필요한 귀중한 자료가 된다. 음성 인식은 표준으로 기록된 음성의 패턴과 입력을 비교하여 가장 유사한 패턴을 찾는 방법을 사용한다. 이때 표준 음성 패턴이 띄어쓰기 단위라면 수백만 개의 표준 패턴이 수록되어야 한다. 이렇게 하면 표준 패턴을 위한 데이터베이스도 너무 커지고 비교회수도 너무 많아져서 실용화가 불가능하다. 그래서, 음절단위로 인식하는 것이 바람직하다. 음절단위로 인식하면 인식된 음가가 한글 표기 문법에 맞지 않으므로, 인식 결과를 출력할 때에는 음가를 그대로 출력하는 것이 아니라 한글표기로 변환하여 표기해야 한다 이때, 본 연구의 연구 결과인 표준규칙을 사용한다.

  • PDF