• 제목/요약/키워드: 음소

검색결과 529건 처리시간 0.027초

한국어 음소 단위 LSTM 언어모델을 이용한 문장 생성 (Korean Sentence Generation Using Phoneme-Level LSTM Language Model)

  • 안성만;정여진;이재준;양지헌
    • 지능정보연구
    • /
    • 제23권2호
    • /
    • pp.71-88
    • /
    • 2017
  • 언어모델은 순차적으로 입력된 자료를 바탕으로 다음에 나올 단어나 문자를 예측하는 모델로 언어처리나 음성인식 분야에 활용된다. 최근 딥러닝 알고리즘이 발전되면서 입력 개체 간의 의존성을 효과적으로 반영할 수 있는 순환신경망 모델과 이를 발전시킨 Long short-term memory(LSTM) 모델이 언어모델에 사용되고 있다. 이러한 모형에 자료를 입력하기 위해서는 문장을 단어 혹은 형태소로 분해하는 과정을 거친 후 단어 레벨 혹은 형태소 레벨의 모형을 사용하는 것이 일반적이다. 하지만 이러한 모형은 텍스트가 포함하는 단어나 형태소의 수가 일반적으로 매우 많기 때문에 사전 크기가 커지게 되고 이에 따라 모형의 복잡도가 증가하는 문제가 있고 사전에 포함된 어휘 외에는 생성이 불가능하다는 등의 단점이 있다. 특히 한국어와 같이 형태소 활용이 다양한 언어의 경우 형태소 분석기를 통한 분해과정에서 오류가 더해질 수 있다. 이를 보완하기 위해 본 논문에서는 문장을 자음과 모음으로 이루어진 음소 단위로 분해한 뒤 입력 데이터로 사용하는 음소 레벨의 LSTM 언어모델을 제안한다. 본 논문에서는 LSTM layer를 3개 또는 4개 포함하는 모형을 사용한다. 모형의 최적화를 위해 Stochastic Gradient 알고리즘과 이를 개선시킨 다양한 알고리즘을 사용하고 그 성능을 비교한다. 구약성경 텍스트를 사용하여 실험을 진행하였고 모든 실험은 Theano를 기반으로 하는 Keras 패키지를 사용하여 수행되었다. 모형의 정량적 비교를 위해 validation loss와 test set에 대한 perplexity를 계산하였다. 그 결과 Stochastic Gradient 알고리즘이 상대적으로 큰 validation loss와 perplexity를 나타냈고 나머지 최적화 알고리즘들은 유사한 값들을 보이며 비슷한 수준의 모형 복잡도를 나타냈다. Layer 4개인 모형이 3개인 모형에 비해 학습시간이 평균적으로 69% 정도 길게 소요되었으나 정량지표는 크게 개선되지 않거나 특정 조건에서는 오히려 악화되는 것으로 나타났다. 하지만 layer 4개를 사용한 모형이 3개를 사용한 모형에 비해 완성도가 높은 문장을 생성했다. 본 논문에서 고려한 어떤 시뮬레이션 조건에서도 한글에서 사용되지 않는 문자조합이 생성되지 않았고 명사와 조사의 조합이나 동사의 활용, 주어 동사의 결합 면에서 상당히 완성도 높은 문장이 발생되었다. 본 연구결과는 현재 대두되고 있는 인공지능 시스템의 기초가 되는 언어처리나 음성인식 분야에서 한국어 처리를 위해 다양하게 활용될 수 있을 것으로 기대된다.

한국어 인식을 위한 인식 단위와 학습 데이터 분류 방법에 대한 연구 (A Study on Recognition Units and Methods to Align Training Data for Korean Speech Recognition))

  • 황영수
    • 융합신호처리학회논문지
    • /
    • 제4권2호
    • /
    • pp.40-45
    • /
    • 2003
  • 본 연구는 한국어 분절음 인식을 위한 인식 단위 설정과 학습시 학습 데이터 분할 방법에 대한 연구이다 대용량 음성 인식을 수행할 경우, 표준 패턴의 인식 단위를 단어나 음절이 아닌 분절음 단위로 사용하여야 효율적인 음성 인식을 수행할 수 있다. 본 연구는 이와 같은 분절음 인식을 수행하기 위한 연구로서, 인식 단위 설정 변화와 학습시 학습 데이터 분할 방법에 따른 인식 결과를 미국 OGI 연구소의 speech toolkit을 이용하여 검토한다. 인식 단위에 관해서 특히 모음의 경우 철자에 기초한 음소별 인식 단위 설정과 현대어 발음에 기초한 인식 단위 설정을 비교했으며, 그 결과 발음에 기초해 몇 개의 모음을 통합한 경우가 더 우수한 결과를 보였으며, 학습 데이터 분할 방법에 따른 인식 결과는 손으로 분할한 방법이 자동 분할 방법보다 약 2-3%의 인식 향상을 보였다. 또한 인식 단위의 설정에 있어서 독립된 분절음으로 설정한 경우보다 앞, 뒤의 소리의 상황을 고려한 바이폰(bipbone)을 이용할 경우가 5.7%-25.9%의 향상된 인식 결과를 보였다 인식 방법에 있어서는 HMM 만을 이용한 방법보다 신경회로망과 HMM을 결합한 인식 방법이 6.1%-7.5%의 더 좋은 인식률을 나타내었다.

  • PDF

경계선지적기능 아동을 위한 언어기반 인지강화 기능성 게임 구현 (Implementation of Serious Games with Language-Based Cognitive Enhancement for BIF Children)

  • 류수린;박현주;정동규;백경선;윤홍옥
    • 디지털콘텐츠학회 논문지
    • /
    • 제19권6호
    • /
    • pp.1051-1060
    • /
    • 2018
  • 본 연구는 경계선지적기능 아동의 인지훈련 프로그램으로 '언어기반 인지강화 프로그램'을 제안하고, 해당 콘텐츠를 활용한 기능성 게임화의 타당성과 효과성을 보이고자 하였다. 콘텐츠는 4개 인지 영역(감각지각, 주의집중, 작업기억, 추론/지식)에 대해 4개 언어 차원(음소-단어-문장-담화)의 활동들로 구성되었으며, 그 중 16개의 언어활동 콘텐츠를 모바일 앱 게임으로 구현하여 일반아동과 BIF아동을 대상으로 시행하였다. 파일럿 테스트 결과, 두 집단의 게임 수행시간과 정확도 측정치는 지능 점수와 상관관계를 보였으며, 게임의 난이도에 따른 수행시간과 정확도의 차이를 확인함으로써 게임 구현의 타당성을 입증할 수 있었다. 또한 게임 시행 전 후 실시한 인지과제의 수행시간 변화를 통해 두 집단 모두에게서 인지강화 효과를 엿볼 수 있었다.

미등록어 거절을 이용한 오류 보정 방법 개선 시스템 (Error Correction Methode Improve System using Out-of Vocabulary Rejection)

  • 안찬식;오상엽
    • 디지털융복합연구
    • /
    • 제10권8호
    • /
    • pp.173-178
    • /
    • 2012
  • 어휘 인식을 위한 모델 생성에서 준비하지 않은 트라이폰이 생성된다. 이는 모델 파라미터의 초기 추정치를 생성하지 못하는 원인으로 어휘 모델을 구성할 수 없는 단점으로 나타난다. 결과적으로 가우시안 모델의 정교함이 떨어지게 되어 인식률을 저하시키게 된다. 이를 개선하기 위한 방법으로 미등록 어휘 거절 알고리즘을 이용한 오류 보정 시스템을 제안한다. 이 방법은 어휘 인식 모델 생성 시 등록되지 않은 어휘를 거절하여 인식률을 향상시킨다. 또한 확률 분포를 이용하여 어휘 분석과 의미를 파악하고 음운 변동이 적용되기 전의 문자열로 복원시킨다. 시스템 분석은 음소 유사율과 신뢰도를 이용하여 오류 보정율을 확인하였고 성능 평가를 위해 에러 패턴, 오류 패턴, 의미 패턴 방법을 이용하여 평가하였다. 성능 평가 결과 2.8%의 오류 보정률의 향상을 보였다.

성분분리에 의한 CELP 보코더의 피치 검색시간 단축에 관한 연구 (On a Reduction of Pitch Searching Time by Separating the Speech Components in the CELP Vocoder)

  • 현진일;변경진;한기천;김종재;유하영;김재석;김대식;배명진
    • The Journal of the Acoustical Society of Korea
    • /
    • 제14권1E호
    • /
    • pp.22-29
    • /
    • 1995
  • 부호여기된 선형예측(CELP) 음성부호화기는 4.8 kbps 이하의 낮은 전송 비율에서도 좋은 성능을 갖는다. CELP형 부호기의 단점은 많은 계산량을 필요로 한다는 것이다. 본 논문에서, 우리는 복잡성을 줄이면서 CELP 보코더의 음질을 유지하는 새로운 피치 검색법을 제안하였다. 그 기본 개념을 피치를 검색하고자하는 신호에 대해 음소 성분 분리를 통해 예비피치주기를 사전에 파악하고 이를 예비피치에 대해서만 본격적인 피치 검색을 수행하는 것이다. 제안한 방법을 CELP 보코더에 적용하므로써, 피침검색에서 기존의 방법에 대해 약 90%의 복잡성이 감소되었다.

  • PDF

오차 역전파 알고리즘을 갖는 MLP를 이용한 한국 지명 인식에 대한 연구 (A Study on the Spoken Korean Citynames Using Multi-Layered Perceptron of Back-Propagation Algorithm)

  • 송도선;이재건;김석동;이행세
    • 한국음향학회지
    • /
    • 제13권6호
    • /
    • pp.5-14
    • /
    • 1994
  • 이 논문은 오차역전달(error back-propagation) 알고리듬을 갖는 다층구조 퍼셉트런(Multi-Layered Perceptron)을 사용하여 우리말 단어음성을 화자종속으로 기계 인식하는 실험에 관한 연구 결과다. 대상단어는 시외 자동전화 지역번호표에서 임의로 선택한 50개 지역명이며, 이 중 43개는 2음절로 구성되어있고 나머지 7개는 3음절이다. 단어를 음소나 음절별로 분리(segmentation)하지 않고, 단어의 각 부분에서 골고루 추출된 특징성분을 신경망에 입력하는 방법을 사용했다. 그렇게 함으로써 발음지속시간에 관계없는 결과를 얻을 수 있으며, 이 때 사용된 특징 성분은 선형예측분석으로 구해진 PARCOR계수다. 전체학습과 구분학습의 비교, 프레임 갯수와 PARCOR차수에 대한 인식률의 의존도, 중간층 뉴런의 갯수에 대한 인식률의 변동, 그리고 출력층 뉴런의 구성 방법에 따른 비교 등 4가지 실험을 통하여 가장 최량의 조건을 찾아보고자 하였다. 이 연구를 발전시킨다면 실시간의 화자독립 소규모어휘 음성인식이 가능해질 것으로 보인다.

  • PDF

한국어 방송 음성 인식에 관한 연구 (A Study on the Korean Broadcasting Speech Recognition)

  • 김석동;송도선;이행세
    • 한국음향학회지
    • /
    • 제18권1호
    • /
    • pp.53-60
    • /
    • 1999
  • 이 논문은 한국 방송 음성 인식에 관한 연구이다. 여기서 우리는 대규모 어휘를 갖는 연속 음성 인식을 위한 방법을 제시한다. 주요 관점은 언어 모델과 탐색 방법이다. 사용된 음성 모델은 기본음소 Semi-continuous HMM이고 언어 모델은 N-gram 방법이다. 탐색 방법은 음성과 언어 정보를 최대한 활용하기 위해 3단계의 방법을 사용하였다. 첫째로, 단어의 끝 부분과 그에 관련된 정보를 만들기 위한 순방향 Viterbi Beam탐색을 하였으며, 둘째로 단어 의 시작 부분과 그에 관련된 정보를 만드는 역방향 Viterbi Beam탐색, 그리고 마지막으로 이들 두 결과와 확률적인 언어 모델을 결합하여 최종 인식결과를 얻기 위해 A/sup */ 탐색을 한다. 이 방법을 사용하여 12,000개의 단어에 대한 화자 독립으로 최고 96.0%의 단어 인식률과 99.2%의 음절 인식률을 얻었다.

  • PDF

전화음성의 격리단어인식 개선에 관한 연구 (A Study on the Improvement of Isolated Word Recognition for Telephone Speech)

  • 도삼주;은종관
    • 한국음향학회지
    • /
    • 제9권4호
    • /
    • pp.66-76
    • /
    • 1990
  • 본 논문에서는 잡음과 전화선로의 왜곡이 음성인식에 미치는 영향을 알아보고, 전처리 과정을 추가하여 이를 개선하는 방법을 제안하였다. 컴퓨터 모의실험은 음소적으로 고르게 분포되어있는 한국어 격리단어 100단어를 각각 10회 발음한 1000개 데이타를 대상으로하고, 화자종속으로 수행하였다. 먼저 잡음에 대한 개선방법으로 spectral subtraction을 제안하였는데, 이것은 매우 간단하면서도 좋은 성능을 보였다. 다음으로 대역폭제한과 전송로왜곡의 영향을 실험하였는데, 대역폭의 제한과 진폭왜곡은 인식율을 크게 떨어뜨렸으나 위상왜곡은 별로 영향이 없었다. 또, 전송로의 영향을 개선하기 위하여 training data를 사용하여 기준패턴을 변화시키는 방법을 제안하였다. 잡음과 전송로의 왜곡이 동시에 있는 경우에 인식율이 7.7~26.4% 밖에 되지 않았는데, 위에서 제안한 방법을 이용하여 76.2~92.3%로 개선되었다.

  • PDF

한국어 분절음 인식을 위한 인식 단위에 대한 연구 (A Study on Recognition Units for Korean Speech Recognition)

  • 황영수;송민석
    • 한국음향학회지
    • /
    • 제19권6호
    • /
    • pp.47-52
    • /
    • 2000
  • 본 연구는 한국어 분절음 인식을 위한 인식단위 설정에 대한 연구이다. 대용량 음성 인식을 수행할 경우, 표준 패턴의 인식 단위를 단어나 음절이 아닌 분절음 단위로 사용하여야 효율적인 음성 인식을 수행할 수 있다. 본 연구는 이와 같은 분절음 인식을 수행하기 위한 연구로서, 인식 단위 설정 변화에 따른 인식 결과를 미국 OGI 연구소의 speech toolkit을 이용하여 검토한다. 인식 단위에 관해서 특히 모음의 경우 철자에 기초한 음소별 인식단위 설정과 현대어 발음에 기초한 인식단위 설정을 비교했으며, 그 결과 발음에 기초해 몇 개의 모음을 통합한 경우가 더 우수한 결과를 보였다. 또한 인식단위의 설정에 있어서 독려된 분절음으로 설정한 경우보다 앞, 뒤의 소리의 상황을 고려한 바이폰(biphone)을 이용할 경우가 5.7%-25.9%의 향상된 인식 결과를 보였다. 인식 방법에 있어서는 HMM 만을 이용한 방법보다 신경회로망과 HMM을 결합한 인식 방법이 6.1%-7.5%의 더 좋은 인식률을 나타내었다.

  • PDF

시간 영역 파형 패턴에 기반한 한국어 모음 'ㅗ'의 음성 인식 (Speech Recognition of the Korean Vowel 'ㅗ' Based on Time Domain Waveform Patterns)

  • 이재원
    • 정보과학회 컴퓨팅의 실제 논문지
    • /
    • 제22권11호
    • /
    • pp.583-590
    • /
    • 2016
  • 최근 일상적인 인간 생활의 거의 모든 영역에서 사물 인터넷에 대한 관심이 급속히 증대되면서, 음성 인식은 중요한 HCI 수단으로 자리 잡고 있다. 더불어, 모바일 환경에서의 음성 인식 시스템에 대한 수요 또한 급속히 증대되고 있다. 모바일 환경을 위한 서버 기반의 음성 인식 시스템은 대체로 빠른 속도와 높은 인식률을 보이고 있지만, 데이터베이스에 저장되어 있는 단어를 단위로 하여 인식을 수행하므로, 인터넷이 연결되어 있어야 하고 서버에서의 많은 계산량을 필요로 한다. 본 논문은 음소 기반 한국어 음성 인식 시스템의 일부로서, 한국어 모음 'ㅗ'에 대한 새로운 인식 방식을 제안한다. 제안하는 방식은 주파수 영역에서의 분석 대신, 시간 영역에서의 파형 패턴에 기반하여 동작하므로, 계산 비용을 현저히 절감할 수 있다. 모음 'ㅗ'의 전형적인 파형 패턴들을 탐지하기 위한 요소 알고리즘들을 제시하며, 이를 결합하여 최종 판별을 수행한다. 실험 결과를 통해, 제안하는 방식이 89.9%의 인식 정확도를 달성할 수 있음을 확인하였다.