• 제목/요약/키워드: Speech Recognition Technology

검색결과 527건 처리시간 0.024초

계산주의적 모델을 이용한 한국어 시각단어 재인에서 나타나는 이웃효과 (The Neighborhood Effects in Korean Word Recognition Using Computation Model)

  • 박기남;권유안;임희석;남기춘
    • 대한음성학회:학술대회논문집
    • /
    • 대한음성학회 2007년도 한국음성과학회 공동학술대회 발표논문집
    • /
    • pp.295-297
    • /
    • 2007
  • This study suggests a computational model to inquire the roles of phonological information and orthography information in the process of visual word recognition among the courses of language information processing and the representation types of the mental lexicon. As the result of the study, the computational model showed the phonological and orthographic neighborhood effect among language phenomena which are shown in Korean word recognition, and showed proofs which implies that the mental lexicon is represented as phonological information in the process of Korean word recognition.

  • PDF

거절기능을 갖는 음성인식 시스템의 시험운용 (An Experimental Field Trial of Speech Recognition System Based on Word Rejection)

  • 구명완
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1996년도 제8회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.163-170
    • /
    • 1996
  • 본 논문에서는 거절기능을 갖는 음성인식 시스템의 시험운용에 대해 소개하였다. 거절기능은 소음 단어에 의한 방식과 인식 결과를 확인하는 방식을 둘 다 병행 사용하여 구현하였다. 소음단어는 필러모델을 정의하여 구현하였으며 인식결과를 확인하기 위해서는 선형변별기를 사용하였다. 연구실에서 구축한 음성 DB로 HMM 파라미터를 추출한 후 시험운용 6개월 동안 구한 음성 DB로 실험한 결과 84.1%의 인식률을 구하였으며 이때 거절률은 0.8%였다.

  • PDF

비원어민 교수자 음성모델을 이용한 자동발음평가 시스템 (An automatic pronunciation evaluation system using non-native teacher's speech model)

  • 박혜빈;김동헌;정진우
    • 한국인터넷방송통신학회논문지
    • /
    • 제16권2호
    • /
    • pp.131-136
    • /
    • 2016
  • 외국어 학습에서 발음학습은 가장 중요한 부분 중 하나이다. 발음학습 과정은 학습자의 발음에 대해 정확한 평가와 잘못된 발음이 있을 경우 적절한 피드백을 주어 이를 개선시키는 작업을 포함한다. 숙련된 평가자의 평가는 비용에서, 비숙련 원어민들의 평가는 일관성에서 문제가 있기 때문에 이를 보완할 수 있는 자동발음평가 시스템에 대한 연구가 진행되고 있으며 자동음성인식 기술의 활용이 각광받고 있다. 본 연구에서는 자동음성인식 기술과 비원어민 교수자의 음성 모델을 기반으로 단어 수준에서 학습자의 발음 정확성과 유창성을 평가하는 시스템을 구축하였고, 이를 통해 학습자들이 자신의 발음을 정확히 평가받고 평가결과에 따라 적절한 피드백을 받을 수 있도록 하였다. 또한 시스템의 성능평가를 통해 발음 정확성과 유창성에 대한 자동평가결과가 전반적으로 학습자의 실제 영어실력을 정확히 구분한다는 것을 확인하였다.

VoiceXML을 이용한 VUI 지원 웹브라우저 개발 (Development of a Voice User Interface for Web Browser using VoiceXML)

  • 예상후;장민석
    • 한국정보과학회논문지:컴퓨팅의 실제 및 레터
    • /
    • 제11권2호
    • /
    • pp.101-111
    • /
    • 2005
  • 현재의 웹정보들은 주로 HTML로 기술되어 있으며, 이러한 정보를 얻기 위해 사용자들은 마우스와 키보드와 같은 입력장치를 사용한다. 이와 같이 기존의 GUI 환경은 인간의 가장 자연스러운 정보획득 수단의 하나인 음성을 지원하지 못하고 있다. 이러한 문제를 해결하기 위해 음성 인터페이스를 가진 여러 제품들이 개발되고 있다. 하지만 이들은 상호대화성이나 기존 웹환경을 수용한다는 측면에서 부족한 면을 가지고 있다. 본 논문에서는 현재 무르익어 가는 음성인식 기술과 XML의 파생언어인 VoiceXML을 이용하여, 기존의 인터페이스 환경을 XML 기반의 대화형 음성인터페이스 환경으로 대체하고자 한다. 이를 통해 기존의 인터페이스 환경을 수용한 VUI(Voice User Interface) 환경을 사용자에게 제공할 수 있다. 기존의 환경을 수용하기 위해 "XML Island" 기술을 이용하여 VoiceXML 문서를 HTML 문서에 포함시키며, 대표적인 정보획득화면인 메뉴, 게시판, 검색 엔진에 대한 대화형 음성 시나리오를 제안하고 있다.

한국인의 영어 문장 발음에 대한 한국인/원어민/ILT(Interactive Language Tutor) 평가 점수 사이의 상관관계 (Correlations between pronunciation test scores given by Korean/Nativel/ILT(Interactive Language Tutor) raters against the Korean-spoken English sentences)

  • 이석재;박전규
    • 대한음성학회:학술대회논문집
    • /
    • 대한음성학회 2003년도 10월 학술대회지
    • /
    • pp.83-88
    • /
    • 2003
  • This study carried out an experimental English pronunciation assessment to see the differences in the relationship between the different rater categories. The result shows that i) correlation between Korean and Native American raters is high(r=.98) enough to be considered reliable, ii) previous instructions about assessment rubric and the knowledge about English phonetics and phonology exert little influence on the rating scores, iii) correlation between the automatic ILT(Interactive Language Tutor) rating using speech recognition technology and Natives' rating is stronger than that between ILT and Koreans' rating.

  • PDF

전화망에서의 한국어 연속숫자음 인식 실험 (The Recognition Experiment of Korean Connected Digit in the Telephone Network)

  • 강점자;김갑기
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 2002년도 하계학술발표대회 논문집 제21권 1호
    • /
    • pp.167-170
    • /
    • 2002
  • 본 논문에서는 전화망 환경에서의 한국어 숫자음 인식을 위한 특징 파라미터 추출, 음향 모델링 방식을 결정하기 위하여 HTK 툴을 사용한 4 연숫자음 인식실험 결과를 기술한다. 또한, 실험 결과를 토대로 빈번하게 발생하는 숫자음에 대해서 오류율을 분석하였다. 숫자 모델로는 left context biword 모델과 triword 모델을 사용하였으며, 상태수와 mixture 수를 바꾸어 인식 실험을 수행한 결과, triword 모델이 biword 모델보다 인식율이 높은 것으로 나타났으며, substitution 에러율은 " 이<->" 에서 가장 높은 에러가 발생하는 결과를 얻을 수 있다.

  • PDF

문법성 품질 예측에 기반한 음성 인식 오류 교정 (Grammatical Quality Estimation for Error Correction in Automatic Speech Recognition)

  • 서민택;나승훈;나민수;최맹식;이충희
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2022년도 제34회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.608-612
    • /
    • 2022
  • 딥러닝의 발전 이후, 다양한 분야에서는 딥러닝을 이용해 이전에 어려웠던 작업들을 해결하여 사용자에게 편의성을 제공하고 있다. 하지만 아직 딥러닝을 통해 이상적인 서비스를 제공하는 데는 어려움이 있다. 특히, 음성 인식 작업에서 음성 양식에서 이용 방안에 대하여 다양성을 제공해주는 음성을 텍스트로 전환하는 Speech-To-Text(STT)은 문장 결과가 이상치에 달하지 못해 오류가 나타나게 된다. 본 논문에서는 STT 결과 보정을 문법 교정으로 치환하여 종단에서 올바른 토큰들을 조합하여 성능 향상을 하기 위해 각 토큰 별 품질 평가를 진행하는 모델을 한국어에서 적용하고 성능의 향상을 확인한다.

  • PDF

Back TranScription(BTS)기반 데이터 구축 검증 연구 (A Study on Verification of Back TranScription(BTS)-based Data Construction)

  • 박찬준;서재형;이설화;문현석;어수경;임희석
    • 한국융합학회논문지
    • /
    • 제12권11호
    • /
    • pp.109-117
    • /
    • 2021
  • 최근 인간과 컴퓨터의 상호작용(HCI)을 위한 수단으로 음성기반 인터페이스의 사용률이 높아지고 있다. 이에 음성인식 결과에 오류를 교정하기 위한 후처리기에 대한 관심 또한 높아지고 있다. 그러나 sequence to sequence(S2S)기반의 음성인식 후처리기를 제작하기 위해서는 데이터 구축을 위해 human-labor가 많이 소요된다. 최근 기존의 구축 방법론의 한계를 완화하기 위하여 음성인식 후처리기를 위한 새로운 데이터 구축 방법론인 Back TranScription(BTS)이 제안되었다. BTS란 TTS와 STT 기술을 결합하여 pseudo parallel corpus를 생성하는 기술을 의미한다. 해당 방법론은 전사자(phonetic transcriptor)의 역할을 없애고 방대한 양의 학습 데이터를 자동으로 생성할 수 있기에 데이터 구축에 있어서 시간과 비용을 단축할 수 있다. 본 논문은 기존의 BTS 연구를 확장하여 어떠한 기준 없이 데이터를 구축하는 것보다 어투와 도메인을 고려하여 데이터 구축을 해야함을 실험을 통해 검증을 진행하였다.

신경망을 이용한 음성인식의 안내 (Introduction to Speech Recognition using Neural Networks)

  • 정홍
    • 대한전기학회:학술대회논문집
    • /
    • 대한전기학회 1992년도 하계학술대회 논문집 A
    • /
    • pp.43-45
    • /
    • 1992
  • 한국의 HAN 인공지능(人工知能)컴퓨터과제나 일본의 NIPT나 성사를 가름할 수 있는 기술 중의 하나가 컴퓨터에 의한 음성인식(音聲認識)의 성공여부이다. 그러나 자동음성인식은 화자독립(話者獨立), 연속음성(連續音聲) 무제한(無制限) 어휘(語彙) 처리라는 세가지 난관을 아직 극복하고 있다. 현재 DTW나 HMM 시스팀은 계속 개선되고있으나 근본적으로 한계가 있다고 보인다. 이와같은 이유로 신경망을 이용한 음성인식연구가 급속히 확산되고 있다. 이와 같은 추세에 따라 본 심포지움에서는 신경망을 이용한 음성인식에 대해 소개한다.

  • PDF

음성인식에 의한 측량자료취득 모듈개발 (The Development of Data Capturing Modules by Speech-Voice Recognition)

  • 조규전;이영진;차득기
    • 한국측량학회지
    • /
    • 제18권3호
    • /
    • pp.279-285
    • /
    • 2000
  • 컴퓨터 기술의 발달과 휴먼인터페이스에 대한 인간욕구로 지능형 MMI(Man-Machine Interface)컴퓨터기술에 키보드나 다른 입력장치를 사용하지 않고 사람의 음성으로 컴퓨터를 조작하거나 필요한 명령을 수행할 수 있게 되었다. 특히 복잡한 측량작업에서 현장자료 취득과 측설작업에 음성인식기술을 응용함으로써 작업시간의 절감과 지루함을 덜 수 있다. 본 연구에서는 50,000어휘 인식소프트웨어엔진과 60어휘 인식용 고도집접회로(IC)에 의한 음성인식기술을 Total-station과 RTK-GPS와 연계하여 적용한 결과 25개 어휘만으로 실시간 Geo-Coding 및 도형처리가 가능하였다.

  • PDF