• 제목/요약/키워드: vocabulary database

검색결과 53건 처리시간 0.03초

대용량 한국어 연속음성인식 시스템 개발 (On the Development of a Large-Vocabulary Continuous Speech Recognition System for the Korean Language)

  • 최인정;권오욱;박종렬;박용규;김도영;정호영;은종관
    • 한국음향학회지
    • /
    • 제14권5호
    • /
    • pp.44-50
    • /
    • 1995
  • 본 논문에서는 연속분포 HMM을 이용한 대용량 한국어 연속음성인식 시스템에 관하여 기술한다. 인식 시스템의 성능을 개선하기 위하여 음성 모델링 단위의 선정, 단어간 모델링, 탐색 알고리듬, 문법에 관하여 연구하였다. 기본 인식단위로 트라이존을 사용하며 학습성을 개선하고 기능어에서의 에러 발생을 줄이기 위하여 일반화된 트라이폰과 function word-de-pendent phone을 사용한다. 단어 사이에는 묵음 모델과 null transition을 사용하여 선택적으로 묵음을 추가하였다. 언어모델로는 단어 클래스에 근거한 word pair 문법과 bigram 모델이 이용된다. 또한 지식 정보들을 효율적으로 활용할 수 있도록 N개의 후보 문장들을 탐색할 수 있는 알고리듬을 구현하였다. 후처리기에서는 word triple문법을 사용하여 N개의 최적 문장을 재정렬하여 최종적인 인식 문장을 결정하며, 마지막으로 후치사와 관련된 사소한 에러들을 수정한다. 3천단어의 연속음성 데이타베이스에 대한 인식실험에서, 후처리로 word triple 문법을 사용하여 $93.1\%$의 단어 인식률과 $73.8\%$의 문장 인식률을 얻었다.

  • PDF

고립단어 인식 시스템에서의 거절기능 구현 (An Implementation of Rejection Capabilities in the Isolated Word Recognition System)

  • 김동화;김형순;김영호
    • 한국음향학회지
    • /
    • 제16권6호
    • /
    • pp.106-109
    • /
    • 1997
  • 고립단어 음성인식 시스템이 실용적이 되려면 인식 대상 이외의 단어를 거절할 수 있는 기능이 요구된다. 본 논문에서는 집단화된 음소 모델과 likelihood ratio에 의한 후처리 방법을 사용하여 거절기능을 구현하는 방법을 제안하였다. 기본적인 음성인식 시스템은 단어 단위 연속 HMM을 사용하였고, 6개의 집단화된 음소 모델들은 음성학적으로 균형잡힌 음성 데이터베이스를 이용하여 훈련된 45개의 문맥독립 음소 모델들로부터 통계적 방법에 의하여 생성되었다. 22개의 부서 명칭을 대상으로 한 화자독립 고립단어 인식시스템에서 거절성능을 시험하여 본 결과, 가장 높은 확률값과 두 번째 높은 확률값을 가지는 후보단어들 간의 차이값에 의하여 거절기능을 수행하는 기존의 후처리 방법보다 성능이 향상됨을 알 수 있었다. 또한 이 집단화된 음소모델은 인식 대상 어휘가 다른 고립단어 인식 시스템에도 재훈련 없이 그대로 사용될 수 있다.

  • PDF

해외 데이터베이스의 통제키워드에 기초한 국내 학술지 논문의 자동분류 성능 향상에 관한 실험적 연구 (An Experimental Study on the Performance Improvement of Automatic Classification for the Articles of Korean Journals Based on Controlled Keywords in International Database)

  • 김판준;이재윤
    • 한국문헌정보학회지
    • /
    • 제48권3호
    • /
    • pp.491-510
    • /
    • 2014
  • 학술지 논문의 효율적인 관리 및 검색을 위한 주요 요소인 키워드는 통제키워드와 비통제키워드로 구분할 수 있다. 그러나 현재 국내 데이터베이스에서 대부분의 학술지 논문에는 비통제키워드인 저자키워드만이 부여되어 있을 뿐, 망라적인 탐색을 돕는 통제키워드로서 디스크립터는 제공되지 않고 있다. 이 연구에서는 해외 데이터베이스의 학술지 논문에 부여된 통제키워드를 학습한 분류기를 사용하여, 국내 학술지 논문에 디스크립터를 자동 할당하는 실험을 수행하였다. 그 결과, 국외 데이터베이스의 디스크립터 학습을 통해 영문 초록이 있는 국내 학술지 논문에 통제키워드를 자동 할당할 수 있는 가능성을 확인하였다. 또한, 다양한 분류기 및 분류기 결합을 통하여 이러한 디스크립터 자동 할당의 성능 향상을 모색하였다.

KONG-DB: 웹 상의 어휘 사전을 활용한 한국 소설 지명 DB, 검색 및 시각화 시스템 (KONG-DB: Korean Novel Geo-name DB & Search and Visualization System Using Dictionary from the Web)

  • 박성희
    • 정보관리학회지
    • /
    • 제33권3호
    • /
    • pp.321-343
    • /
    • 2016
  • 본 연구의 목적은 1) 소설 속 지명 데이터베이스(DB)를 구축하고, 2) 확장 가능한 지명 DB를 위해 자동으로 지명을 추출하여 데이터베이스를 갱신하며, 3) 데이터베이스 내의 소설지명과 용례를 검색하고 시각화하는 파일럿시스템을 구현하는 데 있다. 특히, 학습자료(training)에 해당하는 말뭉치(corpus)를 확보하기 어려운, 소설지명과 같이 현재 잘 쓰이지 않는 개체명을 자동으로 추출하는 것은 매우 어려운 문제이다. 효과적인 지명 정보 추출용 학습자료 말뭉치 확보 문제를 해결하기 위해 본 논문에서는 이미 수작업으로 구축된 웹 지식(어휘사전)을 활용하여 학습에 필요한 충분한 양의 학습말뭉치를 확보하는 방안을 적용하였다. 이렇게 확보된 학습용 코퍼스와 학습된 자동추출 모듈을 가지고, 새로운 지명 용례를 찾아 추가하는 지명 데이터베이스 확장 도구를 만들었으며, 소설지명을 지도 위에 시각화하는 시스템을 설계하였다. 또한, 시범시스템을 구현함으로써 실험적으로 그 타당성을 입증하였다. 끝으로, 현재 시스템의 보완점을 제시하였다.

임상문서표준규격내 검사실 용어의 LOINC 매핑을 위한 LMOF 전처리 도구 (The LMOF Preprocessing Tool for Mapping Laboratory Vocabulary to LOINC in Clinical Document Architecture)

  • 도형호;김일곤;이성기;곽연식
    • 한국정보과학회논문지:시스템및이론
    • /
    • 제35권4호
    • /
    • pp.158-165
    • /
    • 2008
  • LOINC(Logical Observation Identifiers Names and Codes)는 Regenstrief Institute에서 제공하는 병원 검사 명칭 및 임상용어를 위한 표준체계이다. 평생전자건강진료정보에서 검사결과의 교류는 매우 중요한 영역 중 하나이며, 이를 위해서는 현재 각 병원의 표준화되지 않은 검사 명칭을 표준화하는 일이 시급하다. 본 논문에서는 병원의 로컬데이타베이스를 Regenstrief에서 제공하는 LOINC 검색 매핑도구인 RELMA(Regenstrief LOINC Mapping Assistant)가 요구하는 LMOF(Local Master Observation File) 포맷으로 미리 전처리 해주는 도구를 개발함으로써, LOINC 매핑작업을 보다 효율적으로 할 수 있는 해결책을 제시한다. 제안한 도구를 이용하여 로컬데이타베이스를 전처리 한 후 RELMA로 검색하였을 때, 인터페이스 측면에서 기존 전처리하지 않고 RELMA를 사용한 방법에 비해서 사용자의 편의성이 향상되었고 검색되는 키워드가 15% 감소하는 검색의 효율성을 가져올 수 있었다.

중소기업의 효율적 데이터 품질관리를 위한 스크럼 기반 표준관리 방안 : 'I'사 물류서비스 적용 사례 (Investigation on the Scrum-based Standard Management for Efficient Data Quality Control of Small-sized Companies : A Case Study on Distribution Service of Company 'I')

  • 김태윤;김남규;손용락
    • Journal of Information Technology Applications and Management
    • /
    • 제17권1호
    • /
    • pp.83-105
    • /
    • 2010
  • The competence of enterprise for managing information is evaluated not by the amount of information but by the quality of information such as response time, data consistency, and data correctness. The degradation of data quality is usually caused by the inappropriate process of managing the structure and value of stored data. According to the recent survey on the actual condition of data quality management, the correctness and consistency of data appeared to be the most problematic area among the six criteria of data quality management such as correctness, consistency, availability, timeliness, accessibility, and security. Moreover, the problem was more serious in case of small and medium-sized companies than large enterprises. In this paper, therefore, we attempt to propose a new data quality control methodology for small and medium-sized companies that can improve the correctness and consistency of data without consuming too much time and cost. To adopt the proposed methodology to real application immediately, we provided some scripts for as-is analysis and devised automation tools for managing naming rules of vocabulary, terminology, and data code. Additionally, we performed case study on the distribution service of a small-sized company to estimate the applicability of our tool and methodology.

  • PDF

IMGT Unique Numbering for Standardized Contact Analysis of Immunoglobulin/antigen and T cell receptor/peptide/MHC Complexes

  • Kaas, Quentin;Chiche, Laurent;Lefrane, Marie-Paule
    • 한국생물정보학회:학술대회논문집
    • /
    • 한국생물정보시스템생물학회 2005년도 BIOINFO 2005
    • /
    • pp.209-214
    • /
    • 2005
  • Immunoglobulins (IG) , T cell receptors (TR) and major histocompatibility complex (MHC) are major components of the immune system. Their experimentally determined three-dimensional (3D) structures are numerous and their retrieval and comparison is problematic. IMGT, the international ImMunoGeneTics information system$^{\circledR}$(http://imgt.cines.fr), has devised controlled vocabulary and annotation rules for the sequences and 3D structures of the IG TR and MHC. Annotated data from IMGT/3D sructure-DB, the IMGT 3D structure database, are used in this paper to compare 3D structure of the domains and receptor, and to characterize IG/antigen, peptide/MHC and TR/peptide/MHC interfaces. The analysis includes angle measures to assess receptor flexibility, structural superimposition and contact analysis. Up-to-date data and analysis results are available at the IMGT Web site, http://imgt.cines.fr.

  • PDF

바타챠랴 거리 측정 기법을 사용한 가우시안 모델 기반 음소 인식 향상 (Improving Phoneme Recognition based on Gaussian Model using Bhattacharyya Distance Measurement Method)

  • 오상엽
    • 한국멀티미디어학회논문지
    • /
    • 제14권1호
    • /
    • pp.85-93
    • /
    • 2011
  • 기존의 어휘 인식에서는 일반적인 벡터 값을 데이터베이스를 이용하여 구하므로 탐색 중에 형성되는 음소를 처리하지 못하는 문제점을 제공하며, 음소 데이터에 대한 모델을 구성할 수 없는 단점으로 인하여 가우시안 모텔의 정확성을 확보하지 못하게 된다. 따라서 본 논문에서는 음소가 갖는 특징을 기반으로 바타챠랴 거리 측정법을 이용하여 정확한 음소로 인식할 수 있도록 유도하였으며 유사 음소 인식과 오인식 오류를 최소화하여 인식률을 향상시켰다. 연속 확률 분포의 공유로부터 가우시안 모델 최적화를 실험한 결과 향상된 신뢰도로 인해 높은 인식 성능을 확인하였으며, 본 논문에서 제안한 바타챠랴 거리 측정법을 이용하여 실험한 결과 기존의 방법들에 비하여 평균 1.9%의 성능 향상을 나타내었으며 신뢰성을 바탕으로 인식율에서 평균 2.9%의 성능 향상을 나타내었다.

언어생활을 반영한 지능적 끝말잇기 프로그램 구현 (An Implementation of Intelligent Word Relay Game Considering Characteristics of Real World Langunge)

  • 임희석
    • 한국산학기술학회논문지
    • /
    • 제9권1호
    • /
    • pp.122-128
    • /
    • 2008
  • 본 논문은 한국어의 사용 패턴을 고려한 지능적 끝말잇기 프로그램을 구현하였다. 끝말잇기 프로그램은 뇌손상등을 통한 실어증 환자나 언어 능력 발달이 상대적으로 낮은 아동들의 언어 능력을 진단하고, 재미있게 재활치료를 하는데 기여할 수 있다. 하지만 컴퓨터는 사람과 비교하여 대용량의 단어 목록을 기억하기에 유리하므로 끝말잇기 프로그램에서 컴퓨터는 훨씬 유리한 조건이다. 따라서 컴퓨터의 보유 단어 목록에서 임의의 끝말을 생성하는 끝말잇기 프로그램은 지능적인 게임의 상대자로 부적합하며 게임자의 의욕을 저하시킬 수 있다. 게임자의 단어 사용 수준에 따라 컴퓨터의 대답의 난이도를 조절하고, 실제 언어생활의 사용 패턴을 반영한 끝말잇기 프로그램은 게임자로 하여금 컴퓨터 상대방이 사람인 것처럼 느끼게 할 수 있으며, 이를 통하여 끝말잇기 프로그램을 지속시킬 수 있다.

한국어 어휘 인식을 위한 혼합형 음성 인식 단위 (Monophone and Biphone Compuond Unit for Korean Vocabulary Speech Recognition)

  • 이기정;이상운;홍재근
    • 한국컴퓨터산업학회논문지
    • /
    • 제2권6호
    • /
    • pp.867-874
    • /
    • 2001
  • 본 논문에서는 한국어의 발음 특성을 고려하여 인식시간 단축과 동시에 조음현상을 반영할 수 있는 인식단위 표현법을 제안하였다. 제안한 인식단위는 단음소(monophone)와 바이폰(biphone)의 혼합형으로서, 단음소 단위는 안정적인 특성을 나타내는 모음에 적용되고 바이폰 단위는 인접한 모음에 의해 변하는 자음에 적용된다. PBW455 데이터베이스에 대한 단어인식 실험에서 혼합형 단위표현법은 트라이폰 단위에 비해 비슷한 인식률을 나타내면서 57%의 인식시간 단축효과를 나타냈고, 음절 단위에 비해 향상된 인식률과 비슷한 인식시간을 나타내었다. 또한 트라이폰 및 음절 단위보다 적은 모델 수를 가져 메모리 양을 줄일 수 있었다.

  • PDF