Search | Korea Science

Current Status of Speech Database at ETRI (ETRI의 음성데이타베이스 구축현황)

이영직
- Proceedings of the Acoustical Society of Korea Conference
- /
- 1995.06a
- /
- pp.265-271
- /
- 1995
한국전자통신연구소의 음성 데이터베이스 구축 현황을 기술한다. 현재 한국전자통신연구소에서는 음성인식 연구를 위해 단어음성, 정형 문장 음성 등의 데이터베이스를 구축, 보유하고 있다. 음성인식용 데이터베이스는 정해진 단어, 분장을 20명 내지 100명이 발성한 것으로, 일부는 음소 단위까지 레이블링이 되어 있다. 또 음성합성 연구를 위해 합성단위 및 운율데이타베이스를 가지고 있는데 이는 한 명 혹은 남녀 각각 3명이 발성한 것으로, 일부는 피치 등이 수록되어 있다. 문장 데이터베이스는 언어 정보처리를 위해 교재, 문학, 경제, 과학 분야의 문장을 총 480만 어절 가지고 있으며, 이 중 일부에 품사 정보를 추가하였다. 한국전자통신연구소는 국내 음성 연구의 발전에 기여하고자 음성 연구의 기반 자료가 되는 음성 데이터베이스를 국내 대학 및 산업체에 배포하고 있다 음성 데이터베이스는 음성 연구의 기반이 되는 자료임에도 불구하고 많은 비용과 노력이 들어 일반 대학에서는 쉽게 만들 수 없었다. 이에 ETRI는 한국통신이 출연한 "자동통역 요소기술개발" 과제으 LQNTKSANF인 여러 종류의 음성 데이터베이스와 관련 프로그램을 공급하여 국내 음성 연구의 기반 확립에 기여하고자 한다. 기여하고자 한다.
PDF

Conformer-based Elderly Speech Recognition using Feature Fusion Module (피쳐 퓨전 모듈을 이용한 콘포머 기반의 노인 음성 인식)

Minsik Lee;Jihie Kim
- Annual Conference on Human and Language Technology
- /
- 2023.10a
- /
- pp.39-43
- /
- 2023
자동 음성 인식(Automatic Speech Recognition, ASR)은 컴퓨터가 인간의 음성을 텍스트로 변환하는 기술이다. 자동 음성 인식 시스템은 다양한 응용 분야에서 사용되며, 음성 명령 및 제어, 음성 검색, 텍스트 트랜스크립션, 자동 음성 번역 등 다양한 작업을 목적으로 한다. 자동 음성 인식의 노력에도 불구하고 노인 음성 인식(Elderly Speech Recognition, ESR)에 대한 어려움은 줄어들지 않고 있다. 본 연구는 노인 음성 인식에 콘포머(Conformer)와 피쳐 퓨전 모듈(Features Fusion Module, FFM)기반 노인 음성 인식 모델을 제안한다. 학습, 평가는 VOTE400(Voide Of The Elderly 400 Hours) 데이터셋으로 한다. 본 연구는 그동안 잘 이뤄지지 않았던 콘포머와 퓨전피쳐를 사용해 노인 음성 인식을 위한 딥러닝 모델을 제시하였다는데 큰 의미가 있다. 또한 콘포머 모델보다 높은 수준의 정확도를 보임으로써 노인 음성 인식을 위한 딥러닝 모델 연구에 기여했다.
PDF

A Korean Speech Database for Use in Automatic Translation (자동통역용 한국어 음성 데이터베이스)

최인정
- Proceedings of the Acoustical Society of Korea Conference
- /
- 1994.06c
- /
- pp.287-290
- /
- 1994
음성 인식 시스템의 개발을 위해서는 음성 데이터베이스구축이 중요한 과제의 하나로서, 많은 시간과 노력이 요구된다. 개별적인 음성데이타베이스 구축에 따른 중복 투자를 줄이고 다양한 인식 알고리듬의 성능 비교와 국내 음성 인식 기술의 발전을 위해서는 벤치마크 시험을 위한 공통의 음성 데이터베이스가 필수적이다. 본 논문에서는 한국과학기술원 통신연구실에서 제작한 한국어 음성 데이터베이스에 관하여 기술한다. KAIST 음성데이타베이스는 자동통ㅇ역을 N이한 무역 상담과 관련되 3,000 단어 규모의 연속어를 비롯하여, 가변 길이 연결 숫자음, phoneme-balanced 75 고립단어, 지역명 관련 500 고립단어, 한국어 아-세트로 구성되어 있다. 이 음성 데이터베이스의 구축을 위하여 사용된 태스크선정 절차, 녹음 방법, 규격, 및 기대효과 등 세부사항을 기술한다.
PDF

Impact of face masks on spectral and cepstral measures of speech: A case study of two Korean voice actors (한국어 스펙트럼과 캡스트럼 측정시 안면마스크의 영향: 남녀 성우 2인 사례 연구)

Wonyoung Yang;Miji Kwon
- The Journal of the Acoustical Society of Korea
- /
- v.43 no.4
- /
- pp.422-435
- /
- 2024
This study intended to verify the effects of face masks on the Korean language in terms of acoustic, aerodynamic, and formant parameters. We chose all types of face masks available in Korea based on filter performance and folding type. Two professional voice actors (a male and a female) with more than 20 years of experience who are native Koreans and speak standard Korean participated in this study as speakers of voice data. Face masks attenuated the high-frequency range, resulting in decreased Vowel Space Area (VSA) and Vowel Articulation Index (VAI)scores and an increased Low-to-High spectral ratio (L/H ratio) in all voice samples. This can result in lower speech intelligibility. However, the degree of increment and decrement was based on the voice characteristics. For female speakers, the Speech Level (SL) and Cepstral Peak Prominence (CPP) increased with increasing face mask thickness. In this study, the presence or filter performance of a face mask was found to affect speech acoustic parameters according to the speech characteristics. Face masks provoked vocal effort when the vocal intensity was not sufficiently strong, or the environment had less reverberance. Further research needs to be conducted on the vocal efforts induced by face masks to overcome acoustic modifications when wearing masks.
https://doi.org/10.7776/ASK.2024.43.4.422 인용 PDF

음성합성을 위한 분절음 길이예측 모델링

정현성
- Proceedings of the KSLP Conference
- /
- 2003.11a
- /
- pp.236-236
- /
- 2003
음성합성을 위한 운율연구는 실험음성학과 음성공학 분야에서 활발히 이루어져 왔고, 가시적인 성과도 거두어 왔다. 최근 운율의 자연성을 향상시키기 위한 노력은 corpus-based unit selection에서와 같이, 대단위 음성자료에 의존하게 되면서 급격한 자연성의 향상을 가져온 것이 사실이지만, 여전히 새로 주어진 자료에 대해서 부자연스러운 운율을 극복해야 한다는 과제를 안고 있다. 이 논문은 길이, 억양, 에너지 등의 운율요소 가운데, 우선적으로 분절음의 길이에 초점을 두고, 대규모 음성자료를 바탕으로 한 자료기반형 길이예측모델을 지양하고 언어학적 지식과 언어자질을 이용한 지식기반형 길이예측모델을 제시하고자 한다. 모델링을 위한 방법으로는, 기본적으로 자료기반형 모델링 기법이지만 언어자질을 이용한 길이예측이 가능한 Classification and Regression Tree (CART) 모델링과 전통적인 지식기반형 모델링인 sequential rule systems을 확대시킨 Sums-of-Products 모델링을 사용한다. (중략)
PDF

음성다이얼서비스 시스팀 개발

신동헌
- Korea Information Processing Society Review
- /
- v.3 no.1
- /
- pp.102-108
- /
- 1996
통신 선진국들은 음성인식기술을 이용한 통신망에서의 여러 가지 부가서비스 개발을 추진함으로써 서비스를 자동화하여 인력절감 및 고부가치를 추구하는데 노력하여 왔으며 최근에는 가입자들을 대상으로 개발완료된 시스팀들의 시험서비스를 제공하면서 상용화에 박차를 가하고 있다 특히 미국의 NYNEX사는 '93년 3월부터 가입자들을 대상으로 "음성다이얼서비스"를 시험제공함으로써 음성인식기술을 활용한 교환서비스를 세계최초로 시작하였다 한국통신에서도 "자동통역전화요소기술 연구"를 통하여 그동안 음성인식기술에 대한 요소기술을 확보하였으며 현보유기술로도 자체적으로 국제 경쟁력이 있는 음성다이얼 서비스 구현이 가능하다고 판단되어 소프트웨어연구소에서는 '94년부터 시내사업본부 개발과제로 시스팀개발에 착수하였다. 본고에서는 음성다이얼서비스 개요와 서비스 구성, 그리고 장치의 구현에 대하여 단계별로 기술하였다. 구현에 대하여 단계별로 기술하였다.
PDF

음성인터페이스 기술 개요 및 스마트폰 환경에서의 서비스 동향

Lee, Yun-Geun
- Information and Communications Magazine
- /
- v.29 no.4
- /
- pp.3-9
- /
- 2012
본고에서는 최근 스마트폰 등에서 사용자에게 편리한 인터페이스 수단으로 활용되고 있는 음성인식 기술에 대하여 알아본다. 음성인식 기술은 컴퓨터가 인간의 말을 알아듣는 기술로서 50년 이상의 연구개발 역사를 가지고 있다. 그간 꾸준한 기술개발과 상용화 시도를 통하여 지속적인 발전을 이루어왔으며 최근 들어 스마트폰 활성화에 따라 관심도가 급속히 높아지고 있는 분야이다. 음성인식 기술은 언어와 관련된 기술이니만큼 기술측면과 시장측면에서의 특수성이 있으며 이를 충분히 고려한 연구개발전략이 수립되어야 한다. 현재, 구글, 애플, 마이크로소프트 등 세계적인 IT 선도기업이 음성인식 기술 개발에 많은 노력을 기울이고 있으며 특히 스마트폰 환경에서의 음성인식 응용 서비스인 음성검색, 자동통역, 인공지능 개인비서 등을 시작하며 본격적인 기술, 시장 선점 경쟁에 돌입하였다. 이들 서비스에 대하여 자세히 알아보고 이에 따른 시사점 및 국내 대응현황에 대해 알아본다.
PDF KSCI

Implementation of the Acoustic Echo Canceller for a Voice-controlled PC (음성제어 PC를 위한 음향 반향 제거기의 구현)

한철희;이혁재;윤대희
- Proceedings of the Korean Society of Broadcast Engineers Conference
- /
- 1998.06a
- /
- pp.103-106
- /
- 1998
본 논문에서는 전이중(full duplex)으로 동작하는 멀티미디어 PC의 음성 명령어 인식기의 성능 향상을 위한 적응 음향 반향 제거기를 구현하였다. 최근 들어 일고 있는 인간과 컴퓨터의 인터페이스를 쉽고 친밀하게 하려는 노력은 음성으로 제어하는 컴퓨터의 탄생을 예고하고 있다. 이러한 시스템을 전이중 모드에서 사용할 경우 음향 반향은 피할 수 없는 현상이다. 본 논문에서는 이러한 음향 반향을 제거하기 위해서 서브밴드 적응 필터 구조를 이용하여 실시간 처리가 가능한 음향 반향 제거기를 설계하였다. 또한, 동시통화시 음성의 왜곡을 줄이는 스위칭 구조를 사용하였다. 동시통화의 검출은 상호상관도를 이용하여 구현하였다. 이렇게 구현된 반향제거기를 음향 입출력 루틴과 음성 인식기와 결합하여 Windows 95상에서 실시간으로 동작하는 음성 명령어 인식 소프트웨어를 완성하였다. 모의 실험 및 실시간 실험을 통하여 반향 제거기의 성능을 검증하였고, 음성인식 실험을 수행하여 반향 제거기가 인식율 향상에 기여함을 확인하였다.
PDF

Videokymographic Findings of Benign Vocal Fold Lesions (성대양성질환에서 Videokymography 소견)

안철민;윤선영;정덕희
- Proceedings of the KSLP Conference
- /
- 1998.11a
- /
- pp.183-183
- /
- 1998
음성이 성대진동에 의해서 생성된다는 것이 밝혀진 이래로 이것을 확인해 보기 위한 많은 노력이 있어왔다. 특히 성대의 빠른 진동을 느린 움직임으로 정확하게 관찰하기 위해서 후두스트로보스코프같은 기구가 사용되고 있지만, 이것은 실제 시간에 따른 성대움직임을 보는 것이 아니고, 또 불규칙한 진동이 나타날 경우에는 성대점막의 움직임을 관찰하는 것이 불가능한 단점이 있었다. 저자들은 초 당 8000 개의 연속된 영상을 기록할 수 있는 videokymography를 이용하여 성대점막의 실제 시간에 따른 움직임을 관찰해보고, 후두질환에서 나타나는 영상을 확인해 보기 위하여 본 연구를 시작하였다. (중략)
PDF

A Study on the Construction of Speech DB to build a Stock sales system (증권거래시스템 구축을 위한 음성 DB의 구축)

Eo Bumsuk;Kim hakjin;Kim Soonhyob
- Proceedings of the Acoustical Society of Korea Conference
- /
- spring
- /
- pp.95-98
- /
- 2000
음성 인식 시스템의 개발을 위해서는 음성 데이터베이스 구축이 중요한 과제의 하나로써, 많은 시간과 노력이 요구된다. 본 논문은 ARS 주식거래 시스템에서 사용되는 주식의 매수, 매도, 증시 현황에 관련된 문장과 숫자음에 대하여 DB 구축한다. 이 DB 구축을 위하여 Dialogic 사의 D/41ESC보드를 장착하고, Window NT4.0 플렛폼에서 음성을 수집하였다. 본 논문에서는 음성 수집을 위해 전국의 20대에서 50대까지의 남녀에 대해 1명당 50개의 문장 또는 숫자음에 대하여, 유선 및 무선을 통하여 데이터를 수집하였다. 또한 화자 독립 음성 인식을 위하여 1200명의 화자로 구성되어 있다. 지역별로 보면, 서울 및 경기, 강원 지역과 영호남, 충청 지역으로 나누었으며, 일반폰, 휴대폰, 공중전화의 환경에서, 그리고 실내와 실외환경에서 각각 수집하였다.
PDF

Search Result 148, Processing Time 0.02 seconds

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

Detail Search

Image Search (β)