통합 검색 | Korea Science

잡음에 강인한 시청각 음성인식

이종석;박철훈
- 제어로봇시스템학회지
- /
- 제13권3호
- /
- pp.28-34
- /
- 2007
PDF KSCI

음성과 영상정보를 결합한 멀티모달 제어기의 구현 (Implementation of a Multimodal Controller Combining Speech and Lip Information)

김철;최승호
- 한국음향학회지
- /
- 제20권6호
- /
- pp.40-45
- /
- 2001
본 논문에서는 음성과 영상정보를 결합한 멀티모달시스템을 구현하고 그 성능을 평가하였다. 음성정보를 이용해서 음성인식기를, 영상정보를 이용해서 입술인식기를 설계하였으며, 두 인식기는 HMM (Hidden Markov Model) 기반의 인식엔진을 사용하였다. 음성과 영상인식의 결과는 각각 8:2의 가중치를 부여하여 통합하였다. 한편, 구축된 멀티모달 인식시스템은 DARC (data radio channel)시스템과 통합되어 응용프로그램인 Comdio(computer radio)를 제어하도록 구현하였다. 멀티모달과 DARC시스템, 멀티모달시스템 내에서 두 인식기간의 정보교환은TCP/IP소켓 방식을 사용하였다. 통합시스템의 Comdio 제어실험의 결과는 입술인식이 음성인식기의 보조수단으로 사용될 수 있음을 보였으며, 향후교통정보 및 자동차항법장치에 적용되어짐으로써 그 적용분야를 넓힐 수 있을 것으로 기대된다.
PDF

스마트폰 기반의 실시간 모음 인식 마우스 구현 (Implementation of Real-time Vowel Recognition Mouse based on Smartphone)

장태웅;김현용;김병만;정해
- 정보과학회 컴퓨팅의 실제 논문지
- /
- 제21권8호
- /
- pp.531-536
- /
- 2015
음성인식은 HCI(Human Computer Interface)분야에서 가장 활발히 연구되고 있는 분야로 음성을 이용하여 디지털 디바이스를 제어하는 것을 목적으로 하고 있으며 마우스는 GUI 컴퓨터 환경에서 가장 널리 사용하는 장치로서 높은 보급률을 자랑하는 컴퓨터 주변기기 중의 하나이다. 본 논문은 스마트폰 환경에서 실시간 모음 음성 인식을 이용한 마우스 제어 방법에 관하여 제안한다. 구현 방법은 스마트폰에서 실시간으로 일정크기의 음성 신호를 입력 받아 핵심 음성 신호를 추출하고 MFCC(Mel Frequency Cepstral Coefficient)를 이용하여 특징을 추출하여 학습되어 있는 코드 북을 이용하여 양자화를 진행하고 HMM(Hidden Markov Model)을 이용하여 해당 모음 단어를 인식한다. 그리고 각 모음에 해당하는 마우스 명령어로 변환하여 화면상의 가상의 마우스를 제어한다. 최종적으로, 우리는 구현된 스마트폰의 앱을 가지고 데스크톱 PC의 화면상에서 다양한 마우스의 동작을 보여준다.
https://doi.org/10.5626/KTCP.2015.21.8.531 인용 KSCI

피드백 제어 정보 및 알고리즘을 이용한 ABR 서비스 트래픽제어 (An ABR Service Traffic Control of Using feedback Control Information and Algorithm)

이광옥;최길환;오창윤;배상현
- 인터넷정보학회논문지
- /
- 제3권3호
- /
- pp.67-74
- /
- 2002
ATM은 패킷 데이터 서비스 통신에 적합한 통신방식으로 데이터, 음성, 영상 등의 서비스를 동시에 지원할 수 있다. 이러한 ATM의 QoS를 보증하기 위해서는 패킷 데이터를 전송하는 소스 비율에 대해 네트워크 초과적조 조건을 조절하는 것이 필요한데 대부분의 제어알고리즘이 임계값을 기반으로 한 피드백 제어방식이다. 그러나 실시간 음성 트래픽과 같은 서비스는 네트워크 상에서 데이터 서비스 동안에 동적인 연결이 설정되고 종료될 수 있으므로 피드백 제어정보가 지연된다면 고속으로 서비스된 음성 데이터에 대한 품질은 소스와 목적지 사이의 시간 지연으로 인해 손실될 수 있다. 본 논문에서 제시한 최소평균제곱오차에 근거를 둔 제어 알고리즘은 예시적인 피드백 제어로 피드백 제어를 위해 미지함수의 기울기와 버퍼크기를 이용하여 미래의 버퍼크기를 예측하려 하였으며 시뮬레이션 결과 본 논문에서 제시한 제어 알고리즘은 효과적임이 증명되었다.
PDF

한국어 음성합성에서 음운지속시간 모델화 (Segmental duration modelling for Korean text-to-speech synthesis)

이양희
- 대한음성학회:학술대회논문집
- /
- 대한음성학회 1996년도 2월 학술대회지
- /
- pp.125-135
- /
- 1996
본 논문에서는 자연스러운 음성을 합성하기 위하여, 한국어 음운지속시간의 변화에 있어서 문절과 구내의 음절수와 음절의 위치에 의한 영향과 인접하는 음운의 영향에 대하여 통계적으로 분석하였고, 분석된 시간 특징을 제어 요소로 하는 회귀트리를 생성하여 음운 지속시간을 모델 화하였다. 또한, 제안된 음운 지속시간 모델에 의해 예측실험을 행하여, 측정치와 예측치간의 다중 상관계수가 0.74정도이고, 각 음운의 예측오차의 75%이상이 25ms이내로 제안된 모델의 타당성이 입증되었다.
PDF

한국어 음성 합성을 위한 운율 및 길이 정보의 추출 (An Extraction of the Prosody and Duration Information for Speech Synthesis in Korean)

양진석;박광철;양세라;김재범;이정현
- 한국데이타베이스학회:학술대회논문집
- /
- 한국데이타베이스학회 1995년도 제4회 멀티미디어 산업기술 학술대회 논문집
- /
- pp.187-190
- /
- 1995
자연스러운 음성 합성을 위해서는 운율 및 장단음 처리가 선행되어야 한다. 본 논문에서는 음성학적 실험과 억양 규칙을 이용하여 한국어 문장으로부터 운율 제어 정보와 모음 길이 정보를 추출한 뒤 음성 합성에 적용함으로써 합성음의 자연성을 향상시키는 방법을 제안한다. 이러한 정보는 문장 분석 후 일련의 운율 규칙을 적용하여 반복된 실험을 통해 수치화함으로써 얻을 수 있었다. 실험결과, 운율 및 장단처리를 적용한 본 시스템에서는 자연성이 향상된 결과를 얻을 수 있었다.
PDF

TTS 적용을 위한 음성합성엔진 (Speech syntheis engine for TTS)

이희만;김지영
- 한국통신학회논문지
- /
- 제23권6호
- /
- pp.1443-1453
- /
- 1998
본 논문은 컴퓨터에 입력된 문자정보를 음성정보로 변환하기 위한 음성합성엔진에 관한 것이며, 특히 명료성의 향상을 위해 파형처리 음성합성방식을 이용한다. 음성합성엔진은 컴맨드 스트림의 제어에 따라 자연성의 향상을 위한 피치조절, 길이 및 에너지 등을 제어하며 음성합성단위로서 반음절을 사용한다. 엔진에서 사용 가능한 컴맨드를 프로그램하여 음성합성엔진에 입력함으로서 음성을 합성하는 빙식은 구문분석, 어휘분석 등의 하이레벨과 파형의 편집 가공 등의 로우레벨을 완전 분리하므로 시스템의 융통성과 확장성을 높인다. 또한 TTS시스템의 적용에 있어 각 모듈을 객체/컴포넌트(Object/Component)로 각 모듈이 상호 독립적으로 작동되도록 하여 쉽게 대체가 가능하다. 하이 레벨과 로우 레벨을 분리하는 소프트웨어 아키택처는 음성합성 연구에 있어 각각 여러 분야별로 독립적으로 연구수행이 가능하여 연구의 효율성을 높이며 여러 소프트웨어의 조합사용(Mix-and-Match)이 가능하여 확장성과 이식성을 향상시킨다.
PDF

음성 인식에서 훈련 및 인식 과정에 사용되는 대상 어휘의 차이에 대한 음향 모델의 성능 평가 (Performance Evaluation of Acoustic Models According to Differences between Vocabularies in Training and Test Phases of Speech Recognition)

김회린;이항섭;권오욱
- 한국음향학회지
- /
- 제17권7호
- /
- pp.22-27
- /
- 1998
본 논문에서는 ETRI에서 개발한 가변 어휘 음성 인식기의 어휘 독립 음향 모델링 방법을 기술하고, 이 모델의 어휘 종속, 어휘 독립 및 어휘적응 성능을 평가하기 위하여 다 양한 고립단어 및 연속음성 DB에 대하여 실험한 결과를 분석하였다. 평가를 위하여 사용한 음성 DB로는 고립단어 음성으로 POW(Phonetically Optimized Words) 3848, PBW(Phonetically Balanced Words) 445, PBW 452, 호텔예약 244 단어, 게임 제어용 단어 등이며, 연속음성으로 일반 문장 음성 및 연속 숫자음을 이용하였다. 성능 분석 결과 40개 음소 모델만으로도 비교적 높은 인식률을 보여 주었지만, 어휘독립의 경우는 어휘종속에 비 하여 성능이 크게 낮았고, 특히 대상 어휘가 숫자음, 알파벳, 연속음 등의 경우에는 POW 데이터나 PBW 데이터만 가지고는 우수한 가변 어휘 음성 인식기를 구현하기에 한계가 있 음을 알 수 있다. 또한, 훈련 데이터의 어휘와 평가데이터의 어휘가 비슷할 경우에는 변이음 모델을 사용하면 음소 모델만을 사용할 경우에 비하여 그 성능이 우수하였지만, 일반적인 어휘독립의 상황에서는 효과가 별로 없음을 알 수 있었다.
PDF

모바일 음성 웹 페이지의 자동 생성 시스템에 관한 연구 (A Study On the Automatic Generation System of Mobile Voice Web Page)

고유정;김윤중
- 한국정보처리학회:학술대회논문집
- /
- 한국정보처리학회 2008년도 추계학술발표대회
- /
- pp.153-156
- /
- 2008
모바일 기기는 화면의 크기가 작아 스타일러스나 펜으로 웹 컨텐츠를 이용하기에는 불편함이 있다. 이에 따라 음성으로 웹의 컨텐츠를 개발하기 위한 포준 언어인 VoiceXML(Voice Extenxible Markup Language), SALT(Speech application Language Tags)가 빠르게 보급되고 있다. 이를 이용하기 위해서는 기존의 모바일 웹페이지를 음성 웹 표준 기술에 맞게 변환해줘야 한다. 따라서 본 논문에서는 WML(Wireless Markup Language)로 구성된 모바일 웹 페이지를 SALT 음성기술을 이용하여 음성명령이 가능한 모바일 음성 웹페이지(WML + SALT)로 자동 생성하는 시스템을 구현 하고자 한다. 이에 따라 사용자는 음성명령을 통해 컨텐츠를 제어함으로써 편리함을 제공하고, 개발자는 자동 생성 시스템을 이용함으로써 기존의 모바일 웹 페이지를 음성 웹 페이지를 변환하기 위한 개발시간과 비용을 감소 할 수 있다.
https://doi.org/10.3745/PKIPS.y2008m011a.153 인용 PDF

NGN에서 음성서비스의 호 처리 성능해석 (Performance Analysis for Call Processing in NGN Voice Services)

정문조;황찬식
- 대한전자공학회논문지TC
- /
- 제40권11호
- /
- pp.42-50
- /
- 2003
최근 차세대네트워크(Next Generation Network 이하 NGN)란 이름으로 음성서비스 및 다양한 멀티서비스(multi-service)를 품질이 보장되는 IP 네트워크 상에서 제공하려는 움직임이 활발하다. 그리고 NGN에서 원활한 서비스 제공을 위하여 해결되어야 할 문제들은 전달망 구조 정립, IP 망의 QoS 보장, 서비스 생성 및 관리, 그리고 제어채널의 분리에 따른 제어망 설계분야로 나누어져 연구가 진행되고 있다. 특히, NGN에서는 호 및 연결 제어정보와 사용자 데이터를 전달하는 루트가 서로 분리된 형태로 구현될 예정이며, 호 처리 성능평가에 대한 방안은 조속히 정리되어야 할 주요한 문제 중의 하나이다. 그러나 아직 호 처리 성능에 대한 어떠한 정량적 평가방법도 제안되어 있지 않다. 본 연구에서는 NGN에서 음성서비스를 제공하기 위한 제어망 설계에 있어서 QoS 지표의 하나인 호 설정 지연 목표치를 만족시키기 위하여 소프트스위치가 갖추어야 할 서버의 성능을 정량적으로 분석하고 예측하는 방법을 제안한다.
PDF KSCI

검색결과 696건 처리시간 0.025초

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

자세히 찾기

이미지 검색 (β)