• 제목/요약/키워드: 음성효율

검색결과 866건 처리시간 0.039초

광대역 AMR 음성 압축기를 위한 효율적인 코드북 검색 방법 (Efficient Codebook Search Method for AMR Wideband Speech Codec)

  • 김윤희;박호종
    • 한국음향학회지
    • /
    • 제22권4호
    • /
    • pp.308-314
    • /
    • 2003
  • 3.4 ㎑ 대역폭을 가지는 협대역 음성 통신의 품질 한계를 극복하여 새로운 고품질 음성 서비스를 제공하기 위하여 7㎑ 대역폭을 가지는 광대역 음성 통신 시스템이 개발중이며, 광대역 음성 신호의 효율적인 압축을 위하여 광대역 AMR 음성 압축기가 개발되었다. 광대역 AMR음성 압축기는 ACELP 구조를 가지며 뛰어난 음질을 제공하지만 최적의 코드벡터를 찾기 위하여 매우 많은 계산량이 필요한 단점을 가진다. 이와 같은 문제점을 해결하기 위하여 본 논문에서는 광대역 AMR 음성 압축기의 코드북을 효율적으로 검색하는 새로운 방법을 제안한다. 제안하는 방법은 대략적으로 초기 코드벡터를 구하고, 코드벡터의 각 펄스의 중요도를 계산하여 중요도가 낮은 펄스를 제거하고 새로운 펄스를 찾는 과정을 통하여 코드벡터의 성능을 점차적으로 향상시키는 기법을 사용한다 제안한 방법을 광대역 AMR 음성 압축기에 적용하여 성능을 측정하였으며, 매우 적은 계산량으로 기존의 방법보다 약간 우수한 성능을 제공하는 것을 확인하였다.

STT 효율 증대를 위한 음성 주파수 correlation 기반 노이즈 필터링 방안 (Noise filtering method based on voice frequency correlation to increase STT efficiency)

  • 임지원;황용해;김규헌
    • 한국방송∙미디어공학회:학술대회논문집
    • /
    • 한국방송∙미디어공학회 2021년도 추계학술대회
    • /
    • pp.176-179
    • /
    • 2021
  • 현재 음성인식 기술은 인공지능 비서, 전화자동응답, 네비게이션 등 다양한 분야에서 사용되고 있으며 인간의 음성을 디바이스에 전달하기 위해 음성 신호를 텍스트로 변환하는 Speech-To-Text (STT) 기술을 필요로 한다. 초기의 STT 기술의 대부분은 확률 통계 방식인 Hidden Markov Model (HMM)기반으로 이루졌으며, 딥러닝 기술의 발전으로 HMM과 함께 Recurrent Nural Network (RNN), Deep Nural Network (DNN) 기법을 사용함으로써 과거보다 단어 인식 오류를 개선하며 20%의 성능 향상을 이루어냈다. 그러나 다수의 화자 혹은 생활소음, 노래 등 소음이 있는 주변 환경의 간섭 신호 영향을 받으면 인식 정확도에 차이가 발생한다. 본 논문에서는 이러한 문제를 해결하기 위하여 음성 신호를 추출하여 주파수성분을 분석하고 오디오 신호 사이의 주파수 영역 correlation 연산을 통해 음성 신호와 노이즈 신호를 구분하는 것으로 STT 인식률을 높이고, 목소리 신호를 더욱 효율적으로 STT 기술에 입력하기 위한 방안을 제안한다.

  • PDF

연결 단어 음성 인식기 학습용 음성DB 녹음을 위한 최적의 대본 작성 알고리즘 (The Optimal and Complete Prompts Lists Generation Algorithm for Connected Spoken Word Speech Corpus)

  • 유하진
    • 한국음향학회지
    • /
    • 제23권2호
    • /
    • pp.187-191
    • /
    • 2004
  • 연결 단어 인식기, 특히 연결 숫자음 인식기를 제작하기 위한 음성 데이터베이스를 구축하는데 있어서 완전하고 효율적인 발성목록을 작성하기 위한 알고리즘을 제안한다. 기존의 음성 DB에서 사용되는 목록은 주로 난수 발생기에 의하여 만들어지거나 사용자의 전화번호, 우편번호 등을 이용하여 만들어져 왔으므로 다양한 환경의 음소 또는 단어를 균일하게 포함하고 있지 못하다. 따라서 본 논문에서는 하나의 단어에 대하여 전후에 모든 단어가 연결되는 조합을 모두 한번씩 포함하는 목록을 만드는 효율적인 알고리즘을 제안한다. 본 알고리즘으로 7연 숫자 목록을 만들면 200개의 문장으로 모든 조합을 포함할 수 있게 된다. 본 논문에서는 알고리즘 예제와 본 알고리즘의 완전성과 효율성에 대하여 기술하였다.

ATM 멀티플렉서에서 우선순위 제어에 의한 음성전송효율 및 버퍼관리에 관한 연구 (A Study on the Voice Traffic Efficiency and Buffer Management by Priority Control in ATM Multiplexer)

  • 이동수;최창수;강준길
    • 한국통신학회논문지
    • /
    • 제19권2호
    • /
    • pp.354-363
    • /
    • 1994
  • 본 논문은 광대역 ISDN에서 음성 서비스를 효율적으로 제공하는 방법에 관한 연구이다. 음성은 그 특성상 유음구간과 북음구간으로 나누어지며, 음성활성검출에 의하여 실제로 말을 하는 동안만 전송이 이루어질 수 있도록 음성 트래픽을 발생한다. 본 논문에서는 ATM통신망에서 음성을 음성활성검출과 삽입(Embedded) ADPCM으로 코딩하고, 멀티플렉서에서 셀 폐기를 통하여 트래픽을 제어하는 알고리즘에 관하여 연구하였다. 트래픽 제어는 버퍼에 임계값을 주어, 버퍼의 상태가 임계값을 초과하는 경우에 낮은 우선순위를 갖는 음성 셀을 폐기하는 셀 폐기 알고리즘을 사용하였다. 셀 손실 확률, 큐 크기, 평균지연등을 성능분석 파라메터로 설정하고, 트래픽 제어 알고리즘의 성능을 평가하기 위하여 컴퓨터 시뮬레이션하였다. 이를 통하여 센 폐기방식에 의한 트래픽 제어가 음성의 질을 많이 저하시키지 않으면서도 트래픽 제어를 하지 않을 때에 비하여 전송 대역 이득을 향상시킨다는 것을 확인하였다.

  • PDF

캡션정보 및 음성인식을 이용한 내용기반 비디오 정보 색인 및 검색에 관한 연구 (A Study on the Content-Based Video Information Indexing and Retrieval Using Closed Caption and Speech Recognition)

  • 손종목;김진웅;배건성
    • 한국방송∙미디어공학회:학술대회논문집
    • /
    • 한국방송공학회 1999년도 학술대회
    • /
    • pp.141-145
    • /
    • 1999
  • 뉴스나 드라마, 영화 등의 비디오에 대한 검색 시 일반 사용자의 요구에 가장 잘 부합되는 결과를 얻기 위해 비디오 데이터의 의미적 분석과 색인을 만드는 것이 필요하다. 일반적으로 음성신호가 비디오 데이터의 내용을 잘 나타내고 비디오와 동기가 이루어져 있으므로, 내용기반 검색을 위한 비디오 데이터 분할에 효율적으로 이용될 수 있다 본 논문에서는 캡션 정보가 주어지는 방송뉴스 프로그램을 대상으로 효율적인 검색, 색인을 위한 비디오 데이터의 분할에 음성인식기술을 적용하는 방법을 제안하고 그에 따른 실험결과를 제시한다.

  • PDF

AMR 음성 압축기를 위한 효율적인 코드북 검색 방법 (Efficient Codebook Search Method for AMR Speech Codec)

  • 이도윤;박호종
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 2001년도 추계학술발표대회 논문집 제20권 2호
    • /
    • pp.93-96
    • /
    • 2001
  • ACELP 구조의 음성 압축기는 우수한 음질을 제공하지만 최적의 코드 벡터를 구하기 위한 계산량이 상당히 많은 단점이 있다. 이를 해결하기 위해서 본 논문에서는 AMR 음성 압축기의 코드북을 매우 효율적으로 검색하는 새로운 방법을 제안한다. 제안하는 코드북 검색 방법은 완전 순차적인 검색 방법을 사용하여 대략적인 코드 벡터를 구하고, 코드 벡터의 각 펄스들의 중요도를 계산하여 중요도가 낮은 펄스를 새로운 펄스로 교환하는 펄스 교환 과정을 수행하여 코드 벡터의 성능을 향상시키는 방법을 사용한다. 또한, AMR 음성 압축기의 구조에 맞도록 트랙별로 이동하면서 순차적으로 코드북을 검색하여 다수의 대략적인 코드벡터를 찾은 후, 각 코드 벡터에 대하여 펄스 교환 과정을 수행하여 최적의 코드 벡터를 구한다. 제안한 코드북 검색 방법을 AMR 음성 압축기의 모든 모드에 적용하여 코드북 검색을 위한 계산량과 성능을 측정하였으며, 모든 모드에 대하여 매우 적은 계산량으로 동등한 성능을 가지는 것을 확인하였다

  • PDF

Context 정보를 이용한 명령어 음성인식의 성능향상 (Performance improvement of Command Speech recognition using Context Information)

  • 김영주;김은주;김명원
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2005년도 한국컴퓨터종합학술대회 논문집 Vol.32 No.1 (B)
    • /
    • pp.718-720
    • /
    • 2005
  • 이동 단말기의 대중화로 사용자는 시간과 공간의 제약 없이 필요한 다양한 정보 서비스를 쉽게 접할 수 있게 되었다. 그러나 사용자 인터페이스에 있어 이동 단말기는 제약사항이 않음으로 적시적소에 원하는 정보를 접근하기가 어렵기 때문에 음성인식을 통한 인터페이스 연구가 진행되고 있으며, 특히 잡음환경에서 강인한 음성인식 처리를 위한 연구가 활발히 진행되고 있다. 지금까지 잡음환경을 위한 음성인식 접근 방법으로는 언어모델의 개선과 음향모델 개선으로 크게 구분할 수 있다. 그러나 이러한 접근 방법들은 적용하는데 있어 많은 시간과 비용이 요구됨으로 효율성이 떨어진다. 따라서 본 논문에서는 이러한 효율성 문제를 보완하기 위해 음성인식기로부터 인식되어 나오는 결과를 문맥정보와 융합하여 정보를 추출하고 이 정보를 이용한 후처리 모듈을 이용하여 인식시에 발생하는 오류를 적은 비용과 시간으로 수정하여 이동 단말기에 이용할 수 있도록 한다.

  • PDF

SVM 기반 음성/음악 분류기의 효율적인 임베디드 시스템 구현 (Efficient Implementation of SVM-Based Speech/Music Classification on Embedded Systems)

  • 임정수;장준혁
    • 한국음향학회지
    • /
    • 제30권8호
    • /
    • pp.461-467
    • /
    • 2011
  • 제한된 대역폭을 효율적으로 사용하기 위해서 도입된 가변 전송률은 먼저 신호의 정확한 분류를 필요로 한다. 특히 멀티미디어 서비스가 보편화 되면서 음성/음악 신호 분류의 중요성도 높아지게 되었다. 음성/음악 분류기 중, 서포트벡터머신 (SVM)을 이용한 분류기는 높은 분류 정확도로 주목받고 있다. 그러나 SVM는 많은 계산량과 저장 공간을 요구하므로 효율적인 구현이 요구되며, 특히 임베디드 시스템과 같이 자원이 제한 적인 경우에는 더욱 그러하다. 본 논문에서는 먼저 SVM을 이용한 음성/음악 분류기의 임베디드 시스템으로의 구현을 실행시간과 에너지소비의 관점에서 분석하고, 효율적인 구현을 위한 두가지 방법들을 제안한다. 서포트벡터의 판별결과에의 기여도를 바탕으로 기여도가 낮은 벡터들을 제외하는 방법과, 음성/음악 신호에 기본적으로 존재하는 각 프레임간의 상관관계를 이용하여 입력신호의 일부를 건너뛰는 방법이다. 이 기법들은 SVM의 학습 시 사용되는 다른 최적화 기법에 관계없이 적용이 가능하며, 실험을 통해 분류의 정확도, 실행시간, 그리고 에너지소비의 관점에서 그 성능을 증명하였다.

WATM에서 음성 서비스를 위한 동적 슬롯 할당 알고리즘 (Dynamic Slot Allocation Scheme for Voice Service in WATM)

  • 김관웅;박준성;정경택;전병실
    • 한국통신학회논문지
    • /
    • 제26권9A호
    • /
    • pp.1601-1608
    • /
    • 2001
  • 본 논문에서는 무선 ATM 환경에서 음성과 같은 실시간 서비스가 요구되는 트래픽의 QoS를 보장하기 위한 구현 방법을 제안하였다. 음성은 셀이 발생되는 토크스퍼트 구간과 셀이 발생되지 않는 휴지구간이 주기적으로 반복되는 특성을 갖는다. 따라서 음성과 같은 실시간 서비스의 QoS를 보장하기 위해서는 휴지구간 상태에 있는 음성단말의 수와 음성단말의 상태를 고려하여 음성단말의 수에 관계없이 일정한 QoS를 보장할 수 있어야 한다. 음성단말의 수에 관계없이 일정한 연결 지연시간을 제공하기 위하여, 휴지 상태에 있는 음성 단말 수와 휴지 상태의 지속시간에 따라서 동적으로 음성 예약 슬롯을 할당하는 방식을 제안한다. 컴퓨터 시뮬레이션을 통하여 slotted-ALOHA나 NC-PRMA 같은 기존의 슬롯 할당방법과 비교하였으며, 그 결과 제안된 방법이 동적으로 예약슬롯을 할당하여 부하에 관계없이 음성 트래픽에 일정한 지연시간과 낮은 충돌율을 제공하면서 프레임에 예약슬롯의 오버헤드를 최소화하므로, 채널 사용 효율을 높일 수 있음을 알 수 있었다.

  • PDF

디지틀 이동 통신을 위한 음성 부호화 기술

  • 정종태;김영일
    • 전자통신동향분석
    • /
    • 제4권3호
    • /
    • pp.3-12
    • /
    • 1989
  • 디지틀 이동통신 시스팀 개발에 있어서 가용주파수 대역폭의 제한성 때문에 저 전송 속도 음성 부호화기에 관한 연구는 중요하다. 따라서, 음질도 좋고 주파수 효율을 극대화할 수 있는 디지틀 음성 부호화 방식에 대한 연구는 국내 고유모델의 디지틀 이동 통신 시스팀 개발에 초석이 된다고 할 수 있다. 본고에서는 현재 사용되거나 연구가 진행중인 디지틀 음성 부호화 방식들에 대하여 살펴보았고, 세계 각국에서 디지틀 이동통신을 위하여 제안한 디지틀 음성 부호화 방식들을 비교 및 검토 하였다.