• 제목/요약/키워드: 음성의 다양화

검색결과 300건 처리시간 0.024초

상태레벨 공유를 이용한 MLLR 적응화의 회귀클래스 생성에 관한 연구 (A Study on Regression Class Generation of MLLR Adaptation Using State Level Sharing)

  • 오세진;성우창;김광동;노덕규;송민규;정현열
    • 한국음향학회지
    • /
    • 제22권8호
    • /
    • pp.727-739
    • /
    • 2003
  • 본 논문에서는 HM-Net (Hidden Markov Network)을 다양한 태스크에의 적용과 화자의 특성을 효과적으로 나타내기 위해 HM-Net 음성인식 시스템에 MLLR (Maximum Likelihood Linear Regression) 적응방법을 도입하였으며, HM-Net 학습 알고리즘을 개량하여 회귀클래스 생성방법을 제안한다. 제안방법은 PDT-SSS (Phonetic Decision Tree-based Successive State Splitting)알고리즘의 문맥방향 상태분할에 의한 상태레벨 공유를 이용한 방법이다. 즉, 문맥방향의 각 상태에 적응화자 음성데이터에 포함된 문맥정보를 분할하여 적응화될 음소환경을 결정하는 것이다. 따라서 제안방법은 새로운 화자로부터 문맥정보와 적응화 데이터의 발성 양에 의존하여 결정된 많은 적응 파라미터들을 (평균, 분산) 자유롭게 제어할 수 있게 된다. 제안방법의 유효성을 확인하기 위해 국어공학센터 (KLE) 452 데이터와 항공편 예약관련 (YNU200) 연속음성을 대상으로 인식실험을 수행한 결과, 음소인식, 단어인식, 연속음성인식에 대해서, 평균 34∼37%, 평균 9%, 평균 20%의 성능 향상을 각각 보였다. 또한 적응화 데이터의 양에 따른 인식성능 비교에서 제안방법을 적용한 인식 시스템이 적응 데이터의 양이 적은 경우에도 향상된 인식률을 보여 MLLR 적응방법의 특성을 만족하였다. 따라서 MLLR 적응방법을 도입한 HM-Net 음성인식 시스템에 제안한 회귀클래스 생성방법이 유효함을 확인할 수 있었다.

계몽주의 시대 프랑스 문법서에서 기술한 운율 현상과 국제음성기호의 출발에 대한 고찰 (Notes on Descriptions of the Prosodic System in French Grammars in the Age of Enlightenment & the Departure of the International Phonetic Alphabet)

  • 박문규
    • 한국콘텐츠학회논문지
    • /
    • 제21권4호
    • /
    • pp.658-667
    • /
    • 2021
  • 본 연구는 계몽주의 시대에 프랑스 문법서에서 기술한 다양한 운율을 현대 음성학적 관점에서 분석하고 국제음성기호의 효시가 된 도상표기법을 소개하는 것을 목적으로 한다. 세 권의 문법서와 한 권의 표기법 서적을 비교·분석하여 운율 구조를 음성학적으로 재구성하는 연구방법을 도입하였다. 당시에는 규칙성이 있는 운율악센트와 의미적·화용적 맥락에서 발생하는 웅변악센트로 악센트를 분류하여 분석을 시도한 점이 대표적이다. 운율악센트는 억양과 관계가 있으며, 웅변악센트는 억양과 세기가 중요한 운율 자질이다. 여러 문법학자에 의하여 공통적으로 관찰된 현상은 단어의 말음절 장음화이다. 현대프랑스어 악센트의 중요한 특징인 말음절 장음화는 18세기에 자리 잡은 것으로 추정할 수 있다. 다만 억양을 악센트와 동일시하는 관습 때문에 말음절 장음화를 악센트로 보지 않고 단순히 음량의 패턴으로 간주한 것으로 보인다. 또한, 억양을 통한 악센트에 관한 기술이 이전 세기의 일반이성문법학자보다 덜 정교함을 보여주었다. 운율악센트의 위치를 정확히 명시하지 않은 점, 웅변악센트에 음의 고저와 세기가 어떻게 결합되는지에 대한 설명이 부재한 점이 대표적이다. 18세기의 문법가들이 운율에 관하여 기술한 내용을 분석하면 당시의 운율 현상은 전반적으로 오늘날의 프랑스어 운율 현상과 유사하다. 현대 음성학적 관점에서 보면 말음절 장음화가 프랑스어 악센트의 중요한 특성으로 자리 잡은 시기가 바로 18세기인 것이다.

Two Generations in Texas Dialect

  • Park Jookyung
    • 대한음성학회지:말소리
    • /
    • 제29_30호
    • /
    • pp.1-18
    • /
    • 1995
  • 미국 남부 방언은 그 지역의 광대함과 아울러 그 지역에 속하는 언어사용자들의 언어 문화 및 역사적인 다양성에 의해 결코 한 가지 방언으로 취급할 수 없는 것임에도 불구하고 많은 경우에 그렇게 다루어져 왔다. 특히 소위 '남부 방언의 특징적 요소'로서 몇몇 자질들에 대한 연구가 많이 이루어져 왔다. 본 논문의 목적은 텍사스 지역방언에 이러한 남부 방언의 특징적 자질이 어느 정도 유지되고 있는가를 알아보고, 아울러 두 세대간에 언어적 차이가 있는지, 있다면 그 변화의 방향은 어느 쪽으로 전개되어가고 있는지를 밝히려는 데 있다. 이를 위하여 토박이 텍사스 인에 한하여 한 가정에서 두 세대(늙은 세대와 젊은 세대)를 대표하는 정보제공자 두 명씩을 각각 추출하여 네 가정 모두 여덟 명에게서 얻은 언어자료를 녹음하여 이를 분석, 정리하였다. 텍사스 지역방언에 대해 밝혀진 주요 내용은 다음과 같다. 1. /l/앞에 나오는 단순모음 /i/는 [$r{\partial}$] 또는 [$r{\partial}$]로 이중모음화된다. 2. 강세음절에서 비음 앞에 나오는 /e/와 /I/는 중화된다. 3. 늙은 세대에서는 /a/와 /${\supset}$/가 융합되어 쓰이나, 젊은 세대에서는 융합이 일어나지 않는다. 4. 이중모음 /ar/는 /a:/또는 /a/로 단순모음화하는 것으로 보인다. 5. 이중로음 /$a{\mho}$/ /$o{\mho}$/의 앞모음이 전설화한다. 6. [u], [ju] 와 [${\mho}$]는 모두 [${\mho}$]로 된다. 7. [w] 와 [M]는 일관성 없이 교대로 사용되나 [M]는 특히 늙은 세대에서 더 많이 사용된다.

  • PDF

MPEG-NNR 의 지역 비선형 양자화를 이용한 CNN 압축 (Compression of CNN Using Local Nonlinear Quantization in MPEG-NNR)

  • 이정연;문현철;김수정;김재곤
    • 한국방송∙미디어공학회:학술대회논문집
    • /
    • 한국방송∙미디어공학회 2020년도 하계학술대회
    • /
    • pp.662-663
    • /
    • 2020
  • 최근 MPEG 에서는 인공신경망 모델을 다양한 딥러닝 프레임워크에서 상호운용 가능한 포맷으로 압축 표현할 수 있는 NNR(Compression of Neural Network for Multimedia Content Description and Analysis) 표준화를 진행하고 있다. 본 논문에서는 MPEG-NNR 에서 CNN 모델을 압축하기 위한 지역 비선형 양자화(Local Non-linear Quantization: LNQ) 기법을 제시한다. 제안하는 LNQ 는 균일 양자화된 CNN 모델의 각 계층의 가중치 행렬 블록 단위로 추가적인 비선형 양자화를 적용한다. 또한, 제안된 LNQ 는 가지치기(pruning)된 모델의 경우 블록내의 영(zero) 값의 가중치들은 그대로 전송하고 영이 아닌 가중치만을 이진 군집화를 적용한다. 제안 기법은 음성 분류를 위한 CNN 모델(DCASE Task)의 압축 실험에서 기존 균일 양자화를 대비 동일한 분류 성능에서 약 1.78 배 압축 성능 향상이 있음을 확인하였다.

  • PDF

노인음성신호처리에서의 젠더 분석 (Gender Analysis in Elderly Speech Signal Processing)

  • 이지연
    • 디지털융복합연구
    • /
    • 제16권10호
    • /
    • pp.351-356
    • /
    • 2018
  • 화로 인한 성대의 변화는 음성의 주파수를 변화시킬 수 있으며, 그 노인음성 신호는 다양한 분석을 통해 정상음성 신호와 자동으로 구분할 수 있다. 본 연구의 목적은 기존 스마트 의료 시스템의 노령자 음성 인식 성능을 향상시키고, 음성을 이용한 편리한 인터페이스를 제공함으로써 빠르게 변화하고 있는 기술사회에서 제외될 수 있는 노인과 장애인들에게 쉽게 접근 할 수 있는 도구를 제공하는 것이다. 본 연구에서는 성 분석으로서, 연구 대상의 성별을 보고했고, 여성과 남성 음성 샘플 개수를 동일하게 사용하였다. 또한 젠더 분석을 적용하여 모든 연령의 목소리를 사용하지 않고 노령자의 목소리를 목표로 설정하여 실험을 수행하였다. 마지막으로, 우리는 성별 및 젠더 편견을 줄이기 위한 표준 및 참조 모델의 재검토 방법을 적용하였다. 본 연구에서는 70세에서 80세까지의 한국인 여성 10명과 남성 10명의 노령자 음성을 사용했다. 파형을 보고 직접 추출한 F0 값과 TF32와 Wavesufer 음성 분석 프로그램에서 추출된 F0를 비교했을 때, TF32보다 Wavesufer가 노인음성의 F0를 더 잘 분석하는 것을 알 수 있었다. 그러나 노령자 대상 노인음성용 음성분석프로그램이 필요하며, 노령자의 음성을 분석함으로써 기존 스마트 의료 시스템의 음성 인식 및 합성 성능을 향상시킬 수 있을 것으로 기대한다.

자연음 TTS(Text-To-Speech) 엔진 구현 (Implementation of TTS Engine for Natural Voice)

  • 조정호;김태은;임재환
    • 디지털콘텐츠학회 논문지
    • /
    • 제4권2호
    • /
    • pp.233-242
    • /
    • 2003
  • TTS(Text-To-Speech) 시스템은 텍스트 문장을 자연스러운 음성으로 출력하는 시스템이다. 자연스러운 음성을 출력하기 위해서 언어에 대한 전문적 지식을 비롯하여 많은 시간과 노력이 요구된다. 또한 영어의 음운 변환은 음소에 따라 형태소에 따라 의미에 따라 다양한 변환을 가진다. 이를 일괄적으로 처리하기란 매우 힘든 일이다. 이러한 문제들을 해결하기 위하여 모음과 자음의 변화의 규칙을 적용한 시스템을 구현한다. 이 시스템은 문장의 분석을 통해 분류하고 음소 규칙 데이터를 통해 자연스러운 음성을 출력하게 되는 이전 과정을 통해 특수문자나 숫자 등을 정규화하여 처리한다. 이렇게 처리된 문자 데이터를 운율규칙을 통해 최종 출력한다. 그 결과, 40개의 음소 규칙 데이터를 통해 보다. 정확한 음성을 출력할 수 있었으며, 시스템의 효율성도 높였다. 본 논문에서 제시한 시스템은 각종 통신장비와 자동화기기에 적용하여 다양한 분야에 활용될 수 있을 것이다.

  • PDF

AMR과 EVRC 음성부호화기를 위한 파라미터 직접 변환 방식의 상호부호화 알고리듬 (Transcoding Algorithm for AMR and EVRC Vocoders Via Direct Parameter Transformation)

  • 이선일;유창동
    • 대한전자공학회논문지SP
    • /
    • 제39권6호
    • /
    • pp.696-708
    • /
    • 2002
  • 본 논문에서는 AMR과 EVRC 음성부호화기를 위한 새로운 파라미터 직접 변환 방식의 상호부호화 알고리듬을 제안한다. 상호부호화를 위하여 부가적인 복호화, 부호화 과정을 거쳐야하는 기존의 Tandem 방식과 달리 제안된 파라미터 직접 변환 방식에서는 양 음성부호화기가 음성을 부호화하기 위하여 공통적으로 사용하는 파라미터들이 직접 변환된다. 제안된 알고리듬은 파라미터 복호화, 프레임 분류, 모드 결정, 그리고 두가지 프레임형을 위한 상호부호화기로 구성된다. 상호부호화기는 LSP, 프레임 에너지, 적응 코드북을 위한 피치 지연, 고정 코드북 벡터, 그리고 양 코드북의 이득을 변환한다. 제안된 알고리듬을 다양한 방법으로 평가해본 결과 기존의 Tandem 방식과 비교하여 계산량과 지연 시간을 줄이면서도 동등한 음질을 구현함을 확인할 수 있었다.

결정 트리를 이용한 ′이음표′ 문자화의 중의성 해소 (Disambiguating in Transliteration of some Text Symbols using Decision tree)

  • 정영임;이동훈;남현숙;윤애선;권혁철
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 봄 학술발표논문집 Vol.31 No.1 (B)
    • /
    • pp.940-942
    • /
    • 2004
  • 한국어 텍스트 음성합성에서 문장 기호의 문자화에 나타나는 오류는 기호의 중의성에 기인한다. 선행연구에서 규칙에 기반하여 중의성을 해결하는 방안이 제안되었으나 여전히 기호는 다양한 문맥에서 높은 중의성을 가지고 문자화된다. 따라서 본 연구에서는 신문 텍스트에 나타나는 문장 기호 중 이음표의 문자화를 이음표를 포함한 어절의 패턴, 패턴의 좌우에 위치하는 어절 정보 및 휴리스틱스 자질을 학습하여 제시된 이음표의 문자화의 중의성을 해소하는 방안을 제안하였다. 이를 위해 국내 1개 일간지 2년 치 기사에서 이음표를 포함한 어절 49,000여 개를 임의 추출하여 분석하였고, 분석된 자질을 자동추출하여 결정 트리를 구성하였다. 실험 결과, 96.2%~97.7%의 정확도를 보였다.

  • PDF

모바일 리치미디어 방송 기술 (Mobile Richmedia Broadcasting Technology)

  • 차지훈;이인재;박상택;문경애;홍진우
    • 전자통신동향분석
    • /
    • 제23권3호
    • /
    • pp.96-105
    • /
    • 2008
  • 최근 WiBro, HSDPA 등의 통신망을 통한 휴대 인터넷이 광대역화 되고, 방송 기술의 디지털화로 인해 기존의 단순 AV 중심의 모바일 방송 서비스를 탈피하여 음성, 영상, 이미지, 텍스트 등의 다양한 멀티미디어 서비스 제공과 이들간의 대화형 기능을 제공하는 리치미디어 서비스가 각광을 받고 있다. 이러한 응용 분야를 위해서 다양한 멀티미디어 데이터의 시공간적인 배치 및 동기화를 위한 기술 규격으로 MPEG-4에서는 BIFS와 LASeR를 제공한다. BIFS는 2D 및 3D를 포함하는 보다 광범위한 멀티미디어 콘텐츠에 대한 장면 기술 표준이며, LASeR는 자원이 부족한 휴대전화와 같이 디스플레이 크기가 작고, 네트워크 대역폭도 작은 단말을 대상으로 하는 2D 전용의 장면 시술 표준이다. 본 고에서는 제한된 대역폭과 낮은 성능의 단말과 같은 모바일 방송통신 환경에서 리치미디어 방송 서비스를 제공하기 위한 최신 리치미디어 방송 서비스를 위한 요소기술 및 표준화 동향을 살펴보고, 최신 리치미디어의 국제표준인 LASeR에 기반한 모바일 리치미디어 방송 기술 개발 현황에 대하여 살펴본다.

메트로 이더넷용 상하향 동일 파장의 단심 양방향 버스형 WDM-EPON 시스템 (Bidirectional Bus-type WDM-EPON system over Single strand fiber using the same wavelength for each channel for Metro Ethernet)

  • 박노욱;전만식;서준혁;김건우;김영필;이종훈;송재원;강승민
    • 한국광학회:학술대회논문집
    • /
    • 한국광학회 2003년도 제14회 정기총회 및 03년 동계학술발표회
    • /
    • pp.312-313
    • /
    • 2003
  • 최근 인터넷 트래픽의 증가와 음성, 데이터, 동영상과 같은 다양한 멀티미디어 서비스의 영향으로 가입자망의 고속화가 요구되고 있다. 인터넷 트래픽을 효율적으로 가입자에게 제공하기 위해서는 광을 이용한 통신이 이루어져야 한다. 이를 위하여 다양한 기술들이 제시되고 있으며, 경제적인 측면과 구성의 용이성을 고려한 광 가입자망인 PON(Passive Optical Network)에 대한 관심이 고조되고 있다. 본 논문에서는 파장 분할 다중화 방식으로 단심 상하향 동일파장을 사용하여 소요되는 광섬유의 비용을 반으로 줄이고, 채널당 전송용량을 두 배로 높일 수 있는 매트로 이더넷용 단심 양방향 버스형 WDM-EPON 시스템에 대한 연구를 하고자 한다. (중략)

  • PDF