• 제목/요약/키워드: 음성 특성

검색결과 1,835건 처리시간 0.03초

엔터테인먼트 로봇을 위한 음성으로부터 감정 인식 및 표현 모듈 개발 (Development of Emotion Recognition and Expression module with Speech Signal for Entertainment Robot)

  • 문병현;양현창;심귀보
    • 한국지능시스템학회:학술대회논문집
    • /
    • 한국지능시스템학회 2007년도 추계학술대회 학술발표 논문집
    • /
    • pp.82-85
    • /
    • 2007
  • 현재 가정을 비롯한 여러 분야에서 서비스 로봇(청소 로봇, 애완용 로봇, 멀티미디어 로봇 둥)의 사용이 증가하고 있는 시장상황을 보이고 있다. 개인용 서비스 로봇은 인간 친화적 특성을 가져야 그 선호도가 높아질 수 있는데 이를 위해서 사용자의 감정 인식 및 표현 기술은 필수적인 요소이다. 사람들의 감정 인식을 위해 많은 연구자들은 음성, 사람의 얼굴 표정, 생체신호, 제스쳐를 통해서 사람들의 감정 인식을 하고 있다. 특히, 음성을 인식하고 적용하는 것에 관한 연구가 활발히 진행되고 있다. 본 논문은 감정 인식 시스템을 두 가지 방법으로 제안하였다. 현재 많이 개발 되어지고 있는 음성인식 모듈을 사용하여 단어별 감정을 분류하여 감정 표현 시스템에 적용하는 것과 마이크로폰을 통해 습득된 음성신호로부터 특정들을 검출하여 Bayesian Learning(BL)을 적용시켜 normal, happy, sad, surprise, anger 등 5가지의 감정 상태로 패턴 분류를 한 후 이것을 동적 감정 표현 알고리즘의 입력값으로 하여 dynamic emotion space에 사람의 감정을 표현할 수 있는 ARM 플랫폼 기반의 음성 인식 및 감정 표현 시스템 제안한 것이다.

  • PDF

핫스팟지역에서 협동방식 블루투스기지국의 제안과 성능분석 (A Proposal of Collaborating Bluetooth Basestation in Hot Spot Area with Its Performance Analysis)

  • 김동원;조동욱;류원
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2003년도 춘계학술발표논문집 (중)
    • /
    • pp.1369-1372
    • /
    • 2003
  • 가까운 장래에 싼 가격의 블루투스가 여러 가지 이동, 휴대 장치에 내장되어 다양한 응용서비스를 제공할 것이다. 본 논문에서는 공항이나 쇼핑몰 등 사람들이 많이 몰리는 공공장소와 같은 핫스팟(hot spot) 지역에서 블루투스 기지국을 통한 음성서비스 제공을 위하여 다수의 기지국을 유서 LAN으로 협동시켜 각각 기지국별로 따로 제공되던 음성 채널들을 집합화(aggregation) 함으로써 보다 많은 음성 서비스 채널들을 동시에 수용할 수 있는 방법을 제시하고 성능을 분석하였다. 단독으로 동작하는 기지국은 ACL채널을 사용하는 경우 7개까지의 채널 수용이 가능하므로 이상적인 경우에서도 오버랩 영역의 기지국의 개수가 n이면 7n 만큼 채널의 증가가 가능한 반면 협동으로 동작하면 블록킹 율도 개선되면서 집합화된 채널들을 보간(interpolation) 기법을 통한 통계적 사용으로 음성 패킷의 허용 손실 범위 내에서 음성채널의 수를 약 14n 정도까지 확장할 수 있다. 또한 음성전송과 데이터 전송이 혼합 서비스 될 때 수용하는 음성 채널의 수에 따른 데이터 전송지연시간 특성을 분석하였다.

  • PDF

한국어 음성 웹브라우저 설계 및 구현 (Design and Implementation of Korean Voice Web Browser)

  • 장영건;조경환
    • 한국정보과학회논문지:컴퓨팅의 실제 및 레터
    • /
    • 제7권5호
    • /
    • pp.458-466
    • /
    • 2001
  • 본 논문은 HTML을 분석하여 추출된 내용을 음성으로 변환시키고, 웹 브라우저 제어 및 웹문서의 내용 지정을 위하여 음성인식을 사용하는 음성 웹 부라우저의 설계와 구현에 관한 것이다. 이 시스템의 특징은 보편적 설계기법을 사용하여 정상인과 시각장애인을 모두 고려하여 설계되었으며, 특히 시각장애인 인터페이스를 위하여 웹 문서의 구조를 쉽게 인식할 수 있는 트리 구조를 도입하였고, 웹 브라우저 상에 태그로 표현된 모든 요소를 추출하고, 각 요소에 따라 출력음성의 속성을 다르게 하여 별도의 요소 안내음성 출력이 없이 요소 특성을 인지할 수 있게 하였다. 이 방식은 음성 특징을 세부적으로 표현할 수 있는 청각 스타일 시트의 사용을 배제한 것으로써 웹 문서 작성자가 특별한 추가적 노력 없이, 사용자가 문서내의 구조와 요소들의 특징을 쉽게 인식할 수 있는 장점이 있다.

  • PDF

음성 신호의 주파수 대역별 자기 공분산 기울기 분포 (Distribution of the Slopes of Autocovariances of Speech Signals in Frequency Bands)

  • 김선일
    • 한국정보통신학회논문지
    • /
    • 제17권5호
    • /
    • pp.1076-1082
    • /
    • 2013
  • 자기 공분산 기울기를 이용하여 음성 신호와 배경 잡음 신호를 구분할 때 구분 가능성을 높이기 위해 주파수 영역에서 음성 신호의 자기 공분산 기울기를 최대화하는 주파수 대역을 찾아내었다. 디지털 샘플링 된 음성 신호를 일정한 개수의 신호로 이루어진 블록으로 나눈 후 각 블록에 고속푸리에변환(Fast Fourier Transform, FFT)을 하여 주파수 영역으로 변환한 다음 임의의 주파수 대역에서 각 블록에서의 공분산을 구하고 이 공분산 값들을 연결하는 직선 근사를 한 후에 이 직선의 기울기를 자기 공분산 기울기로 사용하는데 이 값은 음성 신호의 특성 상 주파수 대역별로 차이가 있다. 따라서 어느 주파수 대역에서 자기 공분산 기울기가 크게 나타나는지 200개의 남성 음성 파일을 이용하여 주파수 대역별로 비교 분석하였다.

음성 분석 정보값 비교를 통한 사상체질 태음인의 분류 (Classification of Sasang Constitution Taeumin by Comparative of Speech Signals Analysis)

  • 김봉현;이세환;조동욱
    • 정보처리학회논문지B
    • /
    • 제15B권1호
    • /
    • pp.17-24
    • /
    • 2008
  • 본 논문에서는 사상 체질 분류를 음성 분석 정보값의 비교, 분석을 통해 제안하고자 한다. 이를 위해 본 논문에서는 사상체질의 객관적 지표를 마련하기 위한 전체 시스템 구성 중 1차 단계로써 피부 진단을 통한 소음인의 분류 과정과 연계하여 음성 신호 분석에서 발생하는 정보의 출력값에 의해 태음인을 분류하는 방법을 제안하고자 한다. 우선 각 사상 체질별로 뚜렷한 특징을 보유하고 있는 집단군을 구성하고 이들의 음성 특성을 분류하여 음성학적 요소를 추출하고자 한다. 또한 출력된 결과값을 토대로 체질 집단별 차이점과 유사점을 통하여 태음인을 분류하고자 한다. 끝으로 실험에 의해 제안한 방법의 유용성을 입증하고자 한다.

한국어 음성인식 후처리를 위한 주의집중 기반의 멀티모달 모델 (Attention based multimodal model for Korean speech recognition post-editing)

  • 정영석;오병두;허탁성;최정명;김유섭
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2020년도 제32회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.145-150
    • /
    • 2020
  • 최근 음성인식 분야에서 신경망 기반의 종단간 모델이 제안되고 있다. 해당 모델들은 음성을 직접 입력받아 전사된 문장을 생성한다. 음성을 직접 입력받는 모델의 특성상 데이터의 품질이 모델의 성능에 많은 영향을 준다. 본 논문에서는 이러한 종단간 모델의 문제점을 해결하고자 음성인식 결과를 후처리하기 위한 멀티모달 기반 모델을 제안한다. 제안 모델은 음성과 전사된 문장을 입력 받는다. 입력된 각각의 데이터는 Encoder를 통해 자질을 추출하고 주의집중 메커니즘을 통해 Decoder로 추출된 정보를 전달한다. Decoder에서는 전달받은 주의집중 메커니즘의 결과를 바탕으로 후처리된 토큰을 생성한다. 본 논문에서는 후처리 모델의 성능을 평가하기 위해 word error rate를 사용했으며, 실험결과 Google cloud speech to text모델에 비해 word error rate가 8% 감소한 것을 확인했다.

  • PDF

MTF-STI를 이용한 유리창 도청음의 명료도 분석 (Intelligibility Analysis on the Eavesdropping Sound of Glass Windows Using MTF-STI)

  • 김희동;김윤호;김석현
    • 한국음향학회지
    • /
    • 제26권1호
    • /
    • pp.8-15
    • /
    • 2007
  • 음향 공동-유리창 연성계를 대상으로 도청음의 음성 명료도를 검토한다. MLS신호를 음원으로 유리창의 가속도와 속도 응답을 가속도계와 레이저 도플러 진동계를 사용하여 측정한다. 변조전송함수 (MTF)를 사용하여 공동-유리창 진동계의 음성전달특성을 규명한다. 변조전송함수에 근거하여 음성전송지수 (STI)를 구하고, 유리창 진동음의 음성명료도를 평가한다. 가속도음과 속도음의 음성명료도를 비교하고, 최종적으로 대화음의 명료도를 주관적 평가로 확인한다.

인체 내부에서의 진동 전달특성 분석 (An Analysis of the Vibration Characteristics through the Human Body)

  • 전종원;진용옥
    • 한국음향학회지
    • /
    • 제19권7호
    • /
    • pp.59-65
    • /
    • 2000
  • 본 논문은 음성진단이나 치료를 위한 기초연구로서, 인체의 진동신호를 측정하여 그 특성을 분석한 것이다. 가진신호는 외부적인 힘이 아닌 자신의 음성이며, 진동과 공진 특성이 강한 모음 '아', '에', '이', '오', '우'를 적용하여 실험하였다. 실험장치로는 마이크로폰과 가속도계 그리고 증폭기를 이용하였으며 컴퓨터에 측정 데이터를 저장하였다. 마이크로폰으로 음성신호를 저장하면서 동시에 가속도계를 이용하여 인체 각 부위에서의 진동신호를 측정하였으며 측정 위치는 머리, 목, 몸체를 일정한 간격으로 나누어 총 63개의 위치로 정하였다. 진동 신호의 측정 위치와 횟수는 사용 목적에 따라 충분히 가변적일 수 있다. 진동 분석을 위한 파라미터는 진동 신호의 크기, 위상, 기본 진동수, 결집음폭대이며, 코히어런스 함수를 이용하여 인체의 진동신호와 음성과의 상관성을 알아보았다. 실험결과, 인체의 위치에 따라 독특한 특징들이 있음을 확인하였으며, 그 결과를 제시하였다.

  • PDF

다이폰 군집화와 개선된 스펙트럼 완만화에 의한 음성합성 (Speech Synthesis using Diphone Clustering and Improved Spectral Smoothing)

  • 장효종;김관중;김계영;최형일
    • 정보처리학회논문지B
    • /
    • 제10B권6호
    • /
    • pp.665-672
    • /
    • 2003
  • 본 논문에서는 단위음소들의 연결을 통한 음성합성 방법에 관하여 기술한다. 이때, 발생하는 가장 큰 문제점은 두 단위음소 사이의 연결부분에서 불연속이 발생하는 것이며, 특히 다른 화자로부터 녹음한 단위음소의 연결에서 불연속이 많이 발생한다. 이 문제를 해결하기 위하여 본 논문에서는 군집화된 다이폰을 이용하며, 포만트 궤적과 스펙트럼의 분포특성을 사용할 뿐 아니라 인간의 청각적인 특성을 반영하여 스펙트럼을 완만화하는 방법을 제안한다. 즉, 제안하는 방법은 단위음소 연결구간의 스펙트럼 분포특성의 유사도를 사용하여 단위음소들을 군집화하고 단위음소의 연결 구간에서 인간의 청각신경 특성을 고려하여 완만화의 양과 범위를 결정한 다음, 두 다이폰 경계의 스펙트럼 분포를 시간에 따라 가중치를 다르게 주어 스펙트럼 완만화를 수행한다. 이 방법은 불연속을 제거하며 완만화로 인하여 발생할 수 있는 음성의 왜곡을 최소화한다. 제안하는 방법의 성능을 평가하기 위하여 5명으로부터 녹음한 20개의 문장 중에서 추출한 500여 개의 다이폰을 사용하여 실험을 수행하였다.

음색변경을 위한 피치시점 검출에 관한 연구 (On a Detection of Pitch Point for Voice Color Conversion)

  • 박형빈;배명진
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 2000년도 하계학술발표대회 논문집 제19권 1호
    • /
    • pp.149-152
    • /
    • 2000
  • 음성신호처리분야에서 피치시점 검출은 음성 합성시에 여기원의 특성을 나타내어 음질의 자연성을 결정한다. 이에 본 논문에서는 음색 변경시에 운율조절에 필요한 피치시점 검출법을 제안한다. 제안한 방법은 시간영역에서 직접 처리하기 때문에 피치동기분석이 용이하고 다른 영역으로의 변환과정이 불필요하다. 또한 기존의 피치시점검출 방법에서는 결정논리를 실험적인 문턱 값이나 무게치를 적용하여 처리하는 반면에 제안한 방법은 분석구간별로 얻어지는 주기적인 성문특성을 적용하여서 정확한 피치시점을 검출할 수 있었다

  • PDF