• 제목/요약/키워드: Auditory Signal

검색결과 176건 처리시간 0.026초

식별함수를 이용한 오디오신호의 내용기반 분류 (Content Based Classification of Audio Signal using Discriminant Function)

  • 김영섭;이광석;고시영;허강인
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국해양정보통신학회 2007년도 춘계종합학술대회
    • /
    • pp.201-204
    • /
    • 2007
  • 본 논문은 오디오 색인 검색 시스템을 구현하기 위하여 오디오 신호에 대한 특징 파라미터 풀(pool)을 구성하고, 구성되어진 특징 파라미터 풀을 이용한 오디오 데이터의 내용분석 및 분류에 관한 연구이다. 오디오 데이터는 기본적으로 다양한 형태의 오디오 신호로서 분류되어진다. 본 논문에서는 오디오 데이터의 분류에 이용 가능한 특징 파라미터를 분석하고 추출하는 방법에 대하여 논한다. 그리고 특징 파라미터 풀을 색인 그룹 단위로 구성하여 오디오 카테고리에 대한, 설정된 특징들의 포함 정도와 색인기준을 오디오 데이터의 내용을 중심으로 비교, 분석한다. 그리고 마지막으로 위의 결과를 바탕으로 분류카테고리 별로 오디오 데이터의 특징 벡터를 구성한 뒤 이를 이용하여 식별함수 분류기를 통한 분류를 실험한다.

  • PDF

거리경관에 대한 청각적 이미지의 평가구조 - 대학생들의 음풍경 체험을 통한 의미론적 고찰 - (The Evaluation Structure of Auditory Images on the Streetscapes - The Semantic Issues of Soundscape based on the Students' Fieldwork -)

  • 한명호
    • 한국음향학회지
    • /
    • 제24권8호
    • /
    • pp.481-491
    • /
    • 2005
  • 이 연구의 목적은 사운드스케이프의 의미론적 관점에 기초하여 도시의 거리경관에 관한 청각적 이미지의 평가구조를 파악하는 것이다. 캡션평가법이라는 새로운 환경심리조사수법을 이용하여 2001년부터 2005년까지 총45명의 대학생이 남원시의 주요 거리를 걸으면서 듣고 느끼는 소리의 이미지 파악을 위한 현장조사에 참가하고, 그 결과 청각적 경관에 대한 요소, 특징, 인상 및 선호도 등을 포함한 다양한 자료를 얻을 수 있었다. 남원시에 있어서, 청각적 이미지의 구성 요소는 자연음, 그리고 기계음, 사회음, 지시음 등을 포함한 인공음으로 분류되고, 청각적 경관의 특징은 소리종류, 양태, 상황, 성질, 주변관계, 이미지 등으로, 그리고 청각적 경관의 인상은 인간의 감성, 거리의 분위기, 소리 자체의 특성이라는 3가지 카테고리로 분류된다. 청각적 경관과 판단과의 관계로 부터, 청각적 경관의 요소, 특징, 인상 등은 긍정적, 중립적, 부정적 이미지 등의 항목으로 구성된다. 또한, 남원시의 거리경관의 평가구조모델로부터 그 장소 또는 공간의 청각적 이미지특성을 파악할 수 있었다.

Digital Watermarking Using Psychoacoustic Model

  • Poomdaeng, S.;Toomnark, S.;Amornraksa, T.
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 2002년도 ITC-CSCC -2
    • /
    • pp.872-875
    • /
    • 2002
  • A digital watermarking technique applying psychoacoustic model for audio signal is proposed in this paper. In the watermarking scheme, the pseudo-random bit stream used as a watermark signal is embedded into the audio signal in both speech and music. The strength of the embedded signal is subject to the human auditory system in such a way that the disturbances on host audio signal are beyond the sensing of human ears. The experimental results show that the quality of the watermarked audio signal, in term of signal to noise ratio, can be improved up to 3.2 dB.

  • PDF

감마톤 특징 추출 음향 모델을 이용한 음성 인식 성능 향상 (Speech Recognition Performance Improvement using Gamma-tone Feature Extraction Acoustic Model)

  • 안찬식;최기호
    • 디지털융복합연구
    • /
    • 제11권7호
    • /
    • pp.209-214
    • /
    • 2013
  • 음성 인식 시스템에서는 인식 성능 향상을 위한 방법으로 인간의 청취 능력을 인식 시스템에 접목하였으며 잡음 환경에서 음성 신호와 잡음을 분리하여 원하는 음성 신호만을 선택할 수 있도록 구성되었다. 하지만 실용적 측면에서 음성 인식 시스템의 성능 저하 요인으로 인식 환경 변화에 따른 잡음으로 인한 음성 검출이 정확하지 못하여 일어나는 것과 학습 모델이 일치하지 않는 것을 들 수 있다. 따라서 본 논문에서는 음성 인식 향상을 위해 감마톤을 이용하여 특징을 추출하고 음향 모델을 이용한 학습 모델을 제안하였다. 제안한 방법은 청각 장면 분석을 이용한 특징을 추출을 통해 인간의 청각 인지 능력을 반영하였으며 인식을 위한 학습 모델 과정에서 음향 모델을 이용하여 인식 성능을 향상시켰다. 성능 평가를 위해 잡음 환경의 -10dB, -5dB 신호에서 잡음 제거를 수행하여 SNR을 측정한 결과 3.12dB, 2.04dB의 성능이 향상됨을 확인하였다.

음소 인식을 위한 스파이크그램 기반의 음성 특성 추출 기술 (Speech Feature Extraction based on Spikegram for Phoneme Recognition)

  • 한석현;김재원;안순호;신성현;박호종
    • 방송공학회논문지
    • /
    • 제24권5호
    • /
    • pp.735-742
    • /
    • 2019
  • 본 논문에서는 스파이크그램을 기반으로 음소 인식을 위한 특성을 추출하는 방법을 제안한다. 음소 인식에 널리 사용되는 푸리에 변환 기반의 특성은 청각 기관의 동작에 부합하는 과정으로 구해지지 않으며 프레임 단위로 추출되어 높은 시간 해상도를 가지지 못한다. 따라서 음소 인식의 성능 향상을 위해 높은 시간 해상도를 가지면서 인간의 청각기관을 모델링 하는 새로운 음성 특성 추출 기술이 요구된다. 본 논문에서는 청각 기관의 특성 추출 및 전달 과정을 모델링 하는 기법인 스파이크그램을 사용하여 음성 신호를 분석하고, 이로부터 음소 인식을 위한 특성을 추출하는 방법을 제안한다. 심층 신경망 기반의 음소 인식기를 사용하여 제안한 특성의 음소 인식 성능을 측정하였고, 짧은 음소에 대해 제안 특성이 기존 푸리에 변환 기반의 특성보다 우수한 성능을 가지는 것을 확인하였다. 이 결과로부터 청각 모델을 기반으로 추출된 새로운 음성 특성을 사용하여 음소 인식이 가능함을 확인할 수 있다.

Masking Level Difference: Performance of School Children Aged 7-12 Years

  • de Carvalho, Nadia Giulian;do Amaral, Maria Isabel Ramos;de Barros, Vinicius Zuffo;dos Santos, Maria Francisca Colella
    • Journal of Audiology & Otology
    • /
    • 제25권2호
    • /
    • pp.65-71
    • /
    • 2021
  • Background and Objectives: In masking level difference (MLD), the masked detection threshold for a signal is determined as a function of the relative interaural differences between the signal and the masker. Study 1 analyzed the results of school-aged children with good school performance in the MLD test, and study 2 compared their results with those of a group of children with poor academic performance. Subjects and Methods: Study 1 was conducted with 47 school-aged children with good academic performance (GI) and study 2 was carried out with 32 school-aged children with poor academic performance (GII). The inclusion criteria adopted for both studies were hearing thresholds within normal limits in basic audiological evaluation. Study 1 also considered normal performance in the central auditory processing test battery and absence of auditory complaints and/or of attention, language or speech issues. The MLD test was administered with a pure pulsatile tone of 500 Hz, in a binaural mode and intensity of 50 dBSL, using a CD player and audiometer. Results: In study 1, no significant correlation was observed, considering the influence of the variables age and sex in relation to the results obtained in homophase (SoNo), antiphase (SπNo) and MLD threshold conditions. The final mean MLD threshold was 13.66 dB. In study 2, the variables did not influence the test performance either. There was a significant difference between test results in SπNo conditions of the two groups, while no differences were found both in SoNo conditions and the final result of MLD. Conclusions: In study 1, the cut-off criterion of school-aged children in the MLD test was 9.3 dB. The variables (sex and age) did not interfere with the MLD results. In study 2, school performance did not differ in the MLD results. GII group showed inferior results than GI group, only in SπNo condition.

Masking Level Difference: Performance of School Children Aged 7-12 Years

  • de Carvalho, Nadia Giulian;do Amaral, Maria Isabel Ramos;de Barros, Vinicius Zuffo;dos Santos, Maria Francisca Colella
    • 대한청각학회지
    • /
    • 제25권2호
    • /
    • pp.65-71
    • /
    • 2021
  • Background and Objectives: In masking level difference (MLD), the masked detection threshold for a signal is determined as a function of the relative interaural differences between the signal and the masker. Study 1 analyzed the results of school-aged children with good school performance in the MLD test, and study 2 compared their results with those of a group of children with poor academic performance. Subjects and Methods: Study 1 was conducted with 47 school-aged children with good academic performance (GI) and study 2 was carried out with 32 school-aged children with poor academic performance (GII). The inclusion criteria adopted for both studies were hearing thresholds within normal limits in basic audiological evaluation. Study 1 also considered normal performance in the central auditory processing test battery and absence of auditory complaints and/or of attention, language or speech issues. The MLD test was administered with a pure pulsatile tone of 500 Hz, in a binaural mode and intensity of 50 dBSL, using a CD player and audiometer. Results: In study 1, no significant correlation was observed, considering the influence of the variables age and sex in relation to the results obtained in homophase (SoNo), antiphase (SπNo) and MLD threshold conditions. The final mean MLD threshold was 13.66 dB. In study 2, the variables did not influence the test performance either. There was a significant difference between test results in SπNo conditions of the two groups, while no differences were found both in SoNo conditions and the final result of MLD. Conclusions: In study 1, the cut-off criterion of school-aged children in the MLD test was 9.3 dB. The variables (sex and age) did not interfere with the MLD results. In study 2, school performance did not differ in the MLD results. GII group showed inferior results than GI group, only in SπNo condition.

CASA 기반의 마이크간 전달함수 비 추정 알고리즘 (CASA Based Approach to Estimate Acoustic Transfer Function Ratios)

  • 신민규;고한석
    • 한국음향학회지
    • /
    • 제33권1호
    • /
    • pp.54-59
    • /
    • 2014
  • 본 논문은 비정상 (nonstationary)특성을 가지는 잡음환경에서 마이크간 전달함수 비 (RTF, Relative Transfer Function) 추정 알고리즘을 제안한다. 음성을 이용한 다양한 기기에 다중 마이크를 이용한 잡음제거 기술은 널리 사용되며, 이때 각 마이크간의 입력 신호 사이의 관계는 필수적으로 추정되어야 한다. 본 논문에서는 기존의 OM-LSA(Optimally-Modified Log-Spectral Amplitude)기반의 추정 방식에 CASA (Computational Auditory Scene Analysis)를 접목시킨 방식을 제안한다. 제안한 방법의 성능 검증을 위하여 비정상 백색 잡음 (nonstationary white Gaussian noise) 환경에서 10명 화자 발음을 이용한 마이크간 전달함수 비 추정 성능 평가 실험을 수행하였다. 잡음 신호가 초당 8dB 증감하는 환경에서 SBF (Signal Blocking Factor)가 평균 2.65dB 개선됨을 확인하였다.

Emotion recognition from speech using Gammatone auditory filterbank

  • 레바부이;이영구;이승룡
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2011년도 한국컴퓨터종합학술대회논문집 Vol.38 No.1(A)
    • /
    • pp.255-258
    • /
    • 2011
  • An application of Gammatone auditory filterbank for emotion recognition from speech is described in this paper. Gammatone filterbank is a bank of Gammatone filters which are used as a preprocessing stage before applying feature extraction methods to get the most relevant features for emotion recognition from speech. In the feature extraction step, the energy value of output signal of each filter is computed and combined with other of all filters to produce a feature vector for the learning step. A feature vector is estimated in a short time period of input speech signal to take the advantage of dependence on time domain. Finally, in the learning step, Hidden Markov Model (HMM) is used to create a model for each emotion class and recognize a particular input emotional speech. In the experiment, feature extraction based on Gammatone filterbank (GTF) shows the better outcomes in comparison with features based on Mel-Frequency Cepstral Coefficient (MFCC) which is a well-known feature extraction for speech recognition as well as emotion recognition from speech.

인지로봇 청각시스템을 위한 의사최적 이동음원 도래각 추적 필터 (Quasi-Optimal Linear Recursive DOA Tracking of Moving Acoustic Source for Cognitive Robot Auditory System)

  • 한슬기;나원상;황익호;박진배
    • 제어로봇시스템학회논문지
    • /
    • 제17권3호
    • /
    • pp.211-217
    • /
    • 2011
  • This paper proposes a quasi-optimal linear DOA (Direction-of-Arrival) estimator which is necessary for the development of a real-time robot auditory system tracking moving acoustic source. It is well known that the use of conventional nonlinear filtering schemes may result in the severe performance degradation of DOA estimation and not be preferable for real-time implementation. These are mainly due to the inherent nonlinearity of the acoustic signal model used for DOA estimation. This motivates us to consider a new uncertain linear acoustic signal model based on the linear prediction relation of a noisy sinusoid. Using the suggested measurement model, it is shown that the resultant DOA estimation problem is cast into the NCRKF (Non-Conservative Robust Kalman Filtering) problem [12]. NCRKF-based DOA estimator provides reliable DOA estimates of a fast moving acoustic source in spite of using the noise-corrupted measurement matrix in the filter recursion and, as well, it is suitable for real-time implementation because of its linear recursive filter structure. The computational efficiency and DOA estimation performance of the proposed method are evaluated through the computer simulations.