• 제목/요약/키워드: Audio enhancement

검색결과 59건 처리시간 0.028초

가상음장 재현을 위한 근거리 머리전달함수 측정 및 해석 (Measurement and analysis of the near-field HRTFs for virtual audio enhancement)

  • 신기훈;박영진
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 2004년도 추계학술발표대회논문집 제23권 2호
    • /
    • pp.335-338
    • /
    • 2004
  • 효과적인 가상음장 재현을 위한 머리전달함수(Head Related Transfer Function: HRTF) 측정 시도는 1994년에 이루어진 MIT의 Bill Gardner에 의한 KEMAR 머리전달 함수 측정 이후 이미 여러 차례에 걸쳐 이루어졌다. 그러나 대부분의 시도는 음원이 머리중심점에서 1 m 이 후에 위치한 원거리에 국한되었고 음원이 1 m나 그 이내에 위치한 근거리에서의 측정은 스피커에서 반사된 음파가 dummy head 나 피험자의 귀에 다시 들어가는 것을 막기 어려워 시도된바가 적으며 data 도 공개되지 않은 것이 현 실정이다. 음원이 머리중심점에서 1 m 보다 가까운 거리에 있는 경우 머리전달함수의 특성은 고도와 방위뿐만 아니라 거리에도 영향을 받는 것으로 알려져 있으며, 이를 알아보기 위해 무향실에 B&K HATS (Head and Torso Simulator)를 설치하고 단극음원에 가까우며 반사가 적은 스피커를 따로 제작하여 근거리 머리 전달함수를 측정하였고 이를 분석하였다.

  • PDF

지각적 특성을 이용한 저 비트오율 압축 오디오 음질개선 (Audio Quality Enhancement using Perceptual Property at a Low-bitrate Compression)

  • 차혁근;채병국;차형태
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 2004년도 추계학술발표대회논문집 제23권 2호
    • /
    • pp.275-278
    • /
    • 2004
  • 본 논문에서는 저 비트오율 압축 시 발생되는 신호 왜곡을 인간의 지각적 특성을 이용하여 음질을 개선하는 알고리즘을 제안한다. 저 비트오율 압축 과정에서 손실된 고주파 영역의 신호를 부가 정보를 사용하지 않고 손실되지 않은 영역의 정보를 사용하여 고주파 영역의 신호를 첨가함으로써 음질을 개선하였다. 비 손실 영역의 순음 및 비 순음 성분을 검출하여 손실영역에 해당 하모닉 성분을 청각 자극 에너지로 스케일 하여 새로운 신호를 첨가한다. 원 신호와 저 비트오율 압축으로 인해 왜곡된 신호, 그리고 본 논문의 알고리즘을 이용하여 개선된 신호를 신호 대 잡음 비를 측정하고 청감 테스트를 통해 음질 개선 효과를 확인하였다.

  • PDF

오디오 부호화의 성능 향상을 위한 가변 LPC 기술 (Adaptive LPC for Performance Enhancement of Audio Coding)

  • 함우규;구자성;김기준;강경옥;박호종
    • 한국방송∙미디어공학회:학술대회논문집
    • /
    • 한국방송공학회 2013년도 하계학술대회
    • /
    • pp.6-7
    • /
    • 2013
  • 저전송률 오디오 부호화기의 성능 향상을 위해 가변 LPC 기반으로 스펙트럼을 평탄화 하는 방법을 제안한다. 제안한 방법은 대역별 scale factor를 동일하게 하여 비트 효율을 증가시키고 spectral hole이 발생하는 문제점을 해결할 수 있다. 또한, 가변 LPC 필터를 사용하여 프레임 특성에 따라 스펙트럼 평탄화 강도를 가변적으로 조절하여 성능 향상을 제공한다. 제안한 방법이 일반 LPC 필터 방법보다 저대역의 부호화 성능을 향상시키고 스테레오 왜곡을 감소시키는 것을 확인하였다.

  • PDF

스테레오 패닝 음원을 위한 음원 분리 알고리즘 (A Source Separation Algorithm for Stereo Panning Sources)

  • 백용현;박영철
    • 한국정보전자통신기술학회논문지
    • /
    • 제4권2호
    • /
    • pp.77-82
    • /
    • 2011
  • 본 논문에서는 패닝 기법을 이용하여 믹싱된 스테레오 음원에서 음원을 분리하는 방법에 대하여 고찰한다. 음원 분리 알고리즘은 다채널 포맷 변환을 위한 업믹스나 음질 개선, 고품질 음원 분리 등 다양한 응용분야에 사용될 수 있다. 본 논문에서 사용하는 음원 분리 알고리즘은 믹싱된 스테레오 채널을 시간-주파수 별로 PCA(Principal Component Analysis) 분석 방법을 이용하여 각각의 음원들이 패닝된 방향을 추정하며, 추정된 방향의 성분만을 추출하는 방향 필터링 과정을 거쳐 음원들을 독립적으로 분리 해 낸다. 실험을 통해 각 음원 분리 알고리즘의 성능을 평가하였다.

Digital enhancement of pronunciation assessment: Automated speech recognition and human raters

  • Miran Kim
    • 말소리와 음성과학
    • /
    • 제15권2호
    • /
    • pp.13-20
    • /
    • 2023
  • This study explores the potential of automated speech recognition (ASR) in assessing English learners' pronunciation. We employed ASR technology, acknowledged for its impartiality and consistent results, to analyze speech audio files, including synthesized speech, both native-like English and Korean-accented English, and speech recordings from a native English speaker. Through this analysis, we establish baseline values for the word error rate (WER). These were then compared with those obtained for human raters in perception experiments that assessed the speech productions of 30 first-year college students before and after taking a pronunciation course. Our sub-group analyses revealed positive training effects for Whisper, an ASR tool, and human raters, and identified distinct human rater strategies in different assessment aspects, such as proficiency, intelligibility, accuracy, and comprehensibility, that were not observed in ASR. Despite such challenges as recognizing accented speech traits, our findings suggest that digital tools such as ASR can streamline the pronunciation assessment process. With ongoing advancements in ASR technology, its potential as not only an assessment aid but also a self-directed learning tool for pronunciation feedback merits further exploration.

멀티캐스트 화상회의를 위한 3-D 음향시스템 설계 (Design of a Three Dimensional Audio System for Multicast Conferencing)

  • 김영오;고대식
    • 한국통신학회논문지
    • /
    • 제25권1B호
    • /
    • pp.71-76
    • /
    • 2000
  • 다수의 참여자가 존재하는 멀티미디어 화상회의 시스템에서, 참여자의 얼굴은 화상을 통하여 쉽게 구별할 수 있지만, 음성의 경우는 모든 참여자의 음성이 1차원적으로 처리되기 때문에 참여자의 구분이 어렵고 공간적인 실감을 느끼지 못한다. 본 논문에서는 HRTF(Head Realted Transfer Function: 머리전달 함수)와 거리감 재생 기법을 이용한 3-D 음향재현 시스템을 구현하고, 멀티캐스트 화상회의 시스템의 적절한 화자 배치를 연구분석하였다. 고도각과 수평각을 이용한 청취실험결과, 수평각이 고도각에 비하여 양호한 방향감 구별 인지도를 보였으며, 특히 4명의 참여자가 존재하는 화상회의 시스템의 경우 $10^{\circ}$, 90$^{\circ}$, 270$^{\circ}$, 350$^{\circ}$의 HRTF를 이용한 공간배치가 효율적인 것을 확인하였다. 끝으로 5인 이상의 참여자가 존재하는 경우와 현실감의 개선을 위하여 거리감이 이용될 수 있음을 제안한다.

  • PDF

가변 잡음 레벨을 이용한 음성신호에 대한 SBR 성능 항상 기술 (Enhancement of SBR for Speech Signal Using Adaptive Noise Floor Level)

  • 이세원;오승준;안창범;이태진;강경옥;박호종
    • 한국음향학회지
    • /
    • 제28권2호
    • /
    • pp.148-154
    • /
    • 2009
  • 오디오 부호화 기술에서 SBR은 고대역의 시판-주파수 정보를 저대역으로부터 구하고 보정 파라미터를 이용하여 고대역 정보를 보정하여 고대역 신호를 합성하는 기술이다. SBR은 고대역 정보의 부호화를 위하여 보정 파라미터만 전달하므로 매우 적은 비트로 오디오 신호를 압축할 수 있도록 하며, MPEG-4 HE-AAC의 핵심 모듈로 사용되고 있다. SBR은 원래 오디오 신호를 기반으로 개발되었기 때문에 음성 입력에 대하여 성능이 저하되는 문제점을 가지며, 성능 저하의 대표적인 이유는 톤 성질이 부정확하게 계산되어 잡음 레벨이 높게 설정되고 복원된 고대역 정좌에 과도한 잡음이 포함되기 때문이다. 본 논문에서는 음성 신호에 대한 SBR 성능 저하 문제를 해결하기 위하여 잡음 레벨을 입력 음성 신호의 특성에 맞게 가변적으로 적용하는 기술을 제안한다. 제안하는 SBR은 기존의 SBR과 호환성을 유지하며, 주관적 평가를 통하여 기존 SBR에 비하여 남성 음성에 대한 성능이 향상된 것을 확인하였다.

위상 일치와 가변 지수 감쇠 가중치 부여 방법이 적용된 가상 저음 시스템 (Phase-matched Harmonic Generation and Variable Slope Exponential Weighting for Virtual Bass System)

  • 문현기;박영철;황영수
    • 방송공학회논문지
    • /
    • 제21권6호
    • /
    • pp.889-898
    • /
    • 2016
  • 가상 저음 시스템은 기본 주파수 성분의 배음을 생성하여 스피커의 저역 재생 대역을 확장하는 방법으로 소형 스피커에 널리 사용된다. 가상 저음 시스템의 주관적인 성능은 배음의 가중치 부여 방법과 관련이 높기 때문에, 기존 연구에서는 지수 감쇠 가중치 부여 방법과 음색 매칭 방법 등 다양한 가중치 부여 방법이 제안되었다. 그러나 생성한 배음과 기존 신호간의 위상을 맞추지 않을 경우 정확한 가중치 부여가 불가능하다. 본 논문에서는 기존 가중치 부여 방법의 한계점을 분석하고 이를 개선한 가중치 부여 방법을 제안하였다. 제안한 방법은 생성한 배음의 위상을 기존신호의 위상과 일치시키고, 기본 주파수에 따라 배음 가중치를 가변적으로 부여하는 방법이다. 기존 가상 저음 시스템과 객관 및 주관 비교 평가를 수행한 결과, 위상 일치 방법은 자연스럽고 효과적인 저역강화에 필수적임을 확인하였으며, 제안한 배음 가중치 부여 방법은 제한된 상황에서 기존 가중치 부여 방법보다 효과적임을 확인하였다.

잡음 환경에서의 음성인식을 위한 온라인 빔포밍과 스펙트럼 감산의 결합 (Combining deep learning-based online beamforming with spectral subtraction for speech recognition in noisy environments)

  • 윤성욱;권오욱
    • 한국음향학회지
    • /
    • 제40권5호
    • /
    • pp.439-451
    • /
    • 2021
  • 본 논문에서는 실제 환경에서의 연속 음성 강화를 위한 딥러닝 기반 온라인 빔포밍 알고리듬과 스펙트럼 감산을 결합한 빔포머를 제안한다. 기존 빔포밍 시스템은 컴퓨터에서 음성과 잡음을 완전히 겹친 방식으로 혼합하여 생성된 사전 분할 오디오 신호를 사용하여 대부분 평가되었다. 하지만 실제 환경에서는 시간 축으로 음성 발화가 띄엄띄엄 발성되기 때문에, 음성이 없는 잡음 신호가 시스템에 입력되면 기존 빔포밍 알고리듬의 성능이 저하된다. 이러한 효과를 경감하기 위하여, 심층 학습 기반 온라인 빔포밍 알고리듬과 스펙트럼 감산을 결합하였다. 잡음 환경에서 온라인 빔포밍 알고리듬을 평가하기 위해 연속 음성 강화 세트를 구성하였다. 평가 세트는 CHiME3 평가 세트에서 추출한 음성 발화와 CHiME3 배경 잡음 및 MUSDB에서 추출한 연속 재생되는 배경음악을 혼합하여 구성되었다. 음성인식기로는 Kaldi 기반 툴킷 및 구글 웹 음성인식기를 사용하였다. 제안한 온라인 빔포밍 알고리듬 과 스펙트럼 감산이 베이스라인 빔포밍 알고리듬에 비해 성능 향상을 보임을 확인하였다.

차량 주행소음을 고려한 자동차 오디오 음질 개선법 연구 (A Study on the Car Audio Sound Qualify Enhancement under Vehicle Noise)

  • 박석태;김경환;이종규
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1999년도 학술발표대회 논문집 제18권 1호
    • /
    • pp.274-277
    • /
    • 1999
  • 자동차 오디오는 차량의 상품성에 큰 영향을 미치고 있다. 고급 차량일수륵 또한 젊은 층일수록 차량 구매시 선택의 기준이 되기도 한다 그러나 자동차 오디오는 크게 두가지 면에서 가정용 오디오와 차이가 있다. 첫번째는 청취공간이 매우 헙소하다는 것이고 둘째로는 주행시 차량소음이 차 실내로 유입되어 오디오 음질에 영향을 미친다. 차 실내는 즘은 공간 음향폭성으로 인한 음향 dip 현상이 발생하며 이는 오디오 음질의 왜곡을 가져오므로 이를 개선하기 위해서는 라우드스피커 최적배치 뿐 아니라 주행소음에 대한 시험 및 분석을 하여 오디오 음질에 영향을 주는 주파수 밴드를 파악하여야 한다 본 논문에서는 오디오 음에 차량소음이 섞인 경우에 대하여 차량의 라우드스피커 위치는 변경하지 않고 라우드스피커의 주파수 밴드별 출력을 디지털필터를 이용하여 수정하는 방법으로 음질 개선을 제안하였다. 디지털 필터의 보정치는 차량 주행소음 특성과 차 실내 음향특성을 고려하였다. 차량소음을 섞은 주파수 옥타브 밴드 분석법을 이용한 객관적인 분석과 감성적 분석법인 NCB곡선으로 차량소음을 분식하여 디지털 필터 보정치를 구하는데 사용하였다. 제안한 9가지 디지털 필터를 이용하여 차량소음과 음악을 합성하였고 이중에서 좋은 음질에 대한 판정을 하기 위해 Scheffe가 제안한 7점 주관 평가법을 사용하여 64명이 내린 주관평가를 수행하였다.

  • PDF