• 제목/요약/키워드: 심리음향모델

검색결과 71건 처리시간 0.023초

크로스토크 제거를 위한 바크스케일 등가 보상 필터를 이용한 음질 향상에 관한 연구 (A Study on the Sound Quality Improvement Using the Equal Compensation Filter in Bark-scale for the Cross-talk Cancellation)

  • 김학진;김순협
    • 정보처리학회논문지B
    • /
    • 제11B권3호
    • /
    • pp.345-352
    • /
    • 2004
  • 본 논문에서는 자유음장 모델을 기초로 5.1채널 스피커 시스템의 보상함수를 해석하고, 이를 심리음향에 기초한 바크 스케일(bark scale) 등 가 보상 밴드패스 필터에 적용하여 주파수 제한적인 음질 보상에 대한 실험을 통해 5.1채널 스피커 시스템에서 음향 재현시 나타나는 크로스토크를 제거함으로써 보다 입체적인 음을 재현하는 방법을 제안하였다. 정면 채널과 서라운드 채널의 음원을 기존의 2채널 및 5.1채널 시스템에서 제시하는 음원과 비교를 위하여 음질 평가와 함께 청취자를 대상으로 주관적인 평가를 실시하였다. 실험 결과 \pm30{\circ}$의 정면 스피커를 배치한 돌비 표준 스피커 배치에서 38dB 이상의 분리도를 얻었으며, 전문가 그룹의 음의 확산감에 대한 주관 평가에서는 5점 평가를 기준으로 0.4∼0.5점, 음의 깊이감 평가에서는 0.1∼0.2점이 향상되었다.

난청인의 통화 청취도 향상을 위한 전화기 개발 (A Development of Telephone for the Hearing Impaired to Improve Listening Ability of Telephone Speech)

  • 이상민;송철규;이영묵;김원기
    • 대한의용생체공학회:의공학회지
    • /
    • 제18권4호
    • /
    • pp.457-466
    • /
    • 1997
  • 청력장애인이 전화상의 말에 대한 청취력을 향상시킬수 있는 보청기능이 있는 전화기를 개발하였다. 최근 청력장애인이 늘어나고 있으며 생산자로서의 사회참여 욕구 또한 늘어나고 있는데 이들은 자신의 핸디캡을 메워줄 보조기기를 강력히 원하고 있다. 보청기능 전화기는 음성으로써 외부 정보를 획득할 수 있는 기본적인 통신 보조기기의 한 형태이다. 본 연구팀은 청력장애인의 청력특성을 분석하고 전화기에 청력 보상법을 적용함으로써 보청기능이 있는 새로운 모델의 전화기를 개발하였고 3가지 분야의 시험(전기적 시험, 단어 인지도 시험, 사용자 시험)을 수행하여 이 전화기의 유용성을 평가하였다. 새 전화기는 4개의 대역통과필터를 가지고 있으며 각 밴드의 중심주파수는 전화라인의 특성과 심리음향학적인 특성을 고려하여 500, 1000, 2000, 3000 Hz로 설정하였다. 청력장애인은 전화기의 증폭특성을 자신의 청력에 맞도록 피팅(fitting)할 수 있다. 즉 자신의 손실된 청력을 잘 보상하도록 4개 필터밴드에 대한 볼륨조절을 개별적으로 조정할 수 있다. 전화기의 전체 이득은 250~32000Hz 대역내에서 20㏈ 이상이다. 시험결과 새 모델의 전화기가 기존의 전화기보다 청력장애인의 전화음성 이해도를 향상 시킨다고 증명되었다. 향후 측음 및 잡음 억제, 주파수 대역분리, 청력패턴 보상과 심리음향적 라우드니스(loudness)보상에 대한 연구가 필요하며 공학과 임상 분야에서의 청력장애인의 언어 이지특성 연구를 통하여 더욱 발전된 전화기가 개발될 수 있다고 판단된다.

  • PDF

실시간 MPEG-1 오디오 인코더의 설계 및 구현 (A Design and Implementation of the Real-Time MPEG-1 Audio Encoder)

  • 전기용;이동호;조성호
    • 방송공학회논문지
    • /
    • 제2권1호
    • /
    • pp.8-15
    • /
    • 1997
  • 본 논문에서는 하나의 TMS320C31 Digital Signal Processor (DSP)를 사용하여 실시간으로 동작하는 Motion Picture Experts Group-1 (MPEG-1) 오디오 인코더 시스템을 구현하였다. 우선 MPEG-1 Audio Layer-2 및 심리음향모델-1 관련 기본 알고리듬을 C-언어로 구현하여 기본 동작을 확인하였다. 그리고 전체실행 시간을 줄이기 위하여, 이를 다시 Texas Instruments (Tl) 어셈블리어로 작성하였다. 마지막으로, MPEG-1 오디오 인코더 시스템을 위한 실제 DSP 하드웨어 회로 보드를 설계, 제작하였다. Analog-to-Digital Converter (ADC) 제어, 입출력 제어, 그리고 DSP 보드에서 PC로의 비트열 전송과 같은 주변 모듈들은 Very High Speed Hardware Description Language (VHDL)을 사용하여 Field Programmable Gate Array (FPGA)로 구현하였다. 제작된 시스템은 48 KHz로 샘플링 되는 스테레오 오디오 신호를 실시간으로 처리하여 192 kbps 비트율로 부호화된 비트열을 출력시킨다. 다양한 형태의 스테레오 오디오 신호를 통해, 제작된 오디오 인코더 시스템의 실시간 동작과 양질의 오디오 신호가 복원됨을 확인하였다.

  • PDF

향상된 버퍼 제어 방법을 사용한 3D 오디오 핵심 부호화기 (A 3D Audio Core-Codec Employing an Improved Buffer Control Method)

  • 김인철
    • 방송공학회논문지
    • /
    • 제25권2호
    • /
    • pp.233-241
    • /
    • 2020
  • 본 논문에서는 3DA 핵심 부호화기의 FD 처리부의 성능 향상을 위해 새로운 버퍼 제어 기법을 제안하였다. 제안한 버퍼 제어 기법은 3GPP의 심리음향 모델과 스펙트럼 공백 회피 기법을 포함한 율-왜곡 제어부를 채택하였다. 그런 다음, 활동성이 높은 프레임에 충실한 비트 할당이 이루어질 수 있도록 3GPP 버퍼 제어 방법을 수정하였다. 본 논문에서 제안한 버퍼 제어 방법의 성능은 MUSHRA 테스트를 통해 평가되었고, 그 결과 3DA RM9 및 3GPP AAC의 버퍼 제어 방법보다 우수한 성능을 보임을 입증한다.

시간-주파수 구조에 근거한 지각적 오디오 부호화기 (A Perceptual Audio Coder Based on Temporal-Spectral Structure)

  • 김기수;서호선;이준용;윤대희
    • 방송공학회논문지
    • /
    • 제1권1호
    • /
    • pp.67-73
    • /
    • 1996
  • 일반적으로 고음질 오디오 부호화 방법은 전통적인 데이터 압축 기법과 인간의청각 모델을 결합한 구조를 갖고 있다. 고음질 오디오 부호화에 사용되는 주요한 청각 특성은 주파수 영역에서의 마스킹 현상이므로 서브밴드 부호화나 변환 부호화와 같은 주파수 영역 방법들이 널리 사용된다[1][2]. 그러나 지금까지의 고음질 오디오 부호화에서 시간 영역 마스킹과 시간 영역 중복성을 제거하는 방법은 적용되지 않았다. 본 논문에서 제안한 오디오 데이터 압축 방법은 시간 및 주파수 영역에서 통계적, 지각적 중복성을 제거한다. 주파수 영역으로 변환된 오디오 신호는 6프레임으로 구성된 패킷으로 나뉘어진다. 한 패킷은 1536 샘플 ($256{\times}6$)로 되어 있으며 패킷 내에서의 중복성은 시간 및 주파수 영역에서 존재한다. 각 패킷에서 두 중복성이 동시에 제거되어진다. 심리음향 모델에 있어서도 세밀한 주파수 마스킹과 함께 시간 영역 마스킹을 고려하여 보다 정확한 결과를 얻을 수 있도록 향상되었다. 양자화를 위해서 각 패킷은 비선형적인 임계 대역과 시간적인 청각 특성을 반영할 수 있도록 설계된 부블럭으로 분할되었다. 따라서 낮은 비트율에서 고음질의 복원음을 얻을 수 있었다.

  • PDF

지각 오디오 부호화기에서의 스펙트럼 에너지 기반 톤 성분 검출 알고리듬 (Tonality Detection based on Spectrum Energy in Perceptual Audio Coder)

  • 이근섭;연규철;박영철;윤대희
    • 한국통신학회논문지
    • /
    • 제29권6C호
    • /
    • pp.770-776
    • /
    • 2004
  • 지각 오디오 부호화기는 신호의 지각적 중복성과 함께 지각에 무관한 성분들을 줄이기 위해 인간의 청각 특성인 마스킹 효과를 이용하여 부호화 과정에서 발생하는 양자화 잡음을 귀에 들리지 않는 수준 이하로 낮춘다. 이때 마스킹 하는 주체인 입력 신호의 특성이 들, 잡음 중 어떤 성분에 가까운지에 따라 주위의 작은 신호들을 마스킹하는 양이 달라지기 때문에 입력 신호의 특성을 알아내는 것은 지각 부호화기의 성능을 좌우하는 중요한 요소이다. 본 논문에서는 낮은 복잡도로 구현 가능한 새로운 톤 성분 검출 알고리듬을 제안하였다. 제안한 알고리듬은 MPEG 심리음향 모델-II 비해 초월함수가 적게 사용되며 사용되는 연산도 단순하기 때문에 낮은 복잡도의 부호화기 구현에 적합하다. 제안한 알고리듬은 다양한 신호들에 대해 성능평가가 수행되었으며, DSP를 사용한 구현 결과 약 3 MIPS 정도로 구현 가능하였다.

MPEG 오디오 부호화기를 위한 향상된 프리 에코 컨트롤 알고리듬 (Enhanced Pre echo Control Algorithm for MPEG Audio Coders)

  • 이창준;이재성;박영철
    • 방송공학회논문지
    • /
    • 제11권2호
    • /
    • pp.191-199
    • /
    • 2006
  • 본 논문은 심리음향 모델 II(PAM II)를 기반으로 한 MPEG 오디오 코더에 대해서 효율적으로 프리 에코(pre echo)를 제어하는 알고리듬을 제안한다. 프리 에코 제어는 PAM II에서 마스킹 임계값 계산의 마지막 단계로써, 현재 프레임에 대해서 발생하는 양자화 오차를 최소화시키는 역할을 한다. 기존에 부호화기에서 프리 에코는 추정되는 마스킹 임계치가 이전 프레임에서 얻어진 값을 넘지 않도록 제한함으로써 결정된다. 기존의 방법에서 사용되는 프리 에코 제어는 단구간 블록(short block)은 물론 장구간 블록(long block)에 대해서도 사용되는데, 이는 마스킹 임계값을 불필요하게 떨어뜨려 전체적인 양자화 잡음 레벨을 높이는 문제를 발생시킨다. 본 논문에서는 이러한 문제를 해결할 수 있는 효율적인 프리 에코 제어 과정을 제안하였다. 음질 테스트 결과에서 변화가 심한 오디오 신호에 대해서 ITU R 테스트를 시행한 결과 제안된 방법이 평균적으로 0.4점 이상 개선된 결과를 보였다.

MPEG 통합 음성/오디오 코덱을 위한 오픈 소스 부호화 기술에 관한 연구 (Research on Open Source Encoding Technology for MPEG Unified Speech and Audio Coding)

  • 송정욱;이준일;강홍구
    • 전자공학회논문지
    • /
    • 제50권1호
    • /
    • pp.86-96
    • /
    • 2013
  • 통합 음성/오디오 부호화기 (Unified Speech and Audio Coding, USAC)는 2011년 MPEG에서 FDIS (Final Draft International Standard)를 승인받은 최고 성능의 통합 음성/오디오 부호화기이다. 전통적으로 MPEG에서는 복호화기 기술만 표준화하므로 인코더 기술에 대한 고찰이 쉽지 않을 뿐 아니라, 예제로 공개하는 인코더 (Reference Model, RM)의 경우에도 기본 아이디어만을 포함하고 있기 때문에 이를 사용할 경우 성능 저하가 매우 심각하다. 성능 열화는 매우 심각하다. 이러한 문제를 최소화하기 위해 오픈 소스 기반으로 진행되고 있는 프로젝트 JAME에서는 USAC에 적용된 핵심 인코더 기술의 성능을 최대화 할 수 있는 방법을 제안하고 있다. 본 논문에서는 입력 신호에 따라 두 코더가 선택적으로 동작되게 하는 신호 분류기와 심리 음향 모델을 기반으로 하는 주파수 부호화 기술, 그리고 전이 윈도우 기술 등의 주요 인코더 기술들에 대하여 소개한다. 또한 FDIS를 위한 verification test 결과와 Common Encoder의 성능 평가를 덧붙인다.

거리경관에 대한 청각적 이미지의 평가구조 - 대학생들의 음풍경 체험을 통한 의미론적 고찰 - (The Evaluation Structure of Auditory Images on the Streetscapes - The Semantic Issues of Soundscape based on the Students' Fieldwork -)

  • 한명호
    • 한국음향학회지
    • /
    • 제24권8호
    • /
    • pp.481-491
    • /
    • 2005
  • 이 연구의 목적은 사운드스케이프의 의미론적 관점에 기초하여 도시의 거리경관에 관한 청각적 이미지의 평가구조를 파악하는 것이다. 캡션평가법이라는 새로운 환경심리조사수법을 이용하여 2001년부터 2005년까지 총45명의 대학생이 남원시의 주요 거리를 걸으면서 듣고 느끼는 소리의 이미지 파악을 위한 현장조사에 참가하고, 그 결과 청각적 경관에 대한 요소, 특징, 인상 및 선호도 등을 포함한 다양한 자료를 얻을 수 있었다. 남원시에 있어서, 청각적 이미지의 구성 요소는 자연음, 그리고 기계음, 사회음, 지시음 등을 포함한 인공음으로 분류되고, 청각적 경관의 특징은 소리종류, 양태, 상황, 성질, 주변관계, 이미지 등으로, 그리고 청각적 경관의 인상은 인간의 감성, 거리의 분위기, 소리 자체의 특성이라는 3가지 카테고리로 분류된다. 청각적 경관과 판단과의 관계로 부터, 청각적 경관의 요소, 특징, 인상 등은 긍정적, 중립적, 부정적 이미지 등의 항목으로 구성된다. 또한, 남원시의 거리경관의 평가구조모델로부터 그 장소 또는 공간의 청각적 이미지특성을 파악할 수 있었다.

실시간 처리를 위한 멀티채널 오디오 코덱의 구현 (The Implementation of Multi-Channel Audio Codec for Real-Time operation)

  • 홍진우
    • The Journal of the Acoustical Society of Korea
    • /
    • 제14권2E호
    • /
    • pp.91-97
    • /
    • 1995
  • 본 논문은 저비트율을 갖는 고품질의 HDTV용 멀티채녈 오디오 코덱을 구현에 대해 기술한다. 이 코덱은 저주파수 효과 채널을 포함한 최대 3/2 스테레오 채널 구성, 최대 채널 구성보다 낮은 채널 구성과의 호환성, 기존 2채널 스테레오 시스템과의 호환성(MPEG-1 오디오), 그리고 다중 대화 채널 등을 제공하는 특징을 갖는다. 구현한 멀티채널 오디오 코덱의 인코더는 3개의 DSP(TI의 TMS320C40)로 구성되었고, 최대 48KHz 샘플링율과 16비트의 부호화를 갖는 5.1 채널의 아날로그 및 AES/EBU, IEC 958등의 포맷을 갖는 스테레오 2채널의 디지털 오디오를 이력으로 받아 지각 심리음향 모델을 사용하여 압축한후 384Kbps의 빛 스트림으로 전송하는 특징을 가지며, 디코더는 2개의 DSP로 구성되어 있고, 384Kbps로 입력되는 비트 스트림을 받아 최대 5.1 채널의 아날로그 및 2개의 2채널 스테레오의 디지털 오디오 신호로 출력시키는 특징을 갖는다. DSP를 이용한 다중처리는 DMA를 통한 통신포트를 이용한 DSP들간의 고속 데이터 전송에 의해 이루어진다. 끝으로, 멀티 채널 오디오 코덱의 구현을 통하여 나타난 실시간 처리는 위해 고려해야할 기술적 사항을 제안한다.

  • PDF