• Title/Summary/Keyword: 오디오신호

검색결과 435건 처리시간 0.027초

Deep neural network 기반 오디오 표식을 위한 데이터 증강 방법 연구 (Study on data augmentation methods for deep neural network-based audio tagging)

  • 김범준;문현기;박성욱;박영철
    • 한국음향학회지
    • /
    • 제37권6호
    • /
    • pp.475-482
    • /
    • 2018
  • 본 논문에서는 DNN(Deep Neural Network) 기반 오디오 표식을 위한 데이터 증강 방법을 연구한다. 본 시스템에서는 오디오 신호를 멜-스펙트로그램으로 변환하여 오디오 표식을 위한 심층신경망의 입력으로 사용한다. 적은 수의 훈련 데이터를 사용하는 경우 발생하는 문제를 해결하기 위해, 타임 스트레칭, 피치 변화, 동적 영역 압축, 블록 혼합 등의 방법을 사용하여 훈련 데이터를 증강시켰다. 사용된 데이터 증강 기법의 최적 파라미터와 최적 조합을 오디오 표식 시뮬레이션을 통해 확인하였다.

스마트 모바일 기기에서의 객체 기반 실감 음원 서비스 구현 (A Desigin of real sound service based-on object in Smart mobile devices)

  • 정종진;임태범;이석필
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2011년도 춘계학술발표대회
    • /
    • pp.685-688
    • /
    • 2011
  • 앞으로의 멀티미디어 기기시장은 기존의 단순 복합 디지털 기기들이 아닌 사용자 감성 및 취향 제어가 가능한 인간 친화적 지능형 멀티미디어 기기가 주류를 이룰 것이다. 이미 IT 기능이 기존의 '정보의 소통'에서 '감성의 소통'으로 진화 중에 있으며, 미래시대에는 느낌까지 디지털 신호로 전달 가능한 기술이 발달 될 것이다. 이에 맞추어 사람의 감성, 주변 분위기, 섬세한 공간 정보를 전달하는 사실적인 오디오 개발 및 인프라가 구축되어 모든 멀티미디어 제품에 적용된다면, 사용자는 보다 현장감 있게 멀티미디어를 즐길 수 있을 것이다. 최근 스마트폰의 확산과 더불어 각종 다양한 음악서비스를 제고하는 웹/앱 형태의 어플리케이션이 증대되고 있는 바, 본 논문에서는 안드로이드 기반 스마트 모바일 기기에서 다양한 오디오 정보를 청취자에게 제공하고 이를 활용하여 청취자가 다양하게 오디오 재생 / 제어하여, 일방적으로 청취자가 오디오를 듣는 수준이 아니라 청취자 취향에 따라 다양하게 오디오를 감상 할 수 있는 서비스를 구현하였다.

MPEG 오디오의 채널 확장 기술 (Channel Expansion Technology in MPEG Audio)

  • 방희석
    • 방송공학회논문지
    • /
    • 제16권5호
    • /
    • pp.714-721
    • /
    • 2011
  • MPEG 오디오에서는 오디오 신호의 효율적인 압축을 위해서 마스킹 효과, spectral band replication을 이용한 고주파 성분 합성, parametric stereo를 이용한 채널 확장 등의 기술을 이용하고 있다. 본 논문에서는 이 중 최신 기술에 해당하는 채널 확장 기술에 대해서 소개한다. 또한, MPEG 오디오 코덱 중 이 기술을 이용하는 HE-AAC v.2, MPEG Surround, Spatial Audio Object Coding(SAOC), Unified Speech and Audio Coding (USAC)에 대해 기술 소개 및 방송의 적용 예를 기술한다.

화면해설방송 저작을 위한 비 대사 구간 검출 (Non-Dialog Section Detection for the Descriptive Video Service Contents Authoring)

  • 장인선;안충현;장윤선
    • 방송공학회논문지
    • /
    • 제19권3호
    • /
    • pp.296-306
    • /
    • 2014
  • 본 논문에서는 방송 오디오에서로부터 화면해설 삽입을 위한 비 대사 구간 검출 방법을 제시한다. 방송 오디오에서의 대사와 비 대사 구간을 분류하기 위해서는 대사와 배경 음악 등 다양한 종류의 소리가 혼합되어 있는 스테레오 신호로부터 음성 활성 여부의 검출이 우선되어야 한다. 본 논문에서는 방송 오디오 제작과정을 파악함으로써 신호의 채널 특성 분석 결과를 대사 음성 활성 여부 검출에 적용한다. 본 논문에서 제안하는 비 대사 구간 검출 방법은 방송 오디오의 센터채널과 서라운드 성분 간의 에너지 비율을 추가적인 오디오 특징으로 이용하여 센터채널의 음성 활성도와의 결합을 통해 성능 향상을 이루어 낸다. 또한, 실제 화면해설 방송물의 분석을 통해 생성한 규칙 기반의 후처리를 통해 화면해설 삽입이 가능한 비 대사 구간을 검출한다. 이를 실제 방송 컨텐츠를 대상으로 한 실험을 통하여 검증한다.

음향 기기 및 TV 방송 수신기의 내성 시험용 기준 신호 분석 (Analysis of Reference Signal for Immunity Test of Sound System and Television Broadcast Receiver)

  • 최수나;최성웅;박승근
    • 한국전자파학회논문지
    • /
    • 제23권7호
    • /
    • pp.805-814
    • /
    • 2012
  • 무선기기의 간헐적인 신호 또는 높고 낮은 진폭의 주기적인 신호 전송은 오디오 주파수에 간섭 신호를 발생시켜 근접 거리에 설치된 음향 기기에 잡음을 발생시킨다. 최근 이와 관련하여 Global system for Mobile Communication(GSM) 폰과 유사하게 간헐적인 신호 전송을 하는 Long Term Evolution(LTE) 폰에 의한 오디오 잡음현상이 보고되었다. 현재 국내 KN20 규격에서는 잡음에 대한 내성 능력을 확보하기 위하여 음향 및 TV 방송수신기의 내성 시험 기준 신호로 변조 주파수 1 kHz Amplitude Modulation(AM) 80 %와 Code Division Multiple Access(CDMA) 신호를 이용하고 있다. 본 논문에서는 LTE 폰의 출시에 따라 기존의 내성 기준 신호 AM과 CDMA를 GSM과 LTE 폰이 발생시키는 오디오 잡음의 수준과 비교한 후, 국내 음향 기기에 대한 내성 기준 신호의 개선을 제안한다. CDMA 신호는 음향 기기에 간섭을 거의 일으키지 않는 것으로 여겨지므로 시험 항목에서 삭제해도 무방할 것으로 판단된다. 반면, LTE는 많은 사용자가 이용하고 있으며, 음향 기기 등에 무시할 수 없는 간섭을 발생시킬 것으로 분석되므로 CDMA 신호를 대신하여 음향 기기 및 TV 방송 수신기의 내성 시험을 위한 시험 기준 신호로 규정하는 것이 바람직할 것으로 사료된다.

MPEG-H 3D 오디오 표준 복호화기 구조 및 연산량 분석 (MPEG-H 3D Audio Decoder Structure and Complexity Analysis)

  • 문현기;박영철;이용주;황영수
    • 한국통신학회논문지
    • /
    • 제42권2호
    • /
    • pp.432-443
    • /
    • 2017
  • MPEG-H 3D 오디오 표준은 UHDTV 등의 초고해상도 방송서비스에 대응하는 실감음향 서비스의 제공을 목표로 한다. 이를 위해 본 표준은 다채널 신호, 객체 신호, 장면 기반 신호의 부호화/복호화 기술과 다양한 재생 환경에서 3차원 오디오 제공을 위한 렌더링 기술, 후처리 기술 등 방대한 기술을 통합하였다. 본 표준의 참조 소프트웨어 복호화기는 여러 모듈들이 결합된 구조로 다양한 모드에서 동작이 가능하며, 각 모듈들이 독립된 실행파일로 순차적으로 실행되어 실시간 처리가 불가능하다. 본 논문에서는 MPEG-H 3D 오디오의 코어 복호화기, 포맷 변환기, 객체 렌더러, 바이노럴 렌더러의 각 함수를 동적 라이브러리화 및 통합하여 프레임 기반 복호화가 가능하도록 하였다. 또한 MPEG-H 3D 오디오의 각 모드별 연산량을 측정하여 다양한 하드웨어 플랫폼에서 적합한 모드를 선택하기 위한 참고 자료를 제공한다. 연산량 분석 결과, 한국 방송 표준에 포함된 저연산량 프로파일은 채널 신호로 렌더링을 할 경우 QMF 합성 연산의 2.8배에서 12.4배의 연산량을 가지며, 바이노럴 렌더링을 할 경우 QMF 합성 연산의 4.1배에서 15.3배의 연산량을 가진다.

디지털 오디오 프로세서용 전류모드 소자의 성능 개선에 관한 연구 (Performance Improvement of Current-mode Device for Digital Audio Processor)

  • 김성권;조주필;차재상
    • 한국인터넷방송통신학회논문지
    • /
    • 제8권5호
    • /
    • pp.35-41
    • /
    • 2008
  • 본 논문은 디지털 오디오 신호처리의 고속 및 저전력 동작을 구현하기 위한 전류모드 신호처리의 고성능 회로에 관하여 설계방안을 제시한다. 디지털 오디오 프로세서는 FFT(fast Fourier transform)와 같은 디지털 연산 동작이 필요하며, FFT 프로세서는 그 설정 포인트에 따라, 전력이 많이 필요하게 되며, 또한 고속 동작의 요구에 따라, 전력의 부담은 증대되고 있다. 따라서, 디지털 오디오 프로세서에 SI(switched current) circuit을 이용하는 analog current-mode 신호처리의 응용이 적용되게 되었다. 그러나 SI circuit을 구성하는 current memory는 clock-feedthrough의 문제점을 갖기 때문에, 전류 전달 특성에 있어서 오차를 발생시킨다. 본 논문에서는 current memory의 문제점인 clock- feedthrough의 해결방안으로 switch MOS에 dummy MOS의 연결을 검토하고, 0.25um process로 제작하기 위하여 switch MOS와 dummy MOS의 width의 관계를 도출하고자 한다. 시뮬레이션 결과, memory MOS의 width가 20um, 입력전류와 바이어스전류의 비가 0.3, switch MOS의 width가 2~5um일 경우에 switch MOS와 dummy MOS의 width는 $W_{M4}=1.95W_{M3}+1.2$의 관계로 정의되고, switch MOS의 width가 5~10um일 경우에 width는 $W_{M4}=0.92W_{M3}+6.3$의 관계로 정의되는 것을 확인하였다. 이 때, 정의된 MOS transistor의 width관계는 memory MOS의 설계에 유용한 지침이 될 것이며, 저전력 고속 동작의 디지털 오디오 프로세서의 적용에 매우 유용할 것으로 기대된다.

  • PDF