• Title/Summary/Keyword: 오디오 추출

Search Result 170, Processing Time 0.075 seconds

ICLAL: In-Context Learning-Based Audio-Language Multi-Modal Deep Learning Models (ICLAL: 인 컨텍스트 러닝 기반 오디오-언어 멀티 모달 딥러닝 모델)

  • Jun Yeong Park;Jinyoung Yeo;Go-Eun Lee;Chang Hwan Choi;Sang-Il Choi
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2023.11a
    • /
    • pp.514-517
    • /
    • 2023
  • 본 연구는 인 컨택스트 러닝 (In-Context Learning)을 오디오-언어 작업에 적용하기 위한 멀티모달 (Multi-Modal) 딥러닝 모델을 다룬다. 해당 모델을 통해 학습 단계에서 오디오와 텍스트의 소통 가능한 형태의 표현 (Representation)을 학습하고 여러가지 오디오-텍스트 작업을 수행할 수 있는 멀티모달 딥러닝 모델을 개발하는 것이 본 연구의 목적이다. 모델은 오디오 인코더와 언어 인코더가 연결된 구조를 가지고 있으며, 언어 모델은 6.7B, 30B 의 파라미터 수를 가진 자동회귀 (Autoregressive) 대형 언어 모델 (Large Language Model)을 사용한다 오디오 인코더는 자기지도학습 (Self-Supervised Learning)을 기반으로 사전학습 된 오디오 특징 추출 모델이다. 언어모델이 상대적으로 대용량이기 언어모델의 파라미터를 고정하고 오디오 인코더의 파라미터만 업데이트하는 프로즌 (Frozen) 방법으로 학습한다. 학습을 위한 과제는 음성인식 (Automatic Speech Recognition)과 요약 (Abstractive Summarization) 이다. 학습을 마친 후 질의응답 (Question Answering) 작업으로 테스트를 진행했다. 그 결과, 정답 문장을 생성하기 위해서는 추가적인 학습이 필요한 것으로 보였으나, 음성인식으로 사전학습 한 모델의 경우 정답과 유사한 키워드를 사용하는 문법적으로 올바른 문장을 생성함을 확인했다.

Audio Fingerprint Extraction Method Using Multi-Level Quantization Scheme (다중 레벨 양자화 기법을 적용한 오디오 핑거프린트 추출 방법)

  • Song Won-Sik;Park Man-Soo;Kim Hoi-Rin
    • The Journal of the Acoustical Society of Korea
    • /
    • v.25 no.4
    • /
    • pp.151-158
    • /
    • 2006
  • In this paper, we proposed a new audio fingerprint extraction method, based on Philips' music retrieval algorithm, which uses the energy difference of neighboring filter-bank and probabilistic characteristics of music. Since Philips method uses too many filter-banks in limited frequency band, it may cause audio fingerprints to be highly sensitive to additive noises and to have too high correlation between neighboring bands. The proposed method improves robustness to noises by reducing the number of filter-banks while it maintains the discriminative power by representing the energy difference of bands with 2 bits where the quantization levels are determined by probabilistic characteristics. The correlation which exists among 4 different levels in 2 bits is not only utilized in similarity measurement. but also in efficient reduction of searching area. Experiments show that the proposed method is not only more robust to various environmental noises (street, department, car, office, and restaurant), but also takes less time for database search than Philips in the case where music is highly degraded.

Monaural Ambient Sound Extraction for On-line Audio Upmixing System based on Nonnegative Matrix Factorization (실시간 오디오 업믹싱 시스템을 위한 비음수 행렬 분해 기반의 단일채널 배경 잡음 추출 기법)

  • Lee, Seokjin
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 2014.06a
    • /
    • pp.5-8
    • /
    • 2014
  • 본 논문에서는 비음수 행렬 분해 (NMF) 기법을 이용하여 단일 채널에서 배경음 성분을 추출하는 알고리즘에 대해 서술한다. 이러한 배경음 성분 추출은 오디오 업믹싱 시스템을 고려하여 개발되었으며, 기존의 연구를 통하여 분리된 배경음 신호가 서라운드 채널 혹은 상방향 채널에 적용될 경우 청취자의 공간감을 향상시킬 수 있다는 사실이 이미 확인된 바 있다. 다만 기존의 기법은 음향 신호를 모두 축적하여 일괄적으로 처리해야 한다는 단점이 있어, 스트리밍 시스템이나 디지털 신호 프로세서 등을 이용한 시스템에서 사용될 수 없는 단점이 있다. 본 논문에서는 이를 해소하기 위하여 실시간 비음수 행렬 분해 기법을 이용한 배경음 추출 시스템을 고안하여 실험하였다. 실험 결과 실시간 배경음 추출 기법이 신호의 후반부에서는 원하는 대로 동작하나, 초중반에 기저가 과도하게 설정되는 문제점이 있음을 확인할 수 있었으며, 이에 대한 해결이 향후 연구 과제가 될 것이다.

  • PDF

BLIND AUDIO WATERMARKING TECHNIQUE USING SPECIFIC FREQUENCY SIGNAL (특정된 주파수 신호를 이용한 오디오 워터마킹)

  • Piao, Cheng-Ri;Han, Seung-Soo;Choi, Jong-Uk
    • Proceedings of the KIEE Conference
    • /
    • 2002.07d
    • /
    • pp.2368-2372
    • /
    • 2002
  • 멀티미디어의 저작권 보호를 위한 기술로서 워터마킹 기술은 현재 멀티미디어의 여러 분야에서 많이 연구되며 사용되고 있다. 이 기술은 컨텐츠가 질적으로 소비자에게 인식되지 않으며, 그리고 컨텐츠자체에 다양한 정보를 은닉하기 때문에 컨텐츠에 항상 포함되어 있다는 장점이 있다. 현재 MP3등과 같은 압축기술이 발달되어 있기 때문에 네트웍에 의한 데이터 전송성능이 향상되었고, 그러므로 디지털 데이터들이 유통이 활성화되었다. 이것으로 인하여 불법적으로 복제된 다양한 컨텐츠의 유통이 생산자의 이익을 해치고 있다. 디지털 오디오 컨텐츠의 소유권을 위하여, 본 논문에서는 압축에 대한 견고성을 제고하기 위하여 청각시스템의 마스킹 효과를 이용하여 시간영역에서 오디오신호에 특정된 주파수를 가진 워터마크 정보를 삽입하였다. 이 특정된 주파수는 반드시 압축에 살아남는 주파수 대역이어야 하며, 음질을 동시에 고려하여야 한다. 그리고 추출할 때는 FFT변환을 하여 주파수 대역에서 추출한다. 저작권 정보를 쉽게 확인하기 위하여 2진 송상을 워터마크 정보로 삽입하였다.

  • PDF

Study for A Robust Digital Audio Watermarking System (공격에 강인한 고음질 디지털 오디오 워터마킹 시스템에 관한 연구)

  • 김현욱;오현오;윤대희;차일환
    • Proceedings of the IEEK Conference
    • /
    • 2000.09a
    • /
    • pp.771-774
    • /
    • 2000
  • 디지털 워터마킹은 오디오, 이미지, 영상과 같은 고품질 디지털 멀티미디어 컨텐츠의 불법적인 복제와 유통을 막고 저작권을 보호하기 위한 최후의 방어 수단으로 인식되고 있는 신호처리 기술이다. 오디오 신호에 삽입되는 워터마크 신호는 들리지 않아야 하는 특성과 함께, 압축이나 필터링과 같은 신호처리 과정 후에도 추출이 가능한 강인성을 지녀야 한다 본 연구에서는 현재 제안되고 있는 여러가지 오디오 워터마킹 방법 중에서 대역확산을 기반으로 한 PN 시퀸스 오디오 워터마킹 시스템에 대해서 다루었다. 삽입된 워터마크 신호가 들리지 않도록 하기 위해 인간의 청각 시스템에 기반한 심리음향모델을 적용하였으며, 효율적인 검출과 청각상의 특성을 고려한 여러 가지 실험을 수행하였다. 워터마크 정보의 검출에 있어서는 원 신호가 필요하지 않은Blind Detection 방법을 제안하여 효율적인 워터마킹 시스템을 구현할 수 있도록 하였다.

  • PDF

A sturdy on the blind audio source separation based on multi-step NMF-EM algorithm (다중 단계 NMF-EM 알고리즘 기반의 오디오 소스 분리 방법에 대한 연구)

  • Cho, Choongsang;Kim, Jewoo
    • Proceedings of the Korean Society of Broadcast Engineers Conference
    • /
    • 2014.06a
    • /
    • pp.9-11
    • /
    • 2014
  • 본 논문에서는 오디오 신호의 특성 표현에 유용한 nonnegative matrix factorization(NMF)에 대해 설명하였으며, expectation maximization (EM)을 이용한 NMF 파라미터 추출 및 EM-NMF 기반한 오디오 소스 분리 기술에 대해서 설명했다. 또한, 다중 단계 NMF-EM 구조의 객체 분리를 통해서 객체 분리 성능을 향상시키기 위한 알고리즘을 제안하며, 제안된 알고리즘은 K-pop 음원과 SDR(source distortion ratio)를 통해서 객체 분리 성능을 평가한다. 성능 평가 결과 제안된 알고리즘은 다중 단계를 통해 약 3dB 의 보컬 분리 성능이 향상되며, 상업적 음원 제작에서 사용되는 가상 오디오 효과가 많이 적용된 음원에서 약 5dB 의 분리 성능을 향상시켰다. 그러므로 제안된 방식은 오디오 객체 분리에 유용한 방법이 될 것으로 생각된다.

  • PDF

Quick Audio Retrieval Using Multiple Featrue Vector (다중 특징 벡터를 이용한 고속 오디오 검색)

  • Ban Ji-hye;Kim Ki-man;Park Kyu-sik
    • Proceedings of the Acoustical Society of Korea Conference
    • /
    • spring
    • /
    • pp.351-354
    • /
    • 2004
  • 최근 MPEG-7 등에서 컨텐츠 내용 기반 검색에 대한 연구가 이루어지고 있다. 내용 기반 검색은 기존의 키워드기반 검색이 아닌 컨텐츠 내의 특징 벡터를 추출하여 이와 일치하는 것을 찾는 작업으로써 차세대 디지털 방송 등에 적응될 예정이다. 본 논문은 긴 오디오 stream에서 찾고자 하는 오디오의 위치를 빨리 찾을 수 있는 고속 검객 방법을 제시한다. 기존의 방법에서는 zero-crossing rate만을 이용하여 검색을 했었으나 본 논문에서는 오디오 신호의 특성을 표현할 수 있는 여러 가지 특징 벡터들을 이용한 고속 검색 방법을 고찰 한다. 본 논문의 가장 중요만 부분은 active search 알고리즘과 히스토그램, 그리고 적절하게 조합된 다중 특징 벡터들을 이용한 오디오 검색의 정확도와 속도를 향상시키는데 있다.

  • PDF

Audio Watermarking with Highly Non-Audible using Micro QR Code (마이크로 QR코드를 활용한 높은 비가청성을 갖는 오디오 워터마킹)

  • Kim, Won-Sik;Jeong, Hwi-Sang;Ha, Seong-Min;Kim, Jin-Deog
    • Proceedings of the Korean Institute of Information and Commucation Sciences Conference
    • /
    • 2017.05a
    • /
    • pp.116-117
    • /
    • 2017
  • 본 연구에서는 기존의 1차원 코드의 워터마킹이 가지는 많은 정보의 저장이 어렵다는 것을 해결하기 위해 마이크로 QR 코드를 이용한 워터마킹 방법에 대해서 제안한다. 오디오의 비가청성 영역에 국제 표준 녹음 코드(ISRC)를 이용한 오디오 고유의 코드를 마이크로 QR코드화 하여 오디오를 주파수 영역으로 변환한 뒤, 비가청성 영역에 삽입한다. 이를 손실 압축 기법인 AAC로 압축하고 워터마크를 추출함으로써 오디오 워터마킹의 강인성, 비가청성을 확인할 수 있었다.

  • PDF

Study on the Amplitude Modification Audio Watermarking Technique for Mixed Music with High Inaudibility (높은 비가청성을 갖는 믹스 음악의 크기 변조 오디오 워터마킹 기술에 관한 연구)

  • Kang, Se-Koo;Lee, Young-Seok
    • The Journal of Korea Institute of Information, Electronics, and Communication Technology
    • /
    • v.9 no.1
    • /
    • pp.67-74
    • /
    • 2016
  • In this paper, we propose a watermarking technology for a mixed music. The mixed music means recreated music that contained a number of musics in one audio clip. Royalty associated with the audio content is typically imposed by the full audio content. However, the calculation of royalties gives rise to conflict between copyright holders and users in the mixed music because it uses not full audio content but a fraction of that. To solve the conflict related with the mixed music, we propose a audio watermarking technique that inserts different watermarks for each audio in the audio that make up the mixed music. The proposed watermarking scheme might have poor SNR (signal to noise ratio) to embed to each audio clip. To overcome poor SNR problem, we used inaudible pseudo random sequence which modifies typical pseudo random sequence to canonical signed digit (CSD) form. The proposed method verifies the performance by each watermark extraction and the time internal estimation valies from the mixed music.

Modification-robust contents based motion picture searching method (변형에 강인한 내용기반 동영상 검색방법)

  • Choi, Gab-Keun;Kim, Soon-Hyob
    • 한국HCI학회:학술대회논문집
    • /
    • 2008.02a
    • /
    • pp.215-217
    • /
    • 2008
  • The most widely used method for searching contents of mot ion picture compares contents by extracted cuts. The cut extract ion methods, such as CHD(Color Histogram Difference) or ECR(Edge Change Ratio), are very weak at modifications such as cropping, resizing and low bit rate. The suggested method uses audio contents for indexing and searching to make search be robust against these modification. Scenes of audio contents are extracted for modification-robust search. And based on these scenes, make spectral powers binary on each frequency bin. in the time-frequency domain. The suggested method shows failure rate less than 1% on the false positive error and the true negative error to the modified(using cropping, clipping, row bit rate, addtive frame) contents.

  • PDF