통합 검색 | Korea Science

심층신경망 기반 오디오 부호화기를 위한 Multi-time Scale 손실함수의 최적화 (Optimization of Multi-time Scale Loss Function Suitable for DNN-based Audio Coder)

신승민;변준;박영철;백승권;성종모
- 한국방송∙미디어공학회:학술대회논문집
- /
- 한국방송∙미디어공학회 2022년도 하계학술대회
- /
- pp.1315-1317
- /
- 2022
최근, 심층신경망 기반 오디오 부호화기가 활발히 연구되고 있다. 심층신경망 기반 오디오 부호화기는 기존의 전통적인 오디오 부호화기보다 구조적으로 간단하지만, 네트워크의 복잡도를 증가시키지 않고 인지적 성능향상을 기대하는 것은 어렵다. 이 문제를 해결하기 위하여 인간의 청각적 특성을 활용한 심리음향모델 기반 손실함수를 사용한 기법들이 소개되었다. 심리음향 모델 기반 손실함수를 사용한 오디오 부호화기는 양자화 잡음을 잘 제어하였지만, 여전히 지각적인 향상이 필요하다. 본 논문에서는 심층신경망 기반 오디오 부호화기를 위한 Multi-time Scale 손실함수의 지역 손실함수 윈도우 크기의 최적화 제안한다. Multi-time Scale 손실함수의 지역 손실함수 계산을 위한 윈도우 크기를 조절하며, 이를 통하여 오디오 부호화에 적합한 윈도우 사이즈를 결정한다. 실험을 통해 얻은 최적의 Multi-time Scale 손실함수를 사용하여 네트워크를 훈련하였고, 주관적 평가를 통해 기존의 심리음향모델 기반 손실함수보다 좋은 음성 품질을 보여주는 것을 확인하였다.
PDF

MPEG-2 오디오 부호화기 설계 (Design of An MPEG-2 Audio Encoder Chip)

정남훈
- 한국음향학회:학술대회논문집
- /
- 한국음향학회 1998년도 학술발표대회 논문집 제17권 1호
- /
- pp.205-208
- /
- 1998
본 논문에서는 VLSI 기술에 바탕을 둔 top-down 접근 방식에 의하여 MPEG-2 오디오 부호화 알고리듬을 구현하였다. MPEG-2 오디오 부호화기의 알고리듬은 많은 연산량을 갖고 이질적인 특성을 갖고 이질적인 특성을 갖는 알고리듬들이 복합적으로 존재한다. 그러므로, 부호화기를 효과적으로 구현하기 위해서는 알고리듬 수준에서 구조적 수준에 이르기까지 많은 고찰이 이루어져야 한다. 본 논문에서는 우선 전체 부호화 알고리듬을 분석하여 이들을 다시 작업이라고 정의된 작은 부-알고리듬으로 나누었다. 다음으로, 분할된 작업들은 시간과 공간을 초대한 활용할 수 있도록 적절한 작업 순서를 부여하고, 좀 더 큰 모듈들로 모으는 클러스터링을 수행하였다. 마지막으로 이러한 분석 결과를 바탕으로, 실시간으로 동작하는 5.1 채널 MPEG-2 오디오 부호화기를 설계하였다. 설계된 시스템은 두 개의 하드웨어 블록과 한 개의 ASIP형 DSP 프로세서를 갖는 이질적인 다중 프로세서의 형태를 갖는다. 설계된 오디오 부호화기는 0.6$\mu\textrm{m}$ 표준 셀 기술을 이용하여 단일 칩으로 제작되었으며, PC에 탑재 가능한 시험 기판을 제작하여 동작을 검증하였다.
PDF

MPEG-D USAC : LPD 복호화기의 고정 소수점 알고리즘 구현 (Fixed-point Implementation of LPD Decoder in MPEG-D USAC)

송은우;송정욱;강홍구
- 한국방송∙미디어공학회:학술대회논문집
- /
- 한국방송공학회 2012년도 하계학술대회
- /
- pp.254-256
- /
- 2012
본 논문에서는 MPEG-D 오디오 서브그룹에서 진행 중인 Unified Speech and Audio Coding (USAC) 표준의 Linear Prediction Domain (LPD) 복호화기 모듈을 고정소수점 알고리즘으로 제안한다. USAC 부호화기는 두 개의 최신 음성-오디오 부호화기가 융합된 형태로, 음성 및 오디오 신호에 대하여 우수한 성능을 갖는 부호화기이다. USAC의 표준 완료와 본격적인 서비스화에 앞서서 USAC LPD 복호화기의 구조적인 특성을 분석하고, Digital Signal Processor (DSP)구현을 위한 LPD 복호화기의 고정소수점 알고리즘을 구축하는 동시에 모듈의 복잡도를 측정하고자 한다. 또한 고정소수점 알고리즘으로 구현된 LPD 복호화기와 기존의 부동소수점 복호화기의 성능을 비교하고, LPD 복호화기의 두 가지 부호화 모드에 따른 복잡도 이슈를 다루도록 한다.
PDF

채널 간 중복성을 이용한 다채널 오디오 부호화 (Multichannel Audio Coding using inter-channel Redundancies)

신종인
- 한국음향학회:학술대회논문집
- /
- 한국음향학회 1995년도 제12회 음성통신 및 신호처리 워크샵 논문집 (SCAS 12권 1호)
- /
- pp.150-154
- /
- 1995
기존의 2-채널 오디오 복호화기와 호환성을 유지하기 위해서는 다채널 오디오 부호화기에 할당되는 비트율이 제한되어야 한다. 늘어난 채널 신호에 적은 양의 비트를 할당해줌으로 인해서 복원음의 음질이 저하되는 결과를 초래한다. 따라서 기존의 방법에 신호의 채널 간 중복성을 이용한 다채널 오디오 신호의 음질을 개선시킬 필요가 있다. 본 논문에서는 채널간 중복성을 이용하기 위한 방법으로 적응 채널 간 예측법을 제안하였다. 적응 채널 간 예측법은 주로 저주파 대역에서 스테레오 신호 간에 존재하는 중복된 정보를 제거하고자 하는 방법이다. 저주파 대역에서는 큰 예측 이득을 얻을 수 있어서 스테레오 음상에 불필요한 정보를 없애는데 유리하다. 기존의 방법과 제안된 예측 부호화법을 비교해 보면 두 신호의 상관 관계가 클수록 개선폭이 증가함을 알 수 있으며 낮은 비트율에서 기존이 부호화기가 처리하기 어려운 광대역 신호에 대해서 음질이 개선되는 결과를 얻었다.
PDF

ITU-T G.729/G.729E와 호환성을 갖는 광대역 음성/오디오 부호화기 (A New Wideband Speech/Audio Coder Interoperable with ITU-T G.729/G.729E)

김경태;이민기;윤대희
- 대한전자공학회논문지SP
- /
- 제45권2호
- /
- pp.81-89
- /
- 2008
광대역 신호는 16 kHz로 표본화되어 50-7000 Hz로 밴드 제한된 신호를 말하며, 전화대역 음성 신호에 비해서 높은 자연성(naturalness)과 명료성(intelligibility)을 가진다. 이런 특징으로 광대역 부호화기는 화상회의, 디지털 AM 방송 및 고음질 음성통신 등에 사용될 수 있다. 본 논문에서는 가변대역 특징을 갖는 광대역 음성 오디오 부호화기를 제안하였다. 제안된 부호화기는 대역분한 구조를 가진다. 저주파 대역은 전화대역 음성 부호화기로 많이 사용되고 있는 8 kbit/s ITU-T G.729나 보다 높은 전송률로 오디오 신호까지 처리할 수 있는 11.8 kbit/s ITU-T G.729 Annex E로 부호화한다. 고주파 대역은 청각 모델을 기반으로 한 파라미터 부호화 방법으로 부호화한다. 제안된 고주파 대역 부호화는 감마톤 필터뱅크(gammatone filterbank)를 이용하여 입력신호를 임계대역으로 분할한 후, 각각의 임계대역 신호를 양자화한다. 저주파 대역 부호화기와 고주파 대역 부호화기는 서로 독립되어 있으므로, 복호화기에서는 채널 조건에 따라 전화대역 합성신호와 광대역 합성신호를 선택할 수 있는 특징이 있다. 성능 평가 결과, 제안된 부호화기는 낮은 전송률과 짧은 지연 시간으로 음성과 오디오 신호 모두에 대해 ITU-T G.722.1 24 kbit/s와 동등한 음질을 제공한다는 것을 확인하였다.
PDF KSCI

엔트로피 모델을 활용한 심층 신경망 기반 오디오 압축 모델 최적화 (DNN-based Audio Compression Model Optimization Utilizing Entropy Model)

임형섭;강홍구;장인선
- 한국방송∙미디어공학회:학술대회논문집
- /
- 한국방송∙미디어공학회 2022년도 하계학술대회
- /
- pp.54-57
- /
- 2022
본 논문에서는 심층 신경망 기반 점진적 다계층 오디오 코덱의 비트 전송률 효율 향상을 위한 엔트로피 모델 기반 양자화 방식을 제안한다. 최근 심층 신경망을 이용하여 전통적인 신호 처리 이론 기반의 상용 오디오 코덱들을 대체하기 위한 오디오 압축 및 복원 시스템에 관한 연구가 활발하게 이루어지고 있다. 그러나 아직은 기존 상용 코덱의 성능에 도달하지 못하고 있으며 특히 종단 간 오디오 압축 모델의 경우, 적은 정보량으로 높은 품질을 얻기 위해서는 부호화기의 양자화 구조를 개선하는 것이 필수적이다. 본 연구에서는 기존에 제안된 종단 간 오디오 압축 모델 중 하나인 점진적 다계층 오디오 코덱의 벡터 양자화기를 엔트로피 모델 기반 양자화기로 대체하고 전송률-왜곡 트레이드오프 관계를 활용하여 전송률을 다양한 형태로 조절할 수 있음을 보임으로써 엔트로피 모델 기반 양자화기 도입의 타당성을 검증한다.
PDF

음성통신망에서 디지털 오디오 신호 음질개선을 위한 전처리방법 (Preprocessing method for enhancing digital audio quality in speech communication system)

송근배;안철용;김재범;박호종;김석호
- 방송공학회논문지
- /
- 제11권2호
- /
- pp.200-206
- /
- 2006
본 논문은 음성 부호화기에서 입력 오디오 신호가 보다 효과적으로 처리되도록 하기 위해 입력오디오신호를 전 처리하는 방법을 소개한다. 이를 위해 본 논문은 잡음억제 및 적응이득제어 방법을 도입한다. 여기서 입력 오디오 신호는 잡음 부가된 신호로 간주되며 그 오디오 신호의 부호화오차신호는 부가된 잡음신호로 간주된다. 입력 오디오 신호는 기존의 잡음억제방식에 따라 잡음신호 즉, 부호화 오차신호가 억제된 뒤 적응이득제어기를 거쳐 최종적으로 음성 부호화기에 인가된다. 결과적으로 이러한 동작을 통하여 입력 오디오 신호의 주파수 스펙트럼 분포가 음성 부호화기 특성에 맞게 재배치된다 이 방법의 하나의 단점은 부호화 오차를 계산하기 위해 사전에 추가적인 부호화 동작이 필요하다는 것이다. 반면, 이 방법은 일반적인 구조를 가지고 있으며 따라서 기존의 여러 음성부호화기에 쉽게 적용될 수 있다는 장점을 가진다. 주관적인 선호도 조사결과 제안된 방법이 복잡한 음악신호로 기인한 성가신 잡음을 사전에 억제해 주며 결과적으로 음질개선을 가져다준다는 것을 확인할 수 있었다.
PDF KSCI

부동 소수점 DSP를 이용한 MPEG-2 AAC 부호차기 구현 (MPEG-2 AAC Encoder Implementation Using a floating-Point DSP)

김승우
- 한국멀티미디어학회논문지
- /
- 제8권7호
- /
- pp.882-888
- /
- 2005
MPEG-2 AAC는 이미 보다 진보한 차세대 기술로 표준화가 이루어 졌다. AAC는 96-128kbps/stereo에서 CD 음질의 오디오 신호를 표현한다. 본 논문은 고음질의 MPEG-2 AAC LC Profile 부호화기 구현에 관하여 논하였다. 공통 스케일펙터와 무손실코딩은 각각 $45\%$와 $27\%$의 TMS320C30 명령어 이득을 가져왔다. 구현된 부호화기는 프로그램 메모리 7.5 kWords, 데이터 롬 18kWords, 데이터 램 92kBytes를 사용한다. 주관적 음질평가결과는 96kbps 스테레오에서 얻어진 AAC 부호화기 음질이 MP3 128kbps 스테레오에서 얻어진 것과 동일한 음질을 가짐을 보여준다.
PDF

적응 필터뱅크를 이용한 오디오 부호화 (Audio Coding Using Adaptive Filter Bank)

신유철;강현철;변윤식
- 한국음향학회지
- /
- 제17권1호
- /
- pp.98-106
- /
- 1998
본 논문은 두 부류의 오디오 원에 대해 각각 다른 구조를 가지는 필터뱅크를 설계 하고 스위칭 기준을 제안한다. 균일한 필터뱅크로는 MDCT 필터뱅크를 사용하고 필터 뱅크 로는 웨이브렛 패킷 필터뱅크를 사용하였으며 오디오 신호의 시변 특성에 기초하여 두 필터 뱅크를 스위칭한다. MDCT 필터뱅크는 정상신호 표현에 적절하지만 급격한 변화를 포함하 는 오디오 신호를 표현하는데는 적절하지 못한다. 따라서, 본 연구에서 사용한 웨이브렛 패 킷 필터뱅크는 인간의 청각 특성을 고려한 임계대역(critical band)과 유사하게 설계하였으며 스위칭 기준엣는 에너지-엔트로피(energy-entropy), 영교차(zero-crossing)법 그리고 차분 (difference)기준을 사용하였다. 입력되는 오디오 신호의 통계적 특성에 기안하여 두 필터뱅 크를 스위칭하는 방식의 오디오 부호화기에 대해서 새로운 스위칭 기준을 제안하였다. 여러 가지 오디오 신호에 대한 주관적 평가(MOS)를 수행한 결과, 기존의 부호화기보다 좋은 성 능을 보였다.
PDF

콜레스키 분해와 골롬-라이스 부호화를 이용한 무손실 오디오 부호화기 설계 (Design of a Lossless Audio Coding Using Cholesky Decomposition and Golomb-Rice Coding)

정전대;신재호
- 한국멀티미디어학회논문지
- /
- 제11권11호
- /
- pp.1480-1490
- /
- 2008
무손실 오디오 부호화기에 있어서 선형예측기 및 이에 적합한 엔트로피 부호화기의 설계가 가장 중요한 부분이다. 본 논문에서는 공분산 방법에 콜레스키 분해를 이용하여 선형예측기의 계수를 계산하였고, 그 결과를 다항 예측기와 비교하여 예측 에러가 최소화되는 선형예측기를 선택하도록 하였다. 엔트로피 부호화기는 골롬-라이스 부호를 사용하였고, 골롬-라이스 부호화기의 매개변수를 계산하기 위해 블록기반 매개변수 예측 방법과 LOCO-I, RLGR의 순차 적응 방법을 적용하였다. 실험 결과 블록기반 매개변수 예측 방법과 제안 방식의 예측기를 이용하면 자기상관 방법과 레빈슨-더빈을 사용하는 FLAC 무손실 부호화기보다 $2.2879%{\sim}0.3413%$ 압축률이 향상되는 결과를 나타내었고, 제안 방식의 예측기와 LOCO-I 순차 적응 방법을 이용한 경우는 $2.2381%{\sim}0.0214%$ 압축률이 향상되는 결과를 나타내었다. 그러나 제안 방식의 예측기와 RLGR 순차 적응 방법을 이용한 경우는 특정 신호에서만 압축률이 향상되었다.
PDF

검색결과 59건 처리시간 0.027초

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

자세히 찾기

이미지 검색 (β)