• Title/Summary/Keyword: Speech codec

검색결과 128건 처리시간 0.024초

TMS320C542보드를 이용한 Adaptive Multi-Rate 음성부호화기의 실시간 구현 (Real-Time DSP Implementation of Adaptive Multi-Rate with TMS320C542 board)

  • 박세익;전라온;이인성
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 2000년도 제13회 신호처리 합동 학술대회 논문집
    • /
    • pp.827-830
    • /
    • 2000
  • 본 논문에서는 ETSI와 3GPP에서 차세대 이동통신 IMT-2000 서비스의 음성부호화기의 표준안으로 채택한 AMR(Adaptive Multi-Rate)에 대해 알고리즘을 분석하고 Texas Instrument 사에서 제공한 C 컴파일러와 어셈블리 언어를 이용하여 최적화 과정을 수행하였다. 인코더 약 28.2MIPS, 디코더 5.5MIPS로 40MIPS의 사양을 가지는 TMS320C542 보드의 82%를 사용하여 실시간 구현을 하였다. 또한 DSP보드상에서 구현한 결과가 ETSI에서 제공한 ANSI C 소스 프로그램의 결과와 일치됨을 확인하였으며, 마이크 입력과 증폭기를 이용한 스피커 출력의 시스템을 구성하여 지연과 왜곡이 없음을 확인하였다.

  • PDF

VoWiFi 음질 향상을 위한 G.729.1 광대역 코덱의 ARM 프로세서에의 실시간 구현 (A Real-time Implementation of G.729.1 Codec on an ARM Processor for the Improvement of VoWiFi Voice Quality)

  • 박남인;강진아;김홍국
    • 한국HCI학회:학술대회논문집
    • /
    • 한국HCI학회 2008년도 학술대회 1부
    • /
    • pp.230-235
    • /
    • 2008
  • 본 논문에서는 ARM 프로세서로 설계된 VoWiFi 단말기에서 광대역 음성 서비스를 가능하게 하기 위한 방법으로 ITU-T 표준 코텍인 G.729.1을 실시간으로 구현하고 그 성능을 평가한다. 실시간 G.729.1 코덱 구현은 C 코드 최적화 및 코덱 알고리즘의 고속화를 근간으로 한다. 이렇게 최적화된 코덱의 성능은 VoWiFi 단말기내에서 ARM 프로세서가 요구하는CPU 동작 시간으로 평가된다. 실험 결과, ARM926EJ를 사용하여 최적화된 G.729.1 코덱이 실시간으로 동작함을 확인할 수 있으며, 기존의 G.729에 비해 넓은 대역폭의 음성 전송이 가능함을 보일 수 있다.

  • PDF

Adaptive Multi-Rate(AMR) 음성부호화 알고리즘 (Adaptive Multi-Rate(AMR) Speech Coding Algorithm)

  • 서정욱;배건성
    • 대한전자공학회:학술대회논문집
    • /
    • 대한전자공학회 2000년도 하계종합학술대회 논문집(4)
    • /
    • pp.92-97
    • /
    • 2000
  • An AMR(Adaptive Multi-Rate) speech coding algorithm has been adopted as a standard speech codec for IMT-2000. It is based on the algebraic CELP, and consists of eight speech coding modes having the bit rate from 4.75 kbit/s to 12.2 kbit/s. It also contains the VAD(Voice Activity Detector), SCR (Source Controlled Rate) operation, and error concealment scheme for robustness in a radio channel. The bit rate of AMR is changed on a frame basis depending on the channel condition. In this paper, we introduced AMR speech coding algorithm and performed the real-time implementation using TMS320C6201, i.e., a Texas Instrument's fixed-point DSP. With the ANSI C source code released from ETSI and 3GPP, we convert and optimize the program to make it run in real time using the C compiler and assembly language. It is verified that the decoded result of the implemented speech codec on the DSP is identical with the PC simulation result using ANSI C code for test sequences. Also, actual sound input/output test using microphone and speaker demonstrates its proper real-time operation without distortions or delays.

  • PDF

IP 네트워크 기반 고품질 오디오 협업 시스템 (Implementation of a High-Quality Audio Collaboration System Over IP Networks)

  • 강진아;김홍국
    • 한국HCI학회:학술대회논문집
    • /
    • 한국HCI학회 2008년도 학술대회 1부
    • /
    • pp.218-223
    • /
    • 2008
  • 본 논문에서는 IP 네트워크에서 동작하는 오디오 협업 시스템의 성능을 향상시키는 방법들을 구현하고 구현된 방법들의 성능을 검증한다. IP 네트워크가 갖는 지연(jitter) 및 패킷 손실 등의 특성은 음성 및 오디오의 품질을 저하시킨다. 이러한 품질 저하를 줄이기 위해, 패킷 손실률은 패킷 크기를 줄임으로써 감소시킬 수 있다는 점에 착안하여 MPEG-2 AAC 오디오 코덱을 이용한 저전송률 오디오 전송 방법을 제안한다. 또한, 음성 전송 시 패킷손실에 따른 음성 품질을 향상시키기 위해 패킷 손실에 견고한 iLBC(Internet Low-Bitrate Codec) 음성 코덱 및 ITU-T G.711 패킷 손실 은닉 알고리즘을 오디오 협업 시스템에 적용한다. 제안한 방법들을 RAT (Robust-Audio Tool)[7]를 기반으로 구성된 오디오 협업 시스템에 구현하였다. 구현한 결과, 256 kbit/s에서 동작하는 MPEG-2 AAC 오디오 코덱은 압축하지 않고 전송된 오디오와 유사한 품질을 제공하는 것을, iLBC와 G.711 패킷 손실 은닉 알고리즘은 2~10% 패킷 손실 환경에서 음질을 개선하는 것을 확인할 수 있었다.

  • PDF

TMS320F28335 DSP를 이용한 화자독립 음성인식기 구현 (Implementation of a Speaker-independent Speech Recognizer Using the TMS320F28335 DSP)

  • 정익주
    • 산업기술연구
    • /
    • 제29권A호
    • /
    • pp.95-100
    • /
    • 2009
  • In this paper, we implemented a speaker-independent speech recognizer using the TMS320F28335 DSP which is optimized for control applications. For this implementation, we used a small-sized commercial DSP module and developed a peripheral board including a codec, signal conditioning circuits and I/O interfaces. The speech signal digitized by the TLV320AIC23 codec is analyzed based on MFCC feature extraction methed and recognized using the continuous-density HMM. Thanks to the internal SRAM and flash memory on the TMS320F28335 DSP, we did not need any external memory devices. The internal flash memory contains ADPCM data for voice response as well as HMM data. Since the TMS320F28335 DSP is optimized for control applications, the recognizer may play a good role in the voice-activated control areas in aspect that it can integrate speech recognition capability and inherent control functions into the single DSP.

  • PDF

배경잡음을 고려한 가변임계값 Dual Rate ADPCM 음성 CODEC 구현 (Implementation of Variable Threshold Dual Rate ADPCM Speech CODEC Considering the Background Noise)

  • 양재석;한경호
    • 대한전기학회:학술대회논문집
    • /
    • 대한전기학회 2000년도 하계학술대회 논문집 D
    • /
    • pp.3166-3168
    • /
    • 2000
  • This paper proposed variable threshold dual rate ADPCM coding method which is modified from the standard ADPCM of ITU G.726 for speech quality improvement. The speech quality of variable threshold dual rate ADPCM is better than single rate ADPCM at noisy environment without increasing the complexity by using ZCR(Zero Crossing Rate). In this case, ZCR is used to divide input signal samples into two categories(noisy & speech). The samples with higher ZCR is categorized as the noisy region and the samples with lower ZCR is categorized as the speech region. Noisy region uses higher threshold value to be compressed by 16Kbps for reduced bit rates and the speech region uses lower threshold value to be compressed by 40Kbps for improved speech quality. Comparing with the conventional ADPCM, which adapts the fixed coding rate. the proposed variable threshold dual rate ADPCM coding method improves noise character without increasing the bit rate. For real time applications, ZCR calculation was considered as a simple method to obtain the background noise information for preprocess of speech analysis such as FFT and the experiment showed that the simple calculation of ZCR can be used without complexity increase. Dual rate ADPCM can decrease the amount of transferred data efficiently without increasing complexity nor reducing speech quality. Therefore result of this paper can be applied for real-time speech application such as the internet phone or VoIP.

  • PDF

초광대역 음성통화 서비스를 위한 압축 기술 및 표준화 (Speech Codec Standardization for Super-wideband Communication)

  • 오은미
    • 방송과미디어
    • /
    • 제19권1호
    • /
    • pp.48-55
    • /
    • 2014
  • 오디오 신호 압축 기술 관점에서 최근 모바일 통신 시장의 가장 큰 변화 중에 하나는 광대역 음성 코덱인 AMR-WB가 HD voice 또는 VoLTE(Voice over Long Term Evolution) 서비스에 사용된다는 것이다. 모바일 방송 및 음악 재생뿐만 아니라, 통화에서도 다양한 신호를 고음질로 압축해야 하는 필요성이 대두되어 3GPP에서 EVS(Enhanced Voice Service) Codec이 표준화 진행 중이다. 본 논문에서는 실감 통화를 위해 초광대역 신호까지 압축하는 음성 통화 코덱 기술 및 3GPP표준화 현황을 소개한다. 3GPP 표준 기수에서 정의한 디자인 및 성능 요구사항과 더불어 이전 음성 압축기술과의 차이점 등을 논의한다. 또한, 향후 표준화 계획 및 시장 전망에 대해서 논의한다.

16Kbps와 40Kbps의 Dual Rate G.726 ADPCM 음성 codec구현 (Implementation of G.726 ADPCM Dual Rate Speech Codec of 16Kbps and 40Kbps)

  • 김재오;한경오
    • 전기전자학회논문지
    • /
    • 제2권2호
    • /
    • pp.233-238
    • /
    • 1998
  • 본 논문에서는 G.726 ADPCM 음성방식을 기존의 단일 압축을 대신 16Kbps 와 40Kbps의 두 가지 압축율을 사용한 가변 압축방식에 의한 음성 코딩 방식을 다루었다. 음성의 묵음 또는 소 신호 부분은 음질의 향상보다는 데이터 비트 수를 줄이기 위한 저 전송 16Kbps 압축율을 적용하였고 임계값 이상의 대 신호 부분은 음질을 향상하기 위하여 40Kbps의 압축율을 적용하여 모든 신호를 단일 압축율로 코팅하는 방식에 비하여 전체적으로 압축율을 높여 전송 비트 수를 줄이면서 음질을 저하시키지 않도록 하였다. 분 논문에서는 시뮬레이션을 통하여 여러 가지의 임계값에 의한 가변 압축 코딩 방식에 대하여 압축율과 음질의 관계 를 다루었다. 또한 고정된 임계값에 대하여 입력 음성의 크기를 여러 가지로 변동하여 주변 배경잡음과 포화에 의한 음질의 저하를 고찰하여 가변 율에 의한 음성의 코딩방식에서 임계값과 입력의 크기가 음질 및 압축율에 미치는 영향을 다루었다. 각 시뮬레이션의 경우에 대하여 실지 음성의 원음에 대한 음질의 충실 도를 임의의 집단에 대하여 비교하여 음질의 충실 도를 확인하였다. 추후의 연구를 통하여 DSP에 의한 실시간 처리 시스템의 구현을 하고자 한다.

  • PDF

심층 신뢰 신경망을 이용한 오푸스 코덱 기반 인공 음성 대역 확장 기술 (Artificial speech bandwidth extension technique based on opus codec using deep belief network)

  • 최윤상;이아성;강상원
    • 한국음향학회지
    • /
    • 제36권1호
    • /
    • pp.70-77
    • /
    • 2017
  • 대역폭 확장 기술은 300 ~ 3,400 Hz 대역의 협대역 음성 신호를 50 ~ 7,000 Hz 대역의 광대역 음성신호로 확장하여 음질, 명료도, 그리고 자연성을 높이는 기술이다. 본 논문에서는 협대역 음성 정보를 이용하여 광대역 음성신호를 추정하는 인공 대역폭 확장 기술을 설계하여, 오푸스(Opus) 오디오 복호화기에 내장시킴으로써, 대역폭 확장 모듈에서의 LPC(Linear Prediction Coding) 분석 및 LSF(Line Spectral Frequencies) 해석과 관련된 계산량을 감소시켰고 알고리즘 지연도 줄였다. 이를 위해 현재 다양한 분야에 적용되고 있는 딥 러닝 기술 중 하나인 심층 신뢰 신경망(Deep Belief Network, DBN) 방식을 스펙트럼 포락선 확장에 도입하여 전통적인 코드북 매핑법보다 더 좋은 품질의 스펙트럼을 만들 수 있었다.

PESQ-Based Selection of Efficient Partial Encryption Set for Compressed Speech

  • Yang, Hae-Yong;Lee, Kyung-Hoon;Lee, Sang-Han;Ko, Sung-Jea
    • ETRI Journal
    • /
    • 제31권4호
    • /
    • pp.408-418
    • /
    • 2009
  • Adopting an encryption function in voice over Wi-Fi service incurs problems such as additional power consumption and degradation of communication quality. To overcome these problems, a partial encryption (PE) algorithm for compressed speech was recently introduced. However, from the security point of view, the partial encryption sets (PESs) of the conventional PE algorithm still have much room for improvement. This paper proposes a new selection method for finding a smaller PES while maintaining the security level of encrypted speech. The proposed PES selection method employs the perceptual evaluation of the speech quality (PESQ) algorithm to objectively measure the distortion of speech. The proposed method is applied to the ITU-T G.729 speech codec, and content protection capability is verified by a range of tests and a reconstruction attack. The experimental results show that encrypting only 20% of the compressed bitstream is sufficient to effectively hide the entire content of speech.