• 제목/요약/키워드: Filter bank

검색결과 355건 처리시간 0.027초

필터 뱅크 에너지 차감을 이용한 묵음 특징 정규화 방법의 성능 향상 (Performance Improvements for Silence Feature Normalization Method by Using Filter Bank Energy Subtraction)

  • 신광호;최숙남;정현열
    • 한국통신학회논문지
    • /
    • 제35권7C호
    • /
    • pp.604-610
    • /
    • 2010
  • 본 논문에서는 기존의 CLSFN (Cepstral distance and Log-energy based Silence Feature Normalization) 방법의 인식성능을 향상시키기 위하여, 필터 뱅크 서브 밴드 영역에서 잡음을 차감하는 방법과 CLSFN을 결합하는 방법, 즉 FSFN (Filter bank sub-band energy subtraction based CLSFN)을 제안하였다. 이 방법은 음성으로부터 특징 파라미터를 추출할 때 필터 뱅크 서브 밴드 영역에서 잡음을 제거하여 켑스트럼 특징을 향상시키고, 이에 대한 켑스트럼 거리를 이용하여 음성/묵음 분류의 정확도를 개선함으로써 기존 CLSFN 방법에 비해 향상된 인식성능을 얻을 수 있다. Aurora 2.0 DB를 이용한 실험결과, 제안하는 FSFN 방법은 CLSFN 방법에 비해 평균 단어 정확도 (word accuracy)가 약 2% 향상되었으며, CMVN (Cepstral Mean and Variance Normalization)과의 결합에서도 기존 모든 방법에 비해 가장 우수한 인식성능을 나타내어 제안 방법의 유효성을 확인할 수 있었다.

여현변환 계수를 이용한 이미지 탐색 알고리즘 (A Image Search Algorithm using Coefficients of The Cosine Transform)

  • 이석한
    • 한국정보전자통신기술학회논문지
    • /
    • 제12권1호
    • /
    • pp.13-21
    • /
    • 2019
  • 내용기반 영상검색은 영상 내의 정보인 색상, 질감, 형태 등의 특징 값을 추출하여 검색에 이용한다. 본 논문에서는 $8{\times}8$ 이산여현변환, 즉 $8{\times}8$ DCT(Discrete Cosine Transform) 후 얻어지는 DC, AC계수를 이용하여 필터뱅크(filter-bank)를 생성하고, 이를 영상의 내용기반 검색에 이용하는 검색방법을 제안한다. 제안된 방법은 생성된 DCT 필터뱅크에서 DC성분과 주요한 AC성분인 AC01, AC10, AC11 만을 이용하며, DC성분에 대한 양자화를 수행하여 계산량을 최소화한다. 그리고 양자화된 DC성분에 대한 히스토그램 정보를 기반으로 영상 검색에 필요한 특징 값을 산출한다. AC성분에 대해서는 Otsu 이진화를 통하여 개괄적인 형태정보를 취득한 다음 이에 대한 수평/수직 방향으로의 투영 히스토그램을 계산하여 특징 값을 취득한다. 추출된 AC성분의 특징 값은 DC성분의 특징 값과 함께, 특징벡터 빈(feature vector bins)을 구성하여 검색을 수행한다. 실험은 1000장의 데이터베이스를 이용하여 수행 되었으며, 기존의 색상정보를 이용한 검색방법보다 우수한 성능을 보임을 확인하였다.

가버 필터를 사용한 철도 콘크리트 궤도 도상의 자동 균열 감지 개발 (Development of Automatic Crack Detection using the Gabor Filter for Concrete Structures of Railway Tracks)

  • 나용현;박미연;박지수;박성백;권세곤
    • 한국재난정보학회 논문집
    • /
    • 제14권4호
    • /
    • pp.458-465
    • /
    • 2018
  • 연구목적: 철도 안전에 영향을 미치는 콘크리트 궤도는 이미지분석 기술을 사용하여 균열을 감지 할 수 있으나 균열을 검출하기 위한 콘크리트 궤도 및 표면 오염의 조건이 균열검측에 방해되므로 이를 효과적으로 제거하기 위한 방법이 필요하다. 연구방법: 본 연구에서는 한국 철도의 균열을 효과적으로 감지하기 위한 이미지 분석 기법을 적용한 프로세스를 제안하고 실험 모듈을 통해 취득된 이미지를 분석하여 성능을 검증하였다. 또한, 우리는 제안된 Gabor Filter Bank 기법을 사용하여 철도 콘크리트 도상 이미지를 획득한 데이터 중 무작위로 선택된 2000개의 이미지를 개발된 프로세스를 통해 자동 균열 검측을 수행하여 타당성을 검토하였다. 연구결과: 연구에서 제안된 시스템으로 균열 검측 결과 탐지율이 약 94% 성능으로 검토되었으며 취득된 철도콘크리트도상이미지의 균열이 동일한 크기와 형식으로 일치하였다. 결론: Gabor Filter Bank를 사용한 균열 검측법은 한국 철도의 콘크리트 궤도도상에 노이즈를 포함한 균열 이미지에 효과적으로 분석되는 것을 확인 할 수 있었다. 이 시스템은 기존의 인간 위주의 철도 산업에서 자동화 된 유지 관리 시스템이 될 수 있을 것으로 기대된다.

벡터양자화된 부대역 코덱에서 최적필터의 구현 (The Design of Optimal Filters in Vector-Quantized Subband Codecs)

  • 지인호
    • 한국음향학회지
    • /
    • 제19권1호
    • /
    • pp.97-102
    • /
    • 2000
  • 부대역 코딩은 데이터의 압축을 위해 신호의 주파수를 부대역 필터로 통과시켜 서로 상관이 없는 주파수대역으로 분할하여 각 대역의 신호의 에너지에 적합한 비트 할당을 사용하여 인코딩한다. 실제로 부대역 신호의 코딩은 PCM, DPCM이 사용되는 데 고압축의 전송속도를 얻기 위해서 벡터양자기를 사용하였다. 대부분의 연구자들은 부호화기의 오차에만 주안점을 두고 전체 필터대역의 회복오차와 이 오차가 필터대역에 의존되는 것에는 연구가 진행되지 않았다. 본 논문은 벡터양자기를 사용한 부대역 코덱의 분석과 최적구현의 새로운 접근방법을 제공하여 준다. 본 논문에서는 부대역 코덱에서 벡터양자기의 코드 북의 크기와 벡터크기 그리고 대역필터계수에 의존되는 전체 시스템의 회복오차인 Mean Squared reconstruction Error(MSE)를 계산하였다. 본 논문에서는 각 대역의 구조에서 이 MSE로 양자화를 모델링하고 주어진 전송속도, 필터길이, 입력신호 상관모델의 함수인 이 MSE를 최소화하는 최적의 Finite Impulse Response(FIR) 필터를 구현하였다. 최적구현의 예로 2-채널의 paraunitary 필터뱅크의 4-tap 필터계수를 구하였다. 이 paraunitary 최적의 필터 계수들을 Monte Carlo 모의시험을 사용하여 구하였다. 이 논문은 벡터양자기를 사용한 부대역 코덱의 분석방법을 제공하여 주어서 그 활용도가 기대된다.

  • PDF

Matrix Factorization을 이용한 음성 특징 파라미터 추출 및 인식 (Feature Parameter Extraction and Speech Recognition Using Matrix Factorization)

  • 이광석;허강인
    • 한국정보통신학회논문지
    • /
    • 제10권7호
    • /
    • pp.1307-1311
    • /
    • 2006
  • 본 연구에서는 행렬 분해 (Matrix Factorization)를 이용하여 음성 스펙트럼의 부분적 특정을 나타낼 수 있는 새로운 음성 파라마터를 제안한다. 제안된 파라미터는 행렬내의 모든 원소가 음수가 아니라는 조건에서 행렬분해 과정을 거치게 되고 고차원의 데이터가 효과적으로 축소되어 나타남을 알 수 있다. 차원 축소된 데이터는 입력 데이터의 부분적인 특성을 표현한다. 음성 특징 추출 과정에서 일반적으로 사용되는 멜 필터뱅크 (Mel-Filter Bank)의 출력 을 Non-Negative 행렬 분해(NMF:Non-Negative Matrix Factorization) 알고리즘의 입 력으로 사용하고, 알고리즘을 통해 차원 축소된 데이터를 음성인식기의 입력으로 사용하여 멜 주파수 캡스트럼 계수 (MFCC: Mel Frequency Cepstral Coefficient)의 인식결과와 비교해 보았다. 인식결과를 통하여 일반적으로 음성인식기의 성능평가를 위해 사용되는 MFCC에 비하여 제안된 특정 파라미터가 인식 성능이 뛰어남을 알 수 있었다.

필터뱅크 출력을 이용한 실시간 격리 단어 인식에 관한 연구 (A Study on the Real Time Recognition of Korean Isolated Words with Filter Bank Output)

  • 김계국;이종악;강성진
    • 한국음향학회지
    • /
    • 제10권3호
    • /
    • pp.5-12
    • /
    • 1991
  • 本 硏究에서는 韓國語 10개 도市名을 認識 對象으로 하였다. 各 單語는 男性 話者 10人에 의하여 5번씩 反復 發音한 500單語를 對象으로 하여 필터뱅크 出力을 抽出하여 認識 파라미터로 使用하였다. 필터뱅크는 RC 能動素子를 利用하여 200[Kz]부터 1/3 octave 間隔으로 15채널로 構成하였다. 基準音은 集團化 알고리즘에 의해 設定하였으며 類似度 比較를 위해 DTW 알고리즘을 利用하였다. 距離 計算式에 따른 認識結果를 把握하기 위하여 유크리드 式과 체비셔브 式을 使用하여 距離를 計算하였으며 認識 結果 각각 16.4[%], 15.0[%]의 誤認識率을 얻었다.

  • PDF

깊은 신경망을 이용한 오디오 이벤트 분류 (Audio Event Classification Using Deep Neural Networks)

  • 임민규;이동현;김광호;김지환
    • 말소리와 음성과학
    • /
    • 제7권4호
    • /
    • pp.27-33
    • /
    • 2015
  • This paper proposes an audio event classification method using Deep Neural Networks (DNN). The proposed method applies Feed Forward Neural Network (FFNN) to generate event probabilities of ten audio events (dog barks, engine idling, and so on) for each frame. For each frame, mel scale filter bank features of its consecutive frames are used as the input vector of the FFNN. These event probabilities are accumulated for the events and the classification result is determined as the event with the highest accumulated probability. For the same dataset, the best accuracy of previous studies was reported as about 70% when the Support Vector Machine (SVM) was applied. The best accuracy of the proposed method achieves as 79.23% for the UrbanSound8K dataset when 80 mel scale filter bank features each from 7 consecutive frames (in total 560) were implemented as the input vector for the FFNN with two hidden layers and 2,000 neurons per hidden layer. In this configuration, the rectified linear unit was suggested as its activation function.

A Simplified Zero-Forcing Receiver for Multi-User Uplink Systems Based on CB-OSFB Modulation

  • Bian, Xin;Tian, Jinfeng;Wang, Hong;Li, Mingqi;Song, Rongfang
    • KSII Transactions on Internet and Information Systems (TIIS)
    • /
    • 제14권5호
    • /
    • pp.2275-2293
    • /
    • 2020
  • This paper focuses on the simplified receiver design for multi-user circular block oversampled filter bank (CB-OSFB) uplink systems. Through application of discrete Fourier transform (DFT), the special banded structure and circular properties of the modulation matrix in the frequency domain of each user are derived. By exploiting the newly derived properties, a simplified zero-forcing (ZF) receiver is proposed for multi-user CB-OSFB uplink systems in the multipath channels. In the proposed receiver, the matrix inversion operation of the large dimension multi-user equivalent channel matrix is transformed into DFTs and smaller size matrix inversion operations. Simulation is given to show that the proposed ZF receiver can dramatically reduce the computational complexity while with almost the same symbol error rate as that of the traditional ZF receiver.

확산필터뱅크를 전처리기로 사용한 한국어 단모음인식 (The Recognition of Korean Single vowels by Use of the Diffusion Filter Bank as a Pre-processor)

  • 허만탁;김재창
    • 한국음향학회지
    • /
    • 제16권1호
    • /
    • pp.81-87
    • /
    • 1997
  • 본 논문에서는 스펙트럼 포락선을 이용하여 음성을 인식하기 위한 새로운 전처리 방법을 제안한다. 이는 확산필터뱅크를 사용하여 스펙트럼 포락선을 추출하는 새로운 방법이다. 확산필터뱅크의 분석대역을 몇 개의 작은 대역으로 나눔으로써 확산회수를 줄였으며 차분회수를 늘임으로써 선택도를 높였다. 이 결과, 총처리시간을 대폭 줄였으며 스펙트럼의 변별력을 증가시켰다. 컴퓨터 시뮬레이션을 통하여 간단한 인식 알고리듬으로 실제 음성의 단모음 인식 실험을 해본 결과 3%의 인식율을 얻음으로써 확산필터뱅크가 많은 주파수 성분을 가진 음성의 주파수 분석을 이용하는 음성인식에 대단히 유효하다는 것을 확인하였다.

  • PDF

방향성필터뱅크 기반의 새로운 지문영상의 처리 방법 (A New Method of Fingerprint Image Processing Based on a Directional Filter Bank)

  • 오상근;이준재;박길흠
    • 한국통신학회논문지
    • /
    • 제27권8A호
    • /
    • pp.796-804
    • /
    • 2002
  • 본 논문에서는 방향성필터뱅크(Directional Filter Bank; DFB)에 기반하여 지문영상을 해석하여 처리하는 새로운 방법을 제안한다. 지문에서 융선의 방향성는 방향성지도를 구성하고, 이로부터 방향성 필터링을 통한 영상 향상을 행하는 등 지문 영상을 해석하는 전처리과정에서 매우 중요한 요소이다. DFB는 입력영상을 방향성대역영상으로 분해한 다음 이로부터 원영상을 완전하게 복원하는 필터이다. 본 논문에서는 DFB를 이용하여 지문영상을 여러 개의 방향성대역영상으로 분해하고, 이로부터 국부 방향성 에너지를 정의한 다음, 이를 기반으로 방향성지도의 제작, 영상분할, 특이점추출 및 영상개선의 처리과정들을 일관되게 수행하는 알고리듬을 제안한다.