• 제목/요약/키워드: Speech Processing

검색결과 962건 처리시간 0.028초

음성인식 시스템의 입 모양 인식개선을 위한 관심영역 추출 방법 (RoI Detection Method for Improving Lipreading Reading in Speech Recognition Systems)

  • 한재혁;김미혜
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2023년도 추계학술발표대회
    • /
    • pp.299-302
    • /
    • 2023
  • 입 모양 인식은 음성인식의 중요한 부분 중 하나로 이를 개선하기위한 다양한 연구가 진행되어 왔다. 기존의 연구에서는 주로 입술주변 영역을 관찰하고 인식하는데 초점을 두었으나, 본 논문은 음성인식 시스템에서 기존의 입술영역과 함께 입술, 턱, 뺨 등 다른 관심 영역을 고려하여 음성인식 시스템의 입모양 인식 성능을 비교하였다. 입 모양 인식의 관심 영역을 자동으로 검출하기 위해 객체 탐지 인공신경망을 사용하며, 이를 통해 다양한 관심영역을 실험하였다. 실험 결과 입술영역만 포함하는 ROI 에 대한 결과가 기존의 93.92%의 평균 인식률보다 높은 97.36%로 가장 높은 성능을 나타내었다.

홈 네트워크 환경에서 음성인식기반 사용자 인터페이스를 통한 가전기기 제어 시스템 구현 (Implementation of Home Appliance Control System with Speech Recognition based User Interfaces in Home Network Environments)

  • 김연우;장현수;김구수;엄영익
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2007년도 춘계학술발표대회
    • /
    • pp.735-738
    • /
    • 2007
  • 컴퓨팅 기술의 발전에 따라 유비쿼터스 시대로의 이행이 가속화되고 있다. 이에 따라 홈 네트워크 분야에 대한 연구와 상용화를 위한 노력이 활발해지고 있다. 이와 더불어 가전기기들의 종류는 다양해지고 복잡해지면서 사용자들의 가전기기 이용에 있어 사용법을 익혀야하는 어려움이 있다. 이러한 문제점을 해결하기 위한 일환으로 디지털 장치들을 편하게 사용하기 위한 멀티 모달 사용자 인터페이스가 요구되고 있다. 본 논문에서 네트워크 가전기기 제어가 가능한 홈 네트워크 미들웨어인 UPnP를 사용하여 VoiceXML을 통한 음성인식기반 사용자 인터페이스와 디지털 장치 제어 시스템을 제안하고 구현한 후 실험하였다.

스펙트로그램과 심층 신경망을 이용한 온라인 오디오 장르 분류 (On-Line Audio Genre Classification using Spectrogram and Deep Neural Network)

  • 윤호원;신성현;장우진;박호종
    • 방송공학회논문지
    • /
    • 제21권6호
    • /
    • pp.977-985
    • /
    • 2016
  • 본 논문은 스펙트로그램과 심층 신경망을 이용한 온라인 오디오 장르 분류 방법을 제안한다. 제안한 방법은 온라인 동작을 위하여 1초 단위로 신호를 입력하여 speech, music, effect 중 하나의 장르로 분류하고, 동작의 범용성을 위하여 기존 오디오 분석에 널리 사용되는 MFCC 대신에 스펙트로그램 기반의 특성 벡터를 사용한다. 실제 TV 방송 신호를 사용하여 장르 분류 성능을 측정하였고, 제안 방법이 기존 방법보다 각 장르에 대하여 우수한 성능을 제공하는 것을 확인하였다. 특히 제안 방법은 기존 방법에서 나타나는 music과 effect 사이를 잘못 분류하는 문제점을 감소시킨다.

음절 복원 후보 집합의 생성과 후보 감소에 관한 연구 (A Study on a Generation of a Syllable Restoration Candidate Set and a Candidate Decrease)

  • 김규식;김경징;이상범
    • 한국컴퓨터산업학회논문지
    • /
    • 제3권12호
    • /
    • pp.1679-1690
    • /
    • 2002
  • 본 논문에서는 음성 인식의 후처리를 위한 음절 복원 규칙의 생성과 복원 후보의 감소에 관한 연구를 수행하였다. 대화체 연속 음성 인식의 성능 향상을 위하여 음절 단위를 인식하는 음성인식 시스템의 후처리를 통하여 인식된 로 발음되는 복원 후보를 생성하는 음절 복원 규칙을 생성하였다. 또한 복원 집합의 후보수를 줄이기 위한 방안으로 복원 규칙에서 실생활에서 사용되지 않는 표기를 생성하는 규칙을 제거하는 방안을 제시하였다. 음절 복원 규칙이 올바른 복원 후보 집합을 생성함을 보이기 위하여 복원 후보 집합 생성기를 설계 구현하고, 표준 발음법 예제와 발음법 사전에서 무작위로 추출된 단어에 대하여 실험한 결과 발성 이전의 표기가 포함된 올바른 표기 집합이 생성됨을 입증하였다.

  • PDF

ARMA 필터를 이용한 로그 에너지 특징의 정규화 방법 (A Log-Energy Feature Normalization Method Using ARMA Filter)

  • 신광호;정호열;정현열
    • 한국멀티미디어학회논문지
    • /
    • 제11권10호
    • /
    • pp.1325-1337
    • /
    • 2008
  • 훈련과 인식의 환경적 차이가 음성 인식 성능 저하의 주요 요인이며, 이러한 환경적 불일치를 줄이기 위한 다양한 잡음 처리 방법들이 연구되고 있다. 이 가운데 로그 에너지 특징에 대한 ERN(log-Energy dynamic Range Normalization), SEN(Silence Energy Normalization) 등이 우수한 성능을 보이고 있다. 그러나 이들 방법은 상대적으로 큰 갈을 갖는 로그 에너지 특징에 대해서는 처리가 불가능한 문제점이 이으며, 특히 SNR값이 작은 환경에서는 이러한 문제로 인하여 환경적 불일치가 더욱 크게 나타나고 있다. 이를 해결하기 위해서 본 논문은 자동 회귀 방식으로 이동 평균을 계산하여 로그 에너지 특징을 스무딩(smoothing)하는 ARMA(Auto-Regression and Moving Average) 필터를 후처리로 적용하는 방법을 제안한다. Aurora 2.0 DB를 이용한 인식 실험 결과, 제안 방법이 기존의 방법들에 비해 향상된 인식 결과를 얻을 수 있었다.

  • PDF

자동차 환경에서의 단독 숫자음 및 명령어 인식 (Isolated Digit and Command Recognition in Car Environment)

  • 양태영;신원호;김지성;안동순;이충용;윤대희;차일환
    • 한국음향학회지
    • /
    • 제18권2호
    • /
    • pp.11-17
    • /
    • 1999
  • 본 논문에서는 DHMM(Discrete Hidden Markov Model) 기반의 음성 인식 시스템에서 소음에 강인한 인식 성능을 얻기 위하여, 관찰 확률 스무딩(observation probability smoothing) 방법을 제안하고, 자동차 소음하에서의 음성 인식에 적합한 소음처리 기법을 실험을 통해 제시한다. 제안된 관찰 확률 스무딩 방법은 입력되는 음성의 특징벡터가 소음에 오염되어 양자화(vector quantization) 과정에서 적절한 코드워드(codeword)가 아닌 다른 코드워드로 양자화됨으로써 발생하는 인식성능 저하를 막기 위하여, 각각의 코드워드와 거리가 가까운 코드워드들의 관찰 확률값을 높여주는 방법이다. 이 밖에 자동차 소음에 대한 대처 방안으로 특징 벡터의 거리 측정시의 리프터(lifter) 사용, 고역 통과 필터(high pass filter) 사용, 스펙트럴 차감법(spectral subtraction) 사용 등의 성능을 평가한다. 인식 실험은 자동차 정지 중과 주행 중의 두 가지 상황에서 녹음된 한국어 단독 숫자음과 명령어 14단어에 대해 수행하였으며, 정지 중 97.4%와 주행 중 59.1%의 인식률로부터, 제안된 관찰 확률 스무딩 방법과 리프터, 고역 통과 필터, 스팩트럴 차감법의 소음 처리 기법을 추가한 결과, 정지 중 98.3%와 주행 중 88.6%의 인식률을 얻을 수 있었다.

  • PDF

음성 신호 분석에 의한 사상 체질 분류 (Sasang Constitution Classification by Speech Signal Processing)

  • 조동욱
    • 한국통신학회논문지
    • /
    • 제31권5C호
    • /
    • pp.548-555
    • /
    • 2006
  • 본 논문에서는 사상 의학에서 가장 중요한 사상 체질 분류에 대한 방법론을 제안하고자 한다. 기존에 사상 체질 분류를 위해 사용해 온 방법들은 대개 용모사기와 체형기상에 의한 방법이었다. 또한 QSCC, QSCCII라고 불리우는 설문지를 이용하거나 사람이 말하는 음성을 듣고 판별하는 법등과 최근에는 체질 침이나 약물 반응 등의 방법도 사상 체질 분류를 위해 사용되고 있다. 그러나 이러한 방법들은 대개가 임상의들의 직관에 의지하는 방법들이 대부분으로 이와 같은 임상의들의 직관을 정량화하여 기기로 구현하는 것이 보다 정확하고 유용한 사상 체질 분류 방법이 되리라 사료된다. 이를 위해 본 논문에서는 음성 신호 분석에 의해 사상 체질을 분류하는 방법에 대해 제안하고자 한다. 각 사상 체질별로 음성 특성을 분류하고 이를 통해 피치, 인텐서티, 포먼트 값의 특징을 체질별로 차이점과 유사성을 분류하여 사상 체질 분류를 행하고자 한다. 끝으로 실험에 의해 제안한 방법의 유용성을 입증하고자 한다.

음향 보상 시스템에 관한 연구 (A Study on the Audio Compensation System)

  • 정병철;원충상
    • 한국음향학회지
    • /
    • 제32권6호
    • /
    • pp.509-517
    • /
    • 2013
  • 본 연구에서는 음성전기변환기로서 다이나믹 마이크로폰과 디지털 신호처리기를 사용하고 성능분석을 통해 좋은 음성신호를 출력하는 방법을 다루었다. 음성음향시스템의 성능이라 함은 음성신호를 왜곡하지 않고 얼마나 원음 특성을 충실하게 증폭하여 확성하는가를 뜻한다. 마이크로폰의 주파수 응답특성을 측정한 후, 신호처리방법으로 표준마이크로폰 주파수 응답특성과 비교하여 주파수대역 별 보정치를 구하였다. 본 논문에 사용된 마이크로폰과 스피커는 일반적으로 사용되는 제품으로, 주파수응답특성을 구하고 기준치와 비교하여 필요한 보정치를 구하였다. 이와 같이 구한 마이크로폰과 스피커의 보정치는 디지털신호처리방법으로 처리하여 원신호음에 가깝게 보상하였다. 그리고 음성음원과 수음마이크 사이의 거리변화에 의한 음향특성변화보상에 관한 측정 결과도 비교적 좋은 결과를 얻었다.

차량용 음성인식을 위한 주변잡음에 강건한 브라인드 음원분리 (Robust Blind Source Separation to Noisy Environment For Speech Recognition in Car)

  • 김현태;박장식
    • 한국콘텐츠학회논문지
    • /
    • 제6권12호
    • /
    • pp.89-95
    • /
    • 2006
  • 독립성분분석을 사용한 암묵신호분리의 성능은 잔향이 존재하는 환경에서 잔류 누설 성분 (cross-talk) 때문에 현저히 저하된다. 본 논문에서는 잔류 누설 성분을 제거하기 위한 후처리 방법을 제안한다. 제안하는 방법은 주파수 영역에서의 변형된 NLMS(normalized least mean square) 필터를 사용하며 필터의 역할은 잔류 누설 성분을 유발하는 누설 경로를 추정하는 데 있다. 특정 채널에서 잔류하는 누설 성분은 상대 채널의 직접 성분에 해당되므로 관측되는 상대 채널의 입력신호를 이용하여 누설 경로를 추정할 수 있다. 변형된 NLMS 필터는 필터 입력 신호의 전력과 추정 오차 신호의 전력을 함께 고려하여 정규화한다. 특정 채널의 직접 신호 성분은 적응 필터에서 잡음처럼 동작하여 결국 적응필터가 오조정되기 때문에 제안하는 방법을 통해 적응필터의 오조정을 방지할 수 있다. 음성 신호를 사용한 컴퓨터 시뮬레이션 결과를 통해 제안하는 방법이 후처리를 사용하지 않은 경우에 비해 잡음 제거 성능(NRR)이 약 3dB 정도 개선되는 것을 확인 할 수 있다.

  • PDF

차량 항법용 음성인식 시스템의 구현 (Implementation of a Speech Recognition System for a Car Navigation System)

  • 이태한;양태영;박상택;이충용;윤대희;차일환
    • 전자공학회논문지S
    • /
    • 제36S권9호
    • /
    • pp.103-112
    • /
    • 1999
  • 본 논문에서는 차량 항법영 음성 인식을 위한 화자 독립 단독음 인식 시스템을 범용 DSP를 사용하여 구현하였으며, 잡음 처리 기술로 SNR 정규화와 RAS를 결합한 방법을 제안하여 인식 시스템의 성능을 개선시켰다. 인식 알고리즘으로서 반연속 HMM을 사용하였으며, TMS320C31을 이용하여 구현하였다. 실험에서 사용된 인식 단어는 차량 항법 시스템을 위한 명령어 69단어이며, 구현된 인식 시스템은 자동차 환경에서 녹음된 음성 데이터에 의한 인식 결과와 하드웨어 구현에 따르는 제약 조건을 동시에 고려하여 구현되었다. 주행 중에 녹음된 데이터에 대한 컴퓨터 시뮬레이션 상에서 특징 벡터 중 MFCC-CMS를 이용하고, 잡음 처리 방법으로 SNR 정규화와 스펙트럼 차감법을 결합하여 실험한 경우 최고 93.62%의 인식 성능을 보였으며, 89.93%의 인식률을 갖는 기존 방법보다 3.69%의 인식 성능 향상을 가져왔다. 제안된 잡음 처리 방법은 자동차 안에서의 SNR이 5dB이하에서 좋은 인식 성능을 보이는 것으로 나타났다.

  • PDF