• 제목/요약/키워드: normalized confidence measure

검색결과 10건 처리시간 0.026초

하이브리드 신뢰도를 이용한 제한 영역 핵심어 검출 성능향상 (Improvement of Domain-specific Keyword Spotting Performance Using Hybrid Confidence Measure)

  • 이경록;서현철;최승호;최승호;김진영
    • 한국음향학회지
    • /
    • 제21권7호
    • /
    • pp.632-640
    • /
    • 2002
  • 본 논문에서는 기존의 RLJ-신뢰도 (RLJ-confidence measure)와 정규화 신뢰도 (normalized CM)의 단점을 보완하기 위해 ACM (Anti-filler CM)을 제안하였고, HCM (hybrid CM)을 이용하여 기존의 NCM과 제안한 ACM을 통합하였다. 제안된 ACM은 기존 신뢰도의 단점 중 하나인 오인증 (FA: false acceptance)의 원인이 반음소 모델의 구성방법에 있다고 보고 음소 인식기를 이용하여 실제 음소 수열을 추정한 다음, 이를 반음소 모델로 정의하고 신뢰도를 계산하였다. 두 가지 신뢰도의 특성을 살펴보면, 기존 NCM(FR: false rejection)에 좋은 성능을 보이고, 제안한 ACM은 FA에서 좋은 성능을 보여 두 신뢰도가 상보적인 특성을 가진다 이를 이용하여 두 가지 신뢰도를 가중치 벡터 α를 이용하여 통합하고 이를 합성 신뢰도 (HCM: Hybrid CM)라고 정의하였다. 실험결과 미검출율 (MDR: missed detection rate) 10%부근에서, HCM 적용시에 0.219 FA/KW/HR (false alarm/keyword/how)로서 NCM 단독사용에 비해 성능이 22% 향상되었다.

Verification of Normalized Confidence Measure Using n-Phone Based Statistics

  • Kim, Byoung-Don;Kim, Jin-Young;Na, Seung-You;Choi, Seung-Ho
    • 음성과학
    • /
    • 제12권1호
    • /
    • pp.123-134
    • /
    • 2005
  • Confidence measure (CM) is used for the rejection of mis-recognized words in an automatic speech recognition (ASR) system. Rahim, Lee, Juang and Cho's confidence measure (RLJC-CM) is one of the widely-used CMs [1]. The RLJC-CM is calculated by averaging phone-level CMs. An extension of the RLJC-CM was achieved by Kim et al [2]. They devised the normalized CM (NCM), which is a statistically normalized version of the RLJC-CM by using the tri-phone based CM normalization. In this paper we verify the NCM by generalizing tri-phone to n-phone unit. To apply various units for the normalization, mono-phone, tri-phone, quin-phone and $\infty$-phone are tested. By the experiments in the domain of the isolated word recognition we show that tri-phone based normalization is sufficient enough to enhance the rejection performance of the ASR system. Also we explain the NCM in regard to two class pattern classification problems.

  • PDF

잡음 환경 하에서의 입술 정보와 PSO-NCM 최적화를 통한 거절 기능 성능 향상 (Improvement of Rejection Performance using the Lip Image and the PSO-NCM Optimization in Noisy Environment)

  • 김병돈;최승호
    • 말소리와 음성과학
    • /
    • 제3권2호
    • /
    • pp.65-70
    • /
    • 2011
  • Recently, audio-visual speech recognition (AVSR) has been studied to cope with noise problems in speech recognition. In this paper we propose a novel method of deciding weighting factors for audio-visual information fusion. We adopt the particle swarm optimization (PSO) to weighting factor determination. The AVSR experiments show that PSO-based normalized confidence measures (NCM) improve the rejection performance of mis-recognized words by 33%.

  • PDF

정규화 신뢰도를 이용한 핵심어 검출 성능향상 (Improvement of Keyword Spotting Performance Using Normalized Confidence Measure)

  • 김철;이경록;김진영;최승호;최승호
    • 한국음향학회지
    • /
    • 제21권4호
    • /
    • pp.380-386
    • /
    • 2002
  • Rahim의 논문 (M.G. Rahim, et al., PROC. of ICASSP96, 1996)과 같은 기존의 후처리 방법은 음소 모델과 반모델 (anti-model)의 유사도를 이용하여 음소 단위 신뢰도를 계산하고, 이들의 평균을 단어 단위 신뢰도로 정의한다. 그런데 음소단위의 신뢰도가 동일한 확률밀도함수를 갖는 것이 아니기 때문에 특정단어의 경우 계산된 신뢰도는 대체로 낮은 값을 갖는다. 이를 극복하기 위한 방법으로서, 본 논문에서는 기존의 신뢰도를 통계적으로 정규화한 신뢰도를 제안한다. 즉 음소단위의 신뢰도가 가우시안 분포를 갖는다고 가정한 후 트라이 폰(sri-phone) 단위로 정규화하여 동일한 정규분포를 갖도록 한다. 본 논문에서는 제안된 방법의 검증을 위하여 문맥종속 핵심어 모델과 문맥독립 필러 모델을 이용한 일반적인 핵심어 검출기를 사용하였다. 실험결과 제안된 정규화 신뢰도 (NCM: Normalized Confidence Measure)가 불검출율 (WDR: Missed Detection Rate) 8%정도에서 오검출율 (PAR: false alarm rate)을 0.44에서 0.33 FA/KW/HR (false alarm/keyword/hour)로 저하시켰다. 이것은 오검출율에서 성능이 25% 향상된 것이다.

정규화신뢰도 기반 가변어휘 고립단어 인식기의 거절기능 성능 분석 (Rejection Performance Analysis in Vocabulary Independent Speech Recognition Based on Normalized Confidence Measure)

  • 최승호
    • 한국음향학회지
    • /
    • 제25권2호
    • /
    • pp.96-100
    • /
    • 2006
  • 고립단어 인식기의 오 인식 단어를 거절하기 위한 방법으로 정규화 신뢰도가 제안되어 논문 [1-2]에서 성공적으로 적용된 바 있다. 그러나 정규화 신뢰도의 성능 측정을 위해 고정된 단어 셌을 대상으로 실험을 하였다. 본 논문에서는 정규화 신뢰도를 가변어휘 음성인식 영역에 적용하여 신뢰도의 거절성능을 밝히고 특히, 벡터양자화기를 이용하여 미 출현 트라이 폰의 문제를 극복하는 방법을 제안한다. 이때 정규화 신뢰도는 트라이 폰 신뢰도들의 통계적 특징(평균과 표준편차)을 사용한다. 가변어휘 인식실험 결과음소 단위의 정규화방법이 트라이 폰 기반 정규화방법에 비하여 우수한 성능을 보였으며 이러한 결과는 논문 [1-2]의 결과와는 상이한 것으로 트라이 폰 기반 정규화 방법이 미 출현 트라이 폰에 대하여 강인하지 못하다는 점을 시사하고 있다. 따라서 정규화 신뢰도가 음소 또는 트라이 폰에 상관없이 기준 신뢰도인 RLTC 신뢰도 [3]에 비하여 우수한 성능을 보였으며 가변어휘 인식에서도 동작함을 확인 할 수 있었다.

잡음 환경하에서의 PSO-NCM을 이용한 거절기능 성능 향상 (Enhancement of Rejection Performance using the PSO-NCM in Noisy Environment)

  • 김병돈;송민규;최승호;김진영
    • 음성과학
    • /
    • 제15권4호
    • /
    • pp.85-96
    • /
    • 2008
  • Automatic speech recognition has severe performance degradation under noisy environments. To cope with the noise problem, many methods have been proposed. Most of them focused on noise-robust features or model adaptation. However, researchers have overlooked utterance verification (UV) under noisy environments. In this paper we discuss UV problems based on the normalized confidence measure. First, we show that UV performance is also degraded in noisy environments with the experiments of an isolated word recognition. Then we observe how the degradation of UV performances is suffered. Based on the UV experiments we propose a modeling method of the statistics of phone confidences using sigmoid functions. For obtaining the parameters of the sigmoidal models, the particle swarm optimization (PSO) is adopted. The proposed method improves 20% rejection performance. Our experimental results show that the PSO-NCM can apply noise speech recognition successfully.

  • PDF

미등록어 거절 알고리즘에서 가우시안 모델 최적화를 이용한 신뢰도 정규화 향상 (In Out-of Vocabulary Rejection Algorithm by Measure of Normalized improvement using Optimization of Gaussian Model Confidence)

  • 안찬식;오상엽
    • 한국컴퓨터정보학회논문지
    • /
    • 제15권12호
    • /
    • pp.125-132
    • /
    • 2010
  • 어휘 인식에서는 인식 학습 시 나타나지 않는 미 출현 트라이 폰이 존재하며, 이들 시스템에서는 모델 파라미터들의 초기 추정치를 생성하지 못하고 음소 데이터에 대한 모델을 구성할 수 없는 단점으로 인하여 가우시안 모델의 정확성을 확보하지 못하게 된다. 이를 개선하기 위하여 확률 분포를 이용한 모델 파라미터의 가우시안 모델 최적화 방법을 제안한다. 확률 분포의 가우시안 모델을 최적화하여 가우시안 모델의 정확성을 제공하고, 음소 단위로 데이터의 탐색을 지원하여 신뢰도가 향상되었다. 제안된 방법의 성능 평가를 위하여 실제 다양한 미등록어가 관측될 수 있는 대상으로 실험을 수행하였으며 본 연구에서 제안한 정규화 신뢰도를 이용한 미등록어 거절 알고리즘이 기존의 방법들에 비하여 평균 1.7%의 성능향상을 나타내었다.

가변어휘 단어 인식에서의 미등록어 거절 알고리즘 성능 비교 (Performance Comparison of Out-Of-Vocabulary Word Rejection Algorithms in Variable Vocabulary Word Recognition)

  • 김기태;문광식;김회린;이영직;정재호
    • 한국음향학회지
    • /
    • 제20권2호
    • /
    • pp.27-34
    • /
    • 2001
  • 발화 검증이란 등록된 단어 목록 이외의 단어가 입력되었을 때, 미등록된 단어는 인식할 수 없는 단어임을 알려주는 기능으로써 사용자에게 친숙한 음성 인식 시스템을 설계하는데 중요한 기술이다. 본 논문에서는 가변어휘 단어 인식기에서 최소 검증 오류를 나타낼 수 있는 발화 검증 시스템의 알고리즘을 제안한다. 우선, 한국전자통신연구원의 PBW(Phonetically Balanced Words) 445DB를 이용하여 가변어휘 단어 인식에서의 미등록어 거절 성능을 향상시키는 효과적인 발화 검증 방법을 제안하였다. 구체적으로 특별한 훈련 과정이 없이도 유사 음소 집합을 많이 포함시킨 반음소 모델을 제안하여 최소 검증 오류를 지니도록 하였다. 또한, 음소 단위의 null hypothesis와 alternate hypothesis의 비를 이용한 음소 단위의 신뢰도는 null hypothesis로 정규화해서 강인한 발화 검증 성능을 보여 주었으며, 음소 단위의 신뢰도를 이용한 단어 단위의 신뢰도는 등록어와 미등록어 사이의 분별력을 잘 표현해 주었다. 이와 같이 새로이 제안된 반음소 모델과 발화 검증 방법을 사용했을 때, CA (Correctly Accept for Keyword: 등록어를 제대로 인정한 경우)는 약 89%, CR (Correctly Reject for OOV (Out-of-Vocabulary): 미등록어에 대해 거절한 경우)은 약 90%로써, 기존 필터 모델을 이용한 방법보다 미등록어 거절 성능이 ERR (Error Reduction Rate) 측면에서 약 15-21% 향상됨을 알 수 있었다.

  • PDF

Measurement and Decomposition of Socioeconomic Inequality in Metabolic Syndrome: A Cross-sectional Analysis of the RaNCD Cohort Study in the West of Iran

  • Moslem Soofi;Farid Najafi;Shahin Soltani;Behzad Karamimatin
    • Journal of Preventive Medicine and Public Health
    • /
    • 제56권1호
    • /
    • pp.50-58
    • /
    • 2023
  • Objectives: Socioeconomic inequality in metabolic syndrome (MetS) remains poorly understood in Iran. The present study examined the extent of the socioeconomic inequalities in MetS and quantified the contribution of its determinants to explain the observed inequality, with a focus on middle-aged adults in Iran. Methods: This cross-sectional study used data from the Ravansar Non-Communicable Disease cohort study. A sample of 9975 middleaged adults aged 35-65 years was analyzed. MetS was assessed based on the International Diabetes Federation definition. Principal component analysis was used to construct socioeconomic status (SES). The Wagstaff normalized concentration index (CIn) was employed to measure the magnitude of socioeconomic inequalities in MetS. Decomposition analysis was performed to identify and calculate the contribution of the MetS inequality determinants. Results: The proportion of MetS in the sample was 41.1%. The CIn of having MetS was 0.043 (95% confidence interval, 0.020 to 0.066), indicating that MetS was more concentrated among individuals with high SES. The main contributors to the observed inequality in MetS were SES (72.0%), residence (rural or urban, 46.9%), and physical activity (31.5%). Conclusions: Our findings indicated a pro-poor inequality in MetS among Iranian middle-aged adults. These results highlight the importance of persuading middle-aged adults to be physically active, particularly those in an urban setting. In addition to targeting physically inactive individuals and those with low levels of education, policy interventions aimed at mitigating socioeconomic inequality in MetS should increase the focus on high-SES individuals and the urban population.

Deep Learning-Based Assessment of Functional Liver Capacity Using Gadoxetic Acid-Enhanced Hepatobiliary Phase MRI

  • Hyo Jung Park;Jee Seok Yoon;Seung Soo Lee;Heung-Il Suk;Bumwoo Park;Yu Sub Sung;Seung Baek Hong;Hwaseong Ryu
    • Korean Journal of Radiology
    • /
    • 제23권7호
    • /
    • pp.720-731
    • /
    • 2022
  • Objective: We aimed to develop and test a deep learning algorithm (DLA) for fully automated measurement of the volume and signal intensity (SI) of the liver and spleen using gadoxetic acid-enhanced hepatobiliary phase (HBP)-magnetic resonance imaging (MRI) and to evaluate the clinical utility of DLA-assisted assessment of functional liver capacity. Materials and Methods: The DLA was developed using HBP-MRI data from 1014 patients. Using an independent test dataset (110 internal and 90 external MRI data), the segmentation performance of the DLA was measured using the Dice similarity score (DSS), and the agreement between the DLA and the ground truth for the volume and SI measurements was assessed with a Bland-Altman 95% limit of agreement (LOA). In 276 separate patients (male:female, 191:85; mean age ± standard deviation, 40 ± 15 years) who underwent hepatic resection, we evaluated the correlations between various DLA-based MRI indices, including liver volume normalized by body surface area (LVBSA), liver-to-spleen SI ratio (LSSR), MRI parameter-adjusted LSSR (aLSSR), LSSR × LVBSA, and aLSSR × LVBSA, and the indocyanine green retention rate at 15 minutes (ICG-R15), and determined the diagnostic performance of the DLA-based MRI indices to detect ICG-R15 ≥ 20%. Results: In the test dataset, the mean DSS was 0.977 for liver segmentation and 0.946 for spleen segmentation. The Bland-Altman 95% LOAs were 0.08% ± 3.70% for the liver volume, 0.20% ± 7.89% for the spleen volume, -0.02% ± 1.28% for the liver SI, and -0.01% ± 1.70% for the spleen SI. Among DLA-based MRI indices, aLSSR × LVBSA showed the strongest correlation with ICG-R15 (r = -0.54, p < 0.001), with area under receiver operating characteristic curve of 0.932 (95% confidence interval, 0.895-0.959) to diagnose ICG-R15 ≥ 20%. Conclusion: Our DLA can accurately measure the volume and SI of the liver and spleen and may be useful for assessing functional liver capacity using gadoxetic acid-enhanced HBP-MRI.