• 제목/요약/키워드: 사전확률

검색결과 417건 처리시간 0.024초

확률적 CFG 파싱을 활용한 한국어 복합명사 구조 분석의 중의성 해소 (Disambiguation on the Analysis of Korean Complex Nominals, Using Probabilistic CFG Parsing)

  • 김동성
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2011년도 제23회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.61-66
    • /
    • 2011
  • 본 논문은 한국어 복합명사 구조의 분석을 목적으로 한다. 연구는 이론 언어학뿐만이 아니라 정보처리, 정보검색과 같은 언어의 전산적 처리에서도 중요한다. 복합명사 구조는 크게 외심구조와 내심구조로 나뉘며 내심구조의 경우에 좌분지나 우분지 구조로 분석이 되어야 하는 중의성이 있다. 기존의 Lauer 모델은 사전적 정보에서 발견되는 확률 정보를 구조 정보에 연결하기 위한 모델로 의존모델과 인접모델을 제시하였다. 본 연구에서는 구조에 기반을 둔 확률정보를 결합하기 위한 확률적 CFG 파싱 방법을 활용하고자 하였다. 이를 위해서 실제 코퍼스상에서 발견되는 복합명사 패턴을 대상으로 구조적 분석을 화자 직관을 통해서 진행하고, 이를 다시 Lauer 모델과 확률적 CFG 파싱 방법 응용과 비교해 보았다. 결과적으로 화자 직관에 가장 일치한 예측을 하였으며, 구조에 대한 정보 해석이 가능하였다.

  • PDF

정렬 워크벤치의 설계 및 구현 (The Design and Implementation of Alignment Workbench)

  • 이재성;강정구;이주호;;최기선
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1997년도 제9회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.430-435
    • /
    • 1997
  • 통계적인 방법으로 병렬 코퍼스(parallel corpus)로부터 사전정보를 추출해 내는 정렬 시스템에 대한 연구가 세계 여러곳에서 진행되고 있다(신중호 1996; Dagan 1996; Fung 1995; Kupiec 1993). 그 결과로 만들어진 사전정보는 유용한 대역어와 대역 확률을 포함하고 있지만, 불필요하거나 잘못된 요소들도 많이 포함되어 있어 재조정 작업이 필요하다. 이는 사전정보를 직관적으로 확인함으로써 조정을 할 수도 있지만, 좀 더 정확한 조정을 위해 각각의 사전정보(정렬의 결과)가 코퍼스의 어떤 문장에서 나온 것인가 등을 확인할 필요가 있다. 정렬 워크벤치는 이와 같은 작업을 효율적으로 처리할 수 있도록 만들어졌으며, 현재 구현되어 작동되고 있다. 본 논문에서는 정렬 워크벤치를 위해 필요한 정렬시스템의 변형과 사전작업의 편의를 위해 제공되어져야 하는 기능 등에 관하여 설명하고, 간단한 평가 결과를 설명한다.

  • PDF

확률적 모델을 이용한 연속 숫자음 인식에 관한 연구 (A Study on Continuous Digits Speech Recognition using Probabilistic Models)

  • 이주승;이성권;김순협
    • 한국음향학회:학술대회논문집
    • /
    • 한국음향학회 1999년도 학술발표대회 논문집 제18권 2호
    • /
    • pp.109-112
    • /
    • 1999
  • 본 연구는 음소 단위의 CHMM(Continuous Hidden Markov Model)을 이용한 한국어 연속 음성인식에 관한 내용이다. 연구실 환경에서 음성으로 전화를 걸기 위하여 연속 숫자음 인식을 수행하였다. ETRI 445 데이터를 사용하여 초기의 모델은 ML(Maximum Likelihood) 추정법을 이용하여 작성하였고 적응화를 위해 최대 사후 확률 추정법을 사용하였다. 연속 숫자음의 인식을 위하여 한국어 숫자음 음성의 음향학적 특성을 고려하여 발성 사전을 작성하였고, 음절 단위로 되어있는 한국어 숫자음의 모든 경우를 고려하여 복수개의 단어를 사전에 등록하였다. 또한 숫자음의 알 뒤 연음현상을 고려하여 작성한 21 종류의 7자리 숫자음과 이를 음절 단위로 세그먼트한 숫자음을 DB로 사용하여 적응화를 수행하였다. 이의 효율성을 입증하기 위하여 ETRI에서 작성한 35종류의 4연속 숫자음 목록을 대상으로 인식실험을 수행하였다.

  • PDF

HMM 어휘 인식 모델 최적화를 이용한 베이시안 기법 인식률 향상 (Bayesian Method Recognition Rates Improvement using HMM Vocabulary Recognition Model Optimization)

  • 오상엽
    • 디지털융복합연구
    • /
    • 제12권7호
    • /
    • pp.273-278
    • /
    • 2014
  • HMM(Hidden Markov Model)을 이용한 어휘 인식에서 인식 어휘의 모델들의 대한 인식 확률이 이산적인 분포를 나타내며 인식을 위한 계산량이 적은 장점이 있지만 인식률을 계산했을 때 상대적으로 낮은 단점이 있다. 이를 개선하기 위하여 HMM(Hidden Markov Model) 모델 최적화를 이용한 베이시안 기법 인식률 향상을 제안한다. 본 논문은 HMM 어휘 인식에서 인식을 위한 모델 구성을 가우시안 믹스쳐 모델로 최적화한 인식 모델을 생성하였으며 베이시안 기법인 사전확률과 사후확률을 이용한 인식률을 향상시켰다. 본 논문에서 제안한 방법을 적용한 결과 어휘인식률에서 97.9%의 인식률을 나타내었다.

변이음 HMM을 이용한 고립단어 인식 (Isolated Word Recognition Using Allophone Unit Hidden Markov Model)

  • 이강성;김순협
    • 한국음향학회지
    • /
    • 제10권2호
    • /
    • pp.29-35
    • /
    • 1991
  • 본 논문에서는 변이음 단위의 Hidden Markov Model (HMM)을 이용하여 고립단어를 인식하는 방법을 논한다. 변이음 단위로 HMM을 구성하여 변이음 사전을 만들고, 이 변이음 사전을 이용하여 단어 사전을 구성한다. 변이음 HMM을 이용하여 단어를 구성하려면 변이음 간의 천이확률이 계산되어야 하므로 본 연구에서는 변이음 간의 천이 확률의 영향을 측정하여 그 변이음으로 이루어지는 임의의 단어를 적응없이 적은 수의 적응 데이터로 단어모델을 구성 인식하는 것을 설명한다. 비교를 위하여 단어인식 HMM으로 인식 실험을 한 결과, 변이음 단위 HMM이 적은 기억 용량과 적은 데이터의 훈련으로 단어단위 HMM 이상의 인식률을 얻을 수 있음을 보였다.

  • PDF

의미처리 기반의 한글-한자 변환 시스템 (korean-Hanja Translation System based on Semantic Processing)

  • 김홍순;신준철;옥철영
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2011년도 춘계학술발표대회
    • /
    • pp.398-401
    • /
    • 2011
  • 워드프로세서에서의 한자를 가진 한글 어휘의 한자 변환 작업은 사용자에 의해 음절/단어 단위의 변환으로 많은 시간이 소요되어 효율이 떨어진다. 본 논문에서는 한글 문장의 의미처리를 통해 문맥에 맞는 한자를 자동 변환하는 시스템을 제안한다. 문맥에 맞는 한글-한자 변환을 위해서는 우선 정확한 형태소 분석 및 동형이의어 분별이 선행되어야 한다. 이를 위해 본 논문에서는 은닉마르코프모델 기반의 형태소 및 동형이의어 동시 태깅 시스템을 구현하였다. 제안한 시스템은 형태의미 세종 말뭉치 1,100만여 어절을 이용하여 unigram과 bigram을 추출 하였고, unigram을 이용하여 어절의 생성확률 사전을 구축하고 bigram을 이용하여 전이확률 학습사전을 구축하였다. 그리고 품사 및 동형이의어 태깅 후 명사를 표준국어대사전에 등재된 한자로 변환하는 시스템을 구현하였다. 구현된 시스템의 성능 확인을 위해 전체 세종 말뭉치를 문장단위로 비학습 말뭉치를 구성하여 실험하였고, 실험결과 한자를 가진 동형이의어에 대한 한자 변환에서 90.35%의 정확률을 보였다.

베이지안 확률적 접근법을 이용한 건설업체 부도 예측에 관한 연구 (Predicting Default of Construction Companies Using Bayesian Probabilistic Approach)

  • 홍성문;황재연;권태환;김주형;김재준
    • 한국건설관리학회논문집
    • /
    • 제17권5호
    • /
    • pp.13-21
    • /
    • 2016
  • 주수급자 역할을 하는 건설기업의 부실화는 발주자에게 공사계약 미이행에 따른 피해를 초래할 수 있고, 전문건설업체 및 자재공급업체의 재무건전성에 악영향을 줄 수 있다. 건설업은 프로젝트를 수주하고 진도에 따라 기성을 받는 현금흐름의 재무적 특성이 존재하고, 사업 진행 중의 부실화는 투입한 자금의 손실로 이어질 수 있으므로 건설업체의 부실화 예측은 중요하다. 국내 건설업체의 부실화 예측은 90년도 초 미국에서 개발된 KMV (Kealhofer McQuown and Vasicek)사의 KMV모형으로 수행되는 경우도 있지만, 이 모형은 일반적인 기업 및 은행의 신용위험 평가에 개발되어져 건설기업 예측력에는 부족함이 있다. 또한, KMV값의 부도확률 예측력에 대해서는 분석대상의 기업수 및 데이터의 부족으로 의문점이 지속적으로 제기되고 있다. 따라서 이러한 의문점을 해결하기 위해 기존 부도예측확률모형에 베이지안 확률적 접근법(Bayesian Probabilistic Approach)을 접목하고자 한다. 베이즈 통계학의 사전확률(Prior Probability)만 적절하게 예측가능하다면 적은 정보라도 증거에 대한 조건부 획득으로 신뢰성 있는 사후확률(Posterior Probability)을 예측할 수 있기 때문이다. 이에 본 연구에서는 기존 부도예측확률모형에 베이지안 확률적 접근법을 활용하여 예상부도확률(Expected Default Frequency, EDF)을 측정하고, 기존 모형의 예상부도확률과 비교하여 정확성을 예측하고자 한다.

베이즈이론을 이용한 가뭄 확률 전망 기법 고도화 (Improvement in probabilistic drought prediction method using Bayes' theorem)

  • 김대호;김영오
    • 한국수자원학회:학술대회논문집
    • /
    • 한국수자원학회 2020년도 학술발표회
    • /
    • pp.153-153
    • /
    • 2020
  • 우리나라에선 크고 작은 가뭄 피해가 자주 일어나고 있으며 최근엔 유래 없는 다년가뭄이 발생하면서 가뭄에 대한 경각심이 커지고 있다. 가뭄에 적절하게 대응하여 피해를 경감시키기 위해서는 신뢰도 높은 가뭄 예측이 선행되어야 한다. 이에 본 연구는 앙상블 예측과 베이즈이론(Bayes' theorem)을 수문학적 가뭄지수 중 하나인 SRI(Standardized Runoff Index)에 적용해 가뭄 확률 전망을 실시했으며 이를 EDP(Ensemble Drought Prediction)라고 칭하였다. 국내 8개 댐유역에서 EDP를 생성하고 개선하는 과정은 다음과 같이 진행된다. 우선 TANK모형을 활용한 1개월 선행 유량 예측(Ensemble Streamflow Prediction, ESP)의 결과를 SRI로 변환하여 EDP 확률분포를 생성한다. 그런 다음, EDP를 개선하기 위해 그 기초인 ESP에서 미흡한 토양수분 초기조건을 보완하고자 베이즈이론을 활용했다. APCC(APEC Climate Center)의 위성 관측 SMI(Soil Moisture Index) 자료로 SRI와의 회귀식을 구축, 이를 우도함수로 정의해 사전 EDP 분포를 업데이트한 EDP+ 확률분포를 생성했다. 그 결과, EDP와 EDP+ 모두 심도가 깊은 가뭄을 전망할수록 예측력이 기후학적 예측보다 좋지 않았다. 그럼에도 우도함수로 사용한 회귀식의 정확도가 높을수록 EDP+의 정확도도 향상되는 경향이 나타났으며, 이는 베이즈이론을 사용한다면 가뭄 확률 전망을 개선할 수 있다는 것을 의미하고 있다. 하지만, 확정 전망 정확도는 확률 전망 정확도와는 관계가 없었는데 이는 확정 전망과 확률 전망이 본질적으로 다르기 때문인 것으로 사료된다.

  • PDF

프리스트레스트 콘크리트 교량의 프리스트레스 장기 예측의 불확실성 및 업데이팅 (Uncertainty and Updating of Long-Term Prediction of Prestress in Prestressed Concrete Bridges)

  • 양인환
    • 한국전산구조공학회논문집
    • /
    • 제17권3호
    • /
    • pp.251-259
    • /
    • 2004
  • 콘크리트의 크리프와 건조수축에 의한 시간에 따른 프리스트레스 장기예측의 정확성은 프리스트레스트 큰크리트 교량과 같은 사회 기반 시설의 유지 관리 및 보수 결정 측면에서 매우 중요한 역할을 한다. 본 논문에서는 프리스트레스트 콘크리트 교량의 프리스트레스 장기예측의 불확실성 감소, 즉 예측의 정확성 향상을 위하여 현장 계측치를 이용하여 베이시안(Bayesian)통계기법을 도입하는 예측기법을 제안하였다. 베이시안 해석시 사전 확률분포는 콘크리트의 크리프와 건조수축의 확률 특성을 고려하여 나타내며, 우도 함수(likelihood function)는 현장에서의 계측치를 사용하여 나타내었다. 시간에 따른 구조적 거동 시스템으로부터의 지속적인 계측 기록은 베이시안 지식 기반에서의 확률분포를 업데이팅 하기 위하여 사용되며, 사후 확률분포는 사전확률분포와 우도 함수를 조합하여 획득한다. 실제로 가설되고 있는 프리스트레스트 콘크리트 박스 거더 교량으로부터 계측된 프리스트레스 힘의 수치 예제해석을 통하여 제안 기법의 적용성을 제시하였다.

베이지안 기법에 의거한 중대형 방사선원의 분실 시 일반인에 대한 방사선 위험도의 평가 (Radiological Risk Assessment for the Public Under the Loss of Medium and Large Sources Using Bayesian Methodology)

  • 김주연;장한기;이재기
    • Journal of Radiation Protection and Research
    • /
    • 제30권2호
    • /
    • pp.91-97
    • /
    • 2005
  • 베이지안 기법은 객관적 자료 이외에 주관적 지식도 평가에 반영하는 특성으로 인해 최근 PRA에서 널리 사용되고 있다. 본 연구에서는 비파괴검사 장비 분실에 대한 방사선 위험도를 평가하기 위해 베이지안 기법을 활용하였다. U.S. NRC에서 제시한 선원분실 피폭 시나리오를 국내 실정에 맞게 재구성하였고 안전인자의 사고발생 확률에 국한하여 적용하였다. 사고발생 확률수정의 경우 Jeffreys사전분포를 사용한 결과가 모호사전분포를 사용한 결과보다 5 % 베이즈 하한치가 더 낮아서 방사선 사고와 같은 낮은 사고발생 확률을 가지는 시스템에 대한 위험도 평가에 적합하다. 위험도의 결과를 보면 일반인의 연간 예상되는 평균선량은 베이지안 기법이 고전적인 기법에 의거한 평가보다 높은 선량을 나타내는데 이는 수정된 안전인자 확률의 평균이 고전적 확률 참보다 높게 평가된 것에 기인한다. 국내의 경우 방사선 위험도 평가를 위한 자료구축이 미비한 바 베이지안 기법은 위험도 평가에 유용한 대안으로 활용할 수 있으며 이러한 연구는 위험도 정보-기반 규제에 기여할 것이다.