Abstract
It is expected that some Josa/Eomi's are frequently used and others are not in the Korean documents. In this paper. we confirm it through the experiment and show that such information is very useful for Korean language processing. In case of Josa. most frequent 9 Josa's occupied 70% of total Josa's and 20. 32. 69 Josa's occupied 90%. 95%. and 99% respectively. Similarly, most frequent 10 numbers of Eomi's occupied 70% of total Eomi's and 33. 54. 117 Eomi's occupied 90%. 95%. and 99% respectively. We propose a dictionary construction method for Josa/Eomi dictionary that is classified by the frequency information. Furthermore. Josa/Eomi frequency results are very useful for the identification of unregistered morphemes and the disambiguation of lexical ambiguities.
한글 문서에서 일부 조사와 일부 어미들은 출현 빈도가 높은 반면에 그 외에 조사와 어미는 출현빈도가 낮을 것으로 추측되고 있다. 본 연구에서는 실험을 통해서 이러한 사실을 확인하고 한국어 분석 시스템에서 활용하기 위하여 조사와 어미의 상대적 출현 빈도를 조사하였다. 조사의 상대적 출현 빈도를 조사한 결과, 말 뭉치 분야에 따라 약간의 차이가 있으나 일반적으로 빈도수가 높은 9개의 조사가 전체 조사의 70%를 차지하고 상위 20개, 32개, 69개의 조사가 각각 90%, 95%, 99%를 차지하고 있음을 확인하였다. 어말 어미는 빈도수가 높은 10개의 어말 어미가 전체 어말 어미의 70%를 차지하고 상위 33개, 54개, 117개가 각각 90%, 95%, 99%를 차지하고 있다. 본 논문에서는 조사와 어미의 상대적 출현 빈도에 따라 문법형태소 사전을 구성하는 방법을 제안한다. 조사와 어미의 상대적 출현 빈도는 미등록 어 추정이나 형태론적 중의 성을 해결할 때도 활용된다.