A Reverse Segmentation Algorithm of Compound Nouns Using Affix Information and Preference Pattern

접사정보 및 선호패턴을 이용한 복합명사의 역방향 분해 알고리즘

  • 류방 (진주보건대학 컴퓨터정보기술계열) ;
  • 백현철 (진주의료원 전산) ;
  • 김상복 (경상대학교 컴퓨터과학과)
  • Published : 2004.03.01

Abstract

This paper suggests a reverse segmentation Algorithm using affix information and some preference pattern information of Korean compound nouns. The structure of Korean compound nouns are mostly derived from the Chinese characters and it includes some preference patterns, which are going to be utilized as a segmentation rule in this paper. To evaluate the accuracy of the proposed algorithm, an experiment was performed with 36061 compound nouns. The experiment resulted in getting 99.3% of correct segmentation and showed excellent satisfactory result from the comparative experimentation with other algorithm, especially most of the four or five-syllable compound nouns were successfully segmented without fail.

본 논문에서는 음절간 상호정 보를 이용하여 한국어 복합명사의 역방향 분해 알고리즘을 제 안한다. 한국어 복합명사는 그 구조가 한자어에 의해 파생 한것이 대부분이며 음절 상호간 선호 음절이 존재하므로, 이 정보와 접사정보를 복합명사의 분해규칙으로 이용한다. 성능을 평가하기 위해 36061개의 복합명사를 이용하여 본 논문에서 제안한 알고리즘의 분해한 결과 99.3%의 분해 정확율을 얻었다. 실험과 관련한 기존 알고리즘간의 비교에서도 우수한 결과를 얻었으며, 특히 4음절과 5음절 복합명사의 경우 대부분 정확한 분해 결과를 얻었다.

Keywords