A Study on Automatic Indexing of Korean Texts based on Statistical Criteria

통계적기법에 의한 한글자동색인의 연구

  • 우동진 (한국전자통신연구소 정보관리실)
  • Received : 1987.04.02
  • Published : 1987.06.30

Abstract

The purpose of this study is to present an effective automatic indexing method of Korean texts based on statistical criteria. Titles and abstracts of the 299 documents randomly selected from ETRI's DOCUMENT data base are used as the experimental data in this study the experimental data is divided into 4 word groups and these 4 word groups are respectively analyzed and evaluated by applying 3 automatic indexing methods including Transition Phenomena of Word Occurrence, Inverse Document Frequency Weighting Technique, and Term Discrimination Weighting Technique.

본 연구는 한글자동색인에 관한 연구로 한국전자통신연구소의 DOCUMENT Data Base로부터 299개 문헌의 제목과 초록을 무작위로 추출하여 단어분리를 시도하고, 분리된 단어군, 인식어를 제외한 단어군, 인식어와 불용어를 제외한 단어군, 그리고 인식어와 불용어를 제외하고 복합어를 구성하여 포함한 단어군 등 4개의 시험군을 설정한 후, 파오의 전환점 산출기과 스파크죤스의 역문헌 가중기법, 살톤의 문헌분리 가중기법을 적용하여 색인어를 선정하고 이를 비교 평가하여 한글문헌의 자동색인 방안을 모색하였다.

Keywords