Search | Korea Science

Homonym Disambiguation based on Average Mutual Information (평균 상호정보량에 기반한 동음이의어 중의성 해소)

Hur, Jeong;Jang, Myung-Gil
- Annual Conference on Human and Language Technology
- /
- 2005.10a
- /
- pp.159-166
- /
- 2005
자연언어처리의 목적은 컴퓨터가 자연어를 이해할 수 있도록 하여, 인간에게 다양한 정보를 정확하고 빠르게 전달할 수 있도록 하고자 하는 것이다. 이를 위해서는 언어의 의미를 정확히 파악하여야 하는데, 어휘 의미 중의성 해소가 필수적인 기술이다. 본 연구에서는 평균 상호정보량에 기반한 동음이의어 의미 중의성 해소 기술을 소개한다. 사전 뜻풀이를 이용하는 기존 연구들은 어휘들간의 정확한 매칭에 의존하기 때문에 자료부족 현상이 심각하였다. 그러나, 본 연구에서는 어휘들간의 연관계수인 상호정보량을 이용함으로써 이 문제를 완화시켰다. 또한, 상호정보량을 가지는 어휘 쌍의 비율, 의미 별 빈도 정보와 뜻풀이의 길이를 가중치로 반영하였다. 본 시스템의 평가를 위해 질의응답 평가셋의 500여 개의 질의와 정답단락을 대상으로 동음이의어 의미 중의성 해소 평가셋을 구축하였다. 평가셋에 기반하여 두 가지 유형의 실험을 수행하였다. 실험 결과는 평균 상호정보량만을 이용하였을 때 62.04%의 정확률을 보였고, 가중치를 활용하였을 때 83.42%의 정확률을 보였다.
PDF

Improvement of Sign Word Dictionary for Korean Sign Language Avatar (한국 수화 아바타를 위한 수화 사전의 개선 방법)

Oh, Young-Joon;Park, Kwang-Hyun;Bien, Zeung-Nam
- Proceedings of the Korean Information Science Society Conference
- /
- 2007.06c
- /
- pp.167-170
- /
- 2007
본 논문에서는 수화 아바타가 실제 청각장애인처럼 자연스러운 수화 동작을 표현하면서 정확한 의사를 전달할 수 있도록 동음이의어에 대한 처리를 다룬다. 기존의 수화 사전에 품사 정보를 추가하고 한글 형태소 분석기를 활용하여 동음이의어를 구분할 수 있도록 수화 사전을 개선하는 방법을 제안한다.
PDF

Homonym Disambiguation based on Mutual Information and Sense-Tagged Compound Noun Dictionary (상호정보량과 복합명사 의미사전에 기반한 동음이의어 중의성 해소)

Heo, Jeong;Seo, Hee-Cheol;Jang, Myung-Gil
- Journal of KIISE:Software and Applications
- /
- v.33 no.12
- /
- pp.1073-1089
- /
- 2006
The goal of Natural Language Processing(NLP) is to make a computer understand a natural language and to deliver the meanings of natural language to humans. Word sense Disambiguation(WSD is a very important technology to achieve the goal of NLP. In this paper, we describe a technology for automatic homonyms disambiguation using both Mutual Information(MI) and a Sense-Tagged Compound Noun Dictionary. Previous research work using word definitions in dictionary suffered from the problem of data sparseness because of the use of exact word matching. Our work overcomes this problem by using MI which is an association measure between words. To reflect language features, the rate of word-pairs with MI values, sense frequency and site of word definitions are used as weights in our system. We constructed a Sense-Tagged Compound Noun Dictionary for high frequency compound nouns and used it to resolve homonym sense disambiguation. Experimental data for testing and evaluating our system is constructed from QA(Question Answering) test data which consisted of about 200 query sentences and answer paragraphs. We performed 4 types of experiments. In case of being used only MI, the result of experiment showed a precision of 65.06%. When we used the weighted values, we achieved a precision of 85.35% and when we used the Sense-Tagged Compound Noun Dictionary, we achieved a precision of 88.82%, respectively.
PDF KSCI

Homonym Disambiguation using Sense-Tagged Compound Noun Dictionary (복합명사 의미사전을 이용한 동음이의어 중의성 해소)

Hur Jeong;Jang Myung-Gil
- Proceedings of the Korean Information Science Society Conference
- /
- 2005.11b
- /
- pp.538-540
- /
- 2005
본 논문에서는 평균 상호정보량에 기반하고 복합명사 의미사전을 이용한 동음이의어 중의성 해소 기술에 대해서 소개한다. 평균 상호정보량을 이용한 방법은 사전의 뜻풀이를 이용하는 기존 방법의 자료부족문제를 완화시킨다. 복합명사 의미사전은 복합명사를 구성하는 단일영사들의 의미제약 관계를 이용하여 구축된다. 기 구축된 복합명사 의미사전은 어휘 의미 중의성의 정확률을 향상시키고, 연산 시간을 줄여 시스템의 효율성을 극대화시킨다. 평균 상호정보량을 이용한 실험에서는 $62.04\%$의 정확률로 LESK의 방법에 비해 $6.06\%$의 향상이 있었고, 복합명사 의미사전을 이용하였을 때는 $68.13\%$의 정확률로 $12.76\%$의 정확률 향상이 있었다.
PDF

Using Thesaurus for Disambiguation and if's limit (동사의 애매성 해소를 위한 시소러스의 이용과 한계)

송영빈;최기선
- Proceedings of the Korean Society for Cognitive Science Conference
- /
- 2000.06a
- /
- pp.255-261
- /
- 2000
동사의 애매성 해소는 언어학의 여러 부문 중에서도 가장 실체가 불명확한 의미를 다루는 것이기 때문에 언어학뿐만 아니라 자연언어처리에 있어서도 가장 해결하기 어려운 문제 중에 하나이다. 애매성은 언어학에서 말하는 동음이의어와 다의어를 동시에 포괄하는 개념으로 정의된다. 단일어를 대상으로 한 이와 같은 분류는 비교적 명확한 반면 두 개의 언어 이상의 다국어를 대상으로 하는 기계번역용 사전과 같은 대역사전에 있어서는 동음이의어와 다의어의 구별은 경계가 불명확하여 의미에 기반한 대역어의 작성에 도움이 되지 않는다. 그 원인은 의미를 구성하는 세 가지 요소인 [실체], [개념], [표현]의 관점에서 [실체]와 [개념]은 어느 언어를 막론하고 보편적인 반면 [실체]와 [개념]을 최종적으로 실현하는 형태인 [표현]의 경우 각각의 언어에 따라 그 형태가 다르게 표출된다고 하는 사실 때문이다. [나무]라는 [실체]가 있다고 할 때 [나무]에 대한 [실체]와 [개념]은 언어를 초월해서 공통적이라고 할 수 있다. 한편 [개념]을 표현하는 실체인 [표현]은 언어에 따라 [namu](한국어_, [ki](일본어),[tree](영어) 등과 같이 언어에 따라 자의적으로 [개념]을 표현하고 있다. [namu], [ki], [tree]가 같은 뜻을 나타낸다고 인식할 수 있는 것은 [개념]이 같기 때문이지 이들 각각의 [표현]이 의미적 연관성을 갖고 있기 때문은 아니다. 지금까지 의미를 다루는 연구에서는 이와 같은 관점이 결여됨으로 인해 의미의 다양성을 정확히 파악하는 데 한계가 있었으며 애매성 해소에 관한 연구도 부분적 시도에 그친 면이 적지 않다. 본고에서는 다국어를 대상으로 한 대역사전의 구축에 있어서 다의어와 동음이의어에 대한 종래의 분류의 문제점을 지적하고 나아가 애매성 해소의 한 방법론으로 활발히 이용되고 있는 시소러스의 분류체계의 한계를 지적한다. 나아가 이의 해결책을 한국어와 일본어의 대역사전의 구축에서 얻어진 경험을 바탕으로 제시한다.
PDF

Enhancing Document Clustering using Important Term of Cluster and Wikipedia (군집의 중요 용어와 위키피디아를 이용한 문서군집 향상)

Park, Sun;Lee, Yeon-Woo;Jeong, Min-A;Lee, Seong-Ro
- Journal of the Institute of Electronics Engineers of Korea SP
- /
- v.49 no.2
- /
- pp.45-52
- /
- 2012
This paper proposes a new enhancing document clustering method using the important terms of cluster and the wikipedia. The proposed method can well represent the concept of cluster topics by means of selecting the important terms in cluster by the semantic features of NMF. It can solve the problem of "bags of words" to be not considered the meaningful relationships between documents and clusters, which expands the important terms of cluster by using of the synonyms of wikipedia. Also, it can improve the quality of document clustering which uses the expanded cluster important terms to refine the initial cluster by re-clustering. The experimental results demonstrate that the proposed method achieves better performance than other document clustering methods.
PDF KSCI

Using Thesaurus for Disambiguation and it's limit (동사의 애매성 해소를 위한 시소러스의 이용과 한계)

Song, Young-Bin;Choi, Key-Sun
- Annual Conference on Human and Language Technology
- /
- 2000.10d
- /
- pp.255-261
- /
- 2000
동사의 애매성 해소는 언어학의 여러 부문 중에서도 가장 실체가 불명확한 의미를 다루는 것이기 때문에 언어학뿐만 아니라 자연언어처리에 있어서도 가장 해결하기 어려운 문제 중에 하나이다. 애매성은 언어학에서 말하는 동음이의어와 다의어를 동시에 포괄하는 개념으로 정의된다. 단일어를 대상으로 한 이와 같은 분류는 비교적 명확한 반면 두 개의 언어 이상의 다국어를 대상으로 하는 기계번역용 사전과 같은 대역사전에 있어서는 동음이의어와 다의어의 구변은 경계가 불명확하여 의미에 기반한 대역어의 작성에 도움이 되지 않는다. 그 원인은 의미를 구성하는 세 가지 요소인 [실체], [개념], [표현]의 관점에서 [실체]와 [개념]은 어느 언어를 막론하고 보편적인 반면 [실체]와 [개념]을 최종적으로 실현하는 형대인 [표현]의 경우 각각의 언어에 따라 그 형태가 다르게 표출된다고 하는 사실 때문이다. [나무]라는 [실체]가 있다고 할 때 [나무]에 대한 [실체]와 [개념]은 언어를 초월해서 공통적이라고 할 수 있다. 한편, [개념]을 표현하는 실체인 [표현]은 언어에 따라 [namu](한국어), [ki](일본어), [tree](영어) 등과 같이 언어에 따라 자의적으로 [개념]을 표현하고 있다. [namu], [ki], [tree]가 같은 뜻을 나타낸다고 인식할 수 있는 것은 [개념]이 같기 때문이지 이들 각각의 [표현]이 의미적 연관성을 갖고 있기 때문은 아니다. 지금까지 의미를 다루는 연구에서는 이와 같은 관점이 결여됨으로 인해 의미의 다양성을 정확히 파악하는 데 한계가 있었으며 애매성 해소에 관한 연구도 부분적 시도에 그친 면이 적지 않다. 본고에서는 다국어를 대상으로 한 대역사전의 구축에 있어서 다의어와 동음이의어에 대한 종래의 분류의 문제점을 지적하고 나아가 애매성 해소의 한 방법론으로 활발히 이용되고 있는 시소러스의 분류체계의 한계를 지적한다. 나아가 이의 해결책을 한국어와 일본어의 대역사전의 구축에서 얻어진 경험을 바탕으로 제시한다.
PDF

Resolving the Ambigities in World Sense by using Automatic Keyword Network in Information Retrieval (정보검색에서의 어의 중의성 해소를 위한 자동 키워드망의 이용)

Kim, Jung-Sae;Jang, Duk-Sung
- The Transactions of the Korea Information Processing Society
- /
- v.7 no.12
- /
- pp.3855-3865
- /
- 2000
The automatic indexing is a compulsory part for the text retrieval system. However it is impossible to rank the appropriate texts at top. Furthermore, it is more difficult to prevent to rank the inappropriate texts having homonyms at top by only the automatic indexing. In this paper, we proposed the two-level retrieval system to enhance the retrieval efficiency, in which Automatic Keyword Network (AKN) is used at the second-level process. The firsHevel search is carried out with an inverted index file generated by the automatic indexing. On the other hand the second-level search exploits AKN based on the degree of asslxiation between terms. We have developed several formulas for rearranging the rank of texts at second-level search, and evaluated the performance of the effects of them on resolving the word sense ambiguities.
PDF

The Design and Implementation of Automatic Query Term Refiner for Term Expansion/Restriction in Information Retrieval (정보검색에서 질의 용어 확장/한정을 위한 자동 질의 용어 정련기의 설계 및 구현)

Kang, Hyun-Su;Kang, Hyun-Kyu;Lee, Yong-Seok;Kim, Young-Sum
- Annual Conference on Human and Language Technology
- /
- 1998.10c
- /
- pp.65-72
- /
- 1998
인터넷 정보 검색에서 이용자들이 주로 사용하는 질의는 2-3개의 용어로 이루어진 짧은 질의이다. 또만 동음이의어를 갖는 용어를 사용하기도 한다. 짧은 질의를 처리하는 일반적인 방법은 시소러스[8]나 Wordnet[1]을 이용한 질의 확장이다. 그러나 시소러스나 Wordnet과 같은 지식 베이스는 구축하기가 용이하지 않으며, 도메인 종속적인 면과 단어의 회귀(sparseness) 문제를 극복하기 어려운 단점이 있다. 또한 동음이의어 용어로 인하여 검색의 정확성이 털어지는 문제점이 있다. 한편, 사용자의 질의를 주의 깊게 살펴보면, 질의로부터 관련 용어 분류 정보를 추출할 수 있다. 본 논문은 사용자의 질의가 관련 용어 분류 정보에 의해 유기적으로 관계를 가지고 있다는 사실에 기인하여 관련 용어 분류 정보에 따라 자동으로 용어 확장 및 한정을 수행하며 적절한 용어 가중치를 부여하는 자동 질의 용어 정련기를 제안한다. 자동 질의 용어 정련기는 용어의 확장, 한정 및 가중치 부여를 통하여 사용자의 정보 검색 요구를 명확히 하여 검색의 정확성을 향상시킨다.
PDF

Word Sense Disambiguation using corpus based sense distribution and collocation (코퍼스 기반 의미체계와 의미 별 공기정보를 이용한 비지도식 의미구분)

신사임;최기선
- Proceedings of the Korean Information Science Society Conference
- /
- 2004.10a
- /
- pp.772-774
- /
- 2004
본 논문은 원시코퍼스에서 추출한 동음이의어의 의미 별 공기정보를 사용한 비지도식 의미구분 시스템의 구축을 제안한다. 대용량 원시코퍼스에서 추출한 의미체계를 기준으로 의미구분을 수행하였기 때문에 비현실적인 의미체계에 의한 문제점을 해결하였고, 원시코퍼스에서 추출한 공기정보로 데이터 획득비용과 부족문제를 해소하였다 실험을 통해 의미체계의 현실화와 비지도식 훈련데이터 추출방법이 의미구분의 성능향상에 기여함을 보였다
PDF

Search Result 28, Processing Time 0.021 seconds

이메일무단수집거부

이용약관

제 1 장 총칙

제 2 장 이용계약의 체결

제 3 장 계약 당사자의 의무

제 4 장 서비스의 이용

제 5 장 계약 해지 및 이용 제한

제 6 장 손해배상 및 기타사항

Detail Search

Image Search (β)