• 제목/요약/키워드: 어휘정보

검색결과 1,062건 처리시간 0.025초

단어 간 연관성 측정을 통한 문맥 철자오류 교정 (Context-sensitive Spelling Correction using Measuring Relationship between Words)

  • 최성기;김민호;권혁철
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2013년도 추계학술발표대회
    • /
    • pp.1362-1365
    • /
    • 2013
  • 한국어 텍스트에 나타나는 오류어의 유형은 크게 단순 철자오류와 문맥 철자오류로 구분할 수 있다. 이중 문맥 철자오류는 문맥의 의미 통사적 관계를 고려해야만 해당 어휘의 오류 여부를 알 수 있는 오류로서 철자오류 중 교정 난도가 가장 높다. 문맥 철자오류의 유형은 발음 유상성에 따른 오류, 오타 오류, 문법 오류, 띄어쓰기 오류로 구분할 수 있다. 본 연구에서는 오타 오류에 의해 발생하는 문맥 철자오류를 어의 중의성 해소와 같은 문제로 보고 교정 어휘 쌍을 이용한 통계적 문맥 철자오류 교정 방법을 제안한다. 미리 생성한 교정 어휘 쌍을 대상으로 교정 어휘 쌍의 각 어휘와 주변 문맥 간 의미적 연관성을 통계적으로 측정하여 문맥 철자오류를 검색하고 교정한다. 제안한 방법을 적용한 결과 3개의 교정 어휘 쌍 모두 90%를 넘는 정확도를 보였다.

한-일 교차언어검색에서의 질의 문맥 정보를 이용한 대역어 변환 확률 모델 (Query Context Information-Based Translation Models for Korean-Japanese Cross-Language Informal ion Retrieval)

  • 이규찬;강인수;나승훈;이종혁
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2005년도 제17회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.97-104
    • /
    • 2005
  • 교차언어 검색 과정에서는 질의나 문서의 언어를 일치시키기 위한 변환 과정이 필수적이며, 이런 변환 과정에서 어휘의 중의성으로 인해 하나의 어휘에 대응하는 다수의 대역어가 생성됨으로써 사용자의 정보 욕구를 왜곡시켜 검색의 성능을 저하시킬 수 있다. 본 논문에서는 어휘 중의성 문제를 해결하기 위해서 질의의 문맥 정보를 이용하여 변환 질의의 확률을 구함으로써 중의성을 해소하는 방식을 제시하고, 질의의 길이, 중의도, 중의성을 가진 어휘의 비율 등에 따라서 성능이 어떻게 변하는지 비교함으로써 이 방법의 장점과 단점을 분석한다. 또한 현재의 단점을 보완하기 위한 차후 연구 방향을 제시한다.

  • PDF

의학 전문용어의 정의문 자동 추출 (Automatic Extraction of Medical Term Definition from Texts)

  • 김재호;배선미;신효식;최기선
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 봄 학술발표논문집 Vol.31 No.1 (B)
    • /
    • pp.922-924
    • /
    • 2004
  • 지식 정보의 확산에 따라 기존 전문분야 용어집에 수록되지 않은 용어의 수가 폭발적으로 증가하고 있다 이에 따라 용어집을 자동으로 구축하는 작업이 필요하게 되었다. 본 논문에서는 의학분야 코퍼스에서 주어진 전문용어에 대한 정의문을 자동으로 추출하는 방법을 제안한다. 우선, 정의문의 구문적 패턴과 용어의 어휘구성 패턴을 이용하여 용어의 상위개념을 추정한다. 상위개념별로 구축된 특성 어휘 목록을 이용하여 구문적 패턴으로 뽑힌 문장에 등장하는 어휘의 적합성 여부를 판단하여 정의문을 추출한다. 실험 결과 코퍼스에 정의 정보가 있는 48개의 용어에 대하여 71.43%의 정확률을 보인다.

  • PDF

사건 어휘의 특성을 반영한 다국어 사건 연결 탐색 (Multilingual Story Link Detection based on Properties of Event Terms)

  • 이경순
    • 정보처리학회논문지B
    • /
    • 제12B권1호
    • /
    • pp.81-90
    • /
    • 2005
  • 본 논문에서는 다국어 뉴스에 대해서 '시간' 요소와 '언어 공간' 요소를 사건 어휘의 가중치 계산에 반영하는 다국어 사건 연결 탐색하는 방법을 제안한다. 시간의 흐름과 다국어 공간상에서 어휘의 분포 특성을 어휘의 가중치로 반영하여 사건 중심 어휘에 변별력을 줌으로써 같은 사건을 다루는 문서를 탐색하도록 한다. 시간상에서 어휘가중치는 전체 시간의 모든 문서집합에서의 어휘 분포와 특정 시간의 문서집합에서의 어휘 분포를 비교함으로써 계산하고, 그 특정 시간의 어휘의 가중치로 표현한다. 두 개의 언어는 하나의 언어에서보다 더 많은 정보를 줄 수 있기 때문에, 각 언어공간에서 어휘의 중요도를 측정하고, 다국어 처리에서 다른 언어 공간에서의 정보를 참조함으로써 언어 공간에서의 참조 역할을 하도록 한다. 본 논문의 실험에서는 같은 기간의 한국어와 일본어 신문기사에 대해서 사건 연결 탐색 성능을 평가하였다. 일반적인 가중치 기법인 tfidf 가중치 기법과의 비교 평가에서, 제안 방법이 단일언어 문서쌍에 대한 사건 연결 탐색은 $14.3{\%}$, 다국어 문서쌍에 대한 사건 연결 탐색에서는 $16.7{\%}$의 성능 향상을 보였다. 제안한 가중치 요소에 대한 유효성을 검증하기 위해, 공간 밀집도를 측정하였는데, 같은 사건을 나타내는 문서들의 그룹에서는 높은 밀집도를 나타냈고, 서로 다른 사건을 나타내는 문서들의 그룹에서는 낮은 밀집도를 나타냈다. 이 결과를 통해서 시간과 공간 요소를 반영한 사건 어휘 가중치 방법이 단일언어 사건 연결 탐색뿐만 아니라 다국어 사건 연결 탐색에 효과적이라고 볼 수 있다.

본용언과 보조용언의 의미 처리에 관한 연구 : 일반인과 실어증 환자를 대상으로 (Lexical Status of Main and Supportive Verbs in Mental Lexicon)

  • 문영선;김동휘;편성범;황유미;정재범;남기춘
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1999년도 제11회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.447-454
    • /
    • 1999
  • 본 연구에서는 국어의 본용언과 보조용언이 어떠한 방식으로 처리되는지에 대해 알아보는 것이 목적이다. 영어와 달리 국어는 보조용언이 조동사의 역할을 담당하여 화자의 심리적인 상태나 상(想)을 나타내는 기능을 한다. 따라서 같은 어휘가 본용언으로 쓰일 때와 보조용언으로 쓰일 때 그 의미적 차이는 뚜렷하다. 특히 보조용언으로 쓰일 때는 어휘적 의미가 대부분 사라지고 추상적 의미만 남기 때문에 본용언과의 관련성을 따져보는 것도 중요한 연구과제이다. 또한 우리의 심성어휘집(mental lexicon)에서 본용언과 보조용언이 동일한 영역에서 처리되는지도 알아볼 필요가 있다. 만일 동일한 심성어휘집을 사용한다면 보조용언으로 쓰인 환경에서도 본용언의 어휘적 의미가 활성화될 것이다. 이에 대해 본 연구에서는 정상인 피험자와 실어증환자를 대상으로 실험을 하였다. 정상인 피험자를 대상으로는 SOA가 짧은 조건과 긴 조건에서 각각 보조용언을 어떻게 처리하는 지 살펴보았고, 실어증환자를 대상으로는 정상인 피험자와 비교해서 어떤 양상으로 보조용언을 처리하는 지 살펴보았다. 그 결과 정상인 피험자는 SOA가 짧은 조건에서는 본용언과 보조용언을 모두 동일한 방식으로 의미처리하였다. 즉 보조용언의 어휘적 의미가 본용언과 마찬가지로 SOA가 짧을 때는 활성화되었다. 그러나 SOA가 길어지면 보조용언은 문맥 정보로 인해 어휘적 의미가 억제되어 본용언과 다른 의미로 해석된다는 결론을 얻었다. 이런 정상인 피험자와 비교해 보았을 때, 실어증 환자는 두 가지 양상이 나타났다. 명칭성 실어증환자의 경우, 정상인과 비슷한 결과가 나왔으나 보조용언으로 쓰일 때, 본용언보다 어휘적 의미가 다소 불안정하게 활성화됨을 보였다. 그러나 이해성 실어증환자의 경우, 보조용언으로 쓰일 때 어휘적 의미가 전혀 활성화되지 않아 정상인과는 다른 언어처리를 하고 있음이 밝혀졌다.류의 의미가 모두 활성화되는 것을 보여 주었다. 즉, "먹은"과 간은 어절 이해는 구성 형태소로의 분석과 구성 형태소 어휘 접근을 통해 어절 이해가 이루어진다는 가설을 지지하고 있다. 실험 2에서는 실험 1과 다르게 한 뜻으로만 안일 수밖에 없는 "쥐어"와 같은 어절을 사용하여 이런 경우에도(즉, 어절의 문맥이 특정 뜻으로 한정하는 경우) 구성 형태소로의 분석 과정이 일어나는지를 조사하였다. 실험 2의 결과는 실험 1의 결과와는 다르게 어간의 한가지 의미와 관련된 조건만 촉진적 점화 효과가 나타나는 것을 보여주었다. 특히, 실험 2에서 SOA가 1000msec일 경우, 두 의미의 활성화가 나타나는 것을 보여주었는데, 이 같은 결과는 어절 문맥이 특정한 의미로 한정시킬 경우는 심성어휘집에 활용형태로 들어있다는 것이다. 또한 명칭성 실어증 환자의 경우에는 즉시적 점화과제에서는 일반인과 같은 형태소 처리과정을 보였으나, 그이후의 처리과정이 일반인과 다른 형태를 보였다. 실험 1과 실험 2의 결과는 한국어 어절 분석이 구문분석 또는 활용형태를 통해 어휘 접근되는 가설을 지지하고 있다. 또 명칭성 실어증 환자의 경우에는 지연된 점화과제에서 형태소 처리가 일반인과 다르다는 것이 밝혀졌다. 이 결과가 옳다면 한국의 심성 어휘집은 어절 문맥에 따라서 어간이나 어근 또는 활용형 그 자체로 이루어져 있을 것이다.으며, 레드 클로버 + 혼파 초지가 건물수량과 사료가치를 높이는데 효과적이었다.\ell}$ 이었으며 , yeast extract 첨가(添加)하여 배양시(培養時)는 yeast extract 농도(濃度)가 증가(增加)함에 따라 단백질(蛋白質) 함량(含量)도 증가(增加)하였다. 7. CHS-13 균주(菌株)의 RNA 함량(含量)은 $4.92{\times}10^{-2 }\;mg/m{\ell}$이었으며 yeast ext

  • PDF

한국어 어휘 중의성 해소에서 어휘 확률에 대한 효과적인 평가 방법 (An Effective Estimation method for Lexical Probabilities in Korean Lexical Disambiguation)

  • 이하규
    • 한국정보처리학회논문지
    • /
    • 제3권6호
    • /
    • pp.1588-1597
    • /
    • 1996
  • 본 논문은 한국어 어휘 중의성 해소(lexical disambiguation)에서 어휘 확률 (lexical probability) 평가방법에 대해 기술하고 있다. 통계적 접근 방법의 어휘 중 의성 해소에서는 일반적으로 말뭉치(corpus)로부터 추출된 통계 자료에 기초하여 어 휘 확률과 문맥 확률(contextual probability)을 평가한다. 한국어는 어절별로 띄어 쓰기가 이루어지므로 어절 단위로 어휘 확률을 적용하는 것이 바람직하다. 하지만 한 국어는 어절의 다양성이 심하기 때문에 상당히 큰 말뭉치를 사용하더라도 어절 단위 로는 어휘 확률을 직접 평가할 수 없는 경우가 다소 있다. 이러한 문제점을 극복하기 위해 본 연구에서는 어휘 분석 측면에서 어절의 유사성을 정의하고 이에 기반을 둔 한국어 어휘 확률 평가 방법을 제안한다. 이 방법에서는 어떤 어절에 대해 어휘 확률 을 직접 평가할 수 없는 경우 이와 어휘 분석이 유사한 어절들을 통해 간접적으로 평 가한다. 실험결과 제안된 접근방법이 한국어 어휘 중의성 해소에 효과적인 것으로 나 타나고 있다.

  • PDF

한국어 음성어휘(spoken words)의 심성표상(mental representation) 양식과 단위 (The representation type and unit in Korean spoken word recognition)

  • 권유안;김효선;신지영;남기춘
    • 한국인지과학회:학술대회논문집
    • /
    • 한국인지과학회 2005년도 춘계학술대회
    • /
    • pp.141-144
    • /
    • 2005
  • 본 연구에서는 한국어 음성어휘의 표상이 음성정보로 이루어져 있는지 아니면 철자정보로 이루어져 있는지와, 음성어휘의 표상단위가 음절인지를 조사하였다. 연구 과제로는 형태점화기법(form priming technique)을 사용하였다. 점화 자극과 목표 자극간의 관련성 수준으로는 음운적 혹은 철자적인 것을 사용하였다. 점화 자극과 목표자극간의 간격은 50msec 이었다. 따라서 SOA 각 점화자극의 제시시간에 50msec를 합한 것이다. 연구 결과는 음운적으로 관련되어 있을 때에는 무관련 조건에 비해 느려지는 방해점화(inhibitory priming)가 나타났고 철자적으로 관련되어 있는 경우에는 촉진적점화(facilitatory priming)가 나타났다. 이런 연구 결과는 시각단어 재인 연구에서도 보이는 공통적인 현상으로 음성어휘와 시각어휘가 심성어휘표상에서는 동일한 형태를 지니고 있음을 암시한다. 또한 음운적 관련성에 의한 방해점화효과는 음운음절을 공유하고 있는 어휘 후보자간의 경쟁 때문에 나타난 것으로 해석되며, 철자관련 촉진효과는 어휘접근 전에 일어나는 과정에서 나타나는 것으로 해석된다.

  • PDF

온톨로지 검색에 있어서 사용자 질의어와 온톨로지 리소스와의 상이성 해소를 위한 질의어 변환 (Query Translation for Resolving the Difference between User Query Words and Ontology Resources)

  • 김태완
    • 한국컴퓨터정보학회논문지
    • /
    • 제16권3호
    • /
    • pp.35-44
    • /
    • 2011
  • 차세대 웹 기술로 각광 받고 있는 시맨틱 웹에서 웹 리소스는 온톨로지에 기술된 다양한 메타데이타에 의해 가용하게 되며 이러한 온톨로지를 대상으로 한 검색을 위해 SPARQL과 같은 여러 시맨틱 질의 언어가 제안되었다. 그러나 이러한 시맨틱 질의 언어를 사용자가 습득하였다 하더라도 올바른 정보를 찾기 위해서는 사용자가 온톨로지의 구조와 어휘를 잘 파악하고 있어야 한다는 어려움이 있다. 특히 사용자가 질의 언어의 문법과 복잡한 형식 논리 이론에 익숙하더라도 온톨로지 리소스 표기에 사용된 어휘를 모를 경우에는 질의 언어 작성 시 전혀 다른 어휘를 사용할 수 있으며 그에 따라 원하는 정보를 찾지 못하는 어휘 상이성 문제를 해결하여야 한다. 본 논문은 이러한 어휘 상이성 문제의 해소에 주안점을 두고 질의어의 의미와 온톨로지 어휘 사이의 의미 유사도를 이용하여 사용자가 온톨로지에 없는 질의어를 사용하였을 경우 그와 의미가 가장 가까운 온톨로지 어휘로 변환하여 줌으로써 어휘 상이성 문제를 해결하는 방안을 제안한다.

이중언어자의 위계모형 검증 : 암묵기억과제와 외현기억과제의 효과 (A Test of Hierarchical Model of Bilinguals Using Implicit and Explicit Memory Tasks)

  • 김미라;정찬섭
    • 인지과학
    • /
    • 제9권1호
    • /
    • pp.47-60
    • /
    • 1998
  • 이중언어자의 언어구조를 기억정보의 위계적 특성으로 설명하는 위계모형의 적합성을 외현기억검사와 암묵기억검사를 사용하여 살펴보았다. 위계모형에 따르면 단어의 기억표상은 모국어와 외국어의 심성어휘집 정보와 두 언어와 공유하는 개념표상 정보로 구성되어 있으며, 개념표상 정보의 활성화는 심성어휘집 활성화를 통해 이루어지고, 과제의 종류와 번역의 방향성에 따라 심성어휘집과 개념표상의 정보가 별개로 인출될 수 있다. 기억검사중에서 개념 정보의 활성화에 민감한 외현기억검사와 지각 정보의 활성화에 민감한 암묵기억검사는 심성어휘집 정보와 개념표상 정보의 활성화에 상이한 민감성을 보일 것이다. 실험 1에서는 명명과제의 단어들을 의미적으로 범주화하여 제시한 후에 암묵기억검사와 외현기억검사를 실시했고, 실험 2에서는 의미적으로 범주화된 단어목록을 순행 및 역행 번역을 하도록 한 후에 암묵기억검사와 외현기억검사를 했다. 명명과제와 역행번역 및 암묵기억검사에는 목록의 의미적 범주효과가 나타나지 않았고, 순행번역 및 외현기억검사에는 목록의 의미적 범주효과가 나타났다. 이런 결과를 이중언어자의 언어구조가 언어에 따르는 별개의 심성어휘집과 공통의 개념표상을 지니고 있다는 위계모형을 지지하는 것으로 해석하였다.

  • PDF

다양한 지식을 사용한 영한 기계번역에서의 대역어 선택 (Target Word Selection for English-Korean Machine Translation System using Multiple Knowledge)

  • 이기영;김한우
    • 한국컴퓨터정보학회논문지
    • /
    • 제11권5호
    • /
    • pp.75-86
    • /
    • 2006
  • 일반적으로 영어를 한국어로 번역할 때, 대부분의 영어 명사 어휘들은 해당 어휘가 사용되는 문맥에 따라 다양한 한국어 명사로 번역될 수 있다. 따라서 영어 원문이 갖는 의미를 손실 없이 번역문으로 전달하기 위해서는 문맥에 맞는 올바른 한국어 대역어를 선택할 수 있어야 한다. 본 논문에서는 동사구패턴, 공기 정보에 기반한 의미벡터, 공기 품사 정보 및 한국어 문맥 통계 정보 등의 다양한 지식을 사용하여 영어 명사 어휘의 대역어를 올바로 선택하는 방안을 제공한다. 동사구 패턴은 사전과 코퍼스를 사용하여 구축되었으며, 의미 벡터는 영어 어휘가 특정 한국어 어휘로 번역될 때 공기하는 정보들의 조건부 확률을 나타낸다. 한국어 문맥 통계 정보는 한국어 코퍼스로부터 추출된 N-그램 정보를 나타내며, 품사 공기 정보는 대역어 선택 모호성을 지니는 영어 어휘와 통계적으로 깊은 관련성을 지니는 품사를 나타낸다. 마지막으로 본 논문에서 제안한 대역어 선택 모호성 해소 방안을 평가하기 위한 실험을 수행하였으며, 실험 결과, 제안하는 방법이 기존의 방법보다 성능이 좋다는 것을 확인할 수 있었다.

  • PDF