• 제목/요약/키워드: 어휘다양성

검색결과 187건 처리시간 0.025초

정치 도메인에서 신조어휘의 효과적인 추출 및 의미 분석에 대한 연구 (Study on Effective Extraction of New Coined Vocabulary from Political Domain Article and News Comment)

  • 이지현;김재홍;조예성;이민구;최혜봉
    • 문화기술의 융합
    • /
    • 제7권2호
    • /
    • pp.149-156
    • /
    • 2021
  • 정치적 사안에 대한 대중의 의견과 인식을 객관적으로 이해하기 위한 방법으로 텍스트 마이닝을 통한 빅데이터 분석을 수행할 수 있다. 기존 어휘 사전에 기반한 텍스트 마이닝 알고리즘은 신조어와 같이 사전에 수록되지 않은 어휘를 분석하는데 한계가 나타난다. SNS를 통해 나타나는 사용자들의 의견은 많은 경우 신조어와 비속어를 포함하는데, 이러한 어휘들을 효과적으로 분석하지 못한다면 정확한 대중의 인식과 의견을 파악하기 어렵게 된다. 본 논문은 정치 섹션의 뉴스 댓글로부터 정치적 의미성을 지니는 신조어와 비속어를 효과적으로 추출하는 방법을 제안하고, 추출한 신조어휘들의 의미와 맥락을 이해하기 위한 다양한 방법을 제시하였음.

A Sketch of an Optimality Theoretic Account of Anaphora Resolution in Korean

  • Hong, Minpyo
    • 한국언어정보학회:학술대회논문집
    • /
    • 한국언어정보학회 2002년도 학술대회 발표논문집
    • /
    • pp.10-38
    • /
    • 2002
  • 본고는 한국어 영형 대명사의 적절한 해석을 위해 개념적으로 전혀 새로운 이론을 제안한다. 일련의 다양한 제약들이 서로 연관되어 있음을 보인 후, 그러한 규칙의 다양성을 적절히 포착하기 위해 적절성 이론 (Optimality Theory)을 도입할 것을 제안하고, 그 토대 위에 다양한 제약들을 형식화한 후, 그 규칙들의 위계관계를 설정한다. 가장 우선순위를 갖는 제약으로 인접 요소간 어휘의미자질들이 일치해야 한다는 어휘의미제약(*Feature Mismatch)과 통사적 결속규칙을 의미론적으로 재해석한 결속원리 B(Principle B)를 선정한다. 그 다음 순위를 갖는 제약으로, 가능한 한 선행명사를 지칭하도록 요구하는 대용존중제약(DOAP: Don't Overlook Anaphoric Possibilities)과, 센터링 이론의 전이방식 개념을 도입하여 정의한 계속선호제약 (CONTINUE)을 제안한다

  • PDF

원자력과학공학 학술 논문에 나타난 기능적 어휘다발 분석 (Functional Lexical Bundles in Nuclear Science and Engineering Research Articles)

  • 남대현
    • 한국콘텐츠학회논문지
    • /
    • 제21권11호
    • /
    • pp.426-435
    • /
    • 2021
  • 본 연구의 목적은 영어로 작성된 원자력과학공학 학술 논문에 나타나는 어휘다발을 담화기능에 따라 분류한 후, 분류된 어휘다발이 일반 학술 논문에 나타나는 어휘뭉치와 비교하여 어떤 특징을 나타내는지 분석하는데 있다. 이를 위해 원자력과학공학 논문의 텍스트를 수집하여 제작한 약 1백만 단어의 코퍼스에서 기능적 어휘 다발을 추출한 후 이를 75만 단어 크기의 일반 학술 논문 코퍼스에 나타난 어휘다발 분포와 빈도를 카이제곱 검정과 표준화 잔차를 사용하여 비교하였다. 그 결과 원자력과학공학 분야에서는 일반 학술 논문과 비교했을 때 저자태도와 관련한 어휘다발이 주로 사용되었고, 어휘다발 사용에 있어서는 다양성이 결여된 어휘다발 사용이 나타나 동일한 타입의 어휘다발을 '재사용'하는 모습을 보여주었다. 이러한 연구결과를 바탕으로 원자력과학공학 학술목적영어 교육에 대한 교육적 함의와 후속연구의 방향에 관하여 제언하였다.

『노걸대』 분석을 통해서 바라본 우리 반도의 외국어 교육 (Foreign Language Education of Korean Peninsula: Insights from Nogeldae)

  • 김정렬
    • 한국콘텐츠학회논문지
    • /
    • 제17권6호
    • /
    • pp.408-414
    • /
    • 2017
  • 본 연구는 고려말에 저자미상의 실용적인 목적으로 만들어진 외국어 교재 "노걸대"에 대하여 어떻게 고려말부터 조선 500년 동안 지속적으로 외국어 교재로 사용될 수 있었는지 외국어 교재로서 그 지속성의 가치는 어디에 있는지를 알아보고자 하는데 있다. 이를 위해서 "노걸대"에 있는 대화문 구성된 의사소통 상황별로 정광의 "노걸대" 역주본에 나와 있는 106편의 대화를 만남(12편), 숙박(17편), 대도행(21편), 대도 생활(34편), 귀국(11편)으로 구분하여 평균문장길이, 어휘길이, 타입-토큰 비율, 본동사 앞 단어 수, 명사구 평균 수식어수 항목 측정치를 활용하여 외국어 교재로서의 계열성을 파악하고자 한다. "노걸대"는 제시된각 의사소통기능에서 일부 명사구 내의 계열성이 무시된 경우를 제외하면 전체적으로 복잡도의 계열성을 확인할 수 있었다. 문장 길이, 문장의 복잡도 계열성은 전체적으로 확인되었다. 어휘의 다양성은 계열성이 제대로 구성되었다고 볼 수는 없으나 어휘의 반복율이 높은 것은 기본적인 어휘의 사용이 많이 이루어졌다는 것을 의미한다.

어휘 자질 기반 기계 학습을 사용한 한국어 암묵 인용문 인식 (Recognition of Korean Implicit Citation Sentences Using Machine Learning with Lexical Features)

  • 강인수
    • 한국산학기술학회논문지
    • /
    • 제16권8호
    • /
    • pp.5565-5570
    • /
    • 2015
  • 암묵인용문 인식은 학술문헌의 본문 텍스트 내에서 명시적 인용표지가 누락된 인용문장을 자동 인식하는 것으로 인용 기반 논문 검색 및 요약의 핵심 기술이다. 기존 암묵인용문 인식의 최신 연구들은 단어 ngram, 단서어구, 명시인용문과의 거리, 기존 연구자의 성, 기존 방법의 명칭 등 다양한 자질을 활용하여 50% 이상 인식 수준을 보고하고 있다. 그러나 대부분의 기존 연구들은 영어에 대해 수행되었으며 한국어의 경우 최근 긍정/부정 단서어구 패턴을 활용한 규칙 기반 시도에서 42% 성능 수준이 보고되어 있어 추가 성능 향상이 요구되는 상황이다. 이 연구에서는 한국어 어휘 자질을 사용하여 한국어 암묵인용문의 기계학습 기반 인식을 시도하였다. 이를 위해 어절, 형태소, 음절 단위에 기반한 다양한 크기의 어휘 ngram 자질들의 인식 성능을 비교 평가하고 한국어 암묵인용문 인식에 적합한 어휘 자질로 형태소 1gram 및 음절 2gram 단위를 결정하였다. 또한 이들 어휘 자질들을 전후 명시인용문들과의 인접성을 표현한 위치 자질들과 결합하여 한국어 암묵인용문 인식 성능을 50% 이상 수준으로 대폭 향상시켰다.

사전에 나타난 인지정보를 이용한 단어 개념의 지식표현 (Knowledge Representation of Concept Word Using Cognitive Information in Dictionary)

  • 윤덕한;옥철영
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2004년도 제16회 한글.언어.인지 한술대회
    • /
    • pp.118-125
    • /
    • 2004
  • 인간의 언어지식은 다양한 개념 관계를 가지며 서로 망(network)의 모습으로 연결되어 있다. 인간의 언어지식의 산물 중에서 가장 체계적이며 구조적으로 언어의 모습을 드러내고 있는 결과물이 사전이라고 할 수 있다. 본 논문에서는 이러한 사전 뜻풀이 말에서 개념 어휘와 자동적인 지식획득을 통하여 의미 정보를 구조적으로 추출한다. 이러한 의미 정보가 추출되면서 동시에 자동적으로 개념 어휘의 의미 참조 모형이 구축된다. 이러한 것은 사전이 표제어 리스트와 표제어를 기술하는 뜻풀이말로 이루어진 구조의 특성상 가능하다. 먼저 172,000여 개의 사전 뜻풀이말을 대상으로 품사 태그와 의미 태그가 부여된 코퍼스에서 의미 정보를 추출하는데, 의미분별이 처리 된 결과물을 대상으로 하기 때문에 의미 중의성은 고려하지 않아도 된다. 추출된 의미 정보를 대상으로 정제 작업을 거쳐 정보이론의 상호 정보량(Ml)을 이용하여 개념 어휘와 의미 정보간에 연관도를 측정한 후, 개념 어휘간의 유사도(SMC)를 구하여 지식표현의 하나로 연관망을 구축한다.

  • PDF

단어클러스터링 시스템을 이용한 어휘의미망의 활용평가 방안 (The Method of the Evaluation of Verbal Lexical-Semantic Network Using the Automatic Word Clustering System)

  • 김혜경;송미영
    • 한국한의학연구원논문집
    • /
    • 제12권3호통권18호
    • /
    • pp.1-15
    • /
    • 2006
  • 최근 수년간 한국어를 위한 어휘의미망에 대한 관심은 꾸준히 높아지고 있지만, 그 결과물을 어떻게 평가하고 활용할 것인가에 대한 방안은 이루어지지 않고 있다. 본 논문에서는 단어클러스터링 시스템 개발을 통하여, 어휘의미망에 의해 확장되기 전후의 클러스터링을 수행하여 데이터를 서로 비교하였다. 단어클러스터링 시스템 개발을 위해 사용된 학습 데이터는 신문 말뭉치 기사로 총 68,455,856 어절 규모이며, 특성벡터와 벡터공간모델을 이용하여 시스템A를 완성하였다. 시스템B는 구축된 '[-하]동사류' 3,656개의 어휘의미를 포함하는 동사 어휘의미망을 활용하여 확장된 것으로 확장대상정보를 선택하여 특성벡터를 재구성한다. 대상이 되는 실험 데이터는 '다국어 어휘의미망-코어넷'으로 클러스터링 결과 나타난 어휘의 세 번째 층위까지의 노드 동일성 여부로 정확률을 검수하였다. 같은 환경에서 시스템A와 시스템B를 비교한 결과 단어클러스터링의 정확률이 45.3%에서 46.6%로의 향상을 보였다. 향후 연구는 어휘의미망을 활용하여 좀 더 다양한 시스템에 체계적이고 폭넓은 평가를 통해 전산시스템의 향상은 물론, 연구되고 있는 많은 어휘의미망에 의미 있는 평가 방안을 확대시켜 나가야 할 것이다.

  • PDF

A Study on the Academic vocabulary Education for Content-Based Korean Language Education: A Basic Study for Online Dictionary Development

  • Hwang, Shung-eun
    • 한국컴퓨터정보학회논문지
    • /
    • 제25권2호
    • /
    • pp.67-74
    • /
    • 2020
  • 이 연구는 내용 중심 한국어 교육을 위해 학술어휘를 어떻게 교육할 것인지에 대한 방안으로 온라인 학술어휘 사전을 개발할 것을 제안한다. 학문 목적 한국어 학습자가 대학 수학 과정에서 접하게 되는 내용 중심 한국어 교육을 위한 학술적 텍스트에는 다양한 학술어휘가 존재한다. 학술어휘를 모르고서는 학문적 내용을 이해하거나 생산할 수 없다. 따라서 그들이 처한 교육적 환경을 고려하여 그들에게 가장 적합한 방식으로 학술어휘를 교육해 교육적 효율성을 높이는 것이 한국어 교육의 과제 중 하나가 되었다. 이에 대한 대안으로 본고는 온라인 학술어휘 사전 개발에 앞서 온라인 학술어휘 사전에는 어떠한 내용이 어떠한 방식으로 담겨야 하는지에 대한 기초 연구를 수행하고자 한다. 온라인 학술어휘 사전은 교실 안으로 한정되어 있던 교육을 교실 안팎으로 자연스럽게 연결하게 해 교육 현장이 갖는 어휘 교육의 한계를 극복하고 교육적 효과를 극대화할 수 있다.

어휘 빈도를 활용한 지식 검색에서의 답변 추천 시스템 (Answer Recommendation for Knowledge Search using Term Frequency)

  • 이호창;탁현기;이현아
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2012년도 한국컴퓨터종합학술대회논문집 Vol.39 No.1(B)
    • /
    • pp.315-317
    • /
    • 2012
  • 지식iN 등의 지식검색 서비스는 잘못된 답변으로 인한 낮은 신뢰성과 다수의 중복 답변 등의 문제점을 가진다. 질의문 '세상에서 가장 큰 나라'에 대해서 관련된 모든 질문과 답변을 제시하지 않고 질의문과 관련된 다수의 답변을 분석하여 답변 '러시아'를 추천하여 제시할 수 있다면 지식검색의 효용성과 신뢰성이 크게 향상될 수 있다. 본 논문에서는 질문-답변의 유형을 단어, 글, 도표, 목록의 네가지로 분류하고, 그 중 단어 유형에 대한 답변 추천 방법을 제시한다. 질의문에 대해 검색된 질문을 군집화하고, 질문에 대한 답변들에 대해서 TF, IDF, 어휘간 거리 정보를 다양하게 결합하여 어휘의 점수를 계산한다. 각 군집에서 가장 높은 점수를 가지는 어휘를 해당 군집에서 가장 중요한 어휘로 보고 추천 정답으로 제시한다. 단어 유형인 질문 100개에 대한 네이버 지식iN에 대한 시스템 평가에서 추천된 상위 1위에 대해서는 68%의 정답률을, 상위 5위까지에 대해서는 89%의 정답률을 보였다.

소셜미디어를 통해 본 재난안전 분야 어휘 사용 양상 분석 (A Study on the Analysis of Disaster Safety Lexicon Patterns in Social Media)

  • 김태영;이정은;오효정
    • 한국콘텐츠학회논문지
    • /
    • 제17권10호
    • /
    • pp.85-93
    • /
    • 2017
  • 재난안전 분야 어휘의 표준화는 성공적인 재난안전사고 예방 및 대응을 위해 가장 기본적인 과정으로서 중요하다. 재난안전 분야의 어휘에 대한 이해 부족은 커뮤니케이션 및 정보공유의 부재로 이어지며, 이는 재난사고 발생 시 적절한 대응을 위한 의사소통에 문제가 될 수 있다. 현재 재난안전 유관기관별로 다양한 재난안전정보가 생산 및 관리되고 있으며, 정보공유를 위해 각 기관에서는 개별적으로 용어사전을 개발하여 활용하고 있다. 따라서 이용자에 따른 재난안전 분야의 어휘 사용 양상의 차이를 실제적으로 파악하는 것은 표준화를 위해 필수적이다. 이에 본 연구는 재난안전 분야의 어휘 사용 양상을 소셜미디어를 중심으로 분석하여 그 차이를 규명하였다. 구체적으로는 재난안전 분야에서 일반 이용자가 사용하는 어휘와 기존 재난안전 유관기관에서 활용하고 있는 어휘자원의 차이점을 비교 분석하였다. 이후 분석 결과를 기반으로 재난안전 분야 표준화 방안을 제안함으로써 용어사전 구축 방향성을 수립하였다.