Event Template Extraction for the Decision Support based on Social Media (소셜미디어 기반 의사결정 지원을 위한 이벤트 템플릿 추출)

  • Heo, Jeong;Ryu, Pum-Mo;Choi, Yoon-Jae;Kim, Hyun-Ki
    • Annual Conference on Human and Language Technology
    • 2012.10a
    • pp.53-57
    • 2012
  • 본 논문은 소셜 미디어 기반 의사결정 지원 시스템인 '소셜위즈덤'에 포함된 이벤트 템플릿 추출에 대해서 소개한다. 의사결정 지원 시스템은 경제적, 사회적 중요사항을 결정할 수 있도록 관련 정보와 인사이트(Insight)를 제공하는 정보시스템을 이른다. 기존 시스템은 단지 특정 키워드 빈도나 공기하는 키워드들의 관계만을 제공하였다. 그러나, 소셜위즈덤은 이벤트로 정의되는 주체(Subject), 이벤트 속성(Event-Property), 객체(Object)의 트리플(Triple) 집합인 템플릿을 추출하여 이를 기반으로 이벤트 정보를 함께 제공한다. 템플릿 추출은 고정밀 언어분석의 관계추출 기술과 온톨로지에 기반한 템플릿 제약 및 필터링 규칙을 이용하였다. 수작업으로 구축한 평가데이터로 평가한 결과, 템플릿 추출 성능(F-Score)은 뉴스 0.544, 블로그 0.3386, 트위터 0.3251이고 전체 통합 성능은 0.4648이었다. 필터링 성능(Accuracy)은 뉴스 0.7257, 블로그 0.6122, 트위터 0.6207이고 전체 통합 성능은 0.722이었다.

An Automatic Classification System of Korean Documents Using Weight for Keywords of Document and Word Cluster (문서의 주제어별 가중치 부여와 단어 군집을 이용한 한국어 문서 자동 분류 시스템)

  • Hur, Jun-Hui;Choi, Jun-Hyeog;Lee, Jung-Hyun;Kim, Joong-Bae;Rim, Kee-Wook
    • The KIPS Transactions:PartB
    • /
    • v.8B no.5
    • /
    • pp.447-454
    • /
    • 2001
  • The automatic document classification is a method that assigns unlabeled documents to the existing classes. The automatic document classification can be applied to a classification of news group articles, a classification of web documents, showing more precise results of Information Retrieval using a learning of users. In this paper, we use the weighted Bayesian classifier that weights with keywords of a document to improve the classification accuracy. If the system cant classify a document properly because of the lack of the number of words as the feature of a document, it uses relevance word cluster to supplement the feature of a document. The clusters are made by the automatic word clustering from the corpus. As the result, the proposed system outperformed existing classification system in the classification accuracy on Korean documents.

Morpheme-based Korean broadcast news transcription (형태소 기반의 한국어 방송뉴스 인식)

  • Park Young-Hee;Ahn Dong-Hoon;Chung Minhwa
    • Proceedings of the KSPS conference
    • /
    • 2002.11a
    • /
    • pp.123-126
    • /
    • 2002
  • In this paper, we describe our LVCSR system for Korean broadcast news transcription. The main focus is to find the most proper morpheme-based lexical model for Korean broadcast news recognition to deal with the inflectional flexibilities in Korean. There are trade-offs between lexicon size and lexical coverage, and between the length of lexical unit and WER. In our system, we analyzed the training corpus to obtain a small 24k-morpheme-based lexicon with 98.8% coverage. Then, the lexicon is optimized by combining morphemes using statistics of training corpus under monosyllable constraint or maximum length constraint. In experiments, our system reduced the number of monosyllable morphemes from 52% to 29% of the lexicon and obtained 13.24% WER for anchor and 24.97% for reporter.

Automatic Text Categorization by Term Weighting and Inverted Category Frequency (용어 가중치와 역범주 빈도에 의한 자동문서 범주화)

  • Lee, Kyung-Chan;Kang, Seung-Shik
    • Annual Conference on Human and Language Technology
    • /
    • 2003.10d
    • /
    • pp.14-17
    • /
    • 2003
  • 문서의 확률을 이용하여 자동으로 문서를 분류하는 문서 범주화 기법의 대표적인 방법이 나이브 베이지언 확률 모델이다. 이 방법의 기본 형식은 출현 용어의 확률 계산 방법이다. 하지만 실제 문서 범주화 과정에서 출현하지 않는 용어들도 성능에 많은 영향을 줄 수 있으며, 출현 용어들에 대한 빈도 이외의 역범주 빈도나 용어가중치를 적용하여 문서 범주화 시스템의 성능을 향상시킬 수 있다. 본 논문에서는 나이브 베이지언 확률 모델에 출현 용어와 출현하지 않는 용어들에 대한 smoothing 기법을 적용하여 실험하였다. 성능 평가를 위해 뉴스그룹 문서들을 이용하였으며, 역범주 빈도와 가중치를 적용했을 때 나이브 베이지언 확률 모델에 비해 약 7% 정도 성능 개선 효과가 있었다.

Characters of Spoken and Written Korean (국어의 구어와 문어의 특성)

  • Noh, Dae-Kyu
    • Annual Conference on Human and Language Technology
    • /
    • 1989.10a
    • /
    • pp.81-84
    • /
    • 1989
  • 국어의 구어는 격식적으로도 사용되고 비격식적으로도 쓰인다. 회의, 토론, 강의, 뉴스 방 송 등에서는 주로 격식적 국어가, 그리고 가족 사이나 친구 사이의 대화, 소설 및 희곡의 대화 등에서는 주로 비격식적 구어가 쓰인다. 국어의 문어도 구어와 마찬가지로 격식적으로도 사용되고 비격식적으로도 쓰인다. 학술 논문, 논설문, 보고서, 신문 기사 등에서는 주로 격식적 문어가, 그리고 편지, 일기, 동화 등에서는 주로 비격식적 문어가 쓰인다. 이 논문의 목적은 주로 비 격식적 구어와 격식적 문어를 대상으로 하여 국어의 구어와 문어의 문법적 특성, 돋 의미적, 통사적, 음운적 특성을 밝히는 데에 있다. 그러나 여기에서는 국어의 비격식적 구어와 격식적 문어의 의미적 특성만을 살펴보기로 한다.

A Study on the Characteristics of the Intonational Slope of the Korean Broadcasting News Utterances (한국어 방송 뉴스 발화의 억양 기울기 특성 연구)

  • In, Ji-Young;Seong, Cheol-Jae
    • /
    • no.66
    • /
    • pp.21-39
    • /
    • 2008
  • The purpose of this study is to analyze the intonational slope characteristics of the Korean news utterances. Prosodic phrases were analyzed in terms of the K-ToBI labeling system. In addition, the change of intonation contour that occurs throughout the sentences was discussed in terms of types of media and gender. Results showed that the overall declination of the intonation contour of radio and male revealed a gentler slope than that of TV and female, respectively. While the regression of the top line slope showed male's higher $R^2$ with the number of words, the base line slope of the radio and female was proved to be highly influenced from the number of syllables, words, and prosodic phrases. A lot more independent variables statistically affected to the base line slope. This means that the base line slope was strongly related to the variables, the top line slope, otherwise, could be more freely fluctuated due to the light correlation with them.

A Study on the Prosodic Characteristics of the Korean Broadcast News Utterances (한국어 정규 뉴스 방송 문장의 운율 특성 연구)

  • In, Ji-Young;Seong, Cheol-Jae
    • Proceedings of the KSPS conference
    • /
    • 2007.05a
    • /
    • pp.197-200
    • /
    • 2007
  • The purpose of this study is to analyze the prosodic characteristics of Korean news utterances. In this paper, prosodic phrases were described in terms of the K-ToBI labeling system. In addition, the change of intonation contour that occurs throughout the sentences was discussed in terms of types of media and gender. According to analyzing the tendency of resets, 331 out of 729 resets were observed at the boundary of the intonation phrases. This means that resets are of the speaker's own volition regardless of prosodic units of intonation phrases. The declination of the intonation contour of radio news showed a gentler slope than that of TV news, because when the sentence is getting longer, the declination of the intonation contour becomes slower.

Automatic Text Categorization Using Text Summarization Techniques (문서 요약 기법을 이용한 자동 문서 범주화)

  • Park, Jin-Woo;Ko, Young-Joong;Seo, Jung-Yun
    • Annual Conference on Human and Language Technology
    • /
    • 2001.10d
    • /
    • pp.138-145
    • /
    • 2001
  • 자동 문서 범주화란 문서의 내용에 기반하여 미리 정의되어 있는 범주에 문서를 자동으로 분류하는 작업이다. 문서 분류를 위해서는 문서들을 가장 잘 표현할 수 있는 자질들을 정하고, 이러한 자질들을 통해 분류할 문서를 표현해야 한다. 기존의 연구들은 문장간의 구분 없이, 문서 전체에 나타난 각 자질의 빈도수를 이용하여 문서를 표현 한다. 그러나 하나의 문서 내에서도 중요한 문장과 그렇지 못한 문장의 구분이 있으며, 이러한 문장 중요도의 차이는 각각의 문장에 나타나는 자질의 중요도에도 영향을 미친다. 본 논문에서는 문서에서 사용되는 중요 문장 추출 기법을 문서 분류에 적용하여, 문서 내에 나타나는 각 문장들의 문장 중요도를 계산하고 문서의 내용을 잘 나타내는 문장들과 그렇지 못한 문장들을 구분하여 각 문장에서 출현하는 자질들의 가중치를 다르게 부여하여 문서를 표현한다. 이렇게 문장들의 중요도를 고려하여 문서를 표현한 기법의 성능을 평가하기 위해서 뉴스 그룹 데이터를 구축하고 실험하였으며 좋은 성능을 얻을 수 있었다.

Conceptual reranking using single document feedback (단일 문서 피드백을 이용한 개념적인 재순위화)

  • Han, Yong-Jin;Park, Se-Young;Park, Seong-Bae;Lee, Sang-Jo
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2012.06b
    • /
    • pp.276-278
    • /
    • 2012
  • 모바일 환경에서 정보 검색 시, 사용자가 질의를 구체적으로 입력하는 것이 번거로운 문제점이 있다. 본 논문은 모바일 환경에서의 효율적인 검색 성능 향상을 위해 단일 문서 피드백을 이용한 개념적인 재순위화 방법을 제안한다. 사용자는 질의 의도와 관련있는 문서 하나를 시스템에 피드백한다. 제안한 방법은 피드백된 문서와 앞서 검색된 문서들을 위키피디아의 표제어로 표현되는 개념적인 차원으로 맵핑함으로써 개념적인 수준에서 검색 결과를 재순위화한다. 최근 한국어 뉴스 및 블로그를 대상으로 한 실험 결과 키워드 기반 피드백 방법에 비해 제안한 방법이 높은 성능을 보였다.

Preliminary analysis about the differences between South and North Korean Broadcasting Languages (남북한 방송언어의 차이에 대한 기초 분석)

  • Lee, Chang-H.;Kim, Kyung-Il;Park, Jong-Min
    • Proceedings of the KAIS Fall Conference
    • /
    • 2010.05b
    • /
    • pp.622-625
    • /
    • 2010
  • 본 연구는 장기간의 남북한 분단으로 인한 언어적 이질성의 정도를 가늠해보기 위하여 남북한 방송언어 비교하였다. 연구의 주 목적은 남북한 언어간 차이에 대한 데이터가 부족한 상황에서 언어사용 실태에 대한 토대 데이터를 제공하는 것이었다. 남북한의 주요 방송사 뉴스 동영상에서 추출한 텍스트를 대상으로 한국어분석프로그램 KLIWC (Korean Linguistic Inquiry and Word Count)으로 분석하였다. 분석 결과, 북한 방송언어는 KLIWC의 각 차원에서 남한 언어와 유의미한 차이를 나타냈으며, 특히 정서적 단어, 인지적 단어, 사회적 단어 등에서 유의미한 차이가 발견되었다. 또한 북한 방송에서는 인칭대명사나 품사와 같은 언어학적 기능어에 있어서도 남한방송보다 사용빈도가 높았다. 이러한 차이에 대한 예비적인 심리학적 신문방송학적 해석을 제공하였다.

