• Title/Summary/Keyword: 사건 어휘

Search Result 39, Processing Time 0.024 seconds

Multilingual Story Link Detection based on Properties of Event Terms (사건 어휘의 특성을 반영한 다국어 사건 연결 탐색)

  • Lee Kyung-Soon
    • The KIPS Transactions:PartB
    • /
    • v.12B no.1 s.97
    • /
    • pp.81-90
    • /
    • 2005
  • In this paper, we propose a novel approach which models multilingual story link detection by adapting the features such as timelines and multilingual spaces as weighting components to give distinctive weights to terms related to events. On timelines term significance is calculated by comparing term distribution of the documents on that day with that on the total document collection reported, and used to represent the document vectors on that day. Since two languages can provide more information than one language, term significance is measured on each language space and used to refer the other language space as a bridge on multilingual spaces. Evaluating the method on Korean and Japanese news articles, our method achieved $14.3{\%}\;and\;16.7{\%}$ improvement for mono- and multi-lingual story pairs, and for multilingual story pairs, respectively. By measuring the space density, the proposed weighting components are verified with a high density of the intra-event stories and a low density of the inter-events stories. This result indicates that the proposed method is helpful for multilingual story link detection.

Semi-automatic Event Structure Frame tagging of WordNet Synset (워드넷 신셋에 대한 사건구조 프레임 반자동 태깅)

  • Im, Seohyun
    • Annual Conference on Human and Language Technology
    • /
    • 2018.10a
    • /
    • pp.101-105
    • /
    • 2018
  • 이 논문은 가장 잘 알려진 어휘부중 하나인 워드넷의 활용 범위 확장을 위해 워드넷 신셋에 "사건구조 프레임(Event Structure Frame)"을 주석하는 연구에 관한 것이다. 워드넷을 비롯하여 현재 사용되고 있는 어휘부는 풍부한 어휘의미정보가 구조화되어 있지만, 사건구조에 관한 정보를 포함하고 있지는 않다. 이 연구의 가장 큰 기여는 워드넷에 사건구조 프레임을 추가함으로써 워드넷과의 연결만으로 핵심적인 어휘의미정보를 모두 추출할 수 있도록 해준다는 점이다. 예를 들어 텍스트 추론, 자연어처리, 멀티 모달 태스크 등은 어휘의미정보와 배경지식(상식)을 이용하여 태스크를 수행한다. 워드넷에 대한 사건구조 주석은 자동사건구조 주석 시스템인 GESL을 이용하여 워드넷 신셋에 있는 예문에 먼저 자동 주석을 하고, 오류에 대해 수동 수정을 하는 반자동 방식이다. 사전 정의된 23개의 사건구조 프레임에 따라 예문에 출현하는 타겟 동사를 분류하고, 해당 프레임과 매핑한다. 현재 이 연구는 시작 단계이며, 이 논문에서는 빈도 순위가 가장 높은 100개의 동사와 각 사건구조 프레임별 대표 동사를 포함하여 총 106개의 동사 레마에 대해 실험을 진행하였다. 그 동사들에 대한 전체 워드넷 신셋의 수는 1337개이다. 예문이 없어서 GESL이 적용될 수 없는 신셋을 제외하면 1112개 신셋이다. 이 신셋들에 대해 GESL을 적용한 결과 F-Measure는 73.5%이다. 향후 연구에서는 워드넷-사건구조 링크를 계속 업데이트하면서 딥러닝을 이용해 GESL 성능을 향상 할 수 있는 방법을 모색할 것이다.

  • PDF

소셜 데이터에서 재난 사건 추출을 위한 사용자 행동 및 시간 분석을 반영한 토픽 모델

  • ;Lee, Gyeong-Sun
    • Information and Communications Magazine
    • /
    • v.34 no.6
    • /
    • pp.43-50
    • /
    • 2017
  • 본고에서는 소셜 빅데이터에서 공공안전에 위협되고 사회적으로 이슈가 되는 재난사건을 추출하기 위한 방법으로 소셜 네트워크상에서 사용자 행동 분석과 시간분석을 반영한 토픽 모델링 기법을 알아본다. 소셜 사용자의 글 수, 리트윗 반응, 활동주기, 팔로워 수, 팔로잉 수 등 사용자의 행동 분석을 통하여 활동적이고 신뢰성 있는 사용자를 분류함으로써 트윗에서 스팸성과 광고성을 제외하고 이슈에 대해 신뢰성 높은 사용자가 쓴 트윗을 중요하게 반영한다. 또한, 트위터 데이터에서 새로운 이슈가 발생한 것을 탐지하기 위해 시간별 핵심어휘 빈도의 분포 변화를 측정하고, 이슈 트윗에 대해 감성 표현 분석을 통해 핵심이슈에 대해 사건 어휘를 추출한다. 소셜 빅데이터의 특성상 같은 날짜에 여러 이슈에 대한 트윗이 많이 생성될 수 있기 때문에, 트윗들을 토픽별로 그룹핑하는 것이 필요하므로, 최근 많이 사용되고 있는 LDA 토픽모델링 기법에 시간 특성과 사용자 특성을 분석한 시간상에서의 중요한 사건 어휘를 반영하고, 해당이슈에 대한 신뢰성 있는 사용자가 쓴 트윗을 중요시 반영하도록 토픽모델링 기법을 개선한 소셜 사건 탐지 방법에 대해 알아본다.

시간 및 다국어 공간에서 어휘 분포에 기반한 다국어 사건 링크 탐색

  • 이경순
    • Communications of the Korean Institute of Information Scientists and Engineers
    • /
    • v.22 no.4
    • /
    • pp.28-34
    • /
    • 2004
  • 사건 탐색 및 추적(TDT: Topic Detection and Tracking) 연구 [1]은 전세계 각 나라에서 매일 보도 되고 있는 신문이나 방송 뉴스 기사에서 "어떤 중요한 사건이 발생했는가\ulcorner"또는 "새로운 사건이 일어났는가\ulcorner"와 같이 그날 처음 발생한 사건을 탐색하거나, 같은 사건을 다루는 기사들을 탐색하거나, 예전에 발생한 사건과 관련된 사건인지를 추적해 나가는 것이다.된 사건인지를 추적해 나가는 것이다.

The Event Structure of Korean Unaccusative Verbs (한국어 비대격 동사의 사건구조)

  • 이준규;이정민
    • Proceedings of the Korean Society for Cognitive Science Conference
    • /
    • 2000.05a
    • /
    • pp.108-113
    • /
    • 2000
  • 자동사의 두 하위부류, 비대격(unaccusative) 동사와 비능격 (unergative)동사는 Perlmutter(1978)의 비대격 가설 (Unaccusative Hypothesis) 이후 여러 관점에서 활발히 노의 되어왔다. 한국어에서는 사건구조적 측면에서 두 부류가 차이를 보이며, 이런 사실은 인간의 인지작용과 밀접한 관련을 맺는다. 사건구조를 과정(process)사건과 상태(state)로 가정할 때 비능격 동사는 과정사건이, 비대격 동사는 상태사건이 부각된다. 비대격 동사도 두 가지 부류로 나뉠 수 있는데, '도착하다'처럼 과정사건이 언어표현에서 중시되지 않고 결과적인 상태부분만 중요시 되는 유형(unacc_type_1)과 '녹다'처럼 과정사건도 중시되는 사건 구조를 지닌 유형(unacc_type_2)이다. 결국 비대격 동사는 결과상태를 중시하는 사건구조를 중요시 하지만 과정사건의 지각 정도에 따라 다른 양상을 보인다. 한편 비대격 동사는 사동사와도 밀접한 연관 관계를 지닌다. 많은 논의에서 비대격/사동의 교체를 논리적 다의어로 보고 분석을 시도해 왔다. 따라서 사동사를 중심으로 분석한 경우와 비대격 동사를 중심으로 분석한 경우가 있다. 본고에서는 사동분석(causative analysis)은 한국어 기술에는 적절치 않다고 판단한다. 사동분석에서 도입하는 행동주의 사건유발부분이 반드시 비대격 동사의 표현에 필수적인 것은 아니기 때문이다. 끝으로 Pustejovsky(1995)의 생성어휘부(Generative Lexicon) 이론을 한국어에 맞게 확장·수정한 이정민·강범모·남승호(1997)의 모형에 따라 두 가지 유형의 비대격 동사의 어휘 의미구조를 표상한다.

  • PDF

Extracting Core Events Based on Timeline and Retweet Analysis in Twitter Corpus (트위터 문서에서 시간 및 리트윗 분석을 통한 핵심 사건 추출)

  • Tsolmon, Bayar;Lee, Kyung-Soon
    • KIPS Transactions on Software and Data Engineering
    • /
    • v.1 no.1
    • /
    • pp.69-74
    • /
    • 2012
  • Many internet users attempt to focus on the issues which have posted on social network services in a very short time. When some social big issue or event occurred, it will affect the number of comments and retweet on that day in twitter. In this paper, we propose the method of extracting core events based on timeline analysis, sentiment feature and retweet information in twitter data. To validate our method, we have compared the methods using only the frequency of words, word frequency with sentiment analysis, using only chi-square method and using sentiment analysis with chi-square method. For justification of the proposed approach, we have evaluated accuracy of correct answers in top 10 results. The proposed method achieved 94.9% performance. The experimental results show that the proposed method is effective for extracting core events in twitter corpus.

Temporal Information Extraction from Korean News for Event Detection and Tracking (사건 탐지/추적을 위한 시간 정보 추출)

  • Kim, Pyung;Sung, Ki-Youn;Myaeng, Sung-Hyon
    • Annual Conference on Human and Language Technology
    • /
    • 2003.10d
    • /
    • pp.22-29
    • /
    • 2003
  • 시간정보는 사건 탐지/추적 시스템은 물론 정보 추출, 질의/응답 시스템 등에서 매우 중요한 역할을 한다. 본 연구에서는 한국어 신문 기사를 대상으로 시간 표현을 추출하고 정규화한 후 사건 관련 동사와 연결하는 자동화된 방법들을 제안하였다. 시간 표현을 추출하기 위해서 품사정보로 구축된 패턴과 시간 표현 어휘가 사용되었고, 정규화 과정과 사건 관련 동사와의 연결을 위한 규칙이 만들어졌다. 한국어 신문을 대상으로 제안한 방법의 단계별 평가를 수행하였고, 제안하는 방법의 확장성을 보이기 위해 서로 다른 도메인에도 실험을 하였다.

  • PDF

The Semantic Structure and Argument Realization of Korean Passive Verbs (한국어 피동동사의 의미구조와 논항실현)

  • 김윤신;이정민;강범모;남승호
    • Korean Journal of Cognitive Science
    • /
    • v.11 no.1
    • /
    • pp.25-32
    • /
    • 2000
  • Korean passive verbs are derived from their corresponding active verbs by suffixation or by adding endings and auxiliaries to their stems. Therefore. we assume p passive verbs share some lexical informations with their active counterparts. This paper extending the Generative Lexicon theory of Pustejovsky (995). aims to characterize the argument realization patterns of Korean passive verbs focusing on the case alternation a and to propose their lexical semantic structures which account for the syntactic behavior.

  • PDF

Study on synthesis rule of kinesthetic word using fuzzy theory (퍼지 이론을 이용한 운동감 어휘의 합성 규칙에 관한 연구)

  • 신동윤;이세한;송재복;김용일
    • Proceedings of the Korean Society for Emotion and Sensibility Conference
    • /
    • 1997.11a
    • /
    • pp.163-167
    • /
    • 1997
  • 인간이 움직이는 물체에 탑승하고 있거나 움직이는 물체를 잡고 있을때 어떤 종류의 감성을 느끼게 된다. 물체의 속도, 가속도, 또는 강성, 감쇠 등으로 인하여 인간은 쾌, 불쾌감을 갖게 되며, 본 논문에서는 이러한 감성을 운동감이라 정의한다. 이러한 운동감을 공학적으로 유용한 데이터로 만들기 위해 운동감 어휘를 도입하여 정량화를 시도하였으며, 복수의 운동감 어휘를 연산할 수 있는 방법과 가중치를 구할 수 있는 방법을 제시하고자 한다. 본 연구에서는 귀의 전정 기관에서 느끼는 몸 전체의 평형 감각 및 운동 감각은 고려의 대상으로 제외하며, 팔에 국한하여 피부 감각과 팔 근육의 위치 인지 등으로 인한 운동감을 해석 대상으로 한다. 해석의 편의성을 위하여 팔을 제외한 몸의 움직임은 없는 상태로 유지하며, 팔의 2차원 운동만을 고려하기고 한다. 퍼지는 사람의 언어와 같이 모호한 사건을 해석하기 위한 이론이다. 모호한 정도를 표현하는 방법으로 퍼지 정도척도(measutr of fuzziness)와 퍼지척도(fuzzy measure)가 많은 분야에서 이용되고 있다. 하지만 운동감에 대한 연구는 미비한 실정이므로 불확실성을 평가하는 퍼지 이론을 이용하여 운동감을 해석하려 한다.

  • PDF