• 제목/요약/키워드: 트윗 분류

검색결과 41건 처리시간 0.03초

트윗 감정 분류를 위한 비어휘자질의 사용 (Using Non-Lexical Features for Tweet Sentiment Classificaion)

  • 홍초희;김학수
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2012년도 제24회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.160-162
    • /
    • 2012
  • 문서를 대상으로 한 다양한 감정 분류 연구가 진행되어 왔으며, 최근에는 트윗 감정 분류에 그대로 적용되고 있다. 그러나 트윗은 일반 문서와 다르게 몇 가지의 독특한 특징을 갖고 있어 좋은 성능을 보이지 못하고 있다. 본 논문에서는 기계학습을 기반으로 트윗의 특징과 트윗 사용자 정보 자질을 사용한 실험으로 트윗 감정 분류 성능의 영향을 확인하였다. 실험 결과 트윗에 포함된 이모티콘 감정 극성과, 사용자 성향 극성 자질은 트윗 감정 분류 모델의 성능 향상에 기여를 하는 것을 알 수 있었다.

  • PDF

학술문헌을 인용하는 트윗의 기능 분석 연구 (Function Classification of tweets Citing Scholarly Articles)

  • 김병규;강지훈
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2018년도 제58차 하계학술대회논문집 26권2호
    • /
    • pp.83-84
    • /
    • 2018
  • 개별논문 평가를 위해 제안된 altmetric가 주목받고 있다. altmetrics에서는 개별 논문의 트윗의 건수를 평가요소 중 하나로 활용한다. 그러나 여러가지 목적으로 작성된 트윗을 단일하게 처리하는 것은 문제가 있다. 본 논문은 과학 논문에 달린 트윗들을 분석하여 기능의 범주를 정의하고 분류체계를 제시하였으며, 기존의 논문의 인용기능 분류 실험을 실시하여 그 결과와 비교 분석을 수행하였다. 향후 도출한 트윗 기능 분류에 대한 개선과 추가적인 연구를 수행할 계획이다.

  • PDF

트윗 감정 분류를 위한 다양한 기계학습 자질에 대한 비교 연구 (Comparative Study of Various Machine-learning Features for Tweets Sentiment Classification)

  • 홍초희;김학수
    • 한국콘텐츠학회논문지
    • /
    • 제12권12호
    • /
    • pp.471-478
    • /
    • 2012
  • 문서를 대상으로 한 다양한 감정 분류 연구가 진행되어 왔으며, 최근에는 트윗 감정 분류에 그대로 적용되고 있다. 그러나 이러한 연구들은 트윗의 구조, 이모티콘, 철자 오류 그리고 신조어와 같은 트윗의 특징을 고려하지 않아 좋은 성능을 보이지 못하고 있다. 본 논문에서는 기계학습을 기반으로 다양한 자질을(이모티콘 극성, 리트윗 극성, 사용자 극성, 대체 어휘)사용하여 실험하여 트윗 감정 분류 성능의 영향을 확인하였다. 기계 학습기 SVM(Support Vector Machine) 기반의 감정 분류 실험으로 이모티콘 극성 자질과 사용자 극성 자질이 트윗 감정 분류 모델의 성능 향상에 기여를 하는 것을 알 수 있었다. 이와 비교하여 리트윗 극성과 대체 어휘 자질은 트윗 감정 분류 모델에 큰 영향이 없는 것을 알 수 있었다.

토픽 기반의 트윗 분류를 위한 해시태그 분석 기법 (Hashtag Analysis Scheme for Topic based Tweet Categorization)

  • 김용성;전상훈;유제혁;황인준
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2014년도 추계학술발표대회
    • /
    • pp.737-740
    • /
    • 2014
  • 최근 SNS 사용자가 급증하면서 매우 다양하고 방대한 양의 글이 여러 종류의 SNS를 통해 생성되고 있다. 그중 트위터는 정보의 전달 및 확산에 상당히 유용한 도구로 사용되고 있다. 이러한 트위터의 사용자 트윗은 뉴스, 음악, 사진, 여행 등 다양한 형태로 등장한다. 또한 트위터는 해시태그라는 사용자 정의 태그를 사용하는데 이는 트윗의 키워드 및 핵심을 쉽게 표현할 수 있도록 해주는 효과적인 수단이다. 최근 상당히 많은 양의 트윗의 생성에도 불구하고 이를 다양한 카테고리별로 분류할 수 있는 연구가 많이 진행되지 않았다. 따라서 본 논문에서는 해시태그를 이용해 트윗의 핵심을 파악하고 수많은 트윗을 다양한 토픽별로 분류할 수 있는 기법을 제안한다. 우선 다양한 카테고리의 인기 해시태그가 포함된 트윗을 수집하고 수집한 트윗에서 해시태그별 키워드를 추출한다. 그리고 코사인 유사도를 통해 해시태그별 내용 유사도를 파악하여 각 카테고리 내의 해시태그가 얼마나 유사한 내용을 지니고 있는지 파악한다. 마지막으로 사용자 트윗이 입력되면 모든 카테고리와 유사도를 비교하여 가장 유사도가 높은 카테고리를 찾아 추천해준다. 제안된 기법을 바탕으로 프로토타입을 구현하고 실험을 통해 성능을 평가한다.

한국어 트위터의 감정 분석 도구 (A Sentiment Analysis Tool for Korean Twitter)

  • 서형원;전길호;최명길;남유림;김재훈
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2011년도 제23회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.94-97
    • /
    • 2011
  • 본 논문은 자동으로 한글 트위터 메시지(트윗: tweet)에 포함된 감정을 분석하는 방법에 대하여 기술한다. 제안된 시스템에 의하여 수집된 트윗들은 어떤 질의에 대해 긍정 혹은 부정으로 분류된다. 이것은 일반적으로 어떤 상품을 구매하기 원하는 고객이나, 상품에 대한 고객들의 평가를 수집하기 원하는 기업에게 유용하다. 영문 트윗에 대한 연구는 이미 활발하게 진행되고 있지만 한글 트윗, 특히 감정 분류에 대한 연구는 아직 공개된 것이 없다. 수집된 트윗들은 기계 학습(Naive Bayes, Maximum Entropy, 그리고 SVM)을 이용하여 분류하였고 한글 특성에 따라 자질 선택의 기본 단위를 2음절과 3음절로 나누어 실험하였다. 기존의 영어에 대한 연구는 80% 이상의 정확도를 가지는 반면에, 본 실험에서는 60% 정도의 정확도를 얻을 수 있었다.

  • PDF

특징추출을 이용한 트위터 메시지 주제 분류 방법 (A Method of Classifying Tweet by subject using features)

  • 송지민;김한우;김동주;정성훈
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2014년도 춘계학술대회
    • /
    • pp.905-907
    • /
    • 2014
  • 트위터는 전세계적으로 다양한 정보와 의견을 공유하는 교류의 장으로 이용되고 있다. 트위터에서 생성되는 막대한 양의 데이터를 활용하려는 시도가 이루어지고 있다. 그 중 다양한 주제별 정보를 추출하여 이용하려는 연구가 활발히 진행되고 있다. 트위터는 140자의 짧은 메시지로 정보를 공유하는 서비스이다. 이러한 짧은 메시지는 트윗에서 다양한 주제별 정보를 추출하는 것을 어렵게 한다. 본 논문에서는 트윗의 기능들과 분류할 주제의 특징을 이용하여 트윗 주제별 분류 방법을 제안한다. 이 방법의 유용성을 검증하기 위해, 트윗 API를 사용하여 수집된 10000개의 트윗으로 실험하였다. 그 결과 기존 연구들보다 뛰어난 결과를 얻었다.

  • PDF

시공간 정보를 사용한 개선된 트윗 봇 검출 (Improved Tweet Bot Detection Using Spatio-Temporal Information)

  • 김효상;신원용;김동건;조재희
    • 한국정보통신학회논문지
    • /
    • 제19권12호
    • /
    • pp.2885-2891
    • /
    • 2015
  • 온라인 소셜 네트워크 서비스 중 하나인 트위터는 가장 보편적으로 사용되는 마이크로 블로그인데, 트위터의 개방적 구조로 인해 자동화 프로그램인 트윗 봇이 많이 생성되고 있다. 이 트윗 봇은 적법한 봇과 악성 봇으로 분류되는데, 이 중 악성 봇은 일반 사용자들에게 많은 양의 스팸 정보나 유해한 컨텐츠를 배포하기 때문에 트윗 봇을 검출하는 작업은 반드시 필요하다. 기존 연구에서는 시간적 정보를 활용하여 사람과 트윗 봇을 분류하였다. 본 논문에서는 사용자들의 고 정밀 위치 정보를 알려주는 공간 태그된 트윗 정보를 활용하여 트위터 사용자들의 정확한 위치와 트윗 전송시각을 알아낸 후, 각 사용자의 시공간 엔트로피를 계산하여 트윗 봇을 검출하는 개선된 두 단계 알고리즘을 제안한다. 주요 결과로써, 시간 정보만을 이용한 기존 연구결과보다 각 신뢰도별 봇 검출 확률 및 거짓 경보 확률이 모두 우수하게 나타난다.

유사 트윗 분석에 기반한 트위터 해시태그 추천기법 (Twitter HashTag Recommendation Scheme based on Similar Tweet Analysis)

  • 전민아;전상훈;황인준
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2013년도 추계학술발표대회
    • /
    • pp.962-963
    • /
    • 2013
  • 트위터 해시태그(#, HashTag)는 트윗(Tweets)에서 특정 키워드나 내용을 주제별로 분류하고 검색을 보다 효율적으로 사용하기 위한 사용자 정의 태그이다. 사용자가 정의하기에 따라 다양한 형태로 작성되기 때문에 오히려 검색의 효율성이 떨어질 수 있으며, 사용자는 자신이 작성한 트윗에 어떤 해시태그를 추가해야 하는지에 대한 궁금증이 생기는 경우가 발생한다. 본 논문에서는 이러한 문제를 해결하기 위해 사용자가 작성한 트윗에 적합한 해시태그를 추천하는 기법을 제안한다. 수집한 트윗과 해시태그의 키워드를 추출하고 트윗의 유사도를 계산하기 위해 TF-IDF와 Cosine Similarity를 적용하여 유사한 트윗을 갖는 해시태그를 추천한다. 본 논문에서 제안된 기법을 검증하기 위한 실험으로 추천의 정확성을 평가했다.

트위터에서 이슈가 되고있는 뉴스 기사에 대한 소셜 사용자 네트워크 기반 정치 성향 분류 (Political Bias Classification Based on Social User Networks on Issuable Political News Article in Twitter)

  • 김준길;이경순
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2012년도 추계학술발표대회
    • /
    • pp.641-644
    • /
    • 2012
  • 트위터에서 정치 성향을 가지거나 관심이 있는 트위터 사용자는 관심있는 정치 인물이나 단체에 대한 뉴스 기사에 대해 자신의 의견을 남기거나 그대로 인용하게 된다. 또한, 자신의 의견과 공감하거나 비공감하는 트윗에 대해서 리트윗을 하거나 추가적인 자신의 의견을 언급하기도 한다. 본 논문에서는 이슈가 되고있는 정치 뉴스 기사에 대해 관심 있는 트위터 사용자들을 찾아 트위터 사용자들 간의 트윗 문서들 사이에서의 관계 정보를 가지는 사용자 네트워크에서의 트위터 사용자들의 성향을 분류해주는 방법을 제안한다. 제안한 방법의 유효성을 검증하기 위해 트위터에서 이슈가 된 정치 뉴스 기사들과 각 뉴스 이슈를 언급한 트위터 데이터에서 트윗 문서 내용 유사도 기반 분류 방법과의 비교 실험 하였다. 실험 결과에서 사용자간의 관계 정보를 이용한 성향 분류 방법이 유효함을 보였다.

소셜 데이터에서 재난 사건 추출을 위한 사용자 행동 및 시간 분석을 반영한 토픽 모델

  • 촐몽 바야르;이경순
    • 정보와 통신
    • /
    • 제34권6호
    • /
    • pp.43-50
    • /
    • 2017
  • 본고에서는 소셜 빅데이터에서 공공안전에 위협되고 사회적으로 이슈가 되는 재난사건을 추출하기 위한 방법으로 소셜 네트워크상에서 사용자 행동 분석과 시간분석을 반영한 토픽 모델링 기법을 알아본다. 소셜 사용자의 글 수, 리트윗 반응, 활동주기, 팔로워 수, 팔로잉 수 등 사용자의 행동 분석을 통하여 활동적이고 신뢰성 있는 사용자를 분류함으로써 트윗에서 스팸성과 광고성을 제외하고 이슈에 대해 신뢰성 높은 사용자가 쓴 트윗을 중요하게 반영한다. 또한, 트위터 데이터에서 새로운 이슈가 발생한 것을 탐지하기 위해 시간별 핵심어휘 빈도의 분포 변화를 측정하고, 이슈 트윗에 대해 감성 표현 분석을 통해 핵심이슈에 대해 사건 어휘를 추출한다. 소셜 빅데이터의 특성상 같은 날짜에 여러 이슈에 대한 트윗이 많이 생성될 수 있기 때문에, 트윗들을 토픽별로 그룹핑하는 것이 필요하므로, 최근 많이 사용되고 있는 LDA 토픽모델링 기법에 시간 특성과 사용자 특성을 분석한 시간상에서의 중요한 사건 어휘를 반영하고, 해당이슈에 대한 신뢰성 있는 사용자가 쓴 트윗을 중요시 반영하도록 토픽모델링 기법을 개선한 소셜 사건 탐지 방법에 대해 알아본다.