• 제목/요약/키워드: Sentiment

검색결과 950건 처리시간 0.03초

대용량 소셜 미디어 감성분석을 위한 반감독 학습 기법 (Semi-supervised learning for sentiment analysis in mass social media)

  • 홍소라;정연오;이지형
    • 한국지능시스템학회논문지
    • /
    • 제24권5호
    • /
    • pp.482-488
    • /
    • 2014
  • 대표적인 소셜 네트워크 서비스(SNS)인 트위터의 내용을 분석하여 자동으로 트윗에 나타난 사용자의 감성을 분석하고자 한다. 기계학습 기법을 사용해서 감성 분석 모델을 생성하기 위해서는 각각의 트윗에 긍정 또는 부정을 나타내는 감성 레이블이 필요하다. 그러나 사람이 모든 트윗에 감성 레이블을 붙이는 것은 비용이 많이 소요되고, 실질적으로 불가능하다. 그래서 본 연구에서는 "감성 레이블이 있는 데이터"와 함께 "감성 레이블이 없는 데이터"도 활용하기 위해서 반감독 학습기법인 self-training 알고리즘을 적용하여 감성분석 모델을 생성한다. Self-training 알고리즘은 "레이블이 있는 데이터"의 레이블이 있는 데이터를 활용하여 "레이블이 없는 데이터"의 레이블을 확정하여 "레이블이 있는 데이터"를 확장하는 방식으로, 분류모델을 점진적으로 개선시키는 방식이다. 그러나 데이터의 레이블이 한번 확정되면 향후 학습에서 계속 사용되므로, 초기의 오류가 계속적으로 학습에 영향을 미치게 된다. 그러므로 조금 더 신중하게 "레이블이 없는 데이터"의 레이블을 결정할 필요가 있다. 본 논문에서는 self-training 알고리즘을 이용하여 보다 높은 정확도의 감성 분석 모델을 생성하기 위하여, self-training 중 "감성 레이블이 없는 데이터"의 레이블을 결정하여 "감성 레이블이 있는 데이터"로 확장하기 위한 3가지 정책을 제시하고, 각각의 성능을 비교 분석한다. 첫 번째 정책은 임계치를 고려하는 것이다. 분류 경계로부터 일정거리 이상 떨어져 있는 데이터를 선택하고자 하는 것이다. 두 번째 정책은 같은 개수의 긍/부정 데이터를 추가하는 것이다. 한쪽 감성에 해당하는 데이터에만 국한된 학습을 하는 것을 방지하기 위한 것이다. 세 번째 정책은 최대 개수를 고려하는 것이다. 한 번에 많은 양의 데이터가 "감성 레이블이 있는 데이터"에 추가되는 것을 방지하고 상위 몇%만 선택하기 위해서, 선택되는 데이터의 개수의 상한선을 정한 것이다. 실험은 긍정과 부정으로 분류되어 있는 트위터 데이터 셋인 Stanford data set에 적용하여 실험하였다. 그 결과 학습된 모델은 "감성 레이블이 있는 데이터" 만을 가지고 모델을 생성한 것보다 감성분석의 성능을 향상 시킬 수 있었고 3가지 정책을 적용한 방법의 효과를 입증하였다.

형식적 및 비형식적 어휘 정보를 반영한 문장 감정 분류 (A Sentence Sentiment Classification reflecting Formal and Informal Vocabulary Information)

  • 조상현;강행봉
    • 정보처리학회논문지B
    • /
    • 제18B권5호
    • /
    • pp.325-332
    • /
    • 2011
  • 최근 트위터, 페이스북과 같은 소셜 네트워크 서비스(Social Network Service : SNS)가 활성화됨에 따라 서비스 사용자들에 의해 작성된 막대한 텍스트들로부터 의미 있는 정보를 찾기 위한 연구가 많은 주목을 받고 있다. 특히 문장에 담겨 있는 감정은 활용 범위가 매우 넓은 정보로서 문장에 대한 감정을 분류하는 일은 매우 유용한 일이라고 할 수 있다. 본 논문에서는 문장의 감정을 분류하기 위해 문장에 포함되어 있는 형식적 어휘 정보와 이모티콘이나 인터넷 용어와 같은 온라인상에서 많이 이용되는 다양한 형태의 비형식적 어휘 정보를 이용한 새로운 문장 감정 분류 방법을 제안한다. 기존에는 문장의 감정을 분류하기 위해 사전을 기반으로 한 형식적 어휘 정보를 이용했지만, 최근 인터넷 사용자들은 인터넷 용어나 이모티콘과 같은 비형식적 어휘를 많이 사용해 기존의 형식적 어휘 정보만으로는 정확한 감정 분류가 어렵다. 제안한 방법은 형식적 어휘 정보와 비형식적 어휘 정보를 이용해 다양한 형태의 어휘를 포함하는 인터넷 상의 문장들에 대해 보다 정확한 감정 분류 결과를 보여준다. 또한, 같은 어휘라도 도메인별로 다른 감정을 나타내는 경우가 많으므로 제안한 방법에서는 도메인별로 다른 감정 어휘정보를 이용했다. 각 감정 어휘 정보를 통해 특징벡터로 표현된 문장은 Support Vector Machine(SVM) 분류 방법을 통해 감정을 분류하고 그 성능을 평가했다.

트위터를 활용한 감성 기반의 영화 유사도 측정 (Measuring Similarity Between Movies Based on Sentiment of Tweets)

  • 김경민;김동윤;이지형
    • 한국지능시스템학회논문지
    • /
    • 제24권3호
    • /
    • pp.292-297
    • /
    • 2014
  • 최근 소셜 네트워크 서비스가 보편화되면서, 이를 활용하여 사람들의 의견이나 감성 등을 파악하기 위한 감성분석 연구가 다양한 분야 진행되고 있다. 기존의 영화 관련 연구의 경우, 대부분이 영화평에 대해 단순 긍/부정으로 감성분석을 하여, 영화에 대한 선호도를 파악하는 데 그쳤다. 사람의 감성은 단순 긍/부정이 아닌 다양한 감성으로 분류될 수 있는데 반해, 이분법적 감성분석은 영화의 평점 정보에서 손쉽게 얻을 수 있는 선호도와 유사한 분석을 하는데 그친다. 따라서 영화의 평점보다 다양하고 유용한 정보를 얻기 위해서는, 영화 리뷰를 세분화된 감성으로 분석하여 영화에 대해 느낀 감성을 다양한 기준으로 분류할 필요가 있다. 본 논문에서는 Thayer 모델을 기반으로 감성 분류 기준을 세우고, 수집한 영화 관련 트윗을 이용하여 각 영화에 대해 대중이 느끼는 감성을 분석한다. 분석된 영화에 대한 감성 비율을 유클리드거리, 코사인유사도, 피어슨 상관계수를 이용하여 영화간의 유사도를 측정하였다. IMDB에서 제공하는 유사 영화 정보를 바탕으로 본 논문에서 제안하는 방식의 유용성을 검증하였다.

SNS에서의 언어 간 감성 차이 연구: 6개 언어를 중심으로 (Differences in Sentiment on SNS: Comparison among Six Languages)

  • 김형호;장필식
    • 디지털융복합연구
    • /
    • 제14권3호
    • /
    • pp.165-170
    • /
    • 2016
  • 본 연구의 목적은 SNS 활용에 있어 사용자 언어 간 감성의 평균차이가 있는지를 검증하는 것이다. 가장 많이 이용되는 SNS 중 하나인 트위터를 대상으로, 영어, 독일어, 러시아어, 스페인어, 터키어 및 네덜란드어 등 6개 언어로 작성된 약 2억 개 트윗을 스트리밍 API를 이용하여 수집하였으며, SentiStrength를 이용하여 주관적/객관적 비율, 감성강도, 긍정/부정 비율, 리트윗 횟수 및 경계불투과도 등에 대한 분석을 시행하고, 트위터를 통한 감성표현의 경향성과 변동을 파악하였다. 분석결과, 언어권에 따라 주관적/객관적 트윗 비율과 긍정/부정 트윗 비율이 각각 통계적으로 유의한 차이가 있는 것으로 나타났다(p<0.001). 또한, 언어의 종류는 감성강도와 경계 불투과도 그리고 리트윗 횟수에 통계적으로 유의한(p<0.001) 영향을 미치는 것으로 파악되었다. 이러한 결과는 SNS를 활용한 감성분석에 있어 언어, 문화 별 경향성 및 수준차이를 반드시 고려하여야 한다는 것을 보여준다.

Word2vec과 앙상블 분류기를 사용한 효율적 한국어 감성 분류 방안 (Effective Korean sentiment classification method using word2vec and ensemble classifier)

  • 박성수;이건창
    • 디지털콘텐츠학회 논문지
    • /
    • 제19권1호
    • /
    • pp.133-140
    • /
    • 2018
  • 감성 분석에서 정확한 감성 분류는 중요한 연구 주제이다. 본 연구는 최근 많은 연구가 이루어지는 word2vec과 앙상블 방법을 이용하여 효과적으로 한국어 리뷰를 감성 분류하는 방법을 제시한다. 연구는 20 만 개의 한국 영화 리뷰 텍스트에 대해, 품사 기반 BOW 자질과 word2vec를 사용한 자질을 생성하고, 두 개의 자질 표현을 결합한 통합 자질을 생성했다. 감성 분류를 위해 Logistic Regression, Decision Tree, Naive Bayes, Support Vector Machine의 단일 분류기와 Adaptive Boost, Bagging, Gradient Boosting, Random Forest의 앙상블 분류기를 사용하였다. 연구 결과로 형용사와 부사를 포함한 BOW자질과 word2vec자질로 구성된 통합 자질 표현이 가장 높은 감성 분류 정확도를 보였다. 실증결과, 단일 분류기인 SVM이 가장 높은 성능을 나타내었지만, 앙상블 분류기는 단일 분류기와 비슷하거나 약간 낮은 성능을 보였다.

게임 도메인 웹 코퍼스를 이용한 감성사전 구축 및 평가 (Construction and Evaluation of a Sentiment Dictionary Using a Web Corpus Collected from Game Domain)

  • 정우영;배병철;조성현;강신진
    • 한국게임학회 논문지
    • /
    • 제18권5호
    • /
    • pp.113-122
    • /
    • 2018
  • 본 논문은 게임 도메인에서 웹 코퍼스를 이용하여 감성사전을 구축하는 방법과 구축한 감성사전의 평가 결과를 기술한다. 감성사전 구축을 위해 먼저 트위터 형태소 분석기를 이용해 국내 한 포털 사이트의 게임 관련 웹 문서를 기반으로 어휘를 수집하여 감성 사전 어휘 목록을 만들었고, 목록에 있는 단어들 중 동사와 형용사 품사의 단어들에 대해 감성 사전을 구축하였다. 구축된 감성 사전의 평가를 위해 영어 기반의 Senti-word Net(SWN)을 한글로 번역한 한국어 SWN을 이용하여 정밀도와 재현율 값을 계산하였다. 평가 결과 긍정과 부정 감성의 F-1 값에 대한 평균이 형용사의 경우 0.85, 동사에 대해 0.77을 각각 보여 주었다.

에너지 가격이 투자 심리에 미치는 효과 분석: 웨이블릿 분석 방법 적용 (Analysis of the Effect of Energy Prices on Investment Sentiment: Applying the Wavelet Analysis Method)

  • 최기홍;김동윤
    • 한국항만경제학회지
    • /
    • 제37권2호
    • /
    • pp.119-131
    • /
    • 2021
  • 에너지는 경제활동과 사람들의 삶에 있어서 필수적인 요소이고 다양한 산업에서 활용하고 있는 중요한 자원이며 상품 시장의 금융화로 인해 원유가 다른 자산과 동일한 자산으로 변함으로써 그 중요성이 커지고 있다. 이에 따라 에너지 가격과 투자 심리간의 상관관계를 분석한 연구들은 대부분 경제적 요인과 투기를 통해 투자 심리가 유가에 영향을 미친다고 설명하고 있다. 본 연구에서는 에너지 가격과 관련하여 가장 대표적인 유가 변동에 따른 충격이 투자자 의사결정에 영향을 미쳐 투자 심리 변화에 영항을 주는가에 대한 내용을 중심으로 전반적인 에너지 가격 변동이 투자 심리에 영향을 미치는가에 대한 내용을 분석하고자 하였으며, 에너지 가격이 투자 심리에 어떠한 연관성이 있는지를 파악하기 위하여 웨이블릿 일관성 분석(wavelet coherence analysis)을 적용하여 주기별(단기, 중기, 장기) 에너지 가격이 투자 심리를 예측할 수 있는지를 분석하였다. 연구결과 에너지 가격과 투자 심리 사이의 시간 척도별로 차이가 발생하며 투자 심리 안정화를 위해 정책은 시간 척도별 효과를 고려하여야 하며, 에너지 가격과 관련한 투자 심리의 영향력은 단기보다 장기에서 더 크게 나타나고 있으며 마지막으로 시장에 영향을 미칠 수 있는 특정 사건 등이 발생하는 경우 에너지 가격과 투자 심리의 관련성 차이가 발생하기 때문에 이를 감안한 정책 및 시장 변화에 집중해야 할 필요가 있는 것으로 판단된다.

멜로드라마, 그 근대적인 모럴의 형식 (Melodrama as a Form of the Moral)

  • 우수진
    • 한국연극학
    • /
    • 제49호
    • /
    • pp.49-71
    • /
    • 2013
  • Melodrama emerged as a form of the moral in the early modern age. As an approach 'the moral' not only means that rewarding virtue and punishing vice, but also refer to a principle of spiritual life and a way of life. -Melodrama theatricalizes a new vision of human life and society through a new type of the virtuous protagonist and sentiment/-ality. -This allows melodrama to be a dominant cultural form in this modern age, beyond the borders of the theater, mass-media, and literature. Virtue and sentiment/-ality are the core elements of melodrama, which differentiate it from tragedy and comedy especially in the structure and effect of the drama. Actually virtue and sentiment/-ality have been a main target of criticism. Virtue has been regarded as a trite quality of the stereotypical protagonist, and sentiment/-ality as a banal emotion which paralyzes an audience's recognition of reality. -However, this thesis regards both virtue and sentiment/-ality as vehicles for showing and sharing the morals of the modern age. First, the virtues of the protagonist included the general and universal ones of the bourgeois -at that times, the bourgeois represented themselves as a human being- such as the responsibility and obedience of a father, a mother, a wife, a husband, a daughter and a son. They also included the professional ethics such as courage, honesty, and justice and so on. The fall or salvation of the protagonist is largely determined by his/her private individual virtue. Second, sentiment/ality is a theatrical device that makes the audience internalize the protagonist's virtue. The protagonist expresses his/her universal virtue sentimentally, and the audience also expresses their virtue by sympathizing with the protagonist's virtue sentimentally. However, the melodramatic protagonist as an individual, is not connected with society, but remains isolated. As a result, s/he has no influence on the society, where s/he can only ends her/his play alone with a happy-ending. S/he is happy alone, or at best happy with his/her own family. On the contrary to this, tragic protagonist usually fixes social disorder through his/her fall. In that sense, we can say that melodrama presents only the half of the human life.

빅데이터 분석기법을 활용한 아파트 가격 관련 뉴스 기사의 극성 분석 (A Study on the Polarity of Apartment Price News Using Big Data Analysis Method)

  • 조상연;홍은표
    • 디지털융복합연구
    • /
    • 제17권9호
    • /
    • pp.47-54
    • /
    • 2019
  • 본 연구는 빅데이터 분석 방법인 오피니언 마이닝을 사용하여 아파트 가격 관련 뉴스 기사의 극성을 확인하는 연구로 자료는 2012년, 2018년 2년간 네이버에 게시된 인터넷 뉴스 기사를 사용하였다. 감성분석 모형을 모델링하고 주제 지향형 감성사전 구축 방법을 제안하였다. 제안한 감성분석 모형을 통해 분석한 결과, 아파트 가격이 상승하는 시기에는 사회적 이슈 선정에 있어서 언론사의 성향에 따라 차이가 있는 것을 확인하였고 정부와 동일한 성향의 언론사에서 긍정 기사가 많은 것을 확인하였다. 부동산 분야에서 사용할 수 있는 감성분석 모형을 제시하고 부동산 관련 비정형 데이터의 극성을 분석하였다는 것에 의의가 있다. 향후 다양한 분야에 접목하기 위해서는 주제별 감성사전을 구축해야 하며 다양한 비정형 데이터를 수집하고 수집 기간을 확장하는 것이 필요하다.

코로나-19관련 웨이보 정서 분석을 통한 중국 주식시장의 주판 및 차스닥의 민감도 예측 기법 (Sensitivity of abacus and Chasdaq in the Chinese stock market through analysis of Weibo sentiment related to Corona-19)

  • 이가기;오하영
    • 한국정보통신학회논문지
    • /
    • 제25권1호
    • /
    • pp.1-7
    • /
    • 2021
  • 최근 코로나 19발생과 동시에 소셜 미디어의 투자자 정서가 증시 가격 움직임을 주도해 관심을 모으고 있다. 본 연구는 행동금융 이론 기반 빅 데이터 분석을 활용하여 소셜 미디어에서 추출한 정서가 중국 증시의 실시간 및 단기적 가격 모멘텀을 예측하는데 활용될 수 있는 기법을 제안한다. 이를 위해, COVID-19와 관련 200만 건 이상의 시나 웨이보 빅 데이터를 키워드 방식으로 수집 및 분석하고 시간이 따른 영향력이 높은 감정 요인을 추출한다. 최종 결과 도출을 위해 다양한 지도 및 비지도 학습 모델을 다 각도에서 구현 및 성능평가를 비교 분석 후, BiLSTM mdoel이 최적의 결과를 낼 수 있음을 증명했다. 또한, 제안하는 기법을 통해 주가변동과 심리요인 간에도 비슷한 움직임을 보이고 있음을 제안했고 소셜미디어에서 추출한 공공분위기가 어느 정도 투자자들의 심리를 대변할 수 있고, 주식시장에 영향을 미칠 수 있는 특수행사에 몰두할 때 증시변동에 차이를 만들 수 있음을 증명했다.