• 제목/요약/키워드: text representation model

검색결과 49건 처리시간 0.021초

이질성 학습을 통한 문서 분류의 정확성 향상 기법 (Improving the Accuracy of Document Classification by Learning Heterogeneity)

  • 윌리엄;현윤진;김남규
    • 지능정보연구
    • /
    • 제24권3호
    • /
    • pp.21-44
    • /
    • 2018
  • 최근 인터넷 기술의 발전과 함께 스마트 기기가 대중화됨에 따라 방대한 양의 텍스트 데이터가 쏟아져 나오고 있으며, 이러한 텍스트 데이터는 뉴스, 블로그, 소셜미디어 등 다양한 미디어 매체를 통해 생산 및 유통되고 있다. 이처럼 손쉽게 방대한 양의 정보를 획득할 수 있게 됨에 따라 보다 효율적으로 문서를 관리하기 위한 문서 분류의 필요성이 급증하였다. 문서 분류는 텍스트 문서를 둘 이상의 카테고리 혹은 클래스로 정의하여 분류하는 것을 의미하며, K-근접 이웃(K-Nearest Neighbor), 나이브 베이지안 알고리즘(Naïve Bayes Algorithm), SVM(Support Vector Machine), 의사결정나무(Decision Tree), 인공신경망(Artificial Neural Network) 등 다양한 기술들이 문서 분류에 활용되고 있다. 특히, 문서 분류는 문맥에 사용된 단어 및 문서 분류를 위해 추출된 형질에 따라 분류 모델의 성능이 달라질 뿐만 아니라, 문서 분류기 구축에 사용된 학습데이터의 질에 따라 문서 분류의 성능이 크게 좌우된다. 하지만 현실세계에서 사용되는 대부분의 데이터는 많은 노이즈(Noise)를 포함하고 있으며, 이러한 데이터의 학습을 통해 생성된 분류 모형은 노이즈의 정도에 따라 정확도 측면의 성능이 영향을 받게 된다. 이에 본 연구에서는 노이즈를 인위적으로 삽입하여 문서 분류기의 견고성을 강화하고 이를 통해 분류의 정확도를 향상시킬 수 있는 방안을 제안하고자 한다. 즉, 분류의 대상이 되는 원 문서와 전혀 다른 특징을 갖는 이질적인 데이터소스로부터 추출한 형질을 원 문서에 일종의 노이즈의 형태로 삽입하여 이질성 학습을 수행하고, 도출된 분류 규칙 중 문서 분류기의 정확도 향상에 기여하는 분류 규칙만을 추출하여 적용하는 방식의 규칙 선별 기반의 앙상블 준지도학습을 제안함으로써 문서 분류의 성능을 향상시키고자 한다.

브레히트 연기실행도구를 이용한 연기교수법 모형 개발 연구 - 반복적 재현연기의 현존성 상실의 대안으로 - (A Study on the Modeling of Teaching Methods of Acting Using Brecht's Acting Tools - An Alternative to the Loss of Presence of Repetitive Representational Acting -)

  • 이지은
    • 한국엔터테인먼트산업학회논문지
    • /
    • 제14권8호
    • /
    • pp.103-116
    • /
    • 2020
  • 본 연구는 텍스트 중심의 연기론과 신체 중심의 연기론의 연결링크가 필요하다는 문제점을 인식하며 출발한다. 배우뿐만 아니라 연기교육자에 의해서도 수차례 논의되어 온 재현적 반복 연기를 통한 현존성 상실이라는 난제를 극복해줄 방안으로 브레히트의 연기론을 연구한다. 브레히트의 연기론은 많은 연구자들에 의해 종래의 배우훈련의 대안으로써 이미 언급된 바 있지만 실제 적용이 가능한 연기 훈련방법에 대한 연구는 많이 진행되지 않은 실정으로 브레히트 연기법의 실제에 대한 기초자료가 될 수 있도록 목표한다. 본 연구는 그 중에서도 텍스트 기반의 모순 찾기와 신체 중심의 브레히트 연기론을 연구하고 그의 연기론이 텍스트와 신체 중심 연기론의 연결링크로써 작용할 수 있는 가능성을 탐구한다. 연구방법으로는 먼저 텍스트 중심의 재현적 연기론과 신체 중심의 포스트드라마 연기론의 개념과 한계에 대한 이론적 고찰을 진행한다. 그리고 브레히트의 서사적 연기 중에서 텍스트에 중점을 둔 연기실행도구와 신체에 중점을 둔 연기실행도구를 구분하여 그가 사용한 용어와 개념을 정리하고 연기실행의 과정에서 도달하는 현존적 효과에 대해 확인한다. 마지막으로 필자의 지도경험을 바탕으로 브레히트의 연기이론을 변형하여 개발한 연기교수법 학습모형을 제안한다. 그러나 본 연구에서 제시한 학습모형은 필자의 지도경험만을 바탕으로 하기 때문에 그 효과를 일반화하는 데는 한계가 있음을 밝힌다. 향후 후속 연구를 통해 브레히트 연기론에 대한 깊이 있는 통찰과 다양한 연기교수법 모형을 개발을 통해 현대 연기교육의 다양성에 보탬이 되기를 기대해 본다.

내용 기반 이미지 검색에서 효율적인 색상-모양 표현을 위한 복소 색상 모델 (Complex Color Model for Efficient Representation of Color-Shape in Content-based Image Retrieval)

  • 최민석
    • 디지털융복합연구
    • /
    • 제15권4호
    • /
    • pp.267-273
    • /
    • 2017
  • 각종 디지털 기기와 통신 기술의 발전으로 다양한 멀티미디어 콘텐츠의 생산과 유통이 폭발적으로 증가하고 있다. 이미지와 동영상 등의 멀티미디어 데이터의 검색을 위해서는 기존의 문자 위주의 검색과는 다른 접근 방식이 필요하다. 이미지의 여러 가지 물리적인 특징들을 정량화 하여 분석하고 이를 비교하여 유사한 이미지를 검색하는 내용기반 이미지 검색에서 색상과 모양은 주요 물리적 특징들이다. 지금까지는 색상과 모양을 서로 독립적인 특징으로 분리하여 이용하였지만, 인지적 관점에서 두 특징은 밀접한 관련이 있다. 본 논문에서는 색상과 모양 특징을 동시에 표현하기 위하여 3차원 색상 정보를 2차원 복소수 형식으로 표현하는 복소 색상 모델을 이용하여 색상의 공간적 분포 모양을 기술하는 방법을 제안한다. 복소 이미지를 주파수 변환한 후 저주파 영역의 소수의 계수만으로 복원하는 실험을 통하여 제안된 방법이 색상의 공간적 분포 모양을 효율적으로 표현할 수 있음을 보였다.

CNN을 적용한 한국어 상품평 감성분석: 형태소 임베딩을 중심으로 (Sentiment Analysis of Korean Reviews Using CNN: Focusing on Morpheme Embedding)

  • 박현정;송민채;신경식
    • 지능정보연구
    • /
    • 제24권2호
    • /
    • pp.59-83
    • /
    • 2018
  • 고객과 대중의 니즈를 파악하기 위한 감성분석의 중요성이 커지면서 최근 영어 텍스트를 대상으로 다양한 딥러닝 모델들이 소개되고 있다. 본 연구는 영어와 한국어의 언어적인 차이에 주목하여 딥러닝 모델을 한국어 상품평 텍스트의 감성분석에 적용할 때 부딪히게 되는 기본적인 이슈들에 대하여 실증적으로 살펴본다. 즉, 딥러닝 모델의 입력으로 사용되는 단어 벡터(word vector)를 형태소 수준에서 도출하고, 여러 형태소 벡터(morpheme vector) 도출 대안에 따라 감성분석의 정확도가 어떻게 달라지는지를 비정태적(non-static) CNN(Convolutional Neural Network) 모델을 사용하여 검증한다. 형태소 벡터 도출 대안은 CBOW(Continuous Bag-Of-Words)를 기본적으로 적용하고, 입력 데이터의 종류, 문장 분리와 맞춤법 및 띄어쓰기 교정, 품사 선택, 품사 태그 부착, 고려 형태소의 최소 빈도수 등과 같은 기준에 따라 달라진다. 형태소 벡터 도출 시, 문법 준수도가 낮더라도 감성분석 대상과 같은 도메인의 텍스트를 사용하고, 문장 분리 외에 맞춤법 및 띄어쓰기 전처리를 하며, 분석불능 범주를 포함한 모든 품사를 고려할 때 감성분석의 분류 정확도가 향상되는 결과를 얻었다. 동음이의어 비율이 높은 한국어 특성 때문에 고려한 품사 태그 부착 방안과 포함할 형태소에 대한 최소 빈도수 기준은 뚜렷한 영향이 없는 것으로 나타났다.

사회적 이슈 리스크 유형 분류를 위한 어휘 자질 선별 (Linguistic Features Discrimination for Social Issue Risk Classification)

  • 오효정;윤보현;김찬영
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제5권11호
    • /
    • pp.541-548
    • /
    • 2016
  • 사용자의 다양한 의견을 수렴하고 모니터링하기 위한 정보원으로써 소셜미디어의 활용은 이미 필수가 되었다. 본 논문은 소셜미디어에 나타난 다양한 이슈 중 여론 형성에 악영향을 끼치는 부정적 사건을 이슈 '리스크'로 정의, 그 세부 유형을 자동으로 분류하는 모델을 개발하고자 한다. 이를 위해 소셜미디어에 나타난 다양한 어휘 자질을 선별, 그 효과를 규명하였다. 특히 리스크 문장의 어휘 구문 특징을 표현하기 위한 자질로 워드 임베딩 학습 결과를 활용한다. 개별 어휘 자질의 특징을 분석하기 위해 언어분석 오류를 보정한 환경에서 수행한 실험 결과, 가장 효과가 큰 자질은 개체명 자질로 분석되었으며, 기본 어휘 자질을 기반으로 주요 술부의 워드 임베딩 결과와 워드 클러스터 결과를 모두 조합한 경우가 최고 성능을 보이는 것으로 파악되었다. 실제 소셜빅데이터에 적용하는 환경과 유사하도록 자동 언어분석 결과의 오류를 포함한 조건에서 실험한 결과, 고빈도 평가셋에서는 92.08%의 성능을, 전체 58개 범주 평가셋에서는 85.84%의 성능을 얻었다.

화자 겹침을 고려한 화자 전환 검출 시스템 제안 (Proposal of speaker change detection system considering speaker overlap)

  • 박지수;윤영선;차신;박전규
    • 한국음향학회지
    • /
    • 제40권5호
    • /
    • pp.466-472
    • /
    • 2021
  • 화자 전환 검출은 대화 중에 발성 화자가 다른 사람으로 바뀌는 시점을 검출하는 것을 의미한다. 이 과정에서 화자 중복, 화자 정보 표기의 부정확성, 데이터 불균형 등으로 화자가 바뀌는 순간을 검출하는 데 어려움이 발생한다. 본 논문에서는 이러한 문제를 해결하기 위해 음성 인식에 널리 사용되는 TIMIT 데이터를 가공하여 충분한 양의 훈련 데이터를 얻었으며, 화자가 겹치는지를 파악한 후에 화자 전환 여부를 판단하였다. 본 논문에서는 화자 겹침을 고려한 화자 전환 검출 시스템을 구축하기 위하여 다양한 접근법을 사용하여 성능을 평가하고 검증했다. 그 결과 화자 겹칩 영역을 제거하기 위해 X-Vector 구조와 유사한 형태의 검출 시스템과 화자 전환 검출 시스템을 모델링하기 위한 Bi-LSTM 모델을 제안하였다. 실험 결과 기준 시스템보다 상대적으로 각각 4.6 %, 13.8 % 성능 향상을 확인하였다. 또한, 실험 결과를 기반으로 텍스트 정보와 화자 정보 등을 고려한다면 좀 더 강인한 화자 전환 검출 시스템을 구축할 수 있을 것으로 판단한다.

멀티 뷰 기법 리뷰: 이해와 응용 (Multi-view learning review: understanding methods and their application)

  • 배강일;이영섭;임창원
    • 응용통계연구
    • /
    • 제32권1호
    • /
    • pp.41-68
    • /
    • 2019
  • 멀티 뷰 기법은 데이터를 다양한 관점에서 보려는 접근 방법이며 데이터의 다양한 정보를 통합하여 사용하려는 시도이다. 최근 많은 연구가 진행되고 있는 멀티 뷰 기법에서는 단일 뷰 만을 이용하여 모형을 학습시켰을 때 보다 좋은 성과를 보인 경우가 많았다. 멀티 뷰 기법에서 딥 러닝 기법의 도입으로 이미지, 텍스트, 음성, 영상 등 다양한 분야에서 좋은 성과를 보였다. 본 연구에서는 멀티 뷰 기법이 인간 행동 인식, 의학, 정보 검색, 표정 인식 분야에서 직면한 여러 가지 문제들을 어떻게 해결하고 있는지 소개하였다. 또한 전통적인 멀티 뷰 기법들을 데이터 차원, 분류기 차원, 표현 간의 통합으로 분류하여 멀티 뷰 기법의 데이터 통합 원리를 리뷰 하였다. 마지막으로 딥 러닝 기법 중 가장 범용적으로 사용되고 있는 CNN, RNN, RBM, Autoencoder, GAN 등이 멀티 뷰 기법에 어떻게 응용되고 있는지를 살펴보았다. 이때 CNN, RNN 기반 학습 모형을 지도학습 기법으로, RBM, Autoencoder, GAN 기반 학습 모형을 비지도 학습 기법으로 분류하여 이 방법들이 대한 이해를 돕고자 하였다.

토픽모델링을 활용한 국내외 수학교육 연구 동향 비교 연구 (A comparative study of domestic and international research trends of mathematics education through topic modeling)

  • 신동조
    • 한국수학교육학회지시리즈A:수학교육
    • /
    • 제59권1호
    • /
    • pp.63-80
    • /
    • 2020
  • 본 연구는 2000년부터 2019년까지 7종의 KCI 등재지에 게재된 3,114편의 수학교육 논문와 5종의 SSCI 등재지에 게재된 1,636편의 수학교육 논문의 연구 동향을 텍스트 마이닝 기술의 하나인 토픽모델링을 사용하여 비교·분석하였다. 연구 결과, 국내외 수학교육 연구는 16개의 유사한 주제와 7개의 상이한 주제로 분류할 수 있었다. 연구 결과, 예비교사와 관련된 주제는 국내와 해외 수학교육 연구에서 모두 높은 비중을 차지하고 있는 연구주제였다. 현직교사 재교육에 관한 연구주제는 국내 연구에서는 하나의 독립된 주제로 나타나지 않았지만, 해외 연구에서 많은 관심을 받는 주제로 나타났다. 해외 수학교육 연구에 비해 국내에서는 수학적 역량에 관한 연구의 관심이 높았지만, 이는 문제해결역량과 창의·융합역량에 치중되는 경향이 있었다. 반면, 해외 수학교육에서는 정체성과 공정성에 관한 연구가 강조되었다.

선택적 자질 차원 축소를 이용한 최적의 지도적 LSA 방법 (Optimal supervised LSA method using selective feature dimension reduction)

  • 김정호;김명규;차명훈;인주호;채수환
    • 감성과학
    • /
    • 제13권1호
    • /
    • pp.47-60
    • /
    • 2010
  • 기존 웹 페이지 자동분류 연구는 일반적으로 학습 기반인 kNN(k-Nearest Neighbor), SVM(Support Vector Machine)과 통계 기반인 Bayesian classifier, NNA(Neural Network Algorithm)등 여러 종류의 분류작업에서 입증된 분류 기법을 사용하여 웹 페이지를 분류하였다. 하지만 인터넷 상의 방대한 양의 웹 페이지와 각 페이지로부터 나오는 많은 양의 자질들을 처리하기에는 공간적, 시간적 문제에 직면하게 된다. 그리고 분류 대상을 표현하기 위해 흔히 사용하는 단일(uni-gram) 자질 기반에서는 자질들 간의 관계 분석을 통해 자질에 정확한 의미를 부여하기 힘들다. 특히 본 논문의 분류 대상인 한글 웹 페이지의 자질인 한글 단어는 중의적인 의미를 가지는 경우가 많기 때문에 이러한 중의성이 분류 작업에 많은 영향을 미칠 수 있다. 잠재적 의미 분석 LSA(Latent Semantic Analysis) 분류기법은 선형 기법인 특이치 분해 SVD(Singular Value Decomposition)을 통해 행렬의 분해 및 차원 축소(dimension reduction)를 수행하여 대용량 데이터 집합의 분류를 효율적으로 수행하고, 또한 차원 축소를 통해 새로운 의미공간을 생성하여 자질들의 중의적 의미를 분석할 수 있으며 이 새로운 의미공간상에 분류 대상을 표현함으로써 분류 대상의 잠재적 의미를 분석할 수 있다. 하지만 LSA의 차원 축소는 전체 데이터의 표현 정도만을 고려할 뿐 분류하고자 하는 범주를 고려하지 않으며 또한 서로 다른 범주 간의 차별성을 고려하지 않기 때문에 축소된 차원 상에서 분류 시 서로 다른 범주 데이터간의 모호한 경계로 인해 안정된 분류 성능을 나타내지 못한다. 이에 본 논문은 새로운 의미공간(semantic space) 상에서 서로 다른 범주사이의 명확한 구분을 위한 특별한 차원 선택을 수행하여 최적의 차원 선택과 안정된 분류성능을 보이는 최적의 지도적 LSA을 소개한다. 제안한 지도적 LSA 방법은 기본 LSA 및 다른 지도적 LSA 방법들에 비해 저 차원 상에서 안정되고 더 높은 성능을 보였다. 또한 추가로 자질 생성 및 선택 시 불용어의 제거와 자질에 대한 가중치를 통계적인 학습을 통해 얻음으로써 더 높은 학습효과를 유도하였다.

  • PDF