• Title/Summary/Keyword: Keyword Similarity

Search Result 107, Processing Time 0.211 seconds

개념 망을 통한 전자 카탈로그의 시맨틱 검색 및 추천 (Semantic Search and Recommendation of e-Catalog Documents through Concept Network)

  • 이재원;박성찬;이상근;박재휘;김한준;이상구
    • 한국전자거래학회지
    • /
    • 제15권3호
    • /
    • pp.131-145
    • /
    • 2010
  • 현재까지, 사용자의 요구에 맞는 카탈로그 문서를 제공하기 위해 널리 사용되고 있는 패러다임은 키워드 검색 혹은 협업적 필터링 기반 추천이다. 일반적으로 사용자의 질의어는 짧기 때문에, 사용자의 요구(질의어, 선호도)에 적합한 카탈로그 문서를 제공하는 것은 쉽지 않다. 이를 극복하기 위해 다양한 기법들이 제안되었으나, 이전 연구들은 색인어 매칭을 기반으로 하고 있다. 기존 베이지안 신념 망을 이용한 방법은 사용자의 요구 및 카탈로그 문서들을 연관성이 높은 개념들로 표현하였다. 하지만 개념들이 카탈로그 문서에서 추출된 색인어로 구성되어 있기 때문에 개념간의 관계 정보를 잘 표현하지 못하였다. 이에 본 연구는 베이지안 신념 망을 확장하여, 사용자의 요구 및 카탈로그 문서들을 웹 디렉토리에서 추출한 개념(혹은 카테고리) 망으로 표현한다. 개념 망을 이용함으로써, 사용자의 요구와 카탈로그 문서간의 개념 매칭도를 계산하는 것이 가능하다. 즉, 사용자의 질의어와 카탈로그 문서의 색인어가 일치하지 않을지라도, 개념적으로 관련성이 높은 문서를 검색하는 것이 가능하다. 또한 사용자간의 개념적 유사도를 계산함으로써, 시맨틱 기반의 협업적 필터링 추천이 가능하다.

부분 단어 토큰화 기법을 이용한 뉴스 기사 정치적 편향성 자동 분류 및 어휘 분석 (Automatic Classification and Vocabulary Analysis of Political Bias in News Articles by Using Subword Tokenization)

  • 조단비;이현영;정원섭;강승식
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제10권1호
    • /
    • pp.1-8
    • /
    • 2021
  • 뉴스 기사의 정치 분야는 보수, 진보와 같이 양극화된 편향적 특성이 존재하며 이를 정치적 편향성이라고 한다. 뉴스 기사로부터 편향성 문제를 분류하기 위해 키워드 기반의 학습 데이터를 구축하였다. 대부분의 임베딩 연구에서는 미등록어로 인한 문제를 완화시키기 위해 형태소 단위로 문장을 구성한다. 본 논문에서는 문장을 언어 모델에 의해 세부적으로 분할하는 부분 단어로 문장을 구성할 경우 미등록어 수가 감소할 것이라 예상하였다. 부분 단어 토큰화 기법을 이용한 문서 임베딩 모델을 제안하며 이를 SVM과 전방향 뉴럴 네트워크 구조에 적용하여 정치적 편향성 분류 실험을 진행하였다. 형태소 토큰화 기법을 이용한 문서 임베딩 모델과 비교 실험한 결과, 부분 단어 토큰화 기법을 이용한 문서 임베딩 모델이 78.22%로 가장 높은 정확도를 보였으며 부분 단어 토큰화를 통해 미등록어 수가 감소되는 것을 확인하였다. 분류 실험에서 가장 성능이 좋은 임베딩 모델을 이용하여 정치적 인물을 기반한 어휘를 추출하였으며 각 성향의 정치적 인물 벡터와의 평균 유사도를 통해 어휘의 편향성을 검증하였다.

콜라주 기법으로 해석한 비디오 생성 (Video-to-Video Generated by Collage Technique)

  • 조형래;박구만
    • 방송공학회논문지
    • /
    • 제26권1호
    • /
    • pp.39-60
    • /
    • 2021
  • 딥러닝 분야 중 생성과 관련된 연구는 주로 GAN 이후에 많은 알고리즘이 있는데 생성이라는 측면에서 볼 때 미술과는 다른 점이 있다. 공학적 측면에서의 생성이 주로 정량적 지표나 정답과 오답의 유무를 판단하는 것이라면 미술적 측면에서의 생성이란 다양한 관점에서 정답과 오답을 교차검증하고 의심하여 세상과 인간의 삶을 해석하는 생성을 만들어낸다. 본 논문은 딥러닝의 비디오 생성능력을 콜라주적 관점에서 해석하고 미술작가가 만든 결과물과 비교하였다. 실험의 특징은 콜라주 기법으로 만든 창작자의 결과물을 GAN이 얼마만큼 재현하는지와 창작적인 부분과의 차이점을 비교분석하는 것이고, GAN의 재현력에 대한 성능 평가항목을 만들어 그 만족도를 조사하였다. 창작자의 스테이트먼트와 표현목적을 얼마나 재현했는지에 관한 실험을 위해서는 스테이트먼트 키워드에 해당하는 딥러닝 알고리즘을 찾아 그 유사성을 비교하였으며, 실험결과 GAN은 콜라주 기법을 표현하기에는 기대에 많이 못 미쳤다. 그럼에도 불구하고 이미지 연상에서는 인간의 능력보다 높은 만족도를 보여주었는데 이것은 GAN의 추상화 생성 측면에서 인간과 비견할만한 능력을 보일 수 있다는 긍정적인 발견이라고 하겠다.

워드임베딩을 활용한 복압성 요실금 관련 연구 동향에 관한 융합 연구 (A Convergence Study of the Research Trends on Stress Urinary Incontinence using Word Embedding)

  • 김준희;안선희;곽경태;원영수;유화익
    • 한국융합학회논문지
    • /
    • 제12권8호
    • /
    • pp.1-11
    • /
    • 2021
  • 본 연구의 목적은 '복압성 요실금'을 키워드로 검색된 연구들의 경향과 특성을 단어 빈도를 통해 분석하고, 워드 임베딩을 사용하여 그 관계를 모델링 하고자 하였다. 의학 서지 데이터베이스인 MEDLINE에 등록되어 있는 복압성 요실금 연구 9,868개 논문들의 초록 문자 데이터를 Python 프로그램을 이용하여 추출하였다. 그런 다음 빈도 분석을 통해 10개의 키워드를 선택하였다. 키워드 관련 단어들의 유사도는 Word2Vec 머신러닝 알고리즘으로 분석하였다. 그리고, t-SNE 기법을 사용하여 단어의 위치와 거리가 시각화하였고, 이에 따라 그룹을 분류하여 이를 분석하였다. 복압성 요실금과 관련된 연구는 1980년대 이후 빠르게 증가했다. 키워드 분석을 통해 논문 초록에서 가장 많이 사용된 키워드는 '여성', '요도', '수술'로 나타났다. Word2Vec 모델링을 통해 복압성 요실금 관련 연구에서 주요 키워드들과 가장 높은 연관성을 나타내는 단어들에는 '여성', '절박', '증상' 등이 있었다. 그리고, t-SNE 기법을 통해 키워드와 관련 단어들은 복압성 요실금의 증상, 신체 기관의 해부학적 특성, 그리고 수술적 중재를 중심으로 하는 3개의 그룹으로 분류될 수 있었다. 본 연구는 초록을 구성하는 단어들의 키워드 빈도 분석 및 워드임베딩 방식을 이용하여 복압성 요실금 관련 연구들의 동향을 살펴본 최초의 연구이다. 본 연구의 결과는 향후 연구자들이 복압성 요실금 관련 연구 분야의 주제와 방향성을 선택하는 데 있어 기초자료로 활용될 수 있을 것이다.

셀슈머(Sell-sumer)로 진화한 인플루언서의 새로운 유형과 소셜미디어에서의 세일즈 전략 (Sell-sumer: The New Typology of Influencers and Sales Strategy in Social Media)

  • 신하진;김수림;홍만의;황봄님;양희동
    • 지식경영연구
    • /
    • 제22권4호
    • /
    • pp.217-235
    • /
    • 2021
  • 전 세계 인구의 49%가 소셜미디어 플랫폼을 사용하면서 소셜미디어 내에서의 소통과 콘텐츠 공유가 그 어느때보다 활발해지고 있다. 이러한 환경 속에서 1인미디어 시장이 빠른 속도로 성장하고 여론을 형성하면서 셀슈머(Sell-summer)라는 새로운 트렌드가 등장했다. 본 연구는 인플루언서의 상업적/비상업적 키워드의 주제 집중도와 상업적 포스팅의 비율이 매출에 미치는 영향 분석하여 제품 카테고리별 인플루언서의 새로운 유형을 정의하였다. 이는 소셜미디어 내에서 활동하는 인플루언서가 셀슈머로 변모하며 구사하는 새로운 세일즈 전략에 도움이 될 것으로 희망한다. 본 연구의 방법은 파이썬 환경에서 인플루언서의 상업적/비상업적 포스팅으로 분류하고, 이를 KoNLPy를 이용하여 텍스트 마이닝 한 후 FastText 기반 단어 간의 유사도를 계산하였다. 그 결과, 인플루언서의 상업적 포스팅의 키워드 주제 집중도가 높을수록(narrow) 매출이 높아진다는 것을 확인하였다. 또한, 군집분석을 통해 제품 카테고리별 인플루언서 유형을 4가지로 분류하고 매출에 따른 집단 간의 차이가 유의함을 확인하였다. 즉, 본 연구의 시사점은 소셜미디어에서 활동하는 인플루언서들과 이를 마케팅 도구로 활용하고자 하는 마케터들에게 소셜미디어 세일즈 전략의 실증적인 해법을 제시할 수 있을 것이다.

소셜네트워크 빅데이터를 활용한 코로나 19에 따른 프로야구 관람문화조사 (Professional Baseball Viewing Culture Survey According to Corona 19 using Social Network Big Data)

  • 김기탁
    • 한국엔터테인먼트산업학회논문지
    • /
    • 제14권6호
    • /
    • pp.139-150
    • /
    • 2020
  • 본 연구의 자료처리는 텍스톰(textom)과 소셜미디어의 단어를 중심으로 3가지 영역인 '코로나 19와 프로야구', '코로나 19와 프로야구 무관중', '코로나 19와 프로스포츠'에 대해 웹 환경에서 데이터 수집과 정제작업을 실시한 후 일괄 처리하였으며, 이를 시각화하기 위해 Ucinet6프로그램을 활용하였다. 구체적으로 웹 환경의 수집은 네이버, 다음, 구글의 채널을 활용하였고, 추출된 단어들 중 전문가회의를 통해 30개의 단어로 요약 정리하여 최종 연구에 활용하였다. 30개의 추출된 단어를 매트릭스를 통해 시각화하였으며, 단어의 유사성과 공통성의 군집을 파악하기 위해 CONCOR분석을 실시하였다. 분석결과 코로나 19와 프로야구에 관련된 군집은 1개의 중심클러스터와 5개의 주변클러스터로 구성되었고 코로나 19여파에 따른 프로야구 개막과 관련된 내용을 주로 검색하고 있는 것으로 나타났다. 코로나 19와 프로야구 무관중에 관련된 군집은 1개의 중심 클러스터와 5개의 주변클러스터로 구성되었으며, 코로나 19에 따른 프로야구 경기와 관련된 프로야구 입장의 키워드를 주로 검색하고 있는 것으로 나타났다. 코로나 19와 프로스포츠에 관련된 군집은 1개의 중심클러스터와 5개의 주변클러스터로 구성되었으며, 코로나 19의 여파에 따른 프로스포츠 시작과 관련된 키워드를 주로 검색하고 있는 것으로 나타났다. 이를 종합해보면 포스트 코로나 시대의 프로야구는 많은 변화가 있을 것이라 예상된다. 특히 응원문화는 관중들이 원하는 정도의 만족감은 없겠지만 관중들이 누릴 수 있는 직접관람의 기회를 누리기 위해 야구장에서도 코로나 19를 극복하기 위한 하나의 일상으로의 행동강령이 잘 유지되어야 할 것이다. 관람문화 또한 라이브커머스, AR/VR, O4O(Online for Offline)등의 4차 산업혁명의 기술도입으로 현장감 있는 쌍방향 소통이 가능한 인터렉티브 소통의 디지털이 구현돼야 할 것이다. 포스트 코로나 시대는 프로스포츠에도 새로운 형태의 패러다임이 구축될 것이다. 랜선 응원, SNS를 활용한 응원, 실시간 동시시청, 라이브 채팅응원, 편파중계 등 다양한 형태의 응원문화가 새로운 창작 콘텐츠 형태로 진화할 것이며, 팬들의 욕구를 충족할 수 있는 새로운 형태의 패러다임이 구축돼야 하겠다.

토픽모델링을 활용한 COVID-19 학술 연구 기반 연구 주제 분류에 관한 연구 (A study on the classification of research topics based on COVID-19 academic research using Topic modeling)

  • 유소연;임규건
    • 지능정보연구
    • /
    • 제28권1호
    • /
    • pp.155-174
    • /
    • 2022
  • 2020년 1월부터 2021년 10월 현재까지 COVID-19(치명적인 호흡기 증후군인 코로나바이러스-2)와 관련된 학술 연구가 500,000편 이상 발표되었다. COVID-19와 관련된 논문의 수가 급격하게 증가함에 따라 의료 전문가와 정책 담당자들이 중요한 연구를 신속하게 찾는 것에 시간적·기술적 제약이 따르고 있다. 따라서 본 연구에서는 LDA와 Word2vec 알고리즘을 사용하여 방대한 문헌의 텍스트 자료로부터 유용한 정보를 추출하는 방안을 제시한다. COVID-19와 관련된 논문에서 검색하고자 하는 키워드와 관련된 논문을 추출하고, 이를 대상으로 세부 주제를 파악하였다. 자료는 Kaggle에 있는 CORD-19 데이터 세트를 활용하였는데, COVID-19 전염병에 대응하기 위해 주요 연구 그룹과 백악관이 준비한 무료 학술 자료로서 매주 자료가 업데이트되고 있다. 연구 방법은 크게 두 가지로 나뉜다. 먼저, 47,110편의 학술 논문의 초록을 대상으로 LDA 토픽 모델링과 Word2vec 연관어 분석을 수행한 후, 도출된 토픽 중 'vaccine'과 관련된 논문 4,555편, 'treatment'와 관련된 논문 5,791편을 추출한다. 두 번째로 추출된 논문을 대상으로 LDA, PCA 차원 축소 후 t-SNE 기법을 사용하여 비슷한 주제를 가진 논문을 군집화하고 산점도로 시각화하였다. 전체 논문을 대상으로 찾을 수 없었던 숨겨진 주제를 키워드에 따라 문헌을 분류하여 토픽 모델링을 수행한 결과 세부 주제를 찾을 수 있었다. 본 연구의 목표는 대량의 문헌에서 키워드를 입력하여 특정 정보에 대한 문헌을 분류할 수 있는 방안을 제시하는 것이다. 본 연구의 목표는 의료 전문가와 정책 담당자들의 소중한 시간과 노력을 줄이고, 신속하게 정보를 얻을 수 있는 방법을 제안하는 것이다. 학술 논문의 초록에서 COVID-19와 관련된 토픽을 발견하고, COVID-19에 대한 새로운 연구 방향을 탐구하도록 도움을 주는 기초자료로 활용될 것으로 기대한다.