• 제목/요약/키워드: 텍스트 마이닝

검색결과 1,184건 처리시간 0.03초

NFP-Algorithm 알고리즘을 기반한 텍스트 연관 패턴 추출 (Text Assocation Pattern Extraction using NFP-tree Algorithm)

  • 유수경;김교정
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2004년도 춘계학술발표대회
    • /
    • pp.97-100
    • /
    • 2004
  • 인터넷상에서 존재하는 많은 데이터베이스들 중 현실적으로 유용한 정보를 가지고 있는 것은 텍스트 데이타베이스이다. 텍스트 마이닝 기법에서 비구조적인 특징을 가진 텍스트 데이타로부터 유용한 정보를 분석하고 추출하여 연관된 패턴을 탐색하는 과정은 중요한 연구과제이다. 이에 본 논문은 인터넷에서 저장된 텍스트 데이터를 가지고 기존 텍스트 마이닝 기법 중 연관탐색 기법을 적용하여 사용자 중심의 연관된 패턴을 찾아서 의미있는 정보를 얻고자 한다. 탐색하기 위해 먼저 전처리 작업으로 용어의 객체를 추출하고. 추출된 각 객체들은 대용량 데이터에서 시간적, 공간적면에서 효율적인 연관탐색 기법인 NFP-Algorithm(N-most interesting k-itemsets Using FP-tree and FP-Growth)을 적용시켜서 의미있는 정보를 추출했다. 또한 Apriori계 Algorithm, FP-Algorithm, NFP-Algorithm을 비교하여 NFP-Algorithm이 시간적면에서 효율적임을 보여주었다.

  • PDF

감리결과에 텍스트마이닝 기법을 적용한 프로젝트 실패 주요요인 분석 (Project Failure Main Factors Analysis using Text Mining in Audit Evaluation)

  • 장경애;장성용;김우제
    • 정보과학회 논문지
    • /
    • 제42권4호
    • /
    • pp.468-474
    • /
    • 2015
  • 기업은 프로젝트의 중요성을 인지하고 프로젝트의 실패요인을 찾아 위험을 미연에 방지하여 프로젝트의 성공율을 높이기 위해 노력해야 한다. 이것은 급변하는 외부의 변화에 신속히 대응하기 위해 필요하다. 선행연구에서도 이러한 프로젝트의 성공요인 및 실패요인에 대한 연구가 다양하게 수행되었으나, 대부분 설문조사와 샘플링 통계분석으로 연구가 수행되어 데이터의 객관성과 정량적 분석에 한계를 갖고 있었다. 따라서 본 연구에서는 프로젝트의 실패요인 분석을 객관적인 프로젝트의 평가보고서인 감리결과보고서에서 프로젝트의 문제를 발견하고 개선권고사항을 제시하는 부분의 텍스트를 도출하여 텍스트 마이닝을 수행하였다. 텍스트 마이닝에 적용한 알고리즘은 분류 성능이 우수한 NaiveBayes, SMO, J48 알고리즘이다. 실험은 10배 교차검증을 수행하였고 정확률과 재현율로 평가하였다. 도출된 텍스트에서 프로젝트의 실패요인을 분석하여 프로젝트 수행에 활용될 수 있도록 하였다.

웹 캐스트와 연관규칙 마이닝을 이용한 축구 경기의 심층 분석 (An In-depth Analysis on Soccer Game via Webcast and Association Rule Mining)

  • 정호석;이종욱;유재학;박대희
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2011년도 한국컴퓨터종합학술대회논문집 Vol.38 No.1(C)
    • /
    • pp.17-20
    • /
    • 2011
  • 축구 비디오를 분석하고 이를 팀 전략 수립에 활용하는 축구 비디오 분석관의 역할이 강조됨에 따라, 축구 비디오에서 주요 이벤트의 탐지와 같은 절차적 기능에서 부터 고수준의 해석 방법에 이르는 다양한 기능들이 요구된다. 본 논문에서는 축구 웹 캐스트에서 실시간으로 제공하는 텍스트 정보를 기반으로 메타데이터 키워드 매칭을 통하여 축구 경기의 다양한 속성들을 추출하고 텍스트 마이닝의 대표적 해석 기법인 연관규칙 마이닝을 사용함으로써 축구 경기의 전략 수립이 가능한 고수준의 해석 방법을 소개한다. 실제 2010년 월드컵의 스페인 경기를 중계한 웹 캐스트의 텍스트 정보를 대상으로 제안된 방법론의 타당성을 검증한다.

텍스트 마이닝 기법을 이용한 학습 수요자 요구에 관한 연구 : SNS를 중심으로 (A Study on Learners' Needs Analysis Using Text Mining Techniques : Focusing on SNS)

  • 이명숙;이경미;임영규;한경임;박혜정
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2016년도 제53차 동계학술대회논문집 24권1호
    • /
    • pp.259-261
    • /
    • 2016
  • 본 연구는 교양교육에 대한 학습 수요자의 요구와 현재 편성되어 있는 교양교육 교과목들에 대한 차이를 알아본다. 학습 수요자의 다양한 생각들을 SNS를 통해 데이터를 수집하고, 텍스트 마이닝 기법을 이용하여 유용한 정보를 발견하고 시각화 분석을 통해 학습자의 요구를 제시한다. 분석 결과로는 학습자는 교수자와 상호작용 잘되는 수업 방식, 학습자가 참여할 수 있는 수업, 자기주도 학습을 선호하였다. 또한 교양교육 교과목 개설로서는 취업에 필요한 외국어, 자격증 취득이 가능한 과목, 실생활에 적용할 수 있는 실용적인 과목들을 요구하여 실제 균형에 맞게 개설된 교과목과는 차이를 보임을 알 수 있었다.

  • PDF

텍스트 마이닝을 이용한 지능적 워드클라우드 (Intelligent Wordcloud Using Text Mining)

  • 김연창;지상수;박동서;이충호
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2019년도 춘계학술대회
    • /
    • pp.325-326
    • /
    • 2019
  • 본 논문은 텍스트 마이닝 기법으로 명사의 빈도수를 조사하여 워드클라우드를 나타내는 기존의 방법을 개선하여 지능적 워드클라우드를 구현하는 방법을 제안한다. 텍스트 마이닝 시에 명사 단어를 추출하는 사전에 누락된 신조어 등의 단어를 효과적으로 추가하고, 동사 등 다른 품사위주의 워드클라우드를 시각적으로 보여주는 방법을 제안한다. 실험에서 기존 명사의 빈도수 추출에는 KoNLP 패키지를 사용하였고, 지원되지 않는 신조어 80개를 추가하였고 빈도수를 수동으로 조사하여 추가하였다.

  • PDF

텍스트마이닝 기법과 구글데이터를 이용한 질병관련 유전자 식별 (Disease related Gene Identification Using Literature and Google data)

  • 김정우;김현진;박상현
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2013년도 추계학술발표대회
    • /
    • pp.1084-1087
    • /
    • 2013
  • 텍스트마이닝은(Text mining) 바이오분야에서 사용되는 도구 중 하나이다. 본 논문에서는 전립선암(Prostate cancer)과 관련된 질병 유전자(Disease gene)를 찾기 위해 텍스트마이닝을 이용하여 유전자 네트워크(Gene-network)를 구축하였다. 추가적으로 구글(Google) 검색을 통해 네트워크 내의 유전자 노드(Node)들 사이의 간선(Edge)에 새로운 가중치(Weight)를 추가하고 네트워크를 재구성하였다. 구축된 네트워크에서 노드와 노드 사이의 가중치를 기반으로 전립선암과 관련된 질병 유전자를 추출하였다. 본 논문의 방법은 성공적으로 네트워크를 구축하고 질병 유전자를 찾았으며, 구글 데이터를 사용하지 않고 네트워크를 구축하는 경우보다 더 높은 정확성을 입증했다.

텍스트마이닝을 이용한 조선왕조실록 및 측우기기록에 나타난 주요 호우사상의 평가 (Evaluation of Major Heavy Rain Events in the Annals and Rainfall Records of the Joseon Dynasty using Text Mining)

  • 김관준;김순미;이동환;채무석;정상
    • 한국재난정보학회:학술대회논문집
    • /
    • 한국재난정보학회 2023년 정기학술대회 논문집
    • /
    • pp.198-199
    • /
    • 2023
  • 본 연구에서는 조선왕조실록을 중심으로 조선시대의 호우 및 홍수기록의 기술방법에 대해 텍스트마이닝 분석을 실시하였다. 조선왕조실록은 조선시대의 큰 호우사상은 모두 포함하고 있기 때문에 이를 일정한 등급으로 나누어 분류한다면 극치 호우 사상의 발생특성을 이해하는데 도움이 될 수 있다. 전체적으로 '큰비'에서와 같이 강우에 대한 언급만이 있는 경우가 '큰물', '홍수', '폭우'와 같이 홍수유출 및 이에 따른 피해가 설명되어 있는 경우보다 강우의 재현기간이 작게 나타나는 것을 파악할 수 있었다. 또 하나 주목할만한 점은 기록된 호우사상이 강우의 총량보다는 강우의 지속기간에 보다 민감하다는 점이다. 즉, 일시에 많은 비가 온 경우보다는 장기간에 걸쳐 내린 호우사상에 보다 초점이 맞추어져 있다는 점이다. 즉, 홍수유출의 크기 및 이에 따른 피해의 정도가 실제 이들 호우사상이 기록으로 남게 되는 원인으로 파악된다.

  • PDF

데이터마이닝과 텍스트마이닝을 활용한 영화 흥행 예측 (Box Office Hit Prediction Using Data mining and Text mining)

  • 조효정
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2021년도 춘계학술발표대회
    • /
    • pp.316-318
    • /
    • 2021
  • 영화 수익에 있어 영화의 흥행 여부는 중요한 영향을 끼친다. 영화 흥행 요인은 영화 산업의 규모가 커지면서 많은 제작사들 및 투자자들이 고려해야 하는 사항이 되었다. 따라서 영화의 흥행을 예측하기 위한 많은 모델이 연구되었다. 본 연구의 목적은 선행연구에서 흥행에 유의미한 영향을 끼친다고 밝혀진 스크린 수, 감독명, 제작사명 등의 내재적인 속성과 더불어 온라인 구전 변수를 사용하여 영화 흥행 예측 모델을 만드는 것이다. 이때 기사 수, 블로그 수와 같이 온라인 구전의 크기를 나타내는 변수들을 사용하는 대신 개봉 후 첫 주간의 관람객 리뷰를 텍스트마이닝을 이용하여 전체 리뷰 중 긍정 리뷰의 비율에 따라 점수를 매긴 후 독립변수로 사용한다. 그 후, 데이터 마이닝 기법을 활용하여 만든 모델에 앞서 언급한 독립변수를 입력 값으로 사용하여 영화의 흥행을 예측한다. 최종적으로 의사결정트리와 로지스틱회귀를 수행한 결과 영화 흥행에 영향을 주는 독립변수를 찾고 모델의 성능을 평가하였다. 로지스틱회귀의 결과 관객 수, 평점이 영화의 흥행에 특히 유의한 영향을 끼치는 변수로 선정되었고 리뷰 역시 유의한 변수로 선정되었다. 이때 만들어진 모델은 약 90%의 높은 수준의 정확도를 보여주었다. 의사결정트리의 결과 관객 수가 가장 중요한 변수로 선정되었다.

텍스트 마이닝 기법을 이용한 컴퓨터 네트워크의 침입 탐지 (Using Text Mining Techniques for Intrusion Detection Problem in Computer Network)

  • 오승준;원민관
    • 한국컴퓨터정보학회논문지
    • /
    • 제10권5호
    • /
    • pp.27-32
    • /
    • 2005
  • 최근 들어 데이터 마이닝 기법을 컴퓨터 네트워크의 침입 탐지에 적용하려는 많은 연구가 진행되고 있다. 본 논문에서는 침입 탐지 분야에서 프로그램 행위가 정상적인지 비정상적인지를 분류하기 위한 방법을 연구한다. 이를 위해, 택스트 마이닝 기법중의 하나인 k 최근접 이웃 (kNN) 분류기를 이용한 새로운 방법을 제안한다. 본 논문에서는 택스트 분류 기법을 적용하기 위해 각각의 시스템 호출을 단어로 간주하고, 시스템 호출의 집합들을 문서로 간주한다. 이러한 문서들은 kNN 분류기를 이용하여 분류된다. 간단한 예제를 통하여 제안하는 절차를 소개한다.

  • PDF

텍스트 마이닝 기법을 이용한 게임 마케팅 비디오에서의 스피치 분석 (Analysis of speech in game marketing video using text mining techniques)

  • 이여경;김재직
    • 응용통계연구
    • /
    • 제35권1호
    • /
    • pp.147-159
    • /
    • 2022
  • 오늘날 다양한 소셜 미디어 플랫폼이 널리 퍼져 있고 사람들은 그들의 일상생활 속에서 밀접하게 그러한 플랫폼들을 이용하고 있다. 이에 따라, 많은 수의 구독자, 시청, 댓글 등을 보유한 인플루언서들은 우리 사회 속에서 큰 영향력을 가지게 되었다. 이러한 추세에 따라 많은 회사들은 그들의 상품과 서비스 판매의 촉진을 위한 마케팅 목적으로 인플루언서들을 적극 활용하고 있다. 본 연구에서는 게임 마케팅을 위한 비디오에서 인플루언서들의 스피치를 추출하고 텍스트화하여 이를 텍스트 마이닝 기술을 이용하여 탐색적으로 분석한다. 분석에 있어, 성공한 마케팅 비디오와 실패한 마케팅 비디오를 구분하고 성공, 실패한 마케팅 비디오에서 인플루언서들의 언어적 특징들을 비교 분석한다.