• 제목/요약/키워드: 텍스트마이닝 분석

검색결과 986건 처리시간 0.028초

인텔리전트마이너를 이용한 텍스트마이닝 시스템의 설계 및 구현 (Design and Implementation of a Text Mining System using Intelligent Miner)

  • 최윤정;박승수
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2000년도 봄 학술발표논문집 Vol.27 No.1 (B)
    • /
    • pp.316-318
    • /
    • 2000
  • 데이터마이닝 기능은 문서의 구조화되지 않은 텍스트보다는 테이블과 일반적인 DB에 있는 구조화된 자료에 초점이 맞춰져 있다. 정보화의 과정속에서 많은 기업이나 조직들은 과거의 시스템을 DB로 구축하여 어느 정도 형태를 갖추게 되었지만, E-business, E-commerce가 활발해지면서 보유하고 있는 DB기반이 아닌 무작위의 새로운 데이터가 사용자들에 의해 생성되기도 한다. 본 논문에서는 이러한 텍스트 문서에 숨어있는 정보들을 발견하기 위한 텍스트마이닝 과정을 시나리오로 설정하고, 문서와 문서집합에 대해 분석도구를 적용하는 어플리케이션을 구현해 보았다. 대규모의 문서집합에 분석도구를 이용함으로써 빠른 문서처리가 가능하고 이는 사용자가 많은 양의 문서들을 다룰 때의 시간비용을 최소화시킬 수 있는 방법이 될 수 있다. 또한 마이닝과정을 통해 발견한 지식과 특징들을 기반으로 반구조화된 파일로 변환하여, 규칙발견, 데이터마이닝기법을 적용하여 의미있는 새로운 결론을 얻을 수 있을 것이다.

  • PDF

텍스트 마이닝을 활용한 세대별 키워드 빅데이터 분석: 네이트판 10대·20대·30대 게시판을 중심으로 (Bigdata Analysis on Keyword by Generations through Text Mining: Focused on Board of Nate Pann in 10s, 20s, 30s)

  • 정백;배성원;황보유정
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2022년도 제66차 하계학술대회논문집 30권2호
    • /
    • pp.513-516
    • /
    • 2022
  • 본 논문에서는 텍스트 마이닝 기법을 이용하여 MZ 세대를 이해하는 키워드를 도출하고자 한다. MZ 세대의 비중이 높아지면서, MZ 세대를 분석하려고 하는 많은 연구들이 수행되고 있다. 이에 본 연구에서는 MZ 세대를 이해하기 위하여 네이트 판의 연령별 게시판 크롤링을 통해 빅데이터를 수집하였다. 그리고 텍스트 마이닝 기법을 활용하여 10대, 20대, 30대의 각각의 키워드를 도출할 수 있었다. 본 논문에서 도출된 키워드는 이는 MZ 세대를 이해하는데 중요한 키워드로 볼 수 있을 것이다. 향후 연구로는 MZ 세대와 기성 세대를 비교하기 위하여 추가 크롤링을 통해 세대 간 비교 연구를 수행하고자 한다.

  • PDF

텍스트마이닝을 활용한 건설현장 재해 유형별 예방 대책 분석 (Analysis of Prevention Methods by Type of Construction Disaster Using Text Mining Techniques)

  • 조규필;이명도;신윤석;김백중
    • 한국재난정보학회 논문집
    • /
    • 제20권1호
    • /
    • pp.13-19
    • /
    • 2024
  • 연구목적: 본 연구는 텍스트 마이닝 기법을 활용하여 유형별 건설재해의 원인을 도출하여 중대재해 사고의 예방대책 마련을 위한 주요 요소를 파악하는 것을 목적으로 한다. 연구방법: 국내 건설분야의 중대재해 사례를 분석한 데이터베이스를 기반으로 예방대책과 원인을 텍스트 마이닝 기법으로 분석하고, 분석 내용을 시각적으로 표현하였다. 연구결과: 이 시각적 데이터는 중요도에 따라 공종별 중대 재해 예방에 필요한 요소의 파악을 용이하게 한다. 결론: 본 연구의 결과는 건설현장 중대재해와 관련하여 예방대책 마련 시 고려되어야 할 요소 및 요소간 명확한 상관관계의 파악에 기여할 것으로 사료된다.

사회과학을 위한 양적 텍스트 마이닝: 이주, 이민 키워드 논문 및 언론기사 분석 (Quantitative Text Mining for Social Science: Analysis of Immigrant in the Articles)

  • 이수정;최두영
    • 한국콘텐츠학회논문지
    • /
    • 제20권5호
    • /
    • pp.118-127
    • /
    • 2020
  • 본 연구는 최근 사회과학에서 실시되고 있는 양적 텍스트 분석의 흐름과 분석을 실시함에 있어 주의해야 할 사례를 포함하여 기술 하였다. 특히, 2017년부터 2019년까지 3년간 학술지와 언론에서 사용된 "이주", "이민" 키워드를 기반으로 사례연구를 실시하였다. 이를 위해 최근 사회과학분야에서 주목 받는 자연어 처리 기술(NLP)를 이용한 양적 텍스트 분석 (Quantitate text analysis)을 사용하였다. 양적 텍스트 분석은 문서를 구조적 데이터로 변환하여, 가설의 발견 및 검증을 실시하는 데이터 과학의 영역으로, 데이터의 모델링 및 가시화 등이 가능하고, 특히 비구조화 된 데이터를 구조화할 수 있다는 점에서 사회과학 분야에 많이 도입하였다. 따라서 본 연구는 양적 텍스트 분석을 통해 "이주", "이민"을 키워드로 한 연구 및 언론 기사에 대한 통계 분석을 실시하고 도출된 결론에 대한 해석을 실시하였다.

텍스트마이닝을 활용한 도로분야 ITS 정책이슈 탐색기법 정립 (Establishment of ITS Policy Issues Investigation Method in the Road Section applied Textmining)

  • 오창석;이용택;고민수
    • 한국ITS학회 논문지
    • /
    • 제15권6호
    • /
    • pp.10-23
    • /
    • 2016
  • 본 연구는 빅데이터를 활용하여 감사 시 유의해서 살펴보아야 할 ITS 관련 정책이슈 탐색방법 개발 및 적용을 목적으로 한다. 이를 위해 본 연구에서는 William Dunn이 제안한 경계분석을 이론적 토대로 하여, 여기에 감사원 감사실무 프로세스를 접목한 감사이슈 분석 틀을 제안했다. 그리고 이 분석 틀을 전산으로 구현하기 위해 메타문제를 추정하는 개념이 경계분석과 유사한 텍스트마이닝 기법을 응용했다. 텍스트마이닝의 구체적 모형은 David Blei가 제안한 Latent Dirichlet Allocation(LDA) 모형을 기반으로 하는 비대칭-대칭 혼합 어휘소 기반 LDA를 응용했다. 사례분석 결과, 경찰청에서 운영하는 도시교통정보시스템의 교통정보 수집률 저조와 국토교통부의 첨단교통관리시스템과의 중복 문제, 디지털 운행기록계의 주행거리 조작 등이 주요 이슈로 도출됐다.

텍스트 마이닝을 이용한 암반공학분야 SCI논문의 주제어 분석 (Keyword Analysis of Two SCI Journals on Rock Engineering by using Text Mining)

  • 정용복;박의섭
    • 터널과지하공간
    • /
    • 제25권4호
    • /
    • pp.303-319
    • /
    • 2015
  • 텍스트 형태의 자료에서 유용한 정보를 추출하는 텍스트 마이닝 기법은 데이터 마이닝의 한 분야이다. 본 연구에서는 암반공학 분야의 대표적인 국제 학술지인 IJRMMS과 RMRE에 2001년 이후 게재된 논문의 제목과 주요어를 대상으로 텍스트 마이닝 기법을 적용하여 주요 연구 동향과 시계열 트렌드, 연구 분야 상관관계 등을 파악하였으며 이를 이해하기 쉽도록 가시화하였다. 분석 결과 주요 연구 분야는 두 학술지 모두 유사하였으나 연관관계 분석 결과 IJRMMS의 경우 'rock'을 기반으로 1개의 큰 그룹과 소규모 그룹이 형성된 반면 RMRE는 중규모의 그룹이 형성되고 이 그룹 간에 연결이 형성되는 구조가 나타났다. 또한 시계열 자료로 변환하여 군집 분석과 각 주제어의 기울기 자료로 분석한 결과 일부 하강 주제어들이 있었으나 양적인 측면에서 차이가 있을 뿐 대부분 논문 수가 증가하는 것으로 나타났다.

텍스트 네트워크 분석을 이용한 보험 이미지 분석 (Analyzing insurance image using text network analysis)

  • 박경보;고해리;홍종의
    • 예술인문사회 융합 멀티미디어 논문지
    • /
    • 제8권3호
    • /
    • pp.531-541
    • /
    • 2018
  • 본 연구는 소비자들의 농협보험에 대한 이미지 이미지를 분석하기 위해 텍스트 마이닝과 텍스트 네트워크 분석을 실시하였다. 최근 소셜미디어의 발달로 많은 텍스트가 생산 및 재생산되고 있으며, 텍스트는 기업에게 중요한 정보들을 제공한다. 이러한 정보의 의미를 도출하기 위해, 텍스트 마이닝과 텍스트 네트워크 분석을 많은 연구에서 실시하고 있다. 텍스트 분석결과, 농협보험의 긍정적 이미지는 주로 안전과 안정으로 나타났다. 농협보험의 부정적 이미지로는 우려와 불안으로 나타났다. 텍스트 네트워크 분석을 통해 도출한 농협보험의 이미지는 안전과 우려를 중심으로 형성되었다. 텍스트 네트워크 분석을 통해 도출된 결과를 인터뷰를 통해 확인하였다. 인터뷰 결과, 농협은 자산규모 등을 통해 안정적인 재무와 보험금 지급은 안전함이 긍정적 이미지의 주요한 요인이었다. 부정적 이미지로는 최근의 정보유출 사태로 인해 소비자들의 개인정보유출에 대한 우려가 큰 것으로 나타났다. 본 연구에서 분석을 통해 타 상품의 이미지 분석도 사용가능할 것이다.

텍스트 마이닝과 오피니언 마이닝 분석을 활용한 국내외 스포츠용품 브랜드 비교·분석 연구 (Comparison and Analysis of Domestic and Foreign Sports Brands Using Text Mining and Opinion Mining Analysis)

  • 김재환;이재문
    • 한국콘텐츠학회논문지
    • /
    • 제18권6호
    • /
    • pp.217-234
    • /
    • 2018
  • 본 연구는 국내외 스포츠용품 브랜드에 대한 빅데이터 분석을 실시하였다. 이를 위해 소셜 매트릭스 프로그램인 텍스톰과 패션데이터 분석 플랫폼인 MISP를 통해 텍스트 마이닝, TF-IDF, 오피니언 마이닝, 관심도 그래프를 실시하였으며, 스포츠브랜드에 대한 최근 인식을 살펴보기 위해 2017년 1월 1일부터 2017년 12월 31일까지 1년간을 연구대상 기간으로 한정하였다. 분석 결과, 첫째, 각 브랜드를 대표하는 상품을 확인할 수 있었다. 둘째, 각 브랜드를 대표하는 마케팅을 확인할 수 있었다. 셋째, 각 브랜드에서 공통적으로 추출된 단어를 확인할 수 있었다. 넷째, 각 브랜드의 긍정 및 부정에 대한 감정을 확인할 수 있었다.

텍스트마이닝을 활용한 웹사이트 FAQ 개선방안: S대학교 사례를 중심으로 (Improvement Plan of Web Site FAQ using Text Mining : Focused on the S University Case)

  • 안수현;조정현;이상준
    • 한국콘텐츠학회:학술대회논문집
    • /
    • 한국콘텐츠학회 2018년도 춘계 종합학술대회 논문집
    • /
    • pp.361-362
    • /
    • 2018
  • 본 연구는 대학 웹페이지의 Q&A(질의응답) 게시판에 게재된 비정형화 된 데이터를 수집한 후 텍스트마이닝과 네트워크 분석을 활용하여 자주 등장하는 키워드 간 연관 패턴을 파악하고자 한다. 분석결과를 바탕으로 FAQ(자주하는 질문) 게시판을 구성한다면 반복적인 질문에 대한 민원을 간소화함으로써 수요자의 편의성과 행정의 효율성 향상에 기여하고 나아가 원활한 양방향 소통이 가능할 것으로 기대한다.

  • PDF

특허 키워드 시계열 분석을 통한 부상 기술 예측 (Time Series Analysis of Patent Keywords for Forecasting Emerging Technology)

  • 김종찬;이준혁;김갑조;박상성;장동식
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제3권9호
    • /
    • pp.355-360
    • /
    • 2014
  • 오늘날 국가와 기업의 연구 개발 투자 및 경영 정책 전략 수립에서 미래 부상 기술 예측은 매우 중요한 역할을 한다. 기술 예측을 위한 다양한 방법들이 사용되고 있으며 특허를 이용한 기술 예측 또한 활발히 진행되고 있다. 특허를 이용한 기술 예측에는 전문가들의 평가와 견해를 통한 정성적인 방법이 주로 사용되어 왔다. 정성적인 방법은 분석 결과의 객관성을 보장하지 못하고 분석에 많은 비용 및 시간이 요구된다. 이런 문제점을 보완하기 위해 최근에는 텍스트 마이닝을 이용한 특허 데이터의 정량적인 분석이 이루어지고 있다. 텍스트 마이닝 기법을 적용함으로써 특허 문서의 통계적 분석이 가능하다. 본 논문에서는 텍스트 마이닝과 ARIMA 분석을 이용한 기술 예측 방법을 제안한다.