• 제목/요약/키워드: 텍스트 빈도 분석

검색결과 342건 처리시간 0.027초

혼합모드 잠재범주모형을 통한 텍스트 자료의 분석 (Latent class model for mixed variables with applications to text data)

  • 신현수;서병태
    • 응용통계연구
    • /
    • 제32권6호
    • /
    • pp.837-849
    • /
    • 2019
  • 일종의 혼합다항분포 모형이라고 볼 수 있는 잠재범주모형은 범주형 자료에서 직접 관측되지 않은 중요한 정보를 얻어낼 수 있는 유용한 도구이다. 하지만 자료에 범주형 변수 뿐 아니라 연속형 변수 혹은 빈도형 변수가 함께 포함되어 있을 경우 이 모형을 직접적으로 사용할 수 없다. 본 논문에서는 특히 범주형 변수와 빈도형 변수가 함께 포함되어 있는 경우에 잠재범주모형인 혼합모드 잠재범주모형을 사용하여 텍스트 후기와 범주형 응답문항이 모두 포함된 의약품 사용 후기자료를 분석하였다. 이 분석을 통해 범주형 응답만을 사용한 보통의 잠재범주 모형에 비해 텍스트 자료를 함께 사용한 혼합모드 잠재범주모형을 사용했을때 잠재범주에 대한 보다 자세한 정보를 얻을 수 있는 것을 확인하였다.

과학교과서 텍스트의 계량적 분석을 이용한 과학 개념어의 생산적 지식 교육 방안 탐색 (Exploring Teaching Method for Productive Knowledge of Scientific Concept Words through Science Textbook Quantitative Analysis)

  • 윤은정
    • 한국과학교육학회지
    • /
    • 제40권1호
    • /
    • pp.41-50
    • /
    • 2020
  • 과학 개념에 대한 이해를 언어학적 관점에서 바라보면 학생들이 과학 개념어에 대한 깊고 정교한 이해와 더불어 정확하게 사용할 수 있는 능력을 길러주는 것이 매우 중요하다. 본 연구에서는 지금까지 과학 교육에서 과학 개념어에 대한 생산적 지식 교육의 기틀이 잘 마련되어 있지 않음에 주목하고, 과학 개념을 구성하고 있는 단어들 사이의 관계를 생산적이고 효과적으로 교육할 수 있는 방안을 탐색함으로써 과학 개념어의 생산적 지식 교육의 기틀을 제공하고자 하였다. 이를 위해 첫째, 몇 가지의 계량 언어학적 텍스트 분석 방법을 이용하여 과학 교과서 텍스트로 부터 과학 개념을 구성하고 있는 단어들과 그들 사이의 관계를 추출하고, 둘째, 각 방법의 결과로 추출된 단어 관계의 의미를 정성적으로 살펴본 뒤, 셋째, 이를 이용하여 과학 개념어의 생산적 지식 향상에 도움을 줄 수 있는 쓰기 활동 방법을 제안해 보았다. 중학교 1학년 과학교과서 '힘과 운동' 단원 텍스트를 클러스터 분석, 공기 빈도 분석, 텍스트 네트워크 분석, 그리고 워드임베딩의 네 가지 계량 언어학적 분석 방법을 사용하여 분석해 보았다. 연구 결과 첫째, 클러스터 분석 결과를 활용하여 문장 완성하기 활동을 제안하였다. 둘째, 공기 빈도 분석 결과를 이용한 빈 칸 채우기 활동을 제안하였다. 셋째, 네트워크 분석 결과를 이용하여 소재 중심 글쓰기 활동을 제안하였다. 넷째, 워드임베딩을 이용한 학습 중요 단어 목록 작성을 제안하였다.

R을 활용한 정보교육관련 논문 분석 (Analysis of Information Education Related Theses Using R Program)

  • 박선주
    • 정보교육학회논문지
    • /
    • 제21권1호
    • /
    • pp.57-66
    • /
    • 2017
  • 최근 빅데이터 분석과 함께 사회연결망에 대한 관심이 증대되고 있다. 이러한 사회연결망분석을 이용한 연구가 사회과학 영역뿐 아니라 자연과학 영역 등 여러 분야에서 다양하게 이루어지고 있다. 이에 본 논문에서는 정보교육 관련 석 박사 학위논문을 수집하여 텍스트분석과 사회연결망분석을 실시하였다. 그 결과, 모든 기간에서 출현빈도수가 높게 나오거나 지속적으로 나오는 단어가 있었으며, 기간별로 출현빈도가 갑자기 높아진 단어들도 있었다. 또한, 출현빈도수가 큰 단어가 대체적으로 매개중심성도 컸으며, 기간별 연구흐름의 특징이 있음도 알 수 있었다. 그러므로 IT 기술발전과 초 중 고등학교 정보교육과정 변화에 민감하게 정보교육 석 박사학위 논문 주제가 변화되었음을 알 수 있었다. 앞으로 기간4에서 출현빈도가 높아진 스마트, 모바일, 스마트폰, SNS, 어플리케이션, 스토리텔링, 다문화, STEAM과 관련된 연구가 지속될 것으로 예측하며, 로봇, 프로그래밍, 코딩, 알고리즘, 창의성, 상호작용, 개인정보보호와 관련된 주제도 꾸준히 연구될 것으로 예측된다.

키워드 분석 기반 '전통' 용어의 트렌드 분석 (1920~2017) (Exploring 'Tradition' Terminology Trends based on Keyword Analysis (1920~2017))

  • 김민정;김철주
    • 한국콘텐츠학회논문지
    • /
    • 제18권12호
    • /
    • pp.421-431
    • /
    • 2018
  • 본 연구는 우리나라에서 '전통' 용어의 트렌드를 분석하기 위해 과거 신문기사를 수집하여 텍스트 마이닝 기법과 소셜네트워크분석 기법을 수행하였다. 이러한 문헌을 분석하는데 있어서 과거의 해석적 연구 방법을 사용하지 않고 비정형 텍스트 자료에 근거한 정량적 분석을 통해 '전통' 논의들이 신문기사에서는 어떻게 보도되어 왔는지를 분석해봄으로써 우리사회 '전통' 용어의 동향을 파악하였다. 분석 대상은 1920년대부터 2017년까지 미디어에 등장한 '전통' 관련 신문기사 2,481,143건을 수집하였다. 다음으로 시대별 신문기사에 대한 빈도분석을 통해 '전통' 관련 어떤 키워드들이 자주 나타나고 있는지에 대해 파악하였다. 또한 '전통' 관련 키워드들간 연관어 분석을 통해 '전통' 키워드의 연결 맥락을 파악하였다. 마지막으로 소셜네트 워크분석을 통해 키워드들간에 유기적인 관계를 분석하고 군집화하였다. 이러한 텍스트 마이닝 기법을 적용함으로써 객관적이고 가치 중립적인 입장으로 '전통' 관련 사회문화현상에 대한 의미를 포착하고 시대별 '전통'이 담고 있는 사회적 상징성을 파악할 수 있다.

R을 이용한 성경 데이터의 빈도와 소셜 네트워크 분석 (Frequency and Social Network Analysis of the Bible Data using Big Data Analytics Tools R)

  • 반재훈;하종수
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국정보통신학회 2018년도 추계학술대회
    • /
    • pp.93-96
    • /
    • 2018
  • 데이터를 저장하고 분석하여 새로운 지식을 얻을 수 있는 빅데이터 처리기술은 사회의 여러 분야에서 중요성이 강조되고 있으며 정보통신기술 분야의 핵심 이슈로 부각되면서 관련 기술에 대한 관심이 증가하고 있다. 이러한 빅데이터를 분석할 수 있는 도구인 R은 통계 기반의 정보 분석을 가능하게 하는 언어와 환경이다. 본 논문에서는 이를 이용하여 성경데이터를 분석한다. R을 이용하여 어떠한 텍스트가 분포되어 있는지를 빈도 조사를 수행하며 소셜 네트워크 분석을 통해 성경을 분석한다.

  • PDF

접속 부사의 사용에 따른 설득문과 보도문의 대응 분석 (Correspondence Analysis of Reports and Persuasives based on a Newspaper Corpus)

  • 김혜영;강범모
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2013년도 제25회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.175-180
    • /
    • 2013
  • 본 논문은 동아, 조선, 중앙, 한겨레 신문의 2000~2011년 신문 사설과 보도문에서서 나타나는 접속부사의 사용에 대한 분석이다. 구체적으로, 텍스트 구조를 드러내는 표지의 기능을 하는 접속부사에 대해 논의하고자 한다. 12년 동안 출현한 고빈도 접속부사 '그러나, 하지만, 그런데, 그리고, 따라서, 그래서, 그렇지만, 그러면, 그러므로, 하물며'를 대상으로 보도문에서의 빈도 변화와 신문 사설에서의 빈도 변화를 대응 분석과 군집 분석을 통해 객관적, 통계적, 통시적으로 분석하였다. 연구 결과, 나열의 구조에서 보도문은 '그리고'를 선호하고 신문 사설은 '하물며'를 선호하여 사용하며, 대조의 표지로서 보도문은 '하지만'을 신문 사설은 '그러나, 그렇지만'을 선호하여 사용하였다. 화제 전환을 나타낼 때 보도문은 '그러면'을 사용하는 반면 신문 사설은 '그런데'를 사용하고, 문제에 대한 결과를 제시할 때 '보도문'은 '그러므로, 그래서'를 신문 사설은 '따라서'를 더 많이 사용하는 경향이 나타났다.

  • PDF

다차원 텍스트 큐브를 이용한 호텔 리뷰 데이터의 다차원 키워드 검색 및 분석 (Multi-Dimensional Keyword Search and Analysis of Hotel Review Data Using Multi-Dimensional Text Cubes)

  • 김남수;이수안;조선화;김진호
    • 정보화연구
    • /
    • 제11권1호
    • /
    • pp.63-73
    • /
    • 2014
  • 웹의 발달로 텍스트 등으로 이루어진 비정형 데이터의 활용에 대한 관심이 높아지고 있다. 웹상에서 사용자들이 작성한 대부분의 비정형 데이터는 사용자의 주관이 담겨져 있어 이를 적절히 분석할 경우 사용자의 취향이나 주관적인 관점 등의 아주 유용한 정보를 얻을 수 있다. 이 논문에서는 이러한 비정형 텍스트 문서를 다양한 차원으로 분석하기 하는데 OLAP(온라인 분석 처리)의 다차원 데이터 큐브 기술을 활용한다. 다차원 데이터 큐브는 간단한 문자나 숫자 형태의 정형적인 데이터에 대해 다차원 분석하는데 널리 사용되었지만, 텍스트 문장으로 이루어진 비정형 데이터에 대해서는 활용되지 않았다. 이러한 텍스트 데이터베이스에 포함된 정보를 다차원으로 분석하기 위한 방법으로 텍스트 큐브 모델이 최근에 제안되었는데, 이 텍스트 큐브는 정보 검색에서 널리 사용하는 용어 빈도수(Term Frequency)와 역 인덱스(Inverted Index)를 측정값으로 이용하여 텍스트 데이터베이스에 대한 다차원 분석을 지원한다. 이 논문에서는 이러한 다차원 텍스트 큐브를 활용하여 실제 서비스되고 있는 호텔 정보 공유 사이트의 리뷰 데이터 분석에 활용하였다. 이를 위해 호텔 리뷰 데이터에 대한 다차원 텍스트 큐브를 생성하였으며, 이를 이용하여 다차원 키워드 검색 기능을 제공하여 사용자 중심의 의미있는 정보 검색이 가능한 시스템을 설계 및 구현하였다. 또한, 본 논문에서 제안하는 시스템에 대해 다양한 실험을 수행하였으며 이를 통해 제안된 시스템의 실효성을 검증하였다.

텍스트 마이닝 기법을 활용한 환경공간정보 연구 동향 분석 (Analysis of the Research Trends by Environmental Spatial-Information Using Text-Mining Technology)

  • 오관영;이명진;박보영;이정호;윤정호
    • 한국지리정보학회지
    • /
    • 제20권1호
    • /
    • pp.113-126
    • /
    • 2017
  • 본 연구의 목적은 빅데이터 분석 기법 중 하나인 텍스트 마이닝 기법을 활용하여 환경 분야의 환경공간정보 활용 연구 동향을 정량적으로 분석하는 것이다. 분석에 활용된 자료는 NDSL (National Digital Science Library)을 통하여 획득한 국내 논문으로 총 869편을 대상으로 하였다. 논문에서 추출된 단어들은 "환경일반", "기후", "대기", 등 환경 분야 10개, "위성영상", "수치지도", "재난재해" 등 환경공간정보 20개로 설정된 분류체계에 따라 재분류 되었다. 재분류된 분류 키워드를 통해, 논문에서 해당 키워드의 출현 빈도 및 시계열 변화를 파악하였으며, 상호 간 연관분석을 수행하였다. 첫째, 빈도 분석 결과 환경 분야에서는 "환경일반"(40.85%)이 환경공간정보에서는 "위성영상" (24.87%)이 가장 높은 활용 빈도를 나타냈다. 둘째, 환경 분야에 대한 시계열 분석 결과 1996년부터 2000년까지는 "기후"에 대한 연구 비중이 높았으나, 2001년부터는 "환경일반"에 대한 연구가 증가하였다. 환경공간정보에서는 "위성영상"에 대한 수요가 전 기간에 걸쳐 가장 높았으며, 활용 비율 또한 점차적으로 증가하고 있었다. 셋째, 환경 분야와 환경공간정보에 대한 연관분석 결과 총 80개의 연관 규칙이 생성되었으며, 환경 분야 중 "환경일반"이 "위성영상", "전자지도" 등 총 17개의 환경공간정보와 가장 많은 수의 연관 규칙을 생성하였다.

텍스트 마이닝을 활용한 4차 산업혁명 핵심기술 연관분석 (The Fourth Industrial Revolution Core Technology Association Analysis Using Text Mining)

  • 류재한;유연우
    • 디지털융복합연구
    • /
    • 제16권8호
    • /
    • pp.129-136
    • /
    • 2018
  • 본 연구는 기술을 이전하겠다고 KIAT의 NTB에 등록된 이전기술이 4차 산업혁명 핵심기술의 어느 분야와 관련되어 있으며, 이러한 기술의 기술이전 유형에 관해 분석하였다. 분석에 사용된 기술은 대학과 공공연구소에서 개발한 최근 3년(2015 - 2017)간의 것이다. 연구는 R프로그램을 활용해 빅데이터 텍스트 마이닝의 빈도분석, 시각화, 연관분석 등으로 진행하였다. 연구 결과는 첫째, 4차 산업혁명 핵심기술 응용분야와 관련된 이전기술은 로봇, 3D, 자율주행, 웨어러블 등과 관련한 기술이 많았고 둘째, 연도가 지날수록 사물인터넷, 클라우드, 증강현실 등과 같은 응용분야 기술의 등록이 증가하고 있으며 셋째, 응용분야 기술의 기술이전 유형의 연관규칙을 분석한 결과 사물인터넷(IoT)과 VR 기술은 기술매매 라이센싱, 자율주행 기술은 기술매매, 웨어러블 기술은 라이센싱, 로봇 관련기술은 기술협력 라이센싱 기술매매 등으로 이전하겠다고 나타났다. 이에, 기업은 4차 산업혁명 시대에 필요한 관련 기술을 이전받고자 할 경우 이의 계획적 준비가 필요하다고 하겠다.

비정형 텍스트 데이터 분석을 활용한 기록관리 분야 연구동향 (Research Trends in Record Management Using Unstructured Text Data Analysis)

  • 홍덕용;허준석
    • 한국기록관리학회지
    • /
    • 제23권4호
    • /
    • pp.73-89
    • /
    • 2023
  • 본 연구에서는 텍스트 마이닝 기법을 활용하여 국내 기록관리 연구 분야의 비정형 텍스트 데이터인 국문 초록에서 사용된 키워드 빈도를 분석하여 키워드 간 거리 분석을 통해 국내기록관리 연구 동향을 파악하는 것이 목적이다. 이를 위해 한국학술지인용색인(Korea Citation Index, KCI)의 학술지 기관통계(등재지, 등재후보지)에서 대분류(복합학), 중분류 (문헌정보학)으로 검색된 학술지(28종) 중 등재지 7종 1,157편을 추출하여 77,578개의 키워드를 시각화하였다. Word2vec를 활용한 t-SNE, Scattertext 등의 분석을 수행하였다. 분석 결과, 첫째로 1,157편의 논문에서 얻은 77,578개의 키워드를 빈도 분석한 결과, "기록관리" (889회), "분석"(888회), "아카이브"(742회), "기록물"(562회), "활용"(449회) 등의 키워드가 연구자들에 의해 주요 주제로 다뤄지고 있음을 확인하였다. 둘째로, Word2vec 분석을 통해 키워드 간의 벡터 표현을 생성하고 유사도 거리를 조사한 뒤, t-SNE와 Scattertext를 활용하여 시각화하였다. 시각화 결과에서 기록관리 연구 분야는 두 그룹으로 나누어졌는데 첫 번째 그룹(과거)에는 "아카이빙", "국가기록관리", "표준화", "공문서", "기록관리제도" 등의 키워드가 빈도가 높게 나타났으며, 두 번째 그룹(현재)에는 "공동체", "데이터", "기록정보서비스", "온라인", "디지털 아카이브" 등의 키워드가 주요한 관심을 받고 있는 것으로 나타났다.