• 제목/요약/키워드: 텍스트 출현 빈도

검색결과 102건 처리시간 0.023초

영상콘텐츠분야의 정권별 의미연결망 연구 (A Study on the Semantic Network Structure of the Regime in the Image Contents)

  • 황고은;문신정
    • 한국비블리아학회지
    • /
    • 제28권3호
    • /
    • pp.217-240
    • /
    • 2017
  • 이 연구는 영상콘텐츠분야 연구의 의제설정 경향을 분석하여, 정권별 정책과 연결되는 의미화 과정을 제시했다. 이를 위해 문화산업의 도입시점인 <문민정부(1993년)>부터 <박근혜정부(2016년)>까지의 영상콘텐츠 석박사학위논문 총 2,624편의 초록에서 43,991개의 단어를 추출하고 의미연결망 분석을 실시하였다. 분석방법은 R프로그램의 다양한 패키지를 활용하였으며, 이를 통해, 텍스트 분석과 시각화를 도출하였다. 연구 결과는, 첫째, 영상콘텐츠분야 연구는 출현빈도별, 정권순서별로 '영상', '미디어', '콘텐츠'의 순위와 순서로 진화되었다. 둘째, 정권별로는 3단계 연구흐름을 볼 수 있다. <문민정부>는 '교육'과 '표현', <국민의정부>와 <참여정부>에서는 '미디어', <이명박정부>와 <박근혜정부>에서는 '콘텐츠'관련 연구들이 중심이 되었다. 셋째, 연구대상 기간 또는 정권별 기간 내내 지속적으로 꾸준하게 진행되는 연구주제는 '방송', '디지털', '기술', '제작' 등이며, 향후에도 계속 진행될 것으로 보인다. 마지막으로 각 정권마다 새롭게 등장한 연구대상이 있었다. <문민정부>는 '콤팩트디스크기억장치(CD-ROM)', <국민의정부>는 '워터마크', '고화질', '3D', '가상현실', <참여정부>는 '플랫폼', <이명박정부>는 '모바일', '애플리케이션', <박근혜정부>는 '스마트'이며, '콤팩트디스크기억장치'와 '워터마크' 등은 단기에 소멸되었다. 연구의 의제설정과 산업화 과정에서 트렌드와 미래예측이 필요하다고 보여 진다.

EAP 전문 코퍼스를 활용한 유아교육 전문 어휘 추출 (Extracting Technical Vocabulary List for Early Childhood Education Using EAP Specialized Corpus)

  • 이제영;안종기;이지은
    • 한국콘텐츠학회논문지
    • /
    • 제17권1호
    • /
    • pp.475-484
    • /
    • 2017
  • 본 연구는 EAP 전문 코퍼스 구축과 분석을 통해 유아교육 전문 어휘 목록을 개발하는 것을 목적으로 하고 있다. 이를 위해 유아교육 전문가 2인과의 협의를 통해 선정된 7권의 유아교육 관련 영어 전공 서적을 기초로 50만 단어 수준의 전문 코퍼스를 구축하였다. 유아교육 전문 코퍼스의 어휘적 분포를 분석한 결과 기본 어휘에 해당하는 GSL[1]은 81.86%, 학술어휘에 해당하는 AWL[2]은 9.78%로 타 분야의 학술적 텍스트와 유사한 분포를 나타냈다. 한편 어휘의 다양성을 살펴보기 위해 TTR을 산출한 결과 3.18로 타 코퍼스의 결과와 비교할 때 낮은 수치, 즉 동일한 어휘의 반복이 비교적 많다는 특징을 보여 주었다. 다음으로 빈도와 출현 범위 등을 기준으로 유아교육 분야의 전문 어휘를 추출한 결과 총 224개의 어휘가 선정되었다. 이 어휘 목록은 영어로 유아교육을 가르치기 위한 목적으로 활용될 수 있을 것이며, 특히 영어로 쓰인 유아 교육 분야의 전공서적을 읽기 위한 기초 자료서로 유용성을 지닐 것으로 기대된다.

분야연상어의 수집과 추출 알고리즘 (Collection and Extraction Algorithm of Field-Associated Terms)

  • 이상곤;이완권
    • 정보처리학회논문지B
    • /
    • 제10B권3호
    • /
    • pp.347-358
    • /
    • 2003
  • 인간은 문서전체를 읽지 않고 대표적인 단어를 보는 것만으로 정치나 스포츠 등의 분야를 정확히 인지할 수 있다. 문서전체를 대상으로 하지 않고 부분텍스트에서 출현하는 소수의 단어정보에서 문서의 분야를 정확히 결정하기 위해 분야연상어의 구축은 중요한 연구과제이다. 인간이 미리 분야체계를 정의하고, 각 분야에 해당하는 문서를 인터넷이나 서적을 통해 수집한다. 본 논문은 수집문서의 분야를 정확히 지시하는 분야연상어를 수집하는 방법을 제안한다. 문서의 분야결정 시점을 고려하여 분야연상어의 수준과 안정성 랭크에 대하여 논의한다. 학습데이터에서 분야연상어 후보의 각 수준을 자동으로 결정하고, 컴퓨터가 제시하는 분야연상어의 수준, 안정성 랭크, 집중률, 빈도정보를 이용하여 단일 분야연상어를 수집하는 방법을 제안한다.

지식 문서에서 도메인 온톨로지를 이용한 개념 추출 기법 (Concept Extraction Technique from Documents Using Domain Ontology)

  • 문현정;우용태
    • 정보처리학회논문지D
    • /
    • 제13D권3호
    • /
    • pp.309-316
    • /
    • 2006
  • 본 논문에서는 도메인 온톨로지를 이용하여 XML 형식의 지식 문서를 분류하고 대표 개념을 효과적으로 추출하기 위한 기법을 제시하였다. 먼저, 도메인 온톨로지는 텍스트마이닝 기법과 통계적 기법을 이용하여 생성하였다. 이를 위해 XML 문서의 구조적인 특징을 이용하여 도메인 대표용어 집합을 구성하였다. 그리고 XML 문서를 효과적으로 분류하기 위한 DScore 기법과 지식 문서로부터 개념을 추출하기 위한 TScore 기법을 제시하였다. 본 논문에서 제안한 기법의 효율성을 검증하기 위하여 295편의 컴퓨터 관련 논문을 대상으로 실험하였다. 실험 결과, 본 연구에서 제안한 도메인 대표 용어 집합을 이용한 분류 결과가 기존의 방법보다 우수한 성능을 보였다. 특히 TScore기법에서는 문서에서 출현한 용어의 빈도수는 낮더라도 문서의 개념을 대표할 수 있는 용어를 효과적으로 추출할 수 있음을 보였다. 본 연구는 개념 기반의 검색 기법을 통하여 대량의 지식 문서를 효과적으로 관리하기 위한 지식 관리 모델에 적용할 수 있다.

비정형데이터 수집을 통한 드라마 시청률 연관어 분석 (Analysis of drama viewership related words through unstructured data collection)

  • 강선경;이현창;신성윤
    • 한국정보통신학회논문지
    • /
    • 제21권8호
    • /
    • pp.1567-1574
    • /
    • 2017
  • 본 논문에서는 드라마의 시청률에 영향을 미치는 연관어 분석을 위해 정형화된 데이터와 비정형화된 데이터를 분석하는 내용이다. 정형화된 데이터 수집은 각 방송사의 드라마정보, 인물정보, 방송정보, 시청률정보라는 4가지 영역에서 총 19가지항목을 수집하였다. 비정형데이터는 각 방송사에서 드라마별로 운영되고 있는 게시판과 방영전 블로그와 방영후 블로그로부터 크롤링기법을 이용하여 수집하였다. 수집된 정형데이터로부터 각 방송사별 4가지 영역별에 따른 차이를 비교한 결과 방송사별 서로 유사한 결과 값을 보이고 있었다. 그리고 각 방송사의 드라마별 게시판과 블로그에서 수집된 비정형데이터로부터 출현빈도의 상관관계 분석을 통해 관련 연관어를 7개 도출하였다. 도출된 연관어는 신뢰성 분석을 통해 이루어졌다.

텍스트마이닝을 활용한 국내 산림생태 분야 연구동향(2001-2020) 분석 (A Study on Domestic Research Trends (2001-2020) of Forest Ecology Using Text Mining)

  • 이진규;이창배
    • 한국산림과학회지
    • /
    • 제110권3호
    • /
    • pp.308-321
    • /
    • 2021
  • 본 연구는 지난 20년(2001~2020)간 국내 산림생태 분야에 관한 전반적인 연구동향과 주요 연구 주제 분석을 통해 향후 연구의 방향성을 파악하고자 수행되었다. 이를 위해 한국교육학술정보원으로부터 국내 산림생태 관련 총 1015편의 논문 제목 및 키워드 데이터를 수집하여 빅데이터 분석프로그램 Textom과 UCINET을 활용하여 분석을 실시하였다. 분석 결과, 산림생태 관련 연구 논문수는 2006~2010년과 2011~2015년 사이에 증가율 137.6%를 나타내어 2011년 이후 급격히 증가한 것으로 나타났다. 단어빈도, N-gram 분석결과 지난 20년간 산림생태 분야의 주요 연구주제는 종다양성이었으며 2011년 이후 기후변화도 주요 연구주제로 출현하였다. CONCOR 분석결과 산림생태 분야의 주요 연구영역은 종다양성, 환경정책, 기후변화, 운영 관리, 식물분류, 서식지 적합성, 관속식물, 휴양복지로 구분되었다. 특히, 종다양성과 기후변화는 관련 정책 추진 현황을 고려할 때 향후에도 중요 연구주제로 다루어질 것이라 판단되며, 국외 사례를 참고하여 국내 실정에 맞는 연구주제의 다양화 및 범위 확대 등을 고려할 필요가 있다고 본다.

생의학 학술 문헌의 불확실성 기반 지식 동향 분석에 관한 연구 (Knowledge Trend Analysis of Uncertainty in Biomedical Scientific Literature)

  • 허고은;송민
    • 정보관리학회지
    • /
    • 제36권2호
    • /
    • pp.175-199
    • /
    • 2019
  • 불확실성이란 정보의 합의나 현존하는 지식 부족으로 인해 명제의 지식이 불완전한 상태를 의미한다. 과학적 지식의 불확실성을 연구하는 학술문헌의 양은 시간이 흐름에 따라 기하급수적으로 증가하고 있으며, 이에 따라 새로운 지식이 발견되고 연구가 발전하고 있다. 이처럼 시간의 흐름은 지식의 불확실성의 패턴을 발견하는데 중요한 요인이 될 수 있음에도 불구하고 기존의 연구들은 불확실성 단어의 단순 출현 빈도를 기반으로 특정 학문 영역에서 불확실성의 특성을 파악해왔다. 따라서, 본 연구에서는 구축한 불확실성 단어를 생의학 영역의 불확실성 연구에 적용하여 시간의 흐름에 따른 불확실성의 변화와 패턴을 파악하고자 한다. 시간의 흐름에 따른 생의학 지식의 패턴을 분석하기 위해 대표 개체 페어, 동사 유형, 대표 개체의 패턴을 살펴보았으며 선형회귀 분석을 통해 유의성 검증을 수행했다. 개체 페어 분석에서는 17건 중 7건의 개체 페어가 유의하게 감소하는 패턴을 보였다. 10개의 대표적인 동사 유형은 모두 시간이 흐름에 따라 유의하게 감소했다. 대표 개체의 연도별 상대적 중요도 분석에서는 유의하게 상승과 하강 패턴을 보이는 개체들의 불확실성 증감을 분석했다.

사회과학 분야 도서의 목차 텍스트에 대한 통계적 특성에 관한 연구 (A Study on the Statistical Characteristics for Table of Contents Text of the Books in Social Sciences Field)

  • 이용구
    • 정보관리학회지
    • /
    • 제36권2호
    • /
    • pp.255-273
    • /
    • 2019
  • 이 연구는 최근 접근 및 활용이 높아지고 있는 목차에 대해 품사 측면과 주제 측면에서 가지는 기술통계와 비교 분석을 수행하였다. 이를 위해 대학 도서관의 수서 목록에서 사회과학분야 도서를 추출하고 해당하는 도서에 대해 종합목록으로부터 DDC 분류기호를, 인터넷 서점으로부터 목차 정보를 추출하였다. 서명과 목차를 대상으로 형태소 분석하여 명사 중심의 어휘에 대해 기술통계와 빈도 분석을 실시하였다. 그 결과 형태소 측면에서 서명과 목차는 명사가 대략 절반가량 차지하며, 서명과 비교하여 목차는 50배 정도 더 많은 명사를 가지며, 목차에 출현한 명사 중에 목차만이 고유하게 가지는 비율이 95.2%에 달하는 것으로 파악되었다. 또한 목차는 사회과학 학문분야에 따라 길이가 차이가 나는 것으로 나타났다.

토픽 모델링 기반 과학적 지식의 불확실성의 흐름에 관한 연구 (The Stream of Uncertainty in Scientific Knowledge using Topic Modeling)

  • 허고은
    • 정보관리학회지
    • /
    • 제36권1호
    • /
    • pp.191-213
    • /
    • 2019
  • 과학적 지식을 얻는 과정은 연구자의 연구를 통해 이루어진다. 연구자들은 과학의 불확실성을 다루고 과학적 지식의 확실성을 구축해나간다. 즉, 과학적 지식을 얻기 위해서 불확실성은 반드시 거쳐가야 하는 필수적인 단계로 인식되고 있다. 현존하는 불확실성의 특성을 파악하는 연구는 언어학적 접근의 hedging 연구를 통해 소개되었으며 컴퓨터 언어학에서 수작업 기반으로 불확실성 단어 코퍼스를 구축해왔다. 기존의 연구들은 불확실성 단어의 단순 출현 빈도를 기반으로 특정 학문 영역의 불확실성의 특성을 파악해오는데 그쳤다. 따라서 본 연구에서는 문장 내 생의학적 주장이 중요한 역할을 하는 생의학 문헌을 대상으로 불확실성 단어 기반 과학적 지식의 패턴을 시간의 흐름에 따라 살펴보고자 한다. 이를 위해 생의학 온톨로지인 UMLS에서 제공하는 의미적 술어를 기반으로 생의학 명제를 분석하였으며, 학문 분야의 패턴을 파악하는데 용이한 DMR 토픽 모델링을 적용하여 생의학 개체의 불확실성 기반 토픽의 동향을 종합적으로 파악하였다. 시간이 흐름에 따라 과학적 지식의 표현은 불확실성이 감소하는 패턴으로 연구의 발전이 이루어지고 있음을 확인하였다.

빅카인즈를 활용한 5·18 관련 국내 기사 분석 연구 (An Analysis of Domestic Newspaper Articles on 5.18 using the Bigkinds System)

  • 박주현;박현지;김영범
    • 정보관리학회지
    • /
    • 제41권1호
    • /
    • pp.107-132
    • /
    • 2024
  • 이 연구에서는 한국언론진흥재단의 빅카인즈에서 제공하는 1990년부터 2022년까지 약 30년간의 5·18 관련 뉴스데이터를 빈도분석과 네트워크 분석하였다. 구체적으로 시기별과 지역별 기사량을 분석하여 양적 변화 추이를 살펴보았으며 동시 출현 키워드를 활용한 정부별 네트워크 분석을 통해 정부별 주요 키워드 간의 연결 구조를 탐색하였다. 분석 결과, 시기적으로는 사회적 이슈가 많았던 2019년의 보도량이 가장 많은 것으로 나타났으며 지역적으로는 전라권의 보도량이 가장 많은 것으로 나타났다. 그리고 네트워크 분석 결과, 정권이 5·18을 바라보는 인식과 정책에 따라 뉴스데이터 내 5·18과 관련된 단어에 차이가 있었다. 5·18 뉴스데이터 분석을 종합한 결과, 5·18이 지역과 상관없이 시간이 지남에 따라 민주화운동으로 자리매김해 나가고 있었으나 동시에 5·18에 대한 왜곡이 해소되지 못하고 있음을 확인하였다.