• 제목/요약/키워드: 텍스트 출현 빈도

검색결과 102건 처리시간 0.023초

단어 구름과 동적 그래픽스 기법을 이용한 영어성경 텍스트 시각화 (English Bible Text Visualization Using Word Clouds and Dynamic Graphics Technology)

  • 장대흥
    • 응용통계연구
    • /
    • 제27권3호
    • /
    • pp.373-386
    • /
    • 2014
  • 단어 구름은 문자 텍스트 상의 복수개의 단어들을 대상으로 그 단어들의 출현 빈도에 비례하는 글자의 크기나 글자의 색깔로 중요도를 나타내는 텍스트 시각화 방법이다. 이 그림은 텍스트 상의 핵심단어를 재빨리 인지하고 단어들의 상대적 출현빈도수에 맞추어 배열하는 데 유용하다. 동적 그래픽스를 이용하여 텍스트 장들의 변화에 따른 핵심단어와 단어출현빈도의 패턴의 변하는 모습을 살필 수 있다. 행들이 텍스트 상의 장들이고 열들이 텍스트에 출현하는 단어들의 출현빈도수 순위들인 단어출현빈도행렬을 정의할 수 있고 이 행렬을 이용하여 단어출현빈도행렬그림을 그릴 수 있다. 동적 그래픽스를 이용하여 출현빈도수 순위의 변화에 따른 단어출현빈도행렬의 패턴의 변하는 모습을 살필 수 있다. 우리는 단어 구름과 동적 그래픽스 기법을 사용하여 영어성경 텍스트 시각화를 수행할 수 있다.

빈도 분석을 이용한 HTML 텍스트 추출 (HTML Text Extraction Using Frequency Analysis)

  • 김진환;김은경
    • 한국정보통신학회논문지
    • /
    • 제25권9호
    • /
    • pp.1135-1143
    • /
    • 2021
  • 최근 빅데이터 분석을 위해 웹 크롤러를 이용한 텍스트 수집이 빈번하게 이루어지고 있다. 하지만 수많은 태그와 텍스트로 복잡하게 구성된 웹 페이지에서 필요한 텍스트만을 수집하기 위해서는 웹 크롤러에 빅데이터 분석에 필요한 본문이 포함된 HTML태그와 스타일 속성을 명시해야 하는 번거로움이 있다. 본 논문에서는 HTML태그와 스타일 속성을 명시하지 않고 웹 페이지에서 출현하는 텍스트의 빈도를 이용하여 본문을 추출하는 방법을 제안하였다. 제안한 방법에서는 수집된 모든 웹 페이지의 DOM 트리에서 텍스트를 추출하여 텍스트의 출현 빈도를 분석한 후, 출현 빈도가 높은 텍스트를 제외시킴으로써 본문을 추출하였으며, 본 연구에서 제안한 방법과 기존 방법의 정확도 비교를 통해서 본 연구에서 제안한 방법의 우수성을 검증하였다.

태그 경로 및 텍스트 출현 빈도를 이용한 HTML 본문 추출 (HTML Text Extraction Using Tag Path and Text Appearance Frequency)

  • 김진환;김은경
    • 한국정보통신학회논문지
    • /
    • 제25권12호
    • /
    • pp.1709-1715
    • /
    • 2021
  • 웹 페이지에서 필요한 텍스트를 정확하게 추출하기 위해 본문이 존재하는 곳의 태그와 스타일 속성을 웹 크롤러에 명시하는 방법은 웹 페이지 구성이 변경될 때마다 본문을 추출하는 로직을 수정해야 하는 문제가 있다. 이러한 문제점을 해결하기 위해 이전 연구에서 제안한 텍스트의 출현 빈도를 분석하여 본문을 추출하는 방법은 웹 페이지의 수집 채널에 따라 성능 편차가 크다는 한계점이 있었다. 따라서 본 논문에서는 텍스트의 출현 빈도뿐만 아니라 웹 페이지의 DOM 트리로부터 추출된 텍스트 노드의 부모 태그 경로를 분석하여 다양한 수집 채널에서 높은 정확도로 본문을 추출하는 방법을 제안하였다.

빅데이터와 텍스트마이닝을 이용한 부동산시장 동향분석 (Analysis of Real Estate Market Trend Using Text Mining and Big Data)

  • 전해정
    • 디지털융복합연구
    • /
    • 제17권4호
    • /
    • pp.49-55
    • /
    • 2019
  • 본 연구는 빅데이터 분석방법인 텍스트마이닝을 이용한 부동산시장 동향분석에 관한 연구로 자료는 2016년 8월부터 2017년 8월까지의 포털사이트인 네이버에 게시된 인터넷 뉴스를 통해 수집하였다. TF-IDF 분석결과, 주택, 분양, 가구, 시장, 지역 순으로 빈도가 높게 나타났고 대출, 정부, 대책, 규제 등 정책과 관련된 단어들도 많이 추출되었으며 지역관련 단어는 서울의 출현빈도가 가장 많은 것으로 나타났다. 지역과 관련된 단어 조합은 '서울-강남', '서울-수도권', '강남-재건축', '서울-재건축'의 출현빈도가 많은 것으로 나타나 강남지역 재건축에 대한 사람들의 관심과 기대가 높은 것을 알 수 있다.

DNA 서열의 위치 정보를 이용한 효율적인 유사성 검색 알고리즘 (An Efficient Algorithm for Similarity Search using Positional Information of DNA Sequences)

  • 정인선;박경욱;임형석
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2005년도 가을 학술발표논문집 Vol.32 No.2 (1)
    • /
    • pp.970-972
    • /
    • 2005
  • 유전자 데이터베이스의 서열의 길이가 수백만에서 수백억 정도의 대용량 텍스트이기 때문에 기존의 Smith-waterman 알고리즘으로 정확한 서열의 유사성을 검색하는 것은 매우 비효율적이다. 따라서 빠른 유사성 검색을 위해 데이터베이스에 저장된 문자열에 대해 특정 길이의 모든 부분문자열에 나타나는 문자의 출현 빈도를 이용한 휴리스틱 방법들이 제안되었다. 이러한 방법들은 질의 서열과 일치될 가능성이 높은 후보들만을 추출한 후 이들 각각에 대하여 질의 서열과의 일치 여부를 조사하므로 빠르게 유사성 검색을 할 수 있다. 그러나 이 방법은 문자의 출현 빈도만을 사용하므로 서로 다른 서열을 같은 서열로 취급하는 단점이 있어 정확도가 Smith-Waterman 알고리즘에 비해 떨어진다. 본 논문에서는 문자가 부분문자열에 나타나는 위치 정보를 포함하여 문자의 출현빈도를 인덱싱함으로써 질의 처리를 효율적으로 수행하는 알고리즘을 제안한다. 실험결과 제안된 알고리즘은 문자 빈도만을 사용하는 알고리즘에 비해 $5\~15\%$정도 정확성이 향상되었다.

  • PDF

언어 네트워크 분석 방법을 활용한 학술논문의 내용분석 (A Content Analysis of Journal Articles Using the Language Network Analysis Methods)

  • 이수상
    • 정보관리학회지
    • /
    • 제31권4호
    • /
    • pp.49-68
    • /
    • 2014
  • 본 연구의 목적은 국내 학술논문 데이터베이스에서 검색한 언어 네트워크 분석 관련 53편의 국내 학술논문들을 대상으로 하는 내용분석을 통해, 언어 네트워크 분석 방법의 기초적인 체계를 파악하기 위한 것이다. 내용분석의 범주는 분석대상의 언어 텍스트 유형, 키워드 선정 방법, 동시출현관계의 파악 방법, 네트워크의 구성 방법, 네트워크 분석도구와 분석지표의 유형이다. 분석결과로 나타난 주요 특성은 다음과 같다. 첫째, 학술논문과 인터뷰 자료를 분석대상의 언어 텍스트로 많이 사용하고 있다. 둘째, 키워드는 주로 텍스트의 본문에서 추출한 단어의 출현빈도를 사용하여 선정하고 있다. 셋째, 키워드 간 관계의 파악은 거의 동시출현빈도를 사용하고 있다. 넷째, 언어 네트워크는 단수의 네트워크보다 복수의 네트워크를 구성하고 있다. 다섯째, 네트워크 분석을 위해 NetMiner, UCINET/NetDraw, NodeXL, Pajek 등을 사용하고 있다. 여섯째, 밀도, 중심성, 하위 네트워크 등 다양한 분석지표들을 사용하고 있다. 이러한 특성들은 언어 네트워크 분석 방법의 기초적인 체계를 구성하는 데 활용할 수 있을 것이다.

R을 활용한 정보교육관련 논문 분석 (Analysis of Information Education Related Theses Using R Program)

  • 박선주
    • 정보교육학회논문지
    • /
    • 제21권1호
    • /
    • pp.57-66
    • /
    • 2017
  • 최근 빅데이터 분석과 함께 사회연결망에 대한 관심이 증대되고 있다. 이러한 사회연결망분석을 이용한 연구가 사회과학 영역뿐 아니라 자연과학 영역 등 여러 분야에서 다양하게 이루어지고 있다. 이에 본 논문에서는 정보교육 관련 석 박사 학위논문을 수집하여 텍스트분석과 사회연결망분석을 실시하였다. 그 결과, 모든 기간에서 출현빈도수가 높게 나오거나 지속적으로 나오는 단어가 있었으며, 기간별로 출현빈도가 갑자기 높아진 단어들도 있었다. 또한, 출현빈도수가 큰 단어가 대체적으로 매개중심성도 컸으며, 기간별 연구흐름의 특징이 있음도 알 수 있었다. 그러므로 IT 기술발전과 초 중 고등학교 정보교육과정 변화에 민감하게 정보교육 석 박사학위 논문 주제가 변화되었음을 알 수 있었다. 앞으로 기간4에서 출현빈도가 높아진 스마트, 모바일, 스마트폰, SNS, 어플리케이션, 스토리텔링, 다문화, STEAM과 관련된 연구가 지속될 것으로 예측하며, 로봇, 프로그래밍, 코딩, 알고리즘, 창의성, 상호작용, 개인정보보호와 관련된 주제도 꾸준히 연구될 것으로 예측된다.

자동색인을 위한 학습기반 주요 단어(핵심어) 추출에 관한 연구 (Learning-based Automatic Keyphrase Indexing from Korean Scientific LIS Articles)

  • 김혜진;정유경
    • 한국정보관리학회:학술대회논문집
    • /
    • 한국정보관리학회 2017년도 제24회 학술대회 논문집
    • /
    • pp.15-18
    • /
    • 2017
  • 학술 데이터베이스를 통해 방대한 양의 텍스트 데이터에 대한 접근이 가능해지면서, 많은 데이터로부터 중요한 정보를 자동으로 추출하는 것에 대한 필요성 또한 증가하였다. 특히, 텍스트 데이터로부터 중요한 단어나 단어구를 선별하여 자동으로 추출하는 기법은 자료의 효과적인 관리와 정보검색 등 다양한 응용분야에 적용될 수 있는 핵심적인 기술임에도, 한글 텍스트를 대상으로 한 연구는 많이 이루어지지 않고 있다. 기존의 한글 텍스트를 대상으로 한 핵심어 또는 핵심어구 추출 연구들은 단어의 빈도나 동시출현 빈도, 이를 변형한 단어 가중치 등에 근거하여 핵심어(구)를 식별하는 수준에 그쳐있다. 이에 본 연구는 한글 학술논문의 초록으로부터 추출한 다양한 자질 요소들을 학습하여 핵심어(구)를 추출하는 모델을 제안하였고 그 성능을 평가하였다.

  • PDF

텍스트마이닝기법을 활용한 남녀 학생의 인구문제에 관한 인식 분석: 인구교육의 시사점 도출을 위하여 (A Study on the Recognition of Population Problems of Male and Female Students using Text-mining: To Drive the Implications of Population Education)

  • 왕석순;심준영
    • 한국가정과교육학회지
    • /
    • 제31권3호
    • /
    • pp.73-90
    • /
    • 2019
  • 이 연구는 인구 문제에 대한 남녀 학생들의 인식의 차이를 규명하여 인구교육의 시사점을 도출하기 위한 것을 목적으로 하였다. 이를 위해 J 대학교의 인구교육 강좌인 「인구와 사회」수업을 수강한 학생이 개인별로 최종 제출한 보고서를 분석 자료로 활용하였다. 분석 자료는 텍스트 마이닝 기법을 활용하여 성별에 따라 인구 문제에 대한 인식에 차이가 있는 가를 분석하였다. 우선, 출현 빈도가 높은 단어를 중심으로 성별에 따른 차이를 확인하고, 핵심단어를 추출하여 의미연결망 분석을 하고 시각화를 실시하였다. 분석 결과는 다음과 같다. 첫째, 상위 출현 빈도 단어 100개를 기준으로 살펴본 결과, 10위까지의 단어는 '인구', '교육', '문제', '결혼', '사회', '출산', '심각', '사람', '우리' 등으로 남녀가 동일하였다. 또 출현 빈도, 연관분석에 따라 핵심단어를 추출한 후, 의미 연결망을 시각화한 결과, 출현 빈도를 기준으로 한 경우, 의미 연결망 중앙에 위치하는 단어에 남녀 차이가 없었다. 둘째, 연관분석에 따라 추출된 핵심 단어와 바이그램 단위로 추출한 핵심 단어는 성별에 따라 큰 차이를 보였다. 즉, 여학생의 단어의 의미 연결망에서 '생활'-'결혼'-'출산'-'임신'의 연결망이 독립적으로 나타나서, 인구 문제에 대해 분리된 객관적 연결망을 보이는 남학생과 구별되었다. 따라서 남학생과 여학생은 인구 문제에 대해 다른 인식 구조를 갖는 이질적인 집단으로 봐야 하고, 인구 교육에 있어 내용과 방법을 성별에 따라 다르게 접근해야 할 것이라는 시사점을 도출하였다.

Analysis of Keywords and Language Networks of Pedagogical Problems in the Secondary-School Teacher's Employment Exam : Focusing on the 2019~2022 School Year Exam

  • Kwon, Choong-Hoon
    • 한국컴퓨터정보학회논문지
    • /
    • 제27권7호
    • /
    • pp.115-124
    • /
    • 2022
  • 본 연구의 목적은 2019~2022학년도 중등교사 임용시험 교육학문제의 연도별 핵심어와 그 경향, 핵심어들의 언어네트워크를 분석하여 그 결과를 제시하는 것이다. 주요 연구방법론은 텍스트 마이닝 기법과 언어네트워크 분석방법이었으며, 분석프로그램으로는 KrKwic, Wordcloud Maker, Ucinet6, NetDraw 등이었다. 연구결과는 다음과 같다. 첫째, 연도별 교육학문제의 상위출현빈도 핵심어는 교사, 학생, 교육과정, 수업, 평가 등의 기존 상위출현빈도 핵심어들이었으며, 최근 코로나 19 상황의 온라인수업 진행을 반영한 핵심어(온라인, 위키, 토의식, 정보 등)들도 추가로 등장하는 경향을 보였다. 4개년도 통합 텍스트에서의 상위출현빈도 핵심어는 학생(44), 교사(39), 수업(27), 학교(18), 교육과정(16), 온라인(10), 토의식(8) 등이었다. 둘째, 4개년도 상위출현빈도 핵심어들의 전체 언어네트워크는 상당한 수준의 밀도(0.566), 총연결수(492), 평균연결정도(16.4)로 분석되었다. 연결정도 중심성은 교사(199.0), 수업(197.0), 학생(185.0), 학교(150.0) 순으로 나타났으며, 매개 중심성은 교사(30.859), 수업(18.956), 학생(16.054), 학교(15.745) 순으로 나타났다. 본 연구결과는 중등교사 임용시험 수험생인 예비교사, 해당 시험 출제 관리하는 기관과 관련자, 중등학교 예비교사 양성기관의 교수자와 행정가들에게 고려해볼 만한 자료가 되길 기대한다.