• 제목/요약/키워드: 텍스트 출현 빈도

검색결과 102건 처리시간 0.024초

텍스트 마이닝을 이용한 리빙랩 연구동향 분석 (Research Trend Analysis on Living Lab Using Text Mining)

  • 김성묵;김영준
    • 디지털융복합연구
    • /
    • 제18권8호
    • /
    • pp.37-48
    • /
    • 2020
  • 본 연구는 텍스트 마이닝을 활용하여 리빙랩 연구의 동향을 파악하고 연구 방향 정립에 필요한 함의를 도출하고자 하였다. 리빙랩 관련 연구가 발표되기 시작한 2011년부터 2019년 11월까지의 논문 166편의 키워드와 초록을 대상으로 네트워크 분석 및 토픽 모델링 기법을 사용하여 분석하였다. 키워드 중 혁신, 지역, 사회, 기술, 스마트시티 등의 출현빈도가 높았고, 중심도 분석결과 현재까지 리빙랩 연구가 혁신, 사회, 기술, 개발, 사용자 등의 키워드를 중심으로 이루어짐을 파악하였다. 토픽 모델링 결과 지역혁신과 사용자지원, 정부 사회정책사업, 스마트시티 플랫폼구축, 기업기술혁신모델 및 시스템전환 참여 등 5개 토픽을 추출하였으며 토픽을 이어주는 키워드는 혁신, 기술, 사용자, 참여인것으로 분석하였다. 2017년 KNoLL 출범 후 토픽별 비중은 고른 분포로 연구 주제가 다양화됨을 확인하였다. 텍스트마이닝을 이용한 리빙랩 연구동향 분석과 방향 제시는 연구와 정책방향 수립에 유용한 자료를 제공할 수 있다.

동시링크를 이용한 웹 문서 클러스터링 실험 (Clustering of Web Document Exploiting with the Co-link in Hypertext)

  • 김영기;이원희;권혁철
    • 한국도서관정보학회지
    • /
    • 제34권2호
    • /
    • pp.233-253
    • /
    • 2003
  • 인간은 지식의 조직을 통해 세계를 이해한다. 정보검색분야에서 연구되고 있는 정보의 조직화에는 분류와 클러스터링이라는 두 가지 유형이 있다. 분류는 미리 정의된 범주에 각 항목을 배정하는 행위인 반면, 클러스터링은 유사하거나 관련된 항목을 집단화함으로써 정보를 조직한다. 인터넷 정보자원의 조직은 웹 문서에 출현하는 단어들에서 키워드를 추출하여 역파일을 작성함으로써 검색에 활용하는 것이 일반적인 방법이다. 그러나 키워드의 출현 위치나 단어빈도를 통한 문서유사도 기법은 사용된 언어가 다르거나 대부분이 앵커텍스트만으로 구성되어 있는 대문페이지처럼 적용하기 어려운 경우가 많다. 이 연구는 계량정보학적 분석 기법 중에서 동시인용 기법을 웹 문서의 하이퍼링크에 적용하여, 웹 문서의 클러스터링 가능성을 실험한다.

  • PDF

Development of big data based Skin Care Information System SCIS for skin condition diagnosis and management

  • Kim, Hyung-Hoon;Cho, Jeong-Ran
    • 한국컴퓨터정보학회논문지
    • /
    • 제27권3호
    • /
    • pp.137-147
    • /
    • 2022
  • 피부상태의 진단과 관리는 뷰티산업종사자와 화장품산업종사자에게 그 역할을 수행함에 있어서 매우 기초적이며 중요한 기능이다. 정확한 피부상태 진단과 관리를 위해서는 고객의 피부상태와 요구사항을 잘 파악하는 것이 필요하다. 본 논문에서는 피부상태 진단 및 관리를 위해 소셜미디어의 빅데이터를 사용하여 피부상태 진단 및 관리를 지원하는 빅데이터기반 피부관리정보시스템 SCIS를 개발하였다. 개발된 시스템을 사용하여 텍스트 정보 중심의 피부상태 진단과 관리를 위한 핵심 정보를 분석하고 추출할 수 있다. 본 논문에서 개발된 피부관리정보시스템 SCIS는 빅데이터 수집단계, 텍스트전처리단계, 이미지전처리단계, 텍스트단어분석단계로 구성되어 있다. SCIS는 피부진단 및 관리에 필요한 빅데이터를 수집하고, 텍스트 정보를 대상으로 핵심단어의 단순빈도분석, 상대빈도분석, 동시출현분석, 상관성분석을 통해 핵심단어 및 주제를 추출하였다. 또한 추출된 핵심단어 및 정보를 분석하고 산포도, NetworkX, t-SNE 및 클러스터링 등의 다양한 시각화 처리를 함으로써 피부상태 진단 및 관리에 있어 이를 효율적으로 사용할 수 있도록 하였다.

소설 등장인물의 텍스트 거리를 이용한 사회 구성망 분석 (Analysis of Social Network According to The Distance of Characters Statements)

  • 박경미;김성환;조환규
    • 한국콘텐츠학회논문지
    • /
    • 제13권4호
    • /
    • pp.427-439
    • /
    • 2013
  • 복잡계 과학의 발달에 따라 많은 사회 네트워크들이 분석되고 있다. 사회 네트워크는 현재 인문, 경제, 웹 사이언스 등 다양한 분야에 응용되고 있다. 최근, 소설의 등장인물을 이용한 네트워크와 실제 사회 네트워크의 특성을 비교하는 다양한 연구가 진행되고 있다. 그러나 기존의 등장인물 네트워크는 대부분 미리 정리된 인명사전을 이용하므로 주요한 몇몇 인물들 사이의 연관성은 밝힐 수 있으나, 한번 이상 등장한 모든 인물의 전체적인 사회적 구조는 설명하지 못하고 있다. 본 연구에서는 소설로부터 등장인물을 직접 추출하고, 등장인물 사이의 거리를 사용하여 상관관계를 설정하여 네트워크를 구축한다. 제안방법은 소설 텍스트로부터 등장인물의 출현빈도와 등장인물들 사이의 연관성의 발생 빈도를 이용하여 연관성 가중치를 구할 수 있으며, 이 연관성 가중치를 사용하여 노드의 수를 조절하여 K-critical 네트워크를 구성한다. 제시한 K-critical 네트워크는 분석대상 소설에 등장하는 인물들끼리 얼마나 긴밀하게 연관되어 있는지를 정량적으로 파악하는 매우 중요한 정보를 줄 수 있음을 실험을 통하여 제시할 수 있었다.

사회연결망 분석을 활용한 개인정보 유출 프레임 변화에 관한 연구: 1984년-2014년을 중심으로 (A study on frame transition of personal information leakage, 1984-2014: social network analysis approach)

  • 정서화;조현석
    • 디지털융복합연구
    • /
    • 제12권5호
    • /
    • pp.57-68
    • /
    • 2014
  • 이 글은 한국에서 시기별 개인정보 유출에 대한 프레임이 어떤 형태로 변화하는지에 초점을 맞추고 있다. 이를 위하여 개인정보 유출이라는 텍스트가 등장하기 시작한 1984년도부터 현재까지 30년 간 걸쳐 보도된 신문기사의 제목을 수집하였다. 시기마다 형성되어 있는 지배적인 프레임을 도출하기 위하여 단순 빈도분석과 공동출현빈도 매트릭스 기반의 텍스트 네트워크 분석, 군집분석을 실시하였다. 사회연결망분석의 주요 지표인 연결중심성의 개념을 적용하여 시기별 주된 프레임을 밝혀내었다. 총 4시기에 걸쳐 프레임의 태동, 형성, 확장, 전환의 과정이 일어났는데, 개인정보에 대한 접근 및 보유주체가 주로 정부였다면 점차 전자상거래 등 고객맞춤형 서비스로 인해 민간 기업으로 확대되었다. 또한 초국가기업의 등장은 개인정보 유출의 경계를 자연스럽게 국내에서 국외로 확장시켰다. 빅데이터 시대의 엄청난 정보량과 데이터 생태계의 역동성은 새로운 정보보안위협으로 다가오고 있어 강력한 정보보호체계 설계가 시급함을 프레임의 전환을 통하여 보여주고 있다.

WCTT: HTML 문서 정형화 기반 웹 크롤링 시스템 (WCTT: Web Crawling System based on HTML Document Formalization)

  • 김진환;김은경
    • 한국정보통신학회논문지
    • /
    • 제26권4호
    • /
    • pp.495-502
    • /
    • 2022
  • 오늘날 웹상의 본문 수집에 주로 이용되는 웹 크롤러는 연구자가 직접 HTML 문서의 태그와 스타일을 분석한 후 수집 채널마다 다른 수집 로직을 구현해야 하므로 유지 관리 및 확장이 어렵다. 이러한 문제점을 해결하려면 웹 크롤러는 구조가 서로 다른 HTML 문서를 동일한 구조로 정형화하여 본문을 수집할 수 있어야 한다. 따라서 본 논문에서는 태그 경로 및 텍스트 출현 빈도를 기반으로 HTML 문서를 정형화하여 하나의 수집 로직으로 본문을 수집하는 웹크롤링 시스템인 WCTT(Web Crawling system based on Tag path and Text appearance frequency)를 설계 및 구현하였다. WCTT는 모든 수집 채널에서 동일한 로직으로 본문을 수집하므로 유지 관리 및 수집 채널의 확장이 용이하다. 또한, 키워드 네트워크 분석 등을 위해 불용어를 제거하고 명사만 추출하는 전처리 기능도 제공한다.

말뭉치에 근거한 한국어 사전 표제어 구성

  • 박영환;윤준태;송만석
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 1991년도 제3회 한글 및 한국어정보처리 학술대회
    • /
    • pp.58-65
    • /
    • 1991
  • 사전은 자연어를 처리하는 핵심 부분을 이루고 있다. 그러나 기존의 한국어 사전은 기계적인 처리에 직접 이용하기에는 크게 미흡하다. 특히, 사전의 기본을 이루는 표제어 수록에 관한 연구는 더욱 취약한 형편이다. 본 연구는 새로운 한국어 사전의 표제어률 구성하기 위하여 대형 말뭉치를 수집하였다. 이 말뭉치를 이용하여 기존 사전에서 빠져있는 미등록어들을 찾아내어 수록하고, 말뭉치에 나타난 각 단어의 출현 빈도를 조사하였다. 이 연구를 수행하기 위하여 형태소 분석기, 용례 분석기 등의 필수적인 텍스트 처리 도구들을 개발하였다. 또한, 말뭉치에 나타난 어절 단위의 오류 분포를 조사하여 밝히었다.

  • PDF

분야연상어 추출 방법의 설계 및 구현 (Design and Implementation for Extraction of Field-Associationed Terms)

  • 이원휘;최현;이상곤
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2004년도 춘계학술발표대회
    • /
    • pp.651-654
    • /
    • 2004
  • 우리는 특정 문서를 읽을 때 문서 전체를 읽지 않더라도 대표적인 몇 개의 단어를 보는 것만으로 정치나 경제, 스포츠 등의 분야를 정확히 인지할 수 있다. 문서 전체를 대상으로 하지 않고 부분텍스트에서 출현하는 소수의 단어정보에서 문서의 분야를 정확히 결정하기 위해 분야연상어의 구축은 중요한 연구과제이다. 인간이 미리 분야체계를 정의하고, 각 분야에 해당하는 문서를 인터넷이나 서적을 통해 수집한다. 본 논문은 수집문서의 분야를 정확히 지시하는 분야연상어를 자동으로 수집하는 시스템을 설계하고 구현하는데 목적이 있다. 문서의 분야결정 시점을 고려하여 분야연상어의 수준, 안정성 랭크, 집중률, 빈도정보를 이용하여 단일 분야연상어를 수집하는 방법을 제안하고 구현한다.

  • PDF

텍스트마이닝 기법을 활용한 국내외 장소성 관련 연구동향 분석 (Analyzing the Study Trends of 'Sense of Place' Using Text Mining Techniques)

  • 이인아;김혜진
    • 한국비블리아학회지
    • /
    • 제30권2호
    • /
    • pp.189-209
    • /
    • 2019
  • 주경로 분석(Main Path Analysis, MPA)은 문헌의 인용정보를 기반으로 지식이 전달되는데 기여한 핵심 문헌을 추출하는 텍스트마이닝 기법 중 하나이다. 본 연구는 1990년부터 2018년까지 국내외에서 발행된 장소성 관련 논문의 인용정보와 초록을 토대로 주경로 분석과 단어동시출현빈도 연관어 네트워크 분석을 적용하여 연구동향을 파악하였다. 1990년부터 2018년까지 수집된 문헌을 5년씩 기간 구분하여 (마지막 기간은 3년) 각 기간 별로 국내외에서 장소성 관련 연구가 전반적으로 어떻게 진행되었는지 비교 분석하여 제시하였다. 주경로 분석 결과, 1990년부터 해외의 장소성 관련 연구는 개인 정체성, 공공 토지 관리, 환경 교육, 도시 개발 분야 순으로 진행되어 온 것으로 나타났다. 단어동시출현을 기반으로 한 연관어 네트워크를 통해서는 국내의 경우 도시 개발, 문화, 문학, 역사 등 다양한 차원에서 장소성이 논의되는 격변기를 겪는 것으로 해석할 수 있었다. 반면 국외에서는 건강, 정체성, 경관, 도시 개발 관련 논의가 90년대부터 꾸준히 이루어지고 있는 것으로 파악되었다. 본 연구는 장소성 연구동향을 기존의 특정 영역에 장소성 개념을 적용하여 분석하는 미시적 관점의 분석이 아닌 다양한 텍스트마이닝 기법을 적용하여 장소성을 주제로 삼고 있는 논문의 전반적인 흐름을 파악하는 통시적 접근의 방법을 제시하였다는 점에서 시사점을 지닌다.

수학 교수학적 어휘의 변화: 텍스트 마이닝 기법을 이용한 교실수업 어휘 연구의 확장 (Changes in mathematics pedagogical lexicons: Extension research of the International Classroom Lexicon using a text mining approach)

  • 이기마;김희정
    • 한국수학교육학회지시리즈A:수학교육
    • /
    • 제61권4호
    • /
    • pp.559-579
    • /
    • 2022
  • 어휘와 언어에 대한 연구는 이를 사용하는 개인들이 포함된 공동체의 관심과 가치, 실천 관행에 대한 이해도를 높일 수 있다. 이러한 맥락에서 10개국이 참여한 국제 교실수업 어휘 프로젝트(The International Classroom Lexicon Project)는 자국의 수학 교실 수업과 관련하여, 교사가 바라보고 명명하는 구어적 입장에서 수학 교실수업 어휘 연구를 진행하여 어휘를 확인하고 정리하였다. 본 연구는 이 국제 교실수업 어휘 프로젝트 연구의 확장으로, 전국수학교사모임에서 발행하는 수학교사 전문 잡지인 「수학과 교육」에 사용된 교수학적 어휘를 텍스트 마이닝 기법을 이용하여 조사하고, 통시적 관점에서 최근 10년간 시간의 흐름에 따라 이러한 교수학적 어휘가 양적으로 어떻게 변화하였는지를 관찰하였다. 연구 결과, 선행연구에서 발견되지 않은 새로운 교수학적 어휘를 발견할 수 있었다. 또한, 이러한 교수학적 어휘 중 시간의 흐름에 따라 출현 빈도가 유의하게 증가하는 어휘와 단기간에 갑자기 출현(급증)하는 어휘를 발견할 수 있었으며, 이를 통해 수학교사를 위한, 그리고 수학교사에 의한 전문 잡지를 중심으로 이루어진 문어적 공동체 수학교사의 관심의 변화를 살펴볼 수 있었고, 나아가 이러한 관심의 변화를 사회문화적·사건적·시대적 맥락에 비추어 봄으로써 이들의 가치와 시대적 정신의 변화를 조심스럽게 해석할 수 있었다. 이러한 점에서 본 연구는 지난 10년간 시대의 변화에 따른 한국의 수학교사 공동체에서의 수학교육에 대한 관심과 가치, 시대적 정신을 이해하는 첫 걸음으로서 가치를 지니고 있다. 또한, 텍스트 마이닝 기법이 이러한 시대변화에 따른 관심과 가치, 시대적 정신의 변화에 대한 연구를 수행할 수 있는 방법론적인 기여를 제공한다.