• 제목/요약/키워드: 계량적 텍스트 분석

검색결과 33건 처리시간 0.021초

계량정보학의 변천과 응용에 관한 고찰 -정보서비스를 중심으로- (A Transition of Informetrics and Its Application : With Relation to Information Service)

  • 장우권
    • 한국정보관리학회:학술대회논문집
    • /
    • 한국정보관리학회 1996년도 제3회 학술대회 논문집
    • /
    • pp.101-104
    • /
    • 1996
  • 학문은 다양한 이론적 배경을 토대로 시대적 환경에 적응하여 발전한다. 즉, 서로의 영역을 공유하면서 새로운 이론을 창출하고 실제로 이를 응용하고 있는 것이다. 계량서지학, 계량과학학, 문헌과학학등으로 일컫고 있는 계량정보학은 문헌의 분석을 위해 수량학적 방법으로 적용하여 연구하는 학문으로, 활발히 연구되어 응용되고있는 분야는 텍스트검색시스템, OPACs, 비디오텍스시스템, 하이퍼텍스트시스템, CD-ROM, 온라인 정보서비스, 전자출판, 전자우편, 케이블 TV 등의 전자정보서비스 분야이다. 본 연구에서는 계량정보학의 사적변천과 연구영역, 그 응용과 실제를 고찰하였다.

  • PDF

과학교과서 텍스트의 계량적 분석을 이용한 과학 개념어의 생산적 지식 교육 방안 탐색 (Exploring Teaching Method for Productive Knowledge of Scientific Concept Words through Science Textbook Quantitative Analysis)

  • 윤은정
    • 한국과학교육학회지
    • /
    • 제40권1호
    • /
    • pp.41-50
    • /
    • 2020
  • 과학 개념에 대한 이해를 언어학적 관점에서 바라보면 학생들이 과학 개념어에 대한 깊고 정교한 이해와 더불어 정확하게 사용할 수 있는 능력을 길러주는 것이 매우 중요하다. 본 연구에서는 지금까지 과학 교육에서 과학 개념어에 대한 생산적 지식 교육의 기틀이 잘 마련되어 있지 않음에 주목하고, 과학 개념을 구성하고 있는 단어들 사이의 관계를 생산적이고 효과적으로 교육할 수 있는 방안을 탐색함으로써 과학 개념어의 생산적 지식 교육의 기틀을 제공하고자 하였다. 이를 위해 첫째, 몇 가지의 계량 언어학적 텍스트 분석 방법을 이용하여 과학 교과서 텍스트로 부터 과학 개념을 구성하고 있는 단어들과 그들 사이의 관계를 추출하고, 둘째, 각 방법의 결과로 추출된 단어 관계의 의미를 정성적으로 살펴본 뒤, 셋째, 이를 이용하여 과학 개념어의 생산적 지식 향상에 도움을 줄 수 있는 쓰기 활동 방법을 제안해 보았다. 중학교 1학년 과학교과서 '힘과 운동' 단원 텍스트를 클러스터 분석, 공기 빈도 분석, 텍스트 네트워크 분석, 그리고 워드임베딩의 네 가지 계량 언어학적 분석 방법을 사용하여 분석해 보았다. 연구 결과 첫째, 클러스터 분석 결과를 활용하여 문장 완성하기 활동을 제안하였다. 둘째, 공기 빈도 분석 결과를 이용한 빈 칸 채우기 활동을 제안하였다. 셋째, 네트워크 분석 결과를 이용하여 소재 중심 글쓰기 활동을 제안하였다. 넷째, 워드임베딩을 이용한 학습 중요 단어 목록 작성을 제안하였다.

빈도 정보를 이용한 저자 판별: 조선일보 4인 칼럼을 대상으로 (Authorship Attribution in Korean Using Chosun Ilbo Column Texts)

  • 한나래
    • 한국정보과학회 언어공학연구회:학술대회논문집(한글 및 한국어 정보처리)
    • /
    • 한국정보과학회언어공학연구회 2008년도 제20회 한글 및 한국어 정보처리 학술대회
    • /
    • pp.29-34
    • /
    • 2008
  • 본고에서는 빈도 정보를 이용한 저자 판별 (authorship attribution) 기법을 한국어에 적용한 연구를 소개한다. 그 대상으로는 정형화된 장르인 신문 칼럼을, 구체적으로는 조선일보에 연재 중인 4인 칼럼니스트들의 각 40개 칼럼, 총 160개 칼럼 텍스트를 선정하였다. 이들에 대하여 어절, 음절, 형태소, 각 단위 2연쇄 등의 다양한 언어 단위들의 빈도 정보들을 이용한 저자 판별을 시도한 결과, 형태소 빈도를 기반으로 하여 최고 93%를 넘는 높은 예측 정확도를 얻을 수 있었다. 또한, 저자 개인 문체간의 거리도 빈도 정보로써 계량적 표상이 가능함을 보일 수 있었다. 이로써 빈도 분석과 같은 통계적, 계량적 방법을 통하여 한국어 텍스트에 대한 성공적인 저자 판별과 개인 문체의 정량화가 가능하다는 결론을 내릴 수 있다.

  • PDF

문헌정보학 텍스트(단행본)의 내용분석에 대한 연구 (A Study on the Content Analysis of Text(Monograph) in Library and Information Science)

  • 남태우;최희곤
    • 한국문헌정보학회지
    • /
    • 제32권3호
    • /
    • pp.23-44
    • /
    • 1998
  • 본 논문은 문헌정보학의 연구동향을 규명하기 위하여 텍스트 생산성을 다양한 측면에서 계량적으로 분석하였다. 연구대상은 1957년 이래로 1997년 12월까지 국내에서 출판된 단행본 총 1,855종을 내용분석을 이용하여 저자별 생산성, 주제별 생산성, 대학별 생산성, 연구방법별 생산성에 대한 분석을 살펴보았다. 또한 이 데이터를 통한 핵심전공주제, 핵심저자, 전공분야별 핵심저자 등을 각각 계량적으로 분석 조사하였다. 이같은 연구는 문헌정보학의 핵심주제와 관심영역, 주제의 편중과 분포, 미래의 문헌정보학 발전의 좌표를 설정하는데 유용한 데이터로 이용할 수 있을 것이며, 학문발전의 균형과 건전한 방향설정을 잡는데도 유용하리라고 생각된다.

  • PDF

불균형 텍스트 데이터의 변수 선택에 있어서의 카이제곱통계량과 정보이득의 특징 (Properties of chi-square statistic and information gain for feature selection of imbalanced text data)

  • 문혜인;손원
    • 응용통계연구
    • /
    • 제35권4호
    • /
    • pp.469-484
    • /
    • 2022
  • 텍스트 데이터는 일반적으로 많은 단어로 이루어져 있으므로 변수의 수가 매우 많은 고차원 데이터에 해당된다. 이러한 고차원 데이터에서는 계산 효율성과 통계분석의 정확성을 높이기 위해 많은 변수 중 중요한 변수를 선택하기 위한 절차를 거치는 경우가 많다. 텍스트 데이터에서도 많은 단어 중 중요한 단어를 선택하기 위해 여러가지 방법들이 사용되고 있다. 이 연구에서는 단어 선택을 위한 대표적인 필터링 방법인 카이제곱통계량과 정보이득의 공통점과 차이점을 살펴보고 실제 텍스트 데이터에서 이 단어선택 방법들의 성질을 확인해보았다. 카이제곱통계량과 정보이득은 비음성, 볼록성 등의 성질을 공유하지만 불균형 텍스트 데이터에서 카이제곱통계량이 양변수 위주로 단어를 선택하는 반면, 정보이득은 음변수도 상대적으로 많이 선택하는 경향이 있음을 확인하였다.

텍스트마이닝을 이용한 윤동주 연구의 개체계량학적 분석 (Entitymetrics Analysis of the Research Works of Dong-ju Yun using Textmining)

  • 박진균;김택윤;송민
    • 한국비블리아학회지
    • /
    • 제28권1호
    • /
    • pp.191-207
    • /
    • 2017
  • 이 연구는 텍스트마이닝 기술을 이용한 개체계량학적 분석을 인문학 분야 인물 연구에 적용하기 위해 수행하였다. 연구 대상으로 한 인물은 작품뿐만 아니라 종교, 생애에 대해 많은 연구가 이루어진 윤동주를 선정하였다. 본 논문에서는 윤동주 관련 연구 1,076건을 수집하여 이중에서 초록 정보를 가지고 있었던 220건의 논문을 대상으로 LDA(Latent Dirichlet Allocation) 방식의 토픽모델링 분석을 수행하였으며, 참고문헌 정보를 추출할 수 있었던 121건의 논문을 대상으로 저자동시인용 분석을 통해 연구의 동향을 살펴보았다. 또한 초록에서 인명, 작품명의 개체를 추출하여 이들의 관계를 살펴보았다. 이 연구를 통해 윤동주에 관련한 연구 동향은 생애, 시, 실존의식, 비교문학, 번역문학, 종교적 신념에 대한 연구로 다양한 분야에 걸쳐 이루어졌다는 것을 데이터를 기반으로 보다 객관적으로 분석해 볼 수 있었으며, 윤동주와 함께 연구되는 다른 인물이 어떤 작품을 매개로 하여 연구되어 왔는지에 대해서도 알 수 있었다. 이러한 결과는 인문학 분야의 지적구조를 밝히는데 개체계량학적 방법이 유용함을 증명하는 한편 인문학연구의 새로운 시각적 접근을 제안했다는 데에 의의가 있다.

영미 아동 모험 소설에 관한 코퍼스 분석 연구: 『보물섬』을 중심으로 (A Corpus Analysis of British-American Children's Adventure Novels: Treasure Island)

  • 최은샘;정채관
    • 한국콘텐츠학회논문지
    • /
    • 제21권1호
    • /
    • pp.333-342
    • /
    • 2021
  • 본 연구에서는 대표적인 영미 아동 모험 소설 『보물섬』의 언어적 특징을 파악하기 위해 『보물섬』을 코퍼스화 하여 어휘, 리마, 키워드, n-그램을 분석하였다. 이 연구를 통해 고빈도 어휘가 텍스트의 핵심어라는 일반적인 주장과 달리 『보물섬』의 고빈도 어휘는 『보물섬』과 직접 관련이 없는 기능어, 고유명사 등이 최상위층에 포진하고 있다는 것을 발견하였고, 통계적인 방법으로 추출한 『보물섬』 키워드 역시 『보물섬』의 내용을 가늠하기에 충분하지 않음을 발견하였다. 따라서 1차 정량적인 키워드 분석 후 진행된 2차 정성적인 키워드 분석을 통해 추출한 30개의 핵심 키워드를 통해 『보물섬』 내용을 신속하고 구체적으로 파악하는 단초를 마련하였고, 이를 바탕으로 그동안 직관적으로만 회자 되던 『보물섬』에 나타난 남성성을 계량적으로 분석할 수 있었다. 또한, n-그램 분석을 통해 『보물섬』의 작가가 다른 작가에 비해 선호하고 자주 사용하는 연속어휘구를 발견하였고, 이를 토대로 문학 작품의 계량적 연구가 가능한 코퍼스 문체론 연구의 가능성을 탐색하였다. 본 연구를 통해 밝혀낸 연구결과가 영미 아동문학 콘텐츠의 확산과 코퍼스 문체론 연구에 도움이 되기를 희망한다.

계량적 접근에 의한 조선시대 필사본 조리서의 유사성 분석 (A Quantitative Approach to a Similarity Analysis on the Culinary Manuscripts in the Chosun Periods)

  • 이기황;이재윤;백두현
    • 한국언어정보학회지:언어와정보
    • /
    • 제14권2호
    • /
    • pp.131-157
    • /
    • 2010
  • This article reports an attempt to perform a similarity analysis on a collection of 25 culinary manuscripts in Chosun periods using a set of quantitative text analysis methods. Historical culinary texts are valuable resources for linguistic, historic, and cultural studies. We consider the similarity of two texts as the distributional similarities of the functional components of the texts. In the case of culinary texts, text elements such as food names, cooking methods, and ingredients are regarded as functional components. We derive the similarity information from the distributional characteristics of the two key functional components, cooking methods and ingredients. The results are also quantified and visualized to achieve a better understanding of the properties of the individual texts and the collection of the texts as a whole.

  • PDF

빈도 정보를 이용한 한국어 저자 판별 (Authorship Attribution in Korean Using Frequency Profiles)

  • 한나래
    • 인지과학
    • /
    • 제20권2호
    • /
    • pp.225-241
    • /
    • 2009
  • 본고에서는 빈도 정보를 이용한 저자 판별 (authorship attribution) 기법을 한국어에 적용한 연구를 소개한다. 그 대상으로는 정형화된 장르인 신문 칼럼을, 구체적으로는 조선일보에 연재 중인 4인 칼럼니스트들의 각 40개 칼럼, 총 160개 칼럼 텍스트를 선정하였다. 이들에 대하여 어절, 음절, 형태소, 각 단위 2연쇄 등의 다양한 언어 단위들의 빈도 정보들을 이용한 저자 판별을 시도한 결과, 형태소 빈도를 기반으로 하여 최고 93%를 넘는 높은 예측 정확도를 얻을 수 있었다. 또한, 저자 개인 문체간의 거리도 빈도 정보로써 계량적 표상이 가능함을 보일 수 있었다. 이로써 빈도 분석과 같은 통계적, 계량적 방법을 통하여 한국어 텍스트에 대한 성공적인 저자 판별과 개인 문체의 정량화가 가능하다는 결론을 내릴 수 있다.

  • PDF

다중 네트워크 분석과 토픽 모델링을 이용한 임진왜란 시기 사료에 관한 연구 (A Study on the Imjin War's Historical Materials with Multi-layer Network Analysis and Topic Modeling)

  • 조현철;송민
    • 한국비블리아학회지
    • /
    • 제33권1호
    • /
    • pp.167-198
    • /
    • 2022
  • 융합 과학 연구가 활성화되며 인문학에서도 디지털 인문학(Digital Humanities) 연구가 장려되고 있다. 이에 본 연구는 역사 데이터에 텍스트마이닝과 개체계량학 연구 방법을 적용한 시론(試論) 연구를 제안하고자 하였다. 선조실록(宣祖實錄)·선조수정실록(宣祖修正實錄), 난중잡록(亂中雜錄), 징비록(懲毖錄)을 활용하였으며, 사료(史料)에서 주제 변화와 공통 개체를 탐색하기 위해서 네트워크 분석과 DMR 토픽모델을 사용하였다. 분석 결과를 통해서 텍스트 데이터에 대한 계량 분석의 활용 가능성 확인, 특정 주제의 시기적 변화, 인물 개체 간 미발견 관계를 제시함으로써 연구의 확장 가능성을 제안할 수 있었다.