• 제목/요약/키워드: DMR 토픽 모델링

검색결과 5건 처리시간 0.021초

토픽모델링을 통한 저자명 식별 성능 비교 (A Comparison of Author Name Disambiguation Performance through Topic Modeling)

  • 김하진;정효정;송민
    • 한국정보관리학회:학술대회논문집
    • /
    • 한국정보관리학회 2014년도 제21회 학술대회 논문집
    • /
    • pp.149-152
    • /
    • 2014
  • 본 연구에서는 저자명 모호성 해소를 위해 토픽모델링 기법을 사용하여 저자명을 식별 하였다. 기존의 토픽모델링은 용어 자질만을 고려하였지만 본 연구에서는 제 3의 메타데이터 자질을 활용하여 ACT(Author-Conference Topic Model) 모델과 DMR(Dirichlet-multinomial Regression) 토픽모델링을 대상으로 저자명 식별 성능을 평가, 비교하였다. 또한 수작업으로 저자 식별 작업을 한 데이터셋을 기반으로 저자 당 논문 수와 토픽 수에 차이를 두고 연구를 진행하였다. 그 결과 저자명 식별에 있어 ACT 모델보다 DMR 토픽모델링의 성능이 더 우수한 것을 알 수 있었다.

  • PDF

다중 네트워크 분석과 토픽 모델링을 이용한 임진왜란 시기 사료에 관한 연구 (A Study on the Imjin War's Historical Materials with Multi-layer Network Analysis and Topic Modeling)

  • 조현철;송민
    • 한국비블리아학회지
    • /
    • 제33권1호
    • /
    • pp.167-198
    • /
    • 2022
  • 융합 과학 연구가 활성화되며 인문학에서도 디지털 인문학(Digital Humanities) 연구가 장려되고 있다. 이에 본 연구는 역사 데이터에 텍스트마이닝과 개체계량학 연구 방법을 적용한 시론(試論) 연구를 제안하고자 하였다. 선조실록(宣祖實錄)·선조수정실록(宣祖修正實錄), 난중잡록(亂中雜錄), 징비록(懲毖錄)을 활용하였으며, 사료(史料)에서 주제 변화와 공통 개체를 탐색하기 위해서 네트워크 분석과 DMR 토픽모델을 사용하였다. 분석 결과를 통해서 텍스트 데이터에 대한 계량 분석의 활용 가능성 확인, 특정 주제의 시기적 변화, 인물 개체 간 미발견 관계를 제시함으로써 연구의 확장 가능성을 제안할 수 있었다.

토픽 모델링 기반 과학적 지식의 불확실성의 흐름에 관한 연구 (The Stream of Uncertainty in Scientific Knowledge using Topic Modeling)

  • 허고은
    • 정보관리학회지
    • /
    • 제36권1호
    • /
    • pp.191-213
    • /
    • 2019
  • 과학적 지식을 얻는 과정은 연구자의 연구를 통해 이루어진다. 연구자들은 과학의 불확실성을 다루고 과학적 지식의 확실성을 구축해나간다. 즉, 과학적 지식을 얻기 위해서 불확실성은 반드시 거쳐가야 하는 필수적인 단계로 인식되고 있다. 현존하는 불확실성의 특성을 파악하는 연구는 언어학적 접근의 hedging 연구를 통해 소개되었으며 컴퓨터 언어학에서 수작업 기반으로 불확실성 단어 코퍼스를 구축해왔다. 기존의 연구들은 불확실성 단어의 단순 출현 빈도를 기반으로 특정 학문 영역의 불확실성의 특성을 파악해오는데 그쳤다. 따라서 본 연구에서는 문장 내 생의학적 주장이 중요한 역할을 하는 생의학 문헌을 대상으로 불확실성 단어 기반 과학적 지식의 패턴을 시간의 흐름에 따라 살펴보고자 한다. 이를 위해 생의학 온톨로지인 UMLS에서 제공하는 의미적 술어를 기반으로 생의학 명제를 분석하였으며, 학문 분야의 패턴을 파악하는데 용이한 DMR 토픽 모델링을 적용하여 생의학 개체의 불확실성 기반 토픽의 동향을 종합적으로 파악하였다. 시간이 흐름에 따라 과학적 지식의 표현은 불확실성이 감소하는 패턴으로 연구의 발전이 이루어지고 있음을 확인하였다.

디지털 전환: D.N.A.(Data, Network, AI) 키워드를 활용한 토픽 모델링 (Digital Transformation: Using D.N.A.(Data, Network, AI) Keywords Generalized DMR Analysis)

  • 안세환;고강욱;김영민
    • 지식경영연구
    • /
    • 제23권3호
    • /
    • pp.129-152
    • /
    • 2022
  • 디지털 전환의 핵심 인프라로서 데이터·네트워크·인공지능(D.N.A.) 분야의 확산과 유망 산업의 등장은 경제 전반에 걸쳐 활발한 디지털 혁신의 기반이 되고 있다. 본 연구에서는 텍스트마이닝 방법론을 적용하여 WoS 데이터베이스의 SCIE 급 색인에 해당하는 연구의 초록, 출판연도 및 연구분야를 입력변수로 활용하여 주요 토픽을 도출하였다. 우선, 단어 출현 빈도에 기반한 TF 및 TF-IDF 분석을 통해 주요 키워드를 확인하고, 이어서 g-DMR(Generalized Dirichlet-Multinomial Regression)을 이용하여 토픽 모델링을 수행하였는데, 다양한 형태의 변수를 메타정보로 활용 가능한 해당 토픽 모형의 이점으로 단순하게 토픽을 도출하는 것 이상의 의미를 적절하게 탐색할 수 있었다. 분석 결과에 따르면, 비즈니스 인텔리전스, 제조 생산 시스템, 서비스 가치 창출, 원격 진료, 디지털 교육 등의 토픽들이 디지털 전환에서 주요 연구주제인 것으로 식별되었다. 토픽 모델링의 결과를 요약하자면, 1) COVID-19 이후 비즈니스 인텔리전스를 주제로 하는 연구가 전 영역에서 활발하게 수행되고 있으며, 2) 제조 분야에서 지능형 제조 솔루션 및 메타버스 등의 이슈가 등장함에 따라 제조 생산 시스템에 관한 주제가 다시 한번 주목받고 있음을 확인하였다. 마지막으로, 3) 주제어 자체는 기술과 서비스의 측면에서 분리하여 볼 수 있지만, 다수의 연구에서 해당 기술들을 접목하여 적용된 다양한 서비스를 포괄적으로 다루고 있으므로 이를 별개로 해석하는 것이 바람직하지 못하다는 점을 알 수 있었다.

텍스트 마이닝 기법을 이용한 컴퓨터공학 및 정보학 분야 연구동향 조사: DBLP의 학술회의 데이터를 중심으로 (Investigation of Topic Trends in Computer and Information Science by Text Mining Techniques: From the Perspective of Conferences in DBLP)

  • 김수연;송성전;송민
    • 정보관리학회지
    • /
    • 제32권1호
    • /
    • pp.135-152
    • /
    • 2015
  • 이 논문의 연구목적은 컴퓨터공학 및 정보학 관련 연구동향을 분석하는 것이다. 이를 위해 텍스트마이닝 기법을 이용하여 DBLP(Digital Bibliography & Library Project)의 학술회의 데이터를 분석하였다. 대부분의 연구동향 분석 연구가 계량서지학적 연구방법을 사용한 것과 달리 이 논문에서는 LDA(Latent Dirichlet Allocation) 기반 다항분포 토픽모델링 기법을 이용하였다. 가능하면 컴퓨터공학 및 정보학과 관련된 광범위한 자료를 수집하기 위해서 DBLP에서 컴퓨터공학 및 정보학과 관련된 353개의 학술회의를 수집 대상으로 하였으며 2000년부터 2011년 기간 동안 출판된 236,170개의 문헌을 수집하였다. 토픽모델링 결과와 주제별 문헌 수, 주제별 학술회의 수를 조사하여 2000년부터 2011년 사이의 주제별 상위 저자와 주제별 상위 학술회의를 제시하였다. 주제동향 분석 결과 네트워크 관련 연구 주제 분야는 성장 패턴을 보였으며, 인공지능, 데이터마이닝 관련 연구 분야는 쇠퇴 패턴을 나타냈고, 지속 패턴을 보인 주제는 웹, 텍스트마이닝, 정보검색, 데이터베이스 관련 연구 주제이며, HCI, 정보시스템, 멀티미디어 시스템 관련 연구 주제 분야는 성장과 하락을 지속하는 변동 패턴을 나타냈다.