• Title/Summary/Keyword: 주제 연관성

Search Result 251, Processing Time 0.027 seconds

Sentence Cohesion & Subject driving Keywords Extraction for Document Classification (문서 분류를 위한 문장 응집도와 주어 주도의 주제어 추출)

  • Ahn Heui-Kook;Roh Hi-Young
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2005.07b
    • /
    • pp.463-465
    • /
    • 2005
  • 문서분류 시 문서의 내용을 표현하기 위한 자질로서 사용되는 단어의 출현빈도정보는 해당 문서의 주제어를 표현하기에 취약한 점을 갖고 있다. 즉, 키워드가 문장에서 어떠한 목적(의미)으로 사용되었는지에 대한 정보를 표현할 수가 없고, 문장 간의 응집도가 강한 문장에서 추출되었는지 아닌지에 대한 정보를 표현할 수가 없다. 따라서, 이 정보로부터 문서분류를 하는 것은 그 정확도에 있어서 한계를 갖게 된다. 본 논문에서는 이러한 문서표현의 문제를 해결하기위해, 키워드를 선택할 때, 자질로서 문장의 역할(주어)정보를 추출하여 가중치 부여방식을 통하여 주어주도정보량을 추출하였다. 또한, 자질로서 문장 내 키워드들의 동시출현빈도 정보를 추출하여 문장 간 키워드들의 연관성정도를 시소러스에 담아내었다. 그리고, 이로부터 응집도 정보를 추출하였다. 이 두 정보의 통합으로부터 문서 주제어를 결정함으로서, 문서분류를 위한 주제어 추출 시 불필요한 키워드의 삽입을 줄이고, 동시 출현하는 키워드들에 대한 선택 기준을 제공하고자 하였다. 실험을 통해 한번 출현한 키워드라도, 문장을 주도하는 주어로서 사용될 경우와 응집도 가중치가 높을 경우에 주제어로서의 선택될 가능성이 향상되고, 문서분류를 위해 좀 더 세분화된 키워드 점수화가 가능함을 확인하였다. 따라서, 선택된 주제어가 문서분류의 정확도에 있어서 향상을 가져올 수 있을 것으로 기대한다.

  • PDF

A Language Model based Knowledge Network for Analyzing Disaster Safety related Social Interest (재난안전 사회관심 분석을 위한 언어모델 활용 정보 네트워크 구축)

  • Choi, Dong-Jin;Han, So-Hee;Kim, Kyung-Jun;Bae, Eun-Sol
    • Proceedings of the Korean Society of Disaster Information Conference
    • /
    • 2022.10a
    • /
    • pp.145-147
    • /
    • 2022
  • 본 논문은 대규모 텍스트 데이터에서 이슈를 발굴할 때 사용되는 기존의 정보 네트워크 또는 지식 그래프 구축 방법의 한계점을 지적하고, 문장 단위로 정보 네트워크를 구축하는 새로운 방법에 대해서 제안한다. 먼저 문장을 구성하는 단어와 캐릭터수의 분포를 측정하며 의성어와 같은 노이즈를 제거하기 위한 역치값을 설정하였다. 다음으로 BERT 기반 언어모델을 이용하여 모든 문장을 벡터화하고, 코사인 유사도를 이용하여 두 문장벡터에 대한 유사성을 측정하였다. 오분류된 유사도 결과를 최소화하기 위하여 명사형 단어의 의미적 연관성을 비교하는 알고리즘을 개발하였다. 제안된 유사문장 비교 알고리즘의 결과를 검토해 보면, 두 문장은 서술되는 형태가 다르지만 동일한 주제와 내용을 다루고 있는 것을 확인할 수 있었다. 본 논문에서 제안하는 방법은 단어 단위 지식 그래프 해석의 어려움을 극복할 수 있는 새로운 방법이다. 향후 이슈 및 트랜드 분석과 같은 미래연구 분야에 적용하면, 데이터 기반으로 특정 주제에 대한 사회적 관심을 수렴하고, 수요를 반영한 정책적 제언을 도출하는데 기여할 수 있을 것이다

  • PDF

Sequencing Document Clusters to Support Human Annotation Efforts (효율적인 문서 처리 작업을 위한 문서집합 나열)

  • Nah, Chong-Yeol;Moon, Il-Chul;Choi, Key-Sun
    • Annual Conference on Human and Language Technology
    • /
    • 2008.10a
    • /
    • pp.75-78
    • /
    • 2008
  • 온톨로지 어노테이션(Annotation)과정은 수동에 의해 대부분의 문서 처리 작업이 진행되고 있다. 그러므로 계획적이지 않은 문서 처리는 자칫 일관성이나 효율성을 떨어뜨릴 수가 있다. 예를 들어, 처리되는 문서들의 도메인이 자주 바뀌면, 수동 어노테이션을 하는 작업자는 객관성을 잃을 가능성이 높다. 따라서, 본 연구에서는 처리되는 문서집합의 도메인이 최대한 연관성이 유지되도록 처리 문서를 집합하여 나열하는 알고리즘을 소개한다. 첫번째로, 문서들을 유사한 주제 집합으로 형성한다. 두번째로, 두개 이상의 집합에 겹치는 문서들을 계산한다. 마지막으로, 이러한 겹침이 최대화 되도록 문서들의 처리 순서를 나열한다. 본 알고리즘을 IT관련 위키피디아 문서집합을 이용하여 평가를 시행했다. 평가 결과 우리의 알고리즘을 이용하면 처리되는 문서들의 도메인 이동이 무작위로 처리하는 것 보다 연속적이었음을 수치상으로 계산할 수 있었다.

  • PDF

Processing of ρ-intersect Operation on RDF Data Using Suffix Array (RDF 데이터에서 접미사 배열을 이용한 ρ-intersect 연산의 처리)

  • Kim, Sung-Wan;Kim, Youn-Hee
    • Journal of the Korea Society of Computer and Information
    • /
    • v.16 no.7
    • /
    • pp.95-103
    • /
    • 2011
  • The actual utilization of Semantic Web technology which aims to provide more intelligent and automated service for information retrieval over the Web becomes gradually reality. RDF is widely used as the one of standard formats to present and manage the voluminous data on the Web. Efficient query processing on RDF data, therefore, is one of the ongoing research topics. Retrieving resources having a specific association from a given resource is the typical query processing type and several researches for this have done. However the most of previous researches have not fully considered discovering the complex relationship among resources such as returning the association between resources as the query processing result. This paper introduces the indexing and query processing for ${\rho}$-intersect operation which is one of the semantic association retrieval types. It includes an indexing scheme using suffix array and optimal processing approaches for handling ${\rho}$-intersect operation. The experimental evaluations shows that the average execution times for the proposed approach is 3~7 times faster than the previous approach.

A Study on the Development of Subject-Divisional Plan Model for the Efficient Reference Service of University Library (대학도서관의 효율적인 정보서비스를 위한 주제화모형 개발에 관한 연구)

  • Chung, Jae-Young
    • Journal of the Korean Society for information Management
    • /
    • v.22 no.3 s.57
    • /
    • pp.327-350
    • /
    • 2005
  • Second, the necessity of adopting subject divisional plan is to secure enough subject librarians and large space These necessities must be fulfilled prior to adopting the subject divisional plan. Third subject divisional plan model for efficient reference service of university library is 'wide-area subject divisional plan model'. 1) In the case of central library, the space model of wide-area subject divisional plan is programmed as undergraduate library for the undergraduate students. And each subject libraries is operated as research library for the professors and graduate students. 2) In central library, the collection model of wide-area subject divisional plan is practiced as offering reference and general education centered data for undergraduate students 'study. And each subject libraries is furnished with research papers, recent journals, and various major-related data. 3) The human resource model of wide-area subject divisional plan is applicated by arranging appropriate librarians at the right place. In the case of central library, the reference librarians and librarians who educate the users and take charge of function are set in to help undergraduate students with their study. Subject library needs to secure subject librarians, librarians who take charge of function, and graduate students who are related to the subject as student assistant. Then it is possible to discriminate reference service by subjects and users.

A Trend Analysis of Radiological Research in Korea using Topic Modeling (토픽모델링을 이용한 국내 방사선 학술연구 트렌드 분석)

  • Hong, Dong-Hee
    • Journal of the Korean Society of Radiology
    • /
    • v.16 no.3
    • /
    • pp.343-349
    • /
    • 2022
  • We intend to use topic modeling to identify radiation-themed papers published from 1989 to 2022 and analyze the relevance and weight between topics. This study analyzed topics derived from national subjects for 717 papers published until recently in 2022 to contribute to the revitalization of research in the field of radiation. Through text mining, overall research trends on the subject distribution of the study were analyzed, and five topics were derived through topic modeling. First, among the papers to be analyzed, a total of 1,675 words were frequency-analyzed through the preprocessing process of key words in a total of 717 papers centered on keywords. Second, as a result of analyzing topics based on the association of constituent words for five topics, it was found that studies focused on minimizing dose in the range that does not degrade image quality in the fields of radiation, image, CT clinical. In addition, it was found that various studies were mainly conducted in the MRI, and the study of ultrasound in various areas of disease analysis was actively attempted.

How National Water Management Plans lead Hydrological Survey Projects? (텍스트 마이닝을 이용한 국가 물관리 정책 변화 시점별 수문조사사업의 방향 분석)

  • Chan Woo Kim;Min Kuk Kim;Jung Hwan Koh;Seung Won Han;In Jae Choi;Dong Ho Hyun;Seok Geun Park
    • Proceedings of the Korea Water Resources Association Conference
    • /
    • 2023.05a
    • /
    • pp.429-429
    • /
    • 2023
  • 우리나라의 물 관련 정책 방향이 환경 중심의 수자원 관리에서 친수공간 및 정보의 확보와 같은 안전한 물관리로 확대되면서 정책추진에 기초가 될 수 있는 신뢰도 높은 수문자료의 생산이 보다 중요시되고 있다. 국가 수문조사사업은 이러한 정책기조에 맞춰 제도적인 뒷받침과 함께 조사의 범위와 기술, 품질관리 등의 영역을 넓히며 그 기능을 활발히 하고 있으나, 물관리 정책의 경향에 따른 수문조사사업의 방향성과 특징을 구조적으로 살펴본 연구는 부족한 것으로 파악된다. 따라서 본 연구는 친수·친환경적 물관리가 강조된 시기('97~현재)를 중점으로 하여 물관리 정책과 관련 계획의 변화가 수문조사사업에 어떠한 영향을 주는지 고찰하였다. 이를 위해 물관리 여건의 변화에 따라 달라진 관련 정책별 주제어의 분포와 수문조사사업과 연관된 주요어의 출현빈도 및 경향을 살펴보고, 주요 연관어와 연계한 사업의 방향과 구조를 분석하였다. 분석자료로는 물관리 관련 법령 등의 제도와 언론기사자료, 정책별 추진방향을 활용하였다. 정책의 추진방향은 1) 수자원의 종합적 개발에서 친환경적 측면과 지속가능성이 강조된 수자원장기종합계획(3-1차~4-3차)과 2) 사람과 자연이 함께 고려된 맑고 안전한 물, 통합물관리 등의 전략이 수록된 국가물관리기본계획(1차), 3) 정책의 기조에 따라 수립 및 보완된 수문조사 기본계획(1~2차)을 바탕으로 하였다. R프로그램을 통한 텍스트 마이닝을 활용하여 각 자료에서의 주제어 분포와 출현빈도를 분석하고, 정책별 추진방향과 수문조사사업의 연계성을 나타내었다. 연구의 함의를 담은 결과로서 물관리 여건이 변화된 시점별 주요연관어를 중심으로 한 정책동향과 수문조사사업의 특징 및 방향을 요약·비교하여 제시하였으며, 이는 물관리 분야에서의 국정운영 목표와 연계하여 국가 수문조사사업의 사업성을 고찰하는 연구의 기반이 될 수 있으리라 생각된다.

  • PDF

Open Ending and Incomprehensibility in Film: Focused on the Films of the Coen Brothers (영화의 열린 결말과 불가해성: 코엔 형제의 영화를 중심으로)

  • Chang, Woo-Jin
    • Proceedings of the Korea Contents Association Conference
    • /
    • 2013.05a
    • /
    • pp.83-84
    • /
    • 2013
  • 이 연구는 코엔 형제 영화의 열린 결말이 작품의 주제와 어떻게 연관되는지, 그리고 그러한 열린 방식으로 내러티브를 종결시킬 수 있게 하는 서사 논리가 무엇인지 논의한다. <바톤 핑크>(1991), <노인을 위한 나라는 없다>(2007), <시리어스 맨>(2009) 등 코엔 형제의 열린 결말 영화들은 모두 '불확실성'에 관한 영화이다. 이 불확실성은 부조리하고 아이러니컬한 세상의 불가해성과 그것에 대한 캐릭터의 이해 불능으로 나타난다. 코엔 형제의 영화들은 바로 이러한 세계의 불가해성에 대한 논증의 내러티브이며, 이들의 열린 결말은 플롯과 논증의 중층 구조에서 스토리 문제의 해결이 아니라 논증의 완결을 추구한 결과이다.

  • PDF

A Study on the Linkability of Public Information Using Social Network Analysis (사회 연결망 분석을 활용한 공공데이터 간 연관성에 관한 연구)

  • Jeong, Da Woon;Yi, Mi Sook;Shin, Dong Bin
    • Journal of the Korean Society of Surveying, Geodesy, Photogrammetry and Cartography
    • /
    • v.35 no.6
    • /
    • pp.461-470
    • /
    • 2017
  • In Korea, starting with the Government 3.0 Policy, the utilization of public data as an important driving force to promote economic growth has been highlighted as a major issue. However Korea is currently only able to open and provide accumulated data stored in the public domain. To resolve this issue, we need to not only open and provide public information, but also to create new information by linking the data and developing related services. Thus, this study analyzes the linkability of public information and provides lists of the linkable public data. In order to do this, we first have performed preconditioning processes on the accessibility and workability of the data. Next, we have deduced the major keywords in public data through analyzing the morphemes, and then the core keywords (Top 10) and their linkable keyword lists through an analysis of social networks. Based on the outcome of this study, a subsequent study will deduce new information by linking the public data and creating various services and information contents. Furthermore, not only conceptual but also practical linking measures need to be created, and a related law must be prepared.

Integration of Kriging Algorithm and Remote Sensing Data and Uncertainty Analysis for Environmental Thematic Mapping: A Case Study of Sediment Grain Size Mapping (지표환경 주제도 작성을 위한 크리깅 기법과 원격탐사 자료의 통합 및 불확실성 분석 -입도분포지도 사례 연구-)

  • Park, No-Wook;Jang, Dong-Ho
    • Journal of the Korean Geographical Society
    • /
    • v.44 no.3
    • /
    • pp.395-409
    • /
    • 2009
  • The objective of this paper is to illustrate that kriging can provide an effective framework both for integrating remote sensing data and for uncertainty modeling through a case study of sediment grain size mapping with remote sensing data. Landsat TM data which show reasonable relationships with grain size values are used as secondary information for sediment grain size mapping near the eastern part of Anmyeondo and Cheonsuman bay. The case study results showed that uncertainty attached to prediction at unsampled locations was significantly reduced by integrating remote sensing data through the analysis of conditional variance from conditional cumulative distribution functions. It is expected that the kriging-based approach presented in this paper would be efficient integration and analysis methodologies for any environmental thematic mapping using secondary information as well as sediment grain size mapping.