• 제목/요약/키워드: text categorization

검색결과 147건 처리시간 0.029초

전자메일 자동관리 시스템을 위한 전자메일 분류기의 개발 (Development of e-Mail Classifiers for e-Mail Response Management Systems)

  • 김국표;권영식
    • 한국IT서비스학회지
    • /
    • 제2권2호
    • /
    • pp.87-95
    • /
    • 2003
  • With the increasing proliferation of World Wide Web, electronic mail systems have become very widely used communication tools. Researches on e-mail classification have been very important in that e-mail classification system is a major engine for e-mail response management systems which mine unstructured e-mail messages and automatically categorize them. in this research we develop e-mail classifiers for e-mail Response Management Systems (ERMS) using naive bayesian learning and centroid-based classification. We analyze which method performs better under which conditions, comparing classification accuracies which may depend on the structure, the size of training data set and number of classes, using the different data set of an on-line shopping mall and a credit card company. The developed e-mail classifiers have been successfully implemented in practice. The experimental results show that naive bayesian learning performs better, while centroid-based classification is more robust in terms of classification accuracy.

목차 정보와 kNN 분류기를 이용한 사회과학 분야 도서 자동 분류에 관한 연구 (A Study on Book Categorization in Social Sciences Using kNN Classifiers and Table of Contents Text)

  • 이용구
    • 정보관리학회지
    • /
    • 제37권1호
    • /
    • pp.1-21
    • /
    • 2020
  • 이 연구에서는 한 대학도서관의 신착 도서 리스트 중 사회 과학 분야 6,253권에 대해 목차 정보를 이용하여 자동 분류를 적용하였다. 분류기는 kNN 알고리즘을 사용하였으며 자동 분류의 범주로 도서관에서 도서에 부여한 DDC 300대 강목을 사용하였다. 분류 자질은 도서의 서명과 목차를 사용하였으며, 목차는 인터넷 서점으로부터 Open API를 통해 획득하였다. 자동 분류 실험 결과, 목차 자질은 분류 재현율과 분류 정확률 모두를 향상시키는 좋은 자질임을 알 수 있었다. 또한 목차는 풍부한 자질로 불균형인 데이터의 과적합 문제를 완화시키는 것으로 나타났다. 법학과 교육학은 사회 과학 분야에서 특정성이 높아 서명 자질만으로도 좋은 분류 성능을 가져오는 점도 파악할 수 있었다.

학회 웹사이트의 토픽 정보추출을 이용한 주제에 따른 학회 자동분류 기법 (Academic Conference Categorization According to Subjects Using Topical Information Extraction from Conference Websites)

  • 이수경;김관호
    • 한국전자거래학회지
    • /
    • 제22권2호
    • /
    • pp.61-77
    • /
    • 2017
  • 최근 온라인상에 게시된 학회정보가 급증함으로써 주제에 따른 학회정보의 자동분류는 연구자들에게 효율적인 관련 학회 탐색을 가능하게 한다. 그러나 대부분의 학회 목록 제공 서비스에서는 학회명칭, 날짜, 위치, URL 등의 정보만 제공하기 때문에 학회 주제를 파악할 수 있는 정보는 학회명칭에 국한된다. 따라서 본 연구에서는 URL을 통한 학회 웹사이트의 토픽정보를 추출함으로써 학회정보량의 부족문제를 해결하고, 동시에 양질의 정보로 학습의 성능을 향상시키는 기법을 제안한다. 구체적으로는 웹사이트 URL을 통해 수집한 HTML 문서로부터 주요 콘텐츠를 추출하고, 학회명칭과 유사한 토픽 키워드 정보를 선정하여 추가 가중치를 부여한다. 실 데이터를 활용한 실험 결과, 제안된 방법인 추가적인 웹 콘텐츠 정보의 사용은 주제에 따른 학회 분류의 성능을 성공적으로 향상시킬 수 있음을 확인하였다. 추후 연구에서는 웹 사이트의 구조를 고려한 토픽 정보추출을 통해 분류의 정확성을 더욱 향상시킬 계획이다.

Context-based classification for harmful web documents and comparison of feature selecting algorithms

  • Kim, Young-Soo;Park, Nam-Je;Hong, Do-Won;Won, Dong-Ho
    • 한국멀티미디어학회논문지
    • /
    • 제12권6호
    • /
    • pp.867-875
    • /
    • 2009
  • More and richer information sources and services are available on the web everyday. However, harmful information, such as adult content, is not appropriate for all users, notably children. Since internet is a worldwide open network, it has a limit to regulate users providing harmful contents through each countrie's national laws or systems. Additionally it is not a desirable way of developing a certain system-specific classification technology for harmful contents, because internet users can contact with them in diverse ways, for example, porn sites, harmful spams, or peer-to-peer networks, etc. Therefore, it is being emphasized to research and develop context-based core technologies for classifying harmful contents. In this paper, we propose an efficient text filter for blocking harmful texts of web documents using context-based technologies and examine which algorithms for feature selection, the process that select content terms, as features, can be useful for text categorization in all content term occurs in documents, are suitable for classifying harmful contents through implementation and experiment.

  • PDF

New Feature Selection Method for Text Categorization

  • Wang, Xingfeng;Kim, Hee-Cheol
    • Journal of information and communication convergence engineering
    • /
    • 제15권1호
    • /
    • pp.53-61
    • /
    • 2017
  • The preferred feature selection methods for text classification are filter-based. In a common filter-based feature selection scheme, unique scores are assigned to features; then, these features are sorted according to their scores. The last step is to add the top-N features to the feature set. In this paper, we propose an improved global feature selection scheme wherein its last step is modified to obtain a more representative feature set. The proposed method aims to improve the classification performance of global feature selection methods by creating a feature set representing all classes almost equally. For this purpose, a local feature selection method is used in the proposed method to label features according to their discriminative power on classes; these labels are used while producing the feature sets. Experimental results obtained using the well-known 20 Newsgroups and Reuters-21578 datasets with the k-nearest neighbor algorithm and a support vector machine indicate that the proposed method improves the classification performance in terms of a widely known metric ($F_1$).

자동분류 알고리즘을 이용한 지능형 정보검색시스템 구축에 관한 연구 (A Study of Designing the Intelligent Information Retrieval System by Automatic Classification Algorithm)

  • 서휘
    • 한국도서관정보학회지
    • /
    • 제39권4호
    • /
    • pp.283-304
    • /
    • 2008
  • 본 연구의 목적은 이용자의 탐색 행태, 시스템의 정보 구축 행태를 기반으로 초기 질의어의 범주에 해당하는 연관 용어들(해당 용어의 지식구조와 관련된 연관 용어들)을 학습기능을 통해 자동으로 제시해 줄 수 있는 지능형 검색 시스템을 구현하는 것이다. 이를 위해 학습을 통해 전문가 수준의 색인어를 추출할 수 있는 지능형자동색인 알고리즘, 자동분류에 관련한 클러스터링 알고리즘과 문서 범주화 알고리즘 그리고 범주 표현 알고리즘에 대한 이론적 연구를 수행하였으며, 이들 이론적 연구를 근거로 비용과 시간적인 측면에서 그리고 재현율과 정도율이란 측면에서 우수한 성능을 발휘할 수 있는 지능형검색시스템을 구현하였다.

  • PDF

현대 예술의상에 표현된 조형성의 텍스트 분석 (제1보) - 1980년대 이후 서구작가 작품을 중심으로 - (The Text Analysis of Plasticity Expressed in the Modern Art to Wear (Part I) - Focused on the West Art Works since 1980s -)

  • 서승미;양숙희
    • 한국의류학회지
    • /
    • 제29권6호
    • /
    • pp.793-804
    • /
    • 2005
  • The new paradigm of the 21st century demand an openly different world of formative ideologies in respect to art and design. The purpose of this study is focused on trying to comprehend aesthetic essence of clothing as an, with the investigation of artistic theories manifested by art philosophers. Art to Wear was categorized into style to understand its artistic meaning as well as to analyze its character. Upon the foundation of semiotics theory, the feature of Art to Wear and its analysis category were argued in the context of Charles Morris three dimension of semiotics analysis. The conclusion to the research is like so. The feature and analysis category of Art to Wear upon a semiotics perspective was divided into syntactic dimension, semantic dimension and pragmatic dimension. The analytical categorization upon the perspective of syntactic dimension fell into the category of topology, shape and color. The semantic dimension of Art to Wear was divided into categories of denotation and connotation. In addition, the pragmatic dimension of Art to Wear analytical categorization was divided into a delivering function and common function.

과학기술 연구개발조직의 팀 연구 지원을 위한 지식포털 모델 (Design of a Knowledge Portal for Supporting Team Work in Research & Development Organizations)

  • 박성주;이홍주;김종우;김규중;안형준
    • 경영정보학연구
    • /
    • 제5권2호
    • /
    • pp.151-168
    • /
    • 2003
  • A knowledge portal is an integrated gateway for accessing relevant knowledge, collaborating and communicating with other users, and also linking internal applications which is becoming crucial in the age of information abundance. Research and development is a typical knowledge-intensive activity. However, knowledge management support in R&D has been minimal in most research organizations. In this paper, a knowledge portal is designed to support team-based researches in science and technology for searching and browsing knowledge, and also communicating with other team members, coordinating research project and collaborating with other researchers. Automating knowledge acquisition from various knowledge sources, knowledge categorization by applying text categorization method, and knowledge recommendation can help to relieve management effort and increase the efficiency of knowledge management processes. A prototype system based on the suggested model is also presented.

풍석(楓石) 서유구(徐有榘)의 『임원경제지(林園經濟志)』 「인제지(仁濟志)」 '탕액운휘(湯液韻彙)'와 처방 제형에 대한 연구 - '방(方)'을 중심으로 - (A Study on the 'Tangaek-Unhoei(湯液韻彙)' Index of Herbal Medicine in the Inje-Ji(仁濟志) of the Imwon-Gyeongje-Ji(林園經濟志), by Seo-Yugu(徐有榘) Focusing on 'Fang(方)')

  • 전종욱
    • 대한한의학원전학회지
    • /
    • 제36권4호
    • /
    • pp.25-40
    • /
    • 2023
  • Objectives : This paper studies the Tangaek-Unhoei(湯液韻彙) index of herbal medicine in the Inje-Ji(仁濟志) of the Imwon-Gyeongje-Ji(林園經濟志), which contains about 4,800 formulas. Created by 19th-century Joseon scholar Seo, Yugu, it not only lists the formulas according to their names, but also provides index by topic, which enabled the collection and effective application of massive medical information. Methods : We quantitatively examined the nearly 4,800 herbal medicines in the Tangaek-Unhoei and their categorization. Any uncommon or particular categorization was examined further by analyzing the original text. Results & Conclusions : The prescriptions contained in the Inje-Ji are categorized under 26 headings. They are listed according to the 106 units of the Chinese character dictionary and organized by double headings. This unique index makes it easy to browse the contents of such a vast book containing massive medicinal knowledge. In addition, the fifty or so remedies called 'Fang(方)' exemplify the author's attitude toward medicinal knowledge, which is both rational and inclusive. This is an attitude that should be recognized beyond tradition.

네트워크 분석을 이용한 애플리케이션 서비스 하위 카테고리 분류: 헬스케어 어플리케이션 중심으로 (Categorizing Sub-Categories of Mobile Application Services using Network Analysis: A Case of Healthcare Applications)

  • 하소희;금영정
    • 한국전자거래학회지
    • /
    • 제25권3호
    • /
    • pp.15-40
    • /
    • 2020
  • 모바일 애플리케이션 서비스 시장의 폭발적으로 성장함에 따라 애플리케이션 서비스를 고객과 개발자 관점에서 분류하는 것이 필요한 실정이다. 그러나 모바일 애플리케이션 서비스의 체계적 분류에 관한 연구는 제한적이다. 이에 본 연구에서는 네트워크 모듈성 분석을 통하여 모바일 애플리케이션 서비스의 분류하고 하위 카테고리를 제안하고자 한다. 구글플레이(GooglePlay)를 통해 총 1,607개의 헬스케어 관련 애플리케이션 서비스를 수집한 후 각 애플리케이션 서비스의 설명(description) 텍스트를 활용하여 유사도를 측정하고 이를 바탕으로 네트워크 분석을 수행하였다. 모듈성 분석을 수행하여 전체 네트워크의 커뮤니티를 탐지한 후, 각 클러스터를 기반으로 서비스 분류법을 도출한다. 이번 연구는 모바일 애플리케이션 서비스를 체계적으로 탐색하고자 하는 고객과 모바일 애플리케이션 서비스의 트렌드를 분석하고자 하는 개발자 모두에게 도움이 되는 서비스 분류에 대한 체계적인 접근방식이 될 것으로 기대된다.