• Title/Summary/Keyword: Document-Classification

Search Result 448, Processing Time 0.032 seconds

Spam Classification by Analyzing Characteristics of a Single Web Document (단일 문서의 특징 분석을 이용한 스팸 분류 방법)

  • Sim, Sangkwon;Lee, Soowon
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2014.11a
    • /
    • pp.845-848
    • /
    • 2014
  • 블로그는 인터넷에서 개인의 정보나 의견을 표출하고 커뮤니티를 형성하는데 사용되는 중요한 수단이나, 광고 유치, 페이지 순위 올리기, 쓰레기 데이터 생성 등 다양한 목적을 가진 스팸블로그가 생성되어 악용되기도 한다. 본 연구에서는 이러한 문제를 해결하기 위해 웹 문서에서 나타나는 특징들을 이용한 스팸 탐지 기법을 제안한다. 먼저 블로그 본문의 길이, 태그의 비율, 태그 수, 이미지 수, 랭크의 수 등 하나의 웹 문서에서 추출할 수 있는 특징을 기반으로 각 문서에 대한 특징 벡터를 생성하고 기계학습을 통해 모델을 생성하여 스팸 블로그를 판별한다. 제안 방법의 성능 평가를 위해 블로그 포스트 데이터를 사용하여 제안방법과 기존의 스팸 분류 연구를 비교 실험을 진행하였다. Bayesian 필터링 기법을 사용하는 기존연구와 비교 실험 결과, 제안방법이 더 좋은 정확도를 가지면서 특징 추출 속도 및 메모리 사용 효율성을 보였다.

Analysis and Design for the System of Korean Web Document Classification (웹문서분류체계의 분석 및 새로운 설계)

  • Nam Young-Joon
    • Journal of the Korean Society for Library and Information Science
    • /
    • v.32 no.3
    • /
    • pp.207-230
    • /
    • 1998
  • Because of a rapid increase of information available through web site, a user often falls into confusion of which web sites should be visited for his information needs. If a web site search engine can classify web sites according to their subject or topics, it can help the user to determine which web sites are worth accessing and thus to easily acquire relevant information. In this study, I propose new classifying system with a two level hierarchy and 57 items.

  • PDF

Extraction of Field-Associated Term for the Purpose of Document Classification (문서분류용 목적으로 이용할 효율적인 연상정보의 추출방법)

  • Choi, Hyun;Hwang, Nam-Seon;Lee, Samuel Sangkon
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2004.04b
    • /
    • pp.892-894
    • /
    • 2004
  • 분야연상어는 어휘자체가 분야정보를 가지므로 인간이 분야를 인지할 때와 유사하게 문서의 분야를 판단한다. 인간이 한국어와 일본어의 180분야로 분류한 약 15,000개의 문서뱅크를 수집하고, 수집된 문서에서 복합어로 구성된 분야연상어의 효율적인 추출 알고리즘을 제안한다. 제안된 알고리즘으로 자동구축된 분야연상어를 문서분류의 초기결정에 이용할 수 있다. 분야연상어를 이용하면 어떠한 분야체계에도 손쉽게 적용할 수 있으므로 문서분류용 목적으로 이용할 수 있는 보편성은 충분하다.

  • PDF

Document Classification of Green Technology Literature based on Support Vector Machines (녹색기술문헌 자동 범주화를 위한 문서 분류기 개발)

  • Joo, Won-Kyun;Park, Min-Woo;Choi, Ki-Seok
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2012.11a
    • /
    • pp.1762-1763
    • /
    • 2012
  • 최근에 이슈화되고 있는 녹색기술문헌의 중요성에 부합하여 녹색기술 문헌을 자동으로 분류해주는 문서 분류시스템 개발하였다. 분류체계로는 14개의 관심 녹색기술 분류 체계를 선택하였고, 다양한 문서 분류 기법 중 SVM(Support Vector Machine)에 기초를 둔 방법을 이용하였다. 문서 벡터를 생성할 때 제목과 본문에 동일한 가중치를 적용하는 방법을 벗어나서 제목의 키워드에 좀 더 높은 가중치를 부여하는 방식을 적용하여 성능평가를 수행하였다.

A Hyperlink-based Feature Weighting Technique for Web Document Classification (웹문서 자동 분류를 위한 하이퍼링크 기반 특징 가중치 부여 기법)

  • Lee, A-Ram;Kim, Han-Joon
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2012.11a
    • /
    • pp.417-420
    • /
    • 2012
  • 기계학습을 이용하는 문서 자동분류 시스템은 분류모델의 구성을 위해서 단어를 특징으로 사용한다. 자동분류 시스템의 성능을 높이기 위해 보다 의미있는 특징을 선택하여 분류모델을 구성하기 위한 여러 연구가 진행되고 있다. 특히 인터넷상에서 사용되는 웹문서는 단어 외에도 태그정보, 링크정보를 가지고 있다. 본 논문에서는 이 두 가지 정보를 이용하여 웹문서 자동분류 시스템의 성능을 향상 시키는 방법 제안 한다. 태그 정보와 링크 정보를 이용하여 적절한 특징을 선택하고, 각 특징의 중요도를 계산하여 가중치를 구한다. 계산된 가중치를 각 특징에 부여하여 분류 모델을 구성하고 나이브 베이지안 분류기를 통하여 성능을 평가하였다

Implementation of Web-based Document Classification System using Naïve Classifier (Naïve 분류기를 이용한 웹 기반 문서 분류기 구현)

  • Park, Jea-Hyun;Choi, Kwang-Bok;Han, Ju-Hyun;Choi, Won-Jong;Yang, Jaeyoung;Choi, Joongmin
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2004.05a
    • /
    • pp.343-346
    • /
    • 2004
  • 베이지안 확률 모형은 문서 분류에서 널리 사용되는 이론이다. 그러나, 실제로 베이지안 이론에 기초하여 만들어진 시스템은 처리 시간이 많이 소요된다는 단점을 가지고 있다. 이 논문에서는 문서 분류 작업에 있어 기존의 베이지안 모형을 구현함과 동시에 여러 가지 방법을 통해 시간적인 측면을 개선한 시스템을 구현하였다.

  • PDF

IMPLEMENTATION OF PRODUCT DATA MANAGEMENT SYSTEM FOR DESIGN OF BRIDGE STRUCTURES

  • Jin-Suk Kang;Seung-Ho Jung;Yoon-Bum Lee;Kwang-Myong Lee
    • International conference on construction engineering and project management
    • /
    • 2009.05a
    • /
    • pp.1318-1323
    • /
    • 2009
  • In recent years, dramatic advances in information technology have motivated the construction industry to improve its productivity. Computer-based information technology includes Computer-Aided Design (CAD), Computer-Aided Engineering (CAE), Computer-Aided Manufacturing (CAM), Enterprise Resource Planning (ERP), Digital Mock-Up (DMU) and Product Data Management (PDM). Most construction industries are trying to apply these technologies for quality improvement, reduction of construction time and cost. PDM is very useful for managing data and process related to product design and manufacturing. PDM system has various functions such as drawing and engineering document management, product structure and structure modification management, part classification management, workflow management, and project management. In this paper, PDM system was applied to the design of steel-concrete composite girder bridge. To make a practical guidance for PDM implementation to bridge design, the procedure for its implementation was presented. Consequently, this paper could be useful to enhance the efficiency of bridge design.

  • PDF

An Efficient Selection Method for Document Classification Based On Singular Value Decompostion (문서분류에서 SVD(Singular Value Decompotion)기법에 기초한 효율적인 특징 선택방법 연구)

  • Li, Cheng-hua;Byun, Dong Ryul;Park, Soon Cheol
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2009.11a
    • /
    • pp.321-322
    • /
    • 2009
  • 본 논문에서는 문서분류를 위하여 SVD(Singular Value Decomposition)을 이용한 효율적인 특징 선택 방법을 제안한다. 분류기 알고리즘은 문서를 효과적으로 분류할 수 있지만 분류기에 입력되는 특징공간이 너무 크다는 단점이 있다. SVD를 이용하면 입력 데이터의 차원을 줄여줄 수 있으며 문서와 문서 사이의 관계성을 내포하는 벡터공간을 만들 수 있다. 따라서 SVD를 이용하면 문서분류의 시간과 효율을 동시에 증가시킬 수 있다. 본 논문에서는 실험을 통하여 SVD을 이용한 문서분류 시스템이 입력데이터에 대한 차원을 감소시키면서 훌륭한 분류 결과를 얻을 수 있음을 보여준다.

Automating Scanned Document Classification Using ColorCode (컬러코드를 이용한 스캔 문서 분류 자동화)

  • Sang-Kil Ahn;Byung-Uk Choi
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2008.11a
    • /
    • pp.766-769
    • /
    • 2008
  • 디지털 형태의 문서가 널리 퍼지고 끊임없이 증가함에 따라 이를 자동으로 가공하고 처리하는 문서자동분류의 중요성이 널리 인식되고 있다. 본 논문에서는 복합기에서 컬러코드를 인식하는 모듈을 탑재하여 스캔된 문서를 자동으로 분류하는 시스템을 제안하고자 한다. 복합기에서 컬러코드가 부착된 종이문서를 스캔한 다음 그 컬로코드를 추출하여 인식하고 해당 컬러코드와 관련된 문서관리정보에 따라 스캔문서를 복합기 내부의 지정 폴더에 저장하거나 다른 곳으로 전달하는 시스템이다. 이렇게 함으로써 종이문서를 전자화하는 과정에서 수작업으로 분류하는 시간을 줄일 수 있고 또한 사람에 의한 오류를 줄일 수 있다는 장점이 있다.

Decision Method of Importance of E-Mail based on User Profiles (사용자 프로파일에 기반한 전자 메일의 중요도 결정)

  • Lee, Samuel Sang-Kon
    • The KIPS Transactions:PartB
    • /
    • v.15B no.5
    • /
    • pp.493-500
    • /
    • 2008
  • Although modern day people gather many data from the network, the users want only the information needed. Using this technology, the users can extract on the data that satisfy the query. As the previous studies use the single data in the document, frequency of the data for example, it cannot be considered as the effective data clustering method. What is needed is the effective clustering technology that can process the electronic network documents such as the e-mail or XML that contain the tags of various formats. This paper describes the study of extracting the information from the user query based on the multi-attributes. It proposes a method of extracting the data such as the sender, text type, time limit syntax in the text, and title from the e-mail and using such data for filtering. It also describes the experiment to verify that the multi-attribute based clustering method is more accurate than the existing clustering methods using only the word frequency.