• Title/Summary/Keyword: 내포된 문서

Search Result 55, Processing Time 0.029 seconds

An Efficient Selection Method for Document Classification Based On Singular Value Decompostion (문서분류에서 SVD(Singular Value Decompotion)기법에 기초한 효율적인 특징 선택방법 연구)

  • Li, Cheng-hua;Byun, Dong Ryul;Park, Soon Cheol
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2009.11a
    • /
    • pp.321-322
    • /
    • 2009
  • 본 논문에서는 문서분류를 위하여 SVD(Singular Value Decomposition)을 이용한 효율적인 특징 선택 방법을 제안한다. 분류기 알고리즘은 문서를 효과적으로 분류할 수 있지만 분류기에 입력되는 특징공간이 너무 크다는 단점이 있다. SVD를 이용하면 입력 데이터의 차원을 줄여줄 수 있으며 문서와 문서 사이의 관계성을 내포하는 벡터공간을 만들 수 있다. 따라서 SVD를 이용하면 문서분류의 시간과 효율을 동시에 증가시킬 수 있다. 본 논문에서는 실험을 통하여 SVD을 이용한 문서분류 시스템이 입력데이터에 대한 차원을 감소시키면서 훌륭한 분류 결과를 얻을 수 있음을 보여준다.

CALS/EC 통합문서관리 모형 개발

  • 임만택
    • Proceedings of the CALSEC Conference
    • /
    • 1998.10b
    • /
    • pp.335-344
    • /
    • 1998
  • 조직의 내외 부에서 추진되고있는 CALS/EC개념이 인터넷의 발전과 함께 우리의 주변에서 생성되는 많은 문서들에 대한 효율적인 관리가 절실히 요구되고 있다. 이러한 다양한 문서들에 대한 체계적인 관리기술로서 기록관리, 양식관리, 보고서관리, 제반규정관리, 저장관리, 검색관리 등을 통하여 최종사용자에게 적기적시에 제공할 수 있는 통합적인 시스템이 필요하다. 이에 관계되는 요소기술로서 EDM(Electronic Document Management), Image Document Management, COLD(Computer Output to Laser Disk), Hypermedia, Workflow, Knowledge Management 및 Groupware등이 개별적으로 또는 일부는 상호 연계되고 있으나, 통합적으로 상호 운용성 측면에서는 많은 문제들이 내포되어있다. 따라서 본 고에서는 이러한 CALS/EC개념에 입각한 문서관리의 효율적인 관리방법을 살펴보고, 다양한 형태의 기능별 문서에 대하여 통합적으로 관리할 수 있는 통합문서관리시스템에 대한 모형을 제시하고자 한다.

  • PDF

Proposing and Validating an Automated Method of Cognitive Knowledge Structure Creation from Single Documents (단일 문서 기반의 인지적 지식구조 자동 생성 기법 제안 및 검증)

  • Kim, Hyung-Woo;Yi, Mun-Y.
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2011.06a
    • /
    • pp.247-250
    • /
    • 2011
  • 본 연구는 단일 문서로부터 문서가 내포하고 있는 지식정보를 지식구조 혹은 인지스키마로 불리는 형태로 자동 생성하는 기법을 제안한다. 제안된 기법을 이용하여 자동 생성된 지식구조는 실제 문서 학습자의 학습 전, 후의 지식구조, 문서의 해당 지식을 명확히 알고 있는 도메인 전문가의 지식구조와의 유사도 측정을 통해 검증하였다. 자동 생성된 지식구조는 학습자의 학습 후 지식구조, 전문가 지식구조와 상당한 유사성을 보이며, 문서의 지식 정보를 인지적인 관점에서 정교하게 표현 하고 있음을 확인하였다. 이는 기존의 단어 기반의 정보 기술들에서 더욱 고차원적인 지식 정보를 활용한 지식구조 기반 정보 기술의 연구 가능성을 제시한다.

Design of a Mapping Structure of XML DTDs to Relational Tables (XML DTD로부터 관계형 테이블로의 사상구조 설계)

  • 박은경;정채영;김현주;배종민
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2001.04b
    • /
    • pp.133-135
    • /
    • 2001
  • 데이터로서 XML 역할에 대한 중요성이 증대되어감에 따라, 구조 정보를 내포하고 있는 데이터로서의 XML 문서를 효과적으로 관리하는 구조설계 및 질의어 처리에 대한 연구가 활발히 진행되고 있다. XML 저장구조는 XML 스키마에 의존하지 안고, 반구조적 데이터에 대한 저장과 질의처리 설계방법과 DTD와 같은 XML 스키마를 기반으로 저장구조를 설계하는 방법이 있다. DTD는 XML 문서의 논리적인 구조정보를 표현하는 역할을 가지고 있으며, 그러한 역할은 이 기종간의 문서교환시 더욱 중요해진다. DTD 기반의 XML문서를 관계형 테이블로 사상하고자 할 때, 사상과정이 자동적으로 이루어지는 경우와 사용자가 관리자가 직접 테이블 생성에 관여하는 수동적인 사상방법이 있다. 수동적인 사상과정은 질의처리가 구현시 데이터베이스 설계 방법에 크게 의존하게 되는 단점이 있지만, 사용자가 주어진 DTD 구조에 따라서 특정 응용에 알맞은 저장구조를 직접 설계하기 때문에 더 효율적인 저장구조를 설계할 수 있다. 본 논문에서는 관계형 DB를 질의처리 하기 위한 하부 저장소로 사용하고, DTD 기반의 XML 문서를 관계형 DB 테이블간의 수동적인 사상과정을 통하여 효율적인 XML 문서 저장구조를 설계하는 방법을 제시한다.

  • PDF

Entity embedding based on RELIC for Entity linking of Korean (RELIC기반 엔터티 임베딩을 이용한 한국어 엔터티 링킹)

  • Choi, Heyon-Jun;Na, Seung-Hoon;Kim, Hyun-Ho;Kim, Seon-Hoon;Kang, Inho
    • Annual Conference on Human and Language Technology
    • /
    • 2020.10a
    • /
    • pp.128-131
    • /
    • 2020
  • 엔터티 링킹은 주어진 문서 상에서 엔터티가 내포된 부분에 어떤 엔터티가 연결되어야 하는 지를 판단하는 작업이다. 따라서, 이 과정에서 엔터티의 표상을 얻어내는 것이 엔터티 링킹의 성능에 큰 영향을 끼치게 된다. 이 논문에서는 RELIC을 통해 엔터티 임베딩을 얻어내고, 이를 엔터티 링킹에 적용시킨 결과 0.57%p의 성능 향상을 이루었다.

  • PDF

Unsupervised News Article Summarization Using VNA Sets (VNA 집합을 이용한 뉴스기사의 중요문장 추출)

  • Na, Jong-Yeol;Sin, Ji-Ae;Choe, Gi-Seon
    • Annual Conference on Human and Language Technology
    • /
    • 2007.10a
    • /
    • pp.165-168
    • /
    • 2007
  • 본 연구에서는 문서의 문장들을 순위화하여 추출하는 일반적인 문서 요약 방법론을 소개한다. 첫 번째 단계는 주제와 관련되는 동사, 명사, 형용사(VNA) 단어들의 집합을 구하여 각 문장의 주제 관련성 정도를 결정하며, 두 번째 단계는 단어들의 의존관계를 통해 각 문장의 정보 함유량을 판단한다. 두 개의 방법은 모두 주제와 관련된 정보를 많이 내포하는 문장에 중요도를 부여하고 있다. 이러한 방법은 주제와 연관성이 높고 정보전달성이 높은 문서요약을 만들기 위함이다. 생성된 문서요약본의 성능평가는 문서요약의 결과로 추출된 문장들과 설문에 의해 추출된 문장들의 일치율에 의해 시행되었으며 68%의 일치율을 보였다.

  • PDF

An Automatic Question Routing System using Machine Learning (기계학습 기법을 이용한 전자게시판 질문 자동 분류)

  • 최형림;류광렬;강재호;신종일;이창섭
    • Proceedings of the Korea Inteligent Information System Society Conference
    • /
    • 2003.05a
    • /
    • pp.313-318
    • /
    • 2003
  • 인터넷의 급격한 발전과 광범위한 보급에 따라 과거 전화, 서신 또는 직접방문을 통하여 해결하던 고객상담의 상당부분은 인터넷을 이용한 전자우편 및 전자게시판을 이용하는 방향으로 꾸준히 대치되고 있다. 인터넷을 통한 고객과의 접촉방식의 대부분을 차지하는 전자우편과 전자게시판은, 기존의 방식 특히 전화에 비하여 즉각적인 응답을 기대하기가 어렵다는 측면이 고객에게는 가장 큰 불만사항이 되고 있다. 본 논문에서는 문서로 이루어진 전자우편 또는 전자게시판의 고객 상담 내용을 기계학습의 분류기법을 활용하여 담당자를 자동으로 선정함으로써 보다 신속히 고객의 요구에 반응할 수 있는 효과적인 방법을 제안한다. 실제 수집한 다년간의 데이터를 기반으로 다양한 분류기법의 성능을 비교 평가하였으며, 그 결과 k-NN을 이용한 기법이 성능 및 활용도 측면에서 유리함을 보였다 또한, 인터넷을 통한 질문의 경우 상당 수준의 오탈자 및 띄어쓰기 오류를 내포하고 있는데, 바이그램을 이용한 문서처리방법을 이용함으로써 이러한 상황에 효과적으로 대처할 수 있으며, 바이그램으로 문서 처리 시 발생할 수 있는 시스템의 부담을 큰 성능의 저하 없이 최소화하기 위하여 자주 등장한 단어만을 선정하는 방안이 실용성이 있음을 확인하였다.

  • PDF

Similar Patent Search Service System using Latent Dirichlet Allocation (잠재 의미 분석을 적용한 유사 특허 검색 서비스 시스템)

  • Lim, HyunKeun;Kim, Jaeyoon;Jung, Hoekyung
    • Journal of the Korea Institute of Information and Communication Engineering
    • /
    • v.22 no.8
    • /
    • pp.1049-1054
    • /
    • 2018
  • Keyword searching used in the past as a method of finding similar patents, and automated classification by machine learning is using in recently. Keyword searching is a method of analyzing data that is formalized through data refinement. While the accuracy for short text is high, long one consisted of several words like as document that is not able to analyze the meaning contained in sentences. In semantic analysis level, the method of automatic classification is used to classify sentences composed of several words by unstructured data analysis. There was an attempt to find similar documents by combining the two methods. However, it have a problem in the algorithm w the methods of analysis are different ways to use simultaneous unstructured data and regular data. In this paper, we study the method of extracting keywords implied in the document and using the LDA(Latent Semantic Analysis) method to classify documents efficiently without human intervention and finding similar patents.

Bootstrap Mining for Searching Similar Content of XML Data (XML 데이터의 유사내용 검색을 위한 Bootstrap Mining)

  • Lee Han-Su;Park Jong-Hyun;Kang Ji-Hoon
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2005.11a
    • /
    • pp.517-519
    • /
    • 2005
  • 인터넷 상의 정보교환을 위한 국제표준인 XML은 여러 분야의 응용에 사용되며 응용의 특성에 따라 다양한 형태의 구조로 정의되어 사용된다. 이러한 XML은 응용에 따라 의미적으로 유사한 정보라 하더라도 서로 다른 구조정보를 가질 수 있으며 때로는 스키마(DTD)가 없는 XML문서 형태로 존재하기도 한다. 그 결과 특정 영역(동일 스키마 따르는)의 응용들 사이의 통합은 용이해 졌으나 서로 다른 영역 또는 영역에서 소외된 응용과의 통합은 여전히 문제로 남아있다. 본 연구에서는 대부분의 XML문서는 구조정보에 의미를 내포하고 있다는 특성을 고려하여 문서의 구조정보만을 이용하여 서로 다른 영역의 정보들 사이의 유사성을 판단하고 이를 이용하여 의미적으로 유사한 정보를 찾는다. 또한 XML 문서의 특성을 고려하여 보다 정확한 유사정보를 찾기 위하여 처리의 단위를 정의하고 이를 기반으로 프로토타입 시스템을 구현하였다.

  • PDF

The Off-line Verification System of Signature of Handwrite (필적 및 서명에 대한 Off-line 자동분석시스템)

  • Kim, Sei-Hoon;Ha, Jeung-Yo;Kim, Gye-Young;Choi, Hyung-Il
    • 한국HCI학회:학술대회논문집
    • /
    • 2007.02c
    • /
    • pp.189-193
    • /
    • 2007
  • 필적 감정은 개인의 고유한 필적 개성을 이용하여 임의의 두 필기 문장 또는 텍스트가 동일인에 의해 작성되었는지를 판별하는 기술로 유서대필 및 보안수사, 서명의 검증, 범죄 수사 등에 활용되어지고 있다. 이러한 작업은 감정 전문가의 판단기준에 의해 필적의 유사성을 판별하기 때문에 객관성 결여 및 과도한 소요 시간, 과도한 처리비용의 문제를 내포하게 된다. 이러한 문제를 해결하여 판별의 객관성과 업무의 신속한 처리를 가능하게 하기 본 논문에서는 컴퓨터를 통한 패턴 분석을 적용하여 두 필적의 유사성을 판별하는 방법을 본 논문에서는 제안한다. 이를 위하여 본 논문은 학습단계와 자동분석단계로 나뉘며, 학습단계에서는 입력된 문서영상에서 필적의 영역을 추출한 후, 특징을 추출하고 DTW연산을 통하여 학습을 한다. 자동분석단계에서는 대조할 문서영상에서의 특징을 추출하고 입력된 문서영상과 대조할 문서영상간의 마할라노비스 거리(Mahalanobis Distance)를 구하여 서명 및 필적에 대한 유사도를 도출한다. 실험은 4명의 필적을 이용하여 비교하였으며, 우수한 결과를 보였다.

  • PDF