• 제목/요약/키워드: text extraction

검색결과 453건 처리시간 0.026초

Main Content Extraction from Web Pages Based on Node Characteristics

  • Liu, Qingtang;Shao, Mingbo;Wu, Linjing;Zhao, Gang;Fan, Guilin;Li, Jun
    • Journal of Computing Science and Engineering
    • /
    • 제11권2호
    • /
    • pp.39-48
    • /
    • 2017
  • Main content extraction of web pages is widely used in search engines, web content aggregation and mobile Internet browsing. However, a mass of irrelevant information such as advertisement, irrelevant navigation and trash information is included in web pages. Such irrelevant information reduces the efficiency of web content processing in content-based applications. The purpose of this paper is to propose an automatic main content extraction method of web pages. In this method, we use two indicators to describe characteristics of web pages: text density and hyperlink density. According to continuous distribution of similar content on a page, we use an estimation algorithm to judge if a node is a content node or a noisy node based on characteristics of the node and neighboring nodes. This algorithm enables us to filter advertisement nodes and irrelevant navigation. Experimental results on 10 news websites revealed that our algorithm could achieve a 96.34% average acceptable rate.

계층적 특징 결합 및 검증을 이용한 자연이미지에서의 장면 텍스트 추출 (Scene Text Extraction in Natural Images using Hierarchical Feature Combination and Verification)

  • 최영우;김길천;송영자;배경숙;조연희;노명철;이성환;변혜란
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제31권4호
    • /
    • pp.420-438
    • /
    • 2004
  • 이미지에 인위적 또는 자연적으로 포함된 텍스트는 이미지의 내용을 함축적이고 구체적으로 표현하는 중요한 정의이다. 이러한 정보를 실시간에 추출하여 정확히 인식할 수 있다면 다양한 분야에서 활용될 수 있다. 본 논문에서는 자연이미지에 포함된 장면 텍스트를 추출하는 방법으로서 텍스트의 색 연속성, 자기 변화 및 색 변화와 같은 낮은 수준의 이미지 특징으로 텍스트 후보 영역을 찾고, 다해상도 (Multi-resolution) 웨이블릿(Wavelet) 변환을 이용하여 높은 수준의 텍스트 특징인 획의 구성 여부로 검증하는 계층적인 구조를 제안한다. 색 연속성 특징은 대부분의 텍스트는 동일한 색으로 구성된다는 특징을 이용하는 것이고, 밝기 변화 특징은 텍스트 영역은 주변과의 밝기 변화가 존재하며 에지 밀도가 높은 특징을 이용한다. 또한, 색 변화 특징은 텍스트 영역은 주변 배경과의 색 변화가 존재하며, 밝기 변화보다 민감한 색 분산 값으로 표현할 수 있다는 장점을 이용한다. 높은 수준의 텍스트 특징으로서 다해상도 웨이블릿 변환을 이용하여 텍스트 획의 방향성 정보를 추출하고, 추출된 정보를 SVM(Support Vector Machine) 분류기로 검증하여 최종 영역을 확정한다. 제안한 방법을 다양한 종류의 이미지에 적용한 결과 배경이 복잡해도 비교적 안정적으로 텍스트 영역을 추출하는 것을 확인할 수 있었다.

장면 텍스트 추출을 위한 캐니 연산자의 적응적 임계값을 이용한 AEMSER (AEMSER Using Adaptive Threshold Of Canny Operator To Extract Scene Text)

  • 박순화;김동현;임현수;김홍훈;백재경;박재흥;서영건
    • 디지털콘텐츠학회 논문지
    • /
    • 제16권6호
    • /
    • pp.951-959
    • /
    • 2015
  • 장면 텍스트 추출은 현대 스마트 시대에서 쏟아져 나오는 다양한 영상 기반 응용에 중요한 정보를 제공하기 때문에 중요하다. 기본적인 MSER(Maximally Stable Extremal Regions) 추출 후에 캐니 연산자를 이용하여 경계를 강화시키는 Edge-Enhanced MSER은 텍스트 추출 측면에서 뛰어난 성능을 보인다. 하지만 캐니 연산자의 임계값 설정에 따라 Edge-Enhanced MSER의 결과영상이 다르게 나타나므로 임계값 설정을 계산하는 방법이 필요하다. 본 논문에서는 캐니 연산자의 임계값을 설정하는 방법 중 히스토그램의 중앙값을 이용하여 경계를 추출하고 이를 Edge-Enhanced MSER에 적용한 AEMSER(Adaptive Edge-enhanced MSER)을 제안한다. 이 방법은 명확한 경계에 대해서만 영역을 추출하기 때문에 기존의 방법보다 더 좋은 결과영상을 얻을 수 있다.

태그 서열 위치와 경사 부스팅을 활용한 한국어 웹 본문 추출 (Korean Web Content Extraction using Tag Rank Position and Gradient Boosting)

  • 모종훈;유재명
    • 정보과학회 논문지
    • /
    • 제44권6호
    • /
    • pp.581-586
    • /
    • 2017
  • 웹 문서를 자동으로 수집하면 대량의 정보를 손쉽게 모을 수 있다. 이러한 정보 수집 과정을 위해 웹 문서에서 메뉴, 광고 등 불필요한 정보를 제거하고 본문을 자동으로 추출할 필요가 있다. 특히 한국어 웹문서는 영어권과 달리 메타데이터가 포함된 경우가 드물고 디자인이 복잡하여 한국어 웹에 맞는 자동 본문 추출 방법이 필요하다. 기존의 본문 추출 방법은 주로 본문 블록의 문자적, 구조적 특성을 활용한다. 시각적 특성을 처리하기 위해서는 렌더링, 이미지 처리 등에 많은 계산이 필요하기 때문이다. 이 논문에서는 HTML에서 태그 위치를 준-시각적 특성으로 활용한 새로운 본문 추출 방법을 제시한다. 태그 위치는 텍스트의 길이에 따라 가변적이기 때문에 태그 서열 위치라는 특성을 개발하였고, 이를 경사 부스팅과 함께 이용하면 정확한 본문 추출이 가능함을 보인다. 본 논문의 연구 결과는 텍스트 분석에 필요한 양질의 문서 자료를 다양한 형태의 웹페이지에서 자동으로 수집하는 데에 쓰일 수 있다.

온톨로지 자동추출도구의 기능적 성능 평가를 위한 평가지표의 개발 및 적용 (Measurement Criteria for Ontology Extraction Tools)

  • 박진수;조원진;노상규
    • 지능정보연구
    • /
    • 제14권4호
    • /
    • pp.69-87
    • /
    • 2008
  • 이제 인터넷은 시맨틱 웹(Semantic Web)의 형태로 진화 발전하고 있다. 그 결과 시맨틱 웹의 지식을 표현하는 백본 인 온톨로지가 매우 중요하게 인식되고 있다. 그러나 온톨로지를 구축하는 것은 많은 시간과 자원을 필요로 하는 작업이다. 이로 인해 온톨로지 추출도구(ontology extraction tool)에 대한 개발의 필요성이 지난 십여 년간 제기되어 왔으며, 온톨로지를 자동으로 추출하거나 온톨로지 구축을 돕는 도구들이 개발되었다. 그러나 여러 온톨로지 자동추출도구들 중에 구축하고자 하는 온톨로지의 사용자 요구사항에 적합한 자동추출도구를 선택하기 위해서는 이런 도구들에 대한 평가지표가 필요하다. 하지만, 현재 이런 도구들을 평가하기 위한 포괄적인 평가 프레임워크(comprehensive evaluation framework)가 존재하지 않는다. 본 연구에서는, 문헌연구를 수행하여 온톨로지 자동추출도구가 갖춰야 할 핵심 요소들을 찾고, 온톨로지 추출도구들을 평가하기 위한 일련의 평가지표들을 개발했다. 또한 본 연구에서 제안하는 평가지표에 따라 온톨로지 자동추출도구인 OntoLT, Text-To-Onto, TERMINAE, OntoBuilder를 평가해 보았다.

  • PDF

뉴스 비디오 자막 추출 및 인식 기법에 관한 연구 (Study on News Video Character Extraction and Recognition)

  • 김종열;김성섭;문영식
    • 대한전자공학회논문지SP
    • /
    • 제40권1호
    • /
    • pp.10-19
    • /
    • 2003
  • 비디오 영상에 포함되어 있는 자막은 비디오의 내용을 함축적으로 표현하고 있기 때문에 비디오 색인 및 검색에 중요하게 사용될 수 시다. 본 논문에서는 뉴스 비디오로부터 폰트, 색상, 자막의 크기 등과 같은 사전 지식 없이도 자막을 효율적으로 추출하여 인식하는 방법을 제안한다. 문자 영역의 추출과정에서 문자영역은 뉴스 비디오의 여러 프레임에 걸쳐나 나오기 때문에 인길 프레임의 차영상을 통해서 동일한 자막 영역이 존재하는 프레임을 자동적으로 추출한 후, 이들의 시간적 평균영상을 만들어 인식에 사용함으로써 인식률을 향상한다. 또한, 평균 영상의 외각선 영상을 수평, 수직방향으로 투영한 값을 통해 문자 영역을 찾아 Region filling, K-means clustering을 적용하여 배경들을 완벽하게 제거함으로써 최종적인 자막 영상을 추출한다. 자막 인식과정에서는 문사 영역 추출과정에서 추출된 글자영상을 사용하여 white run, zero-one transition과 같은 비교적 간단한 특징 값을 추출하여 이를 비교함으로써 인식과정을 수행한다. 제한된 방법을 다양한 뉴스 비디오에 적용하여 문자영역 추출 능력과 인식률을 측정한 결과 우수함을 확인하였다.

Effective Thematic Words Extraction from a Book using Compound Noun Phrase Synthesis Method

  • Ahn, Hee-Jeong;Kim, Kee-Won;Kim, Seung-Hoon
    • 한국컴퓨터정보학회논문지
    • /
    • 제22권3호
    • /
    • pp.107-113
    • /
    • 2017
  • Most of online bookstores are providing a user with the bibliographic book information rather than the concrete information such as thematic words and atmosphere. Especially, thematic words help a user to understand books and cast a wide net. In this paper, we propose an efficient extraction method of thematic words from book text by applying the compound noun and noun phrase synthetic method. The compound nouns represent the characteristics of a book in more detail than single nouns. The proposed method extracts the thematic word from book text by recognizing two types of noun phrases, such as a single noun and a compound noun combined with single nouns. The recognized single nouns, compound nouns, and noun phrases are calculated through TF-IDF weights and extracted as main words. In addition, this paper suggests a method to calculate the frequency of subject, object, and other roles separately, not just the sum of the frequencies of all nouns in the TF-IDF calculation method. Experiments is carried out in the field of economic management, and thematic word extraction verification is conducted through survey and book search. Thus, 9 out of the 10 experimental results used in this study indicate that the thematic word extracted by the proposed method is more effective in understanding the content. Also, it is confirmed that the thematic word extracted by the proposed method has a better book search result.

Machine Printed and Handwritten Text Discrimination in Korean Document Images

  • Trieu, Son Tung;Lee, Guee Sang
    • 스마트미디어저널
    • /
    • 제5권3호
    • /
    • pp.30-34
    • /
    • 2016
  • Nowadays, there are a lot of Korean documents, which often need to be identified in one of printed or handwritten text. Early methods for the identification use structural features, which can be simple and easy to apply to text of a specific font, but its performance depends on the font type and characteristics of the text. Recently, the bag-of-words model has been used for the identification, which can be invariant to changes in font size, distortions or modifications to the text. The method based on bag-of-words model includes three steps: word segmentation using connected component grouping, feature extraction, and finally classification using SVM(Support Vector Machine). In this paper, bag-of-words model based method is proposed using SURF(Speeded Up Robust Feature) for the identification of machine printed and handwritten text in Korean documents. The experiment shows that the proposed method outperforms methods based on structural features.

텐서보팅을 이용한 텍스트 배열정보의 획득과 이를 이용한 텍스트 검출 (Extraction of Text Alignment by Tensor Voting and its Application to Text Detection)

  • 이귀상;또안;박종현
    • 한국정보과학회논문지:소프트웨어및응용
    • /
    • 제36권11호
    • /
    • pp.912-919
    • /
    • 2009
  • 본 논문에서는 이차원 텐서보팅과 에지 기반 방법을 이용하여 자연영상에서 문자를 검출하는 새로운 방법을 제시한다. 텍스트의 문자들은 보통 연속적인 완만한 곡선 상에 배열되어 있고 서로 가깝게 위치하며, 이러한 특성은 텐서보팅에 의하여 효과적으로 검출될 수 있다. 이차원 텐서보팅은 토큰의 연속성을 curve saliency 로 산출하며 이러한 특성은 다양한 영상해석에 사용된다. 먼저 에지 검출을 이용하여 영상 내의 텍스트 영역이 위치할 가능성이 있는 텍스트 후보영역을 찾고 이러한 후보영역의 연속성을 텐서보팅에 의해 검증하여 잡음영역을 제거하고 텍스트 영역만을 구분한다. 실험 결과, 제안된 방법은 복잡한 자연영상에서 효과적으로 텍스트 영역을 검출함을 확인하였다.

TAKES: Two-step Approach for Knowledge Extraction in Biomedical Digital Libraries

  • Song, Min
    • Journal of Information Science Theory and Practice
    • /
    • 제2권1호
    • /
    • pp.6-21
    • /
    • 2014
  • This paper proposes a novel knowledge extraction system, TAKES (Two-step Approach for Knowledge Extraction System), which integrates advanced techniques from Information Retrieval (IR), Information Extraction (IE), and Natural Language Processing (NLP). In particular, TAKES adopts a novel keyphrase extraction-based query expansion technique to collect promising documents. It also uses a Conditional Random Field-based machine learning technique to extract important biological entities and relations. TAKES is applied to biological knowledge extraction, particularly retrieving promising documents that contain Protein-Protein Interaction (PPI) and extracting PPI pairs. TAKES consists of two major components: DocSpotter, which is used to query and retrieve promising documents for extraction, and a Conditional Random Field (CRF)-based entity extraction component known as FCRF. The present paper investigated research problems addressing the issues with a knowledge extraction system and conducted a series of experiments to test our hypotheses. The findings from the experiments are as follows: First, the author verified, using three different test collections to measure the performance of our query expansion technique, that DocSpotter is robust and highly accurate when compared to Okapi BM25 and SLIPPER. Second, the author verified that our relation extraction algorithm, FCRF, is highly accurate in terms of F-Measure compared to four other competitive extraction algorithms: Support Vector Machine, Maximum Entropy, Single POS HMM, and Rapier.