• Title/Summary/Keyword: 전자 텍스트

Search Result 447, Processing Time 0.024 seconds

Keyword Extraction from News Corpus using Modified TF-IDF (TF-IDF의 변형을 이용한 전자뉴스에서의 키워드 추출 기법)

  • Lee, Sung-Jick;Kim, Han-Joon
    • The Journal of Society for e-Business Studies
    • /
    • v.14 no.4
    • /
    • pp.59-73
    • /
    • 2009
  • Keyword extraction is an important and essential technique for text mining applications such as information retrieval, text categorization, summarization and topic detection. A set of keywords extracted from a large-scale electronic document data are used for significant features for text mining algorithms and they contribute to improve the performance of document browsing, topic detection, and automated text classification. This paper presents a keyword extraction technique that can be used to detect topics for each news domain from a large document collection of internet news portal sites. Basically, we have used six variants of traditional TF-IDF weighting model. On top of the TF-IDF model, we propose a word filtering technique called 'cross-domain comparison filtering'. To prove effectiveness of our method, we have analyzed usefulness of keywords extracted from Korean news articles and have presented changes of the keywords over time of each news domain.

  • PDF

A Study on Indexing Method using Text Partition (텍스트분할에 의한 색인방법 연구)

  • 강무영;이상구
    • Journal of the Korean Society for information Management
    • /
    • v.16 no.4
    • /
    • pp.75-94
    • /
    • 1999
  • Indexing is a prerequisite function for the information retrieval system in order to retrieve the information of the documents effectively which are saved in database. As a digital data increases in accordance with the development of a computer, the numbers of literatures to be saved in database have also been increased in a large volume. To retrieve such documents of large volume, a lot of system resources and processing time will be required. In this paper, we suggest a advanced indexing method using text partition. This method can retrieve the documents of large volume in short processing time. We applied this suggested indexing method to real information retrieval system, and proved its excellent functions through the demonstration.

  • PDF

The Extraction of Effective Index Database from Voice Database and Information Retrieval (음성 데이터베이스로부터의 효율적인 색인데이터베이스 구축과 정보검색)

  • Park Mi-Sung
    • Journal of Korean Library and Information Science Society
    • /
    • v.35 no.3
    • /
    • pp.271-291
    • /
    • 2004
  • Such information services source like digital library has been asked information services of atypical multimedia database like image, voice, VOD/AOD. Examined in this study are suggestions such as word-phrase generator, syllable recoverer, morphological analyzer, corrector for voice processing. Suggested voice processing technique transform voice database into tort database, then extract index database from text database. On top of this, the study suggest a information retrieval model to use in extracted index database, voice full-text information retrieval.

  • PDF

Annotation Anchoring Methods in Structured Document Environments (구조문서 환경에서 Annotation의 앵커링 기법)

  • 손원성;김재경;최윤철;임순범
    • Proceedings of the Korea Multimedia Society Conference
    • /
    • 2003.05b
    • /
    • pp.476-479
    • /
    • 2003
  • 전자문서 환경에서의 annotation은 그 특성상 원본문서의 내용이 변경될 경우 annotation의 대상인 앵커를 더 이상 참조할 수 없게 된다. 따라서 annotation 시스템에서는 반드시 원본문서 변경에 대한 앵커링 기능을 필요로 한다. 그러나 기존 연구에서는 앵커 텍스트의 변경을 고려하지 않거나 일반 텍스트 문서만을 대상으로 한다. 본 논문에서는 XML과 같은 구조문서 환경에서의 annotation 앵커링 기법을 제안한다. 제안된 기법에서는 XML 환경에서 앵커 텍스트 및 path정보에 대한 단계별 앵커링 과정을 수행한다. 또한 본 논문에서는 제안된 기법에 근거한 사용자 인터페이스를 제공한다. 그 결과 제안된 기법 및 시스템에서는 구조문서 환경에서 기존 연구 보다 심도 있는 앵커링을 보장하며 동시에 IETM, cyber-class, eLearing, semantic web 등의 다양한 분야에 효과적으로 적용 가능하다.

  • PDF

PrefixLM for Korean text summarization (PrefixLM에 기반한 한국어 텍스트 요약)

  • Lee, Kun-Hui;Na, Seung-Hoon;Lim, Joon-Ho;Kim, Tae-Hyeong;Choi, Yun-Su;Chang, Du-Seong
    • Annual Conference on Human and Language Technology
    • /
    • 2021.10a
    • /
    • pp.22-27
    • /
    • 2021
  • 언어 모델은 많은 데이터와 많은 파라미터로 오래 사전학습을 수행할수록 그 성능이 높아지지만, 그 크기가 큰 만큼 거대 언어 모델은 너무 큰 크기로 인해서 실사용에 많은 하드웨어 리소스를 필요로 한다. 본 논문에서는 거대 언어 모델 중 하나인 T5의 인코더-디코더 구조 대비 절반의 크기를 가지는 PrefixLM 구조에 기반한 한국어 모델을 학습하여 자연어 처리에서 중요한 태스크 중 하나인 텍스트 생성 요약 태스크에서의 성능평가를 하여 BART, T5와 비교하여 각각 0.02, 0.0859의 성능 향상을 보였다.

  • PDF

Ontology-based Anti-Spam System using Semantic Inference Rules (의미추론규칙을 이용한 온톨로지 기반의 스팸방지 시스템)

  • Heu, Chung-Hwan;Jeong, Jin-Woo;Joo, Young-Do;Lee, Dong-Ho
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 2008.06c
    • /
    • pp.325-330
    • /
    • 2008
  • 전자우편(email)은 인터넷의 급격한 보급으로 인하여 사용자들이 많이 사용하게 된 통신 메커니즘이다. 그러나 이러한 전자우편의 대중성을 상업적인 목적으로 이용한 스팸메일의 출현으로, 사용자들은 정신적 피해, 업무 방해, 메일서버의 트래픽 과부화로 인한 유지보수 비용 증가와 같은 문제점들을 접하게 되었다. 특히, 최근에는 광고성 이미지들을 첨부하는 등의 새로운 기법이 적용된 스팸메일의 발생으로 기존의 텍스트 기반의 스팸메일 필터링 기법들이 무의미하게 되었으며, 따라서 그로 인한 피해가 증가하는 추세이다. 이러한 이미지 기반의 스팸메일들의 필터링을 위하여 Support Vector Machine과 같은 기계학습 기법을 이용한 기법들이 제안되고 있으나, 여전히 그 성능은 만족스럽지 못하다. 본 논문은 전자우편으로부터 텍스트 및 시각적 의미를 분석하여 전자우편 온톨로지에 기술하고 스팸메일 판단을 위한 의미추론규칙을 적용함으로써 광고성 이미지가 첨부되어 있는 스팸메일을 효과적으로 필터링 하기 위한 시스템을 제안한다.

  • PDF

A Study on the Method for Extracting the Purpose-Specific Customized Information from Online Product Reviews based on Text Mining (텍스트 마이닝 기반의 온라인 상품 리뷰 추출을 통한 목적별 맞춤화 정보 도출 방법론 연구)

  • Kim, Joo Young;Kim, Dong soo
    • The Journal of Society for e-Business Studies
    • /
    • v.21 no.2
    • /
    • pp.151-161
    • /
    • 2016
  • In the era of the Web 2.0, characterized by the openness, sharing and participation, it is easy for internet users to produce and share the data. The amount of the unstructured data which occupies most of the digital world's data has increased exponentially. One of the kinds of the unstructured data called personal online product reviews is necessary for both the company that produces those products and the potential customers who are interested in those products. In order to extract useful information from lots of scattered review data, the process of collecting data, storing, preprocessing, analyzing, and drawing a conclusion is needed. Therefore we introduce the text-mining methodology for applying the natural language process technology to the text format data like product review in order to carry out extracting structured data by using R programming. Also, we introduce the data-mining to derive the purpose-specific customized information from the structured review information drawn by the text-mining.

Analyzing the Trend of Wearable Keywords using Text-mining Methodology (텍스트마이닝 방법론을 활용한 웨어러블 관련 키워드의 트렌드 분석)

  • Kim, Min-Jeong
    • Journal of Digital Convergence
    • /
    • v.18 no.9
    • /
    • pp.181-190
    • /
    • 2020
  • The purpose of this study is to analyze the trends of wearable keywords using text mining methodology. To this end, 11,952 newspaper articles were collected from 1992 to 2019, and frequency analysis and bi-gram analysis were applied. The frequency analysis showed that Samsung Electronics, LG Electronics, and Apple were extracted as the highest frequency words, and smart watches and smart bands continued to emerge as higher frequency in terms of devices. As a result of the analysis of the bi-gram, it was confirmed that the sequence of two adjacent words such as world-first and world-largest appeared continuously, and related new bi-gram words were derived whenever issues or events occurred. This trend of wearable keywords will be useful for understanding the wearable trend and future direction.

Implementation of JBIG2 CODEC using Segmentation for Effective Compression (효율적인 압축을 위한 영역 세그먼트를 이용한 JBIG2 CODEC 구현)

  • 백옥규;고형화
    • Proceedings of the IEEK Conference
    • /
    • 2001.09a
    • /
    • pp.37-40
    • /
    • 2001
  • JBIG2 표준은 그레이 문서를 고압축의 이진 영상으로 부호화 하기위하여 선 영역(region of line-art), 하프톤 영역(region of Halftone), 텍스트 영역(region of Text)으로 세그먼트하여 각각 영역에 최적화 모드를 사용하여 부호화한다. 본 논문에서는 JBIG2에서 제공하는 세가지 모드의 코딩, 즉, 제네릭 영역(region of Generic) 코딩, 텍스트 영역을 위한 패턴 매칭(Pattern Matching) 코딩, 하프톤 영역을 위한 하프톤 코딩을 모두 구현하였다. 그리고, 각 영역을 세그먼트하는 방법을 개선하여 적용하여 세그먼트의 성능 향상을 이루었다. 특히, 부호화량이 많은 하프톤 영역의 세그먼트를 향상시켜 최적화 모드로 부호화 하도록 구현하였다. 팩스 테스트 영상(IEEE-l67a)으로 구현한 JBIC2 CODEC을 실험한 결과, 각 영역에 대한 세그먼트가 [6]의 방법에 의한 세그먼트보다 더 효율적으로 이루어졌으며 주관적 화질 또한 우수하였다.

  • PDF

A Study on Precaching according to Push Technology for Audio and Video Data in NOD(News On Demand) System (NOD 시스템에서 오디오와 비디오 데이터 Push에 따른 Precaching 연구)

  • 박성호;김광문;송기욱;정기동
    • Proceedings of the Korea Multimedia Society Conference
    • /
    • 1998.04a
    • /
    • pp.323-327
    • /
    • 1998
  • 컴퓨터와 통신망 기술의 발전으로 많은 언론 기관에서 전자신문 서비스를 제공하고 있다. 그러나 현재 서비스되는 전자신문은 텍스트 위주의 정적인 정보를 주고 서비스 하며, 사용자가 필요한 정보를 찾아 다니는 pull 기술을 기반으로 서비스한다. 그리고 사용자 맞춤 기능을 제공하기 못하므로, 불필요한 정보를 사용자에게 전송함으로써 시스템 자원을 낭비하는 단점을 가지고 있다. 본 논문에서는 멀티미디어 데이터를 지원하는 NOD(News On Demand)시스템에서 텍스트 데이터 뿐아니라 오디오/비디오 데이터를 push 하므로써 서버의 load를 분배시키고 사용자에게 실시간성을 제공하는 NOD 분배 서버를 설계하고 프로토타입을 구현하였다. 특히 본 논문에서는 대용량 데이터인 오디오/비디오 데이터를 사용자 시스템으로 Push할 때, 사용자 시스템의 디스크 공간상태 등을 고려하여 실시간성을 유지할 수 있는 적정 Push 량을 시뮬레이션을 통해 측정하였다.

  • PDF