• Title/Summary/Keyword: XML 색인

Search Result 110, Processing Time 0.02 seconds

Design of Data Structures and Algorithms for Efficient Retrieval of Structured Documents (구조적 문서의 효율적인 검색을 위한 자료 구조와 알고리즘 설계)

  • 김영자;정채영;김현주;배종민
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 1999.10a
    • /
    • pp.60-62
    • /
    • 1999
  • SGML이나 XML과 같은 마크업 언어를 사용하여 생성된 구조적 문서에 대한 검색 시스템은 문서의 임의의 부분에 대한 검색을 지원한다. 문서의 구조에 바탕을 둔 다양한 유형의 사용자 질의를 처리하기 위해서는 색인에 필요한 메모리량이 커지게 된다. 색인에 필요한 메모리양을 줄이기 위해, 색인된 노드의 ID에서 찾고자 하는 노드의 ID를 계산할 수 있어야 한다. 그러나 이 경우 각 노드에 ID가 고정되기 때문에 문서의 갱신이 발생할 때 많은 부분이 수정되어야 하기 때문에 갱신에 필요한 오버헤드가 커지게 된다. 본 논문에서는 전체문서인스턴스트리 구조를 제안하고, 이를 기반으로 하여 노드의 ID를 구성함으로서, 색인과 검색의 효율성을 유지하면서 자료의 추가나 삭제등의 갱신이 발생할 때, 갱신의 파장을 최소화시킬 수 있는 색인구조와 질의처리 알고리즘을 제시한다.

  • PDF

A Labeling Methods for Keyword Search over Large XML Documents (대용량 XML 문서의 키워드 검색을 위한 레이블링 기법)

  • Sun, Dong-Han;Hwang, Soo-Chan
    • Journal of KIISE
    • /
    • v.41 no.9
    • /
    • pp.699-706
    • /
    • 2014
  • As XML documents are getting bigger and more complex, a keyword-based search method that does not require structural information is needed to search these large XML documents. In order to use this method, not only all keywords expressed as nodes in the XML document must be labeled for indexing but also structural information should be well represented. However, the existing labeling methods either have very simple information of XML documents for index or represent the structural information which is difficult to deal with the increase of XML documents' size. As the size of XML documents is getting larger, it causes either the poor performance of keyword search or the exponential increase of space usage. In this paper, we present the Repetitive Prime Labeling Scheme (RPLS) in order to improve the problem of the existing labeling methods for keyword-based search of large XML documents. This method is based on the existing prime number labeling method and allows a parent's prime number to be used at a lower level repeatedly so that the number of prime numbers being generated can be reduced. Then, we show an experimental result of the comparison between our methods and the existing methods.

Design of an Incremental System for Reconstruction of Similar Structured XML Documents (유사구조를 갖는 XML 문서의 재구성을 위한 점진적인 시스템 설계)

  • Seol, Jin-An;Jung, Kye-Dong;Choi, Young-Keun
    • Proceedings of the Korea Information Processing Society Conference
    • /
    • 2003.05b
    • /
    • pp.1031-1034
    • /
    • 2003
  • XML은 통합된 데이터 모델을 지원하기 위한 언어로, 특정 분야의 데이터에 대한 친환 및 통합의 필요성이 증대되어지고 있다. 일반적으로 데이터 교환은 다양한 공급자에 의해 독립적으로 운용 및 서비스됨으로서 개별적으로 데이터를 수집해야 하며 재배포 과정 또한 어렵다. 따라서 데이터 재배포 과정을 간소화하고 데이터 교환의 최적화를 위해 데이터 통합을 위한 재구성 방법이 필요하다. 본 논문에서는 특정 분야의 유사한 구조로 구성된 여러 문서를 입력받아 하나의 통합된 문서로 재구성할 수 있는 시스템을 제안한다. 제안된 시스템은 색인기법을 기반으로 추출된 정보를 하나의 문서로 매핑하기 위해 데이터 사전을 선계하고, 하나의 통합된 문서를 점진적인 과정을 통하여 재구성한다 따라서 재구성된 문서는 재배포 과정을 간소화할 수 있으며, 데이터 교환의 최적화는 물론 전자문서교환(EDI)에 있어서 정보교환 능력을 증가시킬 수 있다.

  • PDF

A Study on Fashion Pieces Goods Information Indexing and Searching Structured Documents Using XML (XML을 이용한 의상 피스 정보의 구조적 문서 생성 및 탐색을 위한 색인기법에 관한 연구)

  • Cho Jin-Ei;Yang Ok-Yul;Nam Myung-Woo;Lee Yong-Ju;Jung Sung-Tea;Joung Suck-Tea;Lee Won-A
    • Journal of the Korea Academia-Industrial cooperation Society
    • /
    • v.7 no.1
    • /
    • pp.39-45
    • /
    • 2006
  • 본 연구는 웹기반 3차원 패션몰 구축에서 의류에 대한 정보를 보다 세부적이고 전문적인 정보로 제공하기 위하여 의상 정보를 2차원 재단 패턴의 피스(piece) 정보로 구분한다. 구분된 피스는 의상에 따라 상하종속관계에 해당하는 피스정보별 상세정보를 가중치에 따라 검색하여 SVG(Scalable Vector Graphics) 파일 형태로 제공하도록 설계하였다. 이러한 의상 상세정보를 통해 디자이너가 의상구조의 다양한 조합으로 새로운 제품 디자인이 용이해지고 유사한 형태의 의상 표현이 가능해진다. 이를 통해 패션몰 상품에 대한 전문가적인 의상 분석도 가능해진다. 또한 SVG 형식의 파일을 이용하기 때문에 부하가 많은 쇼핑몰의 정보 표현에도 용이하다. 이를 위해 구축된 정보는 XML로 표준화 할 수 있도록 DTD(Document Type Definition)를 정의하여 검색 시스템을 설계하였다.

  • PDF

RDF 메타 데이터를 이용한 인덱스 기반의 XML/SGML 문서 검색 방법에 관한 연구

  • 오동현;김규태;정회경;이수연
    • Proceedings of the Korean Information Science Society Conference
    • /
    • 1999.10a
    • /
    • pp.42-44
    • /
    • 1999
  • 인터넷이 급속히 성장함에 따라 대량의 SGML/XML 문서를 보다 효과적으로 다룰 필요성이 증대하고 있다. SGML/XML 문서를 데이터베이스에 저장하는 경우에 문서를 파싱하여 파싱된 결과를 모두 분리하여 저장하고 서로의 연관관계를 모두 구분하는 경우 구조화 정보를 최대한 이용할 수 있는 등 여러 가지 장점을 지니게 된다. 하지만, 이 경우 분할단위의 폭발적인 증가로 인한 시스템 성능 저하와 내용중복으로 인한 색인저장 오버헤드가 문제이다. 이런 문제점을 해결방안의 하나로서 본 논문에서는 RDF 메타데이타를 통하여 검색시 의미가 있는 단위로 분할 단위를 축소 지정하고 이 축소된 정보를 기반으로 인덱스를 생성하여 내용중복을 방지하는 방법을 제안하였다. 이 방법은 RDF메타데이타를 통해 이루어짐으로서 웹기반에서 자동으로 이루어질 수가 있으며, 이를 통해서 기존의 방법보다 자동화된 검색을 할 수 있다.

  • PDF

인용문헌의 효율적인 검색을 위한 KSCI 시스템 설계

  • Lee, Gye-Jun
    • Journal of Scientific & Technological Knowledge Infrastructure
    • /
    • s.7
    • /
    • pp.113-127
    • /
    • 2001
  • 인용문헌정보의 효율적인 저장과 검색을 위하여 인용한 문헌과 인용된 문헌들의 구성요소를 추출하고 상호 인용관계에 대한 논리정보와 구조정보를 재구성을 통해 표현하고, 패스인코딩 색인기법에 의해 구성요소의 중복을 제거하였으며, 관련 있는 데이터베이스들과의 연계를 위하여 XML을 기반으로 하는 KSCI(Korea Science Citation Index)시스템을 설계하였다.

  • PDF

Digital License Searching for Copyright Management of Software Source Code (소프트웨어 소스 코드의 저작권 관리를 위한 디지털 라이센스의 검색)

  • Cha, Byung-Rae
    • The Journal of the Korea Contents Association
    • /
    • v.7 no.1
    • /
    • pp.21-31
    • /
    • 2007
  • The intellectual property system was very important to the past industrial society. It is so important to the 21C information age. It is a leading role to developing these information society. Not only the digital content control but the technology of software source code for the intellectual property is so much mean to international competition. On occurring disputation property, we have to prove the fact, there is a problem to discriminate the original source code. In this paper, we make a study of the digital licence prototype for discriminate the original source code. Reserved words of software source code by parsing express to XML file that have hierarchical structure. Then, we can express architecture of software source code by tree structure form instead of complex source code. And we make a study of the indexing and searching to search digital license.

Study on Model Case of Ideal Digitization of Korean Ancient Books (국학고전자료의 디지털화를 위한 모범적인 방안 연구)

  • Lee, Hee-Jae
    • Journal of the Korean Society for information Management
    • /
    • v.22 no.1 s.55
    • /
    • pp.105-123
    • /
    • 2005
  • The most of all, this study is planned to search an ideal methods to develop the digital library system for our korean ancient books for their safe preservation and, at the same time, for their perusal of transcendental time and space : first. to offer the various access points like traditional oriental Four parts Classics classification, current subject classification and index keyword, etc. : second, to program a digital library system using MARC or XML, but with all bibliographic descriptive elements as possible; third, to prepare the more easy annotated bibliography and index for users' better comprehension, and last, to build original text database for practical reading to avoid the damage of original text. This type of korean ancient books digital library will be developed to the real international bibliographic control by networking enter the same kinds of internal and external organizations.

Partitioning and Merging an Index for Efficient XML Keyword Search (효율적 XML키워드 검색을 인덱스 분할 및 합병)

  • Kim, Sung-Jin;Lee, Hyung-Dong;Kim, Hyoung-Joo
    • Journal of KIISE:Databases
    • /
    • v.33 no.7
    • /
    • pp.754-765
    • /
    • 2006
  • In XML keyword search, a search result is defined as a set of the smallest elements (i.e., least common ancestors) containing all query keywords and a granularity of indexing is an XML element instead of a document. Under the conventional index structure, all least common ancestors produced by the combination of the elements, each of which contains a query keyword, are considered as a search result. In this paper, to avoid unnecessary operations of producing the least common ancestors and reduce query process time, we describe a way to construct a partitioned index composed of several partitions and produce a search result by merging those partitions if necessary. When a search result is restricted to be composed of the least common ancestors whose depths are higher than a given minimum depth, under the proposed partitioned index structure, search systems can reduce the query process time by considering only combinations of the elements belonging to the same partition. Even though the minimum depth is not given or unknown, search systems can obtain a search result with the partitioned index, which requires the same query process time to obtain the search result with non-partitioned index. Our experiment was conducted with the XML documents provided by the DBLP site and INEX2003, and the partitioned index could reduce a substantial amount of query processing time when the minimum depth is given.

Hypertext Retrieval System Using XLinks (XLinks를 이용한 하이퍼텍스트 검색 시스템)

  • Kim, Eun-Jeong;Bae, Jong-Min
    • The KIPS Transactions:PartD
    • /
    • v.8D no.5
    • /
    • pp.483-494
    • /
    • 2001
  • Most of hypertext retrieval models consider documents as independent entities. They ignore relationships between documents of link semantics. in an information retrieval system for hypertext documents, retrieval effectiveness can be improved when ling information is used. Previous link-based hypertext retrieval models ignore link information while indexing. They utilize link information to re-rank the retrieval results. Therefore they are limited that only the documents is result-set utilize link information. This paper utilizes link information when indexing. We present how to use term weighting and inLinks weighting for ranking the relevant documents. Experimental results show that recall and precision evaluation according to the link semantics and the comparison with previously link_based hypertext retrieval model.

  • PDF