• 제목/요약/키워드: Web documents

검색결과 831건 처리시간 0.027초

웹 문서의 메타데이터 관리를 위한 XMP 및 온톨로지 기반의 시맨틱 어노테이션 지원도구 개발 (On Developing a Semantic Annotation Tool for Managing Metadata of Web Documents based on XMP and Ontology)

  • 양경모;황석형;최성희
    • 한국산학기술학회논문지
    • /
    • 제10권7호
    • /
    • pp.1585-1600
    • /
    • 2009
  • 시맨틱 웹에서는 기계가 처리할 수 있는 의미 정보를 토대로 보다 효율적이고 효과적인 시맨틱 검색과 웹서비스를 제공하는 것을 목적으로 한다. 따라서, 다양한 웹 컨텐츠들에 대하여 컴퓨터가 이해 가능한 형식으로 메타데이터를 생성하고 추가하는 과정, 즉, 시맨틱 어노테이션이 시맨틱 웹의 중요한 기반기술 중의 하나이다. 최근에는 어노테이션 정보를 관리하기 위해서, 대상문서 내부에 메타데이터를 직접 내장시키는 기법이 주로 사용되고 있다. 그러나, 웹 문서의 시맨틱 어노테이션과 관련하여 기존의 지원도구들은, 주로 HTML 문서를 대상으로 하고 있고, 대부분의 도구들에서는 메타데이터를 활용한 시맨틱 검색기능을 제공하지 않고 있다. 본 연구에서는, 이와 같은 문제점들과 기존의 관련 연구결과들을 토대로, 웹 문서(HTML, PDF)들에 대한 시맨틱 어노테이션을 보다 효율적으로 지원하기 위한 온톨로지 기반의 시맨틱 어노테이션 지원도구(OSA)를 개발하였다. OSA에서는, RDFS(RDF Schema)로 시맨틱 어노테이션 모델을 정의하고, 이를 토대로 온톨로지 기반의 의미정보들을 표현하며, XMP(eXtensible Metadata Platform)표준에 맞추어서 해당 디지털 문서 내에 시맨틱 어노테이션 정보를 내장시킨다. 본 연구에서 개발한 어노테이션 도구를 활용함으로써, 웹 문서에 대한 효율적인 시맨틱 어노테이션이 가능하며, XMP를 기반으로 웹 문서 자체와 시맨틱 어노테이션 정보를 일체화시킴으로써 어노테이션 정보관리에 정합성을 유지할 수 있으므로, 향후 다양한 웹 컨텐츠에 대한 시맨틱 검색에 효과적으로 활용될 수 있다.

MPEG-21 프레임워크 기반의 REL 및 RDD 웹서비스 시스템 (REL and RDD Web Services System Based on MPEG-21 Framework)

  • 윤화묵;조태범;정회경
    • 한국정보통신학회논문지
    • /
    • 제10권5호
    • /
    • pp.843-850
    • /
    • 2006
  • MPEG(Moving Picture Expert Group)에서는 저작권 언어인 REL(Right Expression Language)과 REL의 능동적 어플리케이션 개발을 위해 용어사전인 RDD(Right Data Dictionary)에 대한 표준을 개발하였다. 그러나 REL의 저작은 MPEG-21 프레임워크를 이해해야 저작이 가능하다는 어려움이 있어 보다 쉬운 저작 시스템이 요구되며 저작된 문서를 분석 처리하는 소비 시스템과 REL 및 RDD를 연동하는 RDD 연동 시스템이 요구되고 있다. 이에 본 논문에서는 REL 문서를 저작 할 수 있는 저작 시스템과 저작된 문서를 분석 처리하는 소비 시스템 그리고 웹서비스 기반에서 권한 질의를 처리하는 RDD 웹서비스 시스템을 설계 및 구현하였다.

WebDBs: 사용자 중심의 웹 검색 엔진 (WebDBs : A User oriented Web Search Engine)

  • 김홍일;임해철
    • 한국통신학회논문지
    • /
    • 제24권7B호
    • /
    • pp.1331-1341
    • /
    • 1999
  • 본 연구에서는 SQL과 유사한 질의어를 사용하여 웹에 등록된 정보를 검색하는 시스템인 WebDBs(Web DataBase system)를 제안한다. 제안된 시스템에서는 웹에 산재되어 있는 HTML 문서로부터 검색에 필요한 정보들을 자동으로 추출한다. 추출된 자료에 대하여 SQL 기반의 질의 처리가 가능하도록 하였다. 웹 데이터베이스 시스템에서는 대부분의 질의 수행 시간이 통신 회선을 통한 문서 획득에 소요된다. 따라서, 웹 검색의 경우 웹 지역성에 많이 의존한다는 점에 착안하여, 사용자 검색 결과를 캐쉬에 저장하고 유사한 응용에서 이를 재사용 하고자 한다. 이때 캐쉬에 저장된 정보들을 검색된 질의와 연관하여 저장함으로써 좀더 사용자 응용을 고려한 캐쉬 관리기법을 제안하였다. 또한 위와 같은 개념에 입각한 웹 검색엔진을 구하였다.

  • PDF

구조 검색을 위한 XML 문서 저장 시스템 (XML Document Repository System for structured retrieval)

  • 임산송;현득창;정회경
    • 정보학연구
    • /
    • 제4권4호
    • /
    • pp.89-100
    • /
    • 2001
  • XML(extensible Markup Language)은 W3C(World Wide Web Consortium)에서 표준으로 제정, 발표한 대표적인 전자문서 표준이다. XML 문서는 구조화된 정보를 체계적으로 생성하고 전송할 수 있으며, 기존의 파일 형태 정보에 비하여 의미적인 정보 단위를 구조로 표현하고 이러한 구조 정보를 이용해 문서의 관리 및 검색, 저장에 이용할 수 있다. 이에 본 논문에서는 XML의 구조적 정보를 이용하여 저장 검색하기 위한 XML 저장 시스템을 설계 및 구현하였다. 문서의 기본 단위인 엘리먼트(element) 단위로 모델링(modeling)하여 저장하였고, 저장된 XML 정보를 구조 단위로 검색 할 수 있도록 모델링 하였다. 또한 DTD(Document Type Definition)와 인스턴스(instance)에 대하여 스키마(schema)를 생성하여 다양한 문서에 대한 구조를 효과적으로 관리, 저장할 수 있도록 하였다.

  • PDF

데이터베이스와 XML에 기반한 건설프로젝트 기술문서 전자화 (Digitalizing Technical Documents of Construction Projects Based on Database and XML)

  • 정종현
    • 한국건설관리학회논문집
    • /
    • 제6권4호
    • /
    • pp.190-198
    • /
    • 2005
  • 본 연구의 목적은 건설프로젝트에 관련된 기술문서(technical document)를 효율적으로 저장하고 웹(web)을 통하여 신속하고 정확하게 교환할 수 있도록 전자화(digitalization)하는 방안을 제시하는 것이다. 이를 위해 본 연구에서는 먼저 전자화 측면을 고려하여 기술문서의 여러 특성을 분석하였고 이를 바탕으로 저장에는 데이터베이스(database)를, 웹을 통한 교환에는 XML을 적용하여 기술문서를 전자화할 수 있는 방안을 도출하였다. 여기에는 기술문서의 저장과 검색, 부분적인 XML문서의 작성, 기술문서에 적합한 구성항목과 구성체계 설정, 웹에서의 수식과 그래픽 처리 방안이 포함된다. 마지막에는 전형적인 기술문서 중의 하나인 구조계산서(structural design sheets)를 대상으로 하여 데이터베이스에 저장하기 위한 자료구조(data structure) 정의, 실제 XML문서의 작성 및 웹을 통한 교환 등을 부분적으로 구현하여 본 연구에서 제안한 데이터베이스와XML에 기반한 기술문서 전자화 방안의 적정성을 검토하였다.

TripleDiff: 트리플 저장소에서 RDF 문서에 대한 점진적 갱신 알고리즘 (TripleDiff: an Incremental Update Algorithm on RDF Documents in Triple Stores)

  • 이태휘;김기성;유상원;김형주
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제33권5호
    • /
    • pp.476-485
    • /
    • 2006
  • 시멘틱 웹(semantic web)과 함께 등장한 RDF는 웹 상의 메타데이타 및 데이타를 나타내는 표준으로 자리매김 하고 있다. 이에 따라 RDF에 대한 저장 및 질의 처리에 대한 연구가 많이 이루어졌으며, 대표적인 시스템으로 Sesame, Jena 등이 있다. 그러나 아직 갱신 방법에 대한 연구는 부족하다. RDF 데이타가 지속적으로 갱신이 이루어지는 경우에는 저장된 RDF를 갱신해야 하는 상황이 발생한다. 현존하는 RDF 저장소에서 데이타를 갱신하기 위해서는 기존의 데이타를 모두 삭제한 후 새로운 데이타를 처음부터 다시 저장해야 하는데, 이러한 상황에서는 매우 비효율적이다. 또한 한 RDF 저장소에 여러 RDF가 저장되어 있는 경우에는 갱신 문제가 더욱 복잡해진다. 이에 본 논문에서는 RDF 데이타를 점진적으로 갱신하는 기법을 제안하고자 한다. 제안한 기법은 텍스트 비교 알고리즘을 통해 얻은 결과를 보완하여 기존 RDF 데이타에서 변화된 트리플 문장만을 추출하여 갱신한다. 실제 RDF 데이터를 이용한 실험을 통해 제안한 방법을 사용하여 갱신을 효율적으로 할 수 있음을 보였다.

FCA 기반 계층적 구조를 이용한 문서 통합 기법 (Methods for Integration of Documents using Hierarchical Structure based on the Formal Concept Analysis)

  • 김태환;전호철;최종민
    • 지능정보연구
    • /
    • 제17권3호
    • /
    • pp.63-77
    • /
    • 2011
  • 월드와이드웹(World Wide Web)은 인터넷에 연결된 컴퓨터를 통해 사람들이 정보를 공유할 수 있는 매우 큰 분산된 정보 공간이다. 웹은 1991년에 시작되어 개인 홈페이지, 온라인 도서관, 가상 박물관 등 다양한 정보 자원들을 웹으로 표현하면서 성장하였다. 이러한 웹은 현재 5천억 페이지 이상 존재할 것이라고 추정한다. 대용량 정보에서 정보를 효과적이며 효율적으로 검색하는 기술을 적용할 수 있다. 현재 존재하는 몇몇 검색 도구들은 초 단위로 gigabyte 크기의 웹을 검사하여 사용자에게 검색 정보를 제공한다. 그러나 검색의 효율성은 검색 시간과는 다른 문제이다. 현재 검색 도구들은 사용자의 질의에 적합한 정보가 적음에도 불구하고 많은 문서들을 사용자에게 검색해준다. 그러므로 대부분의 적합한 문서들은 검색 상위에 존재하지 않는다. 또한 현재 검색 도구들은 사용자가 찾은 문서와 관련된 문서를 찾을 수 없다. 현재 많은 검색 시스템들의 가장 중요한 문제는 검색의 질을 증가 시키는 것이다. 그것은 검색된 결과로 관련 있는 문서를 증가시키고, 관련 없는 문서를 감소시켜 사용자에게 제공하는 것이다. 이러한 문제를 해결하기 위해 CiteSeer는 월드와이드웹에 존재하는 논문에 대해 한정하여 ACI(Autonomous Citation Indexing)기법을 제안하였다. "Citaion Index"는 연구자가 자신의 논문에 다른 논문을 인용한 정보를 기술하는데 이렇게 기술된 논문과 자신의 논문을 연결하여 색인한다. "Citation Index"는 논문 검색이나 논문 분석 등에 매우 유용하다. 그러나 "Citation Index"는 논문의 저자가 다른 논문을 인용한 논문에 대해서만 자신의 논문을 연결하여 색인했기 때문에 논문의 저자가 다른 논문을 인용하지 않은 논문에 대해서는 관련 있는 논문이라 할지 라도 저자의 논문과 연결하여 색인할 수 없다. 또한 인용되지 않은 다른 논문과 연결하여 색인할 수 없기 때문에 확장성이 용이하지 못하다. 이러한 문제를 해결하기 위해 본 논문에서는 검색된 문서에서 단락별 명사와 동사 및 목적어를 추출하여 해당 동사가 명사 및 목적어를 취할 수 있는 가능한 값을 고려하여 하나의 문서를 formal context 형태로 변환한다. 이 표를 이용하여 문서의 계층적 그래프를 구성하고, 문서의 그래프를 이용하여 문서 간 그래프를 통합한다. 이렇게 만들어진 문서의 그래프들은 그래프의 구조를 보고 각각의 문서의 영역을 구하고 그 영역에 포함관계를 계산하여 문서와 문서간의 관계를 표시할 수 있다. 또한 검색된 문서를 트리 형식으로 보여주어 사용자가 원하는 정보를 보다 쉽게 검색할 수 있는 문서의 구조적 통합 방법에 대해 제안한다. 제안한 방법은 루씬 검색엔진이 가지고 있는 순위 계산 공식을 이용하여 문서가 가지는 중요한 단어를 문서의 참조 관계에 적용하여 비교하였다. 제안한 방법이 루씬 검색엔진보다15% 정도 높은 성능을 나타내었다.

교수와 학습자간의 행동 동기화를 이용한 웹 기반의 실시간 원격 강의 시스템 (A Web-based Remote Instruction System on Real-time using Action Synchronization between the Instructor and Learners)

  • 이부권;박규석;서영건
    • 한국멀티미디어학회논문지
    • /
    • 제3권6호
    • /
    • pp.611-616
    • /
    • 2000
  • 일반적으로 강의에서 가장 중요한 내용 전달 매체는 음성이며 다음으로 도큐먼트이다. 실제로 많은 원격 강의 기법에서 동영상을 제공하려고 하지만 네트워크 대역폭의 제한으로 인하여 만족할 만한 결과를 얻지 못하고 있다. 또한 특별한 브라우저를 사용하지 않고 웹 상에서 불특정 다수의 사용자들이 접근하도록 하기위해 웹 브라우저를 사용하고 있다 이와같이 동영상이나 음성과 같은 연속 미디어를 제공하기 위해서 네트워크의 제한으로 인하여 만족스럽지 못한 강의 내용을 제공하고 있으며, 웹 브라우저를 사용하게 되면 대체로 도큐먼트(웹 페이지) 위주의 강의 자료를 제공할 뿐이다. 따라서, 본 논문에서는 정보 전달 매체 중에서 가장 중요한 음성과 도큐먼트를 이용하여 웹 상에서 실시간 원격 강의 시스템을 제안한다. 여기에 사용된 부가기법으로는 교수와 학습자간의 웹 브라우저 동기화와 펜을 이용하며, 교수자는 자신의 컴퓨터를 이용하여 도큐먼트를 보면서 강의하고, 학습자는 교수자가 보고 있는 도큐먼트와 같은 것을 보면서 강의를 듣게 된다

  • PDF

웹 문서와 접근로그의 하이퍼링크 추출을 통한 웹 구조 마이닝 (Web Structure Mining by Extracting Hyperlinks from Web Documents and Access Logs)

  • 이성대;박휴찬
    • 한국정보통신학회논문지
    • /
    • 제11권11호
    • /
    • pp.2059-2071
    • /
    • 2007
  • 웹 사이트의 구조가 정확하게 주어진다면, 정보 제공자의 입장에서는 사용자의 행위 패턴이나 특성을 효과적으로 파악할 수 있어 보다 나은 서비스를 제공할 수 있고, 사용자의 입장에서는 더욱 쉽고 정확하게 유용한 정보를 찾을 수 있을 것이다. 하지만 웹상의 문서들은 빈발하게 수정되기 때문에 웹 사이트의 구조를 정확하게 추출하는 것은 상당한 어려움이 있다. 본 논문에서는 이러한 웹 사이트의 구조를 자동으로 추출하는 알고리즘을 제안한다. 제안하는 알고리즘은 두 단계로 구성된다. 첫 번째 단계는 웹 문서를 분석하여 그들 간의 하이퍼링크를 추출하고 이를 웹 사이트의 구조를 나타내는 방향 그래프로 표현한다. 하지만 플래시나 자바 애플릿에 포함된 하이퍼링크는 추출할 수 없는 한계가 있다. 두 번째 단계에서는 이러한 숨겨진 하이퍼링크를 추출하기 위하여 웹 사이트의 접근로그를 이용한다. 즉, 접근로그로부터 각 사용자의 클릭스트림을 추출한 후, 첫 번째 단계에서 생성한 그래프와 비교하여 숨겨진 하이퍼링크를 추출한다. 본 논문에서 제안한 알고리즘의 성능을 평가하기 위하여 다양한 실험을 수행하였고, 이러한 실험을 통하여 웹 사이트의 구조를 보다 정확하게 추출할 수 있음을 확인하였다.

Xpath에 의한 인터넷 문서의 레이아웃 추출 방법에 관한 연구 (A Study on Layout Extraction from Internet Documents Through Xpath)

  • 한광록;선복근
    • 한국콘텐츠학회논문지
    • /
    • 제5권4호
    • /
    • pp.237-244
    • /
    • 2005
  • 현재 뉴스 데이터 등 대부분의 인터넷 문서는 일정한 템플릿을 기반으로 작성되고 있으며 템플릿은 메인 데이터 이외에 인덱스, 광고, 헤더데이터 등 정보검색에 도움이 되지 않는 형태로 구성되어 있다. 이는 인터넷 문서를 정보검색의 데이터로서 사용하려고 할 때 적합한 형태가 아니다. 그러므로 다양한 정보검색 분야에서 인터넷 문서를 처리하기 위해선 광고, 페이지 인덱스 등의 부가정보를 분별해야 한다. 따라서 본 논문에서는 웹페이지의 레이아웃에 영향을 미치는 블럭 태그의 특징과 구조를 파악하고 웹페이지간의 거리를 계산하여, 웹페이지의 레이아웃을 검출하는 방법을 제안한다. 실험결과 1000개의 문서 중 640개를 분류했으며, 평균 64%의 recall 수치를 얻을 수 있었다. 이 방법을 데이터 추출, 문서요약 등의 정보검색 분야의 전처리 과정에 적용할 경우 문서의 자동화 처리 시간을 감소시키고 처리의 효율성을 높일 수 있을 것으로 기대된다.

  • PDF