• 제목/요약/키워드: 데이터웹

검색결과 3,387건 처리시간 0.036초

WebBase 기반 웹 아카이브 시스템의 설계 (The Design of Web Archive System on the WebBase)

  • 이민희;이무훈;장창복;김동혁;고병오;최의인
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2003년도 추계학술발표논문집 (하)
    • /
    • pp.1473-1476
    • /
    • 2003
  • 웹의 성장으로 사용자는 언제 어디서든지 유용한 정보의 이용이 가능해졌다. 웹이 광범위하게 사용됨에 따라 정보를 획득하기 위해 대다수의 사용자들이 웹을 의존하고 있다. 그러나 웹상의 모든 정보는 정보가 저장되어 있는 서버의 관리자들에 의해 계속적으로 갱신 또는 삭제되어 가고 있어 기존의 정보들은 그것의 중요성 여부와 관계없이 대다수의 정보가 소멸되고 있다. 따라서 오랜 기간에 거쳐 생성된 웹상의 중요 데이터(importance data)들을 효율적으로 활용하기 위한 웹 아카이브(archive) 시스템이 연구되었다. 그러나 현재 존재하는 웹 아카이브 시스템은 갱신되기 이전의 데이터를 다루기 위한 체계적인 처리기법을 제시하지 못하고, 수집된 데이터들에 대한 연관관계를 저장하지 못하여 데이터 관리에 있어 비효율적이라는 문제점을 가지고 있다. 이에 따라 본 논문에서는 웹으로부터 다운로드한 데이터를 레포지토리(repository)에 효율적으로 저장하기 위해 설계된 대표적인 WebBase를 기반으로 하여 갱신되기 이전의 모든 정보들에 대한 내용을 히스토리(history) 저장소내에 저장하여 정보를 효율적으로 활용할 수 있는 웹 아카이브 시스템의 구조를 제안한다.

  • PDF

사이트간 웹 사용 마이닝을 위한 데이터 전처리의 성능 향상 (Performance Improvement of Data Preprocessing for Intersite Web Usage Mining)

  • 현우석
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2006년도 가을 학술발표논문집 Vol.33 No.2 (B)
    • /
    • pp.357-361
    • /
    • 2006
  • 매일 새롭게 생기는 웹 페이지 수가 수천만 개, 온라인 문서들의 수가 수십억 개에 이르게 되자, 웹 사이트를 설계함에 있어서 웹 서버 로그 파일에 기록된 사용자의 행동을 분석하는 것이 중요한 부분이 되어가고 있다. 분석가들은 전체 웹 사이트에서 사용자 행동의 완전한 개요를 알기 원하기 때문에 고객이 방문했던 모든 다른 웹 서버를 통하여 사용자의 패스(path)를 다시 수집해야만 한다. 본 연구에서는 모든 로그 파일을 연결해서 방문했던 곳을 재구성하는 향상된 데이터 전처리 방법에 의하여 실험을 하여 로그 파일 크기를 감소시키게 되어 데이터 전처리의 성능이 향상되었음을 보였다.

  • PDF

웹 서비스 기반 바이오 정보 통합 분석 도구 (WSBAT: Web Services based Biodata Analysis Tool)

  • 최요한;유성준;김민경;박현석
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2004년도 봄 학술발표논문집 Vol.31 No.1 (B)
    • /
    • pp.289-291
    • /
    • 2004
  • 최근 웹 서비스 기술을 이용하여 바이오 데이터 및 데이터 메소드를 제공하는 것과 관련된 연구들이 진행되고 있다. 웹 서비스 기반 바이오 데이터 서비스에 대한 연구 자료는 시스템 구조 및 API 등을 중심으로 보고되고 있으나 이를 기반으로 한 통합 응용 도구 개발 관련 연구는 미미한 실정이다. 이에 따라 이 논문에서는 웹 서비스 API 등을 이용하여 바이오인포매틱스 연구자들이 이용할 수 있는 데이터 통합, 검색, 브라우징 기능을 제공하는 분석 도구를 개발하였다 사용자는 이 도구를 이용하여 바이오 데이터 간의 상호연관성을 보다 쉽게 발견할 수 있으며 보다 다양한 검색 결과를 여러 가지 형태로 볼 수 있게 될 것이다.

  • PDF

최신 웹 크롤링 알고리즘 분석 및 선제적인 크롤링 기법 제안 (A proposal on a proactive crawling approach with analysis of state-of-the-art web crawling algorithms)

  • 나철원;온병원
    • 인터넷정보학회논문지
    • /
    • 제20권3호
    • /
    • pp.43-59
    • /
    • 2019
  • 오늘날 스마트폰의 보급과 SNS의 발달로 정형/비정형 빅데이터는 기하급수적으로 증가하였다. 이러한 빅데이터를 잘 분석한다면 미래 예측도 가능할 만큼 훌륭한 정보를 얻을 수 있다. 빅데이터를 분석하기 위해서는 먼저 대용량의 데이터 수집이 필요하다. 이러한 데이터가 가장 많이 저장되어 있는 곳은 바로 웹 페이지다. 하지만 데이터의 양이 방대하기 때문에 유용한 정보를 가진 데이터가 많은 만큼 필요하지 않은 정보를 가진 데이터도 많이 존재한다. 그렇기 때문에 필요하지 않은 정보를 가진 데이터는 거르고 유용한 정보를 가진 데이터만을 수집하는 효율적인 데이터 수집의 중요성이 대두되었다. 웹 크롤러는 네트워크 대역폭, 시간적인 문제, 하드웨어적인 저장소 등의 제약으로 인해 모든 페이지를 다운로드 할 수 없다. 그렇기 때문에 원하는 내용과 관련 없는 많은 페이지들의 방문은 피하며 가능한 빠른 시간 내에 중요한 페이지만을 다운로드해야한다. 이 논문은 위와 같은 이슈의 해결을 돕고자한다. 먼저 기본적인 웹 크롤링 알고리즘들을 소개한다. 각 알고리즘마다 시간복잡도와 장단점을 설명하며 비교 및 분석한다. 다음으로 기본적인 웹 크롤링 알고리즘의 단점을 개선한 최신 웹 크롤링 알고리즘들을 소개한다. 더불어 최근 연구 흐름을 보면 감성어휘 수집과 같은 특수한 목적을 가진 웹 크롤링 알고리즘의 대한 연구가 활발히 이루어지고 있다. 특수 목적을 가진 웹 크롤링 알고리즘에 대한 연구로써 선제적인 웹 크롤링 기법으로 감성 반응 웹 크롤링(Sentiment-aware Web Crawling) 기법을 소개한다. 실험결과 데이터의 크기가 커질수록 기존방안보다 높은 성능을 보였고 데이터베이스의 저장 공간도 절약되었다.

웹 데이터에서의 사용자 탐색 패턴 발견 및 추천 (Discovery and Recommendation of User Search Patterns from Web Data)

  • 구흠모;양재영;홍광희;최중민
    • 한국지능정보시스템학회:학술대회논문집
    • /
    • 한국지능정보시스템학회 2002년도 추계정기학술대회
    • /
    • pp.287-296
    • /
    • 2002
  • 웹 사용 마이닝은 데이터마이닝을 바탕으로 사용자의 로그 파일 정보를 이용하여 웹이 이용되는 패턴을 발견한다. 이를 이용하여 웹을 개선하여 사용자들이 보다 빨리 원하는 내용을 검색할 수 있도록 할 수 있으며 시스템 관리자에게는 효율적인 웹 구조를 인한 정보를 제공할 수 있다. 웹 사용 마이닝에서 사용하는 데이터는 성형화되어 있지 않으며 웹 사용 패턴을 분석하는데 방해가 되는 잡음 데이터까지 포함하고 있다. 이것은 기존에 개발된 여러 데이터마이닝 기법을 적용하는데 어려움으로 작용한다. 이러한 어려움을 해결하기 위해 본 논문에서는 새로운 방법을 도입한 SPMiner을 .제안한다. SPMiner는 웹의 구조를 이용하여 로그 파일의 전처리 과정을 줄이며 사용자의 탐색 패턴 분석을 효율적으로 수행 할 수 있는 시스템이다. SPMiner는 WebTree 에이전트를 이용하여 웹 사이트 구조를 분석하여 WebTree를 생성하고 사용자 로그 파일을 분석하여 각 웹 페이지의 사용빈도에 대한 정보를 추출한다. WebTree와 로그 파일에서 추출된 웹 페이지에 대한 정보는 SPMiner에 의해 패턴을 분석할 퍼 이용될 수 있는 형태인 WebTree$^{+}$로 병합된다 WebTree$^{+}$는 패턴 발견을 쉽게 해주며 사용자에게 추천할 정보나 웹 페이지를 능동적으로 추천할 수 있게 만들어 준다.

  • PDF

웹사이트의 구조주출, 저장 및 가시화를 위한 구조분석 에이전트 (A Structure Analysis Agent for Extraction, Storage and Visualization of Web Sites)

  • 정윤경;조성배
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2001년도 봄 학술발표논문집 Vol.28 No.1 (B)
    • /
    • pp.313-315
    • /
    • 2001
  • 인터넷 비즈니스 사이트가 많아짐에 따라 사용자에게 편리한 비즈니스 사이트를 구추하기위해 웹서버의 구조 및 내용을 평가하고 재구성해야 하는데, 수작업에 의한 웹문서의 평가시 인적, 시간적 비용이 높고 시스템에 대한 평가값이 객관적이지 못하다. 이를 해결하기 위해 본 논문에서는 구조추출, 구조저장, 구조가시화로 구성된 웹문서의 구조분석 에이전트를 제안한다. 구조추출 모듈은 URL로 웹문서를 받고 이를 잘정의된 XML형태로 변환한 후, 태그정보를 이용하여 웹문서의 구조를 구하고, 하이퍼링크데이터를 이용하여 웹문서간의 연결구조를 얻는다. 구조저장은 추출된 웹문서와 웹문서 연결관계를 웹서버와 같이 연결하여 저장하며, 구조 가시화에서 이를 계층적으로나 그래프형식으로 가시화된다. 제안한 시스템의 유용성을 보이기 위하여 웹문서의 평가문제에 적용한 결과, 많은 양의 데이터를 의 데이터의 기술적인 평가가 가능하고, 데이터를 수집하기 위한 인력자원, 시간과 비용을 줄일수 있으며, 쉽게 사이트를 평가하여 서비스 수준을 향상 시킬 수 있음을 알 수 있었다.

  • PDF

시맨틱 웹 데이터의 경로 기반 질의 처리 기법 (The Scheme for Path-based Query Processing on the Semantic Data)

  • 김연희;김지현
    • 한국컴퓨터정보학회논문지
    • /
    • 제14권10호
    • /
    • pp.31-41
    • /
    • 2009
  • 시맨틱 웹에서는 메타데이터와 온톨로지를 이용해 정보 리소스의 개념을 정의하고 의미적 연관성을 표현함으로써 지능적인 정보 검색과 자동화된 웹 서비스의 제공이 가능하다. 이러한 시맨틱 웹의 핵심적인 기능을 구현하기 위해서는 온톨로지와 메타데이터와 같은 시맨틱 웹 데이터를 효율적으로 관리하는 것이 무엇보다 중요하다. 따라서 본 논문에서는 시맨틱 웹 데이터의 의미와 구조적인 특성을 고려하여 보다 정확한 질의 결과의 검색과 효율적인 질의 처리를 지원할 수 있는 인덱스 구조를 제안한다. 특히 시맨틱 웹 데이터의 의미와 구조적인 특성을 그대로 표현하기 위해 그래프 데이터 모델을 이용하고 다양한 질의 형태를 그래프 모델 기반의 경로식으로 처리한다. 본 논문에서 제안한 인덱스는 1차적으로 추출 가능한 구조적 경로 정보는 물론 온톨로지를 이용한 추론을 통해 2차적으로 추출 가능한 구조적 경로 정보에 대한 질의를 처리 대상으로 하여 기존연구들과 차별화하며 시맨틱 웹의 개념을 온전히 반영하는 것을 목표로 한다. 또한 실험적 평가를 통해 본 논문에서 제안한 인덱스 구조가 정확성과 효율성 측면에서 우수하며 시맨틱 웹의 다양한 애플리케이션 개발에 적용 가능함을 보인다.

데이터 웹 검색을 위한 분산형 소셜네트워크 설계 (A Design of Decentralized Social Network for Data Web Search)

  • 심인수;이홍철
    • 한국산학기술학회:학술대회논문집
    • /
    • 한국산학기술학회 2010년도 추계학술발표논문집 1부
    • /
    • pp.398-401
    • /
    • 2010
  • 오늘날 개방형 플랫폼과 정보공유공간인 소셜네트워크 서비스(Social Network)의 사용이 증가하면서 관련 웹사이트와 어플리케이션이 많이 생겨났다. 기존의 시스템은 소셜네트워크 사이트가 개인 데이터의 소유권을 가지고 있어서 정보 보호에 문제가 있고, 웹 사이트 간 정보공유가 제한되었다. 그래서 소셜네트워크의 데이터를 개인이 원하는 다른 관리 영역에서 소유할 수 있고 서로 다른 소셜네트워크에서도 자유로이 정보를 공유할 수 있는 분산형 소셜네트워크에 대한 연구가 활발히 이루어지고 있다. 본 논문에서는 시맨틱 웹 기술을 이용하여 이종 소셜네트워크 서비스, 다른 관리 영역의 데이터, 사용자들과의 관계, 데이터의 연관성들을 구조화 시키고, 데이터 웹 검색의 사용성을 높이는 데이터 웹 검색기반 분산형 소셜네트워크를 설계 하였다.

  • PDF

웹과 윈도우 환경에서 암호화와 복보화 설계 (Encryption and Decryption Design in Web and Window Environment)

  • 정태일;장현희;박성순
    • 한국멀티미디어학회:학술대회논문집
    • /
    • 한국멀티미디어학회 2003년도 추계학술발표대회(하)
    • /
    • pp.715-718
    • /
    • 2003
  • 웹 페이지와 윈도우 어플리케이션 사이의 데이터 전송하는 과정에서 데이터가 다른 사랑에 의해 유출 되었을 경우 데이터의 보안을 위해 암호 알고리즘을 사용한다. 자료의 기밀이 유지되어야 할 경우 다른 사람이 알 수 없는 형태로 변형하고, 사용할 때는 원문으로 변형하는 방법이 암호 알고리즘이다. 본 논문에서는 암호 알고리즘과 웹과 윈도우 환경에서 전송하고자 하는 데이터에 대해 암호화 및 복호화하는 방법을 제안한다.

  • PDF

웹기반 임상데이터 관리 시스템 구축을 위한 프로그램 개발 (Web-based program development for clinical data management system establishment)

  • 신임희;김달호;김상경;손기철;박전우;곽상규
    • Journal of the Korean Data and Information Science Society
    • /
    • 제23권1호
    • /
    • pp.171-177
    • /
    • 2012
  • 컴퓨터의 발달로 인해 여러 가지 현상들이 수치화되어 데이터로 수집되고 있다. 특히 많은 양의 데이터가 각 분야별로 수집되고 있는데 이는 데이터를 기초로 한 분석과 해석을 통하여 의사 결정의 뒷받침이 되는 정보를 얻기 위해서이다. 데이터의 중요성이 부각되면서 데이터의 관리가 관심사가 되었다. 많은 연구자들이 공유할 수 있도록 서버에 데이터베이스를 구축하고 이를 웹 브라우저를 통하여 조회 및 확인하는 시스템을 구축하는 것이 필요하다. 본 연구에서는 연구자가 가장 많이 사용하는 엑셀 파일을 서버 데이터베이스에 업로드 하였고, 웹기반의 데이터베이스와 연동하여 연구자가 업로드한 데이터를 조회 및 확인할 수 있는 웹기반 프로그램을 개발하였다. 웹을 기반으로 데이터를 업로드 할 DB로 오라클을 사용하였으며 데이터베이스를 조회하기 위하여 웹프로그래밍 언어인 html, JAVA, JSP 등을 사용하여 웹기반 임상데이터 관리 시스템 구축을 위한 프로그램을 개발하였다.