• 제목/요약/키워드: web pages

검색결과 554건 처리시간 0.025초

웹 문서 변화에 관한 실험적 연구 (An Empirical Study on Changes of Web Pages)

  • 김성진;이상호
    • 한국정보과학회논문지:데이타베이스
    • /
    • 제32권2호
    • /
    • pp.151-160
    • /
    • 2005
  • 웹 문서들은 빈번하게 생성, 소멸, 변경을 반복하고 있으며, 웹 데이타베이스는 최신의 웹 상태를 반영하여야 한다. 웹 데이타베이스의 효과적인 갱신 전략 수립을 위하여 실제 웹의 변화 성향을 파악하는 일은 매우 중요하다. 웰의 변화를 관찰한 연구들이 다양하게 발표되고 있으나 기존의 연구들은 웹 문서의 내용 변경에 주된 초점이 맞추어 있고 웹 문서의 생성과 소멸에 대한 결과가 부족하였다. 본 논문에서는 쇌 문서의 변화를 표현할 수 있는 척도로서 URL의 '다운로드 성공률', '변경률', '나이 변이 계수'를 소개하고, 한국의 유명 사이트 집합과 임의(random) 사이트 집합에서 발견된 300만 개의 URL들이 2 일 주기로 100일 동안 관찰한다. 본 논문에서는 '다운로드 성공률'과 '변경률'의 분포를 통해 웰 문서의 다운로드 성공과 변경이 과거 기록과 밀접한 연관이 있음을 발견하였으며, 과거 기록을 이용하여 향후 웹 문서의 다운로드 성공과 변경을 예측할 수 있는 모델을 제안한다. 또한, '나이 변이 계수'를 통해 웹 문서들이 얼마나 비주기적으로 변경되는가를 보고한다.

인용분석을 이용한 인터넷 정보의 연구 (A Study of Internet using Citation Analysis)

  • 곽철완
    • 한국비블리아학회지
    • /
    • 제10권1호
    • /
    • pp.213-222
    • /
    • 1999
  • 본 연구는 특정 주제의 핵심 웹 정보원의 존재를 조사하고 그 정보원의 특징을 파악하는데 그 목적을 두었다. 웹 페이지들이 링크를 많이 한 웹 페이지는 그 분야에서 중요한 정보원으로 간주되므로. 인용분석법을 이용하여 ‘weather’분야의 링크빈도가 높은 웹 페이지를 파악하였다. 사용된 연구방법은 검색엔진을 이용하여, weather분야의 웹 페이지들을 조사한 후, 각 웹 페이지가 링크하고 있는 웹 페이지와 그 웹 페이지를 링크한 웹 페이지를 조사하였다. 7가지 웹 페이지들에 월등하게 많은 링크가 되어 있었는데. 각각 웹 페이지들의 관계성을 동시인용법을 통하여 분석한 결과. 크게 3가지 유형으로 구분되었다.

  • PDF

Web Page Evaluation based on Implicit User Reactions and Neural Networks

  • Lee, Dong-Hoon;Kim, Jae-Kwang;Lee, Jee-Hyong
    • International Journal of Fuzzy Logic and Intelligent Systems
    • /
    • 제12권2호
    • /
    • pp.181-186
    • /
    • 2012
  • This paper proposes a method for evaluating web pages by considering implicit user reaction on web pages. Usually users spend more time and make more reactions, such as clicking, dragging and scrolling, while reading interesting pages. Based on this observation, a web page evaluation method by observing implicit user reaction is proposed. The system is designed with Ajax for observing user reactions, and neural networks for learning correlation between user reactions and usefulness of pages. The amounts of each type of user reactions are inputted to neural networks. Also the numbers of characters and images of pages are used as inputs because the amount of users' behaviors has a tendency to increase as the length of pages increase. The experiment is conducted with 113 people and 74 pages. Each page is ranked by users with a questionnaire. The proposed method shows more close ranking results to the user ranks than Google. That is, our system evaluates web pages more closely to users' viewpoint than Google. Although our experiment is limited, our result shows powerful potential of new element for web page evaluation. Some approaches evaluate web pages with their contents and some evaluate web pages with structural attributes, particularly links, of pages. Web page evaluation is for users, so the best evaluation can be done by users themselves. So, user feedback is one of the most important factors for web page evaluation. This paper proposes a new method which reflects user feedbacks on web pages.

인터넷 쇼핑 사이트의 이미지 분석과 소비감성과의 관계 - 티셔츠 웹 페이지를 중심으로 - (Relation between the Image Analysis of Internet Fashion Shopping Site and Consumption Emotion - Focused on T-shirts Web Pages -)

  • 김은정;이경희
    • 한국의류학회지
    • /
    • 제31권8호
    • /
    • pp.1273-1285
    • /
    • 2007
  • The purpose of this study is to understand consumer emotion about T-shirts web pages and to provide the basis for effective design plan of them. 72 T-shirts web pages through 62 sites have been chosen as stimulus pictures, and the valuation tools are composed of 21 pairs of image adjective and 3 questions for valuation of consumption emotion. Data has been collected on subjects of 480 men and women at the age of $16{\sim}27$ who live in Busan. The image factors are Aestheticism, Activeness, Stability, Intimacy. The types of T-shirts web pages are classified into four groups. The image according to the type of T-shirts web pages has showed meaningful differences in all factors, and the differences of image factors according to design elements have been meaningfully presented. In the relation between consumption emotion and image of T-shirts web pages, Impulse needs, Buying needs, Recommendation needs are related to Aestheticism factor and Stability factor. The consumption emotion according to the type of T-shirts web pages is appeared high in the type 2(Refine image) and 3(Vivid image). The valuation of consumption emotion according design elements has presented meaningful differences all design elements except menu.

메타 태그를 이용한 자동 웹페이지 분류 시스템 (An Automatic Web Page Classification System Using Meta-Tag)

  • 김상일;김화성
    • 한국통신학회논문지
    • /
    • 제38B권4호
    • /
    • pp.291-297
    • /
    • 2013
  • 최근 월드 와이드 웹(World Wide Web)의 사용이 폭발적으로 증가함에 따라 다양한 정보를 포함하고 있는 웹 페이지들의 양도 엄청나게 증가 하였다. 따라서 웹상에 존재 하고 있는 웹페이지들에 대한 접근을 용이하게 하고, 그룹화를 통한 검색을 가능하게 하기 위해 웹 페이지 분류의 필요성이 대두 되고 있다. 웹 페이지 분류는 기존의 웹 상에 산재 되어 있는 웹페이지들을 비슷한 문서 유형 또는 같은 키워드를 사용하는 문서들의 묶음으로 구분하는 작업을 의미하며, 웹 페이지 분류 기술은 웹페이지 검색, 그룹 검색, 메일 필터링 등의 분야에 응용될 수 있는 기술이다. 하지만 웹상에 존재하는 웹페이지들을 사람이 수동적으로 분류하는 방법으로는 현재 월드 와이드 웹에 존재하는 엄청난 양의 웹페이지들을 처리할 수 없으며, 자동적인 분류 방법 역시 서로 다른 형태로 작성된 웹페이지들을 정확하게 분류할 수 없다는 문제로 인해 한계를 보이고 있다. 본 논문에서는 서로 다른 형태로 작성된 웹 문서들에 대한 부정확한 분류 문제를 해결하기위해 웹페이지에 존재하는 메타 정보를 획득하여 자동적으로 분류하는 메타 태그기반의 자동화된 웹페이지 분류 시스템을 제안하였다.

웹 로봇 구현 및 한국 웹 통계보고 (Implementation of a Web Robot and Statistics on the Korean Web)

  • 김성진;이상호
    • 정보처리학회논문지C
    • /
    • 제10C권4호
    • /
    • pp.509-518
    • /
    • 2003
  • 웹 로봇은 웹 문서를 다운로드하고 저장하는 프로그램이다. 현재 웹 로봇 구현에 대한 여러 연구들이 진행되고, 웹에 대한 다양한 통계들이 보고되고 있다. 첫째, 본 논문에서는 새로운 웹 로봇을 개발하고, 개발된 웹 로봇의 전체적인 구조와 구현 결정들을 기술한다. 둘째, 약 7천 4백만 한국 웹 문서들에 대한 여러 통계치를 보고한다. 셋째, 1,424 개의 한국 웹 사이트를 지속적으로 관찰하여 웹 문서들의 변경 경향을 조사한다. 본 논문에서는 웹 문서의 변경에 영향을 미치는 요소들이 식별된다. 식별된 요소는 갱신할 웹 문서를 선택하기 위한 정보로서 유용하게 활용될 수 있다.

웹 문서 변경 예측 (Estimation of Web Page Change Behavior)

  • 김성진
    • 인터넷정보학회논문지
    • /
    • 제8권4호
    • /
    • pp.149-158
    • /
    • 2007
  • 본 논문은 웹 문서의 다운로드 가능 여부와 내용 변경 여부를 예측하는 도구를 기술한다. 웹 데이터베이스 관리자는 자신이 관리하는 웹 문서 집합을 최신 상태로 유지하려고 할 때, 예측 도구를 통하여 다운로드되지 않거나 변경되지 않았을 웹 문서에 대한 불필요한 요청을 감소시킬 수 있다. 본 논문에서는 웹 문서들의 과거 변경이 미래 변경과 매우 밀접한 관련이 있음을 가정한다. 본 논문에서는 약 300만개의 웹 문서들을 2일 주기로 100일 동안 관찰하여 변경 경향을 분석하고, 관찰된 문서들의 다운로드 가능 여부와 내용 변경 여부를 예측한다. 예측 결과는 실제의 변경 사실과 비교 평가되었다.

  • PDF

오디세우스 대용량 검색 엔진을 위한 병렬 웹 크롤러의 구현 (Implementation of a Parallel Web Crawler for the Odysseus Large-Scale Search Engine)

  • 신은정;김이른;허준석;황규영
    • 한국정보과학회논문지:컴퓨팅의 실제 및 레터
    • /
    • 제14권6호
    • /
    • pp.567-581
    • /
    • 2008
  • 웹의 크기가 폭발적으로 증가함에 따라 인터넷에서 정보를 얻는 수단으로서 검색 엔진의 중요성이 부각되고 있다. 검색 엔진은 사용자에게 최신의 정보를 검색 결과로서 제공하기 위해 웹 페이지를 주기적으로 수집하고 이를 데이타베이스에 저장한다. 웹 크롤러는 이러한 목적으로 웹 페이지를 수집하는 프로그램이다. 대부분의 검색 엔진은 제한된 시간 내에 많은 수의 웹 페이지를 수집하기 위해 다수의 머신을 사용하는 병렬 웹 크롤러를 이용한다. 그러나, 병렬 웹 크롤러의 아키텍처와 세부 구현 방법이 잘 알려져 있지 않기 때문에 실제로 병렬 웹 크롤러를 구현하는 데에 어려움이 많다. 본 논문에서는 병렬 웹 크롤러(parallel web crawler)의 아키텍처와 세부 구현 방법을 제시한다. 병렬 웹 크롤러는 다수의 머신에서 웹 페이지를 병렬적으로 수집하기 위해 조정자(coordinator) 대리자(agent) 구조의 2-티어(tier) 모델을 사용한다. 조정자/대리자 모델은 각 머신에서 웹 페이지를 수집하기 위한 다수의 대리자들과 이 대리자들을 관리하기 위한 하나의 조정자로 구성된다. 병렬 웹 크롤러는 웹 페이지를 수집하기 위한 크롤링(crawling) 모듈, 수집한 웹 페이지를 데이타베이스 로딩 포맷으로 변환하기 위한 컨버팅(converting) 모듈, 수집된 웹 페이지의 중요도를 계산하기 위한 랭킹(ranking) 모듈로 구성된다. 본 논문에서는 병렬 웹 크롤러의 각 모듈들을 설명하고, 세부 구현 방법을 설명한다. 마지막으로, 실험을 통해 병렬 웹 크롤러의 성능을 평가하였다. 실험 결과, 제안된 병렬, 웹 크롤러가 수집해야할 웹 페이지 개수와 머신 개수에 따라 확장 가능함을 보였다.

Classifying Malicious Web Pages by Using an Adaptive Support Vector Machine

  • Hwang, Young Sup;Kwon, Jin Baek;Moon, Jae Chan;Cho, Seong Je
    • Journal of Information Processing Systems
    • /
    • 제9권3호
    • /
    • pp.395-404
    • /
    • 2013
  • In order to classify a web page as being benign or malicious, we designed 14 basic and 16 extended features. The basic features that we implemented were selected to represent the essential characteristics of a web page. The system heuristically combines two basic features into one extended feature in order to effectively distinguish benign and malicious pages. The support vector machine can be trained to successfully classify pages by using these features. Because more and more malicious web pages are appearing, and they change so rapidly, classifiers that are trained by old data may misclassify some new pages. To overcome this problem, we selected an adaptive support vector machine (aSVM) as a classifier. The aSVM can learn training data and can quickly learn additional training data based on the support vectors it obtained during its previous learning session. Experimental results verified that the aSVM can classify malicious web pages adaptively.

Design and Implementation of Customer Personalized System Using Web Log and Purchase Database

  • Lee Jae-Hoon;Chung Hyun-Sook;Lee Sung-Joo
    • International Journal of Fuzzy Logic and Intelligent Systems
    • /
    • 제6권1호
    • /
    • pp.21-26
    • /
    • 2006
  • In this paper, we propose a customer personalized system that presents the web pages to users which are customized to their individuality. It analyzes the action of users who visit the shopping mall, and preferentially supplies the necessary information to them. When they actually buy some items, it forecasts the user's access pattern to web site and their following purchasable items and improves their web page on the bases of their individuality. It reasons the relation among the web documents and among the items by using the log data of web server and the purchase information of DB. For reasoning, it employs Apriori algorithm, which is a method that searches the association rule. It reasons the web pages by considering the user's access pattern and time by using the web log and reasons the user's purchase pattern by using the purchase information of DB. On the basis of the relation among them, it appends the related web pages to link of user's web pages and displays the inferred goods on user's web pages.