• 제목/요약/키워드: 웹 링크 분석

검색결과 132건 처리시간 0.023초

웹 페이지 관리를 위한 링크 추출과 검증 (Link Extraction and Validation for Web-page Maintenance)

  • 엄정섭;유대승;심민석;이명재
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2001년도 가을 학술발표논문집 Vol.28 No.2 (1)
    • /
    • pp.427-429
    • /
    • 2001
  • 웹의 발전에 따라 거대해진 웹사이트들은 서로 복잡하게 얽혀진 링크들로 인해 웹 개발과 유지보수에 큰 어려움이 따른다. 효율적인 웹 개발과 유지보수를 위해서는 웹에서 가장 중요한 정보의 단위인 링크정보들을 추출할 수 있는 방법이 요구된다. 본 논문에서는 웹 브라우저 요청에 의해 반환된 HTTP 헤더분석과 HTML 문서의 태그분석을 통해 링크들을 추출하여 “끊어진 링크”를 찾고, 추출된 “링크요소”들과 서버에 저장된 파일들을 비교하여 “사용되지 않는 파일”들을 찾아주는 “링크 분석기”시스템을 개발함으로 써 웹 개발과 유지보수에 있어서 가장 기본적이면서도 중요한 링크관리에 대한 방법을 제시한다

  • PDF

인용분석을 이용한 인터넷 정보의 연구 (A Study of Internet using Citation Analysis)

  • 곽철완
    • 한국비블리아학회지
    • /
    • 제10권1호
    • /
    • pp.213-222
    • /
    • 1999
  • 본 연구는 특정 주제의 핵심 웹 정보원의 존재를 조사하고 그 정보원의 특징을 파악하는데 그 목적을 두었다. 웹 페이지들이 링크를 많이 한 웹 페이지는 그 분야에서 중요한 정보원으로 간주되므로. 인용분석법을 이용하여 ‘weather’분야의 링크빈도가 높은 웹 페이지를 파악하였다. 사용된 연구방법은 검색엔진을 이용하여, weather분야의 웹 페이지들을 조사한 후, 각 웹 페이지가 링크하고 있는 웹 페이지와 그 웹 페이지를 링크한 웹 페이지를 조사하였다. 7가지 웹 페이지들에 월등하게 많은 링크가 되어 있었는데. 각각 웹 페이지들의 관계성을 동시인용법을 통하여 분석한 결과. 크게 3가지 유형으로 구분되었다.

  • PDF

효율적인 웹 마이닝 시스템의 설계 및 구현 (Design and Implementation for the Effective Web)

  • 김형욱;최익규;김민구
    • 한국지능정보시스템학회:학술대회논문집
    • /
    • 한국지능정보시스템학회 2002년도 추계정기학술대회
    • /
    • pp.303-307
    • /
    • 2002
  • 효율적인 웹 마이닝을 위해서는 방대한 인터넷 공간에서 사용자가 원하는 정보를 찾아내고, 이들 중 보다 유용하다고 판단되어진 자료를 선별적으로 제시할 수 있어야 한다. 본 논문에서는 웹 컨텐츠 분석과 HTML 문서들 사이의 링크 연결의 패턴 분석을 기반으로 하는 웹 구조 분석 방법들을 검토하고, 웹 검색 시스템을 구현하여 결과를 분석하였다. 이를 위해 웹 문서의 내용을 인덱싱한 뒤 질의와의 관련성의 확률을 구하는 랭귀지 검색 모델에 링크 구조 분석을 이용한 순위 알고리즘을 사용하여 좋은 결과를 얻고자 하였다. 또한 기존의 링크 관련 알고리즘에서 알려진 문제점을 해결하기 위한 몇가지 테크닉을 사용하였다.

  • PDF

국내 웹 그래프의 링크 구조 분석 (Link Analysis of Korean Web Graph)

  • 서정주;김진일;김은상;김영호;정하웅;김성렬;박근수
    • 한국정보과학회:학술대회논문집
    • /
    • 한국정보과학회 2012년도 한국컴퓨터종합학술대회논문집 Vol.39 No.1(A)
    • /
    • pp.400-402
    • /
    • 2012
  • 웹을 구성하는 웹 페이지들과 페이지들 사이의 하이퍼링크들은 방향성을 지니는 그래프로써 표현될 수 있으며, 웹 그래프가 가지는 독자적인 링크 구조의 특성은 다양한 분야의 연구에서 활용되고 있다. 현재 검색 엔진들이 수집한 웹 페이지들은 그 규모가 수십억 개로 방대한 양을 이루고 있다. 본 논문에서는 약 3억 개의 국내 웹 페이지들을 수집하고, 링크 데이터를 추출하여 생성한 웹 그래프의 구조에 대해 분석한다. 국내 웹 페이지들의 링크의 진입 차수와 연결 요소들의 크기 분포는 멱법칙을 따르고, 웹 페이지의 진출 차수는 특정 차수 이상에서 멱법칙을 가짐을 확인한다. 또한 그래프 알고리즘을 이용하여 웹 그래프를 구성하는 요소들로 나눈 후 전체적인 구조를 도식화한 보우타이 다이어그램을 도출한다.

웹 사용성 관점에서 공공기관 웹 사이트의 링크 유효성 분석 및 개선 과제 (The Analysis and Implication of Link Integrity of Korean Public Institution Website from a Web Usability Perspective)

  • 문현주;김석일
    • 재활복지
    • /
    • 제17권4호
    • /
    • pp.291-309
    • /
    • 2013
  • 웹 사용성(Web Usability)은 장애에 관계없이 누구나 웹을 원활히 사용할 수 있도록 생성하고 운영하는 기준으로 활용된다. 링크 유효성은 웹 사용성을 결정짓는 주요한 검사항목이다. 웹 사이트에서는 시간이 지남에 따라 링크의 타겟이 없어지거나 변경되는 현상이 발생하고 이로써 링크 유효성이 점차 저하된다. 본 논문에서는 국내 공공기관 웹 사이트의 링크 유효성을 분석하였다. 링크 유효성 자동화 도구에 의한 콘텐츠 접근이 가능한 49개 웹 사이트 중 91.8%의 웹 사이트가 한 개 이상의 끊어진 링크를 포함하고 있었다. 또한 웹 사이트별로 끊어진 링크 수의 평균은 50.5개로 전체 링크 수의 0.33% 수준이었다. 29개 웹 사이트는 내부 링크의 끊김 현상이 있었다. 22개 웹 사이트에서는 끊어진 링크에 대한 안내페이지조차 제공하지 않고 있었다. 끊어진 링크는 웹 사용성을 저하시킴으로써 웹 사이트에 대한 사용자의 신뢰도를 하락시킬 뿐만 아니라 검색엔진을 통한 정보 제공을 차단한다. 따라서 웹 사이트 제작자나 운영자는 링크 유효성의 중요성을 인식하고 링크 유효성 검사를 웹 사이트 운영 절차에 추가하거나 주기적으로 실시하여 링크 끊김으로 인한 사용성 저하를 방지할 필요가 있다.

내용 분석을 통한 한국의 학술적 웹 공간 구조 분석 (Ascertaining the Structure and Content of a National Scholarly Web Space Based on Content Analysis)

  • 정영미;유소영
    • 정보관리학회지
    • /
    • 제26권3호
    • /
    • pp.7-24
    • /
    • 2009
  • 학술적 웹 공간을 대상으로 하는 연구는 페이지와 링크의 역동성 때문에 정량적인 방법과 함께 내용 분석 등의 정성적인 방법을 사용하는 것이 필요하다. 따라서 이 연구에서는 내용 분석의 한 방법으로 한국 학술적 웹 공간 내에서 외부 링크로 연결된 페이지 및 링크의 유형을 분류한 후 이를 네트워크 구조 분석에 반영하여 한국 학술적 웹 공간의 특성을 자세히 살펴보았다. 분석 결과 데이터의 수집 시점을 나타내는 기본 네트워크와 내용 분석 시점을 나타내는 활성 네트워크 사이에 구조적으로 큰 차이가 없었으나, 기관 유형별로 다른 기관들을 링크하는 목적이 다르게 나타났다. 그리고 한국 학술적 웹 공간은 여러 중앙성 지수들과 결속계수 간의 설명력이 유사하게 나타나는 형태의 네트워크임을 확인하였다.

학술지 인용과 웹 링크 분석을 통한 과학기술분야의 학제성 비교 연구 (A Comparative Study on Interdisciplinarity in the Fields of Science and Technology Based on Journal Citation and Web Link Analyses)

  • 정호연;정영미
    • 정보관리학회지
    • /
    • 제24권3호
    • /
    • pp.179-200
    • /
    • 2007
  • 이 논문에서는 학술지 인용 데이터와 웹 링크 데이터를 이용하여 8개 과학기술 분야의 학제적 구조를 파악하고 각 학문분야 간 학제성을 비교하였다. 분석 대상이 되는 학술지와 웹 페이지의 주제적 성격을 파악하기 위해 기존의 과학기술분류체계를 재구성하여 이용하였다. 이 연구에서 학제성은 여러 학문분야간 학제적 연결의 측면에서 파악하였으며, 학제성의 정도는 연관 학문분야의 수로 측정한 학제적 다양성과 자기인용률에 의해 평가하였다. 분석 결과, 학술지 인용 분석에서는 밝혀내지 못한 새로운 학제적 연결을 웹 링크분석에 의해 파악하였으며, 이를 통해 웹 링크 분석이 학제성을 연구하는 수단으로서 유용함을 알 수 있었다. 또한 인용 분석과 링크 분석에서 모두 자연과학 분야에 비해 공학 분야의 학제성이 대체로 더 높게 나타났다.

링크 분석에 기반한 웹 문서 중요도 평가 알고리즘의 구현 (An Implementation of the Ranking Algorithm for Web Documents based on Link Analysis)

  • 임성채
    • 한국컴퓨터정보학회:학술대회논문집
    • /
    • 한국컴퓨터정보학회 2010년도 제42차 하계학술발표논문집 18권2호
    • /
    • pp.75-78
    • /
    • 2010
  • 웹 검색에는 기존의 정보검색(Information Retrieval) 시스템에서와 다르게 문서 간 하이퍼링크 정보를 바탕으로 각 웹 문서의 고유 중요도를 추정하는 방식이 자주 이용된다. 링크 분석에 기반한 알고리즘 중 PageRank 알고리즘은 구글의 웹 검색 서비스에 적용된 것으로 알려져 있다. 이런 PageRank 알고리즘에 따라 중요도를 계산하는 경우 색인된 웹 문서수가 증가함에 따라 계산에 필요한 CPU 자원의 사용도 함께 증가하며, 문서 수가 수 억 페이지에 달하면 하나의 서버에서는 계산을 수행할 수 없다는 문제가 있다. 본 논문에서는 이런 문제점을 해소하기 위해 여러 대의 서버를 PageRank 계산 용 클러스터로 사용할 수 있는 방법을 제시한다. 제시된 방법은 고속의 LAN을 이용하여 여러 대의 서버를 연결하고 반복적인 행렬 계산을 병렬로 수행할 수 있어 계산 시간을 단축시킬 수 있다. 이런 서버 클러스터 구현을 위해 멀티 쓰레딩 프로그램이 작성되었으며, PageRank 계산에 사용되는 행렬 데이터를 적은 양의 메모리만으로 표현 가능하도록 하였다.

  • PDF

동시링크를 이용한 사회학 분야 웹 정보원의 지적구조 분석: (A Study on the Intellectual Structure in Web Information of Sociology Using the Co-links Analysis)

  • 김원진
    • 한국정보관리학회:학술대회논문집
    • /
    • 한국정보관리학회 2006년도 제13회 학술대회 논문집
    • /
    • pp.113-120
    • /
    • 2006
  • 본 연구에서는 사회학 분야 웹 정보원을 대상으로 동시링크분석을 실시하여 특정 학문분야의 지적구조를 분석하고, 검색엔진별 지적 구조의 차이를 분석함으로써 웹 정보원의 특성을 살펴보았다. 세 개의 검색엔진을 대상으로 지적구조의 차이를 비교한 결과, 웹 정보원 지도에서 전체적인 지적구조는 비슷하게 나타났지만, 몇 개의 웹 정보원의 경우에는 소속군집이 다르게 나타난 경우도 있었다. 그리고 Altavista와 AlltheWeb은 지도상의 웹 정보원 분포에 있어서 거의 유사한 구조를 보여주었다.

  • PDF

연관 웹 문서 분류와 사용자 브라우징 패턴을 이용한 동적 링킹 시스템 (Dynamic Linking System Using Related Web Documents Classification and Users' Browsing Patterns)

  • 박영규;김진수;김태용;이정현
    • 한국정보처리학회:학술대회논문집
    • /
    • 한국정보처리학회 2000년도 추계학술발표논문집 (상)
    • /
    • pp.305-308
    • /
    • 2000
  • 웹사이트 설계자의 주관적 판단에 의한 정적 하이퍼텍스트 링킹은 모든 사용자들에게 동일한 링크를 제공한다는 단점을 가지고 있다. 이러한 문제점을 개선하고, 각 사용자들의 브라우징 패턴에 적합한 웹 문서들을 동적 링크로 제공해주기 위한 여러 동적 링킹 시스템들이 제안되었다. 그러나 대부분의 동적 링킹 시스템들은 사용자의 현재 브라우징 패턴과 가장 유사한 패턴 정보만을 이용해 동적 링크를 제공하기 때문에 연관성이 없는 웹 문서들에 대한 링크를 수시로 제공한다는 또 다른 문제를 지니고 있다. 본 논문에서는 데이터 마이닝의 한 응용 분야인 웹 마이닝 기법을 이용하여 웹 서버의 로그파일로부터 사용자들의 브라우징 패턴을 분석해내고, 다차원 데이터 집합에 적합한 Association Rule Hypergraph Partitioning(ARHP) 알고리즘을 이용하여 서로 연관성이 있는 웹 문서들을 분류한다. 사용자 브라우징 패턴 정보로부터 사용자에게 추천해줄 1차 링크 집합을 생성하고, 연관 웹 문서 정보를 이용하여 2차 링크 집합을 생성한다. 그리고 두 링크 집합에 공통으로 포함된 링크 집합만을 사용자에게 동적으로 추천해줌으로써 사용자가 보다 편리하고 정확하게 웹사이트를 브라우징 할 수 있도록 하는 동적 링킹 시스템을 제안한다.

  • PDF